蚂蚁清华开源9B模型Realtime-Venus:前台聊天后台干活,多任务并行不排队
蚂蚁集团和清华开源了一个9B参数模型Realtime-Venus,核心是一套叫Harness的框架,把用户对话和后台执行拆开。以前AI办事得一句一问等回复,现在模型可以一边跟用户聊天,一边异步去查资料、填表单,多个任务同时跑。9B的参数量不算大,适合资源有限的部署场景。正文没披露训练数据、跑分和部署成本,实际效果和性价比还得自己测。
蚂蚁集团和清华开源了一个9B参数模型Realtime-Venus,核心是一套叫Harness的框架,把用户对话和后台执行拆开。以前AI办事得一句一问等回复,现在模型可以一边跟用户聊天,一边异步去查资料、填表单,多个任务同时跑。9B的参数量不算大,适合资源有限的部署场景。正文没披露训练数据、跑分和部署成本,实际效果和性价比还得自己测。
DHH 在 Rails World 2026 的开场演讲里说自己已经从专业程序员退休,现在是个“maker”。他认为英语是最好的编程语言,手写代码对大多数程序员来说已经不再划算。37signals 正在用 LLM 把 Hey 重写成六个原生客户端,后端换成 Rust——他说 Rust 对人类很丑,但对 LLM 很友好。他八月写了 15 万行代码,Rub...
推荐理由:DHH 在 Rails World 2026 的开场演讲几乎没怎么谈 Rails 本身,反而抛出了一堆有数字、有产品决策支撑的挑衅性判断。文章是二手转述,不是完整演讲实录,Rails 路线图细节也偏少,所以没给更高分。但“退休声明”加“手写代码不划算”加“用 LLM 重写 Hey”这三件事放在一起,对 AI 从业者来说是个很具体的信号——一个顶级程序员在用自己的产品和行动投票。
TypeSafe AI 发布了 Jev,一个非自回归的“系统一”模型。它不聊天、不写文章、不逐步推理,而是对输入的结构化问题一次性给出答案,并附上每个答案的概率。作者认为,对于生产环境中的分类器,真正的瓶颈不是准确率,而是校准度——即模型给出的概率是否诚实。Jev 的训练目标(RLCD)直接优化这个。它的延迟是 70–500 毫秒,每百万输入 toke...
Jango 做的事很直接:你给它一个开发环境的网址,它派出一组 AI 用户,每人有自己的浏览器、账号、任务目标和记忆,像真人一样登录、互相操作。你可以实时围观,也能随时接管某个用户的屏幕自己上手。跑完后会出一份报告,记录操作、报错和截图。目前只支持 Mac,可以用自己的 AI 密钥,也可以用 Jango 托管的。正文没提价格,也没说具体支持哪些模型。
在加州 Monterey Bay National Marine Sanctuary,于晚 7:07 至 7:27 观测到 Northern Gannet、Great Blue Heron 和 California Brown Pelican。新入手的 200-800mm Canon EF 镜头拍到了迄今最好的 Morris 照片,它们很喜欢待在海港那块牌子下面。
高盛美股首席策略师David Kostin表态,他站在AI“更强更久”这一边,意思是AI基础设施的投资回报不会很快结束,而是会持续好几年。他的判断主要靠企业资本开支趋势和对生产率提升的预期,但正文没披露具体的时间表或回报数字,所以这点先别太激动——如果真如他所说,那对做AI基建的厂商是长期利好,但验证还需要更多数据。
Runway 在 GWM Worlds 2 里加了个叫 WorldPrompt 的功能,让你能用带时间戳的自然语言指令去控制角色、镜头和环境。CTO Kamil Sindi 说这是“按需生成的、音画同步的可提示世界”,但研究员 Robin Kahlow 也承认它还是个研究预览版——移动指令执行得比较稳,复杂的动作就不一定听话了。工程上要解决两个难题:一...
Genspark 在自家超级应用里上线了 GenCode,一个专门写代码的 AI 代理。目前官方只给了一句话介绍,没提支持什么编程语言、能处理多复杂的任务、也没说要不要额外付费。信息太少,暂时没法判断它跟 Cursor、Copilot 这些比到底怎么样。
阶跃星辰的 Step 5 Preview 公布了四类成绩,但自报的 Terminal-Bench 分数还没上公开排行榜,权重许可条款也没披露。独立开发者用 111 道公开难题测了 TypeSafe 的判断接口 Jev,发现它答错时平均把握 0.690,答对时 0.684,把握高低分不出对错。加州州长签了 AI 行政令,但只是让政府部门去起草修法建议,目...
安全团队 Hacktron 从 OpenAI 公开论坛的图片上传接口入手,利用 libheif 一个已知的内存漏洞拿到了论坛管理员权限。论坛登录直接挂在 OpenAI 的统一认证系统上,顺着这条信任链,他们接管了一名内部工程师的 ChatGPT 和 Codex 账户。这名工程师之前把个人 GitHub 授权给了 Codex,于是测试人员借 Codex ...
推荐理由:Hacktron 从 OpenAI 公开论坛的图片上传接口入手,利用 libheif 的已知内存漏洞拿到论坛管理员权限。论坛登录挂在 OpenAI 统一认证上,顺着这条信任链,他们接管了一名内部工程师的 ChatGPT 和 Codex 账户。这名工程师之前把个人 GitHub 授权给了 Codex,测试人员借 Codex 的权限访问了私有仓库,最终在内部仓库里建了分支、提了 PR。整条链只用了两天,涉及三个旧授权,没有零日漏洞,全是已知问题和信任传递的锅。文章把每一步的技术细节和权限关系都讲清楚了,不是那种只放截图的概念验证,而是有完整时间线和修复...
Simon Willison 表示,与编码智能体协作越久,越确信它们让软件工程变得更难。借助智能体可以完成惊人的工作,但释放其全部潜力需要极高的纪律性和知识储备。
美国10年期国债收益率突破5%关口,彭博称市场已进入一个“直到出事才结束”的新利率环境。对AI行业来说,这意味着廉价资金彻底没了——AI创业公司的融资成本会更高,烧钱换增长的模型面临更严峻的考验,科技公司的估值也得重新算。正文没有具体说哪些公司受影响最大,但逻辑很清楚:利率越高,风险资产越不受待见,AI这种长周期、高投入的赛道首当其冲。
Once UI 2.0 是一个开源的设计系统,帮你用 React 搭出一致的前端界面。新版专门给 AI 编码代理(比如 Claude Code)加了组件目录、紧凑规则和任务指南,让 AI 能按规范写代码,而不是瞎猜。对人类开发者来说,API 保持可预测,上手不费劲。正文没披露定价或许可证细节,但开源项目通常可以免费自用。如果你团队在用 AI 写前端代码...
Basedash 新出的 MCP 写功能,让你在 Cursor 或 Claude 里直接建图表和仪表盘,不用切标签页。正文没提支持哪些数据源和图表类型,但核心卖点很清楚:省掉复制粘贴,在 AI 编辑器里直接可视化。对数据团队和产品仪表盘来说是个顺手工具。
这个 GitHub 仓库给团队提供了一套从想法到上线的完整流程,专门配合 Copilot 这类 AI 编程助手用。它覆盖了写需求文档、搭架构、做测试、安全检查、代码审查和 CI/CD(自动构建部署),作者说已经在实际项目中验证过。不过正文没放任何跑分数据或用户案例,效果到底怎么样得自己试。
Anthropic 的生物学实验室用 AI 发现了一种新酶,但外部科学家普遍认为这远算不上突破。正文没有披露这个酶的具体功能、实验验证细节或潜在应用,所以目前能确认的只有“AI 确实找到了一个东西”。这点先别太激动——发现新酶在生物学里不算罕见,关键看它能不能干活、有没有用,而这些信息目前都是缺失的。
LaunchVideo 的做法是:你给它一个网址或一段文字描述,Opus 5.5 直接写 HTML、CSS 和动画脚本,然后一个无头 Chromium 微虚拟机逐帧渲染成 1080p 30fps 的 MP4。整个过程没有用到视频生成模型,靠的是把页面里的时钟(requestAnimationFrame、Date、CSS 动画等)替换成虚拟时钟,保证每一...
推荐理由:把 Opus 5.5 的写代码能力包装成“贴链接出视频”的工具,管线解释得清楚,例子也看得见,H 和 K 都打中了。但产品本身还轻,R 偏弱,分数刚好卡在 featured 门槛上。
Simon Willison 发布 commit-rewriter 0.2。该工具与 git 相关,具体功能与更新细节原文未作说明。
Anthropic 和做内容分发网络(CDN)的 Akamai 签了一份五年、总价 120 亿美元的云计算合同。这是 Anthropic 第一次把主要算力押在 AWS 以外的供应商身上,目的很明确:降低对亚马逊的依赖。消息出来后 Akamai 盘后股价涨了 8%。不过正文没披露具体用了多少张 GPU、什么时候开始交付,也没提合同里的详细条款,所以实际算...
推荐理由:这条消息的份量在于它改写了 AI 云服务的势力版图。Anthropic 之前算力基本全押在 AWS 上,现在突然拉进一个做内容分发的 Akamai,120 亿、五年,摆明了要摆脱对亚马逊的单点依赖。我会先打个折:正文没写具体 GPU 数量、交付时间、合同细节,所以实际算力规模和落地节奏还不清楚。但 Akamai 盘后直接涨了 8%,说明市场已经把这当成真金白银的利好。Bloomberg 的独家信源也加分,不是传闻。
GitHub Copilot 应用推出 canvas,一种运行在应用内、无浏览器外壳的全栈小应用,可与 Copilot 智能体双向通信,并能在本地执行代码、调用第三方 API。作者认为聊天只是 AI 的通用兜底界面,用户明确任务时更该让智能体生成可复用工具,而非把智能体本身当工具、白白消耗 token。示例包括 Connect 4 游戏、Winget 包管理、SQLite 操作和开发工作流自动化。
Gemini 3.8 Live 现在能让你对着一个动画头像聊天,它会实时对口型、做表情。这个叫 Live Avatar 的功能目前只开放给 Gemini Enterprise 的企业客户,个人用户什么时候能用,正文没提。谷歌说它支持 97 种语言切换,不会拖慢视频画质,也不会出现画面漂移。演示里头像说英语和日语时,嘴型都能对上,还能在屏幕上调出信息。
Google 研究博客发了一篇关于自动化生成长视频的文章,重点解决场景切换时的连贯性问题——比如角色长相不突变、背景不穿帮。系统会先规划镜头再逐段生成,算是 Sora 之后 Google 第一次正面回应“长视频”这个方向。但正文没披露模型架构、最大能生多长的视频,也没给定量对比结果。对做视频生成或 AI 电影工具的人来说,方向对,但信息太薄,先打个折看。
软银刚卖了一笔 90 亿美元的债券,创了它自己的发债纪录,钱主要用来支持对 OpenAI 的投资。但市场对软银的债务负担和孙正义这次集中下注有顾虑,所以它付出的利息比同等条件的公司高了 0.25 到 0.5 个百分点。这笔钱会先拿去还旧债,剩下的才投给 OpenAI,不过正文没披露还债和投资的具体比例。
推荐理由:软银破纪录发债 90 亿美元去填 OpenAI 的坑,结果利息被市场抬高了 0.25-0.5 个百分点,这个溢价本身就是个信号。我会先打个折:正文没写还旧债和投 OpenAI 各占多少,所以没法判断这笔钱到底有多少真能到 OpenAI 手里。但 FT 独家拿到的定价数据够硬,HKR 全中,给 72 分合适,再高就缺细节支撑了。
作者用 GPT-6 Sol 和 Opus 5.5 试了两道历史难题:一是破译一条 1941 年的恩尼格玛密文,模型自己跑去德国联邦档案馆翻出了补充记录;二是把牛顿一段拉丁文炼金术笔记,追溯到此前未被指认的法文出处。他的判断是,现在的顶尖模型在密码破译、跨语言文本溯源、跨小众领域串联线索上,已经能给出可验证的结果,跟去年只能当助手完全不是一回事。文章没提...
推荐理由:文章用两个可验证案例展示了前沿模型在密码破译和跨语言文本溯源上的真实能力,不是空谈。但话题是学术历史,对 AI 行业读者的吸引力偏弱,所以分数刚好卡在 featured 门槛上。
PrismML 在高通骁龙峰会上展示了一个叫 Bonsai 的 1-bit 语言模型,能直接在智能眼镜上跑,不用联网。这个模型有 20 亿参数,同时处理图像和文字,戴着眼镜看到什么可以直接问。他们的核心本事是把大模型体积压到原来的四分之一,跑分还几乎不掉。这家公司的长远目标是做开放权重的端侧 AI,不把隐私押在云厂商的承诺上。不过目前还没有哪款智能眼镜...
GitHub 安全实验室发布了一个叫 Taskflow Agent 的工具,用大模型自动完成 C/C++ 项目的模糊测试全流程:它自己写测试用例、编译、跑 fuzzer,最后生成崩溃报告。相当于把安全研究员从重复劳动里解放出来,但正文没披露具体用了哪个 LLM,也没说在真实项目里挖到了多少漏洞,效果到底多好还得看后续数据。
新泽西州对 DataOne 位于 Vineland 的数据中心处以 110 万美元罚款,原因是其未经许可秘密安装并运行 62 台燃气发电机,其中 45 台被无人机热成像拍到正在运转。
英伟达 CEO 黄仁勋在播客里说,AI 能帮人类对抗气候变化,但前提是得先“造成巨大的痛苦和伤害”。这跟特朗普和一堆科技领袖的论调一样:数据中心现在烧的是脏电,破坏环境是值得的,因为 AI 以后会回报人类。文章没给出具体的能耗数字或时间表,但点出了黄仁勋的精英视角——他不用承受污染后果,却替别人做决定。
Meta 给 Horizon 平台搞了两个新开发工具:手机上的 Horizon Create 和浏览器里的 Horizon Studio,都是靠输入 AI 提示词来生成游戏。Studio 版能调得更细。目前只开放候补名单,正文没写具体上线时间和背后用的哪个模型。比较特别的是,用这些工具做出来的游戏不光能在 Horizon 里玩,还会被推荐到 Faceb...
Critic 把 AI 写的代码和审查放在同一个界面里,附带一份“改动说明”和可追问的对话线程。演示的 PR 里,Codex 和 Claude 两个 agent 联手改造了一个离线消息队列:用租约令牌替换心跳表,设备断线 45 秒后回来还能接着干活,不丢上下文。正文没提定价,也没说能不能自己部署。
推荐理由:把 AI 写代码和审代码塞进同一个界面,还带改动说明和可追问的对话,这个产品形态确实少见。演示里用租约令牌替代心跳表的设计也给出了一个可复用的工程思路。我会先打个折,因为没看到定价和部署方式,暂时只能当个有趣的 demo 看。
InstaCloud 的 CTO 把代理(Agent)大规模部署看作分布式系统问题,而不是单纯的模型能力问题。他引用了 Google Research 的一项研究,测试了 180 种代理配置后发现:多加代理在能并行的任务上最多提升了 80.9% 的表现,但在需要严格按顺序推理的任务上,表现反而下降了 39% 到 70%。不加协调的代理会把错误放大 17...
推荐理由:把代理规模化拉回分布式系统视角,有 Google Research 的 180 种配置实测数据撑腰,不是空谈。扣分是因为这是 InstaCloud 的厂商博客,有产品推销动机,而且正文没贴论文链接,也没交代实验细节。我会先打个折,但观点本身对从业者有用。
两个开发者分别用很短的提示就让 Muse 把整个根文件系统打包交了出来,包括 Ubuntu 系统文件、应用模板和内部文档。Saunders 说复现起来“极其容易”,Muse 几乎没有做任何提示注入防御。Meta 回应这不算是安全漏洞,因为每个用户本来就跑在一个持久的 Linux 虚拟机里。但正文没披露这种访问权限是否能让用户看到其他用户的数据或宿主机信...
Google Cloud API Gateway 进入公开预览,原生支持 MCP 协议。你只要在已有的 OpenAPI 配置文件里加一行 x-google-api-management.mcp: true,部署后网关本身就变成一个远程 MCP 服务器,现有的 REST 接口直接作为智能体可调用的工具暴露出来。这意味着不用再单独写代码、部署和维护一个 M...
Google Photos 推出了一项新功能:AI 虚拟衣橱。它能从你相册里的照片中识别出衣服,自动整理成一个数字衣柜。这个功能今年 6 月先在 Android 上线,现在 iOS 也有了。灵感来自电影《独领风骚》里主角 Cher 的虚拟衣橱应用。正文没披露用了什么模型或训练数据,但这是一个值得关注的消费级 CV 应用。
Anthropic 官宣了 Claude Opus 5.5,定位很明确:编码会话现在越来越长、上下文越塞越满,这版模型就是冲着降成本去的。但正文除了标题和导航栏,什么都没展开——没给定价、没跑分、也没提上下文窗口到底多大。唯一能确认的是成本优化这个方向,其他细节一概欠奉。
推荐理由:Anthropic 发新模型本身是个信号,但正文只有标题和导航栏,所有关键事实都欠奉。H 和 R 都踩中了,K 不成立。内容太薄,勉强够 featured 门槛,分数压在 72 这个底线。
ElevenLabs 目前估值传闻 220 亿美元,CEO Mati Staniszewski 聊了三个事:利润率、IPO 时间点、以及企业用 AI 语音打电话该不该主动说。他认为现阶段应该告知,等 AI 电话变成常态后可能就不需要了。正文没披露具体利润率数字和 IPO 时间表。
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,在原生实时对话模型上加入近实时视频生成,实现带唇形同步、自然表情和流畅轮次切换的动态视觉形象。
推荐理由:原文给出 Live Avatar 的实时视频对话能力、异步工具调用与 97 语言支持,可据此判断企业级多模态交互的落地形态。
Google 的 Project Suncatcher 首颗试验卫星 MVP 将于 10 月 1 日发射,用于验证其轨道 AI 数据中心构想。该卫星约冰箱大小,搭载 4 块 Google 自研 TPU AI 加速器,太阳能板供电约 1 千瓦。
Pixel 11 上新加了一个功能:你可以让 Gemini 帮你打电话给餐厅、理发店之类的商家,问营业时间、预约或者查库存。AI 会自己拨号、跟店员对话,完事给你一份摘要。目前只在美国开放,还得订阅 Google One AI Premium(每月 20 美元那个)。正文没提非 Pixel 手机什么时候能用,也没说会不会支持其他语言。
加州联邦法官批准了 LinkedIn 与两家软件公司 ProAPIs 和 Netswift 的和解,要求它们停止批量抓取用户数据、删除已抓取的数据,并停止使用假账号。LinkedIn 去年起诉这两家公司,指控它们用数百万个假账号持续抓取会员、公司和学校信息,以及用户的反应、评论和帖子。LinkedIn 高管称这是重大胜利,强调用户数据不是给第三方用的。...