跳到正文

#Agent

今日 39 条

6月4日星期四

机器之心 · 公众号

谷歌放出 Gemma 4 12B,120 亿参数模型能在 16G 显存的笔记本上跑

谷歌发了 Gemma 4 系列的新成员,一个 120 亿参数的中等尺寸模型。它主打本地运行,16GB 显存或统一内存的笔记本就能带起来。架构上没走传统多模态那套编码器路线,直接原生支持音频输入,还带了一个叫 MTP 的推测解码模块来压延迟。模型用 Apache 2.0 协议开源。不过正文因为环境验证没加载出来,具体跑分、训练数据、实际推理速度这些关键信...

推荐理由:Gemma 4 12B 的卖点很直给:一个不算小的模型,能在普通笔记本上跑,还用了 Apache 2.0 协议。这对想自己折腾、又不想被云服务绑住的开发者来说,是个实在的更新。我会先打个折,正文没提具体推理速度和实际任务表现,光看参数和硬件门槛还不够,得等实测。但就凭“16G 笔记本能跑”这个钩子和宽松的开源协议,值得推给关注本地部署和成本控制的读者。

机器之心 · 公众号

办公室都在用嘴打字,敲键盘快成老手艺了

这篇文章本身没加载出来,微信页面显示环境异常需要验证,所以正文内容我没看到。从标题和已有的英文摘要看,讲的是 AI 语音输入工具正在进入办公和开发场景。Wispr Flow 这个产品全球下载量超过 250 万,12 个月留存率 70%,年用户增长 100 倍,说明用的人确实在猛增,而且用了就回不去。OpenAI 的 gpt-4o-transcribe ...

推荐理由:HKR 三项都站得住,但这是一篇带数据的工作流趋势观察,不是模型发布或平台级更新,放在 featured 里属于门槛线附近的那一类。我会先打个折,不把它当硬核技术突破看,但“打字正在变古老技艺”这个判断加上 250 万下载和 70% 留存,确实能让人重新想一遍语音交互的落地速度。

The Verge · AI

亚马逊给仓库机器人 Proteus 加了语音交互,工人可以直接用自然语言派活

亚马逊发布了新版 Proteus 仓库机器人,核心变化是工人不用再通过专用软件下指令,直接说话就能给它派任务,像跟同事沟通一样。Proteus 最早在 2022 年亮相,外形像个大号扫地机,负责在仓库里搬重货、推大车。这次升级主要是交互方式从代码/软件切到了自然语言,但正文没披露具体部署了多少台、单台成本多少,也没说语音指令在嘈杂仓库里的准确率怎么样。...

推荐理由:我会先打个折:Amazon 只说了 Proteus 能听懂人话,没给任何规模数据,所以重要性卡在 featured 门槛附近。亮点是交互方式从编程界面直接跳到口语对话,对一线工人上手门槛降得明显;但没披露部署量,效果和稳定性都还是未知数。如果是真的跑通了,省培训成本、提响应速度都说得通,这点先别太激动。

AI HOT 精选

ChatGPT 推出 Dreaming 记忆系统,能自动从聊天记录里提炼你的偏好,不用每次都重新自我介绍

OpenAI 给 ChatGPT 换了一套叫 Dreaming 的记忆架构,核心变化是模型会在后台自动翻看你的历史对话,把零散信息合成一个关于你的“记忆摘要”,而不是只靠你手动让它“记住”某件事。官方说这能解决旧版记忆容易过时、记不全的问题,让 ChatGPT 在跨对话时更懂你的偏好和长期项目。目前这个更新只对美国的 Plus 和 Pro 用户开放,免...

推荐理由:OpenAI 给 ChatGPT 加了个叫 Dreaming 的记忆系统,核心是跨对话记住你的偏好,让聊天更连贯。这事有热度,因为名字和“长期记住你”这个点本身就自带话题,隐私这根弦也绷着。但正文没披露默认开关状态、保留周期和推送范围,这些关键信息缺了,所以重要性先打个折,定在 84。

AI HOT 精选

OpenJarvis:斯坦福开源了一个本地优先的个人 AI 框架,把推理、工具、记忆都塞进设备里跑

斯坦福的研究人员放出了 OpenJarvis,一个开源的本地优先框架,目标是让个人 AI 助手直接在手机或电脑上跑,不用把数据传到云端。他们把个人 AI 拆成了五个基础模块:推理、工具调用、记忆、学习,还有一个叫“自我”的模块来协调这些能力。实测下来,在设备端用小模型跑这套流程,效果只比顶尖云端模型差 3.2 分,但每次调用的边际成本直接砍了约 800...

推荐理由:HKR 三项都站得住:本地优先加 800 倍成本下降是个好钩子,数字具体且能说明问题,话题本身也切中 agent 落地时大家最在意的成本和隐私。信息源深度一般,所以分数放在 78–84 这个区间,不往上拔。

AI HOT 精选

Cloudflare 数据显示机器人流量首次超过人类,占 HTML 请求的 57.5%

Cloudflare Radar 统计了 5 月 28 日到 6 月 4 日这一周的全球流量,发现所有 HTML 网页请求里,57.5% 来自爬虫、AI 抓取和自动化脚本,真人浏览器只占 42.5%,这是机器人流量头一回超过人类。如果把所有 HTTP 返回内容都算上,JSON 格式(主要是机器对机器的 API 通信)占了 33.1%,排第一,HTML ...

推荐理由:Cloudflare Radar 这次给了一个很具体的窗口和比例,HKR 三项都踩实了。文章没把 AI 爬虫、搜索引擎蜘蛛和恶意自动化流量拆开讲,所以我会先打个折,不把它捧得太高。但“机器人过半”这个信号本身对做网站、做爬虫、做安全的人都有直接参考价值,放在 featured 档刚好。

AI HOT 精选

Hugging Face 改造命令行工具,让 Claude Code 这类编码智能体调用时省下 6 倍 token

Hugging Face 把自家的 hf 命令行工具重新设计了一遍,让它能同时服务人类和编码智能体。工具会通过环境变量自动识别是不是 Claude Code、Codex 等智能体在调用,如果是,就输出紧凑、不截断的 TSV 格式,而不是给人看的表格。在复杂多步任务测试里,没用这个 CLI 的智能体(比如自己拼 curl 或调 Python SDK)消耗...

推荐理由:我会先打个折:token 降到六分之一是官方说法,正文没给出测试场景和对比基准,实际省多少要看具体任务。但思路很清晰——传统 CLI 输出对人类友好,对智能体却是噪音,切成结构化 TSV 能减少大量解析和截断开销。自动检测智能体身份这一点也实用,不用手动切模式。整体是工具链层面的务实改进,不是模型或平台级发布,所以放在 featured 档合理。

AI HOT 精选

Anthropic 用 Claude 把 95% 的业务取数需求自动化了,准确率约 95%

Anthropic 公开了他们内部用 Claude 做自助数据分析的整套方案。核心思路是让非技术同事直接用自然语言问业务数据问题,系统自动查表、写 SQL、出结果。他们搭了一个三层架构:底层是数据基础层,负责把分散的业务指标统一成模型能读懂的语义;中间是验证工作流,专门处理模糊提问、过期数据和查不到的情况;上层是技能模块,让 Claude 学会按公司规...

推荐理由:我会先打个折,这是官方博客,数字肯定挑好看的讲。但 95% 自动化加约 95% 准确率,配上数据层、验证和 skills 这套 agentic analytics stack,确实把怎么做说清楚了。没有新模型或产品发布,所以分数在 72–77 这个区间。正文没披露错误类型的具体分布和延迟数据,这点先别太激动。

Latent Space

微软 CEO 纳德拉对谈:把 AI 做成生态,别只盯着一两个模型

纳德拉在 Build 大会的播客里聊了微软的 AI 思路,核心是把 AI 当成一个生态平台来做,而不是押注单个模型。他举了比尔·盖茨那条老原则:平台创造的价值得远超平台自己赚走的。微软这次主推的 MAI 系列模型,强调从预训练阶段就保证数据干净、可追溯,因为现在很多开源模型在榜单上看着漂亮,实际用起来不行。有意思的是他们拿一个 50 亿参数的小模型做“...

推荐理由:HKR 三项都踩中了:Satya 本人就是流量钩子,文章给出了微软企业级多模型平台的具体组件名,还透露了 5B 小模型用 traces 做 hill climbing 的机制,对从业者判断技术路线有参考价值。不过它终究是 Build 大会的访谈,不是独立模型发布,所以 78 分合理。

6月3日星期三

NVIDIA 博客

NVIDIA 在 CVPR 发了三篇物理 AI 论文:抓取、自动驾驶和游戏里练出来的智能体

这三篇论文都进了 CVPR。GraspGen-X 用 20 亿次模拟抓取训练,让机械手能处理没见过的物体,但正文没披露真实世界的抓取成功率。LCDrive 把自动驾驶的推理 token 砍了大约一半,靠的是让模型直接输出轨迹而不是先写文字再转成动作,延迟更低,不过没提极端场景下的安全性验证。NitroGen 在 1000 多个游戏里跑了 4 万小时的交...

推荐理由:NVIDIA 在 CVPR 放出的三篇论文,每篇都带着实打实的数字:GraspGen-X 用 20 亿次模拟抓取训练机械手,LCDrive 把自动驾驶模型的推理 token 砍掉一半,NitroGen 在 1000 多款游戏里攒了 4 万小时交互数据来训游戏 agent。我会先打个折——这是厂商研究打包发布,不是新模型或产品上线,所以重要性停在 78 分。但信息密度够高,对做机器人、自动驾驶和游戏 agent 的人有直接参考价值,尤其是用合成数据替代真实采集、降低推理延迟这两条思路,正文没披露具体硬件环境和延迟数字,这点先别太激动。

AI HOT 精选

微软和 OpenAI 正式分手,现在准备正面开打

微软 AI 负责人 Mustafa Suleyman 在 Build 大会上放话,说微软必须从零开始证明自己能独立搞定所有事。两家公司从合作转向直接竞争,但文章没透露具体产品路线图和时间表。Suleyman 还提到,微软正在把 AI 智能体(让模型进业务流程干活的工具)作为重点方向,不过目前没有给出任何性能数据或客户案例来支撑这个说法。

推荐理由:H 和 R 都站得住:微软和 OpenAI 翻脸会影响整个 agent 平台的格局,从业者肯定盯着。K 偏弱,因为正文除了 Suleyman 一句“必须从头证明自己能独立搞定”之外,没给出任何可落地的信息,所以整体卡在 featured 门槛上。

AI HOT 精选

Meta 把 AI 客服机器人推到了全球 WhatsApp Business 商家手里

Meta 正式在全球上线 WhatsApp Business 的 AI 客服机器人,叫 Meta Business Agent。它能自动回消息、推商品、约时间、筛销售线索,搞不定再转人工,Instagram 私信里也能用。收费按模型 token 消耗算,但具体价格和用的哪个模型,正文没披露。另外还在小范围测一个功能,让机器人每天早上给你总结前一晚的聊天重点。

推荐理由:Meta 把 AI 智能体塞进 WhatsApp Business 并全球铺开,等于让商家直接在聊天里接客、推销、处理售后。收费按 token 算,说明 Meta 想从对话量里抽成,但具体多贵、用的什么模型、哪些国家能用,正文全没写。我会先打个折:全球上线听着热闹,没价格和模型细节,商家算不了账,从业者也判断不了实际成本。这点先别太激动,等单价出来再看是不是真省钱。

MIT Technology Review · AI

特朗普签了新 AI 行政令,Anduril 和 Meta 在给美军做能“用眼神下命令”的 AR 眼镜

特朗普废掉旧令不到两周,又签了一份新的 AI 行政令。核心变化是:要求科技公司在发布前沿模型前 30 天,自愿把模型交给政府审查,但不设强制许可证。对比之前被搁置的版本(要求提前 90 天提交),这次明显缩水了,不过也算从完全不管迈向了轻度监管。另一条消息是,军工公司 Anduril 和 Meta 正在给美军搞一款 AR 头显原型,想实现用眼球追踪和语...

推荐理由:我会先打个折:行政令是“自愿”送审,不是强制,别当成立法看。但 30 天这个数字给了企业一个明确的时间窗口,比之前模糊的“提前沟通”要具体。另一条更硬——Anduril 和 Meta 的原型头显让士兵用眼动和语音指挥无人机打击,这已经不是实验室概念了。两条放一起,一条在收紧模型发布,一条在把 AI 往杀伤链里塞,反差够大,从业者得知道。

AI HOT 精选

微软 Build 2026:生图超谷歌,推理还在追

微软在 Build 2026 一口气发了七个自研模型,头一回做推理模型 MAI-Thinking-1。这是个万亿参数、每次激活 350 亿的大家伙,上下文窗口 12.8 万 token,专啃多步指令和代码。内部盲测说比 Anthropic 的 Sonnet 4.6 更受偏爱,但看公开跑分,大概跟 DeepSeek V3.2 打个平手。微软强调模型是从干...

推荐理由:微软在 Build 2026 上发了 7 个自研模型,图像生成直接对标 Google 并声称超越,推理模型则明确说还在追赶。同时公布了一种新调优方法和一个后台自主智能体。正文没披露具体模型名称、基准分数和开放时间,所以信息有冲击力但缺验证细节,重要性给到 84 是合适的,先别急着当定论。

阿里技术 · 公众号

当 AI Agent 变成主力开发者,研发工具链得从头想想了

这篇文章我没能看到正文,微信页面显示环境异常需要验证。从已有的英文摘要看,作者许晓斌提出了一个判断:用 AI Agent 做开发,能把从“有想法”到“出代码”的周期从几周甚至几个月压缩到几分钟。他举了几个例子,包括用 Agent 搭周报系统、多角色 Agent 协同开发、自动配镜像仓库。文章还点出了现有研发设施跟 Agent 开发模式不匹配的地方,比如...

推荐理由:这篇文章不是产品发布或模型评测,而是一篇基础设施层面的评论。我会先打个折,因为案例都来自作者自己的实践,没有第三方验证,但“周/月级压到分钟级”这个说法配上具体场景,对从业者来说有参考价值。正文没披露多角色 agent 协作的成功率和翻车率,这点先别太激动。整体放在 featured 里合理,属于那种看完会让你重新打量自己团队流水线的东西。

AI 群聊日报

微软发布自研推理模型MAI-Thinking-1,35B参数在编程和数学上追平Opus 4.6

微软首个正式对外发布的自研推理模型MAI-Thinking-1,用了35B活跃参数、总参数约1T的稀疏MoE架构。SWE-Bench Pro编程测试跟Claude Opus 4.6打平,AIME 2025数学测试拿到97%,盲测里人类偏好优于Sonnet 4.6。训练全程没用任何第三方模型蒸馏,预训练数据也排除了AI生成内容。不过群友对微软年底拿第一的...

推荐理由:这条消息的钩子很清晰:微软的 MAI-Thinking-1 在代码基准上追平了 Opus 4.6,而且给出了具体的参数规模和数学测试得分。我会先打个折——来源是群聊日报,不是官方公告,正文没披露模型是否开源、API 定价和完整评测设置,所以权威性偏弱。但 H/K/R 三个维度都踩中了:有竞争对标、有硬数字、有平台格局的冲击力。综合来看,值得作为 featured 推给从业者看一眼,但别急着把它当正式发布。

量子位 · 公众号

Papers with Code 复活了,Hugging Face 用 AI 代理把论文和排行榜重新串了起来

Hugging Face 的开源团队在 2026 年 5 月上线了 paperswithcode.co,用 AI 代理自动解析论文,把原来平台超过 9300 个基准测试的 SOTA 排行榜恢复了出来。这次复活正好赶上 CVPR,首页直接整理了会议论文和对应代码。正文没披露解析准确率和代理的具体工作流,但能看出他们想用自动化方式解决原平台长期停更的问题。

推荐理由:Hugging Face 把 Papers with Code 重新做回来了,这次用 AI 智能体自动解析论文,一口气恢复了 9300 个基准相关的排行榜。对做研究的人来说,这比手动翻论文找 SOTA 省事太多。我会先打个折:正文没披露智能体解析的准确率有多高,也没说排行榜更新频率和覆盖范围的具体边界,所以别急着当完全体用。但光是 CVPR 期间能一站式查代码和榜单,实用价值就摆在那。

量子位 · 公众号

扣子3.0实测:手机能远程遥控你电脑上的智能体干活

扣子3.0把智能体协作搬到了项目里,支持iOS、安卓、Mac、Windows和网页端。你可以把本地跑的Claude Code、Codex CLI这类命令行智能体导进去,在手机上授权后直接让它读你电脑里的PDF。正文没披露具体延迟和资源占用数据,实际体验得自己跑一遍才知道稳不稳。

推荐理由:HKR 三项都踩中了:扣子 3.0 让手机能远程指挥电脑里的 Agent,还支持导入 Claude Code 这类命令行工具,等于把 Agent 协作和跨设备控制绑在一起。不过它本质上还是一个产品更新,正文没提定价、推送范围和本地文件读取的安全边界,所以先放在 featured 这一档。

AI HOT 精选

Qwen3.7 发布,重点强化推理和让模型进业务流程干活的能力

Qwen 发了 Qwen3.7,由通义大模型 BU 多模态交互负责人 Steven Hoi 介绍。官方说法是推理能力有重大突破,工具调用、写代码和长链条的 agent 任务都做了升级。正文没披露模型参数量、定价、跑分成绩和开源/闭源条件,我会先打个折——等看到具体数字和实测再判断突破有多大。

推荐理由:HKR-H 和 HKR-R 通过,因为 Qwen3.7 是阿里云旗舰模型更新,从业者会关注。HKR-K 不通过:正文只说了能力方向,没给参数量、价格、跑分或接入方式,信息缺口太大,没法判断实际提升。

r/LocalLLaMA

微软在 Build 2026 发了两个端侧模型 Aion 1.0:一个管推理和调工具,一个管总结改写

微软在 Build 2026 大会上发了两个能在设备本地跑的模型,都叫 Aion 1.0。一个是 Aion 1.0 Plan,140 亿参数,专门做推理和调用工具,上下文窗口 3.2 万 token,会直接预装在配置够的 Windows 设备里。另一个是 Aion 1.0 Instruct,定位是总结、改写、理解意图、无障碍功能,会集成进 Edge 浏...

推荐理由:微软在 Build 2026 发了 Aion 1.0 Instruct 和 Plan 两个端侧模型,其中 Plan 是 14B 参数、32K 上下文的规划模型,会直接跟着 Windows 推给符合条件的设备。我会先打个折:文章没提许可证、跑分、具体硬件门槛,所以实际落地效果还得观望。但 Windows 内置这件事本身,分发优势和生态卡位就很明显,对做端侧 AI 和 agent 的人来说值得盯一下。

新智元 · 公众号

WSJ 挖出 OpenAI 与 Anthropic 创始人的九年恩怨:Dario Amodei 曾把 Greg Brockman 踢出 ChatGPT 前身项目

这篇来自 WSJ 的报道梳理了 OpenAI 总裁 Greg Brockman 和 Anthropic 联合创始人 Dario Amodei 之间长达九年的矛盾。核心冲突是,在 OpenAI 内部研发一个后来演变成 ChatGPT 的项目时,Dario Amodei 直接禁止 Greg Brockman 参与。文章还提到,Brockman 现在负责 O...

推荐理由:我会先打个折:这不是模型发布或现任高管离职,所以放在 featured 里算合理。但 WSJ 挖出的料够硬——Dario 当年直接不让 Brockman 碰 ChatGPT 的前身,这比普通的口水仗有信息量。后面 Brockman 管了近 1500 人的产品战略,也说明他现在在 OpenAI 的盘子有多大。两条事实一前一后,把两家公司的旧怨和现状串起来了,对关注 AI 公司权力格局的人有参考价值。

AI HOT 精选

智能体工程实战窍门全录

@mvanhorn 分享了一套让 AI 智能体干活的工程方法,核心是把开发流程从“人写代码”扭成“人定方向、智能体执行”,工作台从 IDE 搬到了终端和一份 plan.md 计划文件。整体走 Research → Plan → Work 循环,用 plan.md 来约束智能体行为。帖子总结了 22 条实战技巧,覆盖规划、并行执行、输入方式、远程控制这些...

推荐理由:这是一篇从业者的方法总结,不是模型发布或产品上线。正文没披露完整工具栈清单,所以我会先打个折。但 Research→Plan→Work 循环和 plan.md 约束的思路很具体,22条技巧也给了可操作的抓手,对正在折腾智能体工程的人有直接参考价值,放在 featured 档刚好。

纽约时报中文网

科技公司大裁员,AI是原因还是借口?

Meta、Coinbase 和 Block 最近各自砍了至少 10% 的人,三家加起来约 1.3 万个岗位没了,高管们把一部分理由推给了 AI。但文章指出,这些裁员发生时,公司本身也在经历业务震荡:Meta 在元宇宙上烧了约 800 亿美元后大幅收缩,Coinbase 赶上加密市场低迷,Block 承认疫情期间招人太多。今年已有超过 150 家科技公司...

推荐理由:这篇纽约时报的报道没在讲模型或产品,而是把三家科技公司合计1.3万人的裁员和今年全行业11.5万人的数字摆出来,追问管理层到底是真的用AI省了人力,还是借AI的名义砍成本。对做AI的人来说,这比技术论文更扎心——它直接关系到岗位安全感和行业叙事。信息量够,角度也够锐,所以放在featured。

Computing Life · Share · 鸭哥调研

vibe coding 之后:AI 编程的工业化

MAI 从 487 万个开源 PR 里筛出 26.5 万道可训练题目,又为它们建了一套三层判分体系。AI 编程这两年真正的变化不是模型变聪明了,而是训练基础设施被工业化了:出题从手工活变成了流水线,批改也从“单测全绿就行”升级到能检查工具使用效率和前端视觉质量。

推荐理由:这篇文章没发模型、没给跑分,但把“vibe coding”之后该看什么讲清楚了:训练数据怎么筛、判分怎么搭、工程成本怎么控。487 万 PR 筛到 26.5 万题,这个压缩比本身就说明他们在做苦活,不是随便抓一把数据就训。三层判分体系正文没展开细节,但至少表明他们知道代码题不能只靠单次通过率来评。我会先打个折:没看到开源计划、也没看到实际训练出来的模型效果,所以目前更像一套训练基础设施的思路,离可复现的结论还差一步。对正在考虑自训代码 agent 的团队来说,这篇值得看,但别急着当标杆。

AI HOT 精选

NVIDIA 发布 NemoClaw 蓝图,让工业软件能跑通自主 AI 工程师

NVIDIA 在 COMPUTEX 上放出了一个叫 NemoClaw 的开放蓝图,专门用来构建能长时间自主干活的 AI 智能体。十几家工业软件厂商已经用它来打造“自主 AI 工程师”,主要用在 CAE 仿真和 EDA 芯片设计流程里。按官方说法,以前要跑好几周的仿真和设计任务,现在能压缩到几小时内完成。不过正文没给出具体的测试基准、客户实测数据或错误率...

推荐理由:我会先打个折:这是 NVIDIA 官方博客发的,没有第三方验证,技术细节也基本没给。但它的核心信息够硬——NemoClaw 这个新平台专门瞄准 CAE 和 EDA 场景,让模型像工程师一样自主跑仿真和设计任务,而且已经拉了十多家工业软件厂商在用了。它抛出的“数周变数小时”虽然没讲清楚是怎么算出来的,但哪怕打个对折,对工业仿真这种重计算场景也是实打实的吸引力。这点先别太激动,正文没披露具体架构、模型规模和实测对比,后续得看有没有论文或客户案例放出来。

AI HOT 精选

Google DeepMind 在 GitHub 开源了一个给科研智能体用的工具包,叫 Science Skills

这个工具包专门用来搭科学发现场景里的自主智能体,让模型能跑科研流程。官方说它有两个好处:一是针对科学任务做了基础能力封装,二是 token 效率更高,也就是调用大模型时可能更省 token、更省钱。不过正文没披露开源协议、具体跑分数据,也没给出 token 节省量的数字,所以实际能省多少、效果怎么样,还得自己跑跑看。

推荐理由:这条消息有明确的开源动作和落地载体,对做智能体的人有参考价值。我会先打个折:正文没写许可证、没给基准测试结果,也没提 token 效率或成本数字,所以没法判断实际好用程度和复用门槛。这点先别太激动,等后续有实测数据再看。

AI HOT 精选

Claude Code 现在能自己派活给多个子模型,并行干活

Claude Code 新增了动态工作流,核心是让它在运行时执行 JavaScript 文件,按需创建并协调多个子代理(subagent)。每个子代理有自己的上下文窗口,互不干扰,可以同时跑研究、安全分析和代码审查这些任务。官方举的例子是让一个子代理查漏洞、另一个审代码逻辑,主代理最后汇总结果。正文没披露子代理数量上限和额外费用怎么算,这点先别太激动。

推荐理由:HKR 三项全中:Claude Code 用运行时 JS 编排带独立上下文的子代理,这是个实打实的新功能。Anthropic 的品牌有加分,但这次是功能更新而非模型或平台级发布,所以分数落在 78–84 区间。正文没提具体性能数据和价格变化,这点先别太激动。

AI HOT 精选

Claude Code 能按任务自动生成专属工作流了,用 JS 脚本调度子智能体干活

Claude Code 加了一个动态工作流功能,你给它一个任务,它会现场写一段 JavaScript 来指挥多个子智能体分工协作。你可以指定用哪个模型、工作区隔离到什么程度,适合做研究、安全分析、代码审查这类复杂活,写好的工作流还能共享和复用。不过正文没提具体会多烧多少 token,也没说这个功能现在是不是所有人都能用,这点先别太激动。

推荐理由:HKR 三项都过,但文章只给了机制层面的细节,token 增量、推送范围和定价都没提。因为跟 Claude Code 直接相关,所以放在中量级产品更新里偏高的位置。

NVIDIA 博客

英伟达和微软搞了一套统一方案,让 AI 能在 Windows 电脑、云端和本地服务器之间来回跑

微软 Build 大会上,两家宣布把 AI 部署的底层打通了。简单说,就是同一个 AI 应用,既能在你笔记本的 RTX 显卡上跑,也能无缝切到 Azure 云或者公司本地的 DGX 工作站上,不用重写代码。现场还亮了两款新硬件:RTX Spark 是个小盒子,能提供 1 petaflop 的 AI 算力(大概相当于每秒一千万亿次计算);DGX Stat...

推荐理由:HKR 三项都过了。NVIDIA 和微软这次合作,把 agent 部署从 Windows 到 Azure 再到本地串成一条线,还亮出了 1 petaflop 和 20 petaflops FP4 两个硬件规格,对从业者来说有信息增量。不过消息源是厂商自己,正文没给定价、跑分和迁移细节,所以分数没往上拉。

AI HOT 精选

Claude Platform 推出命令行工具,终端里直接跑 API 和托管智能体

这个 CLI 工具把 Claude Platform 的所有 API 端点都搬到了终端里。你可以直接在命令行调用 Messages API、启动 Claude 托管的智能体,然后把返回结果用管道传给 shell 做后续处理。官方提到,用 Claude Code 这类编码智能体来理解这个 CLI 也没问题。正文没披露性能开销或额外费用,实际用起来会不会增...

推荐理由:Claude Platform CLI 在 HKR 三项上都站得住,是个实用的开发者工具更新。不过公告只给了能力范围,安装流程、权限控制、安全限制和定价都没提,我会先打个折——实际落地好不好用,还得看这些缺口怎么补。

TechCrunch · AI

微软给开发者发了份说明书,让 AI 代理的行为能按规矩来

微软发布了一份 AI 代理的行为规范说明书,让开发、合规和安全团队能把想让代理遵守的规则,写进可移植的策略文件里。正文没提版本号、开源协议、支持哪些开发框架,也没说什么时候正式上线。

推荐理由:我会先打个折:正文没披露版本号、开源协议和具体支持的框架,所以没法判断落地有多顺滑。但“可移植策略文件”这个机制本身是实在的,它让开发、合规、安全三拨人能用同一份文件定规矩,不用各说各话。对正在搭 Agent 的团队来说,规则能不能跨栈迁移是个真需求,这点先别太激动,但值得放进 featured 里提醒大家关注。

AI HOT 精选

微软推出 Scout 个人助手,基于 OpenClaw,能常驻在 Outlook 和 Teams 里干活

微软发了 Microsoft Scout,一个能一直挂在 Outlook、OneDrive、Teams 里的 AI 助手。企业可以把它分给员工,让它帮忙管日历、处理报销、起草邮件。微软副总裁 Omar Shahine 说这是他们第一次给客户一个真正的个人助手,功能比应用内嵌的 Copilot 更宽。不过正文没提 OpenClaw 具体是什么、怎么跟现有...

推荐理由:这篇就是微软 workplace agent 的产品更新,给了集成范围和任务类型,但没给定价、上线时间,也没技术细节。信息量够上 featured 低段,但别指望从这篇看出落地节奏。

The Verge · AI

微软在 Build 2026 上发了 Project Solara,一个给 AI 硬件跑智能体的安卓系统

微软在 Build 2026 大会上公布了 Project Solara,一个专门为跑 AI 智能体的硬件设计的操作系统。它底层是安卓,不是 Windows。现场展示了两个概念机:一个是类似 Echo Show 的桌面设备,用人脸识别解锁后可以直接调用各种 AI 智能体;另一个是可穿戴工牌,带摄像头和指纹扫描,能唤醒 AI 智能体。正文没披露具体上市时...

推荐理由:我会先打个折:正文没给发货时间、开发者接口和定价,所以别当产品发布看。亮点是微软在 Build 2026 上拿出的 Project Solara,一个跑在 Android 上的 AI 硬件系统,不是 Windows。现场有两台概念机,一台放桌上的带人脸识别,一台可佩戴的徽章带摄像头和指纹,说明微软在试探 agent 硬件长什么样。系统层面用 Android 意味着生态借力,但也绕开了自家系统,这点挺有意思。隐私那块正文没展开,只提了人脸和指纹,具体怎么处理数据没说。

AI HOT 精选

Google DeepMind 放出 Co-Scientist:让多个 Gemini 智能体组队,自己辩论、自己迭代科学假设

Google DeepMind 发了个叫 Co-Scientist 的系统,核心是用多个 Gemini 智能体搭成一个科研小组:有的负责生成假设,有的负责挑刺辩论,再让假设在内部迭代进化。官方说法是能帮科学家在复杂问题上找新思路。不过正文没披露具体用的是哪一版 Gemini、有没有跑过基准测试、开放方式是什么、什么时候能用上,这些关键信息目前都还是空白。

推荐理由:我会先打个折:正文没披露模型版本、评测结果和开放时间,所以目前只能当一次研究发布来看,别太激动。但 Gemini 被架成多智能体科研系统这个动作本身,说明 DeepMind 在认真推“AI 做科学假设”这件事,不是单次推理,而是让多个 agent 互辩、演进想法,思路比单纯刷榜有意思。对从业者来说,这更像一个方向信号,离能用的产品还有距离。

Latent Space

GitHub COO 聊怎么让平台接住 AI 代理的代码洪流

GitHub COO Kyle Daigle 说,2026 年 AI 驱动的代码提交量涨了 14 倍,这给原本按人类节奏设计的 GitHub 基础设施带来了很大压力,公开的宕机问题也跟这有关。他聊了 Copilot 的演变:从代码补全到命令行工具、桌面应用、云端代理和 SDK,以及 WorkIQ、MCP 这些让模型接入 Slack、邮件等公司上下文的方...

推荐理由:HKR 三项都成立:GitHub 高管给出 14 倍 AI 代码提交这个具体数字,把 Copilot、Actions、MCP、WorkIQ 和云端 agent 串成一条线来讲,信息量够。不是重大产品发布,所以重要性停在 80 分。

AI HOT 精选

Claude Code 团队自述:把编程工作默认交给智能体后,我们的流程和分工全变了

Claude Code 的工程主管在 Code w/ Claude SF 2026 活动上分享了团队内部的变化。他们把智能体编程(让模型直接写代码、改代码)设为默认工作方式后,砍掉了传统的详细需求文档,改成“即时规划”——在动手前先让 Claude 收集上下文、理清任务。代码审查环节,Claude 会先过一遍代码风格和测试覆盖,人则把精力集中在法律合规...

推荐理由:这是 Anthropic 自家团队在 Code w/ Claude SF 2026 上的分享,不是模型发布或重大产品更新,所以分数压在 80 分左右。亮点在于他们公开了内部怎么用 Claude Code 干活:规划从提前设计改成即时按需,写代码前先让 Claude 把上下文理一遍,审查环节把风格和测试甩给 Claude,人只做法律和安全判断。这些机制写得实在,没有画饼,对工程团队有直接参考价值。但正文没披露具体效率数据或量化对比,所以别当性能报告看。

AI HOT 精选

OpenAI Codex 出了 Python SDK,一行命令就能把编程 Agent 塞进自己应用里

OpenAI Codex 发布了 Python SDK,安装命令是 pip install openai-codex。这意味着开发者可以直接在自己的代码里调用 Codex 的编程和生图能力,不用再单独打开 Codex 界面。更省事的是,SDK 能复用你已经在 Codex 上的登录状态,省去再搞一套鉴权的麻烦。不过正文没提 API 怎么收费、用的是哪个模...

推荐理由:我会先打个折:正文只说了怎么装和怎么登录,没给 API 价格、模型版本或限流条件,所以别急着算账。但这件事本身挺实在——Codex 不再只是个聊天窗口,而是能当零件用,pip 一装就能集成。对开发者来说,复用登录态省了一步鉴权麻烦,但没写清楚调用上限,真上生产还得自己测。整体是实用的产品更新,信息有缺口但不妨碍它值得关注。

AI HOT 精选

OpenAI 给 Codex 加了 Sites 功能,能把想法直接变成团队可用的网页或小应用

Codex 现在可以把你的工作内容、想法和计划直接转成一个交互式网站或应用,团队通过一个链接就能打开、使用和分享。这个功能会先推给 Business 和 Enterprise 用户,正文没提价格,也没说什么时候开放给其他套餐。

推荐理由:我会先打个折:正文没披露定价、权限边界,也没给实际效果案例,所以别急着把它当成成熟的生产力工具。但 Codex 从写代码延伸到直接出可交互站点,这个方向本身挺省钱——省掉了从代码到可演示原型中间的那一步。对企业和团队用户来说,一个 URL 就能让非技术人员上手试用,协作摩擦会小很多。这点先别太激动,等看到具体质量表现和计费方式再说。

TechCrunch · AI

OpenAI 在 Codex 里塞了六个白领岗位插件,覆盖数据分析、创意、销售、产品设计、股票研究和投行

OpenAI 给 Codex 应用上线了六个新插件,分别瞄准数据分析、创意产出、销售、产品设计、股票投资和投行业务。每个插件都打包了工具集成、操作指令和上下文,让 Codex 能模拟特定岗位的工作流。正文没提定价和开放范围,我会先打个折——没看到实际跑通的效果和成本之前,别急着把它当正式员工用。

推荐理由:OpenAI 把 Codex 从程序员工具扩成白领插件包,六个方向覆盖了数据、创意、销售、产品、股票和投行,动作不小。但正文没提定价、实际效果和推送范围,所以我会先打个折,把它放在中等权重的产品更新档。

6月2日星期二

AI HOT 精选

Holo3.1 发布:一套能在本地快速跑起来的电脑/手机操作模型

H公司把他们的电脑操作模型升级到了 Holo3.1,这次主打的是“哪里都能跑”。模型基于 Qwen 系列,一口气放出 0.8B、4B、9B 和 35B-A3B 四个尺寸,并且首次提供了 FP8、Q4 GGUF 和 NVFP4 这些压缩版本,方便直接在个人设备上做本地推理。35B-A3B 的旗舰版在 AndroidWorld 测试里拿到了 79.3% 的...

推荐理由:Holo3.1 把电脑操作智能体做成了本地可跑的版本,而且最小模型只有 0.8B 参数,对想在个人设备上试水的开发者来说门槛很低。四个尺寸加三种量化格式一起发,部署灵活度拉满,不是只给一个玩具。我会先打个折:正文没披露具体任务成功率或延迟数据,所以实际效果还得自己测。但就凭本地运行和量化支持这两点,已经够让做私有化部署的人点进去看了。