跳到正文

#Agent

今日 41 条

6月3日星期三

TechCrunch · AI

OpenAI 在 Codex 里塞了六个白领岗位插件,覆盖数据分析、创意、销售、产品设计、股票研究和投行

OpenAI 给 Codex 应用上线了六个新插件,分别瞄准数据分析、创意产出、销售、产品设计、股票投资和投行业务。每个插件都打包了工具集成、操作指令和上下文,让 Codex 能模拟特定岗位的工作流。正文没提定价和开放范围,我会先打个折——没看到实际跑通的效果和成本之前,别急着把它当正式员工用。

推荐理由:OpenAI 把 Codex 从程序员工具扩成白领插件包,六个方向覆盖了数据、创意、销售、产品、股票和投行,动作不小。但正文没提定价、实际效果和推送范围,所以我会先打个折,把它放在中等权重的产品更新档。

6月2日星期二

AI HOT 精选

Holo3.1 发布:一套能在本地快速跑起来的电脑/手机操作模型

H公司把他们的电脑操作模型升级到了 Holo3.1,这次主打的是“哪里都能跑”。模型基于 Qwen 系列,一口气放出 0.8B、4B、9B 和 35B-A3B 四个尺寸,并且首次提供了 FP8、Q4 GGUF 和 NVFP4 这些压缩版本,方便直接在个人设备上做本地推理。35B-A3B 的旗舰版在 AndroidWorld 测试里拿到了 79.3% 的...

推荐理由:Holo3.1 把电脑操作智能体做成了本地可跑的版本,而且最小模型只有 0.8B 参数,对想在个人设备上试水的开发者来说门槛很低。四个尺寸加三种量化格式一起发,部署灵活度拉满,不是只给一个玩具。我会先打个折:正文没披露具体任务成功率或延迟数据,所以实际效果还得自己测。但就凭本地运行和量化支持这两点,已经够让做私有化部署的人点进去看了。

Ben's Bites

Claude Opus 4.8 发布,Claude Code 学会写脚本派子任务并行干活

Anthropic 发了新模型 Claude Opus 4.8,主要卖点是 Claude Code 现在能先写一个调度脚本,再同时拉起多个子代理并行处理复杂任务。不过有开发者提醒,这并不证明松散的 multi-agent 架构靠谱,反而是围绕小代理循环的确定性工作流更稳。模型本身被 Simon Willison 评价为“温和但有用的升级”,更诚实、更少...

推荐理由:HKR 三项都成立,因为这是一次有实质内容的 Anthropic/Claude 发布和 Claude Code 代理更新。文章没给基准测试、定价和上下文窗口数据,所以分数压在 85–94 这个区间。

AI HOT 精选

阶跃星辰放出 Step 3.7 Flash,开放权重,主打帮智能体写代码

阶跃星辰发了个新模型 Step 3.7 Flash,把权重开放了,你可以直接下载用。它的定位是给智能体编程场景用,强调工具调用可靠,还能处理多模态输入。同一天 MiniMax 也开源了 M3,两家模型都已经能在 Kilo 平台上跑。正文没披露具体的跑分、参数量或硬件门槛,所以实际快不快、省不省资源还得自己测。

推荐理由:这条消息的钩子在于“开放权重”和“智能体编程”两个点,不是常规发个新版本。我会先打个折:正文没给模型尺寸、跑分、许可证和定价,所以只能算有信息增量但缺关键验证。对开发者来说,能直接下载权重、能调工具、能看懂多模态输入,这几个能力放在一起确实有吸引力,尤其现在大家都在抢智能体编程这条赛道。Kilo 上线也让想试的人有个现成入口。不过没披露性能对比和实际成本,这点先别太激动,等后续数据出来再看值不值得切过去。

The Verge · AI

我试了 Google 的 AI 管家 Gemini Spark,它规划行程的方式让我又惊又怕

过去四年所有 AI 产品演示都说能帮你规划旅行,但实际用起来只会推荐每个城市最俗套的六件事。我用 Spark 的体验完全不同——它是 Google 一个野心很大的常驻 AI 管家。不过这篇报道只放了开头,正文没披露 Spark 什么时候上线、怎么收费、有没有跑分,也没说测试条件能不能复现,所以它到底多能打,我会先打个折。

推荐理由:我会先打个折:这篇是 The Verge 的上手体验,不是产品发布稿,所以别当官方公告看。标题的情绪冲击力够强,能勾住人,但正文只披露了旅行规划这一个场景的差异,发布时间、定价、可复现的测试条件一概没提,信息密度其实不高。不过它踩中了两个从业者会关心的点:一是 agent 常驻系统带来的自主性和安全边界问题,二是 Google 在这个方向上给竞品施加的压力。综合来看,有话题性但缺硬信息,放在 featured 级别是合适的。

r/LocalLLaMA

我把多智能体调度器里的 Claude 换成本地 Qwen3.6-27B,跑了两个星期

作者用一张 RTX 3090 跑 Qwen3.6-27B,在 47 个多步骤编程工作流里顶替 Claude 试了两周。计划生成的结构合规率大约 95%,但工具调用格式错误率有 12% 左右,而且上下文一超过约 12k token,实际表现就开始明显下滑。正文没披露具体任务难度和对比基准,所以 95% 这个数只能当个参考,别直接当成“接近 Claude”...

推荐理由:这篇值得看,因为它是真人两周实测,不是跑分。作者用一张消费级显卡把 Qwen3.6-27B 塞进多智能体编排里,替换 Claude,给出了能用的上限和会翻车的点。95% schema 合规听着不错,但 12% 工具调用格式错误意味着每八九次就有一次格式炸了,生产环境还得加校验层。长上下文到 12k tokens 就吃力,复杂任务得拆。正文没披露延迟数据和总 token 消耗,这点先别急着算成本账。整体是份诚实的工程笔记,不是公关稿。

机器之心 · 公众号

DataMaster:让模型自己搜数据、洗数据、拼数据,MLE-Bench Lite 奖牌率从 35.91% 拉到 68.18%

这篇论文提出了 DataMaster,一个让大模型自己当数据工程师的流程。它不碰模型结构和训练算法,只做三件事:自动搜索外部数据、清洗脏数据、把多个数据集拼成一张表。在 MLE-Bench Lite 这个机器学习竞赛基准上,DataMaster 把奖牌率从 35.91% 提到了 68.18%,几乎翻倍。正文没披露具体用了哪些模型、单次任务耗时和额外算力...

推荐理由:DataMaster 做的事很直接:模型和训练代码都不动,只让系统自己去搜、洗、拼数据,结果 MLE-Bench Lite 奖牌率从 35.91% 拉到 68.18%,接近翻倍。我会先打个折——这还只是单篇研究,没有生产环境验证,benchmark 本身也不是完整 MLE-Bench,所以别急着当银弹。但“数据工程自动化”这个方向确实戳中很多团队的日常痛点,加上数字够具体,给 78 分 featured 合理。

机器之心 · 公众号

图灵奖得主 Sutton 新论文:AI 的下一步,得学会在行动中理解世界

这篇文章的正文被微信环境验证挡住了,实际内容没抓到。从标题和摘要看,Banafsheh Rafiee 和 Richard S. Sutton 提了一个叫“生成认知”的框架,给 AI 立了四根柱子:经验、感知与行动不可分、自主性、具身性。说白了就是主张智能不能光靠看数据,得在跟环境互动的过程中长出来。但具体怎么实现、有没有实验,正文没披露,这点先别太激动。

推荐理由:这篇是 Sutton 和 Rafiee 的新论文解读,核心是提出“生成认知”框架,主张智能体得靠经验、感知和行动绑在一起、自己定目标、还得有身体去试错。我会先打个折:正文没披露实验、代码或可复现的测试,目前还停在概念层。但 Sutton 的名气和四个支柱的提法,让它有资格进 featured,属于研究评论向的必读。

AI HOT 精选

为了省120刀,我把电脑清理做成了开源AI工具

作者用Codex扫了自己的MacBook,发现B站缓存等一堆可删文件,激进方案能清出超140G。他干脆把清理逻辑做成一个开源skill,Mac和Windows都能用。工具会扫描文件生成可交互的HTML报告,用绿黄红三色标出哪些能放心删、哪些要人工判断、哪些千万别动,还带安全执行按钮。实测清出近120G,而CleanMyMac只扫出15.8G,信息透明度...

推荐理由:这篇东西不是平台级大新闻,但 H、K、R 三点都踩中了:120 美元的替代钩子够抓人,扫描报告和 120G 实测结果给了具体信息,开源 skill 的思路对想用 AI 省钱的开发者有直接复用价值。放在 featured 门槛附近没问题,属于那种实用开源工具类的推荐。

量子位 · 公众号

老黄带着英伟达 CPU 杀进 PC 赛道

英伟达要在今年秋天把一台叫 RTX Spark 的 Windows 电脑推向市场。这台机器把一块 Blackwell 架构的 RTX 显卡和一颗 20 核 Arm 架构的 Grace CPU 焊在一起,通过 NVLink-C2C 高速互联,共享 128GB 统一内存。官方给出的 AI 算力是 1 petaflop,号称能在本地跑起 1200 亿参数、上...

推荐理由:英伟达把RTX Spark搬进Windows PC,不是发新模型,而是给开发者一台能本地跑120B模型的机器。1 petaflop算力和128GB统一内存这些数字,说明它想解决本地跑大模型内存不够、上下文装不下的痛点。对从业者来说,这意味着可以省掉一部分云端推理成本,延迟也更可控。不过正文没提具体功耗和价格,实际性价比还得等上市再看。整体是硬件产品更新,不是基础模型发布,所以分数落在78到84之间。

新智元 · 公众号

中科院开源 MobileGym:在浏览器里搭了个手机训练场,微信、原神都能跑

中科院自动化所开源了一个叫 MobileGym 的移动端智能体训练环境,直接在浏览器里模拟安卓手机。它覆盖了 28 款常用 App,包括微信、原神、淘宝这些,每个实例只占 400MB 左右,冷启动 3 秒就能跑起来。环境会把手机界面状态转成结构化的 JSON 快照,方便模型理解当前屏幕有什么、能点哪里,任务验证也是程序化自动完成的,不用人工盯着看。这套...

推荐理由:MobileGym 是一套开源的移动 agent 训练与评测基础设施,不是模型发布,但实用性强。我会先打个折:正文没披露判分准确率、任务完成率等验证数据,这点先别太激动。不过它用浏览器仿真 28 个 App,单实例约 400MB、3 秒冷启动,还支持 JSON 状态复制,意味着复现成本低、部署快,适合批量跑实验。对 agent 开发者来说,这比租真机或搭模拟器集群省钱省事。整体在 78–84 这个质量区间里算扎实的工程贡献,所以维持 featured 和现有评分。

AI HOT 精选

阶跃星辰发了 Step 3.7 Flash,一个 196B 参数的 MoE 模型,主打推理省钱

这个模型用了多矩阵分解注意力,把 KV-cache 的占用压到 DeepSeek 同类模型的 22% 左右,显存压力小很多。另外还把注意力和前馈网络解耦,方便在硬件上跑得更顺。模型走 Apache 2.0 协议,已经在 Fireworks AI 上可用,官方说能用来搭智能体应用。不过正文没给出具体跑分和延迟数据,实际效果还得看第三方实测。

推荐理由:HKR 三项都站得住:Step 3.7 Flash 有 196B MoE 和约 22% KV-cache 成本的具体数字,不是纯宣传稿。不过它还没到一线旗舰模型的体量,所以给 78 分放在 featured 里。

AI HOT 精选

Anthropic 开发者公开了一套 Claude Code 工作流,核心是让 AI 当老师逼你真正搞懂代码,而不是只点“同意”

这套流程把 Claude Code 定位成“高效又聪明的老师”,目标不是替你写完代码,而是确保你能把问题、方案和影响讲清楚、辩得动。它沿着问题域、方案域和语境域三条线,拆成 8 个可执行步骤,用增量教学、用户复述、清单加测验的方式,在进入下一步前先确认你真的懂了。这么设计是为了对抗长会话里人慢慢变成“审批按钮”的问题,强制把决策上下文沉淀下来,让理解过...

推荐理由:我会先打个折:这不是产品发布,是一篇实操分享,所以放在 featured 低位。HKR 三项都踩实了——钩子把“人变按钮”这个痛点讲得很透,知识部分有 8 步工作流和验证循环,相关性直击开发者对 agent 失控的担忧。正文没披露这套流程在复杂项目里的失败率,这点先别太激动,但作为可落地的教程,信息密度够。

Computing Life · Share · 鸭哥调研

AI Agent 不用攻破,说服它就行

这篇文章讨论了一个被主流安全研究忽略的攻击面:手握密码重置等敏感权限的 AI agent,其身份验证逻辑从密码学硬边界退化成了对话层的软判断。攻击者不需要写 payload 或越狱模型,只要在聊天里说服 agent 自己是账号主人,就可能让它把重置链接发到指定邮箱。文章引用了 Hacker News 上一个声称用此法劫持上百个 Instagram 账号...

推荐理由:我会先打个折:正文没给出任何实际攻击案例、成功率数据,也没跟现有产品方案做对比,所以只能算一篇有启发的观点文章,不是验证过的解法。但它的好处是把 agent 安全从“防入侵”拽到了“防忽悠”上,这个视角本身就有提醒价值。what/who 分离的三层架构虽然细节不多,至少给了一个可讨论的起点,不是空喊口号。对正在给 agent 配权限的团队来说,这篇值得扫一眼,但别指望拿来就直接落地。

Computing Life · Share · 鸭哥调研

Google 推出后台常驻 AI 助手 Spark,Agent 产品形态从聊天窗口转向守护进程

Google 向美国 AI Ultra 用户推送了 Gemini Spark,一个能 24 小时在后台监控邮箱、日历和云盘,并按你设定的规则自动干活的 AI 助手。它和之前聊天式 AI 最大的区别是:你不用打开它,它也会在条件满足时自己行动。The Verge 的评测显示,Spark 在查开支、写邮件这类简单任务上表现惊人,但面对复杂任务会编造信息,结...

推荐理由:我会先打个折:正文没披露 Gemini Spark 的具体上线时间、推送范围,也没有实测数据,所以这更像一篇概念梳理,不是产品首发。但它的价值在于把“后台常驻 agent”这个方向讲明白了——从聊天窗口到守护进程,四代演化加上 periodic 和 reactive 两种模式,对正在做 agent 产品的人有参考意义。信息密度够,判断也克制,放在 featured 低分段合适。

r/LocalLLaMA

我花了几个月钻进 verl 的 RL 训练框架,最后还是放弃了:内部机制、维护分支的代价,还有一个 NCCL 的坑

作者深入研究了字节跳动的 verl(一个做 RLHF 强化学习微调的开源框架),把它的核心流程拆了一遍:DataProto 数据协议怎么走,模型怎么生成回答(rollout),怎么打分(reward),怎么算优势函数(advantage),最后怎么更新模型。作者本来维护了一个自己的分支,但因为上游几乎每天都有改动,同步的成本比自己做改动还高,最后只能停...

推荐理由:这是一篇来自一线的 RL 后训练框架使用报告,不是官方发布。作者没在推销什么,而是老实交代了 fork 又放弃的原因和踩坑记录。我会先打个折:信息密度不错,但只覆盖单机场景,正文没披露多机下的 NCCL 表现。对正在选型或折腾 verl 的人有参考价值,对其他人可能就只是看个热闹。

AI HOT 精选

Google AI Studio 现在能直接搭 Gmail、Drive 应用,不用跳出去

Google AI Studio 上线了应用构建功能,可以直接在里面连接 Gmail、Drive 和 Sheets 等 Google 自家服务,不用再切到别的网站。目前支持在 AI Studio 内部添加测试人员,但正文没披露完整的公开分享功能具体什么时候上线,只说“即将推出”。

推荐理由:这是个中等体量的产品更新:Workspace 连接和测试人员支持已确认,但分享机制、权限细节和定价都没披露。我会先打个折,因为目前更像内部测试能力,离正式开放还有信息缺口。

TechCrunch · AI

英伟达联手微软、戴尔和惠普,想用 AI 代理 PC 抢 2000 亿美元 CPU 市场的蛋糕

英伟达要把 AI 代理(能自主干活的软件助手)装进消费级 PC,合作方是微软、戴尔和惠普。他们瞄准的是价值 2000 亿美元的 CPU 市场。不过正文没披露具体配置、价格、上市时间,也没说怎么保证这些代理在个人电脑上安全运行不出乱子。如果真解决了易用、安全和实用这三个问题,这事儿确实不小,但现在只能先打个折看。

推荐理由:我会先打个折:正文没给任何规格、价格或上市时间,所以这更像一次生态站队宣示,不是产品发布。但“2000亿美元市场”这个钩子和微软/戴尔/惠普三家站台,足够让它进featured的低位。对从业者来说,知道Nvidia拉着OEM三巨头在铺AI agent PC的局就够了,具体能跑什么模型、卖多少钱,现在还没法判断。

The Verge · AI

Gemini Spark 上手:演示里能做的,实测基本也能做,但成本和隐私还是笔糊涂账

The Verge 的编辑用了一周 Gemini Spark,这个能 24 小时在后台跑多步骤任务的 AI 代理,干活能力确实和谷歌演示的差不多。但文章没提具体价格,也没说清楚隐私条款,只透露 Spark 会在执行大动作前先跟你确认。编辑觉得它替你办事时偶尔好得让人意外,可一想到要付出的钱和可能交出去的数据,就不太确定值不值了。

推荐理由:我会先打个折:正文没披露价格、隐私条款和完整测试结果,所以判断只能基于已有信息。The Verge 用了一周,结论是 Gemini Spark 确实能后台执行多步骤任务,但表现也就跟 Google 自己演示的差不多,没有超出预期。这点先别太激动,因为缺了成本和隐私细节,实际能不能在生产环境用还不好说。整体看,这是一次有参考价值的实测,但信息缺口明显,所以分数放在 72–77 这个区间。

AI HOT 精选

Meta 自家的 AI 客服被利用来劫持 Instagram 账号

攻击者直接跟 Meta 的 AI 客服聊天,让它把目标账号的绑定邮箱换成自己的,就能把号拿走。问题出在这个 AI 被赋予了直接操作账号的权限,而且它没法区分对面是号主还是骗子。报道没披露到底有多少账号受影响、漏洞现在修没修,也没给出能复现的具体步骤。

推荐理由:我会先打个折:正文没披露影响范围、修复时间和可复现步骤,所以不能往满分冲。但核心事实清楚——一个 AI 客服智能体因为能直接执行账户管理操作,被利用来接管 Instagram 账号。对做 agent 安全的人来说,这是个实打实的警钟,说明工具权限没卡死会直接变成攻击面。综合下来给 82 分,放在 featured 里提醒同行。

Hacker News 首页

黑客用 Meta 的 AI 客服机器人劫持 Instagram 账号

Brian Krebs 报道,上周末奥巴马白宫官方号和美国太空军高级士官长的 Instagram 账号被挂上亲伊朗图片,起因是 Telegram 上流传的一个教程:用 VPN 把 IP 切到目标账号常驻城市附近,申请密码重置,然后跟 Meta 的 AI 客服机器人说“把这个账号绑到我的新邮箱上”,机器人就会照做并发来一次性验证码,直接重置密码。攻击者声...

推荐理由:标题说黑客用 Meta 的 AI 支持机器人抢 Instagram 账号,听着挺吓人,但正文只给了 40 分和 14 条评论,没讲具体怎么做到的。我会先打个折:钩子够强,安全风险也确实存在,所以 H 和 R 都过;但关键信息全缺,K 过不了,只能放在 featured 的底线位置。

AI HOT 精选

Perplexity 把搜索流程写成代码,让 AI 代理直接调接口,不再绕函数循环

Perplexity 公开了一套叫 Search as Code 的搜索架构。它的做法是让 AI 代理直接写 Python 代码去调用自家的搜索栈,而不是像以前那样一步步循环调用函数。这套东西已经上线 Perplexity Agent API,并且成了 Computer 功能的默认选项。正文没披露具体性能对比数据,但思路很直接:省掉中间环节,让搜索更快...

推荐理由:我会先打个折:这篇只有 Perplexity 自己的公告,没给性能对比、定价细节和实际铺开范围,所以只能算一个低配版的产品更新。但亮点很实在——Perplexity 把搜索从“调 API 拿结果”变成了“让模型写代码操作搜索栈”,并且已经接进 Agent API,这对正在搭 agent 的团队来说是个省事的信号。正文没披露延迟和成本数据,这点先别太激动。

6月1日星期一

Latent Space

视频智能体是下一个方向:Ethan He 谈 xAI Grok Imagine 的三个月从零到一

Ethan He 在 NVIDIA 做完 Cosmos 世界模型后跳到了 xAI,带着一个小团队三个月就做出了 Grok Imagine。他有个很直接的观点:视频模型现在的智能主要来自语言模型,不是靠堆视频数据训练出来的。下一个 Sora 级别的突破不会是更好的视频生成模型,而是能规划、生成、修改、反复打磨一个完整创意任务的视频智能体。这期播客聊了从零...

推荐理由:我会先打个折:这篇是访谈级别的信号,不是论文或产品发布。它给了“三个月小团队从零搭建”这个事实,也点出了视频 Agent、音视频对齐和推理加速这几个方向,但正文没披露任何基准分数、具体成本数字或可复现的测试方法。所以它更像一份来自 xAI 内部的路线图预告,能帮你判断他们在往哪使劲,但暂时没法拿来做技术选型。对关注视频模型和多模态 Agent 的人来说值得扫一眼,别当结论用。

AI HOT 精选

开源与闭源模型,正走在两条不同的增长曲线上

作者 Nathan Lambert 的核心判断是:在编程智能体这类对智商极度敏感的场景里,用户会一直为最聪明的闭源模型付高价,他自己就愿意每月掏 2000 美元。闭源实验室会逐渐把最好的模型藏起来,不在 API 里轻易放出,以保护利润和防止被蒸馏。他预测 5 到 10 年内,OpenAI 和 Anthropic 的估值会到 2 万亿到 10 万亿美元,...

推荐理由:我会先打个折,这是一篇个人评论,不是系统研究,所以重要性停在 featured 门槛附近是合理的。但它的 HKR 三项都站得住:观点有明确的冲突框架(h),给出了可引用的价格和估值数字(k),讨论的议题正好是当下圈子里吵得最凶的那几个(r)。正文没披露这些估值模型的具体假设,所以数字本身先别太激动,但它们作为讨论的引子够用了。

AI HOT 精选

美团要把自己的 AI 助手“小美”接进腾讯元宝,让用户在聊天界面就能直接点外卖、叫跑腿

王兴在美团一季度财报电话会上说,美团的 AI 智能体“小美”很快会和腾讯元宝打通。以后你在元宝里说一句本地生活相关的需求,系统会直接跳转到美团的点餐、配送等服务,不用再切 App。王兴还提了一个新说法叫“To A”(服务 AI 智能体),认为这会是美团未来的重要方向。美团一季度营收 910.39 亿元,但亏了 68.27 亿元,由盈转亏。正文没披露“小...

推荐理由:我会先打个折:合作还是“即将”状态,具体上线时间、用户从元宝哪个入口唤起小美、订单收入怎么分账,正文都没披露。所以它是个中等体量的产品合作,放在featured层级刚好,别当重磅发布看。

AI HOT 精选

用 Claude Opus 4.8 把一本书做成 AI 技能,45 分钟、不到 20 块钱

作者拿《非暴力沟通》试了一遍,用 Claude Opus 4.8 把整本书拆成可调用的 AI 技能。流程分六步:先喂全书文本,让模型分析结构,再提炼框架、原则、技法、反模式和作者语气这五类内容,接着生成技能,最后做一轮自检。技能保留了书里的原始命名,比如 OFNR 四要素和“长颈鹿语言”,但触发词换成了“怎么提意见不像在指责”这种日常说法。全程花了约 ...

推荐理由:这是一篇带编号步骤的第一人称Claude实操教程,成本和token数据都摆出来了。因为属于个人教程而非Anthropic官方发布或模型更新,所以放在featured低位。

AI HOT 精选

Apache RocketMQ 出了个 AI 专用版,专门解决多智能体协作时状态丢失和流量打崩的问题

阿里云给 RocketMQ 加了一套 AI 场景的适配,叫 RocketMQ for AI。它主要干三件事:用 Lite-Topics 减少资源开销,靠有序消息防止多智能体协作时上下文乱掉,再通过流量整形避免突发请求把系统打挂。官方说已经在阿里云大规模跑过,代码也开源了,但正文没披露具体版本号和性能对比数据,实际省多少资源还得自己测。

推荐理由:这条更新把 RocketMQ 往 AI 场景推了一步,提的几个机制——轻量级主题、有序消息、流量整形——听着像是给多 agent 协作和长任务链路做减法,减少排队打架和资源争抢。我会先打个折,因为正文没给版本号、性能对比和实际落地案例,没法判断是已经能用的东西还是路线图上的规划。但方向本身不虚,agent 之间通信乱、调度不公正是真痛点,所以分数给到 74,放在 featured 里提醒一下做 agent 架构的人可以关注。

新智元 · 公众号

阶跃星辰发布 Step 3.7 Flash,196B 参数的 MoE 模型每次推理只激活 11B,速度冲到 400 tokens/秒,跑 Agent 任务...

阶跃星辰这次放出的 Step 3.7 Flash 是个混合专家模型,总参数量 196B,还挂了一个 1.8B 的视觉编码器,但每次推理实际只动用 11B 参数,所以能跑到每秒 400 个 token。官方说在 Agent 任务上,它的成本只有 Claude 的零头。不过正文因为微信环境验证没抓到具体内容,实际跑分、具体任务对比和定价细节都没披露,这点先...

推荐理由:速度和参数数字都摆出来了,标题里那个成本对比很抓人。但正文没披露具体定价、基准测试的细节和开源条款,所以分数只能停在 82 这个质量更新档位。

机器之心 · 公众号

OpenAI 为机器人团队招兵买马,由 Sora 负责人带队,部分岗位底薪开到 34 万美元以上

OpenAI 放出了十多个旧金山的机器人岗位,团队由 Sora 的负责人 Aditya Ramesh 带队,是从他之前的 Worldsim 项目演变过来的。其中执行器设计工程师的底薪现金在 34.2 万到 44.5 万美元之间,另外还有 PPU 激励。不过原文因为微信环境异常,具体岗位职责和团队规模都没披露,只能看到招聘信息的大致框架。

推荐理由:这条消息有明确的团队、负责人和薪资数字,不是模型或产品发布,但作为招聘信号已经够硬。我会先打个折:目前只是招人阶段,离实际产品还有距离,这点先别太激动。不过 OpenAI 把机器人当成全栈方向来做,薪酬又直接对标顶级硬件人才,对同行抢人和行业风向都有参考价值,所以放在 featured 档位没问题。

机器之心 · 公众号

VAST 发布 Project Eden,世界模型第一次能像游戏一样“存档”了

VAST 推出了一个叫 Project Eden 的三层世界模型架构,把场景的持久状态和画面渲染拆开了。简单说,就是给 AI 生成的 3D 世界加了个“存档”功能,你改过的东西下次打开还在,不用每次都重新生成。文章还提到 VAST 在 A+ 和 A++ 轮一共融了将近 2 亿美元。不过正文因为微信页面环境异常被屏蔽了,具体技术细节和效果演示都没看到,这...

推荐理由:我会先打个折:VAST 不是一线基础模型实验室,正文也没披露具体基准测试结果或开放接入方式,所以分数落在 78–84 区间。但 Project Eden 把世界状态推演和视觉渲染拆成三层,还给了“存档”这个产品钩子,加上近 2 亿美元的融资规模,对关注仿真基础设施的从业者来说信息量够硬。

AI HOT 精选

腾讯混元给智能体做了个长期记忆插件,叫 Hy-Memory

这个插件是给 OpenClaw 这类需要长期协作的智能体用的,相当于给它们装了个“第二大脑”。它用了一套六层记忆框架,还分了快慢两个系统来处理信息,目的是把零散的记忆整理成更有用的经验。官方给的数据是,记忆数量能砍掉 70% 以上,单条记忆的信息密度反而提升了 45% 多。在要处理超长文本的场景下,消耗的 token 能省下 35%,记忆更新速度也快了...

推荐理由:腾讯混元给OpenClaw这类长期协作智能体做了个记忆插件,思路是把记忆分层管理,再用快慢双系统决定什么时候调用什么记忆,目标是少记、记准、省 token。我会先打个折:目前只有官方一篇短文,没有可复现的测试、没提开源协议、也没有第三方对比,所以分数卡在 featured 门槛上。但给出的70%记忆缩减和35% token 节省这两个数,如果实测能复现,对跑长期 agent 的人来说确实挺省钱。

量子位 · 公众号

VAST 拿了近 2 亿美元,首次公开世界模型 Eden 的技术路线

VAST 在 A+ 和 A++ 轮融了近 2 亿美元,同时公布了 Project Eden 世界模型的架构。这套架构把“世界状态怎么变”和“画面怎么渲染”拆开了:先有一个结构化的状态层来推演变化,中间加一层条件接口做翻译,最后再用生成式渲染层出图。正文没披露具体估值、投资方和模型落地时间表,技术细节也只给了三层框架,没有实验数据和验证指标。

推荐理由:VAST拿了近2亿美元A+和A++轮,同时把Project Eden的三层架构亮出来:状态层管世界推演,条件接口层接外部输入,生成式渲染层负责最终画面。这个拆法让世界模型不再是一团黑盒,对做3D和具身智能的人有启发。不过正文没给出任何量化指标、开源时间或实际跑通的场景,所以我会先打个折,不往顶格推。

AI HOT 精选

NVIDIA 发布工厂运营蓝图 FOX,让 AI 智能体接管产线管理

NVIDIA 在台北 GTC 上推出了一个叫 FOX 的工厂运营蓝图,相当于给工厂装了一套能自主管产线的“AI 大脑”。富士康已经用它搭了一个叫 MoMClaw 的多智能体系统,把摄像头、传感器和产线数据喂给多个 AI 智能体,让它们协同干活。官方说,这套系统能把查找产线故障根因的时间缩短 80%,但正文没披露这个数字是在什么规模的产线、什么类型的故障...

推荐理由:英伟达在 GTC 台北丢出一套工厂运营蓝图 FOX,让多个 AI 智能体组团进产线干活。富士康已经拿它搭了 MoMClaw 系统,号称能把找问题根因的时间砍掉 80%。我会先打个折——这是厂商博客放出来的预期数字,不是实测报告,正文也没披露具体产线、样本量和对比基准。但方向本身踩中了现在企业最关心的:智能体能不能真进业务流程降本,所以还是值得看一眼。

AI HOT 精选

NVIDIA 发布 RTX Spark 本地 AI 电脑,1 petaflops 算力跑智能体,llama.cpp 优化让 Qwen 27B 吞吐翻倍

NVIDIA 在 Computex 上发了台叫 RTX Spark 的 Windows 电脑,专门在本地跑 AI 智能体。配置给得挺足:1 petaflops AI 算力、128GB 统一内存,意思是大模型不用来回倒腾显存。安全方面,他们和微软合作搞了个 OpenShell 运行时,用 Windows 新的安全接口把智能体锁在设备本地跑,数据不出机。性...

推荐理由:HKR 三项都踩中了:NVIDIA 把 RTX Spark 定位成本地智能体机器,给了 1 petaflops、128GB 统一内存和 llama.cpp 上 Qwen 27B 吞吐最高 2 倍的硬数字。因为是厂商博客发布,我会先打个折,分数落在 78–84 区间合理。

AI HOT 精选

MiniMax 开源 M3 模型:一个模型搞定编程、100 万 token 上下文和原生多模态

MiniMax 把 M3 模型开源了,权重公开可下载。它把三个能力塞进了一个模型里:编程水平摸到了 GPT-5.5 和 Gemini 3.1 Pro 的边(SWE-Bench Pro 得分 59.0%),能处理 100 万 token 的超长上下文,还原生支持图片和视频输入。长上下文不卡顿的关键是他们自研的 MSA 稀疏注意力机制——在 100 万 t...

推荐理由:MiniMax M3开源了一个把文本、图像、音频塞进同一个模型的一体方案,上下文窗口拉到100万token。最实在的点是MSA注意力机制,每token计算成本降到前代的1/20,长文本推理能省不少钱。编码和Agent跑分看着不错,但正文没给出具体对比对象和测试细节,这点先别太激动。整体是一次有诚意的开源发布,信息量够,但验证还缺一环,所以放在featured而不是P1。

AI HOT 精选

Qwen3.7-Plus:一个能看图、写代码、操作界面的多模态智能体模型

Qwen 发布了 Qwen3.7-Plus,把视觉理解和语言能力塞进同一个模型里,让它能直接看懂屏幕、操作手机 App、根据截图写前端代码,还能在命令行和图形界面之间来回切换干活。在 Terminal Bench 2.0 终端任务上拿了 70.3 分,比 Opus 4.6 Max 和 DeepSeek-V4-Pro Max 都高;在 Deep-Plan...

推荐理由:我会先打个折:正文只给了功能清单,没给任何硬指标。7 类能力听着挺全,聊天、看图、读文档、搜网页、调工具都塞进去了,但没参数、没价格、没上线日期,等于只看了个目录。这点先别太激动。不过 Qwen 这条线每次更新都会牵动国内从业者的注意力,尤其是把多模态和智能体绑在一起推,说明他们想在应用层抢身位。信息虽然薄,但话题本身够热,放在 featured 里提醒大家盯后续是合理的。

AI HOT 精选

MWC26 上海要办人形机器人点球大战,宇树科技等 8 支队伍上场,全程自主、不靠遥控

GSMA 宣布在 2026 年 6 月 24 日至 25 日的 MWC 上海搞一场人形机器人点球比赛,这是全球头一回。8 支国内具身智能团队参加,包括宇树科技、灵心巧手等。规则参照世界杯点球,双方各罚 5 轮,射门和守门的都是机器人,平局后一球定胜负。关键限制是机器人必须自己识别球和守门员位置、决定射门角度并控制发力,不能由人遥控,也不能跑预设脚本。这...

推荐理由:我会先打个折:这是活动预告,不是模型发布或可复现的测试结果,所以分数压在 72–77 之间。但选题本身够抓人,规则里“不许遥控、不许脚本”把门槛拉高了,不再是展台走秀。正文没披露具体评分标准、场地条件和机器人硬件细节,所以别急着当技术里程碑看。如果现场真能稳定自主对抗,那才算数。

5月31日星期日

AI HOT 精选

苹果 WWDC 要拿 Gemini 蒸馏出的小模型跑在 iPhone 上,复杂问题还是会甩给谷歌云

下个月 WWDC 苹果会展示 Siri 和端侧 AI 的升级,核心思路是把谷歌 Gemini 模型“蒸馏”成一个小号版本,直接在 iPhone 芯片上本地跑,主打隐私和省 token 费。但整个技术栈对外依赖很重:本地模型源自 Gemini 蒸馏,手机处理不了的复杂请求会路由到谷歌云,还用了英伟达的机密计算。苹果之前承诺的 Private Cloud ...

推荐理由:这条消息我会先打个折,因为目前只有单一信源,正文没披露模型参数量、延迟、成本或合同细节。但它的信息量对从业者来说很实在:苹果在 WWDC 前被曝出用 Gemini 蒸馏模型救急,本地跑小模型保隐私,重活还是得走 Google 云和 Nvidia 机密计算,等于承认自研大模型没跟上。这个技术栈组合本身就说明苹果在端侧 AI 上选择了外部依赖,跟它一贯的全栈控制路线反差很大,所以给了 82 分,放在 featured 位置。

r/LocalLLaMA

PolyRange:一个防考题泄露、专测 AI 攻击能力的靶场,每次出题都不一样

PolyRange v1.0 把 OWASP 测试指南里的 12 大类、84 种攻击手法做成了动态靶场。它不靠固定题库,而是每次部署时让一个大模型现场生成新靶机和防守策略,分两档难度,最后用“AI 提交攻击结果、裁判机验证”的方式打分。整套环境一条命令就能在 Fly.io 或 Docker 上跑起来。正文没披露具体评测数据和成本,但思路很明确:防止模型...

推荐理由:PolyRange 把网页安全靶场做成了会自己换题的 agent 评测。每次部署由大模型新生成任务,不是死题库,防污染这点做得比较彻底。覆盖 84 个 WSTG 类、12 个 OWASP 类别,两档防御加 flag 判定,规则清楚。信息源单一,目前只有 Reddit 帖子,正文没披露实际跑分数据和 agent 通过率,所以分数先打 78,等有实测结果再往上调。

r/LocalLLaMA

不用改代码,让 OpenAI Codex 桌面客户端接任意模型和供应商

Reddit 用户 thibautrey 分享了一个三步走的方法:编辑 Codex Desktop 的 config.toml 配置文件,存好 API 密钥,再用一个叫 multicodex 的代理别名把 gpt-5.3-codex 这个模型名映射到 MiniMax-Latest。代理跑在本地 127.0.0.1:1455,会把返回的模型名伪装成 gp...

推荐理由:这是一条可复现的开发者操作流,不是官方发布。我会先打个折:正文没披露 MiniMax-Latest 的具体成本和延迟,也没说 proxy 稳定性如何,所以别急着在生产环境照搬。但 hook 很直接——不改代码就能在 Codex 桌面端用别的模型,配置细节也够落地,对想省钱或换模型的人有实际参考价值。