跳到正文

#Agent

今日 41 条

5月28日星期四

Latent Space

Cognition 拿了 10 亿美元,估值冲到 260 亿,预计年底年经常性收入超 10 亿

Cognition 完成了 10 亿美元的 D 轮融资,估值 260 亿美元,比 8 个月前 C 轮时的 100 亿估值涨了 1.5 倍。公司自己预计到年底年经常性收入能超过 10 亿美元,客户里包括 Exa 和 Modal 这类挑剔的企业。正文没披露具体的利润率或成本结构,所以这个收入数字先别直接等同于利润。 这期 AI 新闻还提了几个技术趋势:推...

推荐理由:Cognition 这轮融资信息量很足。我会先打个折:260 亿估值和 10 亿年收入预期都是公司自己说的,正文没披露第三方验证,但即便打个七折也够猛。8 个月估值涨 2.5 倍,说明市场对 AI 编程 agent 这条路的买单意愿很强。对从业者来说,这不是又一家模型公司融到钱,而是一个把模型塞进开发流程干活的产品拿到了大额支票,信号比纯模型融资更实际。

新智元 · 公众号

清华团队开源 PilotDeck:让多个 AI 分工干活,Token 成本砍掉七成

清华 NLP 实验室、面壁智能、OpenBMB 和 AI9stars 一起放出了 PilotDeck 的开源代码。这套系统让多个 AI 子代理分工协作,各自有独立的工作区和可编辑的记忆库,每次任务还会留下调度日志。文章里举了个例子:在小红书内容生成测试里,用 PilotDeck 把成本从 12.58 美元压到了 2.83 美元,相当于省了 77% 的 ...

推荐理由:我会先打个折,标题里“彻底凉了”是流量话术,但正文确实给了硬数据:子 Agent 路由在小红书内容生成场景把成本从 12.58 美元压到 2.83 美元,降幅接近 77%。如果是真的,对跑 Agent 工作流的人来说挺省钱。不过正文没披露这个数字是在什么规模、什么模型上测的,也没说延迟有没有变差,这点先别太激动。整体是个有具体成本锚点的工具发布,不是大模型或平台级动作,所以分数放在 78–84 区间是合理的。

机器之心 · 公众号

ICML 2026:AutoMoT 用大小模型异步分工,在 Bench2Drive 和 nuScenes 上拿了双料第一

这篇文章本身被微信环境验证挡住了,正文内容没抓到,所以下面说的都基于标题和已知信息。AutoMoT 是南洋理工 AutoMan 实验室、哈佛和小米汽车一起搞的端到端驾驶模型,核心思路是把视觉语言模型和驾驶动作拆成两个专家:一个 4B 的 Qwen3-VL 负责看懂场景,一个 1.6B 的动作专家负责输出驾驶指令,而且两个模型是异步推理的,不用互相等。在...

推荐理由:我会先打个折:双 SOTA 听着唬人,但正文没披露 nuScenes 的具体指标,只能看到 Bench2Drive 的数据。亮点在于架构思路——把视觉语言模型和端到端驾驶拆成异步推理,大模型负责想、小模型负责开,不是硬塞进一个模型里。4B 的 Qwen3-VL UE 做决策,1.6B 的 AE 执行,这个组合在算力上挺省。不过论文没提实车验证,纯仿真成绩,这点先别太激动。整体看,对做自动驾驶算法的人有参考价值,但离出圈还差一口气,所以放在 featured 而不是更高一档。

AI HOT 精选

英伟达开源 Polar 框架,不改代码就能让 Codex 跑分涨近 6 倍

英伟达搞了个叫 Polar 的开源框架,专门解决一个实际问题:怎么在不重写 Codex、Claude Code 这些现成代码工具的前提下,用强化学习(GRPO,一种让模型在多步任务里根据奖励信号自己学会更优操作的训练方法)去训练它们。Polar 的做法很取巧,它不碰工具本身的执行逻辑,而是在模型和工具之间的 API 接口上做文章,把对话记录、采样结果这...

推荐理由:英伟达开源 Polar,用 GRPO 训练小模型 Qwen3.5-4B,Codex 在 SWE-Bench Verified 上从 3.8% 冲到 26.4%,这个提升幅度在代码 agent 圈子里很能打。技术细节和基准分都给得清楚,属于扎实的研究开源项,不是大模型或产品发布,所以放在 featured 档、82 分合理。

AI HOT 精选

xAI 把最快的编程模型 Grok Build 0.1 放上 API 公测了

xAI 发布了专门干编程活的模型 grok-build-0.1,现在通过 API 公测。这个模型主要用来做网页开发、修 bug 这类需要模型自己调用工具、跑流程的任务,跟 Grok Build 命令行工具背后是同一个模型。速度标称每秒 100 个 token 以上,价格是输入每百万 token 1 美元、输出每百万 token 2 美元。除了写代码,官...

推荐理由:我会先打个折:这是 0.1 公测版,正文没披露基准测试成绩、上下文窗口大小和具体任务成功率,所以别急着把它当成成熟产品。但亮点很实在——速度标到 100+ tokens/秒,定价也直接亮出来,输入 $1/M、输出 $2/M,对想试编码智能体的团队来说,成本门槛不高。xAI 明显在抢 Cursor/Claude 的开发者心智,这点从定位就能看出来。综合看,信息量够、有价格锚点,但缺验证数据,给 78 分、featured 不 p1 是合理的。

AI HOT 精选

AI 智能体时代的安全:一个终端可能跑着上万个智能体,每个都得有自己的身份

Lemonade 的安全负责人 Jonathan Jaffe 聊了聊当攻防双方都用上 AI 后,安全团队该怎么变。他提到一个终端上可能同时跑着 200 到 10000 个智能体,现在的身份和权限管理系统根本管不过来,必须给每个智能体一个独立身份,并在它执行动作时直接卡控策略。另外,AI 写的代码漏洞虽多,但修得也快,软件反而可能更皮实。安全团队本身也在...

推荐理由:这篇是活动评论,不是产品发布或研究论文,但终端智能体数量和身份管控模型这两个信息点很实在,对正在头疼智能体安全的团队有参考价值,放在 featured 里合适。

AI HOT 精选

Cognition AI 拿了超 10 亿美元,投前估值 260 亿,想把软件工程师效率提 10 倍

Cognition AI 新融了超过 10 亿美元,投前估值 260 亿美元。它的年化收入一年里从 3700 万美元涨到约 4.92 亿美元,涨了十几倍。核心产品 Devin 被定位成能自主干活的初级工程师,不是只补代码,而是能自己规划、测试、部署,走完多步骤流程。公司不绑死一家模型,既用自己的模型,也接 OpenAI 和 Anthropic 的大模型...

推荐理由:这条消息硬数字够多,估值和收入增速都摆在那,Devin 的定位也从“写代码助手”变成了能自己规划、测试、部署的初级工程师,对从业者的冲击感很直接。不过信息源单一,正文没披露具体投资方和估值计算细节,所以没给到行业地震级的高分。

AI HOT 精选

Anthropic 公开了用 Claude Opus 扫代码漏洞的六步流程,扫开源项目找到 1596 个漏洞,修了 97 个

Anthropic 在这篇博客里讲了他们怎么用自家最强的 Claude Opus 模型去扫代码安全漏洞。整个流程分六步:先做威胁建模(搞清楚代码可能被怎么攻击),再把代码放进沙盒隔离运行,接着让模型找漏洞,找到后人工验证是不是误报,然后排优先级,最后出修复方案。他们拿这套流程去扫开源项目,截至 2026 年 5 月 22 日共报出 1596 个漏洞,其...

推荐理由:HKR 三项都站得住:Anthropic 公开了 Claude Opus 做源码安全审计的完整工作流,并附上 1,596/97 的漏洞与修复数据,不是 PR 稿。没给 85 以上是因为这不算新模型或平台级能力发布,更像现有能力的工程化实践报告。

AI HOT 精选

Cognition 拿了 10 亿美元融资,估值冲到 260 亿,自称全球最大独立智能体实验室

Cognition 宣布完成超 10 亿美元融资,估值 260 亿美元,领投方包括 Lux Capital 和 General Catalyst。公司说今年企业用量涨了 10 倍以上,年化收入做到 4.92 亿美元。他们两年前推出的 Devin 定位是第一个 AI 软件工程师,这次还强调自己在编码智能体和代码审查上领先,Peter Thiel 也投了重...

推荐理由:Cognition 这轮拿了超过10亿美元,估值直接干到260亿,年化收入也接近5亿美元,说明编程智能体赛道正在快速商业化。我会先打个折:正文没披露具体投资方和资金用途,估值这么高,后续能不能撑住还得看实际产品落地和竞争。不过“用量一年涨10倍”这个数字如果是真的,确实挺猛,对做开发工具和智能体的同行来说,压力不小。

AI HOT 精选

OpenAI 产品现在能直连你内网的 MCP 服务器了

OpenAI 给 ChatGPT、Codex 和 Responses API 加了个能力:可以走纯出站 HTTPS 去调你团队放在内网的 MCP 服务器。服务器不用暴露到公网,模型这边只往外发请求,不接收入站连接。正文没提延迟和鉴权细节,实际部署前最好先测一下链路稳定性。

推荐理由:我会先打个折:正文没披露权限控制怎么配、收不收费、什么时候全量推,这些缺口让实际落地还有变数。但方向很明确——让模型直接进公司内网干活,而且用仅出站 HTTPS 绕过了安全团队最头疼的入站暴露问题。对正在评估 AI agent 接内部系统的团队来说,这是个值得马上跟进的消息。

AI HOT 精选

Anthropic 发布 AI 智能体零信任安全框架

Anthropic 发了篇博客,讲企业里用自主 AI 智能体(能自己调用工具、读写记忆的模型)该怎么搞安全。核心判断是:前沿模型把漏洞利用的时间从几个月压到了几小时,老一套安全流程跟不上。文章给了一套三层零信任架构,把智能体拆成身份层、工具层和记忆层分别做权限最小化,还列了八个阶段的落地步骤。威胁模型里重点提了提示注入、工具投毒和记忆投毒这三种攻击方式...

推荐理由:Anthropic 这份零信任框架把攻击速度的变化说得很直白——前沿模型能把漏洞利用周期从几个月压到几小时,这个数字本身就是最好的警示。三层架构和八阶段流程让方案有了骨架,提示注入这些威胁也点得实在。我会先打个折:正文没披露具体验证数据或落地案例,目前更像一套设计原则而非实测报告。但安全、智能体、权限这几个话题叠加,对正在推 agent 上线的团队来说,参考价值不低。

彭博科技

Meta 开始对 AI 聊天机器人收订阅费,想靠用户付费来填 AI 投资的坑

Meta 第一次给普通消费者用的 Meta AI 加上了付费订阅。说白了就是他们砸了几千亿美元搞 AI,现在想从用户口袋里直接回收一部分,不再只靠广告。但正文没公布具体价格、什么时候上线、在哪些国家推出,也没说付费版比免费版多了哪些功能。这点先别太激动,等细节出来再看值不值。

推荐理由:Bloomberg 报了 Meta 第一次给 Meta AI 上消费者订阅,目的是给 AI 支出找补。我会先打个折:正文没写价格、什么时候上线、付费功能比免费强在哪,所以现在只能当个方向信号看,别太激动。但方向本身够硬——从纯烧钱到试着收钱,对盯着 AI 变现的人来说值得扫一眼。

AI HOT 精选

Google Pay 更新:让 AI 代理替你跑支付流程,安卓端也能一键结账了

Google Pay 这次更新主要干了两件事:一是把支付系统开放给 AI 代理,二是把安卓和桌面端的结账体验做得更顺滑。先说 AI 这块,他们搞了个通用商业协议(UCP),你现有的商户号和支付后台不用动,就能让 AI 代理直接调用支付能力去完成交易。还发了个 MCP 服务器(公开预览版),相当于给开发用的 AI 助手配了个支付插件,能帮你查集成问题、分...

推荐理由:我会先打个折:正文只列了功能点,没给实际采用规模、定价,也没展示一个真实的 agent 交易案例,所以分数卡在 72–77 这个区间。但 MCP 支付这个方向本身够具体,对 agent 商业化的推动力是实打实的,值得放进 featured。

Hugging Face 博客

ITBench-AA 发布:最前沿的模型在企业 IT 运维任务上得分不到 50%

Artificial Analysis 和 IBM 搞了个新基准 ITBench-AA,专门考模型能不能像真人一样处理企业 IT 的活,第一波先考站点可靠性工程(SRE)任务。结果最厉害的 Claude Opus 4.7 也只拿了 47%,GPT-5.5 是 46%,所有顶尖模型都没过半。这个测试让模型在真实的 Kubernetes 环境里查日志、追依...

推荐理由:HKR-H/R 都成立:前沿模型在企业 IT agent 任务上不到 50% 的准确率,既有反转感又戳中部署焦虑。HKR-K 偏弱,因为正文没给模型名单、样本量和评分机制,信息密度不够,所以重要性卡在 featured 门槛附近。

AI HOT 精选

Anthropic 和 OpenAI 把编程助手从包月套餐改成按量收费,我觉得他们终于找到赚钱的感觉了

Simon Willison 发现,从 2026 年 4 月起,Anthropic 和 OpenAI 悄悄把企业版编程助手(Claude Code/Cowork 和 Codex)的收费方式从固定座位费改成了按 API 调用量计费,跟直接买 token 一个价。他自己一个月用这些工具烧掉的 token 折合 2180 美元,但个人套餐只要 200 美元,...

推荐理由:这篇不是官方公告,是一篇行业评论,但它抓的点很实在:Anthropic 和 OpenAI 在 2026 年 4 月前后把编程智能体的收费从打折卖席位改成按 API 调用量算钱。我会先打个折——正文没给出具体定价数字或客户迁移数据,所以“找到产品市场契合点”更多是作者基于计费模式转向的判断,不是有财报支撑的结论。但这点本身对从业者有用,因为它直接关系到采购和用量评估。整体属于有观点、有信息缺口、但不虚的评论,放在 featured 档位合理。

AI HOT 精选

Google 搜索产品 VP 聊 AI 原生搜索:新模式怎么跑、成本多高、出版商怎么办

Robby Stein 在 Google I/O 上谈了搜索正在从列链接转向直接给答案的 AI 原生模式。AI Mode 会把复杂问题拆成多轮搜索去查,背后跑在 Google 自己的 TPU 上,推理成本不低,但正文没给具体数字。搜索量没降反升,这点他提了但没展开数据。关于答案里引用哪些信息源和链接,有一套选择逻辑,但没细说权重。出版商最关心的流量问题...

推荐理由:这是一篇访谈摘要,不是产品发布,所以我会先打个折。HKR 三个维度都踩中了,但正文没披露具体价格、流量数字或成本数据,判断只能停在“高质量访谈”这个区间。文章把 Google 转向 AI 原生搜索的几个矛盾摆得很清楚:想用多轮对话和 AI Mode 留住用户,又得面对 TPU 成本高和出版商怕被截流的现实。信息够硬,但缺量化验证,所以分数给到 74 是合理的。

5月27日星期三

The Verge · AI

Robinhood 开放接口,允许 AI 代理直接帮你炒股

Robinhood 宣布允许用户创建独立账户,划拨一笔钱后,让 AI 代理(也就是能自主执行任务的模型)直接买卖股票。Robinhood 自己也在风险提示里写得很直白:AI 交易可能导致全部本金亏光。正文没披露这个 AI 代理具体是 Robinhood 自研还是第三方模型,也没说交易策略由谁提供。

推荐理由:Robinhood 这次不是开放行情数据,而是直接让 AI agent 进场下单。用户给 agent 单开账户、注入指定资金,agent 就能自主买卖股票。我会先打个折:正文没披露风控细节、回撤限制、交易频率上限,也没说 agent 跑在什么模型上、能不能接外部信号。所以“赚很多或赔很多”目前更像产品定位,不是实测结论。但这件事本身信号很强——交易权限从人移交到 agent,合规和客诉风险会成倍放大。

AI HOT 精选

Runway 发布 MCP 服务器,让 Claude、ChatGPT 这类助手能直接在对话框里帮你生图和剪视频

Runway 推出了一个 MCP 服务器,相当于给 AI 助手装了个插件,让 Claude、ChatGPT、Cursor 等工具能在聊天窗口里直接调用 Runway 的模型生成图片和视频。你不用再切换软件,给助手扔一个商品链接、一张参考图或一段文字描述,它就能把成品返回到同一个对话框里。这次接入的模型包括 Gen-4.5、Seedance 2.0、GP...

推荐理由:这条消息的钩子很直接——Runway 的视频能力进了程序员和创作者天天用的对话工具。技术上不是模型突破,而是集成方式变了,MCP 服务器当中间人,让多个模型被一个入口调度。对从业者来说,这比单纯发个新模型更贴近实际工作流,所以 HKR 三项都成立。不过正文没提延迟、并发限制和计费方式,实际体验还得观望。整体算一次产品整合更新,重要性给 76 分,放在 featured 里合理。

r/LocalLLaMA

8 个开源模型在 MMO 里挂了 10 天机,放出了 9.3 万条事件日志

Firespawn Studios 在《Null Epoch》第 0 赛季里放了 25 个 AI 智能体,分别跑在 8 个开源模型上,连续运行了 10 天。他们公开了大约 9.3 万条记录的事件数据集,其中约 70% 的动作都附带了模型当时的推理或决策理由。不过,Reddit 原帖的正文内容被网络屏蔽了,目前看不到具体的实验结论和模型表现对比,只能从标...

推荐理由:Firespawn Studios 把 8 个开权重模型丢进 MMO 里当 agent 跑了整整 10 天,攒了 9.3 万条事件数据,这事本身比跑分有意思——因为不是测单次问答,是看模型能不能在持续变化的环境里记住东西、做出连贯决策。我会先打个折:信息来自 Reddit,不是正式论文,实验细节和失败案例正文没展开,所以别当严谨研究来读。但 25 个 agent、8 个模型、10 天的规模,加上数据公开,对想测 agent 长期稳定性和记忆的人是个现成的素材包。

TechCrunch · AI

Robinhood 开始让 AI 代理替你炒股了

Robinhood 给用户开了个口子:你可以创建一个独立账户,连上一个专用钱包,让 AI 代理(也就是能自己干活的小程序)去读你的持仓、分析行情、出策略、推股票。但下单的钱只能从这个钱包里扣,动不了你主账户里的资金。每笔交易都会推通知,有些单子还得你点一下确认才会执行。正文没披露代理的决策模型具体怎么搭、回测表现如何,也没说风控和止损机制。Robinh...

推荐理由:我会先打个折:Robinhood 不是前沿 AI 实验室,所以这条消息的份量更多在产品落地层面。但它的机制设计很实在——代理能看组合、能分析,但动钱时只能碰你专门划拨的那一小块余额,不是整个账户敞开了让它玩。这点先别太激动,正文没披露代理具体用什么模型、分析能力有多深,但光是“代理+真实资金+预存钱包”这个组合,就足够让做 agent 安全的人盯一阵了。

阿里技术 · 公众号

阿里吕若凡聊 Agent Room:让多个 AI 共享上下文和任务账本,从跑流程进化到协作判断

这篇文章讲的是阿里技术专家吕若凡提出的 Agent Room 模型。核心想法是不再让 AI 智能体各干各的,而是把它们放进一个共享上下文、任务账本、记忆和产物的“房间”里协作。文章用两个软件工程案例做了验证,说明这套系统不是简单地把任务分发给不同模型,而是让它们能基于共享信息做出协作判断。不过正文因为微信环境验证问题没能加载出来,具体的技术细节、实验数...

推荐理由:这是一篇方法论文章,不是模型发布或开源框架,但 Agent Room 的机制和两个研发现场让它有干货。HKR 三项都踩中了,我会给到 76 分,放在 featured 里。

量子位 · 公众号

7B小模型在医学影像理解上跑赢o3和GPT-5,靠的是教会模型“看哪里、怎么看”

上海创新研究院的LeapQuest和三所大学搞了两个医学AI系统Ophiuchus和MedScope,核心思路是让模型在看图看视频时学会像医生一样先定位关键区域再分析。Ophiuchus-7B在8个医学视觉问答基准上拿了68.0分,比OpenAI-o3的62.2、Gemini 2.5 Pro的61.8和GPT-5的59.9都高。正文没披露具体参数量以外...

推荐理由:我会先打个折:标题里 GPT-5 目前没公开评测数据,更像噱头,但 7B 模型在医学 VQA 上跑赢 o3 这个事实本身够抓人。正文给了 8 个 benchmark 的平均分对比,信息量撑得起 featured。不是通用大模型发布,分数定在 80 合理。

量子位 · 公众号

卡内基梅隆和马里兰大学让大模型“睡觉”:上下文快满时暂停、压缩记忆再继续推理

这篇论文给大模型设计了一个类似人类睡眠的机制。当模型处理长文本、上下文窗口快塞满时,它会主动停下来,不再接收新 token,而是利用离线时间对已积累的上下文做多轮递归前向计算,把信息压缩成“快速权重”。之后清空 KV 缓存,相当于整理完记忆再醒来继续干活。测试在细胞自动机、多跳图谱检索和 GSM-Infinite 推理任务上跑过,但正文没披露具体的性能...

推荐理由:我会先打个折,因为正文没给出压缩后的基准测试提升、代码或实际部署证据,所以分数停在 76。但“睡觉”这个说法确实把枯燥的上下文压缩讲得让人想点进去看。核心操作是模型在上下文快满时主动暂停,用多轮离线方式把旧信息压紧,然后清掉 KV 缓存腾地方,思路清楚。如果后续有实测数据,比如长文本任务不掉点、显存省了多少,分数还能往上走。这点先别太激动,等看到具体数字再说。

纽约时报中文网

谷歌怎么从 AI 掉队变成领跑的?

两年前谷歌的 AI 还在建议人吃石头、往披萨上抹胶水,现在它的聊天机器人 Gemini 月活用户已经冲到 9 亿,跟 OpenAI 自报的 ChatGPT 用户数打平。谷歌没把 Gemini 当独立产品养,而是直接塞进 Gmail、地图、Google.com 这些每天被几十亿人用的服务里,连苹果 Siri 未来的底层技术也换成了它,等于 Gemini ...

推荐理由:HKR三项全中。文章用逆袭主线把谷歌从掉队拉到能打的位置,钩子够强;9亿用户、770亿广告收入、Siri合作这些数字和信息量扎实,不是空谈;对从业者来说,模型竞争格局和分发渠道的变动直接关系工作判断,相关性高。整体是产业分析而非模型发布,放在78-84分档合理。

机器之心 · 公众号

三星公开 Meki、M2RL 和 LiveClawBench 三项研究,从端侧记忆架构做到物理 AI 评测

三星这次放出了三个项目:Meki 是一种给端侧模型用的记忆架构,让手机或 IoT 设备上的小模型能记住上下文、省着用算力;M2RL 是多领域强化学习框架,想让一个模型在不同任务里都能自己学会干活;LiveClawBench 则是专门测物理 AI 的基准,看模型能不能在真实世界里抓取、操作物体。文章还提到三星已经采购了数万张 GPU 来搭 AI 基础设施...

推荐理由:这是一组三星研究院的技术打包发布,不是旗舰模型或产品上线,但胜在信息具体、方向明确。我会先打个折:正文没披露数万张 GPU 的具体型号和部署时间线,也没说 Meki 在端侧实测的延迟和功耗,所以不能当量产信号看。不过,三星把 Memory 架构、多领域 RL 和灵巧手评测一起端出来,等于公开了自己在 Physical AI 上的三条腿走路策略,对关注端侧和机器人方向的从业者来说,比单篇论文更有参考价值。

AI HOT 精选

面壁智能开源 ForgeTrain,一个完全由 AI 写出来的模型训练框架,零人类代码

面壁智能、清华和 OpenBMB 开源了 ForgeTrain,一个完全由 AI 编写、没有人类代码介入的大模型训练框架。他们用这套框架在华为昇腾芯片上预训练了 MiniCPM5-1B,这个模型在 AA 榜单的 2B 参数以下级别里排到了第一。同时开源的还有制造 ForgeTrain 的 Agent Harness 工具链。正文没披露训练成本、耗时和具...

推荐理由:我会先打个折:这不是一个顶配模型发布,而是一个工具链层面的开源动作,所以给 80 分、放 featured 比较合适。故事的核心是“AI 造 AI”——面壁智能说 ForgeTrain 是全球第一个零人类代码介入的生产级训练框架,并且已经在华为昇腾上跑通了 MiniCPM5-1B 的预训练。对从业者来说,这比单纯刷榜有意思,因为它直接关系到训练流程能不能自动化、能不能省人力。不过正文没披露这套 AI 写的代码质量到底怎么样、训练出来的模型跟人手写的框架比有没有性能差距,这点先别太激动。整体看,H、K、R 三条都踩中了,是个扎实的工具链新闻。

Latent Space

AI 推理基础设施又出百亿美金独角兽:Fireworks 估值 150 亿,Baseten 估值 110 亿,OpenRouter 融了 1.13 亿

这周 AI 圈的钱主要涌向了推理层。Fireworks 正在谈一轮估值 150 亿美元的融资,7 个月内估值涨了 3.75 倍;Baseten 也在以 110 亿美元估值募资,3 个月翻 2.2 倍。这两家都还没正式官宣,数字先别太当真。已经落定的是 OpenRouter 的 1.13 亿美元 C 轮融资,他们 6 个月内周调用量从 5 万亿 toke...

推荐理由:这条消息把三家推理服务商的估值摆在一起看,Fireworks 和 Baseten 还在谈,OpenRouter 已经拿钱且用量涨得很快。我会先打个折,估值数字本身是谈判口径,不代表最终成交价,但能看出资本在往推理层集中砸钱。对从业者来说,这直接关系到未来用谁的 API、成本怎么走,以及这些平台会不会变成新的流量入口。正文没披露具体营收或利润率,所以别急着喊泡沫,但估值确实不低。

AI HOT 精选

Anthropic 在伦敦发布了两项让 Claude 自己动手干活的新功能:自托管沙盒和 MCP 隧道

Anthropic 在 Code w/ Claude 伦敦活动上宣布了两项 Claude 托管代理的新能力。一个是自托管沙盒,公开测试版,让 Claude 能在你自己的安全环境里跑代码、操作浏览器,不用把敏感数据交给第三方;另一个是 MCP 隧道,研究预览版,相当于给 Claude 开了条加密通道,让它能直接连到你本地或私有网络里的工具和数据源。Spo...

推荐理由:Anthropic 官方产品更新,在伦敦活动上发布了 Claude 托管代理的两项具体能力。我会先打个折:这不是新模型发布,而是开发者工具层面的迭代,所以重要性给到 78。自托管沙箱让代理在隔离环境里跑代码,MCP 隧道则打通了本地工具和云端代理的连接,对实际干活的人比刷榜分数更有用。正文没披露沙箱的安全隔离具体到什么程度,这点先别太激动。

TechCrunch · AI

用户不想被硬塞 AI 搜索,DuckDuckGo 安装量涨了 30%

Google 在 2026 I/O 大会上把传统搜索结果页的蓝色链接换成了 AI 代理,直接替用户做决定。用户反弹很快,DuckDuckGo 的 App 安装量跟着涨了 30%,说明不少人开始找别的搜索入口。正文没披露这个 30% 的绝对基数有多大,所以实际规模还不好说。

推荐理由:HKR 三项都踩中了:30% 的安装涨幅是个具体的用户用脚投票信号,直接挂钩 Google AI Search 改版。不过正文没写清楚这个涨幅是多长时间内的、怎么统计的,所以信息有缺口,我会先打个折,放在 featured 里比较合适。

Computing Life · 鸭哥

用好AI的第二步:先写Skill再执行

作者提出一个反直觉但关键的工作习惯:让AI干活前,先把成功标准、踩过的坑和固定工具写成一个Skill文档。因为AI没有记忆,每次新对话都是白纸一张,不把经验外化落盘,它下次还会犯同样的错。文章解释了为什么程序员反而容易掉进“只有代码才能复用”的陷阱,并给出Skill的三个要素:描述最终想要什么而不是微操步骤、只记录AI真正犯过的错、提供确定性的工具调用...

推荐理由:这篇文章没讲新模型或产品能力,也没给实验数据,但“先写 Skill”这个动作把 agent 工作流从一次性尝试变成了可积累的资产,对日常用 Claude Code 或类似工具的人有直接参考价值。三个 Skill 要素讲得清楚,复用方式也具体,所以放在 featured 档。

Computing Life · 鸭哥

用好 AI 的第二步:先写“技能说明书”,再让 AI 干活

作者王咏刚提出一个反直觉的习惯:别上来就让 AI 直接做事,先把怎么做写成一个可复用的“技能文档”。他用 Outlook 收邮件举例,第一次花半小时把用户名、手机端批准、客户端选择这些坑都记下来,下次 AI 读这个文件就能跳过所有陷阱。核心逻辑是,AI 没有记忆,不把经验外化成文档,它就会反复踩同一个坑。程序员容易觉得只有代码才值得复用,但文章指出,研...

推荐理由:这是一篇工作流教程,不是产品或模型发布。技能文档化的机制和 Outlook 示例够实在,能上 featured;但来源权威性一般,所以定在 72 分。

AI HOT 精选

Anthropic 公开了他们在不同产品里给 Claude 上“紧箍咒”的工程实践

Anthropic 工程师分享了在 claude.ai、Claude Code 和 Claude Cowork 三款产品中限制 AI 智能体(agent)破坏力的实战经验。文章指出,随着模型能力变强,能接触的系统越多,一旦出错的“爆炸半径”就越大。他们主要靠两种思路来兜底:一是让人盯着(人在回路),但数据显示用户会点掉约 93% 的权限请求,容易产生“...

推荐理由:Anthropic 这次公开了一套针对 Claude 智能体的具体隔离控制方案,比普通的更新说明更有料。HKR 三项都满足,但这不是模型发布或重大能力升级,所以分数放在 78-84 这个区间。

5月26日星期二

AI HOT 精选

Sundar Pichai 聊 AI 搜索:Google 想把搜索框变成帮你干活的入口

Sundar Pichai 在 Google I/O 后聊了聊公司怎么应对 ChatGPT 的冲击。核心是把 Gemini 模型塞进新的智能搜索框和 Gemini Spark 智能体平台,让搜索从“给你一堆链接”变成“直接帮你启动任务”。他回应了“Google Zero”的担忧——网站从 Google 来的流量可能归零,但没给出具体流量影响数据。另外,...

推荐理由:这篇是 Sundar Pichai 在 I/O 后的访谈,核心就两件事:Gemini 要嵌入搜索框,以及 Spark 这个让模型进业务流程干活的平台。我会先打个折——正文没披露任何模型规模、延迟数据或上线节奏,所以别当产品发布看。但它的价值在于把 Google 对搜索未来的态度摆上台面:AI 直接生成答案会进一步挤压传统网页流量,同时 Spark 又在抢 agent 平台的身位。这点先别太激动,因为没给技术细节,但方向本身对做搜索、做内容和做 agent 的人都有影响。

r/LocalLLaMA

SkillOpt 把 Markdown 技能文件当成可训练参数,用编辑操作来优化

这篇帖子正文被 Reddit 屏蔽了,只能看到标题和摘要。从现有信息看,SkillOpt 的做法是把给模型用的 Markdown 技能说明文件当作可优化的对象,而不是写死就完事。它让一个更强的模型对技能文件提出增、删、改的编辑建议,然后只在留出的验证集上接受那些确实能提升效果的改动。摘要里说,最好的技能文件通常在 1 到 4 次被接受的编辑后就会收敛,...

推荐理由:我会先打个折:目前只看到一个项目源和 Reddit 讨论,没有大规模落地数据,所以分数定在 78、featured 而不是 p1。但 HKR 三项都站得住——把技能文件当可训练参数这个 hook 够新鲜,留出验证集加 1-4 次编辑收敛的机制也讲得清楚,对做 agent 的人来说省手工调 prompt 的钱和时间是实打实的痒点。正文没披露验证集规模和任务多样性,这点先别太激动。

AI HOT 精选

通义千问 Qwen3.7-Max 编程能力排到全球第二,Code Arena 得分 1541,仅次于 Claude

Qwen3.7-Max 在 Code Arena 编程评测上拿了 1541 分,排名第二,只比 Claude 低。官方说它能连续跑 35 小时的任务、单次调用工具超过 1000 次,原本要两周的项目几小时就能搞定。不过正文没披露具体测试环境、任务类型和对比模型的详细分数,实际生产表现还得看后续验证。

推荐理由:这条消息的钩子很清晰,就是“编程第二”这个位置。给出的分数和任务时长是硬指标,虽然都来自阿里云自己的一篇发布,没有第三方交叉验证,但作为产品更新和基准测试的成绩单,信息量够、指向明确。我会先打个折——没有独立评测之前,这个“第二”更多是厂商宣称,但它的确提供了一个可被检验的标靶,值得放进 featured 让从业者自己去盯后续实测。

量子位 · 公众号

面壁智能发布 ForgeTrain 和 MiniCPM5-1B,声称训练框架由 AI 自己编写,训练速度比英伟达 Megatron 快 10%

面壁智能放出了 ForgeTrain 训练框架和 MiniCPM5-1B 模型。ForgeTrain 最抓眼球的地方是,他们说是让 AI 自己写的代码,在同样硬件下比英伟达的 Megatron 训练快 10%。MiniCPM5-1B 是个 10 亿参数的小模型,FP16 权重约 2GB,压缩到 INT4/Q4 后约 0.5GB,主打端侧部署。不过原文因...

推荐理由:面壁智能说 ForgeTrain 是 AI 写的训练框架,同硬件下比英伟达 Megatron 快 10%,还发了 1B 参数的端侧模型 MiniCPM5-1B,FP16 权重约 2GB,压缩到 INT4/Q4 约 0.5GB。我会先打个折——“全球首例 AI 造 AI”这个说法正文没给出第三方复现,10% 的速度提升也没交代测的是什么任务、什么卡、什么 batch size。但即便保守看,一个 AI 生成的训练框架能跑起来还声称更快,本身就有信息量;1B 模型压到 0.5GB 对手机端部署也够直接。分数定在 80,是因为概念够新、数字够具体,但验证...

机器之心 · 公众号

ACL 2026 论文:Spatial-Agent 让大模型不只是调地图 API,而是生成可执行的地理分析流程

这篇 ACL 2026 主会论文提出了 Spatial-Agent,核心思路是在用户用自然语言提问和调用地图工具之间,插入一张“地理流程关系图”(GeoFlow Graph),让大模型先规划出可执行的地理分析步骤,再一步步调用 API。在 MapEval-API 评测集上,搭配 GPT-4o-mini 的 Spatial-Agent 准确率达到 45....

推荐理由:ACL 主会论文,机制和数字都拿得出手,H 和 K 能过。但 GIS 工作流这件事本身圈子小,缺了成本、安全或平台竞争这些能出圈的点,R 就够不着,放在 featured 刚好。

机器之心 · 公众号

xAI 解散但 Grok 没停,马斯克预告新模型

马斯克说,1.5 万亿参数的 Grok V9-Medium 已经训完了,过几天开始做强化学习,计划两到三周后发布。Grok Build 现在支持同时跑 8 个子代理,上下文窗口拉到 25.6 万 token,还加了计划模式、竞技场模式、MCP 和 ACP。不过正文因为微信环境验证失败,具体技术细节和评测数据都没披露,这些功能实际效果怎么样还得等实测。

推荐理由:这条消息的钩子在于 xAI 解散的传闻和 Grok 上新同时出现,戏剧性够。马斯克亲自预告 1.5T 参数的 Grok V9-Medium,还给了两到三周的发布窗口,对盯着模型竞赛的人是个明确的信号。Grok Build 那边放出的 8 个子智能体、256K 上下文、Plan Mode 和 Arena Mode,说明他们在把智能体往实际业务流程里塞,不是只发个 API 就完事。我会先打个折:模型刚训完还没进强化学习,没跑分没对比,性能完全未知,这点先别太激动。但整体信息密度和时效性都够,放在 featured 里合理,给 82 分。

机器之心 · 公众号

面壁开源 MiniCPM5-1B 和训练框架 ForgeTrain,框架代码是 AI 自己写的,1B 模型跑分 17.9

面壁智能放出了两个东西:一个叫 MiniCPM5-1B 的端侧小模型,和一个叫 ForgeTrain 的训练框架。1B 模型在 AA-Index 上拿了 17.9 分,这个分数说明小体量也能有不错的综合能力。更特别的是 ForgeTrain,它的训练代码不是人写的,是让 AI 自动生成的,跑出来的结果跟英伟达的 Megatron 框架对得上,而且在 H...

推荐理由:HKR 三项都踩中了:AI 写训练框架这个钩子够新鲜,不是又一个千篇一律的模型发布;AA-Index 17.9 分和比 Megatron 快 10% 的 H100 数据让信息有骨头;话题又落在开源小模型和端侧部署上,读者会想点开看。不过它毕竟不是旗舰模型发布,所以分数放在 78 这个区间是合适的。

新智元 · 公众号

昆仑万维发布天工 Agent,号称性能逼近 Opus 4.6,还给了 2-4 周免费试用

这篇文章本身被微信环境验证挡住了,正文内容没抓到。从标题和现有英文摘要看,昆仑万维发了两个模型:SkyClaw-v1.0 和 SkyClaw-v1.0-lite,主打 Agent 场景,也就是让模型进业务流程干活。他们宣称 SkyClaw-v1.0 的输入成本是 DeepSeek V4 Pro 的 1/24、Sonnet 4.6 的 1/43,这个数字...

推荐理由:这条消息我会先打个折,因为所有性能对比和成本数字都来自厂商自己,没有第三方验证。但它的传播点很清晰:一个国产 Agent 模型宣称能力接近 Claude Opus 4.6,同时把输入价格压到对手的四十分之一,还白送几周试用。对正在被 Token 账单压得喘不过气的团队来说,哪怕只是“声称”,也足够让人点进去看一眼。正文没披露这些基准测试的具体条件和评测机构,所以“逼近 Opus 4.6”先别太激动,但成本对比如果属实,确实挺省钱。