跳到正文

#Agent

今日 36 条

5月5日星期二

Hacker News 首页

Airbyte 给 AI 助手做了个“统一资料库”,查多系统数据能省 90% 的 token

Airbyte 推出了 Airbyte Agents,核心是一个叫 Context Store 的东西。你可以把它理解成一个专门给 AI 助手用的预索引资料库,把 Slack、Salesforce、Zendesk 这些业务系统里的数据提前整理好。这样助手在回答问题时,不用再现场去调几十次 API 拼凑信息。作者举了个例子:一个原本要跑 47 步才能回答...

推荐理由:HKR 三项都站得住:预索引这个角度比市面上又一层 MCP 包装有信息量,给了可复现的 token 节省数字,痛点也打在企业数据接入的成本和可靠性上。Airbyte 不是前沿模型厂,所以留在 featured 低段。正文没披露 Context Store 的索引延迟和更新频率,这点先别太激动。

r/LocalLLaMA

SenseNova-U1-8B-MoT 开源多模态架构引发讨论,去掉 VE 和 VAE 的单体设计是亮点还是噱头?

商汤开源了一个叫 SenseNova-U1-8B-MoT 的 8B 多模态模型,能理解图文也能直接生成图片。它最特别的地方是用了 NEO-Unify 架构,把传统多模态模型里常见的 VE(视觉编码器)和 VAE(变分自编码器)都去掉了,支持图文交错生成和高密度渲染。Reddit 上讨论的焦点是这种单体设计到底能不能带来可复现的性能提升,但帖子正文没给出...

推荐理由:HKR 三项都踩中了:架构钩子够具体,一个 8B 模型把理解和生成揉在一起,还砍掉了 VE/VAE;信息增量有,但缺实测分数和部署成本,所以分数压在 72–77 这个区间。我会先打个折,没看到跑分和许可就别急着全信,但方向值得盯。

r/LocalLLaMA

Hugging Face 发了个交互式指南,横向对比不同框架下的强化学习训练环境

Hugging Face 的后训练团队花了一个月,用 verifiers、OpenEnv、Nemo-Gym、OpenRewards 等几套框架分别搭了强化学习环境,然后实际训模型来看哪种方案在扩展时更顺手。他们把这个过程做成了交互式指南,方便你点进去对比。不过正文没给出具体的基准分数、模型规模或训练成本,所以没法判断哪套方案效果更好或更省钱,目前更像一...

推荐理由:我会先打个折:正文没给具体基准分数、模型规模和训练成本,所以没法判断哪个框架真的更省钱或更稳。但 Hugging Face 花一个月亲自下场踩坑,把不同 RL 环境框架的差异和扩展轴摆出来,对正在搭训练流程的团队有实操参考价值。这点先别太激动,等他们把量化结果补上才算完整。

OpenAI News

OpenAI 把 ChatGPT 默认模型换成了 GPT-5.5 Instant,回答更准、废话更少

OpenAI 把免费用户和默认聊天用的模型升级到了 GPT-5.5 Instant。官方说这次更新主要干了三件事:回答更靠谱、更简洁,并且更能利用你之前聊过的上下文来贴合你的偏好。内部测试里,在医疗、法律、金融这类高风险问题上,GPT-5.5 Instant 比上一代 GPT-5.3 Instant 的幻觉内容少了 52.5%;在用户举报过的事实错误对...

推荐理由:HKR 三项全中:OpenAI 把 ChatGPT 默认模型切到了 GPT-5.5 Instant,说答案更准、幻觉更少、个性化控制更好,但没给任何评测数字、价格或上下文窗口,我会先打个折。这点先别太激动,等看到实测再判断。

MIT Technology Review · AI

一份用 AI 加固民主的蓝图

Andrew Sorota 和 Josh Hendler 提出了一套三层架构,把 AI 塞进知识获取、个人代理和制度运行里,想让它帮民主续命。他们引用了 X 平台上的实地测试:AI 写的事实核查被不同政治立场的人认为比人类写的更有用,不过这篇论文还没经过同行评审,这点先别太激动。文章说,现在大家越来越靠 AI 来了解真相、形成观点,未来的个人 AI 代...

推荐理由:这篇文章没推新产品或新模型,而是搭了一个三层民主基础设施的框架:认知层帮人辨别信息,代理层让 AI 参与协商,制度层把 AI 嵌进治理流程。我会先打个折,因为正文没披露 X 平台事实核查的准确率、误判率这些硬指标,也没说地方协商平台到底覆盖多少用户、效果如何。但框架本身有干货,两个落地案例让讨论没飘在天上,对做 AI 治理和安全的人算一份有用的参考。

r/LocalLLaMA

DeepSeek V4 Pro 在 FoodTruck Bench 上追平 GPT-5.2,晚了十周但成本只要十七分之一

Reddit 上有人发帖说,DeepSeek V4 Pro 在一个叫 FoodTruck Bench 的智能体评测里排到第四,中位数得分跟 GPT-5.2 只差 3%,但跑一轮任务的成本大概是后者的十七分之一。这个评测跑了 30 天,模型要用 34 种工具、带持久记忆、每天还得做反思,比较贴近真实业务流程。帖子还提到小米的 MiMo v2.5 Pro ...

推荐理由:这篇是一个 Reddit 用户自己搭的 benchmark 结果,不是官方发布,所以我会先打个折。但内容本身挺有意思:DeepSeek V4 Pro 在一个叫 FoodTruck Bench 的 30 天 agent 测试里排第 4,跟 GPT-5.2 的中位数只差 3%,API 成本却低了大约 17 倍。测试用了 34 个工具、持久记忆和每日反思,不是简单的一问一答。小米 MiMo v2.5 Pro 也进了前 6,5 次全存活,中位 ROI 1019%,单次跑完只要 $2.41。正文没披露样本量和方差,所以“匹配 GPT-5.2”这个结论先别太激...

机器之心 · 公众号

Agent-World 用近两千个环境训练通用智能体,任务平均超过 15 步

这篇文章的正文被微信环境验证挡住了,看不到具体内容。从已有的英文摘要看,Agent-World 这个工作造了 1978 个环境和 19822 个工具,专门用来训练能处理长流程任务的智能体。它的做法是把网页挖掘、工具生成、可验证的任务合成和 GRPO 训练串在一起,任务平均要跑 15 步以上。核心结论是环境数量、自我进化轮次和 23 个基准测试之间存在规...

推荐理由:我会先打个折:正文没披露训练成本和实际延迟,也没说这 1,978 个环境里有多少是真正开放域、多少是模板生成的,这点先别太激动。但 Agent-World 把环境规模、自进化轮次和基准表现拉通看缩放关系,这个思路比单纯刷榜有用。对做智能体评估和长程任务的人,值得花时间读一下它怎么用 GRPO 把环境生成和智能体训练拧成一个闭环。

机器之心 · 公众号

马斯克 55 万张英伟达 GPU 的集群,实际有效利用率只有 11%

The Information 的报道说,xAI 手里大概 55 万张英伟达 GPU,但模型浮点运算利用率(MFU)只有 11%,折算下来相当于真正在干活的卡就 6 万张左右。文章把锅甩给了 HBM 显存读写、服务器之间通信、训练时空等和软件栈不统一这几个问题。作为对比,Meta 的利用率是 43%,Google 是 46%。不过原文因为微信环境验证失...

推荐理由:这篇不是模型发布或产品更新,是实打实的基础设施效率爆料。55万卡对11%利用率这个对比本身就够抓人,再加上Meta和Google的43%、46%做参照,信息密度高。我会先打个折:正文没披露xAI具体怎么算的MFU,也没说这个11%是瞬时值还是长期均值,但瓶颈拆解(HBM、跨节点通信、软件栈)让文章站得住脚,所以给到82分。

机器之心 · 公众号

Anthropic 联创预测:2028 年底前 AI 自己搞研发的概率超六成

Anthropic 联合创始人 Jack Clark 给了个时间点:到 2028 年底,AI 脱离人类独立做研发的概率超过 60%。他拿几个基准测试当证据——Claude Mythos Preview 在软件工程测试 SWE-Bench 上跑到 93.9%,Opus 4.5 在评估 AI 复现研究能力的 CORE-Bench 上拿到 95.5%。Cla...

推荐理由:我会先打个折:标题里的“自我进化”和“没有人类了”是媒体写法,Clark 原文说的是无人类参与的 AI 研发概率,不是奇点降临。但他作为联创,拿内部模型跑出来的基准分来押 2028 这个时间点,分量不一样。SWE-Bench 93.9% 说明代码修 bug 这类短任务已经很高,CORE-Bench 95.5% 测的是复现论文的工程能力,真正该盯的是 MLE-Bench 和 PostTrainBench——这两个才碰得到长周期、需要自己调参和做后训练的任务,目前正文没给具体分数,这点先别太激动。整体看,他是在用基准曲线推 timeline,不是纯拍脑...

r/LocalLLaMA

本地跑 Qwen 给 Codex 当代码审查员、协作者和挑刺对手的实测

robert896r1 把 Qwen3.6 27B 的 GGUF 量化版放在 Codex 旁边当代码校验器,并放出了一套可复现的评测流程。测试覆盖了 Bartowski 和 Unsloth 两种量化来源、65k 和 128k 上下文窗口,以及 q8 和 f16 的 KV 缓存精度。三个 128k 上下文的配置并列最佳,在这个评测套件里没测出 q8 KV...

推荐理由:我会先打个折:这不是官方发布,是一个个人实测套件,样本量和覆盖面有限。但它的价值不在权威性,而在把 Qwen 塞进一个贴近真实开发的 sidecar eval 里——测的是漏指令、过度实现、UI 判断和长上下文遗漏,不是跑分。三个 128k profile 并列最佳,q8 KV 没翻车,这点对想省显存的人挺实用。正文没披露 Codex 的具体版本和调用方式,也没给错误分布,所以别当严谨 benchmark 用,更适合当一份本地部署的参考起点。

5月4日星期一

Hacker News 首页

Sierra 融资 9.5 亿美元,估值冲到 150 亿,要把 AI 客服做成企业的标配

Sierra 宣布拿到 9.5 亿美元新融资,由 Tiger Global 和 GV 领投,估值超过 150 亿美元。公司账上现金超过 10 亿,目标是把自家 AI 客服平台推成全球标准。Sierra 说现在财富 50 强里超过 40% 在用他们,平台上跑的 AI 客服已经处理了几十亿次对话,从房屋再融资、保险理赔到退货和筹款都有覆盖。他们观察到客户对...

推荐理由:这条消息我会先打个折:钱数很猛,但正文就是个 RSS 片段,没披露投资方、轮次、用途或任何产品指标。真正值得盯的是客户代理这个赛道被推到了 150 亿美元估值,而不是模型能力有什么更新。信息缺口摆在那,所以分数卡在 78–84 这个区间,不往上拔。

FT · 科技

黑石和高盛等出资 15 亿美元,跟 Anthropic 成立合资公司帮华尔街用 AI

FT 这篇报道正文被付费墙挡住了,只能看到标题和摘要。已知信息是:黑石、高盛等机构参与了一个 15 亿美元的合资项目,合作方是 Anthropic。这家合资公司会以咨询形式,帮华尔街机构在投资组合里部署 AI。但正文没披露股权结构、具体产品形态、时间表,也没说 Anthropic 的 Claude 模型会以什么方式嵌入业务流程。15 亿这个数字不小,说...

推荐理由:我会先打个折——正文没披露股权结构、具体产品长什么样、什么时候上线,所以别急着把它当成一个马上能用的东西。但黑石和高盛愿意掏钱组局,说明华尔街开始认真把 AI 塞进自己的业务流程里,不只是买来玩玩。Anthropic 这边也在找除了卖 API 之外的赚钱路子,咨询加投资的模式如果跑通,对纯做模型的同行压力不小。

Import AI

AI 研究即将全自动:Jack Clark 预测 2028 年底前,AI 自己造自己的概率超过六成

Jack Clark 根据公开数据做了一个判断:到 2028 年底,不需要人类插手的 AI 研发有超过 60% 的概率会出现。他主要拿两个指标说事。一个是 SWE-Bench,这个测试看 AI 能不能解决 GitHub 上的真实代码问题,Claude 2 当初得分大概 2%,现在 Claude Mythos Preview 已经干到 93.9%,基本把...

推荐理由:HKR 三项全中。Jack Clark 用 SWE-Bench 和 METR 的数据撑起一个 2028 年全自动 AI 研发的赌注,属于知名人物对 AI 时间线的判断,放在 85–94 分档合适,比模型发布的分量低一点。

r/LocalLLaMA

用 Hermes Agent 和 qwen3.6-35b 在本地跑深度研究,生成了 21 页报告

一位 Reddit 用户用 Hermes Agent 框架搭配 qwen3.6-35b-a3b 的 Q6_K 量化版,在单张 RTX 4060 上跑了 6 轮循环、超过 5 小时,生成了一份 21 页的研究报告。生成速度约每秒 28 个 token。仓库里放了提示词、脚本、中间产物和最终报告。正文没披露报告具体主题和结论质量,也没说这 5 小时里人工干...

推荐理由:HKR 三项都站得住:这是一个带硬件型号、运行时长、生成速度和完整产物的本地 agent 实验。来源是 Reddit 个人分享,传播面有限,所以分数放在 72–77 的 featured 门槛区间,不往上拔。

量子位 · 公众号

DeepSeek-TUI 开源:一个用 Rust 写的终端版 DeepSeek 编程助手,GitHub 上拿了 2.3k 星

这是一个叫 DeepSeek-TUI 的终端工具,你可以把它理解成“DeepSeek 版的 Claude Code”,专门在命令行里帮你写代码、跑命令。项目用 Rust 开发,MIT 协议开源,目前主要对接 DeepSeek V4 模型,支持 100 万 token 的上下文窗口。它有个叫 RLM 的功能,能把大任务拆成最多 16 个 V4 Flash...

推荐理由:我会先打个折:2.3k 星在 GitHub 不算爆款,但标题蹭 Claude Code 的热度很精准,加上 Rust 实现和 MIT 协议,对在意可控性和成本的开发者有吸引力。正文没披露实际延迟和任务完成率,所以性能先别太激动。真正值得盯的是缓存成本——未命中 token 价格是命中的 10 倍,如果是真的,对高频编码场景挺省钱。影响面集中在开发者群体,所以重要性给到 75 是合理的。

新智元 · 公众号

迪士尼员工9天狂调Claude 46万次,Meta一个月烧掉60万亿token

新智元这篇推文本身被微信环境拦截,正文没披露原始数据表,只能从标题和摘要反推。标题说迪士尼内部有个AI使用看板,一名员工在9个工作日内向Claude发起了约46万次调用,平均每天超5万次,频率高到像在跑自动化任务。另一组数字是Meta 30天消耗60万亿token,按公开API价格算大概值90亿美元,但实际内部成本肯定低得多。我会先打个折:token消...

推荐理由:HKR三项都成立:钩子靠两个夸张的用量数字立住,知识部分有仪表盘截图和token折算,痛点踩在企业最关心的Claude成本控制上。分数维持74,因为数据都是二手转述,正文没给原始数据表,我会先打个折。

r/LocalLLaMA

一台 5 年老笔记本跑通 35B 模型:6GB 显存 + CPU 混合推理,插电 23 token/秒

Reddit 用户 abhinand05 在一台 5 年前的华硕 ROG Zephyrus G14 上跑起了 Qwen3.6-35B-A3B 模型。这台笔记本只有 RTX 2060 Max-Q 6GB 显存,搭配 24GB DDR4 内存和 Ryzen 7 处理器。插电时生成速度约 23 token/秒,不插电掉到 10 token/秒出头。能跑起来的...

推荐理由:我会先打个折:这只是单个Reddit用户的跑分,不是官方发布,别当基准看。但它的价值不在权威性,而在把CPU MoE、KV cache量化和ngram推测解码这三样东西组合起来,在6GB显存的旧机器上跑出可用的速度。正文没披露量化精度和功耗细节,这点先别太激动。对想用老设备玩大模型的从业者来说,这篇给了参数和思路,比单纯喊'能跑'有用得多。

5月3日星期日

r/LocalLLaMA

本地模型后端生成基准测试:GLM、Qwen、DeepSeek 函数调用能力对比

AutoBe 发了一个后端代码生成基准,用函数调用来测模型设计数据库和 API 的能力。qwen3.5-35b-a3b 在测试里跟 gpt-5.4 打平,但样本量只有 4 个项目,而且评分工具是自己写的,可能有偏向。一个商场项目跑下来要消耗 2 到 3 亿 token,按 GPT 5.5 的定价算,单模型成本在 1000 到 1500 美元。正文没披露...

推荐理由:我会先打个折:数据来自 Reddit 帖子,只测了 n=4 个项目,评测 harness 还是自己写的,偏差肯定有。但 35B 模型追平 gpt-5.4 这个结论够抓眼球,加上单任务 1000 多美元的成本和笔记本可跑的硬限制,对做本地部署的人有参考价值。正文没披露具体任务类型和评分标准细节,这点先别太激动。

r/LocalLLaMA

开源代理 rosetta-llm 让 Claude Code 能调用任意模型

DataNebula 开源了一个叫 rosetta-llm 的代理,它像一个翻译网关,让 Claude Code 可以跟不同厂商的模型对话。它负责把 Anthropic Messages、OpenAI Chat 和 OpenAI Responses 这三种接口格式互相转换,并且通过 signature 字段把加密的推理过程来回传递,保证多轮对话时不会丢...

推荐理由:这是个 Reddit 开源工具帖,没披露 star 数、实际用量或任何基准测试结果,所以我会先打个折。技术点本身有意思:用 signature 字段回传加密 reasoning,试图保住 thinking block 的保真度,让多轮 agent 的 prompt-cache 不失效——这点如果真跑通了挺省钱。但正文没给出验证数据,也没说支持哪些模型、延迟增加多少,目前只能当个有潜力的工具看,分数停在中等偏上合理。

r/LocalLLaMA

Upskill 开源了一个技能注册表,让 AI 代理动手前先查“说明书”,已收录超 1 万个技能

Autoloops 把 Upskill 做成了开源项目,相当于给 AI 代理配了一本可检索的技能黄页,目前索引了超过 1 万个技能。代理在干活前会先来这里查一下有没有现成的工具或流程可用。搜索靠的是 Postgres 全文检索、1024 维向量匹配,再按收藏数、安装量和反馈做重排序,尽量把靠谱的技能往前排。入库时有专门的对抗性审查,用大模型拦下了几百个...

推荐理由:Autoloops 这个 Upskill 开源项目,本质是给 Agent 配一个可查询的技能黄页,1 万+ 索引量不算大但起步够用。我会先打个折:正文没披露实际检索延迟和重排效果数据,也没说这 1 万+ 技能的质量分布,所以实用性还得看社区后续填充。安全侧的 LLM 对抗审查是个加分项,但拦截几百个技能这个数字本身说明不了漏检率。整体是个方向对、实现也实在的开源工具,Agent 开发者值得关注,但别指望开箱即用。

机器之心 · 公众号

百亿公司 CTO 们集体跳去 Anthropic 当一线工程师

机器之心这篇文章本来想盘点 2025 年 1 月到 2026 年 4 月间,至少六位从 Workday、You.com、Box、Super.com、Adept AI 等公司离职加入 Anthropic 做个人贡献者(IC)的前 CTO,但微信页面被环境异常拦截,正文内容完全看不到。从已有的英文摘要看,核心讨论点不是“为了 AGI 理想”,而是职业杠杆—...

推荐理由:这篇不是产品发布或模型更新,是篇评论,但切入点很巧。它没停留在“为了 AGI 理想”这种公关叙事,而是把重点放在职业杠杆上:当 CTO 不如在 Anthropic 当工程师划算,说明顶级 AI 公司里技术执行者的议价权在涨。我会先打个折,因为正文没给出这些 CTO 具体负责什么、薪资怎么变,但 6 个案例摆在那,趋势信号是清晰的。

新智元 · 公众号

Claude Code 让 Anthropic 两个月收入翻倍,成史上增长最快的 AI 公司

Semi Analysis 的报告说,Anthropic 的年化收入(ARR)已经冲到 440 亿美元,过去 12 个月净增了 350 亿。其中 Claude Code 这个编程助手到 2026 年 2 月,自己就贡献了 25 亿美元的年化收入。推理毛利率也从 38% 涨到了 70% 以上。不过正文因为微信环境异常没抓到具体内容,这些数字背后的客户留存...

推荐理由:我会先打个折——Semi Analysis 的数据不是官方财报,但 440 亿 ARR 和 70% 推理毛利率这两个数如果属实,说明 Anthropic 靠 Claude Code 在企业端收钱的速度比外界想的快得多。文章真正值得盯的不是总盘子有多大,而是三个东西能不能同时成立:企业用量在涨、代码智能体收入在涨、推理毛利也在涨。正文没披露 Claude Code 的客户留存和续费率,这点先别太激动。

新智元 · 公众号

谷歌搞了个“最毒”AI面试官,专测你在压力下怎么跟人合作

谷歌研究院和纽约大学一起做了个叫 Vantage 的 AI 角色扮演系统,专门模拟高压工作场景,看你怎么处理冲突、推进项目。他们找了 188 个 18 到 25 岁的美国人测试,让 AI 扮演难搞的同事或客户,一步步施压,再从对话里抓你的行为打分。打分结果和真人专家的一致性 Kappa 值在 0.45 到 0.64 之间,跟专家之间的互评一致性差不多。...

推荐理由:我会先打个折:这还是个 Google Labs 的实验,样本只有 188 个美国年轻人,正文也说了跨文化能不能用还不知道。但选题确实抓人,用多智能体模拟压力场景来测人的冲突处理和项目管理能力,还给出了和人类评委的一致性数据。这点先别太激动,但值得放进精选让做评估的人看一眼。

量子位 · 公众号

DeepSeek V4 技术报告里漏掉了 Engram,一个能明显拉高长文本记忆分数的查表模块

DeepSeek V4 的技术报告列了一堆新组件,但没提 Engram。这个模块是 DeepSeek 和北大在 1 月开源的,做法是在 Transformer 的第 2 到第 15 层之间插入查表模块。在 27B 规模的测试里,它把 MMLU 拉高了 3.4 分,多查询大海捞针准确率干到了 97.0%。工程上还有个信号:8 台服务器通过 CXL 共享 ...

推荐理由:文章不是 V4 发布本身,而是技术报告缺了 Engram 这件事的分析。有层数范围、基准涨点和内存池损耗数据,信息密度够,但属于评论向,不是一手发布,所以重要性在 78-84 区间合理。

5月2日星期六

r/LocalLLaMA

Semvec:把聊天记录压成固定大小的“语义状态”,上下文再长也不涨 token

一个开发者在 Reddit 上发了个叫 Semvec 的项目,思路是把对话历史从无限增长的文本流换成固定大小的语义向量,每次推理只传这个压缩后的状态。他给出的 48 轮基准测试里,token 用量大概砍掉了 76%,而且第 10 轮和第 10000 轮的输入开销一样大。项目兼容 OpenAI 接口的模型,也接了 MCP、Claude Code、Curs...

推荐理由:这是个 Reddit 自发布项目,数据来自作者自己的基准,没有第三方验证,所以我会先打个折,不当成行业级事件。但它的思路挺省钱的:用固定大小的语义向量替代无限增长的对话历史,token 减少约 76%,而且第 10 轮和第 10000 轮输入量一样,对跑长链 agent 的人有参考价值。HKR 三项都满足,冲突、数字和治理/竞争伦理的神经都碰到了,只是目前没有裁决或产品级变动,所以保持在 featured 而不是更高优先级。

Hacker News 首页

SimplePDF 推出 AI 填表助手,PDF 解析和填写全在浏览器里完成

SimplePDF 发布了一个叫 Copilot 的演示,能让你用聊天的方式填写 PDF 表单。它把 PDF 的解析、渲染和字段识别都放在浏览器本地跑,文件不会上传到服务器。默认接的是 DeepSeek V4 Flash 的代理,也支持你自己带 API 密钥、用云端模型或者接 LM Studio 本地模型。正文说 SimplePDF 现在月活用户超过 ...

推荐理由:HKR 三项都成立:审判式冲突来自“AI 填表但不上传文件”的设定;事实层面给出了 20 万月活、本地解析和蒸馏机制,不是空泛宣传;治理和竞争伦理的神经被触动,因为客户端工具调用绕开了传统 SaaS 的隐私风险。不过目前只是产品演示,没有裁决或平台级发布,所以重要性停在 74 分、featured 档位是合理的。

量子位 · 公众号

苹果官方 App 把 Claude.md 打包进去了,大公司也搞 Vibe Coding?

苹果支持 App 的 5.13 版本在 5 月 1 日上线时,不小心把一个叫 Claude.md 的文件打进了安装包,不到 24 小时就被下架了。这个文件描述了 Juno AI 和人工客服之间怎么通过一个协议层来切换,客户端、AI 助手、人工客服的消息都在同一个流程里处理。正文没披露这个文件到底是怎么跑进正式版本的,但问题核心出在发布审核环节。

推荐理由:HKR 三项都踩中了,但这说到底还是个 App 打包事故,不是模型或平台发布。苹果的体量加上 Claude.md 的细节够得上 featured;正文没披露审查链哪里断了,这点先别太激动。

TechCrunch · AI

Replit 创始人聊 Cursor 收购传闻、跟苹果较劲,以及他为什么不想卖公司

Replit 的 CEO Amjad Masad 在 StrictlyVC 活动上回应了几个尖锐问题。首先是竞争对手 Cursor 被传要以 600 亿美元卖给 SpaceX,他怎么看。Masad 没直接评价这个价格,但明确表示自己不想卖 Replit,更想独立发展。文章还提到 Replit 的收入从 2024 年全年的 280 万美元,猛增到现在年化...

推荐理由:TechCrunch 这篇截出来的部分,核心钩子是 Cursor 的 600 亿美元收购传闻和 Masad 的不卖表态,反差够强。信息增量上,Replit 从 280 万到十亿年化目标的跨度、Cursor 的天价传闻,都是圈内会盯着看的数字。不过正文没展开 Masad 对 Apple 争议和出售意向的完整说法,所以重要性我打个折,放在 72–77 这个区间。

5月1日星期五

r/LocalLLaMA

Reddit 实测 MiMo-V2.5-Pro:开源模型里跑桌游《血染钟楼》最稳的一个

Reddit 用户 cjami 拿小米的 MiMo-V2.5-Pro 在《血染钟楼》里做了自主对局测试。模型扮演好人阵营时胜率 88%,扮演坏人时胜率掉到 48%,说明它更擅长合作推理,搞欺骗和伪装还差点意思。每局平均输出 18.3 万 token,成本 0.99 美元,工具调用出错率只有 0.4%,这个错误率很低,说明模型能稳定按规则调用游戏功能。对...

推荐理由:这条帖子来自 Reddit 个人测试,不是官方模型发布,权威性要打个折。但 HKR 三项都站得住:有具名基准、有胜负率、有 token 消耗和成本对比,还有工具调用错误率,信息量够放进 featured 档。

The Verge · AI

微软在 Word 里塞了个法律 AI 助手,想让律师放心把合同交给它审

微软发布了一个叫 Legal Agent 的 Word 插件,专门帮法律团队审合同。它会按你预设的规则手册(playbook)逐条检查条款,还能直接处理文档里的修订痕迹。这个功能来自微软收购的 Robin AI 团队。不过正文没披露具体定价和推送范围,所以实际用起来贵不贵、什么时候能用上还不清楚。

推荐理由:微软把 AI 塞进 Word 给律师用,不是写泛泛摘要,而是按法律实务流程干活——对照内部 playbook 审条款、处理修订记录。这点比通用 copilot 更具体,但正文没披露价格、上线范围和客户验证,所以先打个折,放在 featured 低段。

新智元 · 公众号

一个开发者用10天婚假做了个AI世界生成器,一句话就能生成会自己运转的小镇

这个叫WorldX的项目,你输入一句话,它大概5分钟就能生成一个完整的AI世界。背后是一套6步地图生成流程,每个世界消耗约3万到18万个token。里面的NPC有自己的两层记忆和双轴情绪,会按Tick循环自主行动。比较有意思的是它用叠加标签加色差定位来做确定性坐标,让角色能真正走到具体位置而不是大概描述。不过正文没披露实际运行时的延迟和稳定性数据,这点...

推荐理由:我会先打个折,这是个独立项目不是大厂发布,所以分数压在75附近。但它的技术披露很实在,地图管线分6步、token消耗范围明确、坐标转换方案有工程参考价值,不是那种只放视频不说原理的展示。对正在折腾 Agent 记忆和世界生成的人,这篇文章能省不少试错时间,所以给 featured 没问题。

新智元 · 公众号

拆解 Claude Code:让它好用的 98.4% 是工程,不是 AI

VILA-Lab 把 Claude Code v2.1.88 的 51.2 万行代码扒了一遍,发现真正跟 AI 决策逻辑相关的部分只占 1.6%。剩下 98.4% 全是确定性的工程基础设施:权限控制、上下文管理、工具路由和错误恢复。核心变化不是把提示词写得更长,而是给模型套上了一套好用的“缰绳”。

推荐理由:这篇不是 Anthropic 官方出品,是 VILA-Lab 的逆向分析,所以权威性我会先打个折。但它给的 51.2 万行源码和 1.6%/98.4% 的拆分很具体,对正在搭 agent 的团队来说,比很多公关稿有用——它把“模型强所以产品强”的叙事拉回到工程现实。正文没披露完整复现步骤,这点先别太激动,但判断方向是准的。

新智元 · 公众号

OpenAI 把 Codex 升级成能直接操控 Mac 的助手,跨应用干活不用人插手

OpenAI 给 Codex 接入了 Slack、Google Workspace 和 Microsoft 365,重点不是帮你补代码,而是让它直接接管电脑操作。测试里 Mike Russell 让 Codex 在 Mac 上跨 Adobe Audition、Photoshop 和 Firefly 完成一套音频剪辑到出图的工作流,全程人只围观,大概 8...

推荐理由:HKR 三条全中。OpenAI Codex 这次不是补代码,是直接上手操作 Mac,集成 Slack、Google Workspace 和 Microsoft 365,等于把 agent 塞进日常办公软件里。Mike Russell 的实测给了具体数字:8 分钟跑完音频修复、Photoshop 封面和 Firefly 视频生成,效果 85—90 分,虽然只有单信源,但 OS-agent 这个方向本身就够重,P1 没毛病。

Latent Space

AI 周报:Codex 开始抢知识工作者的活儿,Claude 盯上了创意工具

OpenAI 把 Codex 从写代码扩展到了文档、幻灯片、表格这类非编程工作,新版本里电脑操作速度提升了 42%,还接入了微软、谷歌、Salesforce 的办公套件。Anthropic 这边,Claude 新增了对 Blender、Adobe 全家桶、Ableton 等创意软件的支持,同时推出了一个代码安全审查工具。另外,英国 AI 安全研究所的报...

推荐理由:OpenAI 把 Codex 从写代码推到了非编码的 GUI 操作上,说 CUA 比之前快 42%,还接进了微软、谷歌和 Salesforce 的办公套件。我会先打个折:正文没披露价格、具体上线范围和可复现细节,所以别急着当省钱结论。真正值得盯的是 GUI agent 产品化这一步,而不是单次模型跑分。

量子位 · 公众号

北大和快手可灵开源 OpenWorldLib,一个框架想统一视频生成、3D、机器人控制和推理

正文因为微信环境异常被拦截了,实际内容没抓到。从现有标题和英文摘要看,北大 DCAI 和快手可灵开源了一个叫 OpenWorldLib 的统一世界模型框架,把视频生成、3D 建模、VLA 机器人控制、多模态推理四类任务塞进一套 Pipeline 里。Pipeline 里分了 Operator、推理、合成、表征和记忆几个模块,支持前向和流式执行。核心看点...

推荐理由:HKR 三项都踩中了:框架覆盖四类任务、模块和推理模式交代得具体、落脚点在降低复现成本。但正文没给基准测试结果、没提实际部署规模或生态接入情况,所以分数先停在 78,别急着往上调。

Hacker News 首页

Pu.sh:一个 400 行 shell 脚本搭起来的编程助手框架

Pu.sh 用大约 400 行 shell 脚本(只靠 sh、curl 和 awk)搭了一个编程助手的运行框架。它支持 Anthropic 和 OpenAI 的接口,内置 7 种工具,有对话上下文自动压缩、断点续跑和管道模式,还配了 90 个不调 API 的测试用例。没有图形界面、流式输出、图片处理、OAuth 登录,也不支持 Windows。

推荐理由:我会先打个折:这就是个 Show HN 的开源小工具,不是模型或平台发布,别当大新闻看。但它上了 HN 首页,而且 400 行能复现的代码本身就说明问题——把 coding-agent 的核心链路(调模型、给工具、压缩上下文、断点续跑)剥到只剩 shell,依赖极简,对想理解 agent 怎么跑、又不想装一堆依赖的人很友好。正文没披露实际任务成功率,所以别急着说它比别的框架强,但作为教学和轻量集成的起点,这个 featured 给得值。

r/LocalLLaMA

Qwen3.6-27B 在单张 RTX 3090 上跑到 21.8 万上下文,工具调用也稳了

一位 Reddit 用户用一张 24GB 显存的 RTX 3090 跑 Qwen3.6-27B(一个 270 亿参数的模型),把上下文窗口推到了约 21.8 万个 token,生成速度在每秒 50 到 66 个 token 之间。之前工具调用时,如果返回结果有 2.5 万个 token 左右就会爆显存,他修了一个叫 Genesis PN12 补丁的锚点...

推荐理由:我会先打个折,这是 Reddit 个人实测,不是官方基准。但信息量够:修了 Genesis PN12 补丁后,25K token 的工具调用不再 OOM,198K 加 vision 能到 51/68 TPS。限制也说清楚了,单提示单卡在 50–60K 附近还有第二个内存断崖,这点先别太激动。对想用消费级显卡跑长上下文 agent 的人来说,这些数字和踩坑记录比论文更有参考价值。

r/LocalLLaMA

RTX 5080 16GB 跑长上下文编程:Qwen3.6-35B-A3B 在 128K 窗口下稳在 30 t/s,刚启动时能到 89 t/s

一位 Reddit 用户用 RTX 5080 16GB 显卡本地跑编程 agent,测了 Qwen3.6-35B-A3B 这个 MoE 模型(总参数 35B,每次激活 3B)。刚加载完上下文时速度有 89 t/s,等上下文塞满到 128K token 后,生成速度还能维持在 30 t/s,而且回复质量没掉。作为对比,同系列的 27B 稠密模型在 128...

推荐理由:HKR 三项都成立:16GB 显卡撑住 128K 上下文 30 t/s 是个很强的钩子,硬件和 CUDA 版本细节都有,还给了稠密模型的惨烈对比。不过这只是 Reddit 单帖测试,没有多源复现,所以 featured 而不是 P1。

NVIDIA 博客

NVIDIA 说 OpenClaw 开源智能体项目 60 天拿了 25 万星,但治理成本才是真问题

NVIDIA 这篇博客主要讲了两件事:一是 Peter Steinberger 做的自托管持久化智能体 OpenClaw 在 GitHub 上火了,到 2026 年 3 月已经攒了 25 万颗星,增速超过了 React。二是 NVIDIA 自己推出了 NemoClaw,用 OpenShell 沙箱和 Nemotron 模型来跑智能体。文章真正想聊的是治...

推荐理由:我会先打个折:这是 NVIDIA 官方博客,立场肯定偏向自家 Nemotron 和 NemoClaw,但文章没回避常驻 Agent 最要命的问题——token 成本暴涨和安全边界。OpenClaw 本身是 Peter Steinberger 做的自托管常驻 Agent,NVIDIA 用 OpenShell 沙箱和 Nemotron 模型给它加了网络、数据访问的默认限制,这个加固思路比单纯吹性能更有信息量。文中给出的推理后 token 增 100 倍、自治 Agent 再增 1000 倍的估算,虽然没披露测算口径,但把成本焦虑直接量化了,对做落地的人...

TechCrunch · AI

谷歌把 Gemini 助手装进了几百万辆车里

谷歌宣布 Gemini 会逐步替换掉车机里原来的 Google Assistant,首批覆盖的是内置谷歌服务的车型。官方说法是能让车载语音对话更自然、更聪明,但正文没披露具体用了哪个版本的 Gemini 模型、哪些功能会先上、什么时候推完,也没提要不要额外收费。这点先别太激动——目前看更像是一次品牌升级和底层模型切换,实际体验能好多少还得等实车评测。

推荐理由:标题说 Gemini 要上车,规模是“数百万辆”,听着挺唬人。但正文基本就是一句话新闻,没给车型、没给时间、没给功能细节,也没说要不要额外收费。我会先打个折:这事方向对,但落地信息太少,现在激动还太早。对从业者来说,知道 Google 在铺车载渠道就够了,具体怎么打、打不打得赢,还得等后续。