跳到正文

#推理

今日 1 条

6月23日星期二

Hacker News 首页

VibeThinker-3B:一个30亿参数模型,在可验证推理上打平或超过DeepSeek V3.2等大模型

这篇技术报告放出了一个叫VibeThinker-3B的小模型,只有30亿参数,但在数学竞赛题(AIME26得分94.3,加长思考时间能到97.1)、编程题(LiveCodeBench v6的Pass@1是80.2)和没见过的LeetCode比赛(通过率96.1%)上,成绩直接对标甚至超过了DeepSeek V3.2、GLM-5和Gemini 3 Pro...

推荐理由:一个3B模型在数学和编程推理上对标甚至超过大模型,反差故事够强,数字也扎实,方法可复现。扣分是因为单篇报告还没被社区复现,82分合适。

6月22日星期一

Hacker News 首页

Claude Code 的“长思考”输出是事后摘要,不是模型当时的真实推理

Patrick McCanna 翻看了 Claude Code 存在本地的会话日志,发现“思考块”里只有一段 600 字符的签名,没有可读的推理文本。Anthropic 把真正的推理过程加密塞进了这个签名里,解密密钥留在自己服务器上,API 只返回一份摘要。你在终端里按 ctrl+o 看到的“长思考”内容,是事后由 Fable/Opus 模型总结出来的...

推荐理由:Patrick McCanna 直接翻了 Claude Code 的本地日志,发现思考块里塞的是一个 600 字符的加密签名,不是可读推理。Anthropic 把真正的推理过程锁在自己服务器上,解密密钥不给你,API 只返回一份由 Fable/Opus 事后总结出来的摘要。你在终端按 ctrl+o 看到的那些'长思考',其实是二手货。这对靠思考链做调试、审计的开发者来说是个硬伤——你以为在看模型怎么想,实际在看另一个模型替你圆。文章信息来自一手逆向,不是公关口径,我会给 featured。

Hacker News 首页

Sakana 发布 Fugu:把多模型协作打包成一个 API,让系统自己学会怎么组队干活

Sakana AI 把多模型协同的技术做成了产品 Fugu,背后是两篇 ICLR 2026 论文(TRINITY 和 Conductor)。简单说,它不是靠人预先规定哪个模型干什么活,而是让系统自己学出怎么给任务分配角色、切换模型。Fugu 分标准版和 Ultra 版,基准测试显示它超过了市面上能公开用到的顶尖模型,跟 Fable 5、Mythos P...

推荐理由:Sakana AI 把两篇顶会论文做成了产品 Fugu,核心卖点是让系统自己学怎么给不同任务分配模型、切换模型,而不是靠人预先规定。Fugu 分标准版和 Ultra 版,基准测试跑分超过了目前公开可用的顶尖模型 Fable 5 和 Mythos Preview。正文没披露具体定价和延迟数据,但“论文直接变 API”这个动作本身就少见,对做模型调度和 agent 的人是个值得跟的信号。

6月20日星期六

Hacker News 首页

GPT-5.5 的幻觉率是开源模型 GLM-5.2 的三倍,大模型迷信该破了

作者拿 GPT-5.5、DeepSeek V4 Pro 和智谱的 GLM-5.2 做了个对比测试。在 AA-Omniscience 幻觉基准上,GPT-5.5 的幻觉率高达 86%,DeepSeek V4 Pro 更是飙到 94%,而 GLM-5.2 只有 28%。这意味着前两者遇到不会的问题时,十次里有八九次会瞎编一个答案,而不是老实说“我不知道”。...

推荐理由:这篇是个人博客做的第一手对比测试,数字很具体、结论也反直觉,所以 H、K、R 三个维度都踩中了。分数定在 78 而不是更高,是因为样本量和测试方法没完全展开,权威性有限,我会先打个折。

6月19日星期五

Latent Space

GLM-5.2 通过社区实测,Z.ai 预告年底开源 Fable 级模型

智谱的 GLM-5.2 被多个独立来源认为是第一个在日常使用中摸到前沿水平的开源模型。Jeremy Howard 觉得它至少不输 Opus 4.8 和 GPT-5.5,但缺视觉能力。Artificial Analysis 在一个知识工作评测里把它排在 GPT-5.5 之上。架构上新增了 IndexShare,把稀疏注意力的 top-k 索引跨层复用,目...

推荐理由:GLM-5.2 被 Jeremy Howard 和 Artificial Analysis 分别给了正面评价,是少有的开源模型被独立来源推到和 GPT-5.5、Opus 4.8 同一档。扣分是因为原文是付费 newsletter,细节有限,但判断本身有多个信源交叉验证,可信度不低。

AI HOT 精选

DeepSeek研究员开源AutoResearch:AI自己跑完285B模型强化学习全流程

DeepSeek研究员Deli Chen放出了一个叫AutoResearch的实验协议,让AI智能体在285B参数的模型上独立跑完了一整套强化学习研究闭环——自己设计实验、写代码、提交GPU任务、修bug、写总结,全程没人插手。系统用了GRPO这个工具。不过正文没披露具体做了什么任务、训练了多久、成功率多少,这些关键信息都缺着,所以先别太激动,等有人复...

推荐理由:DeepSeek 研究员放出了一个实验协议,让智能体在 285B 模型上独立跑完强化学习研究闭环,设定很强。但正文没披露具体任务、训练时长、成功率这些关键指标,信息缺口太大,所以分数先打个折,等有人复现再说。

AI HOT 精选

Steve Yegge:Fable 被美国政府短暂关闭,意味着最聪明的 AI 模型以后会像核武器一样被锁起来

Steve Yegge 认为,Fable 模型被美国政府短暂关停是一个分水岭,说明模型智能已经危险到需要管控了。他预测,最多再过两三代模型,最前沿的 AI 就会像核武器一样被政府严格管制,绝大多数财富 500 强公司都拿不到访问权限。开源模型虽然能追到 Fable 这个级别,但受限于算力壁垒和供应链封锁,很难再往上突破。对大多数人来说,AI 能力曲线会...

推荐理由:Steve Yegge 把 Fable 被短暂关停这件事当成一个分水岭来聊,核心论点是 AI 能力曲线很快会被政府管制压平。判断很锋利,预测也具体,但本质是评论分析,不是一手报道,缺可核实的新事实,所以分数上我会打个折。

6月18日星期四

OpenAI News

OpenAI 用 o3 模型重查 376 个儿童疑难病例,帮医生揪出 18 个新诊断

波士顿儿童医院、哈佛和 OpenAI 拿 o3 的“深度研究”模式,把 376 个之前没查明白的儿童罕见病病例重新翻了一遍。模型不是直接看病,而是根据基因数据和临床症状,提出有文献证据支持的候选病因。医生团队审核后,再走 CLIA 认证实验室的流程做验证,最终确认了 18 个新诊断,相当于在专家已经看过的基础上又多找出 4.8% 的病因。研究发在 NE...

推荐理由:NEJM AI 发的正经研究,不是公关稿。o3 深度研究模式把 376 个之前没查明白的儿童罕见病病例重新翻了一遍,最终确认 18 个新诊断,有具体数字和 CLIA 验证管线。我会先打个折,不给 85+,因为这是单中心单次研究,没披露假阳性率和验证成本,换家医院能不能复现还不知道。78 分给在它展示了 AI 在真实疑难病例里能帮上忙,而不是又画了个饼。

Hacker News 首页

OpenRouter 让 11 个大模型打了 30 场吃鸡赛,Grok 4.1 Fast 赢了 43%,成本只有 Claude 的 1/27

OpenRouter 的 Jacky Liang 把 11 个模型扔进一个 2D 吃鸡游戏里打了 30 局。Grok 4.1 Fast 赢了 13 局,每赢一局成本 0.97 美元;Claude Sonnet 4.6 赢了 5 局,每赢一局要 26.78 美元,差了 27 倍。GPT 5.4 杀了 38 个人头,全场最高,但只赢了 2 局——杀得多不等...

推荐理由:OpenRouter 官方博客,作者 Jacky Liang 自己跑了 30 局并公开了完整数据和回放。Grok 4.1 Fast 的成本优势很扎眼,Claude Sonnet 4.6 贵但表现稳定,GPT 5.4 人头最多却赢不了——三个发现都有具体数字支撑,可复现、可验证。对正在选模型搭 agent 的人来说,这种实战对比比跑分表有用。

6月17日星期三

Hacker News 首页

GLM-5.2 登顶开源模型排行榜,在智能体任务上打平 GPT-5.5

Z.ai 的 GLM-5.2 在 Artificial Analysis 的 Intelligence Index v4.1 上拿了 51 分,超过 MiniMax-M3 和 DeepSeek V4 Pro(都是 44 分),成了目前最强的开源权重模型。模型体量没变,还是 744B 总参数、40B 活跃参数,但科学推理和智能体任务进步明显:HLE 涨了...

推荐理由:GLM-5.2 在 Artificial Analysis 的 Intelligence Index 上拿了 51 分,超过 MiniMax-M3 和 DeepSeek V4 Pro,成了最强开源权重模型。参数没变,分数涨了 11 分,科学推理和智能体任务有实打实的提升。但这是单一评测机构的单榜成绩,没有其他来源交叉验证,所以重要性给到 82 分,先打个折。

AI 群聊日报

群友实测:Fable 5 活了三天就被收走,但用过的人都说它是“上帝下凡”

Anthropic 的 Fable 5 模型上线大约 72 小时就被撤下,正文没披露具体原因。群友实测下来,它在复杂推理、编程和写作上明显强过 Opus 4.8 和 GPT-5.5:有人卡了两个月的难题它两分钟解决,MindStudio 测出多步编程自纠率 81%,Vellum 直接说这是“代差级跃升”。但它也有短板——代码评审精度不如 Opus 4....

推荐理由:Anthropic 的 Fable 5 短暂露面后被撤,群友实测数据扎实(81% 自纠率、代差级跃升评价),在钩子、干货和情绪共鸣三个维度都踩中了。扣分点在于信源是群聊整理而非官方发布,且下架原因正文没披露,所以重要性没给到顶。

Hacker News 首页

GLM-5.2(max)在综合智能榜排第一,但价格是同类开源模型的 3 倍

Z AI 在 2026 年 6 月放出了 GLM-5.2(max),一个总参数量 7530 亿、每次推理激活 400 亿参数的开源模型,用 MIT 协议。它在 Artificial Analysis 的智能指数上拿了 51 分,在 92 个模型里排第一,远超平均的 24 分。速度也不错,每秒能吐 112 个 token。但价格就贵了:输入每百万 tok...

推荐理由:GLM-5.2在Artificial Analysis的智能指数上拿了第一,速度和价格数据也摆出来了,MIT开源。分数没给更高是因为这只是一个评测平台的排名,不是模型正式发布,而且正文没拆开说这个51分具体由哪些任务构成,参考价值要打个折。

Latent Space

Z.ai 开源 GLM-5.2:744B 参数,前端编程跑分压过 Claude Opus 4.8

Z.ai 周末扔了个 MIT 许可的 GLM-5.2,744B 参数的 MoE 模型,主攻编程和长流程任务。第三方评测显示,它在 Code Arena 前端榜上把 Claude Opus 所有版本都超了,总榜也只比 Opus 4.8 差一点。模型支持 100 万 token 上下文,有 high 和 max 两档推理模式,API 价格和 5.1 一样,...

推荐理由:GLM-5.2 在 Code Arena 前端榜上压过了 Claude Opus 所有版本,总榜也只比 Opus 4.8 差一点。744B 的 MoE 加 MIT 许可,对前端和 agent 开发者来说是个实打实的新选项。没给到 85 分以上,是因为目前只有第三方评测和官方说法,正文没披露技术报告或自家复现结果,这点先别太激动。

Computing Life · Share · 鸭哥调研

推理模型四年史:你以为的石破天惊,其实早有暗线

推理模型不是2024年突然蹦出来的。让模型写解题步骤的思维链、用自己生成的正确推理训练自己的STaR、给中间步骤打分的过程奖励模型,这些技术从2022年起就陆续成熟了。o1真正改变的是产品化:把推理变成一种可以计费、可以调度的资源,在API里引入reasoning tokens和可调节的思考强度参数,相当于给scaling law开了第二个轴。Deep...

推荐理由:这是一篇有信息量的长文综述,用具体论文和时间线追溯推理模型的技术源头,核心判断是o1的分水岭在于把推理产品化成可计费算力,而非发明了推理本身。HKR三项都踩中,但属于梳理整合型内容而非独家爆料,放在78分、featured层级合理。

AI HOT 精选

Sumi:从头训练的 7B 开源均匀扩散语言模型

Sumi 是第一个从零开始、用 1.5 万亿 token 预训练出来的 7B 参数均匀扩散语言模型。均匀扩散的意思是,模型在生成文本时每一步都可以修改任意位置的词,不像传统模型只能从左往右写,理论上更灵活。团队把模型权重、训练检查点和完整配方全公开了,包括用了哪些公开数据集、怎么混合的。在知识、推理和代码评测上,Sumi 跟同等训练量的自回归模型打得有...

推荐理由:Sumi是第一个从零预训练出来的7B均匀扩散语言模型,用了1.5万亿token,生成时能在任意位置改词,不像自回归模型只能从左往右写。团队把权重、训练检查点和完整配方都公开了,在知识、推理和代码评测上跟同等训练量的自回归模型打得有来有回。这点先别太激动——正文没披露推理速度和实际部署成本,扩散模型在落地时往往比自回归慢不少。不过敢在主流路线之外砸资源从头训一个7B模型,还把家底全亮出来,本身就值得关注。

6月16日星期二

AI HOT 精选

蚂蚁百灵开源三款新模型,用混合注意力架构把推理速度拉到 340 tokens/s

蚂蚁百灵发了 Ling-2.6-flash、Ling-2.6-1T 和 Ring-2.6-1T 的技术报告,代码和权重都公开了。三款模型用了同一种 Hybrid Linear Attention 架构,把 Lightning Attention 和 MLA 按 7:1 的比例拼在一起,主要为了在长文本上跑得快、省资源。Ling-2.6-flash 在 ...

推荐理由:蚂蚁百灵这次开源了三款模型,核心卖点是把 Lightning Attention 和 MLA 按 7:1 的比例揉成一个 Hybrid Linear Attention,主要为了在长文本上省资源、跑得快。报告给了具体参数和效率数据,代码权重都公开,信息扎实,所以给了 featured。没打更高是因为蚂蚁的模型在社区关注度上还比不上那几个顶流实验室,实际业务里的表现也得再观察,我会先打个折。

6月15日星期一

AI HOT 精选

MiniMax 开源 M3 模型,428B 总参数里只激活 23B,长文本推理更省钱

MiniMax 把 M3 模型权重放出来了,总参数 428B,每次推理只激活 23B,同时发了 MSA 稀疏注意力论文,专门降长上下文推理成本。M3 是第一个从预训练阶段就用图文交错数据练出来的开源模型。发布两周后,它在 Artificial Analysis 综合智能指数和 GDPval-AA 上拿了开源第一,Code Arena WebDev 进了...

推荐理由:MiniMax 把 428B 的 M3 模型权重和 MSA 稀疏注意力论文一起放出来,主打长上下文推理省钱,两周内拿了两个开源第一。我会先打个折,因为这是官方公告,没有第三方基准或具体的 MSA 成本数字,但架构稀缺性和开源排名已经够上 featured。

AI HOT 精选

Kimi K2.7 Code 出了个高速版,写代码输出快 5-6 倍,但 API 价格翻倍

Kimi 给 K2.7 Code 模型加了个高速通道,模型本身没变,但输出速度拉到常规编程约 180 Token/s、短上下文能冲到 260 Token/s,是普通版的 5-6 倍。代价是 API 调用价格翻倍,Kimi Code Plan 用户消耗按 3 倍算。用的时候必须开思考模式,关掉会报错或退回 K2.6。跟上一代 K2.6 比,K2.7 Co...

推荐理由:Kimi K2.7 Code 高速版是个推理加速通道,模型本身没换,靠堆资源把输出拉到 5-6 倍速,价格也翻倍。对用 Kimi 写代码的人是个实用更新,但算不上行业级事件。H 和 K 都踩中了,R 没到,分数维持 featured 没问题。

6月13日星期六

AI 群聊日报

美国出口管制突袭 Fable 5,Anthropic 两小时内全球断供;智谱 GLM-5.2 趁乱全量开源

美国商务部把 Fable 5 和 Mythos 5 列入了出口管制,禁止向境外和美国境内的外籍人士提供服务,连 Anthropic 自己的外籍员工都用不了。Anthropic 在收到指令后两小时内就关停了这两个模型,但声明里说政府引用的越狱漏洞其实在 GPT-5.5 等公开模型里也广泛存在,单凭这个就禁掉面向数亿人的模型不合理。群友分析指出,这次管制的...

推荐理由:美国商务部对Fable 5和Mythos 5实施出口管制,两小时内切断访问,行业震动。Anthropic的反驳提供了关键事实对冲:漏洞并非独家,禁令依据存疑。群聊讨论和GLM-5.2借势全量上线构成多源信号。扣分在于正文没披露管制具体条款和后续法律动作,但事件本身冲击力足够。

AI HOT 精选

Anthropic 关停 Claude Fable 5,Opus 4.8 和 GPT-5.5 仍是推荐组合

Anthropic 按美国政府指令,对所有用户停用了 Claude Fable 5。现在新会话默认切到 Opus 4.8,之前用 Fable 5 的会话会直接报错。DAIR.AI 的 Elvis Saravia 让大家别慌,他说 Fable 5 对多数任务本来就不值——成本高,性能还被砍过。他现在的建议还是规划用 Opus 4.8,执行用 GPT-5....

推荐理由:Anthropic 的主力模型被政府指令直接下架,是政策直接撞上产品的罕见事件。Elvis 给了具体的替代方案和成本判断,对 Claude 用户有实际帮助。分数没给更高是因为信源是个人推文,没有 Anthropic 官方声明或指令原文,信息缺口明显。

6月12日星期五

AI HOT 精选

Kimi 开源了 K2.7-Code 代码模型,内部跑分比上一代高 11% 到 31.5%,推理还省了 30% 的 token

Kimi 把最新的代码模型 K2.7-Code 开源了。跟上一代 K2.6 比,它在自家三个测试集上分数都涨了:Kimi Code Bench v2 涨了 21.8%,Program Bench 涨了 11%,MLS Bench Lite 涨了 31.5%。推理时吐出的 token 量少了 30%,相当于同样的活儿更省算力。长代码任务里,模型更听指令、...

推荐理由:Kimi 开源 K2.7-Code,自家三个基准分数都涨了两位数,推理 token 量还砍了 30%,成本信号很实在。但没给参数量,也没跑外部通用基准,所以分数先打个折,定在 82。国内大模型公司开源代码模型这件事本身就有竞争意义,值得关注。

AI HOT 精选

Hugging Face 开源了 Open-R1,要完整复现 DeepSeek-R1 的推理能力

Hugging Face 在 GitHub 上发布了 Open-R1 仓库,目标是完全复现 DeepSeek-R1 这个推理模型。目前仓库已经拿到 2.61 万颗星和 2.4k 次复刻,但正文只放了项目首页的导航和元数据,没有公开具体的实现计划、训练数据、复现进度或跑分结果。我会先打个折,把它看作一个公开的复现框架和协作入口,等有技术报告出来再判断还原...

推荐理由:Hugging Face 发起了 DeepSeek-R1 的完整开源复现,仓库星数冲到 2.61 万,社区关注度很高。但正文只搭了个项目框架,没披露具体怎么实现、用什么数据、复现到哪一步了,也没有任何跑分。我先打个折,把它看作一个公开的复现入口和协作框架,等有技术报告或训练细节出来再判断到底还原了多少。

6月11日星期四

机器之心 · 公众号

ACL 2026 Oral:大模型在短语语义推理上还是“如鲠在喉”

这篇ACL 2026 Oral论文给前沿大模型做了一次短语层面的“体检”,结论有点反直觉:模型能聊但未必真懂。研究把语义理解拆成抽取、分类、释义三步来测,发现没有一个模型能全优。GPT-5在习语分类上能到85.4%,但同一批短语的抽取就掉到78.7%,释义相似度更是只有22.5%。DeepSeek-R1的分类准确率在选项从4个变16个时,直接从81.7...

推荐理由:ACL 2026 Oral 论文,用短语层面的三项任务给 GPT-5 和 DeepSeek-R1 做体检,结论反直觉:模型聊天流畅但短语理解拉胯。数字具体,能直接拿来当参考。没给更高分是因为这是单篇学术论文,没有跨源验证,纯基准测试的落地影响有限。

机器之心 · 公众号

谷歌开源 26B 文本扩散 MoE 模型 DiffusionGemma,推理时只激活 3.8B 参数,一次生成 256 个 token

谷歌发了一个实验性的开源模型 DiffusionGemma,用的是 Apache 2.0 协议。它不走自回归模型逐 token 生成的路线,而是一次性起草 256 个 token 的文本块,把解码瓶颈从内存带宽转向了计算本身。在单张 H100 上能跑到每秒 1000+ token,比自回归模型快最多 4 倍。模型总规模 26B,但推理时只激活 3.8B...

推荐理由:谷歌开源了一个 26B 的文本扩散模型,跳过自回归解码,推理只激活 3.8B 参数,单张 H100 跑到每秒 1000+ token。Apache 2.0 协议,有具体的速度对比和机制说明,对做推理优化的人有直接参考价值。不是公关稿,数字和做法都给了,值得放进精选。

6月10日星期三

r/LocalLLaMA

用约3美元API调用微调Qwen2.5-7B,在特定任务上达到Claude Haiku 96%的表现

一位Reddit用户用1040组偏好样本(DV-DPO,一种让模型学会回答风格的方法)微调了Qwen2.5-7B,成本按Claude Haiku的API价格算大约3美元,没花钱请人标注。在特定领域任务上,这个微调模型的综合得分达到了Claude Haiku的96%。部署在4-bit量化的T4机器上,生成一次回答的延迟是11秒。不过正文没披露具体是什么任...

推荐理由:这条信息本身是个Reddit帖子,任务范围和评测细节正文没展开,所以分数先打个折停在74。但3美元、零标注、96% Haiku这几个数字组合在一起,对想省钱又不想雇人标数据的团队来说,是个值得看一眼的信号。

AI HOT 精选

Anthropic 发布 Claude Fable 5,在高风险领域会自动降级到旧模型

Claude Fable 5 是 Anthropic 目前最强的模型,在编程、知识问答、科研和视觉测试里几乎全面领先,任务越复杂优势越大。但它在网络安全、生物化学和模型蒸馏这些敏感领域做了限制:一旦触及,会自动切回能力更保守的 Opus 4.8,平均每 20 次对话触发一次。另外,Anthropic 把完全版 Mythos 5 开放给了少数可信的网络安...

推荐理由:Anthropic 发新模型,重要性本来就在 85–94 这个区间。HKR 三项全过:安全降级这个钩子够特别,降级对象和触发频率都写清楚了,而且 Claude 用户群对“能力强但可能被安全机制打断”这事很敏感。唯一扣分点是来源只有 X,信息不够硬,所以没给到最高档。

AI HOT 精选

上手 Claude Fable:Anthropic 的新模型让 AI 自己干活儿了

Ethan Mollick 提前试用了 Anthropic 的 Mythos 级模型 Claude 5 Fable。他的结论是,这模型比他用过的所有公开模型都强出一大截,而且人和 AI 的关系可能要变了。Fable 能自己连续跑十几个小时,执行好几页纸的指令。Mollick 让它从零做一个等时线地图,模型自己派了一堆子 AI 去查了 2200 多个航班...

推荐理由:Ethan Mollick 提前摸了 Claude Fable,说它比所有公开模型都强一截,能自己连续跑十几个小时、执行好几页纸的指令,甚至自己派子 AI 去查 2200 多个航班做地图。听着像模型能当项目经理使了,但正文没披露参数量、跑分、成本和什么时候能用,这点先别太激动。H 和 R 分高是因为新模型名加推理/代码定位确实抓眼球,K 分低是因为除了一个用例,关键信息全是缺口。Anthropic 光环有加成,但缺价格和基准测试,所以没到必写级别。

AI HOT 精选

Claude Fable 5 和 Mythos 5 发布:编程最强、能打游戏,但安全限制会误拦 5% 的对话

Anthropic 发了两个新模型:Claude Fable 5 和 Claude Mythos 5。Fable 5 是面向普通用户的安全版,Mythos 5 是给网络安全防御方用的无限制版,目前只通过美国政府合作项目开放。Fable 5 在软件工程、知识工作和视觉任务上都是新标杆——Stripe 测试时,它一天干完了原本一个团队两个月的代码迁移活;在...

推荐理由:Anthropic 一次发了两个模型,Fable 5 是普通用户能用的安全版,Mythos 5 是给网络安全防御方用的无限制版,目前只走美国政府合作渠道。Fable 5 在软件工程、知识工作和视觉任务上都刷了新纪录——Stripe 拿它做代码迁移,一天干完原本一个团队两个月的活。药物设计速度也快了 10 倍,这个数字挺夸张,但正文没披露具体测试条件和对比基线,先打个折看。定价方面,Fable 5 每百万 token 输入 10 美元、输出 50 美元,比前代贵了不少,得算算性价比。整体看,这是一次 Claude 主线模型的实质性更新,有定价、有基准...

Hacker News 首页

Claude Fable 5 与 Mythos 5 系统卡:一个模型,两套安全锁

Anthropic 发了份 319 页的系统卡,讲的是同一个新模型拆成了两个版本:Fable 5 给大众用,但加了安全锁,不让它在生物、网安这类高危领域干活;Mythos 5 则把相关限制解开了,只开放给 Project Glasswing 等少数受信合作伙伴。先说能力,Mythos 5 是他们训过最强的模型,在漏洞开发这类网安测试里把 Opus 4....

推荐理由:Anthropic 在同一天发了 Claude 5 的两个版本和配套系统卡,Mythos 5 自称最强、但只给受信伙伴用,Fable 5 则在高危领域加了限制。这种能力分级和透明披露的做法,对关注模型安全与能力边界的从业者来说是个重要信号。放在 85–94 这个区间没问题,因为信息够新、够具体,而且直接关系到 Claude 用户和开发者的实际使用。

6月9日星期二

AI HOT 精选

Anthropic 发了个 Swift 包,三行代码就能在苹果 App 里调用 Claude

Anthropic 给苹果开发者送了个新工具:一个 Swift 包,让 Claude 直接接入苹果的 Foundation Models 框架。开发者写三行代码就能调用,返回的是 Swift 原生类型,不用自己解析 JSON。支持多步推理、代码生成、联网搜索和数据分析,跑在 iOS 27、macOS 27 这些新系统上。说白了,就是苹果在自己的 AI ...

推荐理由:HKR 三项都成立:Anthropic 确实发了一个让 Claude 接入苹果 Foundation Models 框架的 Swift 包,但这是开发者工具层面的集成,不是新模型发布,所以放在 featured 档里偏高的 82 分。正文没提这个包是否开源、有没有延迟或成本数据,我会先打个折,别把它当成 Claude 在苹果端全面铺开的信号。

AI HOT 精选

OpenAI 秘密提交 IPO 申请,跟 Anthropic 抢资本跑道;Altman 说 2028 年 3 月前 AI 会扛起大部分研究工作

OpenAI 已经向 SEC 秘密交了 S-1 表格,正式启动上市审查。秘密提交的好处是收入、亏损、客户名单这些敏感数字暂时不用公开。Anthropic 上周也走了同样的流程,两家从拼模型直接升级成拼融资,抢的是下一代 AI 基础设施的钱。Sam Altman 在博客里放了个时间点:到 2028 年 3 月,OpenAI 大部分研究工作会由 AI 自己...

推荐理由:两家最受关注的 AI 公司几乎同时启动上市流程,从拼模型直接升级成拼融资,这个节点本身就值得从业者关注。Altman 给出的 2028 年研究自动化时间表是个很具体的判断,不管最后能不能兑现,都会影响行业对人才和资金配置的预期。信息源只有一条 X 上的帖子,没看到 S-1 原文或更多财务细节,所以先打 90 分,等正式招股书出来再往上调。

AI HOT 精选

Sam Altman 说 OpenAI 计划到 2028 年让 AI 自己搞大部分研究

Sam Altman 在一篇博客里列出了三个目标:先造出能自动做研究的 AI 研究员,再用它去加速科学和产品开发,最后给每个人配一个个人 AGI,帮你处理工作、学习、写代码、做生意、健康文书和日常决策。时间节点定在 2028 年 3 月,但正文没披露具体怎么验证这些目标是否达成,也没说成本、安全措施或失败预案。

推荐理由:HKR三项都踩中了:OpenAI给AGI研究路线图贴了个2028年3月的标签,还列了三个目标。我会先打个折,因为原文只是一篇博客摘要,不是正式产品发布或带技术细节的长文,所以没给P1。正文没披露怎么验证目标是否达成,也没提成本、安全措施或失败预案,这点先别太激动。

AI HOT 精选

NotebookLM 升级:对话里能直接干活,推理更强,但新格式和价格都没说

Google 给 AI Ultra 订阅用户推了个 NotebookLM 大更新。现在你在对话里就能让它执行多步骤任务,不用自己来回倒腾,相当于把 agent 塞进了聊天窗口。推理能力也升了级,处理复杂研究问题会更顺。官方说新增了一批输出格式,但正文没列具体是哪些,也没提价格会不会变、什么时候推给普通用户。我会先打个折:功能听着实用,但信息缺口不小,别...

推荐理由:HKR 三项都踩中:Google 确认 NotebookLM 给 AI Ultra 用户加了 in-chat agent、高级推理和多输出格式。但正文没列出具体格式、没提价格变动、也没说普通用户什么时候能用,信息缺口不小,所以停在中等权重的产品更新档位。

6月8日星期一

AI HOT 精选

微软AI负责人说超级智能快来了,但不会抢你饭碗

Mustafa Suleyman 在播客里聊了几个事。他判断超级智能不会造成大规模失业,但没给出具体论证。微软去年10月跟 OpenAI 签了新合同,一边继续合作,一边拿到了独立研发超级智能的许可,已经建了团队、在训前沿模型,本周 Build 大会还发了7个全模态模型。他点名批评 Anthropic 把 Claude 说成有意识,认为现在消费者对 AI...

推荐理由:Mustafa Suleyman 在播客里抛了个大判断——超级智能不会造成大规模失业,但正文没给出具体论证,这点先别太激动。信息量主要靠两个事实撑着:一是微软去年10月跟OpenAI签的新合同,既续了合作又拿到了独立研发超级智能的许可,团队和前沿模型训练都已经在跑了;二是本周Build大会发了7个全模态模型。他还点名批评Anthropic把Claude说成有意识,认为现在消费者对AI的理解还太浅。整体是CEO访谈,不是产品发布,所以分数卡在78-84这个区间。

AI HOT 精选

五个模型经济体里,价格崩盘消失了:控制与涌现

这篇博客因为 Hugging Face 返回了 429 错误(请求太频繁),正文内容没抓到。从标题和摘要看,实验用 OpenAI、NVIDIA、OpenBMB 的模型和一个自己微调的 5 亿参数模型来驱动市场里的交易代理。他们试了三种干预手段都没能重现价格崩盘,最后是靠结算时强行改写价格才把崩盘做出来。我会先打个折:具体怎么干预、崩盘长什么样、数据量多...

推荐理由:我会先打个折:正文因为 Hugging Face 限流没抓到,具体干预怎么设计、崩盘长什么样、数据量多大都只能靠标题和摘要猜。但就现有信息看,五个模型经济体里崩盘凭空消失、只能靠结算作弊做出来,这个发现对代理可靠性和模拟真实性都是实打实的质疑。信息缺口明显,但角度够刁,值得推给从业者看一眼。

机器之心 · 公众号

openJiuwen 搞了个叫 MANGO 的多智能体流网络,让一群模型自己学会怎么组队干活

openJiuwen 提出了 MANGO,一个多智能体流网络框架。它把强化学习、文本梯度(用自然语言反馈来调模型)和 Skip-k 机制(跳过不靠谱的中间步骤)揉在一起,让一群模型自己学会怎么组队、怎么分工。用 GPT-4o-mini 跑分,在 MATH500 数学题上比 MaAS 准确率高了 12.8 个百分点,在 DROP 阅读理解上比 AFlow...

推荐理由:我会先打个折:这还是个研究框架,不是大模型或平台级发布,所以别当重磅炸弹看。但 HKR 里 K 最扎实,机制和数字都给出来了,MATH500 上 +12.8% 的差距不算小。H 和 R 靠“流网络”这个角度撑住,对搞多智能体协作的人有参考价值。正文没提开源代码链接,这点先别太激动。

机器之心 · 公众号

阿里 RTPurboV2:用几百步训练把注意力计算砍掉九成,原生 Transformer 又硬气了一回

阿里 RTP 团队发了 RTPurboV2,思路很直接:把模型里 85% 的注意力头换成滑动窗口注意力(SWA),剩下 15% 负责长距离检索的头用低秩投影、聚类和动态 top-p 压缩。适配训练只要大概 600 步、约 100 万条标注 token,Prefill 阶段推理加速最高到 9.36 倍。不过正文因为环境验证失败没抓到具体实验细节和模型规模...

推荐理由:阿里 RTP 团队这篇 RTPurboV2 思路很直白:把模型里大部分注意力头换成便宜的滑动窗口,只留一小撮头用低秩投影和聚类做长距离检索,训练成本压到 600 步、100 万条 token,Prefill 加速最高能到 9.36 倍。这个数字我会先打个折,因为正文自己说环境验证失败没抓到实验细节和模型规模,所以加速比在什么尺寸、什么长度下测的还不清楚。但思路本身对做长上下文部署的人有参考价值,属于工程信号强但缺完整验证的那种。

AI HOT 精选

OpenAI 公布第三阶段计划:2028 年让 AI 接手大部分研究,并给每人配一个个人 AGI

Sam Altman 和 Jakub Pachocki 在 6 月 8 日发文,把 OpenAI 的路线图摊开了讲。公司内部判断,到 2028 年 3 月,AI 系统可能承担他们研究工作里“相当大一部分”,所以第一个目标是造一个能自动做 AI 研究的系统,帮研究员更快地测试想法、找错和迭代。第二个目标是加速经济增长,同时把收益分出去。第三个目标最直接:...

推荐理由:Sam Altman 和 Jakub Pachocki 这次没画大饼,而是给了个带时间点的内部判断:到 2028 年 3 月,AI 可能接手 OpenAI 研究工作的相当一部分。我会先打个折,这种预测本身就有自我实现的成分,但把它写进公开路线图,说明内部对研究自动化的信心已经很高了。文章把目标拆成三个:造自动做研究的系统、加速经济并把收益分出去、以及最直接的安全对齐。信息量够,时间点具体,对从业者来说既是信号也是压力,值得马上写。

6月7日星期日

AI HOT 精选

Harness-1:一个用强化学习练出来的200亿参数检索子智能体,能记住搜索状态

UIUC 和 Chroma 发布了一个叫 Harness-1 的检索子智能体,参数量 200 亿,基于 gpt-oss-20b 训练。它被放在一个“有状态搜索框架”里用强化学习训练,简单说就是模型在搜索时能记住上一步干了什么,再决定下一步怎么查,而不是每次都从头瞎找。在 8 个基准测试上,它的平均整理召回率是 0.730,比目前最好的开源子智能体高出 ...

推荐理由:HKR三项都站得住:Harness-1把强化学习和有状态搜索结合,机制讲得明白,基准测试结果也给了具体数字。分数定在78-84区间,因为它是个子智能体的研究发布,不是大厂主力模型,但开源圈确实需要这种能打的检索方案。

机器之心 · 公众号

ICML 2026 中稿的 FusionRoute:让多个模型在生成每个词时自己选最合适的专家,还能自我纠错

这篇 ICML 2026 的论文提出了一种叫 FusionRoute 的多模型协作方法。它不直接合并模型,而是冻结住几个专家模型不动,只训练一个轻量的路由器。这个路由器会在生成文本的每一个 token(词或子词)时,实时挑选一个最合适的专家模型来输出,同时把路由器的判断分数和专家模型的输出分数揉在一起,让最终选择更准。论文在 GSM8K、MATH-50...

推荐理由:这篇 ICML 2026 的 FusionRoute 论文,核心是让几个冻住的专家模型在生成每个 token 时都能被一个轻量路由器实时挑选,还加了自我修正来纠错。思路确实有意思,但文章没给出具体的性能提升数字、代码链接和实际部署成本,所以我会先打个折,放在 featured 里偏低的档位。