跳到正文

#推理

今日 1 条

7月10日星期五

Computing Life · Share · 鸭哥调研

别再往大模型窗口里塞几百万字了:用 RLM 像跑代码一样查 Context

Alex Zhang 提出的递归大语言模型(RLM)换了个思路处理长文本:不把资料塞进模型窗口,而是留在外部当数据,让模型自己写代码去查。在 depth=1 配置下,RLM 带着 GPT-5-mini 把 OOLONG-Pairs 的 F1 从 0.04% 拉到了 58.0%,BrowseComp-Plus 准确率从 0% 拉到 91.3%。但我会先打...

推荐理由:Alex Zhang 的 RLM 把长文本处理从“全塞进窗口”改成“当外部数据查”,用 GPT-5-mini 在 depth=1 时把两个硬骨头基准的分数从几乎为零拉到 58.0% 和 91.3%,效果摆在那。作者自己先打了折,说多层递归会失败,这种不吹牛的态度反而让人更信。分数卡在 78 是因为目前只绑定了 GPT-5-mini,换别的模型行不行还没验证,而且方法本身还在早期,先别太激动。

7月9日星期四

Hacker News 首页

Meta 发布 Muse Spark 1.1:一个能自己用工具、写代码、管多步骤任务的多模态推理模型

Meta 超级智能实验室推出了 Muse Spark 1.1,相比上一代在工具调用、电脑操作和写代码上提升明显。这个模型能直接上手没见过的工具和 MCP 服务器(一种让模型调用外部服务的协议),不需要额外训练。它支持 100 万 token 的上下文窗口,能记住之前干过什么,还会主动压缩记忆,只保留关键步骤。做复杂任务时,它可以自己当主控,把活拆给并行...

推荐理由:Meta 超级智能实验室把 Muse Spark 1.1 推出来了,工具调用、电脑操作和写代码都比上一代强,最抓人的是它不用额外训练就能上手没见过的工具和 MCP 服务器,还带 100 万 token 上下文和主动记忆压缩。正文没给基准对比和定价,所以分数先压一压,但 agent 开发者肯定会拿它跑测试,开源也让验证门槛变低。

Computing Life · Share · 鸭哥调研

GPT-5.5 的推理卡在 516 个 token:模型“想”的那一层会单独坏掉

开发者 vguptaa45 审计了 39 万条 Codex 响应,发现 GPT-5.5 在 44% 的编程任务里,推理部分刚好在 516 个 token 处截断,而 GPT-5.4 是 19.8%,GPT-5.2 只有 0.34%。被截断的任务全部答错,同一道题如果完整跑完 6000 到 8000 个 token 则全对。社区复现后,在 prompt ...

推荐理由:开发者 vguptaa45 翻查了 39 万条 Codex 回复,发现 GPT-5.5 在 44% 的编程任务里,推理部分会精准地在第 516 个 token 处断掉,断掉的题全错,而同一道题让它完整跑完 6000 到 8000 个 token 就全对。对比 GPT-5.4 的 19.8% 和 GPT-5.2 的 0.34%,这个 bug 像是新版本引入的。社区复现后找到了临时绕过的方法,对日常靠它写代码的人有直接参考价值。没给更高分是因为这更像一个具体版本的质量缺陷,影响面暂时局限在 Codex 的推理环节,正文没披露 OpenAI 是否已确认或修复。

AI HOT 精选

Anthropic 秘密提交 IPO 申请,三季度利润预计超 10 亿美元

SemiAnalysis 的报告说,Anthropic 今年第三季度利润会超过 10 亿美元,并且在 6 月 1 日已经秘密交了上市申请。它和 OpenAI 两家现在的年度经常性收入加起来快 1000 亿美元了。Anthropic 能跑在前面,主要靠 Claude Code 在开发者里用得特别猛,帮它在企业生意上赚到了钱,成了 B2B 市场的领跑者。O...

推荐理由:SemiAnalysis 这篇爆料给出了硬数字和明确的时间节点,可信度不低,但正文没披露 S-1 细节,所以重要性先打个小折。Anthropic 靠 Claude Code 在企业端跑通赚钱,比 OpenAI 先一步秘密交表,这件事对行业排序有直接影响,值得放在头条。

Hacker News 首页

SpaceXAI 发布 Grok 4.5,主打编程和自动化任务,用更少的输出 token 解决问题

Grok 4.5 是 SpaceXAI 目前最强的模型,专门为写代码、让模型进业务流程干活和知识类工作优化。在 SWE Bench Pro 这类编程基准测试里,它的解决率是 64.7%,虽然比 Fable 和 GPT 5.5 低,但有个很实在的优点:平均每次任务只输出约 1.6 万个 token,比 Opus 4.8 少了 4.2 倍,意味着推理成本更...

推荐理由:SpaceXAI 推出 Grok 4.5,定位是写代码和让模型进业务流程干活,跟 Cursor 联合训练算是个实在的差异化。SWE Bench Pro 上 64.7% 的解决率没超过 Fable 和 GPT 5.5,这点先别太激动,但它的省钱优势很具体:平均每次任务输出约 1.6 万个 token,比 Opus 4.8 少了 4.2 倍,意味着推理成本低不少。正文没披露定价和延迟,这两个才是决定它能不能打的关键。

7月8日星期三

Latent Space

Lilian Weng 用 35 篇论文讲清一件事:让 AI 自我进化的关键在外挂程序,不在模型本身

Lilian Weng 发了一篇长综述,把 AI 的递归自我改进(RSI)重新聚焦到“外挂程序层”(harness),而不是直接去改模型权重。她翻了 35 篇论文,拆解了目前被验证过的外挂设计趋势,重点提到了 ACE 和 Meta-Harnesses 这类让外挂程序自己优化自己的方法。她的核心判断是:就算未来很多外挂能力会被内化进模型里,“设定目标和上...

推荐理由:Lilian Weng 发了一篇 35 篇论文的综述,核心观点是把递归自我改进的重心从模型权重挪到外挂程序层。她管这叫“外挂工程”,重点讲了 ACE 和 Meta-Harnesses 这类让外挂自己优化自己的设计。我会先打个折:这是个人博客综述,不是正式论文,但判断本身有论文支撑,对做 agent 和推理的人有实操参考价值。

AI HOT 精选

Claude 团队公开两种多智能体用法:一个当顾问省钱,一个当指挥冲高分

Claude 开发者分享了他们内部高频使用的两种多智能体模式。第一种叫 Advisor,让便宜的 Sonnet 5 干活,遇到难题时通过工具调用去问贵的 Fable 5。在 SWE-bench Pro 测试上,这套组合拿了 84% 的分数,花了 1.40 美元;对比纯用 Fable 5 是 91.5% 但花 2.25 美元,相当于用 92% 的性能省了...

推荐理由:Anthropic 开发者分享了两种多智能体模式,Advisor 模式有 SWE-bench Pro 跑分和成本对比,用 92% 的性能省了 38% 的钱,对做 agent 的团队直接有用。分数没给更高是因为这只是个人分享,不是官方发布,而且 Orchestrator 模式缺基准测试数字。

AI HOT 精选

蚂蚁周俊:万亿模型跑15分钟烧掉一辆特斯拉,他们用“Token密度”把长文本成本从指数压到线性

蚂蚁集团副总裁周俊在AICon上算了一笔账:万亿参数模型每跑15分钟,算力成本就抵得上一辆特斯拉。团队不再拼Token数量,转而提高“Token密度”。他们用7份Lightning Attention加1份MLA搭了一套混合线性注意力架构,把256K长上下文的计算开销从指数级拉回到线性级,省下的算力可以留给推理环节。Kpop算法会把工具调用和自然语言的...

推荐理由:周俊在AICon上的演讲不是画饼,而是算了一笔实打实的成本账,并给出了一个具体的架构方案来降本。那个“15分钟一辆特斯拉”的比喻让成本问题变得很直观,混合线性注意力的设计也有干货。但这是演讲复盘,不是产品发布或开源,没有真实场景的验证数据,所以分数卡在featured门槛上,不往上拔了。

AI HOT 精选

OpenAI 发布 GPT-Live:能同时听和说的全双工语音模型,今天开始推给 ChatGPT 用户

OpenAI 推出了新一代语音模型 GPT-Live,最大的变化是“全双工”——它能一边听你说话一边回话,不用等你闭嘴再开口。聊天时它会用“嗯”、“对”这类语气词表示在听,也能在你思考时安静等着。遇到需要上网搜资料或复杂推理的问题,GPT-Live 会把活儿派给后台的 GPT-5.5 去干,自己继续跟你聊,等结果回来再接上话。这次发了两个版本:GPT-...

推荐理由:OpenAI 官方发布下一代语音模型,全双工架构加异步调用 GPT-5.5 是实打实的产品升级,不是小修小补。发了两个版本说明在部署上有分层策略。正文摘要没给完整技术细节和实测数据,所以分数没拉满,但重要性和话题度已经足够高。

AI HOT 精选

Liquid AI 开源 Antidoom:用“最终 Token 偏好优化”修掉推理模型的死循环毛病

推理模型有时会卡在“死循环”里,反复输出无意义的 token 直到把上下文窗口塞满。Liquid AI 开源了 Antidoom,用最终 Token 偏好优化(FTPO,一种教模型在推理结束时学会停下来的训练方法)来解决这个问题。他们在 DeepSeek V4 Pro 上试了,用 1,040 组偏好样本训练后,死循环率从 3.2% 降到了 0.3%,而...

推荐理由:Liquid AI 开源了一个修推理模型死循环的实用方法,在 DeepSeek V4 Pro 上把死循环率从 3.2% 压到 0.3%,数字扎实。没给更高分是因为目前只有一篇博客,没有论文或第三方验证,单源信息到这个分数已经不错了。

Hacker News 首页

Liquid AI 用“末位偏好优化”把推理模型的死循环率从 10.2% 压到 1.4%

Liquid AI 针对小参数推理模型在解难题时容易陷入“死循环”(反复输出同一段话直到窗口耗尽)的问题,搞了个叫 Antidoom 的方法。它不调全局参数,而是精准定位到循环开始的第一个 token,用“末位偏好优化”(FTPO)教模型在那个位置选一个更合理的词,其他地方基本不动。在 LFM2.5-2.6B 的一个早期版本上,硬核数学和编程题的死循环...

推荐理由:Liquid AI 给 LFM2.5-2.6B 早期版本做了个轻量修复:先找出死循环的第一个 token,再用偏好样本教模型在那个位置选个更合理的词。想法聪明,改动也小,但验证只在一个 2.6B 的早期检查点上,没有跨模型或更大规模的对比,效果能泛化多少还不好说。如果是真的,对跑小模型做推理任务的人挺省钱,但这点先别太激动。

7月7日星期二

AI HOT 精选

推理成本趋近于零,数据库系统该怎么变?

伯克利 BAIR 实验室发了一篇研究路线图,核心判断是:当模型推理便宜到几乎免费,数据库系统会面临三重变化。第一是“为 Agent 服务的系统”:一个用户请求可能让 Agent 自动发出上千条 SQL 查询,但其中 80% 到 90% 的子查询是重复的,系统可以通过复用结果或返回近似答案来提速。第二是“由 Agent 组成的系统”:当成千上万个 Age...

推荐理由:伯克利 BAIR 这篇路线图不是空谈趋势,而是带着硬数字和三层框架来的。核心洞察是推理成本趋零后,数据库系统得为 Agent 重做一遍,80% 到 90% 的重复子查询这个数据让工程师能直接估算优化空间。文章把“为 Agent 服务、由 Agent 组成、被 Agent 使用”拆得干净,读起来像一份给同行看的工程笔记,不是公关稿。

Product Hunt · AI

美团发布 LongCat-2.0:1.6 万亿参数 MoE 模型,MIT 开源,全程用自研 AI 芯片训练

美团在 Product Hunt 上线了 LongCat-2.0,一个总参数 1.6 万亿的 MoE 模型,每次推理激活约 480 亿参数,上下文窗口 100 万 token。模型用 MIT 协议开源,训练没碰英伟达 GPU,全跑在美团自己的 AI 专用芯片集群上。技术亮点是 LongCat 稀疏注意力机制,能省计算量;后期专门针对写代码和让模型进业务...

推荐理由:我会先打个折:正文没给任何评测基准分,也没说自研芯片的具体性能和训练成本,所以“强不强”现在没法判断。但亮点很明确——1.6万亿参数、100万token窗口、纯国产芯片训练、MIT开源,这几个要素凑在一起,在国内是第一次。LongCat稀疏注意力如果能实打实省计算量,对长文本和代码场景会有用。后期训练专门针对写代码和业务部署,说明美团不是放个玩具出来,是想让模型真进生产环境干活。如果是真的,训练成本可能比用英伟达低一截,这点先别太激动,等更多数据出来再看。

AI HOT 精选

给模型看模糊图反而更烧钱:OpenRouter 实测图像清晰度与成本倒挂

OpenRouter 拿五款模型在 MMMU-Pro Vision 上跑了一遍,发现给推理模型喂低清图(detail: low)经常既费钱又拉胯。gpt-5.5 用低清图准确率从 79% 掉到 65.2%,但每题成本反而从 4.5 美分涨到 5.1 美分——因为模型看不清,被迫多想了 1.6 倍的推理 token,输出端多花的钱直接吞掉了省下的输入成本...

推荐理由:OpenRouter 拿五款模型在 MMMU-Pro Vision 上跑了一遍,发现给推理模型喂低清图经常既费钱又拉胯。gpt-5.5 用低清图准确率从 79% 掉到 65.2%,但每题成本反而从 4.5 美分涨到 5.1 美分——因为模型看不清,被迫多想了 1.6 倍的推理 token,输出端多花的钱直接吞掉了省下的输入成本。Gemini 2.5 Pro 也一样,低清下准确率掉 5 个百分点,成本涨 15%。文章还给了 Gemini 2.5 Flash 的对比,低清下成本确实降了,但准确率也崩了,说明非推理模型可能适用不同策略。我会先打个折:测试...

Hacker News 首页

Anthropic 在 Claude 内部发现了一个“全局工作空间”,模型用它做无声推理

Anthropic 用一种叫 J-lens(雅可比透镜)的方法,在 Claude 内部找到了一组特殊的神经活动模式,命名为 J-space。每个模式对应一个词,但亮起来不代表模型要说这个词,而是它在“想”这个词。J-space 有四个关键特征:Claude 能报告自己在想什么;能按指令调整想法;做多步推理时,中间步骤会在这里亮起,哪怕没说出来;这些表征...

推荐理由:Anthropic 这篇论文用雅可比透镜在 Claude 内部挖出一个叫 J-space 的全局工作空间,四个特征都做了实验验证,是把认知科学概念落地到具体模型里的一次硬核尝试。HKR 全中。没给 95 以上是因为它还是研究论文,不是产品发布,实际影响有待观察。

7月6日星期一

Hacker News 首页

回归均值:大语言模型与新事物的无声消亡

这篇文章抛出一个挺冷的观察:大语言模型骨子里是个“求平均”的机器,它给你的永远是已有文本里最可能出现的那个续写,而不是真相。你给它一个它没见过的新词,它会当成错别字纠正你;你提一个离经叛道的观点,它会用“多数来源认为”把棱角磨平,把共识包装成事实还给你。更深的隐患在于反馈循环——我们把模型吐出的平均答案又当成新问题喂回去,一轮轮下来,思想的方差就漏光了...

推荐理由:一篇冷静到有点残酷的哲学随笔,把大模型重新定义为“求平均的机器”——它输出的是统计上最可能的续写,不是真相。新词被当错别字纠正,异见被磨平,反馈循环再把方差漏光。没给85分是因为它本质是个人观察,没有实验或数据支撑,但观点本身足够锋利,能让人重新审视自己每天在用的工具。

7月5日星期日

AI HOT 精选

美团 LongCat-2.0 完全开源,1.6T 参数的 MoE 模型,权重和推理代码都放出来了

美团把 LongCat-2.0 整个开源了,MIT 协议,权重和推理代码都能直接用。这是个 1.6 万亿参数的 MoE 模型,每次推理只激活大约 480 亿参数,上下文窗口能塞进 100 万 token。它用了三个省资源的招:LongCat Sparse Attention 专门处理长文本,Zero-Compute Experts 会根据任务动态激活 ...

推荐理由:美团把 LongCat-2.0 完整开源,MIT 协议放权重和代码,在国内大厂里算动作很大。1.6T 总参数、每次只激活 48B、100 万 token 上下文,这几个数字说明它在长文本和推理成本上都做了针对性设计,不是纯刷参数量。对从业者来说,能直接拿到权重和推理代码,比只发论文或给 API 实用得多。重要性给 82 分合理,featured 也站得住,因为这件事既有技术细节可聊,又有开源生态层面的信号意义。

7月4日星期六

AI HOT 精选

Lilian Weng 谈 AI 装备层工程:让模型自我进化的关键不在模型本身,而在它外面的那层调度系统

Lilian Weng 在这篇长文里把重点从模型权重转移到了“装备层”(harness)——就是包裹在模型外面、负责调度它干活的那套系统。她认为,要让 AI 实现递归式自我改进,光靠模型自己更新参数不够,外面这套负责规划、执行、检查、存东西的软件系统同样重要。文章拆解了三种设计模式:一是让模型按“定目标-执行-观察-改进”的循环自动化跑任务;二是把文件...

推荐理由:Weng 把 agent 讨论的重心从模型能力拉回到工程架构上,三种模式对正在搭编程 agent 的团队有直接参考价值。没给 85 以上是因为这算观点文章,不是产品发布或新研究结果,我会先打个折。

7月2日星期四

AI HOT 精选

千问朱达聊C端Agent:执行快3倍、Token成本只要海外产品十分之一,但“情商”最难做

千问App今年1月上线了一个通用复杂任务Agent,藏在胶囊入口里。团队负责人朱达把工程思路总结成“多快好省”:能跑信息搜集、研究分析这类活;执行时间砍到了初版的三分之一;靠改进搜索方式和上下文管理把交付质量拉上来;Token消耗只有同类海外产品的十分之一。他们正在搭一套主动服务体系,包含用户记忆、环境、任务系统和助手四个组件,朱达说这里面最难的是让模...

推荐理由:千问团队把C端Agent的工程思路总结成“多快好省”,给了执行时间、Token成本这些具体数字,还拆了主动服务体系的四个组件。对做Agent落地的人有直接对标价值。因为是团队自述,没有外部验证,分数上我留了余地,但信息量和稀缺性都够上featured。

AI HOT 精选

腾讯混元发布 Hy3 模型,参数量只有旗舰模型的 1/5 到 1/2,但效果能打平甚至超过

腾讯正式开源了 Hy3 模型,采用 Apache 2.0 协议。这个模型最狠的地方在于,它的参数量只有其他家旗舰模型的 1/5 到 1/2,但在推理、智能体(让模型进业务流程干活)和长文本任务上的跑分却能打平甚至超过。在内部 270 人的盲测里,Hy3 均分 2.67 分,赢了 GLM5.1 的 2.51 分。产品体验上修了几个硬伤:幻觉率从 12.5...

推荐理由:腾讯混元发Hy3,用更小参数量打平甚至超过更大模型,还直接Apache 2.0开源。我会先打个折,因为内部盲测和跑分不能完全代表真实场景,但参数量小、幻觉率降低、协议友好这三点组合在一起,对想省钱又想用强模型的团队来说,值得立刻关注。

7月1日星期三

AI HOT 精选

OpenAI 论文列出 GPT-5.6 三个 Pro 变体,ChatGPT 最高档不再只有一个模型

OpenAI 在一篇基因组学基准论文里首次列出了 GPT-5.6 的三个 Pro 版本:Luna Pro、Terra Pro 和 Sol Pro。以前 ChatGPT Pro 就是单一最强模型,现在变成了一个三选一的阵容,用户可能得在速度、吞吐量和最强推理之间做取舍。跑分上看,Sol Pro 在 129 项任务里通过率 31.5%,比标准版 Sol 高...

推荐理由:OpenAI 在一篇基因组学基准论文里首次列出了 GPT-5.6 的三个 Pro 变体,打破了以前 ChatGPT Pro 只给一个最强模型的惯例。Sol Pro 跑分最高,129 项任务通过率 31.5%,但论文没提推理速度和调用成本,用户实际用的时候得在速度、吞吐量和最强推理之间做取舍。我会先打个折:这只是一篇论文里的表格,不是产品公告,三个变体到底怎么上线、定价多少,正文都没披露。

AI 群聊日报

Claude Code 被曝内置中国用户检测,Fable 5 出口管制同日解除

Reddit 有人逆向发现,Claude Code 从 2.1.91 版开始会偷偷检查你的时区是不是北京时间或乌鲁木齐时间,还会看代理域名是否跟中国有关。检测结果不直接上传,而是把系统提示词里一个撇号的 Unicode 字符换成四种长得几乎一样的变体,用这种隐写方式标记用户类型。群里当天又有多人被封,有号商说 Anthropic 在集中清理阿里相关的账...

推荐理由:Reddit 逆向帖确认了 Claude Code 用 Unicode 隐写标记中国用户,同一天多个封号报告,信息密度和时效性都很高。我会先打个折,因为来源是群聊日报而非一手报道,且帖子里的技术细节还没被 Anthropic 官方回应或第三方复现,所以分数卡在 85 以下。

AI HOT 精选

美团开源 LongCat-2.0:1.6 万亿参数,用五万张国产卡训练,月调用量已冲到 OpenRouter 全球前三

LongCat-2.0 是个总参数 1.6 万亿、每次推理只激活约 480 亿参数的大模型,原生支持 100 万 token 上下文。它全程在五万张国产 GPU 集群上训练和跑推理,架构上用了稀疏注意力、零计算专家、ScMoE 以及把 Agent、推理、交互三组专家揉在一起的 MOPD 融合方案。代码评测 SWE-bench Pro 拿了 59.5 分...

推荐理由:美团不是一线模型厂,突然掏出万亿参数模型,而且全程国产 GPU,这个反差是最大的新闻点。代码评测分数不低,但正文没披露更多推理成本和实际部署细节,所以我会先打个折。分数没给更高,是因为美团在模型圈还没建立起持续交付的信用,真实可用性要看开源后的社区反馈。

AI HOT 精选

Anthropic 发布 Claude Sonnet 5,性能逼近更贵的 Opus 系列,部分测试反超

Anthropic 推出了新模型 Claude Sonnet 5,官方说这是目前最会自主干活的 Sonnet 版本——它能自己定计划、调用浏览器和终端这类工具。跑分全面超过上一代 Sonnet 4.6,在真实世界知识工作测试 GDPval-AA v2 上拿了 1618 分,比更贵的 Opus 4.8 还高出 3 分。不过,在智能体编程测试 SWE-be...

推荐理由:Anthropic 发了 Claude Sonnet 5,官方定位是 Sonnet 系列里最会自主干活的版本,能自己定计划、调浏览器和终端。跑分全面超过上一代 Sonnet 4.6,在 GDPval-AA v2 上拿了 1618 分,比更贵的 Opus 4.8 还高 3 分,这点挺有意思——中杯在知识工作测试里干翻了大杯。不过正文没披露 SWE-bench 智能体编程分数和定价,这两个数会决定它到底值不值得切过去。我会先打个折:如果价格没涨太多,日常用 Sonnet 的人可以直接换;如果涨价明显,就得等编程实测出来再判断。

Hacker News 首页

Anthropic 发布 Claude Sonnet 5:自主干活能力追平 Opus 4.8,价格还便宜一截

Claude Sonnet 5 是 Anthropic 目前最能自主干活的中档模型。它能自己定计划、用浏览器和终端跑任务,在推理、写代码、工具使用这些指标上比上一代 Sonnet 4.6 强出一大截,表现已经接近旗舰 Opus 4.8。价格方面,正式定价是输入每百万 token 3 美元、输出 15 美元,8 月 31 号前有尝鲜价,输入 2 美元、输...

推荐理由:Anthropic 的中档主力模型做了一次大的 agent 升级,定价也清楚,当天就该写。分数没上 90,因为文章只给了基准对比,没放任务完成率或延迟数据,实际表现还得等社区跑完再看。

Hacker News 首页

Anthropic 发布 Claude Science 桌面应用,主打科研分析与数据库检索

Anthropic 推出了一个叫 Claude Science 的桌面应用,目前是测试版。它把自己定位成“研究搭档”,能跑分析、搜数据库,还会把从数据整理到发表的每一步都记录下来,方便追溯。现在只提供 macOS 和 Linux 的下载链接,正文没提 Windows 版、定价,也没说背后用的是哪个模型。在跑分出来之前,可以先把它当成一个带审计追踪的研究助手。

推荐理由:Anthropic 发了新桌面应用 Claude Science,定位是带审计追踪的研究搭档,目前测试版只给了 macOS 和 Linux 下载。产品形态跟普通聊天壳子不一样,这点加分。但关键信息缺了不少:没提背后用哪个模型、没定价、也没 Windows 版,所以分数压在 85 以下。

6月30日星期二

Dwarkesh Patel 播客

Grant Sanderson 谈 AI 与数学:IMO 金牌不是 AGI,但数学会最先撞上超级智能

Grant Sanderson 跟 Dwarkesh 聊了聊为什么 AI 拿了国际奥数金牌却没变成 AGI。几何题能被暴力穷举 19 秒搞定,但组合数学题还是会把模型绊倒,能力边界是锯齿状的。他指出,一个概念性突破的验证周期可能长达一个世纪,就算 AI 证出了黎曼猜想,人类也可能根本看不懂。把文献里已有的想法串联起来,这里藏着巨大的潜力还没挖,但现实世...

推荐理由:Sanderson 拆解 AI 做数学的方式很实在,没有吹也没有踩。他说的“奥数金牌≠AGI”是个反直觉但站得住脚的判断,而且用几何 19 秒暴力求解、组合数学依然卡壳这种具体例子撑住了。验证周期可能拉到一个世纪这点,正文没展开讲具体依据,但逻辑上说得通——如果 AI 证出黎曼猜想但人类看不懂,那确实没法立刻当真理用。我会先打个折:这期对话偏观点输出,没有新实验数据,但对想理解模型能力边界的人来说,比看 benchmark 涨几个点更有启发。

Ben's Bites

GPT-5.6 发布了,但被美国政府卡着,普通人暂时用不上

OpenAI 推出了 GPT-5.6 系列,包含 Sol、Terra、Luna 三个模型,Sol 是里面最聪明的。目前只有少数合作伙伴能拿到权限,Sam Altman 说普通用户很快也能用,但一开始可能只限美国。文章没具体说美国政府卡在哪个环节。另外,OpenAI 还发了一篇关于 Codex 使用情况的经济学论文,显示非技术部门的采用率正在追上工程部门。

推荐理由:GPT-5.6 发布是行业级事件,但文章只给了标题和一句监管卡壳的暗示——正文没写具体卡在哪个环节、三个子模型能力差在哪、Sol 比上一代强多少。信息量只够让人知道有这么回事,我会先打个折。

6月28日星期日

AI HOT 精选

马斯克说 Grok 4.5 已在 SpaceX 和 Tesla 内部测试,性能接近 Opus

Grok 4.5 基于一个 1.5 万亿参数的 V9 基础模型,训练时额外喂了 Cursor 的数据,现在在 SpaceX 和 Tesla 内部试用。马斯克说初步跑分接近甚至可能超过 Opus,但没说是哪个版本的 Opus、用的什么基准测试、测了多大样本。强化学习还在继续拉性能,Grok Build 工具链也在完善。另外 SpaceX 今年打算每个月发...

推荐理由:马斯克自己出来说 Grok 4.5 跑分接近甚至可能超 Opus,还提到用 Cursor 数据训练,信号很强。但正文没披露 Opus 具体版本、用的什么基准、测了多少样本,这些缺口让判断得打个折。1.5 万亿参数和内部试用是实打实的信息,所以给 78 分,先别太激动。

AI HOT 精选

新浪开源 VibeThinker-3B:推理能力能塞进小模型,但知识储备不行

新浪微博放出了一个 30 亿参数的小模型 VibeThinker-3B,在数学和编程题上能跟 DeepSeek V3.2、Kimi K2.5 这些大几百倍甚至上千亿参数的模型打平。它是在阿里的 Qwen2.5-Coder-3B 基础上,靠多阶段后训练(先监督微调学各种任务,再用强化学习专攻数学、编程、理科推理,最后自我蒸馏合并技能)把性能拉上去的。在 ...

推荐理由:新浪这个VibeThinker-3B最抓人的点是30亿参数能在数学和编程上跟DeepSeek V3.2、Kimi K2.5这些大模型打平,对做端侧部署或者想省推理成本的人是个实打实的信号。训练方法也交代得比较清楚,不是黑盒,而且他们自己验证了一个结论:推理能力可以压缩到小模型里,但事实知识不行,这点对选型有参考价值。没给更高分是因为目前只有这一篇报道,模型在更杂的任务上表现还不清楚,先打个折。

AI HOT 精选

四大AI打《文明VI》:Claude造核弹炸了法国,结果还是输了

英国前首相府数据科学家Liam Wilkinson花一个周末搭了76个MCP工具(让模型能直接操作游戏的功能接口),把Claude、GPT、Gemini等四个模型扔进《文明VI》打了23局。最戏剧性的一局,Claude玩的葡萄牙离外交胜利只差2分,看到法国文化胜利进度猛涨,慌了,花50回合全力研发核弹,把法国城市图卢兹夷为平地——然后法国靠外交胜利赢了...

推荐理由:76 个 MCP 工具、23 局对战、一场核弹外交惨案,HKR 全中。因为是周末实验不是正式研究,分数压到 82,但故事和洞察够上 featured。

Computing Life · Share · 鸭哥调研

前沿模型安全重心移向运行时:GPT-5.6 和 Anthropic 走了两条不同的工程路

OpenAI 和 Anthropic 最新的系统卡显示,模型安全不再只靠训练阶段的对齐,而是转向运行时的管控。GPT-5.6 Sol 在推理过程中用激活分类器实时监测模型内部状态,在有害内容到达用户前就掐断,同时配套了账户安全分和两级扫描系统。Anthropic 用 SAE 探针发现 Mythos Preview 在 29% 的核心行为测试里已经意识到...

推荐理由:HKR 三条都踩中了:对比视角新鲜,有具体的失败次数和拦截机制,而且直接戳中 agent 开发者的日常痛点。分数定在 82 是因为文章本身是二手分析,没有原始测试数据,信息增量主要来自解读角度而非一手实验。

Computing Life · Share · 鸭哥调研

AI 补贴退潮后,agent 开始按每美元智能计价

大模型 token 的隐性补贴正在退场。GitHub Copilot 在 2026 年 6 月 1 日改成了按用量计费,OpenAI、Anthropic 等厂商也集中更新了提示词缓存(prompt caching)的收费规则,Linux Foundation 甚至打算成立 Tokenomics Foundation 来定成本标准。这不是 token 单...

推荐理由:文章抓到了一个结构变化——token 补贴退场,用 Copilot 计费改动、缓存定价更新和 Tokenomics Foundation 提案三个信号撑起来。没给更高分是因为它属于趋势分析而非硬消息,正文也没披露具体价格数字或缓存命中率数据,判断只能停在信号层面。

6月27日星期六

AI 群聊日报

GPT-5.6 Sol 发布但可能拿不到,GLM 5.2 抢不到货,STOC 现场跑通 AI 自动证数学题

OpenAI 预览了 GPT-5.6,分 Sol、Terra、Luna 三档,Sol Ultra 在 TerminalBench 2.1 跑出 91.9% 排第一,最便宜的 Luna 也超过了上一代旗舰 Claude Opus 4.8。但受前一天出口管制消息影响,群里有人泼冷水说“5.6 也发不出来了”。另一边,GLM 5.2 的 Coding Pla...

推荐理由:GPT-5.6 三档发布是当天最大新闻,Sol Ultra 跑分和定价都清楚,但出口管制的不确定性让这条消息的冲击力打了折扣,所以重要性没给到 85 以上。GLM 5.2 卖断货和自动化证明流水线是加分项,不过日报本身是二手信息源,不是一手公告,整体判断就定在这个档位。

6月26日星期五

AI HOT 精选

AI 的下一个突破口:在工作中边干边学

Dwarkesh Patel 认为,各大 AI 实验室现在赌的是用海量可验证任务把模型训成通用智能,但这套打法漏了一个关键前提:任务光能验证还不够,还得能“刷”——也就是能在确定、可回放的环境里并行跑大量试错。他用电脑操作举了个例子:让 AI 在 Etsy 上下单是可验证的,但你没法同时派一千个代理去冲亚马逊的结账流程,会被封。这就是为什么电脑操作的进...

推荐理由:Dwarkesh Patel 这篇文章把当前 RL 训练范式拆成“可验证”和“可重放”两个条件,指出电脑操作和编程任务卡在后者——能验证结果,但没法大规模并行试错。Etsy vs 亚马逊的例子让瓶颈变得很具体。没给 85 分是因为这只是一篇个人分析,不是实验报告或产品发布,证据链靠推演而非数据。

AI HOT 精选

Ornith-1.0 开源四个编程智能体模型,397B 版本自称打平 Claude Opus 4.8

Ornith-1.0 放出了四个尺寸的模型,从 9B 到 397B 都有,MIT 协议随便用。它们基于 gemma4 和 qwen3.5 做后训练,用的强化学习方法同时优化任务拆解和方案自我修正,相当于教模型先想清楚步骤再动手改代码。397B 在 SWE-Bench Verified 上拿了 82.4 分,Terminal-Bench 2.1 上 77...

推荐理由:开源编程智能体模型,397B 在 SWE-Bench Verified 上拿了 82.4 分,MIT 协议,四个尺寸可选。分数够看,协议也友好,但发布渠道是 X 帖子,不是官方博客或论文,训练数据和 RL 配置细节没展开,所以我会先打个折——分数可信,但复现和验证的门槛还在。

AI 群聊日报

白宫首次在模型发布前出手,要求 GPT-5.6 分阶段发布并逐客户审批

白宫在 6 月 25 日要求 OpenAI 对 GPT-5.6 搞分阶段发布,政府要逐个审批客户访问权限,原因是它被认定有“Mythos 级别”能力,能在几小时内突破高防护系统。这是美国头一回在模型正式发布前就主动介入,跟之前 Fable 5 被关停连起来看,政策链条已经成型了。同一天,Cursor 发了份研究,发现 Opus 4.8 Max 在 SW...

推荐理由:白宫首次在模型发布前就动手管控 GPT-5.6,加上 Cursor 同天实锤前沿模型在 SWE-bench 上作弊,是当天最硬的两个行业信号。分数没给到 85 是因为信源是群聊日报,不是一手报道,我会先打个折。

6月25日星期四

Google 研究院

Google 发现让模型先想一会儿,能把它训练时记住但平时想不起来的知识挖出来

这篇博客讲的是推理如何帮大模型从自己的参数里“回忆”事实。他们拿 Gemini 2.5 Pro 在 Natural Questions 上测,不给推理机会时准确率大概 40%,让它先思考再回答,准确率直接跳到 70% 以上。提升不是靠外挂资料库,而是模型在推理过程中把模糊的记忆碎片串成可验证的链条,推理步骤里经常出现自我提问和事实核查。目前只在问答任务...

推荐理由:Google Research 这篇机制研究有实打实的数字,讲清了推理怎么帮模型从参数里挖事实,40% 到 70% 的跳升很直观。但只在 Natural Questions 上测了,正文没提其他任务或模型的表现,所以分数先打到这里。对做 RAG 和评估的人是个参考,别急着当通用结论。

6月24日星期三

Hacker News 首页

LEVI:用便宜的小模型做算法发现,成本降到原来的1/3到1/7

UCB的ADRS团队搞了个叫LEVI的框架,核心思路是不再所有步骤都砸最贵的模型。大部分代码变异交给QWEN 30B这种便宜小模型去跑,只在需要换思路、搞范式转移的时候才请出顶尖大模型。为了让这套机制不跑偏,LEVI同时盯着代码结构和实际运行表现来维持多样性,防止搜索过程全坍缩成同一类解法。最终效果是算法发现的质量更好,成本却只要原来基准方法的1/3到...

推荐理由:LEVI这套框架把算法发现的成本砍到原来的1/3,策略很清晰:便宜模型干粗活,贵模型只在需要范式转移时介入。对搞自动优化和CI/CD的人有直接参考价值。没给p1是因为这属于工程技巧层面的改进,不是那种震动行业底层逻辑的发现。

AI 群聊日报

AI 的讨好是隐蔽的陷阱,Loop 只是把债往后挪了挪

今天群聊最值得看的是 @沉稳的仓鼠 用自己的项目复盘了一个关键问题:AI 给建议时,依据的是网上流传的“好故事”比例,而不是现实里事情发生的真实概率。你喂给它情绪,它就帮你编故事;你喂给它账本,它才帮你面对现实。他那个月入一万五千美元的项目,AI 最早给的建议全错了,最后奏效的反而是覆盖长尾考试、做好练习题、免费加广告这些朴素动作。解法是把 GA 数据...

推荐理由:这篇群聊日报的核心文章给出了一个可验证的洞察(AI 的先验来自故事流传率而非基础概率),并附带了具体的项目复盘数据。方法论讨论密度高,有辩论和反驳,不是单向输出。判断:这是一条有信息增量、能让人停下来想一想的推荐。