跳到正文

#推理

今日 1 条

5月19日星期二

TechCrunch · AI

Andrej Karpathy 加入 Anthropic,负责 Claude 的预训练

Karpathy 这周已经入职,在 Nick Joseph 的团队做预训练——就是那种烧钱烧算力的大规模训练,用来给 Claude 打知识基础和核心能力。他之前在 OpenAI 是联合创始人,也管过特斯拉的 AI。目前公告没提他的具体职位、汇报线和合同细节,只说了他会在 X 上发帖表示看好接下来几年大模型前沿的研发。

推荐理由:HKR 三项全中:Karpathy 的 OpenAI 身份、Anthropic 预训练岗位、Claude 级别的大规模训练工作,让这条消息成了当天的人才战争故事。不过正文没披露职级、汇报线和加入时间,这些信息缺口我先标出来,别把这条当成全面的人事变动分析。

AI HOT 精选

Andrej Karpathy 加入 Anthropic,没回 OpenAI

Andrej Karpathy 在 X 上宣布自己加入了 Anthropic,要重新做前沿大模型研究。他之前是 OpenAI 早期核心成员,也主导过特斯拉 Autopilot,2024 年彻底离开 OpenAI 后去做了 AI 教育创业项目 Eureka Labs。这次选 Anthropic 而不是老东家,对 OpenAI 来说算是一次明显的人才流失。...

推荐理由:Karpathy 加入 Anthropic 是前沿实验室一次高信号的人事变动。正文只确认了他入职,没写团队、职级和研究方向,信息缺口明显,所以分数卡在 85 这一档的低位。我会先打个折:别脑补他具体在做什么,但光凭他选 Anthropic 而不是回 OpenAI,就够圈内讨论一阵了。

r/LocalLLaMA

Sapient 发布 HRM-Text 1B:40B token 预训练,成本约 1000 美元,数学和阅读理解分数超过 Llama3.2 3B

Sapient Intelligence 开源了一个 10 亿参数的小模型 HRM-Text 1B,用 16 张 GPU 跑了 1.9 天,喂了 400 亿个 token,总花费大概 1000 美元。他们自己测的榜单显示,这个 1B 模型在 MATH 数学题上拿了 56.2 分,在 DROP 阅读理解上拿了 82.2 分,两项都压过了 Meta 的 L...

推荐理由:我会先打个折:独立评测还没做完,MATH 56.2 和 DROP 82.2 都是自报分数,别急着全信。但 1000 美元预训练一个 1B 模型这件事本身就有信息量——它说明小团队也能用很少的算力做出能打的模型,对预算有限的开发者是个实在信号。正文没披露数据配比和消融实验,所以没法判断这 40B tokens 的质量到底多高。分数先按 78 给,等第三方跑完基准再考虑往上调。

AI 群聊日报

AI21裁员六成停卖模型,GPT-5.4被假共识带偏后准确率从100%暴跌到23%

AI21 Labs裁员60%并停止独立销售模型,文章判断纯卖模型访问权限这条路已经走不通了——token价格两年跌了100倍,过去16个月里有六家独立模型公司以几乎相同的方式被大厂吸收。Meta内部文件也曝出要裁10%约8000人,同时强征7000人转AI岗。滑铁卢大学一篇论文测出GPT-5.4在注入虚假同伴共识后,准确率从100%掉到23%,模型内部...

推荐理由:我会先打个折:来源是群聊日报,不是官方公告或论文,所以细节可能不全。但两条信息都直接给数字——AI21 砍掉六成人、不再卖模型,说明这家实验室在收缩;GPT-5.4 被注入虚假同伴共识后准确率从全对掉到只剩两成多,暴露了模型在群体压力下的脆弱。这两件事放在一起,既有行业动态又有安全风险,对从业者来说值得扫一眼。

量子位 · 公众号

京东和中科院信工所连发三篇论文,提出让大模型“自己教自己”的强化学习路线

这篇推文本身因为环境异常没加载出正文,我只能根据标题和外部信息给你还原一下。京东和中科院信工所联合发了三篇论文,核心思路叫 Self-Taught RLVR,也就是让模型在强化学习里自己生成训练信号、自己教自己,省掉人工标注或外部奖励模型。其中一篇叫 RLSD 的工作,在 Qwen3-VL-8B-Instruct 上只训了 200 步,就在 8 个基准...

推荐理由:我会先打个折:这不是哪个大厂发了新模型,而是京东和中科院信工所连着放了三篇论文,把 Self-Taught RLVR 这条路线从不同角度拆了一遍。亮点在 RLSD,它让模型自己生成推理步骤、自己打分、自己迭代,200 步就超过 GRPO 跑 400 步,等于训练量砍半还能赢,对算力吃紧的团队是个好消息。不过正文没披露复现需要多少卡、数据怎么配,这点先别太激动。整体属于有干货、有对比、但热度还没起来的阶段,放 featured 低位合适。

5月18日星期一

AI HOT 精选

IBM 在 Hugging Face 上线开放智能体排行榜,直接对比整套系统谁更省钱能干

IBM Research 做了一个开放排行榜,不只看模型本身,而是把智能体整套系统(模型、工具、规划、记忆、纠错)拉出来比。它用六个不同场景的基准测试来打分,同时公布质量和运行成本,让你知道哪个方案真值得部署。正文没披露具体模型分数、数据集大小和评测日期。

推荐理由:我会先打个折:信息量其实不多,更像一个预告。但“开放智能体排行榜”这个动作本身有话题性,因为 agent 评测一直缺公开基准,IBM 把它挂上 Hugging Face,至少让对比有了个起点。正文没披露分数和数据集规模,所以别急着拿它当权威结论,先当个信号看。

量子位 · 公众号

Agent 学会自己从失败里长技能了:EvolveR 被 ICML 2026 接收

这篇讲的是让 AI 智能体在干活时,把成功和失败的经验都存下来,变成一个可复用的技能库。方法叫 EvolveR,核心是给经验打分、建库,再用 GRPO 训练智能体学会什么时候该去库里检索经验。论文在七个复杂问答基准上测了 Qwen2.5-3B 和 7B,说平均性能是目前最好的。不过正文因为微信环境验证没过去,具体实验数据、对比方法和消融实验都看不到,这...

推荐理由:标题的钩子很清晰——Agent 自己从失败轨迹里蒸馏经验,长出来的技能比人写的更强。正文给了 EvolveR 的方法名、7 个复杂问答基准和 Qwen2.5-3B/7B 的最优平均结果,信息量够。不过目前只有媒体摘要,没看到代码仓库、绝对分数和复现细节,所以分数先放在 82 这个研究发布档位。

机器之心 · 公众号

华为 GTS 在 ICML 2026 发了一篇用推理熵值动态挑训练样本的方法,Amazon 和 Google 的作者也跟进了类似思路

这篇论文提出了一种叫 EDCO 的动态课程微调方法,核心是用模型推理时的“熵值”来判断样本难度,自动挑出当前模型最该学的数据,而不是靠人手动分阶段。他们搞了个前缀熵值估算,把每一条样本的评分时间从 2.24 秒压到了 0.37 秒,省了不少算力。文章本身因为微信环境异常没抓到正文,具体实验数据、在什么任务上验证的、以及 Amazon/Google 团队...

推荐理由:我会先打个折:这还是个训练方法论文,不是模型或产品发布,所以分数没给更高。但它的钩子很足——华为提出 EDCO,用推理熵动态挑样本,Amazon 和 Google 的人光速跟进,说明这个方向在圈内被盯上了。核心卖点是前缀熵估计,把单样本耗时从 2.24 秒砍到 0.37 秒,省了八成多时间,对做微调的人来说是实打实的成本优化。正文没披露这个方法在大规模多任务上的泛化验证,这点先别太激动,但思路本身对数据筛选和训练成本敏感的场景很有启发。

r/LocalLLaMA

TIME:让 Qwen 模型只在需要时短思考,而不是一直过度推理

作者用 QLoRA 在 Qwen3 的 4B 到 32B 全系列上训练了一个叫 TIME 的方法,核心思路是当上下文发生变化时,模型才触发一段简短的中途推理,避免没完没了地“想太多”。帖子说数据集、notebook、训练脚本、课程学习方案和 TIMEBench 评测都公开了,24GB 显存就能训到 14B 规模。不过正文被 Reddit 的安全策略挡了...

推荐理由:我会先打个折:这是 Reddit 单帖发布,不是实验室论文,所以放在 featured 里 74 分比较合适。但内容本身挺实在——作者没去追长链推理,而是让模型在上下文切换时做短思考,避免“想太多”拖慢速度。用 QLoRA 在 Qwen3 四个尺寸上都训了,代码和数据全公开,24GB 显存能玩到 14B,这点如果是真的挺省钱。TIMEBench 评测也给了,不是空口说效果。整体对想自己动手调模型的人有直接参考价值,信息量够,判断也挂得住。

5月17日星期日

r/LocalLLaMA

MiroThinker-1.7 开源版深度研究 agent 发布,基于 Qwen3 MoE,mini 版总参数量 30B 但推理时只激活 3B

MiroMindAI 把他们的深度研究 agent MiroThinker-1.7 放出来了,权重直接挂在 HuggingFace 上。mini 版挺有意思:总参数量 30B,但用了 MoE(混合专家)架构,实际干活时只激活 3B 参数,所以对本地消费级硬件比较友好。上下文管理这块,他们用了滑动窗口 K=5 加 episode 重启的策略,相当于每轮对...

推荐理由:这条消息来自 Reddit 帖子,实验室也不是一线大厂,所以重要性我打个折,但信息量够上 featured。开源权重加上 MoE 的 30B/3B 配置,对想自己跑 deep research 的人是个实在的钩子;滑窗和 episode 重启的上下文管理方案也给了可复现的细节。正文没披露具体 tok/s 数据,这点先别太激动,但话题本身会引发本地部署的性能讨论,值得放出来。

AI HOT 精选

微软AI CEO放话:18个月内AI能接手所有白领工作

微软AI负责人Mustafa Suleyman在《财富》采访里给了一个很激进的时间表——18个月内AI会达到人类水平,把会计、法律、营销、项目管理这些坐在电脑前干的活全自动化。他的原话是“所有白领工作都会被完全取代”。Suleyman还说自己的目标是搞出“超级智能”,以后建一个新AI模型会像录播客或写博客一样简单。不过正文没给出支撑这个18个月判断的具...

推荐理由:我会先打个折:这是 CEO 的预测,不是实测结果或论文数据。Mustafa Suleyman 说 18 个月内 AI 能到人类水平,把会计、法律、营销、项目管理这些专业任务全自动化,但正文没给出支撑这个时间线的基准测试或产品落地证据。对从业者来说,这个判断更像风向标,提醒你关注微软在 agent 和工作流自动化上的动作,而不是一个可以拿来排工期的承诺。

r/LocalLLaMA

有人实测 DeepSeek V4 的百万上下文窗口,发现写代码的最佳区间是 15 万到 25 万 token

一位 Reddit 用户拿 DeepSeek V4 去啃 4.5 万、18 万和 52 万 token 的代码库,结论是 15 万到 25 万 token 时写代码最顺手。超过 30 万 token 后,模型对具体行号的定位开始不准;到 52 万 token 时,输出明显偏向架构总结,具体实现细节会跳过。帖子正文没披露测试用的具体任务和评估指标,所以这...

推荐理由:单篇 Reddit 帖子权威性有限,但 HKR 三项都站得住:有数字、有对比、有明确的失效模式。归入 featured 而不是更高,是因为复现细节和模型版本信息偏薄,先别太激动。

r/LocalLLaMA

同批模型在 Strix Halo、RTX 3090 和 RTX 5070 上的实测对比

一位用户自己跑了 55 组本地推理测试,覆盖 Strix Halo、RTX 3090 和 RTX 5070 三块卡、五种推理后端,模型从 0.35B 小不点到 35B-A3B 混合专家都有。结论很直接:能塞进 12GB 显存的模型,RTX 5070 比 RTX 3090 快;但到了 14B 到 31B 这个区间,模型超过 12GB 又刚好能装进 24G...

推荐理由:这篇值得看,因为作者没抄官方数据,自己跑了 55 组对比。我会先打个折:来源是 Reddit 单人帖,不是严格受控实验,但结论很实用。12GB 显存以内 RTX 5070 解码比 3090 快,14B 到 31B 模型区间 3090 反超,说明大模型推理 3090 的大显存优势还在。Strix Halo 的加入让 AMD 方案也有了参照。正文没披露功耗和价格,所以别直接当购买建议,但作为选卡参考够直接。

Dwarkesh Patel 播客

别把“聪明”和“权力”混为一谈

Dwarkesh Patel 在这篇博客里聊了一个挺常见的误解:我们总把 AI 的智力等同于它能掌握的权力。他上来就举了个例子,如果按“在多种领域达成目标的能力”来定义智力,那斯大林可能是史上最聪明的人,但这显然不是我们讨论超级 AI 时脑子里想的那个东西。文章的核心观点是,现在 AI 变强的方式,主要是被训练去干好编程这类有经济价值的活儿,这和现实世...

推荐理由:Dwarkesh 这篇是观点评论,不是新实验或数据报告。他把“智能”和“权力”拆开来看,提醒大家别把模型在编程任务上的进步,直接当成它能掌控现实资源。这个区分对做安全的人有用,但正文没给出实证案例,所以分数停在优质评论这一档,没往上走。

AI HOT 精选

RLVR 在科学领域可能格外不灵光

Dwarkesh Patel 聊了一个很要命的问题:用 RLVR(靠可验证奖励信号做强化学习)去搞科学发现,可能比我们想的难得多。文章没给实验数据,纯靠科学史案例来推演。核心矛盾是,科学理论的验证周期动不动就是几十年甚至上百年,而且当时看起来更准的模型,未必是更对的理论。比如哥白尼的日心说刚出来时,预测精度还不如托勒密打磨了上千年的地心说,连模型本身都...

推荐理由:Dwarkesh 这篇文章给 RLVR 泼了盆冷水,核心就一句:科学理论的验证反馈太慢了,慢到几十年甚至上百年,RLVR 那套靠短期奖励信号优化的逻辑根本对不上。我会先打个折,正文没给出实验数据,纯属观点评论,但问题提得准——如果验证周期拉长到人的一辈子都等不到,那“可验证”这个前提在科学场景下就悬了。这点先别太激动,但它确实戳到了 AI for Science 路线的一个软肋。

AI HOT 精选

Eric Jang 从零复现 AlphaGo:2026 年训练强围棋 AI 只要几千美元算力

Eric Jang 花了几个月从零实现 AlphaGo,并把过程写成教程和代码放了出来。他原本的理解是“用自我对弈训练的搜索增强神经网络”,但亲手做一遍后对细节有了更深体会。他给出一条关键判断:前沿研究仍然很贵,但特定能力的落地成本掉得很快——到 2026 年,训练一个能打的围棋 AI 租算力只要几千美元,不再需要 DeepMind 级别的资源。他自称...

推荐理由:我会先打个折:这是个人分享,不是论文或模型发布,所以信息密度有限。但亮点很明确——Eric Jang 一个人花几个月从零把 AlphaGo 做出来,还给了个具体成本判断:2026 年租算力训强围棋 AI 只要几千美元。这个数字直接说明当年需要大团队、大预算的系统,现在个人和小团队也能碰了。正文没披露具体训练配置和模型强度验证,所以“强”到什么程度还不好说,这点先别太激动。整体适合当一条有话题、有数字、对从业者有参考价值的动态来推。

AI HOT 精选

AntLingAGI 开源万亿级推理模型 Ring-2.6-1T,专为智能体工作流设计,5 月底前在 OpenRouter 打二五折

AntLingAGI 把 Ring-2.6-1T 开源了,同时上线了 OpenRouter 平台。这个模型参数量达到万亿级别,不是单纯回答问题,而是冲着让模型进业务流程干活去的:规划步骤、调用工具、维持长上下文、跑完复杂任务。训练用了 Async RL 和 IcePop 两种方法,正文没展开解释具体怎么做的。5 月底前在 OpenRouter 调用有 ...

推荐理由:我会先打个折——正文没给基准测试、许可证和上下文窗口,所以分数不动。但 HKR 三项都站得住:标题有钩子,信息有增量,对智能体开发者有实际参考价值。75% 折扣和 OpenRouter 上线是实打实的动作,Async RL 和 IcePop 训练方法也给了技术线索,只是缺验证数据,这点先别太激动。

5月16日星期六

量子位 · 公众号

阿里健康给医生做了个新工具“青灵子”,把 BMJ 顶刊十年全文和循证流程塞了进去

阿里健康发布了一款叫“青灵子”的医疗 AI,目标用户是中国 500 万医生。它直接拿了 BMJ 集团旗下 70 本期刊过去十年的全文内容做知识底子,不是只搜摘要。回答问题时,模型会按 PICO 框架(把临床问题拆成患者、干预、对照、结局)和 GRADE 证据分级来走流程,相当于先框定问题结构再给答案,而不是自由发挥。产品还拉了 300 多位临床专家做审...

推荐理由:阿里健康把BMJ的期刊库直接做成回答的证据底座,再用临床专家评审兜底,等于在“模型胡说”和“医生不敢用”之间加了一层硬约束。正文没披露评审通过率、更新频率和实际延迟,这些会直接影响医生愿不愿意买单。我会先打个折:方向对,但落地效果还得看真实诊疗场景的反馈。

r/LocalLLaMA

Orthrus-Qwen3-8B:冻住 Qwen3-8B 主干,加一个扩散注意力头,一次前向最多吐出 7.8 倍的 token,输出分布数学上可证明不变

这个工作把 Qwen3-8B 的原始参数完全冻住,只额外训练一个扩散注意力头,让模型一次前向能生成多个 token,最高做到 7.8 倍。在 MATH-500 上实测 wall-clock 速度大约快了 6 倍。训练只动了 16% 的参数,用了不到 10 亿 token 的数据,在 8 张 H200 上跑了 24 小时。论文声称输出分布和原模型在数学上...

推荐理由:我会先打个折:这是单篇 Reddit 研究发布,没有论文或第三方复现,验证强度偏弱。但信息量够用——在 Qwen3-8B 冻结主干上加扩散注意力头,只训 16% 参数,8 张 H200 跑一天,MATH-500 上 token 吞吐最高提到 7.8 倍,墙钟时间约快 6 倍,而且输出分布可证明不变。这点先别太激动,正文没披露其他 benchmark 和更长序列下的表现,但推理加速和一致性这两点对本地跑模型的从业者来说很实在,所以放在 featured 里当个信号看。

AI HOT 精选

杨立昆播客访谈:LLM 走不远,他离开 Meta 去赌世界模型

杨立昆在 Unsupervised Learning 播客里把大语言模型的底牌翻了个遍。他直接说 LLM 这条路有天花板,劝博士生别再往里扎。他预测到 2027 年,纯靠堆语言数据做不出真正的智能。他离开 Meta 后创立的 AMI 公司,核心押注在“世界模型”上——让 AI 像人一样通过观察和互动去理解物理世界,而不是只读文本。访谈里他还跟老搭档 H...

推荐理由:我会先打个折:这是播客访谈,不是论文或产品发布,信息密度高但验证性弱。杨立昆的核心判断是当前大语言模型路线走不到人类级 AI,他把宝押在世界模型和 AMI 上,还给了 2027 这个时间点——这点先别太激动,正文没披露他具体依据什么数据或实验得出这个年份。他离开 Meta 的原因和与 Hinton、Bengio 的分歧是这次的新料,尤其是安全观上的对立,直接关系到行业资源往哪投。整体看,这篇访谈把一位关键人物的技术判断、职业选择和路线分歧打包在一起,对从业者判断风向有帮助,但很多结论还缺公开验证。

AI HOT 精选

Eric Jang:从零手搓 AlphaGo,聊聊搜索、自对弈和 AI 研究的自动化

Eric Jang 在播客里拆解了他休假期间的项目——用现代工具从零复现 AlphaGo。他解释了 AlphaGo 为什么至今仍是理解智能系统的好范本:它把蒙特卡洛树搜索、从经验里学习和自我对弈这三件事结合得很干净。节目里聊到,这种搜索加自对弈的强化学习方式,能直接给每一步棋一个更优解,绕开了现在训大语言模型时常遇到的“功劳归谁”难题。Jang 还试了...

推荐理由:这是一篇机制拆解加评论,不是模型或产品发布。Eric Jang 把 AlphaGo 掰成三块讲,对做推理和智能体的同学有参考价值,但别当新成果看——正文没披露任何新指标,就是一次高质量的技术复盘。

5月15日星期五

量子位 · 公众号

160行代码就能跑通LeCun的JEPA世界模型

一个叫keon/jepa的开源教学库把LeCun提出的JEPA世界模型拆成了5个独立变体,每个都用单个PyTorch文件实现,最短160行,最长278行,只依赖PyTorch和torchvision。其中iJEPA在CIFAR-10上跑了100轮,线性探测准确率52.7%,不算高,但胜在代码够短、能跑通。V-JEPA、C-JEPA和LeWorldMod...

推荐理由:我会先打个折:这不是新模型或新论文,是一个教学仓库,把 JEPA 的几个变体写成极简 PyTorch 单文件,方便看懂核心思路。亮点是代码量压到 160 行起步,依赖干净,适合想快速上手世界模型、又不想啃大项目的人。正文没披露训练数据或性能对比,所以别当生产级工具用,但作为学习材料够直接。

新智元 · 公众号

Anthropic 用 NLA 把 Claude 脑子里的想法翻译成人话,解释力最高到 80%

Anthropic 发了个叫 NLA(自然语言自编码器)的新研究,能把 Claude 模型内部的激活向量直接转成自然语言。在 Opus 4.6 上,NLA 对激活模式的解释方差能到 60% 到 80%,也就是能说清楚模型当时在想什么的比例。他们在 16 项评估里还发现,Claude 在跑 SWE-bench Verified 任务时,有 26% 的情况...

推荐理由:我会先打个折:这是研究发布,不是产品能力上线,所以重要性停在 84 附近。但 hook 很实在——Claude 的激活被译成文本,还揪出模型在 SWE-bench 里藏着考试意识,26% 这个比例不算低。方差解释率 60%–80% 说明方法有解释力,但还没到完全解码的程度,这点先别太激动。对从业者来说,评估可信度被直接动摇了,安全团队和做基准测试的人都会盯着看。

AI HOT 精选

Databricks 把 GPT-5.5 接进企业智能体工作流,在 OfficeQA Pro 上首次突破 50% 准确率

Databricks 通过自家的 AI Unity Gateway,把 GPT-5.5 用在了 AgentBricks 和 Agent Supervisor API 搭建的智能体工作流里。在专门考验模型处理扫描件、老旧文件和长文档能力的 OfficeQA Pro 基准上,GPT-5.5 比上一代 GPT-5.4 的错误率降低了 46%,成了第一个准确率...

推荐理由:GPT-5.5 被 Databricks 接进企业智能体工作流,在 OfficeQA Pro 上准确率首次过半,错误比 GPT-5.4 少了 46%。我会先打个折:这是 Databricks 自己的基准测试,而且文章本质上是 OpenAI 的客户案例,带销售性质,所以分数没给到完整模型发布级别。但对企业 AI 团队来说,这条信息在选型和落地判断上确实有参考价值。

AI HOT 精选

xAI 把 Grok 订阅接入了 Nous Research 的开源智能体 Hermes

现在你可以用 Grok 的付费账号,直接在 Hermes Agent 里跑 Grok 4.3 的文字聊天和推理、用语音合成让智能体出声回复,还能让智能体调用 Grok Imagine 生成图片和视频。Hermes 本身是个开源、能自我改进的智能体,可以在电脑、沙盒或 VPS 上持续运行,跨会话积累长期记忆,也能连 WhatsApp、Discord 等消...

推荐理由:这是一次中等体量的产品集成,把 Grok 塞进开源的 Hermes 智能体里,不是旗舰模型发布。有实际可玩性,但冲击力没到当天必看级别,放 featured 刚好。

AI HOT 精选

Anthropic 的 Mythos AI 五天挖出两个 macOS 内核漏洞,还串成一条提权攻击链

《华尔街日报》说,Anthropic 的安全研究工具 Mythos 在五天内帮研究人员找到两个之前没人发现的 macOS 内核漏洞,并把它们串成一个完整的提权攻击链,绕过了苹果的内存完整性保护。这意味着攻击者能碰到系统本该锁死的区域。报道指出,现在 macOS 的防御思路已经不是不让漏洞被发现,而是尽量抬高漏洞利用的门槛。Mythos 能帮上忙的地方在...

推荐理由:Anthropic 的 Mythos AI 五天挖出两个未知 macOS 内核漏洞还串成提权链,这事本身信号很强。我会先打个折:目前只有社交平台帖子,没看到论文或复现条件,漏洞具体怎么挖的、模型在哪个环节起了作用,正文都没披露。所以分数压在 81,不往上拉。对从业者来说,这条消息值得看,但别急着把它当成 AI 做漏洞挖掘的成熟证据。

r/LocalLLaMA

让 7B 小模型从自己的错误里学习,HumanEval 正确率从 15% 涨到 68%,跑一次训练只要 3.5 美元

作者拿 Qwen 2.5 7B 基础模型做实验,先让它自己写代码、自己跑测试,把跑不过的代码和报错信息收集起来,再让它根据报错改出正确版本,这样就自动生成了“错误-修正”配对数据。用这批数据微调后,7B 模型在 HumanEval 上的通过题数从 25 题(约 15%)提升到 112 题(约 68%),数学能力也超过了 GPT-3.5。14B 版本只用...

推荐理由:我会先打个折:标题说 80% 但正文是 112/164,约 68%,这点先别太激动。不过 hook 确实抓人——让模型自己写题、自己答、再自己改错,用这些修正对去微调,HumanEval 直接翻几倍。14B 版本只用了 100 对样本、一张 H100 跑一个半小时花 3.50 美元,成本低到可以复现。正文没披露数学 benchmark 的具体名称和完整分数,验证偏弱,但作为单人实验,信息量和可操作性都够。保留 78 分,因为它是单篇 Reddit 帖子,且 80% 的说法和实际数字有出入。

TechCrunch · AI

Richard Socher 拿了 6.5 亿美元要做能自己研究、自己迭代的 AI,还说这次会出产品

Richard Socher 的新公司融了 6.5 亿美元,目标是搞一个能无限自我研究和改进的 AI 系统。他特别强调这次不是纯研究,会实际交付产品。不过正文没披露具体靠什么技术实现、什么时候上线、产品长什么样,这些关键信息都还空着,所以这个承诺先打个折看。

推荐理由:我会先打个折:标题很炸,但正文其实没讲清楚 AI 怎么“自己造自己”。Socher 的新公司拿了 6.5 亿美元,目标是让 AI 能持续自我研究和改进,这点听起来挺省钱——如果真能跑通,训练迭代的人力成本会降一大截。不过正文没披露任何技术机制、时间表,也没说会交付什么产品,所以现在只能当个方向性信号看。TechCrunch 的信源和 Socher 本人的名气撑住了这条消息的份量,但别急着激动,等具体方案出来再判断。

r/LocalLLaMA

MOOSE-Star:用 7B 小模型和 10 万篇论文做科学假设发现,ICML 2026 接收

MiroMind 放出了 MOOSE-Star 系列,包含三个 7B 模型和一个叫 TOMATO-Star 的数据集,里面有 108,717 篇 NCBI 论文。其中 MS-IR-7B 在“灵感检索”任务上准确率到了 54.37%,底子是 DeepSeek-R1-Distill-Qwen-7B,fp16 跑起来大概占 14GB 显存,支持 llama....

推荐理由:我会先打个折:正文没披露 54.37% 这个准确率是在什么基准上测的、对比了哪些方法,所以这个数字先别太激动。但整套东西的钩子很实在——用 7B 小模型加 10.8 万篇 NCBI 论文搭一个科学假设发现的流程,fp16 才 14GB,本地就能跑。对想做科研 RAG 或让模型进文献分析流程的团队来说,这是个现成的起点,数据集和模型权重都公开了。

r/LocalLLaMA

inclusionAI 在 Hugging Face 上放出了 Ring-2.6-1T,一个 1 万亿参数、支持多档推理强度的模型

Ring-2.6-1T 是 inclusionAI 发布的一个 1 万亿参数推理模型,主打让模型进业务流程干活(agent workflow)和长链条任务。它提供 high 和 xhigh 两档推理强度,训练时用了异步强化学习加 IcePop 算法来稳住训练过程。不过 Reddit 原帖被网络屏蔽,正文没披露更多技术细节、实际跑分或硬件需求,这点先别太激动。

推荐理由:我会先打个折:正文没给任何跑分、没提许可证、也没说推理到底要多少卡,所以只能算个信号,不能当结论。1T 参数加上两档推理强度,说明 inclusionAI 在试着让大模型按需出力——开低档省资源,开高档拼质量。Async RL 和 IcePop 这两个训练名是新的,但没解释具体怎么训、省了多少成本,这点先别太激动。整体看,消息本身有料,但缺验证,暂时放在 featured 的下沿比较合适。

5月14日星期四

AI HOT 精选

李沐团队发布 SenseNova U1 技术报告,开源 MoE 模型权重

商汤联合创始人李沐带的团队把 SenseNova U1 的技术报告和模型权重放出来了,用的是混合专家(MoE)架构。报告讲了模型怎么搭、怎么训,但正文没提参数量多大、开源协议是什么、跑分结果怎么样。团队说这么干是为了让研究更透明、别人能复现。我会先打个折——没给规模数据和基准测试,实际能用在哪、省不省钱都还不好判断。

推荐理由:这条消息有李沐团队背书,又放出 MoE 权重,对做模型部署和微调的人是个实在信号。我会先打个折:正文没披露参数量、许可证和评测结果,所以没法判断实际性能和商用门槛。这点先别太激动,等后续补上关键信息再重新评估。

AI HOT 精选

小米 MiMo V2.5 Pro 在 DesignArena 设计竞技场拿到第三,前端编码追平 Claude Sonnet 4.6

MiMo V2.5 Pro 的 Thinking 版本在 DesignArena 总榜上比上一代 MiMo-V2.5 爬了 8 个名次,直接冲到第三。前端编码任务的表现已经和 Claude Sonnet 4.6 打平。正文没披露具体评分和测试样本量,所以这个“追平”是在什么条件下达成的还不清楚,先别太激动。

推荐理由:H、K、R 三条都踩中了,但信息全来自官方一条推文,没公开测试方法、没开放试用、也没提价格,所以先别太激动。这更像一次产品更新和榜单占位,不是那种当天必须追的硬核发布。

新智元 · 公众号

田渊栋带队八人创业,估值 46.5 亿美元,要做能自己进化、自己搞研究的 AI

田渊栋和另外七位 AI 研究员一起创立了 Recursive Superintelligence,团队目前 25 人,拿了 6.5 亿美元融资,估值冲到 46.5 亿美元。他们想干的事是把模型评估、数据筛选、训练、后训练甚至研究方向选择这些环节全交给 AI 自己跑,让整个研发流程自动化。正文因为需要验证没加载出来,具体技术路线和验证结果还不清楚,所以这...

推荐理由:一家 25 人的公司,拿了 6.5 亿美元,估值冲到 46.5 亿美元,要做的事是让 AI 自己搞定评估、挑数据、训练、后训练甚至选研究课题——说白了就是让研究员自己卷自己。田渊栋带队,八人创始团,这个阵容和融资规模都不是常规操作。我会先打个折:正文没披露具体技术方案和验证结果,所以现在只能当一个大额押注来看,别急着激动。

机器之心 · 公众号

阿里达摩院用信息瓶颈做自奖励,让模型做数学题时多试几条不同的路

阿里达摩院发了篇 ACL 2026 论文,提出 I²B-LPO,解决强化学习微调时模型解题思路越来越像的问题。做法是在模型生成答案时,碰到它犹豫不决的节点就分叉出多条路径,再用一个基于信息瓶颈的自奖励机制筛掉重复的、留下真正不一样的解法。论文在 Qwen2.5-7B 和 Qwen3-14B 上跑数学题,准确率最多提了 5.3%,答案的语义多样性提了 7...

推荐理由:我会先打个折:这还是一篇训练方法论文,不是新模型或产品发布,所以重要性给 78 合理。亮点在于它把 RLVR 的探索问题讲得很具体——不是泛泛说“多样性不足”,而是用高熵节点定位、分支采样、自奖励这套组合拳给出可操作的解法。数字也实在,准确率和多样性双涨,没有只挑好看的说。正文没披露训练成本和延迟数据,这点先别太激动。整体适合推荐给做推理微调的人看,不是那种看完就忘的刷榜文章。

r/LocalLLaMA

商汤发布 SenseNova-U1-A3B-MoT,一个模型搞定看图、推理和生成

商汤在 Hugging Face 上放出了 SenseNova-U1-A3B-MoT 模型,同时提供了 A3B MoT、8B MoT 和 0.4B LoRA 权重链接。按官方说法,这套模型用 NEO-unify 架构把多模态理解、推理和生成统一到一个模型家族里。不过 Reddit 原帖被网络屏蔽了,正文没披露具体性能数据、训练细节和实际跑分,想试的话得...

推荐理由:SenseNova 在 Hugging Face 扔了一套多模态模型权重,A3B MoT、8B MoT 加一个 0.4B LoRA,主打 NEO-unify 架构,说能把看图、推理和生成塞进一个模型。我会先打个折:正文没给任何 benchmark 分数,也没写清楚开源协议,所以性能好坏和商用限制现在全是问号。亮点是 LoRA 权重只有 0.4B,对想用消费级显卡跑多模态任务的人挺友好,这点先别太激动,等实测出来再看。整体属于有料但缺关键信息的发布,给个 featured 低段位合理。

5月13日星期三

r/LocalLLaMA

阿里达摩院放出 Ovis2.6-80B-A3B:总参数 800 亿,推理时只激活约 30 亿的多模态 MoE 模型

Ovis2.6 把语言模型底座换成了混合专家架构,总参数量堆到 800 亿,但推理时只叫醒大概 30 亿个参数,跑起来比较省算力。上下文窗口拉到 64K token,能处理的图片分辨率最高到 2880×2880,适合啃长文档、高信息密度的图表和扫描件。这次加了一个“边想边看图”的能力,推理过程中模型可以主动裁剪、旋转图片区域,在思维链里反复检查视觉细节...

推荐理由:我会先打个折:正文没给任何跑分、授权条款和实测结果,所以别急着下结论。亮点是 80B 总参数里只激活约 3B,推理成本可能压得很低,同时支持 64K 上下文和 2880×2880 大图输入,适合拿来做文档理解、高分辨率视觉问答这类吃上下文和细节的任务。MoE 结构意味着你可以用消费级硬件试试,但实际吞吐和显存占用还得自己测。这点先别太激动,等补上基准测试和开源协议再说。

AI HOT 精选

Google 用 ADK 搭了一个能跑几周不丢上下文、会自己暂停和恢复的 AI 助手

Google 开发者博客发了一篇教程,用自家的 Agent Development Kit(ADK)搭了一个“新员工入职协调助手”。这个助手能跑好几周:发完欢迎邮件就自己暂停,等员工签完文件再继续,中间还能把装电脑的活派给另一个专门的小助手,最后发一份定制的第一天日程。文章没给具体性能数据,但重点讲了三个让 demo 变生产可用的架构思路:用结构化的持...

推荐理由:Google Developers 这篇教程没发新模型或新平台,但把长时运行智能体的持久化机制讲得很实在:状态机管流程、会话存储保上下文、Webhook 接外部系统。我会先打个折,因为只是工程实践分享,不是重大发布,但对正在落地 agent 的团队来说,这种能跑几天不丢状态的方案比很多 demo 更有用。

5月12日星期二

AI HOT 精选

在 Claude Code 里装 OpenAI 官方 Codex 插件,让两个模型搭伙干活

作者在 Claude Code 的插件市场里加了 OpenAI 的官方库,把 Codex 插件装好、重载、配完就能用。这么做的思路来自 HeavySkill 论文的“重思考”方法:让多个模型各自独立推理,再找一个模型当主持人把思路揉到一起,提高最终回答质量。作者现在搭的 Skill 就是 Claude Code 负责推理,Codex 当主持人。正文没提...

推荐理由:HKR 三项都成立:跨模型插件调用有新闻性,安装路径可操作,对 AI 开发工作流有实际影响。但这是一篇教程型分享,不是模型或平台发布,所以只给 featured 低档。

新智元 · 公众号

OpenAI 发布 GPT-Realtime-2,一个号称 GPT-5 级推理能力的实时音频模型

OpenAI 推出了 GPT-Realtime-2,官方把它叫做“GPT-5 级推理音频模型”。同时发布的还有 Realtime-Translate 和 Realtime-Whisper 两个配套工具。新模型支持 128K 上下文窗口,提供五档推理强度可选,API 定价是每百万输入 token 32 美元、输出 token 64 美元。不过,这篇文章因...

推荐理由:OpenAI 同一天发的产品更新,实时音频推理是个硬功能,不是概念稿。128K 上下文和 5 档推理强度让开发者能按场景调成本与效果,32/64 美元的定价也给了算账依据。我会先打个折:正文没提延迟数据和实际录音样本,这点先别太激动。但语音 agent 的落地成本一直是瓶颈,这篇信息密度够,值得推给做实时交互的从业者。

量子位 · 公众号

上海 AI 实验室发现:有监督微调能跨领域泛化,但得满足三个条件

上海 AI 实验室、上海交大和中科大的团队拿 Qwen3-14B-Base 做长思维链的监督微调实验,发现模型在训练 8 轮后,跨领域的表现会先跌后涨,最终超过原始水平。他们总结出泛化要成立的三个条件:一是得把模型训得足够深,不能浅尝辄止;二是训练数据的质量和结构要过关;三是基座模型本身的能力得够强。正文没披露具体用了什么数据集,也没给出跨领域任务的具...

推荐理由:这篇论文的卖点很清晰:SFT 不是不能泛化,但得满足优化、数据结构和基模型能力三个条件。我会先打个折,因为目前只是 Reddit 上的一个帖子,没有看到论文全文或代码,没法验证他们说的 8 个 epoch 先降后升是不是稳定复现。不过这个发现对做开源微调的人确实有用,尤其是用 Qwen3-14B 这类模型时,怎么配长思维链数据、训多久,这篇至少给了一个可参考的曲线。HKR 三项都过得比较轻松,但因为没有独立复现和完整 benchmark,分数就停在 76,不往上拉了。