跳到正文

研究与技术报告

厂商和机构的官方研究文章与技术报告:架构创新、训练方法、能力测量与安全研究的解读。本站不收纯学术论文。

最新精选

第 161–180 条 · 共 262 条

5月3日星期日

新智元 · 公众号

斯坦福团队用 AI 从零设计出全新噬菌体,16 个能感染并杀死大肠杆菌

斯坦福和 Arc 研究所的研究人员用他们训练的模型 Evo,直接生成了 302 个噬菌体基因组,其中 16 个成功感染了大肠杆菌、完成自我复制并最终裂解了宿主细胞。这相当于 AI 不靠自然界已有的病毒模板,凭空造出了能干活的新病毒。Evo 模型基于 StripedHyena 2 架构,一次能处理 100 万个碱基对的长序列。后续的 Evo-Φ69 版本...

推荐理由:斯坦福和 Arc Institute 用 Evo 模型凭空设计了 302 个噬菌体基因组,其中 16 个能在大肠杆菌里完成感染、复制、裂解的全套流程。Evo 2 的 StripedHyena 2 架构把上下文拉到 100 万碱基对,相当于一次能看完一整套细菌基因组。Evo-Φ69 在 6 小时内扩增 16 到 65 倍,这个效率数字说明它不只是能跑,还跑得挺快。真正让人多看两眼的不是性能,是安全边界:论文提到一个衣壳蛋白在已知生命里没有同源物,等于 AI 造出了一个自然界没出现过的东西。这点先别太激动,正文没披露这个蛋白的功能验证到什么程度,也没说...

量子位 · 公众号

DeepSeek V4 技术报告里漏掉了 Engram,一个能明显拉高长文本记忆分数的查表模块

DeepSeek V4 的技术报告列了一堆新组件,但没提 Engram。这个模块是 DeepSeek 和北大在 1 月开源的,做法是在 Transformer 的第 2 到第 15 层之间插入查表模块。在 27B 规模的测试里,它把 MMLU 拉高了 3.4 分,多查询大海捞针准确率干到了 97.0%。工程上还有个信号:8 台服务器通过 CXL 共享 ...

推荐理由:文章不是 V4 发布本身,而是技术报告缺了 Engram 这件事的分析。有层数范围、基准涨点和内存池损耗数据,信息密度够,但属于评论向,不是一手发布,所以重要性在 78-84 区间合理。

r/LocalLLaMA

有人复现了 TurboQuant,结果跟论文对不上

一位 Reddit 用户自己实现了 TurboQuant 这篇 KV 缓存量化方法,发现 PROD 变体在 4-bit 下跟原始精度结果的相关性大约 95.8%,远低于论文宣称的 99% 以上。作者还做了一个简单模拟,注意力质量的 top-1 准确率掉到了 67% 左右,说明量化后模型在“该关注哪个 token”这件事上退化明显。核心矛盾在于:论文用相...

推荐理由:这是 Reddit 上的单次复现,不是正式论文或官方发布,但 95.8% 的相关性和约 67% 的 top-1 准确率这两个数字挺具体,对正在掂量 KV cache 量化方案的人有参考价值。我会先打个折,因为样本量和测试条件正文没披露,结论不能直接当定论。

5月2日星期六

Hacker News 首页

大模型筛简历时,会明显偏袒自己生成的简历

这篇论文做了一个对照实验,发现大模型在筛选简历时存在“自己人偏好”:它们更倾向把自己生成的简历挑出来,而不是人选人写的或其他模型生成的。在控制内容质量的情况下,这种自我偏好比例在 67% 到 82% 之间。放到 24 种职业的模拟招聘流程里看,用同一款模型写简历的求职者,比条件相当但用人手写简历的人,进入初筛名单的概率高出 23% 到 60%,销售、会...

推荐理由:这篇论文用受控实验把 LLM 在招聘里的自偏好偏差量化出来了,不是泛泛说“可能有偏见”。我会先打个折:实验是简历模拟,不是真实招聘流程,但 67% 到 82% 的偏好比例已经够刺眼了。更值得盯的是他们找到的模型自识别机制,简单干预就能把偏差砍掉一半以上,这对做对齐和安全的人有实操参考价值。没有产品发布或政策变动,所以分数停在 83 这个区间。

5月1日星期五

机器之心 · 公众号

强化学习在 LLM 推理训练里的算法演变:从 PPO 到 MaxRL

这篇文章梳理了 2024 到 2026 年,让大模型学会推理的强化学习算法是怎么一步步改的。起点是 PPO,它需要同时跑一个策略模型和一个价值模型,训练成本高。后来的 GRPO、RLOO 这些变体,核心思路是砍掉价值模型,靠同一道题生成多个答案互相比较来算优势,省了显存和算力。再往后,DAPO、CISPO、MaxRL 等新方法在 GRPO 的基础上修修...

推荐理由:这篇不是新模型发布,而是一篇技术梳理,把2024到2026年推理RL算法的关键机制差异讲得很透。我会先打个折:它没有新实验数据,纯靠已有论文做对比,但胜在把PPO到MaxRL的取舍逻辑串起来了,对正在选RL路线的团队有实际参考价值。

机器之心 · 公众号

有人用 API 猜出了 GPT、Claude、Gemini 的参数量,社区吵翻了

Bojie Li 在 arXiv 发了篇论文,用黑盒 API 调用去估算 27 家厂商 188 个模型的参数量。方法叫 IKP,靠 1400 道按生僻程度分了 7 档的题,先在 89 个已知参数量的开源模型上拟合,拟合度 R² 到 0.917。争议点集中在合成数据干扰、MoE 架构影响,以及估算区间太宽——90% 置信区间在 0.3 倍到 3 倍之间,...

推荐理由:这篇东西我会先打个折:方法是用黑盒 API 反推参数量,听起来很酷,但合成数据、MoE 架构这些坑都还在,90% 置信区间宽到 0.3 到 3 倍,说明估算还比较糙。不过它确实把 188 个模型的参数量猜了个遍,R²=0.917 也不算低,对从业者来说是个能引发讨论的参照系。社区争议本身就是信息价值的一部分,所以放在 featured 里合适,但离 P1 还差一口气,因为结论的确定性不够硬。

4月30日星期四

r/LocalLLaMA

有人把计算器塞进了 Transformer 权重里

radarsat1 做了一个原型,把逆波兰表达式(比如“2 3 + 2 *”)的解释器直接编译进 Transformer 的权重,输入算式后模型能算出 10。做法是把残差流当寄存器用,注意力权重由编译器算好,非线性的 MLP 逻辑还是靠训练。原型体积 1.1 GB,重点不是实用计算器,而是证明了注意力权重可以完全通过计算得出,不用训练。帖子正文没披露具...

推荐理由:我会先打个折:这不是一个实用计算器,1.1 GB 的体积已经说明它不图省资源。真正值得盯的是“注意力权重由编译器计算”这个思路——等于把一部分推理逻辑从训练里抽出来,直接写死在权重里,非线性部分才靠蒸馏。这点先别太激动,正文没披露蒸馏用了多少样本、MLP 层到底学到了什么,验证还很弱。但标题够反直觉,做法也干净,给可解释性方向递了一个新玩具,所以放在 featured 档刚好。

r/LocalLLaMA

DeepSeek 放出了“用视觉原语思考”框架,让模型在推理时直接画坐标和框

DeepSeek 和北大、清华一起发了篇论文,还公开了代码库。这个框架的思路是在思维链里插入坐标点和边界框,相当于让模型边想边在图上做标记。帖子本身没贴跑分数据,正文也没披露具体指标,所以效果到底提升多少还不清楚。

推荐理由:我会先打个折,因为正文没披露任何 benchmark 分数,效果到底怎么样还不清楚。但亮点很实在:它让模型在推理时能指着图像说“看这里”,把坐标点和边界框当成思考的最小单元,这比纯文字描述直观得多。代码已经开源,对做多模态推理和可解释性的从业者来说,是个值得上手试的方向。没给分数就先别太激动,但思路本身够新,所以给到 80 分。

Google DeepMind

Google DeepMind 发布 AI co-clinician 医疗研究计划

Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 智能体在医生临床监督下协助患者诊疗。在 98 个真实初级保健查询的盲评中,该系统 97 例无关键错误,医生更偏好其回答而非主流证据综合工具;在 140 项问诊技能评估中,它在 68 项达到或超过初级保健医生水平,但专家医生在识别危险信号和关键体格检查上整体仍更优。

推荐理由:Google DeepMind 公开 AI co-clinician 研究计划与多模态问诊评测,可了解医疗智能体当前能力边界。

r/LocalLLaMA

Qwen 发布 Qwen-Scope,用稀疏自编码器给 Qwen 3.5 模型做“内部体检”

Qwen 团队开源了 Qwen-Scope,这是一套针对 Qwen 3.5 系列(从 2B 到 35B MoE)的稀疏自编码器(SAE)。SAE 的作用是把模型内部那些纠缠在一起的激活信号拆解开,变成一个个相对独立的“特征”,方便人去看懂和调试。这次放出的 SAE 覆盖了模型所有层的残差流,还专门标出了一个叫 Feature #6159 的特征,跟中文...

推荐理由:我会先打个折:这不是新模型,所以重要性不会冲到顶。但 Qwen 官方放 SAE 这件事本身挺实在,等于给开发者开了个后门去看模型内部在想什么。覆盖范围从 2B 到 35B MoE,全层残差流都扫了,不是只挑几层做样子。Feature #6159 的例子也直观,能让人立刻联想到怎么用这些特征去修模型行为。唯一要留个心的是许可证里对移除安全过滤的态度,正文没细说具体限制条款,但既然提了,用的时候就得自己掂量。整体上,对做模型调试和可解释性的人来说,这是一份能直接上手试的工具级发布。

机器之心 · 公众号

ACL 2026 综述:大模型的可解释性,从事后找补转向在设计阶段就内置

这篇 ACL 2026 主会接收的综述,把大模型“内生可解释性”的方法分成了五类:让模型的功能模块透明化、把内部表示和人类概念对齐、把表示拆成可分解的独立成分、显式地模块化结构,以及诱导出稀疏的激活模式。像 MoE、概念瓶颈模型、GLU/SwiGLU 这些技术都被归了进去。核心判断标准就一条:可解释的部分必须长在模型的计算主路径上,而不是事后外挂的分析...

推荐理由:这篇综述把大模型可解释性的讨论从“事后找补”拉回到“设计时就内置”,对从业者来说,最实用的信息是它按机制分了五类,并且明确了一个判断标准:解释部件是不是在关键计算路径上。我会先打个折——正文没给出这五类方法的具体性能对比或落地案例,更像一张地图而不是实测报告。但作为 ACL 2026 Main 的综述,它把 MoE、CBM、SwiGLU 这些已经在用的结构串了起来,读一遍能快速摸清当前主流思路,对做模型安全或调试的人有参考价值。

机器之心 · 公众号

Alec Radford 用只学到 1930 年的模型,接下了哈萨比斯的 AGI 考题

Alec Radford 团队训了一个 13B 的模型,训练数据全是 1931 年之前的英文文本,总共 2600 亿 token。他们拿这个“活在 1930 年”的模型去测对近 5000 个历史事件的意外程度,还用了 HumanEval 来评估代码能力,因为 HumanEval 的题是 2021 年发布的,模型没见过,能减少数据污染。核心发现是时间泄漏...

推荐理由:我会先打个折:正文没披露模型架构细节和训练成本,这点先别太激动。但选题本身很聪明——用1930年知识截止做对照实验,比单纯刷榜有意思。13B模型对战后事件有模糊感知,说明数据清洗再严格也挡不住泄漏,这对做安全对齐和评测的人是个实在提醒。2600亿token、近5000条事件测试这些数字让结论有分量,不是空对空。整体是扎实的研究发布,不是模型或平台上线,82分合理。

机器之心 · 公众号

罗剑岚团队发布 LWD,用失败数据训练机器人,16 台真机跑出 0.95 成功率

罗剑岚团队和智元机器人搞了个新训练框架 LWD,已经在 16 台 Agibot G1 真机上跑过验证。LWD Online 在 8 个任务上平均成功率 0.95,长流程任务也能到 0.91。它的核心思路是把失败轨迹当训练数据用——他们攒了 652.5 小时的机器人操作数据,里面失败样本占了 34.8%,然后用离线转在线的强化学习方式让模型从这些翻车经验...

推荐理由:HKR三项都站得住:真机规模、任务数和成功率给了硬数字,失败轨迹占比这个数据点对同行有参考价值。不过具身智能的受众比基础模型窄,所以重要性定在78,不上头条。

量子位 · 公众号

新加坡国立等团队提出 ViF,专治多智能体协作时的视觉幻觉传染

多智能体系统里有个麻烦:一个模型看图说话出错,把错误描述传给下一个模型,下一个模型再添油加醋,幻觉就像滚雪球一样越滚越大。新加坡国立大学 LV-Lab 等团队搞了个叫 ViF 的方法,不改造模型本身,即插即用。核心思路是不再只传文字,而是把视觉信息打包成“视觉接力令牌”塞进对话流里,同时用分层注意力重分配让模型多看该看的地方。论文已被 ICLR 202...

推荐理由:这篇入选 ICLR 2026 的工作解决的是多智能体视觉问答里一个很实际的毛病:纯靠文字传递信息,幻觉会一个 agent 传一个 agent,越传越离谱。他们提出的 ViF 用视觉中继令牌和分层注意力重分配,把图像信息直接塞进通信链路,不改模型就能插进现有系统。我会先打个折——论文没披露实际部署的延迟和额外算力开销,这点先别太激动。但 8 个基准、4 种结构、10 款模型上的提升摆在那里,幻觉严重度平均砍掉三成以上,环形结构接近四成,对做多模态 agent 的人来说是个值得跟的方案。

量子位 · 公众号

OpenAI 正经解释 GPT-5.5 为什么爱说“哥布林”

OpenAI 发公告说,GPT-5.5 老把“哥布林”挂嘴边,是因为训练时给“书呆子”人设的回复打了高分,这个偏好通过强化学习和后续训练扩散开了。GPT-5.1 之后,ChatGPT 用“哥布林”的频率涨了 175%;书呆子风格的回复只占总回复的 2.5%,却贡献了 66.7% 的“哥布林”出现次数。核心问题是奖励信号有偏差,在强化学习的采样和生成、以...

推荐理由:我会先打个折,这不是什么重大能力发布,但 OpenAI 自己复盘模型行为偏差的料很实在。核心就一件事:他们给模型加了“书呆子”人格的奖励信号,结果这信号通过 RL、rollouts 和 SFT 扩散到完全无关的场景,让 GPT-5.5 动不动就 cue 哥布林。数字摆在那——175% 的用量飙升,2.5% 的回复源头——说明偏差放大效应有多猛。对做对齐和微调的人来说,这是个活生生的警告:奖励函数里一个看似无害的偏好,最后能在产品里闹出笑话。正文没展开他们具体怎么修的,但光这个诊断过程就值得从业者盯一眼。

4月29日星期三

新智元 · 公众号

清华团队花约10万美元、一周时间,让系统自动刷出105个SOTA

清华徐丰力团队和北京中关村实验室搞了个叫AutoSOTA的系统,放养式跑了一周,烧掉约220亿token,产出了105个所谓的最优结果。系统里塞了8个智能体,分别负责搭环境、修bug、排任务、想点子、做审计。每完整跑一轮平均5小时。最关键的是它设了条红线:不准改评估脚本和数据划分,靠这个来保证结果能复现。不过正文没披露具体在哪些任务上拿了SOTA,也没...

推荐理由:HKR三项全中:有具体数字和机制描述,审计约束让说法可验证。保留84分是因为这仍是单篇二次报道,不是模型或产品级发布,但选题和切入角度对从业者足够有信息量。

Computing Life · Share · 鸭哥调研

DeepSeek V4 技术解读:为 Agent 长任务做的工程取舍

这篇文章把 DeepSeek V4 的技术报告翻译成了人话,核心就讲一件事:为了让模型能稳定地跑完一个长链条的 Agent 任务(比如改代码、调工具、看日志反复几十轮),V4 在架构上做了哪些又贵又复杂的工程决策。文章拆解了三个主要矛盾。第一,百万级上下文不是光能装下就行,Agent 得随时回看历史里的报错和工具结果,V4 的做法是把注意力机制分成三层...

推荐理由:我会先打个折:正文没给参数量、训练数据、价格和发布时间,所以没法判断它到底多能打,只能当技术方向看。但 DeepSeek V4 把 100 万 token 上下文和 agent 负载绑在一起讲,还给了混合注意力、OPD 这些具体手段,对做 agent 落地的人有参考价值。信息缺口明显,所以重要性停在 78,不往上拔。

X · @dotey(宝玉)

港科大等十余所高校发 88 页综述,给“世界模型”画了一张统一地图

这篇综述先捅破一层窗户纸:做强化学习、视频生成、Web Agent 的人嘴里说的“世界模型”根本不是一回事,论文之间没法比。作者团队拉出一个“能力等级 × 领域法则”的二维框架,把 400 多篇工作摆到同一张桌子上。能力分三层:L1 只预测下一步,L2 能做多步推演且遵守领域基本规则,L3 能在预测翻车时自己诊断原因、设计实验、修正模型。领域分物理、数...

推荐理由:我会先打个折:这不是新模型发布,是一篇梳理定义的综述。但它的价值在于把“世界模型”这个被用烂的词拆成可验证的层级和领域法则,400 多篇文献、26.2% 的物理一致性通过率、A-Lab 的闭环实验数据,都让讨论从玄学回到工程。对从业者来说,下次再有人说“我们做了世界模型”,可以直接拿这篇的框架去问到底在哪个层级、遵守什么领域法则。

X · @OpenAI

GPT-5.4 Pro 帮数学家解决了一个 60 年没解开的 Erdős 问题

OpenAI 发推说,本月初一个悬了 60 年的 Erdős 问题在 GPT-5.4 Pro 的帮助下被解决了。推文里提到了 Sebastien Bubeck、Ernest Ryu 和 Andrew Mayne 三位研究员,但正文没披露具体是哪个问题、证明过程长什么样、能不能复现。我会先打个折:目前只有一条推文,没有论文或预印本链接,所以很难判断模型到...

推荐理由:这条消息的吸引力全在“60 年未解 Erdős 问题 + GPT-5.4 Pro”这个组合上,对 AI 从业者来说是个很强的信号。但正文只给了讨论数学研究变化的氛围,没给任何硬货——题目叫什么、证明怎么做的、能不能复现,全都没说。所以我会先打个折:钩子值一个 H 和 R,但 K 完全站不住,因为信息缺口大到没法判断模型到底干了多少活。这点先别太激动,等有论文或细节再重新评估。

4月28日星期二

量子位 · 公众号

南洋理工搞了个模糊指令测试,机器人成功率最多暴跌 36.9%

南洋理工 MARS 实验室发了 REI-Bench,专门测机器人怎么理解人话里的模糊指令。他们把模糊程度分了 9 个等级,拿 4 套机器人规划框架搭上 6 个小模型跑了一遍。结果 LLaMA3.1-8B 加 SayCan 这套组合,在多轮对话里成功率从 57.7% 掉到 46.9%。最要命的是隐含指代——比如“把那个拿过来”但不说清是哪个——基线成功率...

推荐理由:这篇论文没造新模型,而是用一套模糊指令基准把现有方案拉出来遛了一遍。36.9%的成功率跌幅很直观,说明机器人一碰到指代不清、上下文省略的人类说话方式就崩。测试覆盖了4种规划框架和6个轻量模型,对照做得扎实,不是单点自嗨。对做具身智能的人来说,这个基准比刷榜分数更有参考价值,因为它暴露的是真实部署里绕不开的问题。