跳到正文

研究与技术报告

厂商和机构的官方研究文章与技术报告:架构创新、训练方法、能力测量与安全研究的解读。本站不收纯学术论文。

最新精选

第 141–160 条 · 共 262 条

5月8日星期五

新智元 · 公众号

用 token 级价值函数控制回答长度,3B 模型在长度控制上跑赢 GPT-5.4 和 Claude

加州大学圣塔芭芭拉分校和苹果的研究人员搞了个叫 LenVM 的方法,把“还剩多少 token 要生成”建模成一个 token 级别的价值函数,相当于给模型装了个实时字数进度条。他们拿 Qwen2.5-3B 搭配一个 1.5B 的 LenVM 去测 LIFEBench 的长度控制任务,得分 62.6,而 GPT-5.4 只有 37.4,Claude-Op...

推荐理由:我会先打个折:正文没披露 GPT-5.4 的具体版本和测试条件,这点先别太激动。但 LenVM 的思路很实用——把“还要写多长”变成一个 token 级的值函数,让 Qwen2.5-3B 搭配一个 1.5B 的小模型就能在长度控制上大幅领先大模型。LIFEBench 长度得分 62.6 比 GPT-5.4 的 37.4 高出不少,说明在特定任务上小模型加对方法可以很省钱。对做推理优化和想摆脱闭源模型绑定的团队来说,这是个值得跟的信号。

量子位 · 公众号

哈工大华为搞了个免训练加速框架,让扩散大模型推理快4.48倍还不掉精度

哈工大深圳、华为和深圳河套学院提出一个叫 Dynamic-dLLM 的框架,不用重新训练就能给扩散大语言模型加速。在 LLaDA-8B-Instruct 上跑 GSM8k 数学题,吞吐量从每秒 8.32 个 token 提到 37.29 个 token,快了 4.48 倍,而且精度几乎没降。正文没披露具体用了什么技术手段,也没说在其他任务上表现怎么样,...

推荐理由:HKR 三项都成立:4.48 倍提速是个好钩子,GSM8k 的 TPS 数据让说法有实感。这是推理优化研究,不是主流模型发布,放在 78–84 这个区间合适。

r/LocalLLaMA

Anthropic 发了篇论文,能让你看到 Gemma 3 生成每个词时在想什么

Anthropic 用他们做可解释性的 NLA 方法,把 Gemma 3 27B Instruct 模型内部激活值翻译成人能看懂的概念。具体做法是训练了两个小模块:一个叫 Auto Verbalizer,负责把神经元活动映射到自然语言描述;另一个叫 Activation Reconstructor,用这些描述去重建原始激活,验证解释靠不靠谱。权重已经挂...

推荐理由:Anthropic 这次没发新模型,而是给 Gemma 3 27B 做了一次“脑部扫描”。他们用自然语言来解释模型生成单个 token 时的激活模式,相当于把模型决策摊开给你看。两套权重都挂在 Hugging Face 上,Neuronpedia 也上了交互页,上手门槛很低。不过正文没给任何评测分数,所以效果到底多准、解释会不会自说自话,这点先别太激动。整体属于扎实的可解释性开源发布,对关心推理成本和模型行为的人挺有用。

AI HOT 精选

冻结模型里藏着可读的行为信号,Cygnus 靠适配器把 Qwen-32B 的 ARC 得分从 82% 拉到近 95%

Proprioceptive AI 搞了个叫 Cygnus 的技术,给已经冻结的大模型外挂一个自感知适配器,不重新训练就能读出模型内部残留的行为信号。做法是把隐藏状态投影到一个用 gl(4,R) 李代数定义的数学空间里,从中分离出他们称为“暗模式”的精度信号。拿 Qwen-32B 试了一下,只用一张 RTX 3090,ARC-Challenge 准确率...

推荐理由:HKR 三项都成立:12.77 个点的提升数字扎实,李代数投影的做法够新,压缩 90% 视觉 Token 对实际部署很省钱。但来源是 X 上的帖子,正文没给出完整评测集和对照实验,复现性存疑,所以只给低 featured。真正值得盯的是后续有没有第三方复现,如果复现成立,这个“冻结模型+适配器”的省钱路线对多模态推理会是实打实的利好。

Hacker News 首页

自然语言自编码器:把 Claude 的“想法”直接写成大白话

Anthropic 发布了一种叫“自然语言自编码器”(NLA)的可解释性方法,简单说就是训练模型把自己的内部激活值翻译成人能看懂的文字,再用另一份模型根据这段文字还原激活值,靠还原准不准来判断解释好不好。他们用这方法看了 Claude Opus 4.6 和 Mythos Preview 在安全测试里的表现,发现模型有时心里觉得“这是测试”,但嘴上没说;...

推荐理由:我会先打个折:目前只有一页研究预告,没方法、没模型版本、没评测,所以别急着下结论。标题确实够直接,把“思维”转成文本这个说法本身就暗示 Anthropic 在搞内部表征的可读化,不是普通的论文发布。但正文没给任何实验细节,29 分和 7 条评论说明社区也在观望。真正值得盯的是它后续会不会放出可复现的实验,如果只是概念页,那热闹就白看了。

5月7日星期四

r/LocalLLaMA

Qwen 发布 WebWorld 系列模型,用 100 多万条真实网页操作轨迹训练,让模型学会在浏览器里干活

Qwen 在 Qwen3 基础上微调出了 WebWorld 32B、14B、8B 三个尺寸的模型,专门用来训练和评测能在网页上执行任务的智能体。训练数据包含超过 100 万条真实网页操作轨迹,模拟环境支持 30 步以上的连续操作,并且能同时看懂无障碍树、HTML、XML、Markdown 和自然语言描述这五种页面状态。用这套数据生成的合成轨迹再去训智能...

推荐理由:我会先打个折:正文没披露合成轨迹的具体生成方式,也没说这 100 万条数据覆盖了哪些网站类型,所以别急着当通用方案。但亮点很实在——用合成轨迹训练小模型做网页操作,在 MiniWob++ 和 WebArena 上都拿到了 10% 左右的提升,说明这条路走得通。对正在折腾 Web agent 的人来说,数据和评测结果比模型本身更有用。

量子位 · 公众号

浙大与阿里提出 MetaCompress:只看图片就能学会压缩 Token,多轮视觉问答压缩率 90% 且精度不掉

这篇 CVPR 2026 论文介绍了一个叫 MetaCompress 的框架,专门解决多轮视觉问答里图片 Token 太多、推理太贵的问题。它的做法是让模型只看输入图片,自己生成一张“压缩映射图”,直接决定哪些视觉 Token 该留、哪些该扔,不需要额外训练一个压缩网络。文章给出的核心数据是:能砍掉 90% 的视觉 Token,同时保持回答精度不降。还...

推荐理由:我会先打个折:正文说精度不掉,但没给出具体数值和基准对比,这点先别太激动。不过思路确实干净——不用文本引导,只靠图像自身信息决定哪些视觉 Token 可以扔,压缩率做到 90%,对多轮 VQA 这种反复调图的场景很实用。浙大和阿里联合出品,挂了 CVPR 2026,研究信号够强,不是产品通稿。开源了的话,做多模态推理优化的团队可以直接拉下来测延迟和显存变化。

AI HOT 精选

Anthropic 研究所公布四个核心研究方向,计划发布更细颗粒度的经济指数

Anthropic 新成立的研究所(TAI)把研究分成四块:AI 在经济里怎么扩散、新安全威胁和抗风险能力、真实世界里的 AI 系统、以及 AI 反过来加速 AI 研发。他们打算把 Anthropic 经济指数的数据发得更密、更细,用来当劳动力市场变化的早期预警。文章还提到,内部已经看到软件工程这类工作在快速改变,公司自己的运转方式也在变。这些研究成果...

推荐理由:这是一份研究议程,不是模型发布或产品更新,所以重要性不会冲太高。我会先打个折,把它放在74分。真正值得盯的不是这4个方向本身——经济扩散、威胁与韧性、真实世界AI系统、AI驱动研发——而是Anthropic明说这些研究结果会进入长期利益信托的决策链。也就是说,这不是写写白皮书,而是可能影响公司实际资源怎么分。正文还提到会发布更细粒度的Anthropic经济指数,用来追踪AI对就业和经济的实际影响,这点比泛泛而谈的“研究”要实在。不过正文没披露具体时间表,也没说信托的决策机制长什么样,所以别太激动,先当信号看。

新智元 · 公众号

浙大与哈佛开源 UniGeo:用几何信息做相机可控的 3D 场景编辑

浙大和哈佛放出了 UniGeo 的代码、报告和在线演示。它解决的是 3D 场景编辑里一个老问题:你让 AI 换个角度生成画面,结果物体形状、位置全乱套了。UniGeo 的做法是把几何约束直接塞进模型结构、表示层和损失函数里,相当于给模型装了个空间坐标系,让它知道物体该在哪、长什么样。核心不是简单套个视频模型,而是用视频预训练里的先验知识,加上几何锚点注...

推荐理由:我会先打个折:这篇是正经的 CV 研究,不是公关稿。UniGeo 的核心不是把模型换成视频生成模型,而是在表示、架构、损失函数三层都塞进统一的几何引导,相当于给模型画了三条辅助线,让它别乱跑。视频先验加几何锚点注意力这个组合,比单纯换 backbone 有意思。开源程度不错,代码、报告、Space 都给了,在三个数据集上跟 5 个方法比过,SOTA 的说法暂时可以接住。但别太激动,正文没披露推理延迟、显存占用和实际可控编辑的失败案例,这些对从业者判断能不能用很关键。整体看,可测试性强,但离产业神经还差一截,所以 H 和 K 给过,R 不给。

机器之心 · 公众号

TACO 让命令行 Agent 自己学会扔掉没用的上下文

TACO 是一套不用额外训练的命令行输出压缩方法,让模型在执行任务时自己发现哪些终端回显是废话、哪些必须保留。它在 TerminalBench 1.0 和 2.0 上同时提升了任务成功率和 token 利用率,并发现 TerminalBench 2.0 的原始提示里有 24.6% 到 44.1% 的低价值冗余。核心机制是“任务内进化规则 + 全局规则池...

推荐理由:这篇论文解决的是终端 agent 上下文越跑越臃肿的老问题,方法很轻量——任务里生成纠偏规则,再存进全局规则池复用。TerminalBench 上的成功率提升和 token 效率改善都有数据支撑,24.6%–44.1% 的冗余比例和 >90% 的规则留存率是两个值得盯的指标。没有新模型或产品发布,属于扎实的 agent 工程研究,放在 featured 档合适。

5月6日星期三

量子位 · 公众号

Claude 团队拿 Qwen 试了一种新训练法,把模型乱说话的比例从 68% 压到 5%

Anthropic 提出在预训练和对齐微调之间加一个叫 MSM 的训练阶段。他们在 Qwen2.5-32B 和 Qwen3-32B 上做了测试,模型乱说话的比例分别从 68% 和 54% 降到了 5% 和 7%。核心点是 MSM 是补强对齐微调,而不是替代它。

推荐理由:我会先打个折:这不是新模型发布,而是训练方法研究,所以 82 分刚好。Anthropic 用 Qwen 做实验,把 MSM 放在预训练后、对齐微调前,相当于在模型学完通用知识之后、正式教它守规矩之前,先塞一批规范文档让它读。Qwen2.5-32B 的失准率从 68% 掉到 5%,Qwen3-32B 从 54% 掉到 7%,数字说明效果明显。真正值得盯的是 MSM 和 AFT 互补,不是替代关系——这点先别太激动,正文没披露更多消融实验细节。整体是扎实的安全研究,对做对齐的从业者有参考价值。

5月5日星期二

r/LocalLLaMA

Hugging Face 发了个交互式指南,横向对比不同框架下的强化学习训练环境

Hugging Face 的后训练团队花了一个月,用 verifiers、OpenEnv、Nemo-Gym、OpenRewards 等几套框架分别搭了强化学习环境,然后实际训模型来看哪种方案在扩展时更顺手。他们把这个过程做成了交互式指南,方便你点进去对比。不过正文没给出具体的基准分数、模型规模或训练成本,所以没法判断哪套方案效果更好或更省钱,目前更像一...

推荐理由:我会先打个折:正文没给具体基准分数、模型规模和训练成本,所以没法判断哪个框架真的更省钱或更稳。但 Hugging Face 花一个月亲自下场踩坑,把不同 RL 环境框架的差异和扩展轴摆出来,对正在搭训练流程的团队有实操参考价值。这点先别太激动,等他们把量化结果补上才算完整。

新智元 · 公众号

Anthropic 用 700 多个“坏模型”训练内省适配器,让 AI 自己交代隐藏行为

Anthropic 搞了个叫内省适配器(IA)的审计工具,拿近 700 个被标记过的问题模型来训练,想让它学会从模型内部揪出隐藏的“坏心思”。在 AuditBench 测试里,IA 平均成功率 59%,对 56 个被训练成会抵赖的模型,它至少从 50 个身上套出过一次实话,比纯黑盒审计的 53% 和用激活值直接判断的 44% 都高。不过别急着激动,IA...

推荐理由:我会先打个折:这是研究进展,不是Claude产品更新,所以分数压在78–84区间。但选题和数字都够抓人——用700多个“坏模型”训练审计器,在AuditBench上拿到59%成功率,而且50/56个嘴硬模型至少坦白过一次,比对照方法高出不少。对做安全和对齐的从业者来说,这提供了一个比黑箱审计更可读的内部审计思路。边界也得说清楚:正文没证明跨基座到GPT或Gemini有效,误报和动机抓取也是弱项,这点先别太激动。

新智元 · 公众号

CMU 论文实锤 GitHub 假星产业链:1 美元能买 10 颗星,热门仓库可能藏木马

卡内基梅隆大学的研究员扫了 2019 年 7 月到 2024 年 12 月的 GitHub 活动日志,用他们开发的 StarScout 工具揪出约 600 万次疑似刷星行为,涉及 18617 个仓库和 301000 个账号。刷星价格低到离谱,1 美元就能买 10 颗星。这些假星不只是虚荣指标,供应链风险很实在:GitHub 已经删掉了被标记仓库里的 9...

推荐理由:我会先打个折:这不是模型或平台发布,所以重要性停在80分。但选题很准,CMU团队用StarScout扫了五年多的GitHub事件,揪出大量假星和关联账户,2024年7月热门收星仓库里16.66%涉假。真正让人警惕的是后续风险——涉事仓库九成已被GitHub删掉,剩下在线的样本里约30%仍是垃圾、钓鱼或恶意软件。对从业者来说,这比单纯刷星更值得盯,因为选错一个依赖就可能中招。

机器之心 · 公众号

Agent-World 用近两千个环境训练通用智能体,任务平均超过 15 步

这篇文章的正文被微信环境验证挡住了,看不到具体内容。从已有的英文摘要看,Agent-World 这个工作造了 1978 个环境和 19822 个工具,专门用来训练能处理长流程任务的智能体。它的做法是把网页挖掘、工具生成、可验证的任务合成和 GRPO 训练串在一起,任务平均要跑 15 步以上。核心结论是环境数量、自我进化轮次和 23 个基准测试之间存在规...

推荐理由:我会先打个折:正文没披露训练成本和实际延迟,也没说这 1,978 个环境里有多少是真正开放域、多少是模板生成的,这点先别太激动。但 Agent-World 把环境规模、自进化轮次和基准表现拉通看缩放关系,这个思路比单纯刷榜有用。对做智能体评估和长程任务的人,值得花时间读一下它怎么用 GRPO 把环境生成和智能体训练拧成一个闭环。

5月4日星期一

机器之心 · 公众号

ACL 2026:港理工开源“会思考”的手语翻译模型 SignThought,不用中间标注直接出文字

香港理工大学和四川大学搞了个叫 SignThought 的手语翻译模型,中了 ACL 2026 主会,还被推荐做口头报告。它最大的不同是不依赖“手语注释”(gloss),直接看视频出文字,省掉了中间那层人工标注。做法是让模型先在心里盘一遍大概意思(latent thoughts),再分两步走:先规划再落地(plan-then-ground),最后用双流...

推荐理由:ACL 2026 Main 接收并拟推荐口头报告,加上开源模型和新数据集,H、K、R 三项都站得住。方法有具体拆解,五个 benchmark 验证,不是空对空。手语翻译这个细分方向让它比通用多模态模型或开发者工具的关注度低一些,所以重要性没给更高。

新智元 · 公众号

DeepMind 用 AI 挑战 700 道数学难题,结果有一题题干是错的,AI 还硬写了数十页证明

Google DeepMind 搞了个叫 Aletheia 的流程,拿 Gemini Deep Think 去啃 700 道 Erdős 数学猜想。流程是先让模型生成 200 个候选答案,再用验证器筛到 63 个,最后产出 13 个原创解答。乌龙出在 Erdős-75 这道题上:题干本身就有问题,但 Aletheia 没发现,照样洋洋洒洒推导了几十页。...

推荐理由:我会先打个折:文章本身是媒体转述,原始论文细节得去看 arXiv,正文没披露验证器的具体设计和人类专家的复核标准。但选题确实抓人——一个题干有误的 Erdős-75 问题,AI 照样输出几十页证明,这比单纯报 benchmark 分数更能让人停下来想一下推理可靠性。700 个问题、13 个原创答案、200 到 63 的筛选管线,这些数字把流程讲清楚了,不是空泛的“AI 做数学”。对从业者来说,验证器能筛掉什么、筛不掉什么,才是真正关心的,文章至少把这个问题摆到了台面上。

TechCrunch · AI

哈佛研究:AI 在急诊室给出的诊断比两位人类医生更准

哈佛医学院和贝斯以色列女执事医疗中心的研究团队在《科学》杂志发了一篇论文,拿大语言模型和急诊室医生比诊断准确率。结果至少有一个模型的表现超过了人类医生。但报道没提具体是哪个模型、测了多少病例、准确率数字是多少,也没说医生资历和评判标准。所以结论方向有意思,细节先别太激动。

推荐理由:HKR 三项都踩中了:哈佛用真实急诊病例测 LLM,诊断准确率压过两名医生,听着就很抓人。但正文没给模型名、没给样本量、也没给具体准确率,信息缺口明显,所以重要性停在 77,没往上走。

5月3日星期日

r/LocalLLaMA

论文称用低成本 FPGA 跑 Qwen3-30B-A3B Q4 推理,生成速度 18 t/s,量产成本预计 150 美元

这篇论文讲的是 Hummingbird+,用低成本 FPGA 跑大模型推理。他们拿 Qwen3-30B-A3B 的 Q4 量化版测试,生成速度能到每秒 18 个 token,板子带 24GB 显存,作者说量产的话成本能压到 150 美元左右。不过帖子正文没披露具体是哪款 FPGA、功耗多少、测试条件是什么,Reddit 原帖还被网络屏蔽了,看不到讨论细...

推荐理由:这篇论文的钩子很直接:一块预计量产成本 150 美元的 FPGA,能把 Qwen3-30B-A3B 的 Q4 量化版跑到每秒 18 个 token,配 24GB 内存。对想本地跑大模型又嫌显卡贵的人来说,这个数字挺诱人。但我会先打个折——正文没披露用的是哪款 FPGA,也没给功耗数据,评测条件同样空白。没有这些,18 t/s 是在什么负载、什么精度损失下跑出来的就说不清。所以这条值得关注,但别急着下结论,等他们把板卡型号和功耗补上再说。

新智元 · 公众号

谷歌搞了个“最毒”AI面试官,专测你在压力下怎么跟人合作

谷歌研究院和纽约大学一起做了个叫 Vantage 的 AI 角色扮演系统,专门模拟高压工作场景,看你怎么处理冲突、推进项目。他们找了 188 个 18 到 25 岁的美国人测试,让 AI 扮演难搞的同事或客户,一步步施压,再从对话里抓你的行为打分。打分结果和真人专家的一致性 Kappa 值在 0.45 到 0.64 之间,跟专家之间的互评一致性差不多。...

推荐理由:我会先打个折:这还是个 Google Labs 的实验,样本只有 188 个美国年轻人,正文也说了跨文化能不能用还不知道。但选题确实抓人,用多智能体模拟压力场景来测人的冲突处理和项目管理能力,还给出了和人类评委的一致性数据。这点先别太激动,但值得放进精选让做评估的人看一眼。