Google DeepMind 发布 Co-Scientist 多智能体科研系统
Google DeepMind 在 Nature 发表 Co-Scientist 研究,推出基于 Gemini 的多智能体 AI 系统,可迭代生成、辩论和演化复杂科学问题的新假设。
推荐理由:原文披露了多智能体系统的三阶段协作机制与多个实验室的落地案例,可了解 AI 参与科学假设生成的具体路径。
厂商和机构的官方研究文章与技术报告:架构创新、训练方法、能力测量与安全研究的解读。本站不收纯学术论文。
Google DeepMind 在 Nature 发表 Co-Scientist 研究,推出基于 Gemini 的多智能体 AI 系统,可迭代生成、辩论和演化复杂科学问题的新假设。
推荐理由:原文披露了多智能体系统的三阶段协作机制与多个实验室的落地案例,可了解 AI 参与科学假设生成的具体路径。
Thinking Machines 终于又冒泡了,这次直接扔了个新模型 TML-Interaction-Small。总参数 2760 亿,是个 MoE 架构,实际干活时只激活 120 亿参数。它最狠的地方是把实时语音交互做进了模型骨子里,不再像以前那样给大语言模型外挂语音识别和合成模块。模型能同时听、说、看、想,用 200 毫秒一个的“微对话轮次”连续...
推荐理由:我会先打个折——基准分是 Thinking Machines 自己跑的,还没第三方复现,所以“超过 GPT 和 Gemini”先别太激动。但这条消息值得推,因为它给出了具体架构(276B MoE、12B 激活)、200ms 微轮次这个硬指标,还直接挑战了语音 agent 里常用的 VAD 方案。对正在搭实时语音管线的从业者来说,哪怕只是思路参考也有价值。
上海 AI 实验室、上海交大和中科大的团队拿 Qwen3-14B-Base 做长思维链的监督微调实验,发现模型在训练 8 轮后,跨领域的表现会先跌后涨,最终超过原始水平。他们总结出泛化要成立的三个条件:一是得把模型训得足够深,不能浅尝辄止;二是训练数据的质量和结构要过关;三是基座模型本身的能力得够强。正文没披露具体用了什么数据集,也没给出跨领域任务的具...
推荐理由:这篇论文的卖点很清晰:SFT 不是不能泛化,但得满足优化、数据结构和基模型能力三个条件。我会先打个折,因为目前只是 Reddit 上的一个帖子,没有看到论文全文或代码,没法验证他们说的 8 个 epoch 先降后升是不是稳定复现。不过这个发现对做开源微调的人确实有用,尤其是用 Qwen3-14B 这类模型时,怎么配长思维链数据、训多久,这篇至少给了一个可参考的曲线。HKR 三项都过得比较轻松,但因为没有独立复现和完整 benchmark,分数就停在 76,不往上拉了。
OpenAI 搞了个叫 Parameter Golf 的机器学习挑战赛,规则很硬:模型加代码总大小不能超过 16MB,训练时间只有 10 分钟(用 8 张 H100),看谁能在固定数据集上把测试损失压到最低。超过 1000 人提交了 2000 多次结果。我会先打个折,正文没披露最终冠军的具体分数,但重点讲了技术路数。最卷的方向是训练优化,有人把前人的好...
推荐理由:OpenAI 的 Parameter Golf 复盘靠一场实打实的比赛、1000多名参与者和2000多份提交撑住了 HKR 三项。它属于研究/基准信号,不是模型或产品发布,所以 78 分放在 featured 里偏低的那一档是合理的。我会先打个折:目前只有一篇 Reddit 帖子,没有独立复现,也没看到论文或代码放出来。
作者提出在强化学习训练时复用 prompt 缓存,专门针对那种提示很长、模型回复很短的任务。在 Qwen3.5-4B 上跑 16k token 提示、64 token 回复的例子,训练速度直接快了 7.5 倍。另一个 G=8 的例子更直观:1000 token 提示加 100 token 回复,原本要处理 8800 个 token,用这方法后实际只需处...
推荐理由:这是一篇 Reddit 帖子,作者把推理时常用的 prompt caching 思路搬到了 RL 训练里,在长提示短回答的场景下效果明显:Qwen3.5-4B 跑 16k 提示、64 输出 token 的任务,训练速度提了 7.5 倍。核心逻辑是 RL 训练时同一组 prompt 会被反复采样,把重复的 token 缓存起来不重复算,G=8 时实际要处理的 token 数从 8800 掉到 1800。这个数字说明去重效果确实好,但前提是 prompt 够长、回答够短,场景比较挑。正文没给代码或论文链接,也没有独立复现验证,所以分数先打个折,定在 78。
这篇 ICML 2026 的论文给扩散语言模型(dLLM)提出了一套叫 PRISM 的推理时扩展方法。它把搜索过程拆成三层:先让模型并行生成多条推理路径,再对每条路径局部“回退重写”不靠谱的步骤,最后用模型自己当裁判打分筛选。在数学题集 GSM8K 上,LLaDA-8B-Instruct 的准确率从 67.58% 拉到了 85.30%。最直接的好处是省...
推荐理由:这篇 ICML 论文给扩散语言模型做 test-time scaling,核心卖点是不靠堆算力硬拉分。PRISM 在 LLaDA-8B-Instruct 上把 GSM8K 正确率从 67.58% 提到 85.30%,靠的是三层搜索、局部 remasking 和自验证,把复杂度从 O(NT) 压到接近 O(N+KT)。我会先打个折:这只是单模型单数据集的实验,正文没披露在其他 benchmark 或更大模型上的表现,泛化性还不好说。但思路本身对做推理优化的人有参考价值,尤其适合预算有限又想压榨小模型推理能力的场景。
这篇技术报告介绍了 Qwen-Image-2.0,一个把生图和精确修图合到一个模型里的方案。它的做法是把 Qwen3-VL 当成“条件编码器”,去理解你输入的指令,再连上一个多模态扩散模型来出图。指令最长能塞进 1000 个 token。报告里说,这套架构在多语言文字渲染、画面排版质量、以及人工打分上都有提升,尤其适合文字多、构图复杂的场景。不过正文没...
推荐理由:HKR 全中:Qwen 的旗舰图像模型报告给出了具体架构、1K 令牌指令输入和编辑能力,国产旗舰模型的信号足够强,必须写。
我会先打个折:这项研究用的是 OpenAI 一年前发布的 o1 模型,按现在标准已经算旧版了。测试数据来自真实急诊室,信息混乱、不完整,模型给出的正确或接近正确的诊断率达到 67%,而参与对比的医生是 50-55%。差距在早期分诊阶段最明显,那时能拿到的信息最少。研究还提到 o1 在处理结构化病例时临床推理几乎不出错。不过正文没披露样本量有多大、医生是...
推荐理由:我会先打个折:这只是一项诊断研究,没覆盖住院数据和影像诊断,别急着说 AI 能独立看急诊。但《科学》背书加上 o1 在真实急诊病例上比医生高出十几个百分点,确实值得从业者看一眼。它说明在特定文本诊断任务上,旧模型已经能摸到甚至超过人类平均水平,后续怎么落地、怎么担责才是真难题。
这篇论文提出了 CreativeGame 框架,核心思路是让模型在写代码之前,先产出一份“玩法机制说明书”,把游戏规则、胜利条件、交互方式都定死,然后再分四步生成代码。这样做的好处是避免每次生成都像抽卡一样碰运气,也让后续迭代有据可依。评估部分用了两个硬性门槛:运行时错误和静态错误,不通过就直接打回,解决了评分虚高的问题。框架还引入了“谱系记忆”,同一...
推荐理由:这篇是游戏生成方向的研究框架,思路挺清楚,但正文没披露是否开源、有没有量化指标或实际落地案例。我会先打个折,放在 featured 里但不到必写级别。
Richard Sutton 团队给流式强化学习(就是来一条数据学一次、不存回放池的那种)开了个新方子,叫“意图更新”。核心思路很直白:先定好这次更新想让模型输出变多少,再反推学习率该设多大,用的还是 1967 年 Kalman 滤波里的一个公式。在 MuJoCo 机器人控制任务上,他们用纯流式、batch size 为 1 的训练方式,让 Inten...
推荐理由:我会先打个折:这篇是研究发布,不是产品级大新闻,所以分数不会冲太高。但 Sutton 的署名加上 Intentional Updates 在极端在线条件下的实验结果,确实给流式 RL 提供了一个很省算力的新思路。1/140 的 FLOPs 对比很直观,batch=1、无回放这些条件也贴近真实部署,对 RL 圈子来说信息量够硬。整体判断是强研究信号,但市场影响力有限,放在 78–84 这个区间合理。
华东师大和复旦的研究者发现,现在大模型训练时只盯着“下一个词”来猜,容易让模型变得自信但目光短浅。他们提出 Next-ToBE,训练时给模型一个“软目标”,让它同时参考未来几个词的信息,但推理时不用改,还是正常的逐词生成。在 Qwen2.5-Math-1.5B、Qwen2.5-Math-7B 和 Llama3.1-8B-Instruct 上跑了 36 ...
推荐理由:这篇论文的卖点很清晰:不碰模型结构,只把训练时“猜下一个词”的目标换成“看未来一小段窗口的软目标”,就在36组实验里赢了35组。我会先打个折——正文没披露用了多大的模型、什么规模的数据,也没给复现细节或生产环境的验证,所以目前只能当学术信号看。如果是真的,这种改目标不改架构的思路确实省钱,但别急着把它当成下一个训练范式。
浙大和腾讯优图在 ACL 2026 上发了 AdaMARP,让 AI 角色扮演不再只是你一句我一句,而是像导演一样调度四类消息:对话、旁白、场景描述和内心独白。框架里塞了个场景管理器,能根据剧情走向自动切分镜。训练数据从 81 部文学作品和 20 个合成主题里抽,评测集 AdaptiveBench 用 100 个种子场景来考模型能不能把故事讲下去。正文...
推荐理由:这篇 ACL 2026 的工作把角色扮演从“一问一答”拉到了多角色叙事,四通道消息和场景管理器是核心卖点,81 本书的数据集也算扎实。我会先打个折:它更像一个研究原型,没看到生产环境下的延迟、成本或安全约束,所以别急着想象它能直接跑在商业产品里。亮点在机制设计,短板在工程验证,整体值得关注但保持观望。
NVIDIA 放出了一个叫 Star Elastic 的模型,一个检查点文件里包含了 30B、23B 和 12B 三个尺寸的推理模型,不用额外训练就能直接“切片”取用。具体玩法是让 23B 的子模型负责思考过程,30B 的模型负责给出最终答案。在 AIME-2025、GPQA、LiveCodeBench v5 和 MMLU-Pro 这几个测试集上,这种...
推荐理由:我会先打个折:这还是个研究发布,不是大规模验证过的产品,影响力肯定比不上一个全新旗舰模型。但它的机制很具体——一个检查点通过“零样本切片”就能变出不同大小的推理模型,而且 23B 负责思考、30B 负责回答这种分工方式,在 AIME-2025 上确实跑出了 16% 的准确率提升和 1.9 倍延迟降低。对正在折腾推理部署的人来说,这种“一份权重、多种用法、精度可选”的思路,直接打中了成本和延迟的痛点,所以放在 featured 里是合适的。
Anthropic 一项专利披露了 Computer Use 的训练数据管线,核心不是录屏,而是把原始操作变成带推理链的数据。管线分三步:截获用户操作时允许附加思考标注,用多模态模型把点击坐标翻译成语义意图,再用更强的模型做合成扩展,一条真实轨迹变出几十条带推理变体的样本。学术数据集能训出跑 benchmark 的原型,但覆盖软件少、轨迹偏干净、缺少长...
推荐理由:这篇不是官方发布,是从专利里扒出来的分析,所以我会先打个折。但它把 Computer Use 的数据管线讲得很实在:先截屏记录人的操作,再用 transformer 推断操作背后的意图,最后让强模型把意图扩展成更多样的训练样本。对正在搭 agent 的团队来说,这套思路能直接参考,尤其是怎么把少量人工操作放大成训练数据。正文没披露具体模型规模和成功率数字,这点先别太激动。
MBZUAI 和 UCL 的研究人员直接扒了 Claude Code v2.1.88 的源码,没看公关稿,就看代码怎么写的。他们从里面挖出了 5 条设计哲学、13 条设计原则、7 层权限控制和 5 层上下文压缩策略。核心结论是:Claude Code 没追求做一个万能 agent,而是主动做减法,把模型塞进一个边界清晰、行为可控的工程框架里。比如它的权...
推荐理由:这篇不是 Anthropic 官方通稿,而是第三方扒源码做的分析,把 Claude Code 为什么这么设计、在哪做了让步讲得很透。标题的反直觉钩子够强,内容有 v2.1.88 的版本号和具体机制撑住,对正在踩坑的 Agent 开发者来说,比看十篇趋势报告都管用。不过毕竟是外部解读,不是一手发布,所以放在 featured 而不是 must-write。
谷歌 DeepMind 发布了一个叫 AI Co-Mathematician 的系统,它不是单个模型,而是一套异步协作的智能体工作区,专门用来做数学研究。在 FrontierMath 这个目前最难的数学基准测试里,它解开了 48 道 Tier 4 级私密题中的 23 道,正确率 48%。对比之下,GPT-5.5 Pro 的正确率是 39.6%。测试条件...
推荐理由:我会先打个折:正文没披露模型架构、训练数据和具体成本,所以没法判断这 48% 的含金量到底多实。但故事本身很抓人——牛津教授用这个系统解开了一个群论悬案,同时 FrontierMath Tier 4 这种非公开难题集上的成绩比 GPT-5.5 Pro 高了 8 个多点,说明在极难数学推理上确实往前走了一步。对做推理和 agent 的人来说,这是个值得盯的信号,但别急着把它当成通用数学家的雏形。
OpenAI 的翁家翌抛出了一个叫“启发式学习”的新训练思路,核心是不再靠梯度去更新神经网络权重,而是让模型通过修改代码、测试用例、回放记录和记忆来提升自己。他拿 Atari 游戏做验证,提到 codex gpt-5.4 在打砖块(Breakout)上拿了满分 864 分,并在 Atari 57 个游戏里生成了 342 条搜索轨迹。不过文章正文因为微信...
推荐理由:OpenAI 研究员翁家翌提了个叫 Heuristic Learning 的思路,不是官方产品发布,更像研究评论和开源信号。亮点是 codex gpt-5.4 在 Breakout 拿了 864 满分,Atari 57 上只靠 342 条搜索轨迹就让模型自己改代码、测试和记忆。我会先打个折:正文没披露这套方法在更复杂任务上的泛化表现,也没说计算开销多大,所以“下一个训练范式”这个判断先别太激动。但如果是真的,意味着不用梯度也能让模型在具体环境里持续变强,对做 agent 自进化的团队是个值得盯的参考。
AllenAI 放出了一个叫 EMO 的混合专家模型(MoE),总参数量 140 亿,每次推理只激活 10 亿参数。它最大的不同是训练时没按人类划好的学科(比如数学、代码)去分专家,而是让模型自己从 1 万亿 token 的数据里长出模块。结果是,跑特定任务时你只用挑出 12.5% 的专家,性能就接近全模型水平;而同样架构、同样数据训出来的普通 MoE...
推荐理由:AllenAI 和 Hugging Face 放出的 EMO,是个 14B 总参数、1B 活跃参数的 MoE 模型,用 1 万亿 token 训练。亮点是跑任务时只激活 12.5% 的专家,推理成本压得很低。不过正文没披露具体 benchmark 成绩和路由策略细节,这点先别太激动。它更像一个研究发布,不是前沿模型发布,所以给 featured 低档。
这篇是 ICLR 2026 的论文,讲的是英伟达 Cosmos Lab 和普渡大学搞的 Scenethesis 框架。它让语言和视觉模型组成一个 agent 闭环,根据文字描述生成 3D 场景。流程里加了视觉定位、基于 SDF 的物理约束,还有一个裁判模块来挑错。实验数据是:首次生成成功率约 72%,模型自己检查修正后能拉到 91%,碰撞率从 6.1%...
推荐理由:我会先打个折:正文没披露 72% 和 91% 是在什么数据集上跑的,也没说 judge 模块本身会不会出错,所以这个自检提升幅度先别太激动。但思路本身挺实在——让 agent 自己生成、自己检查、自己修,相当于给文生 3D 加了个质检闭环。SDF 物理约束这个点也值得留意,它不是纯靠视觉打分,而是用几何和物理规则卡了一道,理论上能减少穿模和浮空这种低级错误。对做机器人仿真和 3D 资产管线的人来说,如果这套流程真能稳定跑通,省下来的手工修场景的时间会很可观。
BAIR 这篇博客梳理了并行推理的最新进展,核心观点是:与其让外部规则替模型决定怎么拆分任务、开几个线程,不如让模型自己判断。文章介绍了 ThreadWeaver 和 Multiverse 两种方法,它们能让模型在解题时动态决定是否并行、开多少并行分支、以及如何汇总结果。相比传统的多数投票、树搜索或固定并行结构,这种自适应方式更省算力,也更贴合问题本身...
推荐理由:BAIR 的出身让这篇有基本可信度,HKR 三项都过关。文章把动态控制并行线程的机制讲清楚了,但我会先打个折:没给任何量化结果,也没说怎么复现,所以分数卡在 74 不动。这点先别太激动,等他们把延迟降幅和基准跑出来再说。