OpenAI 发布前沿 AI 训练安全案例早期指南
OpenAI 公布前沿 AI 训练安全案例的早期指南,涵盖技术防护措施、运营实践以及失准事件调查三方面。该指南旨在为前沿 AI 训练建立安全论证框架。
OpenAI 公布前沿 AI 训练安全案例的早期指南,涵盖技术防护措施、运营实践以及失准事件调查三方面。该指南旨在为前沿 AI 训练建立安全论证框架。
Google DeepMind 宣布与游戏开发商合作,用 AI 原型化全新游戏体验,并回顾了从 DQN 玩 49 款 Atari 游戏、AlphaGo、AlphaZero、MuZero、AlphaStar 到 SIMA 的游戏 AI 研究历程。
Google DeepMind 发布 AI Control Roadmap,一套用于构建和管理 Google 内部部署的高级 AI 的框架,采用纵深防御思路,在模型对齐之外增加系统级安全层,即便对齐不完美也能提供保障。
推荐理由:Google DeepMind 公开内部 AI Control Roadmap,给出把智能体当作内部威胁来监控与拦截的分层思路。
一位Reddit用户用1040组偏好样本(DV-DPO,一种让模型学会回答风格的方法)微调了Qwen2.5-7B,成本按Claude Haiku的API价格算大约3美元,没花钱请人标注。在特定领域任务上,这个微调模型的综合得分达到了Claude Haiku的96%。部署在4-bit量化的T4机器上,生成一次回答的延迟是11秒。不过正文没披露具体是什么任...
推荐理由:这条信息本身是个Reddit帖子,任务范围和评测细节正文没展开,所以分数先打个折停在74。但3美元、零标注、96% Haiku这几个数字组合在一起,对想省钱又不想雇人标数据的团队来说,是个值得看一眼的信号。
这篇 ICML 2026 论文给证据型问答任务设计了一个 ISR=1 的闸门:模型在不确定时直接闭嘴不答,而不是硬编。他们同时放出了 ntkMirror,一个免训练的开源实现,能在本地模型上跑。做法是让模型对同一问题看多份不同排序的证据,如果几次回答不一致就弃权。在留出的审计集上,幻觉率压到了 0.0%–0.7%,代价是大约 24% 的问题被主动弃权。...
推荐理由:这篇 ICML 论文和配套的 ntkMirror 实现,核心思路不复杂:让模型对同一问题看几份顺序不同的证据,回答不一致就闭嘴不答。在审计集上幻觉率确实压得很低,但约四分之一的问题被弃权,这个代价得看场景能不能接受。论文限定在证据型问答,别急着往开放域对话上套。开源免训练能本地跑是个加分项,但正文没披露不同模型尺寸下的延迟和资源消耗,实际部署前最好自己测一下。
OpenBMB 把 VoxCPM2 的技术报告和模型都放出来了,Apache 2.0 协议。这是个 20 亿参数的语音生成模型,用超过 200 万小时的多语言语音数据训练,能说 30 种语言和 9 种中文方言。它主要干三件事:按自然语言指令设计语音、可控地克隆声音,以及高保真地延续一段语音。技术方案上,它把语音拆成两步走——先用 16kHz 做语义编码...
推荐理由:HKR 三项都踩中了:200 万小时训练数据和 9 种方言是实打实的钩子,参数和协议信息也够新,对国内语音开发者有直接参考意义。分数定在 78 是因为技术报告正文没给出具体的评测基准和对比数字,实际效果和落地表现还不清楚,这点先别太激动。
这篇博客因为 Hugging Face 返回了 429 错误(请求太频繁),正文内容没抓到。从标题和摘要看,实验用 OpenAI、NVIDIA、OpenBMB 的模型和一个自己微调的 5 亿参数模型来驱动市场里的交易代理。他们试了三种干预手段都没能重现价格崩盘,最后是靠结算时强行改写价格才把崩盘做出来。我会先打个折:具体怎么干预、崩盘长什么样、数据量多...
推荐理由:我会先打个折:正文因为 Hugging Face 限流没抓到,具体干预怎么设计、崩盘长什么样、数据量多大都只能靠标题和摘要猜。但就现有信息看,五个模型经济体里崩盘凭空消失、只能靠结算作弊做出来,这个发现对代理可靠性和模拟真实性都是实打实的质疑。信息缺口明显,但角度够刁,值得推给从业者看一眼。
Google DeepMind 公布在塞拉利昂开展的预注册随机对照试验结果,使用 Guided Learning 的学生数学成绩比对照组提升 0.258 个标准差,相当于八周内取得约 1.2 至 1.7 年的常规学习进度。
推荐理由:原文给出塞拉利昂随机对照试验的量化结果与交互数据,可了解 AI 辅助教学在真实课堂中的效果边界。
openJiuwen 提出了 MANGO,一个多智能体流网络框架。它把强化学习、文本梯度(用自然语言反馈来调模型)和 Skip-k 机制(跳过不靠谱的中间步骤)揉在一起,让一群模型自己学会怎么组队、怎么分工。用 GPT-4o-mini 跑分,在 MATH500 数学题上比 MaAS 准确率高了 12.8 个百分点,在 DROP 阅读理解上比 AFlow...
推荐理由:我会先打个折:这还是个研究框架,不是大模型或平台级发布,所以别当重磅炸弹看。但 HKR 里 K 最扎实,机制和数字都给出来了,MATH500 上 +12.8% 的差距不算小。H 和 R 靠“流网络”这个角度撑住,对搞多智能体协作的人有参考价值。正文没提开源代码链接,这点先别太激动。
阿里 RTP 团队发了 RTPurboV2,思路很直接:把模型里 85% 的注意力头换成滑动窗口注意力(SWA),剩下 15% 负责长距离检索的头用低秩投影、聚类和动态 top-p 压缩。适配训练只要大概 600 步、约 100 万条标注 token,Prefill 阶段推理加速最高到 9.36 倍。不过正文因为环境验证失败没抓到具体实验细节和模型规模...
推荐理由:阿里 RTP 团队这篇 RTPurboV2 思路很直白:把模型里大部分注意力头换成便宜的滑动窗口,只留一小撮头用低秩投影和聚类做长距离检索,训练成本压到 600 步、100 万条 token,Prefill 加速最高能到 9.36 倍。这个数字我会先打个折,因为正文自己说环境验证失败没抓到实验细节和模型规模,所以加速比在什么尺寸、什么长度下测的还不清楚。但思路本身对做长上下文部署的人有参考价值,属于工程信号强但缺完整验证的那种。
UIUC 和 Chroma 发布了一个叫 Harness-1 的检索子智能体,参数量 200 亿,基于 gpt-oss-20b 训练。它被放在一个“有状态搜索框架”里用强化学习训练,简单说就是模型在搜索时能记住上一步干了什么,再决定下一步怎么查,而不是每次都从头瞎找。在 8 个基准测试上,它的平均整理召回率是 0.730,比目前最好的开源子智能体高出 ...
推荐理由:HKR三项都站得住:Harness-1把强化学习和有状态搜索结合,机制讲得明白,基准测试结果也给了具体数字。分数定在78-84区间,因为它是个子智能体的研究发布,不是大厂主力模型,但开源圈确实需要这种能打的检索方案。
这篇 ICML 2026 的论文提出了一种叫 FusionRoute 的多模型协作方法。它不直接合并模型,而是冻结住几个专家模型不动,只训练一个轻量的路由器。这个路由器会在生成文本的每一个 token(词或子词)时,实时挑选一个最合适的专家模型来输出,同时把路由器的判断分数和专家模型的输出分数揉在一起,让最终选择更准。论文在 GSM8K、MATH-50...
推荐理由:这篇 ICML 2026 的 FusionRoute 论文,核心是让几个冻住的专家模型在生成每个 token 时都能被一个轻量路由器实时挑选,还加了自我修正来纠错。思路确实有意思,但文章没给出具体的性能提升数字、代码链接和实际部署成本,所以我会先打个折,放在 featured 里偏低的档位。
UC Berkeley 和普林斯顿的研究者给“隐式思维链”找了理论依据。他们提出 Log-ICoT 方法,用 k 奇偶校验任务做实验:当 k=16 时,训练阶段从传统方法的 15 步砍到 4 步。论文证明,在简化假设下,一个 L 层的 Transformer 可以通过 log₂k 个课程阶段把推理步骤内化到模型里,不用再像显式思维链那样一步步往外蹦字。...
推荐理由:这篇论文给“隐式思维链”找了理论依据,不是光靠实验撞大运。我会先打个折:目前只在k奇偶校验这种玩具任务上验证,正文没披露真实NLP任务上的表现,所以实际能省多少算力还不好说。但亮点在于,他们用log₂k个课程阶段就让Transformer把推理步骤内化进模型,k=16时训练步数从15砍到4,这个压缩比挺直观。Stuart Russell参与也增加了可信度。对做推理优化的人,这是个值得跟的理论方向,只是别急着往生产里搬。
这篇文章的正文被微信环境异常页挡住了,看不到具体技术细节。从标题和现有摘要看,快手可灵和城大合作了一个叫 VLM-as-Teacher 的方法。思路是在测试阶段用视觉语言模型(VLM)给视频生成模型(VGM)的 LoRA 模块打分反馈,边生成边优化,让模型学会按文字规则推理。他们搞了个 VBVR-Bench 基准,分数从 0.666 提到了 0.781...
推荐理由:正文被微信环境异常页挡住了,看不到技术细节,这点先打个折。但从标题和摘要看,快手可灵和城大搞的 VLM-as-Teacher,思路是在测试阶段让视觉语言模型给视频生成模型的 LoRA 打分,边跑边调,让模型学会按文字规则推理。VBVR-Bench 上分数从 0.666 提到 0.781,说明规则遵循能力有明显提升。方法本身有巧思,不是换模型架构,而是在推理时加一层在线优化,对可控视频生成是个实用方向。信息缺口在于没看到具体实现和消融实验,等正文能看了再补判断。
这个项目用四家不同实验室的小模型(OpenAI 的 gpt-oss-20b、OpenBMB 的 MiniCPM3-4B、NVIDIA 的 Nemotron-Mini-4B 和一个自己微调的 0.5B Qwen)分别扮演市场里的不同角色,玩家则充当幕后金主,可以放贷、散布真假内幕消息、做空和贿赂。模型之间的差异本身就是卖点,让市场博弈更像真的吵架而不是念...
推荐理由:我会先打个折:这只是个实验项目,不是产品。但它的切入点很巧——用小模型之间的差异来制造博弈感,而不是硬靠 prompt 演。技术细节也够实在,vLLM 版本冲突、0.5B 模型的表现数据都摆出来了,做 agent 的人能直接参考。正文没披露微调那 0.5B Qwen 的具体数据配方,这点先别太激动。整体值得一看,放在低 featured 合理。
这篇论文提出 Domino,把推测解码(让一个小模型先快速起草、大模型再校验)里的两个步骤拆得更干净:因果建模和自回归起草不再绑在一起跑。在 Qwen3 上测出了最高 5.8 倍的吞吐提升。不过 Reddit 帖子本身被屏蔽了,正文没披露具体用了什么硬件、基线怎么设的、数据集和接受率这些关键细节,所以这个 5.8 倍是在什么条件下跑出来的还不清楚,先打...
推荐理由:这篇的核心卖点是 5.8 倍吞吐提升,但 Reddit 帖子被屏蔽了,正文没写用什么硬件、基线怎么设、数据集和接受率这些关键信息,所以这个数字是在什么条件下跑出来的还不清楚,先打个折。不过思路本身有意思:把起草和校验拆干净,代码和模型也开源了,对搞推理优化的人值得看一眼。
这篇推文本身因为微信环境验证没抓到正文,我只能根据标题和已有英文摘要来说。PhysX-Omni 是一个 3D 生成框架,特点是生成出来的模型不是只能看,而是直接带物理属性,能区分刚体、软体和带关节的物体,扔进仿真器就能跑。配套的数据集 PhysXVerse 有超过 8700 个物理 3D 资产,覆盖 2900 多个类别。对做机器人仿真的人来说,省掉了手...
推荐理由:标题说打通全链路,但正文没抓到,只能按摘要判断。PhysX-Omni 解决的是仿真资产从能看升级到能跑的问题,省掉了手动标物理属性的脏活。8700+ 资产和 2900+ 类别说明数据集有一定覆盖面,不过没披露资产质量、仿真精度和实际跑分,效果还得等模型放出来再看。大晓机器人和南洋理工的组合在机器人圈有认知度,但放到整个 AI 圈声量中等,所以卡在 featured 门槛上。
普林斯顿的研究员搞了一套叫 Goedel-Architect 的智能体系统,专门让模型在 Lean 这种形式化证明语言里自动做数学题。他们拿 DeepSeek-V4-Flash 跑 PutnamBench 数学竞赛题,672 道题里正确率到了 75.6%,API 调用费总共才花了 294 美元。对比之前 Hilbert 系统用别的模型达到 70.0% ...
推荐理由:普林斯顿团队搞了个叫Goedel-Architect的智能体系统,让DeepSeek-V4-Flash在形式化证明语言Lean里自动做数学题。PutnamBench 672道题正确率75.6%,API调用费总共294美元,对比之前Hilbert系统用别的模型达到70.0%却花了约17万美元,成本差了近500倍。这个对比很直观,数字也扎实,但正文没详细拆解294美元是怎么算出来的,也没说Hilbert那17万是不是包含了大量试错和人工调参。所以“500倍”这个说法可以先打个折看,不过即使有水分,成本优势依然明显。整体还是偏学术研究,离工程落地有距离,...
一个开发者拿Qwen2.5-3B(30亿参数的开源小模型)做了个多智能体模拟:五个角色在森林里各自生产、交易、囤货,跑了15轮。模型在100%的调用里都能输出格式正确的JSON,这点挺稳,但一到经济决策就露怯——它分不清该囤柴还是该卖蜜。作者靠两招补救:一是给环境加限制,比如食物会坏、冬天缺燃料,逼着模型做取舍;二是优化提示词,直接写明“别买自己生产的...
推荐理由:HKR全过。标题本身就抓人——3B小模型跑经济模拟,不是那种千篇一律的benchmark刷分。正文给了实打实的交易数据和基尼系数变化,不是空谈“涌现行为”。对做agent模拟的工程师来说,模型100%输出合法JSON这点很实用,但经济决策拉胯的坑和两条补救措施(环境约束、提示词优化)才是真正能省时间的干货。这只是一份个人工程报告,不是产品发布或框架开源,所以保持在featured门槛上,不往上拔。
谷歌研究院和谷歌云一起搞了个叫“跨语料库检索”的框架,用在 Gemini 企业智能体平台上,本质是让多个 AI 代理分工合作:一个负责理解问题并拆解计划,一个负责改写查询词,一个负责把问题路由到最合适的数据库,还有一个反复去搜、去验证。这套流程比传统 RAG(给模型外挂资料库直接查)在事实类数据集上准确率最多高出 34%。文章没细说测试用的具体数据集规...
推荐理由:谷歌把 RAG 拆成多个代理分工干活,在事实类数据集上准确率最多高出 34%,这个数字挺抓人。不过文章没披露测试用的具体数据集规模和难度,所以这个 34% 的含金量得打个折看。另外,框架绑在 Gemini 企业平台上,有给自家云服务带货的味道,所以分数没给到纯研究框架那档。
这篇推文本身被微信的环境验证挡住了,正文内容没抓到。从标题和已有的英文摘要看,MetaFine 是一个诊断式的元评测框架,专门拆开看机器人在精细操作上的理解、感知和行为三个环节,而不是只给一个“成功/失败”的二元结果。研究团队说,传统只看最终成功率的评测方式,对精细操作能力的评估会虚高最多 70%。具体怎么测的、用了哪些任务和模型,正文没披露,没法展开。
推荐理由:标题和摘要抛出的 70% 虚高数字很有冲击力,MetaFine 的三轴诊断思路也确实比只看成功率进了一步。但正文被微信环境验证挡住,具体任务、模型和实验细节全是缺口,没法核实。所以它是一篇有钩子、有新知但信息不完整的二次评论帖,放在 featured 门槛上刚好,不宜再拔高。
CMU 和马里兰大学的研究者给大模型加了一个“睡眠”机制。具体做法是:当模型处理长文本、上下文窗口(L-token)塞满时,不直接丢掉旧的 KV 缓存,而是先跑 N 轮离线的循环前向传播,把当前信息压缩更新到 SSM(状态空间模型)的快速权重里,然后再清空缓存。论文在 GSM-Infinite 任务上拿 Jet-Nemotron 2B 模型试了试,设 ...
推荐理由:HKR 三项都过:钩子强,知识点有可复现的机制和 Jet-Nemotron 2B 的实测数字,也踩中了中美算力效率竞赛的神经。但它仍是一篇早期论文,不是产品发布或行业级事件,所以刚好卡在 featured 门槛上。
这篇 ICML 2026 的论文直接动手试了三种省参数的方案:让 Key 和 Value 共用一套投影(Q-K=V)、让 Query 和 Key 共用(Q=K-V),以及三者全共用(Q=K=V)。后两种会让注意力图变成对称的,作者用 2D 位置编码来打破对称性。实验覆盖了合成任务、图像分类和语言模型,最大跑到 12 亿参数、100 亿 token 的训...
推荐理由:这篇 ICML 2026 论文没搞理论推导,直接动手试了三种省投影的方案:Key 和 Value 共用一套(Q-K=V)、Query 和 Key 共用(Q=K-V),以及三者全共用(Q=K=V)。后两种会让注意力图变成对称的,作者用 2D 位置编码来打破对称性。实验从合成任务一路做到 12 亿参数的语言模型,最大跑了 100 亿 token。结果挺实在:Q-K=V 方案在语言模型上几乎不掉点,但 KV 缓存直接砍半,推理成本能省不少。不过这是架构研究,不是落地产品,而且论文里没提法案文本和执行时间表——那部分只是公开信呼吁,还没变成法律。所以放在 ...
Anthropic 发了一篇文章,讲他们内部怎么让 Claude 越来越多地参与 AI 开发。核心概念是“递归式自我改进”——让 AI 系统能完全自主地设计和开发自己的下一代。他们说自己还没到那一步,但趋势在加速。文章给了几个内部数据:到 2026 年 5 月,Anthropic 合并的代码里超过 80% 是 Claude 写的;工程师现在平均每个季度...
推荐理由:H 和 R 都过了:标题钩子强,话题本身也切中前沿模型的安全焦虑。K 没过是因为这只是一封公开信和政策呼吁,不是已生效的法律,正文也没披露具体机制或模型细节,信息密度撑不起更高评级,放在 featured 合理。
Together AI 和悉尼大学、UIUC 搞了个叫 OSCAR 的 2-bit KV Cache 压缩方案,每个 KV 元素实际只占约 2.28 bit,在 Qwen3-4B-Thinking 上跑分 71.86,比 TurboQuant 高出 40.1 分。简单说就是把模型推理时占显存的大头——键值缓存——压到极低精度,还尽量不丢性能。正文没披露...
推荐理由:HKR 三项都站得住:OSCAR 把 2-bit KV Cache 从纸面推到线上,还给了实打实的分数和对比。不过话题本身还是底层推理优化,放 featured 比放头条更合适,做推理基建的人会点进去看。
小鹏在 CVPR 2026 上公开了他们的世界模型技术栈,包含 X-World、X-Foresight 和 X-Cache 三个部分。X-Cache 能砍掉约 70% 的重复计算,相当于让模型推理时少做无用功。第二代 VLA 模型用了超过 4 万亿个 token 训练,这个量级说明训练数据投入很大。车端推理延迟压到了 80 毫秒,对实时驾驶决策来说这个...
推荐理由:我会先打个折,这毕竟是小鹏在顶会上的技术展示,不是独立验证过的第三方评测,所以分数没给到 85 以上。但选题确实抓人:CVPR 舞台上让北美自动驾驶三巨头听一家中国公司讲物理 AI,本身就制造了对比。信息量也够,X-Cache 的七成重复计算缩减、4 万亿 token 的训练规模、80 毫秒的车端延迟,都是能直接拿来讨论的指标。正文没披露 X-Cache 具体在什么场景下测出这个节省比例,也没说 80 毫秒是平均还是 P99,这点先别太激动。整体看,对做自动驾驶和端侧模型的人有参考价值,也踩中了中美技术竞争的神经,所以放在 featured 位置。
这三篇论文都进了 CVPR。GraspGen-X 用 20 亿次模拟抓取训练,让机械手能处理没见过的物体,但正文没披露真实世界的抓取成功率。LCDrive 把自动驾驶的推理 token 砍了大约一半,靠的是让模型直接输出轨迹而不是先写文字再转成动作,延迟更低,不过没提极端场景下的安全性验证。NitroGen 在 1000 多个游戏里跑了 4 万小时的交...
推荐理由:NVIDIA 在 CVPR 放出的三篇论文,每篇都带着实打实的数字:GraspGen-X 用 20 亿次模拟抓取训练机械手,LCDrive 把自动驾驶模型的推理 token 砍掉一半,NitroGen 在 1000 多款游戏里攒了 4 万小时交互数据来训游戏 agent。我会先打个折——这是厂商研究打包发布,不是新模型或产品上线,所以重要性停在 78 分。但信息密度够高,对做机器人、自动驾驶和游戏 agent 的人有直接参考价值,尤其是用合成数据替代真实采集、降低推理延迟这两条思路,正文没披露具体硬件环境和延迟数字,这点先别太激动。
这篇文章正文被微信环境验证挡住了,看不到具体内容。从标题和已有的英文摘要看,Junpeng Zhang 他们发现,用高度同质化的数据做 SFT 时,有效训练窗口其实很短,大概几百到一千步左右。他们搞了一个基于交互信号的预警方法,能在 loss 差距还没拉大之前就检测到过拟合,据称能省下 30% 到 50% 的训练算力。不过具体怎么检测、实验怎么设计的,...
推荐理由:这篇论文没画大饼,直接给了一个可操作的结论:同质化数据做 SFT,有效训练步数很短,几百到一千步就差不多了。他们还提出一种交互机理预警,能比传统看 loss 更早发现过拟合,实测能省下 30% 到 50% 的算力。对天天在调参、担心过拟合又心疼显卡钱的人来说,这个发现挺实用。不过正文没披露实验用的模型规模和具体数据配比,实际省下来的算力在不同场景下会打多少折扣,还得自己试。
蚂蚁灵波和港科大搞了个叫 LingBot-VA 的模型,把“预测画面接下来怎么变”和“判断该做什么动作”合到一个自回归框架里。论文说,每个任务只用 50 条真实世界的演示数据微调,在 RoboTwin 2.0 的简单和困难设定下,成功率分别到了 92.0% 和 91.1%。不过原文因为微信环境异常没抓到,具体实验细节和泛化边界暂时看不到,这个成功率数字...
推荐理由:标题的“50条数据”是个强钩子,对数据成本敏感的从业者吸引力很大。文章把自回归因果世界模型的机制讲得比较清楚,就是让模型先预测画面变化再决定动作,不是黑箱。但全文只有一篇论文发布,没看到开源代码、实物测试视频或跟主流基线(比如扩散策略)的量化对比,验证强度不够。所以重要性给78,属于值得关注但别急着全信的研究发布。
这个框架叫PhysX-Omni,目标是让生成的3D模型直接能进物理仿真跑起来,不用再手动修。它把刚体、软体和关节体三类物体的生成统一到一个流程里,省掉了以前要分开处理的麻烦。配套的PhysXVerse数据集有8700个资产,覆盖2900个类别,规模不小。评测基准PhysX-Bench从几何、尺寸、材质、可交互性、运动学和文字描述六个维度打分,但正文没披...
推荐理由:统一物理 3D 生成这个钩子很清晰,数据集和评测基准的规模也给了实锤,对做机器人仿真的团队确实有用。不过正文没提开源、没提落地案例,也没说生成质量跟现有方案比到底好多少,所以分数先不打满,78 分合理。
微软 MAI-Thinking-1 的技术报告没在吹模型多会解题,而是在讲怎么让强化学习训练别崩。他们给 GRPO 算法打了三个补丁:一个像恒温器一样动态调节模型的“自信度”,防止它变得死板或乱猜;一个像断路器,在梯度爆炸时直接截断,保住整批训练数据;还有一套自蒸馏抢救流程,训练万一崩了,能把之前学会的推理能力搬到新模型上继续跑。这三个机制合起来,让模...
推荐理由:标题把卖点从“会思考”转到“持续思考”,一下就把训练崩溃这个真问题拎出来了。三种机制的名字虽然有点包装感,但至少给了具体抓手:恒温器控波动、断路器防崩、自蒸馏保风格。正文没披露具体实验数据和复现条件,所以“几千步不崩”这个数字先打个折看。整体对做推理模型训练的人有参考价值,但离落地验证还差一口气。
MAI 从 487 万个开源 PR 里筛出 26.5 万道可训练题目,又为它们建了一套三层判分体系。AI 编程这两年真正的变化不是模型变聪明了,而是训练基础设施被工业化了:出题从手工活变成了流水线,批改也从“单测全绿就行”升级到能检查工具使用效率和前端视觉质量。
推荐理由:这篇文章没发模型、没给跑分,但把“vibe coding”之后该看什么讲清楚了:训练数据怎么筛、判分怎么搭、工程成本怎么控。487 万 PR 筛到 26.5 万题,这个压缩比本身就说明他们在做苦活,不是随便抓一把数据就训。三层判分体系正文没展开细节,但至少表明他们知道代码题不能只靠单次通过率来评。我会先打个折:没看到开源计划、也没看到实际训练出来的模型效果,所以目前更像一套训练基础设施的思路,离可复现的结论还差一步。对正在考虑自训代码 agent 的团队来说,这篇值得看,但别急着当标杆。
微软发了 MAI-Thinking-1,一个混合专家(MoE)模型,总参数 1 万亿但每次只激活 350 亿,跑起来相对省算力。它用 30T token 从零预训练,没拿第三方模型做蒸馏,这点比较硬气。微软管自己的迭代优化流程叫“爬山机器”,听着像在反复试错往上拱。成绩单上,AIME 2025 拿了 97.0%,LiveCodeBench v6 拿了 ...
推荐理由:微软发了 MAI-Thinking-1,一个 MoE 架构的推理模型,活跃参数 35B,总参数 1T,用 30T tokens 从零开始预训练。我会先打个折:正文没给任何跑分、开放方式或定价,所以没法判断实际水平。光看参数规模,35B 活跃部分在推理时成本不会太高,但 1T 总参数意味着训练和存储都不便宜。这点先别太激动,等有 benchmark 和访问方式再说。
这篇论文提出了 DataMaster,一个让大模型自己当数据工程师的流程。它不碰模型结构和训练算法,只做三件事:自动搜索外部数据、清洗脏数据、把多个数据集拼成一张表。在 MLE-Bench Lite 这个机器学习竞赛基准上,DataMaster 把奖牌率从 35.91% 提到了 68.18%,几乎翻倍。正文没披露具体用了哪些模型、单次任务耗时和额外算力...
推荐理由:DataMaster 做的事很直接:模型和训练代码都不动,只让系统自己去搜、洗、拼数据,结果 MLE-Bench Lite 奖牌率从 35.91% 拉到 68.18%,接近翻倍。我会先打个折——这还只是单篇研究,没有生产环境验证,benchmark 本身也不是完整 MLE-Bench,所以别急着当银弹。但“数据工程自动化”这个方向确实戳中很多团队的日常痛点,加上数字够具体,给 78 分 featured 合理。
这篇文章的正文被微信环境验证挡住了,实际内容没抓到。从标题和摘要看,Banafsheh Rafiee 和 Richard S. Sutton 提了一个叫“生成认知”的框架,给 AI 立了四根柱子:经验、感知与行动不可分、自主性、具身性。说白了就是主张智能不能光靠看数据,得在跟环境互动的过程中长出来。但具体怎么实现、有没有实验,正文没披露,这点先别太激动。
推荐理由:这篇是 Sutton 和 Rafiee 的新论文解读,核心是提出“生成认知”框架,主张智能体得靠经验、感知和行动绑在一起、自己定目标、还得有身体去试错。我会先打个折:正文没披露实验、代码或可复现的测试,目前还停在概念层。但 Sutton 的名气和四个支柱的提法,让它有资格进 featured,属于研究评论向的必读。
Google DeepMind、Anthropic 和 Meta 都在研究 AI 能不能产生意识,以及这对人意味着什么。但正文被付费墙挡了,没披露具体用什么方法、有没有时间表、怎么才算“有意识”的评判标准。
推荐理由:我会先打个折:标题很抓人,但正文几乎没给干货。三家大厂在研究 AI 会不会产生意识,这确实是个能吵起来的话题,安全和对齐方向的人都会关注。可文章没披露他们怎么定义“意识”、用什么实验验证、有没有阶段性结论,连时间表都没有。所以这条只能当个信号看,别太激动。基于信息缺口,重要性停在 72,放在 featured 里提醒大家有这么个动向就够了。
JetBrains 在 Hugging Face 上开源了 Mellum2,一个从零开始训练的混合专家模型。它总共有 120 亿参数,但每次计算只激活其中的 25 亿,这让它跑起来比同尺寸模型快了一倍多,适合对延迟和吞吐量要求高的场景。模型专门处理文本和代码,不做多模态,主要用在路由分发、外挂资料库检索、摘要和子智能体这些需要频繁调用模型但不必上大模型...
推荐理由:HKR 三项都过,但正文只给了 12B 和 MoE 这两个信息,没放跑分、没提许可证、没写上下文窗口,也没说怎么跟自家 IDE 集成。先按中等量级的模型发布处理,放在 featured 里偏低的档位。
这期 Import AI 聊了几件事。美国 AI 经济的真实增速可能被严重低估了:名义 GDP 在 2025 年约 2500 亿美元,但算上质量提升,实际年增速接近 2600%。之所以在常规统计里看不出来,是因为 AI 推理价格跌得和性能涨得几乎一样快,而且数据中心建设规模还没大到能明显拉动 GDP。作者提醒,AI 跟过去的半导体、互联网不一样,它可能...
推荐理由:这篇是 Import AI 的周报汇总,不是一手突发新闻,所以我会先打个折。但它的选题角度很刁钻,把“AI 灭绝风险”当成一个可以算账的经济问题来聊,比单纯喊安全口号有意思。里面给的美国 AI GDP 数字和质量调整增速,能让读者对行业体量有个具体感知。监督那部分也点出了当前对齐工作的实际困难,不是空谈。整体信息密度够,对关注 AI 政策与安全的从业者有参考价值。
作者用一张 12GB 显存的 RTX 3060 训练了一个叫 Mamba-Titan-1.4B-Reasoning 的模型。做法是把一个 1.4B 参数的 Mamba-1 主干完全冻结,只在第 24、25 层外挂了 8 个可训练的专家臂,组成一个总参数量 2.54B 的混合专家模型,每次推理只激活其中 2 个专家。数学题准确率大概做到 50%。正文没披...
推荐理由:这是一篇 Reddit 个人实验帖,不是论文,也没有独立复现,所以我会先打个折。但它的价值在于把一次失败解剖写得清楚:在单张 RTX 3060 上,冻结 Mamba 主干、外挂 8 路 MoE 做推理,最后数学准确率卡在 50% 左右。正文没披露训练时长和具体数据集,这点信息有缺口。对想用消费级显卡折腾推理模型的从业者来说,这篇能省掉一次踩坑,属于低门槛、有参考意义的 featured 内容。
这篇综述把“评分标准(Rubrics)”这件事拆成了五个部分来讲:定义、怎么构建、怎么用来训练、怎么用来评估、以及还没解决的难题。它想回答一个很实际的问题:在模型能自己调用工具、走流程干活的 Agent 时代,光看答案对不对已经不够了,得有一套更细的尺子来衡量“好答案”到底好在哪里。正文没披露具体的实验数据,更像是一张研究地图,帮从业者快速看清这个方向...
推荐理由:这篇综述没发布新模型或产品,但 40 页的框架对 agent 评测很有用,我会先打个折,放在 featured 档。正文没披露具体实验数据,更像文献梳理,但问题意识够强,从业者能直接拿来对照自己的评估流程。