跳到正文

研究与技术报告

厂商和机构的官方研究文章与技术报告:架构创新、训练方法、能力测量与安全研究的解读。本站不收纯学术论文。

最新精选

第 61–80 条 · 共 262 条

5月27日星期三

AI HOT 精选

Anthropic 工程师称 Claude Mythos 用“巧妙简洁的证明”解开了 OpenAI 此前攻克的 Erdős 数学猜想

Anthropic 工程师 Sholto Douglas 在 X 上说,Claude Mythos 用一个“巧妙简洁的证明”解决了 Erdős 单位距离猜想,而 OpenAI 前不久刚把这个问题当作 AI 数学推理的里程碑。团队的做法是把问题丢给多个独立的 Claude Code 实例,让它们各自找解题路径,再汇总分发,Mythos 经常走出和 Ope...

推荐理由:HKR 三项都成立:标题自带反差,信息点具体,又牵动前沿推理模型的竞争格局。但正文没披露证明内容、验证方式、Mythos 是否已发布,所以只能放 featured,不能上 P1——我会先打个折,等看到证明再说。

5月26日星期二

AI HOT 精选

Runway 发布 Project Luxo,用三部短片和一支广告证明 AI 视频已经跨过恐怖谷

Runway 放出了三部完全用 AI 生成的短片和一支广告样片,每部都由单人完成,制作时间从三周压缩到四小时。他们把这些片子拿给制片人、演员、工会成员和媒体看,得到的反馈是:观众不再盯着画面瑕疵,而是被故事本身抓住了。Runway 认为这意味着 AI 视频的视觉真实感、角色稳定性和创作可控性已经够用,技术开始退到幕后,故事走到了台前。不过正文没披露具体...

推荐理由:这是 Runway 的研究展示和样片发布,不是新模型或已上线的产品功能。给出的 4 小时出片数字很抓眼球,但正文没披露这个流程里人工修改了多少轮、失败率多高,所以我会先打个折。整体属于高质量展示,但离验证过的生产力工具还差一步。

FT · 科技

斯坦福研究:AI 招聘工具造成“明显的种族差异”

斯坦福大学牵头的一项研究发现,用 AI 工具筛选求职者会导致系统性的种族偏见。具体来说,被一家公司 AI 刷掉的候选人,在应聘其他用同类工具的公司时也会反复被拒。不过这篇报道正文被付费墙挡住了,研究用了多少样本、测了哪几家厂商的招聘系统、具体的差异率是多少,这些关键信息都没披露。

推荐理由:这篇值得推,因为斯坦福的招牌加上“跨公司系统性拒绝”这个结论,把 AI 招聘偏见从模型指标拉到了真实伤害层面。我会先打个折:正文没披露样本量和测试怎么做的,所以“系统性”到底多严重还不好说。但即便信息有缺口,它戳中的是企业用 AI 筛人最怕的合规和公平性雷区,从业者需要知道有这么个信号。

阿里技术 · 公众号

南大和阿里发现 DiT 里的残差流拖慢收敛,改用跨层路由后训练快了近 9 倍

南京大学 LAMDA 组和阿里智能引擎团队提出了一种叫 DAR 的方法,把 DiT 模型里固定的残差累积,换成了按时间步动态选择路径的跨层路由。在 ImageNet 256×256 上拿 SiT-XL/2 试,FID 从 9.67 降到了 7.56,而且只用原来大约九分之一的训练步数就达到了同等收敛质量。不过原文因为微信环境验证拦截,具体怎么实现路由、...

推荐理由:我会先打个折:这还是一个针对DiT架构的训练方法改进,不是新模型或产品发布,所以分数没往78以上走。但它的亮点很实在——把残差流这个大家默认的组件揪出来说是收敛瓶颈,然后用一个时间感知的路由去替代固定累加,效果是FID更好、收敛快近9倍。对正在烧钱训视觉模型的人,这个省钱省时间的信号够强,featured没问题。

r/LocalLLaMA

SkillOpt 把 Markdown 技能文件当成可训练参数,用编辑操作来优化

这篇帖子正文被 Reddit 屏蔽了,只能看到标题和摘要。从现有信息看,SkillOpt 的做法是把给模型用的 Markdown 技能说明文件当作可优化的对象,而不是写死就完事。它让一个更强的模型对技能文件提出增、删、改的编辑建议,然后只在留出的验证集上接受那些确实能提升效果的改动。摘要里说,最好的技能文件通常在 1 到 4 次被接受的编辑后就会收敛,...

推荐理由:我会先打个折:目前只看到一个项目源和 Reddit 讨论,没有大规模落地数据,所以分数定在 78、featured 而不是 p1。但 HKR 三项都站得住——把技能文件当可训练参数这个 hook 够新鲜,留出验证集加 1-4 次编辑收敛的机制也讲得清楚,对做 agent 的人来说省手工调 prompt 的钱和时间是实打实的痒点。正文没披露验证集规模和任务多样性,这点先别太激动。

量子位 · 公众号

浙大和阿里给生图模型加了个“先想再画”的模块,画数独、烧蜡烛这类精细活终于不翻车了

这篇论文提出了一个叫 Unified Thinker 的独立规划模块,专门解决生图模型一遇到需要精确空间推理的任务就乱来的问题。它不像以前那样让模型边想边画,而是把“思考”和“执行”拆开:先让模型生成结构化的推理步骤,再把这些步骤翻译成具体的视觉指令去生图。训练用了 4 万条叫 HieraReason-40K 的样本,分两阶段做强化学习,让模型学会在动...

推荐理由:这篇论文解决的是一个很实际的问题:多模态模型经常在需要一步步操作的视觉任务里翻车,比如画数独格子画错、烧蜡烛的步骤搞反。浙大和阿里的做法是给模型加一个独立的规划模块,用 4 万条专门构造的样本训练它先想清楚再下笔,再通过两阶段强化学习把思考过程转成可执行的视觉指令。正文没披露这个规划模块的具体参数量和推理延迟,所以实际部署成本还不好判断。但思路本身挺直接,如果规划模块够轻量,对提升视觉 agent 的可靠性会有帮助。

机器之心 · 公众号

ACL 2026 论文:Spatial-Agent 让大模型不只是调地图 API,而是生成可执行的地理分析流程

这篇 ACL 2026 主会论文提出了 Spatial-Agent,核心思路是在用户用自然语言提问和调用地图工具之间,插入一张“地理流程关系图”(GeoFlow Graph),让大模型先规划出可执行的地理分析步骤,再一步步调用 API。在 MapEval-API 评测集上,搭配 GPT-4o-mini 的 Spatial-Agent 准确率达到 45....

推荐理由:ACL 主会论文,机制和数字都拿得出手,H 和 K 能过。但 GIS 工作流这件事本身圈子小,缺了成本、安全或平台竞争这些能出圈的点,R 就够不着,放在 featured 刚好。

5月25日星期一

r/LocalLLaMA

RTPurbo:用几百步训练把全注意力模型转成稀疏推理,长上下文预填充快 9.36 倍

这篇论文提出 RTPurbo,能把原本用全注意力的模型改成稀疏注意力来跑推理,而且只需要几百步训练。做法是只给“检索头”保留完整的 KV 缓存,其他头用一个 16 维的 token 索引器来近似,相当于大幅压缩了要存要算的内容。在 100 万 token 的长上下文场景下,预填充阶段最高快了 9.36 倍,解码阶段快了约 2.01 倍。正文没披露具体用...

推荐理由:我会先打个折:目前只有 Reddit 讨论,正文没披露模型规模、具体任务和代码,验证强度偏弱。但“几百步把全注意力转稀疏”这个思路本身挺省钱的,数字也够具体,对做长上下文推理优化的人值得看一眼。信息缺口明显,所以分数没往上拉。

5月24日星期日

r/LocalLLaMA

OpenBMB 在华为昇腾 NPU 上把大模型从头训成 1.58-bit,8B 模型性能保住全精度 97%

OpenBMB 放出了 BitCPM-CANN,一个在华为昇腾 NPU 上原生跑通的 1.58-bit(三值)大模型训练方案。他们用和 MiniCPM4 一样的架构与数据,从零训了 0.5B、1B、3B、8B 四个尺寸。1B 到 8B 的模型在 11 个测试集上平均保住了全精度模型 95.7% 到 97.2% 的性能,3B 版本在 BBH 上打平,3B...

推荐理由:我会先打个折:目前只有 Reddit 帖子作为来源,没有吞吐量、显存占用或复现细节,所以先放在 featured 的底线。但这条信息本身挺实在——OpenBMB 在昇腾 NPU 上从零训练了四个 1.58-bit 的模型,不是推理时量化,而是训练阶段就压到极低比特。1B 到 8B 的性能保留率都在 95% 以上,说明这条路在国产硬件上走得通。对需要控制训练成本、又绑在昇腾生态里的团队来说,这是个值得跟的信号。

机器之心 · 公众号

ICML 2026 中了一篇让视觉模型学会“多条思路并行思考”的论文,但正文被验证页挡住了

这篇被 ICML 2026 接收的论文叫 Visual Para-Thinker,给视觉语言模型加了一套并行思考框架。核心是用 Pa-Attention 和 LPRoPE 把视觉推理拆成四条独立路径,让模型同时从不同角度理解图像,再综合出答案。训练数据是 16.3 万组问答对,规模不算大,所以泛化能力得打个问号。不过目前文章页面被微信环境异常验证挡住了...

推荐理由:这篇 ICML 2026 论文给视觉语言模型装了一个并行思考框架,叫 Visual Para-Thinker。核心是把视觉推理拆成 4 条路径同时跑,用 Pa-Attention 和 LPRoPE 做隔离,防止路径间串味。训练数据是 16.3 万对问答,规模不算大,但够验证想法。我会先打个折:这是单篇研究,没有多团队复现或产品落地,所以重要性停在 79。对做多模态推理加速和内部机制拆解的人,这篇值得看,但别当成熟方案直接用。

新智元 · 公众号

AI 第一次独立跑完芯片设计全流程:219 个英文单词进去,7nm 图纸出来,工程师全程没碰键盘

Verkor 的 Design Conductor 用一段 219 个英文单词的规格说明,在 12 小时内自动生成了 VerCore RISC-V CPU 的 ASAP7 7nm GDSII 版图,中间没有工程师介入。跑分结果是 1.48GHz 下 CoreMark 拿到 3261 分。不过先别太激动:这颗芯片还没实际流片验证,而且正文明确说没做缓存,...

推荐理由:我会先打个折:VerCore没流片、没缓存,现在只是跑分和版图层面的演示,离真能用还差验证和量产。但219词出GDSII这个点太直观了,12小时和1.48GHz也让效率对比有了抓手。正文没披露功耗、面积和设计规则检查结果,这些缺口让“独自跑完”的说法要打问号。不过作为自动化流程的阶段性成果,数字够硬、场景够刺激,给79分合理。

5月23日星期六

机器之心 · 公众号

FlashAR 用 0.05% 的训练数据,把自回归图像模型的生成速度提了 22.9 倍

浙大和阿德莱德大学搞了个 FlashAR,专门给预训练好的自回归图像模型加速。拿 Emu3.5-Image-34B 试了一下,生成一张 512×512 的图,原来要 130.10 秒,现在只要 5.68 秒,快了 22.9 倍。而且只用了原始训练数据量的 0.05% 做微调,GenEval 分数从 80.48 变成 80.29,画质基本没掉。正文没披露...

推荐理由:FlashAR 用极少量数据给预训练好的自回归图像模型做加速,速度提升 22.9 倍,质量几乎没掉,对在意推理延迟和成本的团队是个好消息。论文给了具体数字和 GenEval 对比,信息量够,但正文没披露这 0.05% 数据具体怎么选、不同分辨率下是否同样有效,这点先别太激动。整体是扎实的推理优化工作,不是顶级实验室的模型发布,放 featured 合适。

机器之心 · 公众号

Bengio 团队新论文:用多条并行思路链做递归推理,效果比单条串行推理好

这篇论文提出了 GRAM,一个会生成多条内部推理轨迹、再从中挑出最优解的递归模型。在极难数独测试上,GRAM 用 16 步递归、同时跑 20 条并行思路,准确率达到 97.0%;作为对比,传统串行递归模型 TRM 要跑到 320 步才做到 90.5%。简单说,就是让模型多想几条路再选,比闷头一条路走到黑更靠谱,而且推理步数还少得多。不过正文没披露具体的...

推荐理由:Bengio 团队这篇新论文拿数独极端难度当试金石,用 GRAM 把递归推理的上限拉高了一截。核心卖点是并行轨迹比长串行更有效:16 步递归配上 20 条并行采样,准确率 97.0%,而对比的串行方法要跑 320 步才到 90.5%。我会先打个折——这只是在单一任务上的结果,泛化到其他推理场景还没验证,正文也没披露并行采样的实际计算开销和延迟。但思路本身对做推理加速的人有参考价值,尤其是想用多条短路径替代一条长路径的时候。

AI HOT 精选

Anthropic 公布 Glasswing 项目首月战报:用 Claude Mythos Preview 挖出上万个高危漏洞

Anthropic 说,他们和大约 50 家合作伙伴用 Claude Mythos Preview 模型,在全球最关键的基础软件里找到了超过一万个高危或严重级别的漏洞。现在瓶颈已经不是找漏洞的速度,而是验证、通报和打补丁的速度。在开源软件扫描这块,模型自己估算发现了 6,202 个高危或严重漏洞,其中 1,752 个已经过独立安全公司或 Anthrop...

推荐理由:Anthropic 这次放出的不是模型跑分,而是 Claude 在真实关键系统里挖漏洞的战报。约 50 家合作伙伴用 Claude Mythos Preview 扫出超过一万个高危或严重漏洞,独立验证准确率 90.6%,说明模型在安全自动化这条线上已经从“能看”走到“能干活”了。我会先打个折:正文没披露漏洞类型分布、误报率和修复成本,也没说这 90.6% 是在什么条件下测的,所以准确率数字先别太激动。但不管怎么说,一万多个高危漏洞这个量级,加上 Mozilla、Cloudflare 这类合作方背书,对做安全自动化和关键基础设施防护的团队来说,是一个...

5月22日星期五

AI HOT 精选

首个在华为昇腾910B上全栈训练的1.58比特开源模型BitCPM-CANN发布

ModelBest、清华和OpenBMB搞了个BitCPM-CANN,从0.5B到8B都有,全程用华为昇腾910B NPU训练,没走英伟达路线。1.58比特三元量化意味着每个权重只取三种值,内存比BF16省了约6倍,能塞进手机、电脑和车载设备里跑。基准测试成绩保住了全精度模型的95-97%,这点挺实在。我会先打个折:正文没披露具体推理延迟和功耗数据,也...

推荐理由:HKR三项都站得住:昇腾910B全栈训练1.58比特开源模型这个角度够新,数据也扎实。没给P1是因为目前只有发布事实,缺少独立复现或实际落地效果的佐证,所以先放在featured。

新智元 · 公众号

香港理工和港科大(广州)发现,日常聊天就能悄悄污染 AI 助手的长期记忆,不用任何恶意指令

这篇研究来自香港理工大学和香港科技大学(广州),他们做了一个叫 ULSPB 的测试集,里面有 350 种场景。核心发现是:攻击者不需要写越狱提示词,只要在日常对话里夹带私货,就能慢慢把 AI 助手的长期记忆带偏。比如聊着聊着,让模型记住错误的用户偏好或事实,后续决策就会出错。团队还提出了一个防御方案叫 StateGuard,原理是在每次更新记忆前先检查...

推荐理由:这篇我会先打个折:正文没给出具体攻击成功率或防御对比数字,所以没法判断实际危害有多大。但选题本身很刁钻——大家盯着越狱攻击,它却告诉你正常对话也能让 Agent 慢慢“学坏”,这对把 Agent 放进业务流程的团队是个实在的提醒。ULSPB 的 350 个设置让测试面够宽,不是那种只测三五条样本的玩具基准。建议关注后续有没有开源测试集和修复方案,这点先别太激动。

机器之心 · 公众号

CVPR 2026 | HiF-VLA:用视频压缩的思路教机器人“边看动作边想下一步”

西湖大学团队搞了个叫 HiF-VLA 的框架,核心想法是把机器人看世界的方式从“一帧帧静态图”换成“画面怎么动的”。它直接用 H.264 这类视频编码器从画面里提取紧凑的运动向量,再让一个联合专家模型同时预测未来的视觉动态和该做的动作序列。论文里给的数据是,在设定的历史窗口下,显存峰值 31.4GB,延迟 117.7 毫秒。不过正文因为环境验证问题没加...

推荐理由:这篇 HiF-VLA 我会先打个折:它还是一个单篇研究,没有落地案例或多方交叉验证,所以放在 featured 低位。但它的思路确实比多数 VLA 论文更“省”——直接用 H.264 运动向量代替逐帧视觉编码,把“看变化”和“想动作”塞进联合专家里一起算,显存压到 31.4GB、延迟 117.7ms,对想在真机上跑实时推理的团队是个可参考的方向。正文没披露在真实机械臂上的成功率或与主流 VLA 的 head-to-head 对比,这点先别太激动。

机器之心 · 公众号

Meta 华人团队发布 ATLAS:用一个词让视觉模型学会可泛化的推理

Meta AI 和港中文的研究者搞了个叫 ATLAS 的方法,核心是在视觉语言模型里塞一个“功能词”(Functional Token),让模型能同时走两条路:一条是显式的、一步步调用工具去操作图像(Agentic 推理),另一条是隐式的、在内部潜空间里直接算(Latent 推理)。他们配套搞了个 ATLAS-178K 数据集,分两阶段训练——先做监督...

推荐理由:我会先打个折:这是 Meta AI 和港中文联合发的研究,不是产品发布或旗舰模型,所以重要性给到 78 分比较合适。一个 Functional Token 搞定视觉推理这个 hook 确实抓人,正文也给了数据集和训练方法的细节,对做多模态和 agent 的团队有参考价值。但正文没披露实际部署成本或大规模验证结果,这点先别太激动。

Computing Life · Share · 鸭哥调研

OpenAI 的通用推理模型推翻了一个 80 年没人撼动的数学猜想

GPT-5 否证了 Erdős 在 1946 年提出的平面单位距离猜想。这个猜想说平面上 n 个点最多只能有约 n 对距离为 1 的点,80 年里数学家都信这个。模型没走证明路线,而是直接构造反例,用上了代数数论里跟几何八竿子打不着的工具,把单位距离对的数量推到了 n 的 1.014 次方。Fields 奖得主 Tim Gowers 审完证明说,如果是...

推荐理由:我会先打个折,因为正文没给论文、没给证明过程、也没说复现条件,信息缺口不小。但一个没专门练过数学的通用模型,推翻了一个 80 年没人动得了的 Erdős 猜想,还有 Fields 奖得主背书说能投顶刊——这个事实本身分量很重,属于当天就该推的消息。HKR 三项全中,重要性给 90 是合理的,再高就需要更多证据了。

r/LocalLLaMA

这篇论文主张:输入处理用低精度加速,输出生成用高精度保质量

论文 arXiv 2605.20315 提出一个混合精度策略:在预填充阶段用 W4A4 量化,理论上能把输入处理速度提升 4 倍;但解码阶段仍用原始高精度,因为激活值的量化误差会扰动采样出的 token,并在自回归生成中逐步累积,导致输出质量下降。正文没披露具体实验模型和数据集,也没给出实际延迟或吞吐数据,所以这 4 倍目前只是理论估算,实际能省多少还...

推荐理由:这篇论文的卖点是“前段省、后段稳”:预填充用 W4A4 量化,理论上能换来 4 倍加速,解码时再切回高精度,防止误差递归累积把回答搞崩。思路本身挺直接,但正文只给了理论增益,没披露实测吞吐、困惑度变化和具体硬件环境,所以实际能省多少、质量掉多少还不清楚。我会先打个折,等看到实测数据再判断值不值得跟。