从 Atari 到 EVE Online:Google DeepMind 回顾 15 年游戏 AI 研究并携手开发商探索新玩法
Google DeepMind 宣布与游戏开发商合作,用 AI 原型化全新游戏体验,并回顾了从 DQN 玩 49 款 Atari 游戏、AlphaGo、AlphaZero、MuZero、AlphaStar 到 SIMA 的游戏 AI 研究历程。
Google DeepMind 宣布与游戏开发商合作,用 AI 原型化全新游戏体验,并回顾了从 DQN 玩 49 款 Atari 游戏、AlphaGo、AlphaZero、MuZero、AlphaStar 到 SIMA 的游戏 AI 研究历程。
Google DeepMind 发布 AI Control Roadmap,一套用于构建和管理 Google 内部部署的高级 AI 的框架,采用纵深防御思路,在模型对齐之外增加系统级安全层,即便对齐不完美也能提供保障。
推荐理由:Google DeepMind 公开内部 AI Control Roadmap,给出把智能体当作内部威胁来监控与拦截的分层思路。
这篇博客因为 Hugging Face 返回了 429 错误(请求太频繁),正文内容没抓到。从标题和摘要看,实验用 OpenAI、NVIDIA、OpenBMB 的模型和一个自己微调的 5 亿参数模型来驱动市场里的交易代理。他们试了三种干预手段都没能重现价格崩盘,最后是靠结算时强行改写价格才把崩盘做出来。我会先打个折:具体怎么干预、崩盘长什么样、数据量多...
推荐理由:我会先打个折:正文因为 Hugging Face 限流没抓到,具体干预怎么设计、崩盘长什么样、数据量多大都只能靠标题和摘要猜。但就现有信息看,五个模型经济体里崩盘凭空消失、只能靠结算作弊做出来,这个发现对代理可靠性和模拟真实性都是实打实的质疑。信息缺口明显,但角度够刁,值得推给从业者看一眼。
openJiuwen 提出了 MANGO,一个多智能体流网络框架。它把强化学习、文本梯度(用自然语言反馈来调模型)和 Skip-k 机制(跳过不靠谱的中间步骤)揉在一起,让一群模型自己学会怎么组队、怎么分工。用 GPT-4o-mini 跑分,在 MATH500 数学题上比 MaAS 准确率高了 12.8 个百分点,在 DROP 阅读理解上比 AFlow...
推荐理由:我会先打个折:这还是个研究框架,不是大模型或平台级发布,所以别当重磅炸弹看。但 HKR 里 K 最扎实,机制和数字都给出来了,MATH500 上 +12.8% 的差距不算小。H 和 R 靠“流网络”这个角度撑住,对搞多智能体协作的人有参考价值。正文没提开源代码链接,这点先别太激动。
UIUC 和 Chroma 发布了一个叫 Harness-1 的检索子智能体,参数量 200 亿,基于 gpt-oss-20b 训练。它被放在一个“有状态搜索框架”里用强化学习训练,简单说就是模型在搜索时能记住上一步干了什么,再决定下一步怎么查,而不是每次都从头瞎找。在 8 个基准测试上,它的平均整理召回率是 0.730,比目前最好的开源子智能体高出 ...
推荐理由:HKR三项都站得住:Harness-1把强化学习和有状态搜索结合,机制讲得明白,基准测试结果也给了具体数字。分数定在78-84区间,因为它是个子智能体的研究发布,不是大厂主力模型,但开源圈确实需要这种能打的检索方案。
这篇 ICML 2026 的论文提出了一种叫 FusionRoute 的多模型协作方法。它不直接合并模型,而是冻结住几个专家模型不动,只训练一个轻量的路由器。这个路由器会在生成文本的每一个 token(词或子词)时,实时挑选一个最合适的专家模型来输出,同时把路由器的判断分数和专家模型的输出分数揉在一起,让最终选择更准。论文在 GSM8K、MATH-50...
推荐理由:这篇 ICML 2026 的 FusionRoute 论文,核心是让几个冻住的专家模型在生成每个 token 时都能被一个轻量路由器实时挑选,还加了自我修正来纠错。思路确实有意思,但文章没给出具体的性能提升数字、代码链接和实际部署成本,所以我会先打个折,放在 featured 里偏低的档位。
这个项目用四家不同实验室的小模型(OpenAI 的 gpt-oss-20b、OpenBMB 的 MiniCPM3-4B、NVIDIA 的 Nemotron-Mini-4B 和一个自己微调的 0.5B Qwen)分别扮演市场里的不同角色,玩家则充当幕后金主,可以放贷、散布真假内幕消息、做空和贿赂。模型之间的差异本身就是卖点,让市场博弈更像真的吵架而不是念...
推荐理由:我会先打个折:这只是个实验项目,不是产品。但它的切入点很巧——用小模型之间的差异来制造博弈感,而不是硬靠 prompt 演。技术细节也够实在,vLLM 版本冲突、0.5B 模型的表现数据都摆出来了,做 agent 的人能直接参考。正文没披露微调那 0.5B Qwen 的具体数据配方,这点先别太激动。整体值得一看,放在低 featured 合理。
普林斯顿的研究员搞了一套叫 Goedel-Architect 的智能体系统,专门让模型在 Lean 这种形式化证明语言里自动做数学题。他们拿 DeepSeek-V4-Flash 跑 PutnamBench 数学竞赛题,672 道题里正确率到了 75.6%,API 调用费总共才花了 294 美元。对比之前 Hilbert 系统用别的模型达到 70.0% ...
推荐理由:普林斯顿团队搞了个叫Goedel-Architect的智能体系统,让DeepSeek-V4-Flash在形式化证明语言Lean里自动做数学题。PutnamBench 672道题正确率75.6%,API调用费总共294美元,对比之前Hilbert系统用别的模型达到70.0%却花了约17万美元,成本差了近500倍。这个对比很直观,数字也扎实,但正文没详细拆解294美元是怎么算出来的,也没说Hilbert那17万是不是包含了大量试错和人工调参。所以“500倍”这个说法可以先打个折看,不过即使有水分,成本优势依然明显。整体还是偏学术研究,离工程落地有距离,...
一个开发者拿Qwen2.5-3B(30亿参数的开源小模型)做了个多智能体模拟:五个角色在森林里各自生产、交易、囤货,跑了15轮。模型在100%的调用里都能输出格式正确的JSON,这点挺稳,但一到经济决策就露怯——它分不清该囤柴还是该卖蜜。作者靠两招补救:一是给环境加限制,比如食物会坏、冬天缺燃料,逼着模型做取舍;二是优化提示词,直接写明“别买自己生产的...
推荐理由:HKR全过。标题本身就抓人——3B小模型跑经济模拟,不是那种千篇一律的benchmark刷分。正文给了实打实的交易数据和基尼系数变化,不是空谈“涌现行为”。对做agent模拟的工程师来说,模型100%输出合法JSON这点很实用,但经济决策拉胯的坑和两条补救措施(环境约束、提示词优化)才是真正能省时间的干货。这只是一份个人工程报告,不是产品发布或框架开源,所以保持在featured门槛上,不往上拔。
谷歌研究院和谷歌云一起搞了个叫“跨语料库检索”的框架,用在 Gemini 企业智能体平台上,本质是让多个 AI 代理分工合作:一个负责理解问题并拆解计划,一个负责改写查询词,一个负责把问题路由到最合适的数据库,还有一个反复去搜、去验证。这套流程比传统 RAG(给模型外挂资料库直接查)在事实类数据集上准确率最多高出 34%。文章没细说测试用的具体数据集规...
推荐理由:谷歌把 RAG 拆成多个代理分工干活,在事实类数据集上准确率最多高出 34%,这个数字挺抓人。不过文章没披露测试用的具体数据集规模和难度,所以这个 34% 的含金量得打个折看。另外,框架绑在 Gemini 企业平台上,有给自家云服务带货的味道,所以分数没给到纯研究框架那档。
CMU 和马里兰大学的研究者给大模型加了一个“睡眠”机制。具体做法是:当模型处理长文本、上下文窗口(L-token)塞满时,不直接丢掉旧的 KV 缓存,而是先跑 N 轮离线的循环前向传播,把当前信息压缩更新到 SSM(状态空间模型)的快速权重里,然后再清空缓存。论文在 GSM-Infinite 任务上拿 Jet-Nemotron 2B 模型试了试,设 ...
推荐理由:HKR 三项都过:钩子强,知识点有可复现的机制和 Jet-Nemotron 2B 的实测数字,也踩中了中美算力效率竞赛的神经。但它仍是一篇早期论文,不是产品发布或行业级事件,所以刚好卡在 featured 门槛上。
Anthropic 发了一篇文章,讲他们内部怎么让 Claude 越来越多地参与 AI 开发。核心概念是“递归式自我改进”——让 AI 系统能完全自主地设计和开发自己的下一代。他们说自己还没到那一步,但趋势在加速。文章给了几个内部数据:到 2026 年 5 月,Anthropic 合并的代码里超过 80% 是 Claude 写的;工程师现在平均每个季度...
推荐理由:H 和 R 都过了:标题钩子强,话题本身也切中前沿模型的安全焦虑。K 没过是因为这只是一封公开信和政策呼吁,不是已生效的法律,正文也没披露具体机制或模型细节,信息密度撑不起更高评级,放在 featured 合理。
这三篇论文都进了 CVPR。GraspGen-X 用 20 亿次模拟抓取训练,让机械手能处理没见过的物体,但正文没披露真实世界的抓取成功率。LCDrive 把自动驾驶的推理 token 砍了大约一半,靠的是让模型直接输出轨迹而不是先写文字再转成动作,延迟更低,不过没提极端场景下的安全性验证。NitroGen 在 1000 多个游戏里跑了 4 万小时的交...
推荐理由:NVIDIA 在 CVPR 放出的三篇论文,每篇都带着实打实的数字:GraspGen-X 用 20 亿次模拟抓取训练机械手,LCDrive 把自动驾驶模型的推理 token 砍掉一半,NitroGen 在 1000 多款游戏里攒了 4 万小时交互数据来训游戏 agent。我会先打个折——这是厂商研究打包发布,不是新模型或产品上线,所以重要性停在 78 分。但信息密度够高,对做机器人、自动驾驶和游戏 agent 的人有直接参考价值,尤其是用合成数据替代真实采集、降低推理延迟这两条思路,正文没披露具体硬件环境和延迟数字,这点先别太激动。
MAI 从 487 万个开源 PR 里筛出 26.5 万道可训练题目,又为它们建了一套三层判分体系。AI 编程这两年真正的变化不是模型变聪明了,而是训练基础设施被工业化了:出题从手工活变成了流水线,批改也从“单测全绿就行”升级到能检查工具使用效率和前端视觉质量。
推荐理由:这篇文章没发模型、没给跑分,但把“vibe coding”之后该看什么讲清楚了:训练数据怎么筛、判分怎么搭、工程成本怎么控。487 万 PR 筛到 26.5 万题,这个压缩比本身就说明他们在做苦活,不是随便抓一把数据就训。三层判分体系正文没展开细节,但至少表明他们知道代码题不能只靠单次通过率来评。我会先打个折:没看到开源计划、也没看到实际训练出来的模型效果,所以目前更像一套训练基础设施的思路,离可复现的结论还差一步。对正在考虑自训代码 agent 的团队来说,这篇值得看,但别急着当标杆。
这篇论文提出了 DataMaster,一个让大模型自己当数据工程师的流程。它不碰模型结构和训练算法,只做三件事:自动搜索外部数据、清洗脏数据、把多个数据集拼成一张表。在 MLE-Bench Lite 这个机器学习竞赛基准上,DataMaster 把奖牌率从 35.91% 提到了 68.18%,几乎翻倍。正文没披露具体用了哪些模型、单次任务耗时和额外算力...
推荐理由:DataMaster 做的事很直接:模型和训练代码都不动,只让系统自己去搜、洗、拼数据,结果 MLE-Bench Lite 奖牌率从 35.91% 拉到 68.18%,接近翻倍。我会先打个折——这还只是单篇研究,没有生产环境验证,benchmark 本身也不是完整 MLE-Bench,所以别急着当银弹。但“数据工程自动化”这个方向确实戳中很多团队的日常痛点,加上数字够具体,给 78 分 featured 合理。
这篇文章的正文被微信环境验证挡住了,实际内容没抓到。从标题和摘要看,Banafsheh Rafiee 和 Richard S. Sutton 提了一个叫“生成认知”的框架,给 AI 立了四根柱子:经验、感知与行动不可分、自主性、具身性。说白了就是主张智能不能光靠看数据,得在跟环境互动的过程中长出来。但具体怎么实现、有没有实验,正文没披露,这点先别太激动。
推荐理由:这篇是 Sutton 和 Rafiee 的新论文解读,核心是提出“生成认知”框架,主张智能体得靠经验、感知和行动绑在一起、自己定目标、还得有身体去试错。我会先打个折:正文没披露实验、代码或可复现的测试,目前还停在概念层。但 Sutton 的名气和四个支柱的提法,让它有资格进 featured,属于研究评论向的必读。
这篇综述把“评分标准(Rubrics)”这件事拆成了五个部分来讲:定义、怎么构建、怎么用来训练、怎么用来评估、以及还没解决的难题。它想回答一个很实际的问题:在模型能自己调用工具、走流程干活的 Agent 时代,光看答案对不对已经不够了,得有一套更细的尺子来衡量“好答案”到底好在哪里。正文没披露具体的实验数据,更像是一张研究地图,帮从业者快速看清这个方向...
推荐理由:这篇综述没发布新模型或产品,但 40 页的框架对 agent 评测很有用,我会先打个折,放在 featured 档。正文没披露具体实验数据,更像文献梳理,但问题意识够强,从业者能直接拿来对照自己的评估流程。
现在给 Agent 塞一堆工具,它经常不知道该点哪个。复旦和通义实验室提出了一套叫 ToolCUA 的训练方法,核心是用约 4000 个合成工具和 18 万步的“屏幕操作+工具调用”交叉轨迹来训练模型。他们训出来的 ToolCUA-8B 在 OSWorld-MCP 基准上跑到了 46.85% 的准确率。不过正文因为微信环境验证没抓到,具体训练细节和对比...
推荐理由:这篇文章抓了一个实际工程里的矛盾:工具越多,Agent 越不会选。我会先打个折,46.85% 的准确率不算高,但考虑到是 4k 工具的环境,这个数字说明问题确实难。18 万步合成轨迹是亮点,意味着训练数据不用全人工标,成本上友好一些。正文没披露推理延迟和实际部署的资源消耗,这点先别太激动。整体是一篇有痛点的研究发布,不是大模型或产品级发布,所以放在 featured 里合适。
这篇推文本身因为微信环境验证没抓到正文,我只能根据已有的英文摘要和标题来还原。γ-World 是一个多智能体世界模型,核心是把多个 AI 角色放在同一个虚拟环境里互动。它用了一种叫“单纯形位置编码”的方法和 hub token 机制,把多个智能体之间的交互计算成本从平方级降到了线性级。说人话就是:以前每加一个角色,系统要算它和所有其他角色的关系,开销涨...
推荐理由:我会先打个折:这是研究发布,还没看到大规模落地验证,但技术点够具体。Gamma-World 解决的是多个 AI 同时在一个世界里交互时计算量爆炸的问题,用正单纯形位置编码让每个智能体知道彼此位置,再靠 hub token 汇总信息,把原本 O(n²) 的复杂度压到 O(n)。8 个玩家延迟压到 4.5ms 这个数挺实在,说明小规模场景已经能跑顺。不过正文没披露更多玩家数下的表现,这点先别太激动。整体属于有干货、有数字、方向对路的研究,给 featured 合理。
Meta 放出了一个叫 ATLAS 的数学形式化库,用 Lean 4 语言把 26 本数学教材里的定义和证明搬了进去。整个工程消耗了 1830.57 亿个 token,生成了约 63 万行代码,包含 46203 条声明。其中 42837 个证明已经跑通,证明通过率 92.7%。说白了就是让 AI 把教科书上的数学推理,转成机器能严格检查的代码,以后训练...
推荐理由:HKR三项都站得住:token量、Lean库规模和已验证证明数都是硬数字。没给P1是因为这还是个偏专的研究开源发布,不是通用模型或产品级发布。
报告给了几个数:开发者每周写的代码从 3.6K 行涨到 8.6K 行,千行以上的大 PR 占比也高了。AI 智能体单次会话里调工具的次数多了约 30%,说明它在接更复杂的活。被采纳的 AI 代码 60 分钟后还在代码库里的比例从 76% 提到 81%,留存确实在变好。不过正文没披露样本量、统计口径和是否排除自动生成代码,我会先打个折看这些数字。
推荐理由:我会先打个折,这是 Cursor 自家的报告,不是第三方审计,数字可能有美化。但 3.6K 到 8.6K 的翻倍和工具调用涨 30% 这两个点,对开发者判断 AI 编程工具的实际提效幅度有参考价值。正文没披露统计口径和样本量,这点先别太激动。整体不是产品发布或跨源事件,放在 featured 档、81 分比较合适。
这篇讲的是 AutoWebWorld 这个项目,它没有靠人工标注或大模型当裁判,而是用有限状态机(FSM)来定义网页的状态、前置条件和跳转规则,自动生成并验证 GUI Agent 的操作轨迹。最终合成了 29 个网页环境、875 个页面和 11663 条经过验证的轨迹,平均每条轨迹的成本大约 0.04 美元。正文没披露具体用了哪些模型做测试,也没给出任...
推荐理由:我会先打个折:这不是顶级大厂的发布,所以分数压在 78–84 的研究工具档位。但 H、K、R 三条都站得住。0.04 美元一条轨迹是个能让人点进去的数字;放出的环境和轨迹量不算小,而且 FSM 内置状态验证这个设计,比靠人标或 LLM 打分更可复现,对做 GUI 智能体的人有直接参考价值。
NVIDIA Research 在 ICRA 上展示了 8 篇论文,都围绕一个思路:在仿真里训练机器人,然后直接部署到真实环境。ScheduleStream 让多机械臂并行规划,速度提升 3 倍,代码已开源。COMPASS 导航框架完全不靠真实数据,在仿真里训练后迁移到真机,20 次真实导航测试成功率约 80%,比纯模仿学习基线高了 4.5 倍。Gra...
推荐理由:我会先打个折:这些成功率都是在论文设定的场景里跑出来的,换到更乱的现场不一定能复现。但 8 篇论文同时给出实机数据,而且不是零星的几次测试,ScheduleStream 的 3 倍提速和 COMPASS 的 20 次导航约 80% 成功,至少说明 sim-to-real 的 gap 在可控缩小。对正在纠结仿真训练能不能落地的团队,这组结果比纯讲架构有说服力。
这篇文章本身被微信环境验证挡住了,正文内容没抓到,所以下面说的都基于标题和已知信息。AutoMoT 是南洋理工 AutoMan 实验室、哈佛和小米汽车一起搞的端到端驾驶模型,核心思路是把视觉语言模型和驾驶动作拆成两个专家:一个 4B 的 Qwen3-VL 负责看懂场景,一个 1.6B 的动作专家负责输出驾驶指令,而且两个模型是异步推理的,不用互相等。在...
推荐理由:我会先打个折:双 SOTA 听着唬人,但正文没披露 nuScenes 的具体指标,只能看到 Bench2Drive 的数据。亮点在于架构思路——把视觉语言模型和端到端驾驶拆成异步推理,大模型负责想、小模型负责开,不是硬塞进一个模型里。4B 的 Qwen3-VL UE 做决策,1.6B 的 AE 执行,这个组合在算力上挺省。不过论文没提实车验证,纯仿真成绩,这点先别太激动。整体看,对做自动驾驶算法的人有参考价值,但离出圈还差一口气,所以放在 featured 而不是更高一档。
英伟达搞了个叫 Polar 的开源框架,专门解决一个实际问题:怎么在不重写 Codex、Claude Code 这些现成代码工具的前提下,用强化学习(GRPO,一种让模型在多步任务里根据奖励信号自己学会更优操作的训练方法)去训练它们。Polar 的做法很取巧,它不碰工具本身的执行逻辑,而是在模型和工具之间的 API 接口上做文章,把对话记录、采样结果这...
推荐理由:英伟达开源 Polar,用 GRPO 训练小模型 Qwen3.5-4B,Codex 在 SWE-Bench Verified 上从 3.8% 冲到 26.4%,这个提升幅度在代码 agent 圈子里很能打。技术细节和基准分都给得清楚,属于扎实的研究开源项,不是大模型或产品发布,所以放在 featured 档、82 分合理。
Firespawn Studios 在《Null Epoch》第 0 赛季里放了 25 个 AI 智能体,分别跑在 8 个开源模型上,连续运行了 10 天。他们公开了大约 9.3 万条记录的事件数据集,其中约 70% 的动作都附带了模型当时的推理或决策理由。不过,Reddit 原帖的正文内容被网络屏蔽了,目前看不到具体的实验结论和模型表现对比,只能从标...
推荐理由:Firespawn Studios 把 8 个开权重模型丢进 MMO 里当 agent 跑了整整 10 天,攒了 9.3 万条事件数据,这事本身比跑分有意思——因为不是测单次问答,是看模型能不能在持续变化的环境里记住东西、做出连贯决策。我会先打个折:信息来自 Reddit,不是正式论文,实验细节和失败案例正文没展开,所以别当严谨研究来读。但 25 个 agent、8 个模型、10 天的规模,加上数据公开,对想测 agent 长期稳定性和记忆的人是个现成的素材包。
上海创新研究院的LeapQuest和三所大学搞了两个医学AI系统Ophiuchus和MedScope,核心思路是让模型在看图看视频时学会像医生一样先定位关键区域再分析。Ophiuchus-7B在8个医学视觉问答基准上拿了68.0分,比OpenAI-o3的62.2、Gemini 2.5 Pro的61.8和GPT-5的59.9都高。正文没披露具体参数量以外...
推荐理由:我会先打个折:标题里 GPT-5 目前没公开评测数据,更像噱头,但 7B 模型在医学 VQA 上跑赢 o3 这个事实本身够抓人。正文给了 8 个 benchmark 的平均分对比,信息量撑得起 featured。不是通用大模型发布,分数定在 80 合理。
这篇论文给大模型设计了一个类似人类睡眠的机制。当模型处理长文本、上下文窗口快塞满时,它会主动停下来,不再接收新 token,而是利用离线时间对已积累的上下文做多轮递归前向计算,把信息压缩成“快速权重”。之后清空 KV 缓存,相当于整理完记忆再醒来继续干活。测试在细胞自动机、多跳图谱检索和 GSM-Infinite 推理任务上跑过,但正文没披露具体的性能...
推荐理由:我会先打个折,因为正文没给出压缩后的基准测试提升、代码或实际部署证据,所以分数停在 76。但“睡觉”这个说法确实把枯燥的上下文压缩讲得让人想点进去看。核心操作是模型在上下文快满时主动暂停,用多轮离线方式把旧信息压紧,然后清掉 KV 缓存腾地方,思路清楚。如果后续有实测数据,比如长文本任务不掉点、显存省了多少,分数还能往上走。这点先别太激动,等看到具体数字再说。
三星这次放出了三个项目:Meki 是一种给端侧模型用的记忆架构,让手机或 IoT 设备上的小模型能记住上下文、省着用算力;M2RL 是多领域强化学习框架,想让一个模型在不同任务里都能自己学会干活;LiveClawBench 则是专门测物理 AI 的基准,看模型能不能在真实世界里抓取、操作物体。文章还提到三星已经采购了数万张 GPU 来搭 AI 基础设施...
推荐理由:这是一组三星研究院的技术打包发布,不是旗舰模型或产品上线,但胜在信息具体、方向明确。我会先打个折:正文没披露数万张 GPU 的具体型号和部署时间线,也没说 Meki 在端侧实测的延迟和功耗,所以不能当量产信号看。不过,三星把 Memory 架构、多领域 RL 和灵巧手评测一起端出来,等于公开了自己在 Physical AI 上的三条腿走路策略,对关注端侧和机器人方向的从业者来说,比单篇论文更有参考价值。
这篇帖子正文被 Reddit 屏蔽了,只能看到标题和摘要。从现有信息看,SkillOpt 的做法是把给模型用的 Markdown 技能说明文件当作可优化的对象,而不是写死就完事。它让一个更强的模型对技能文件提出增、删、改的编辑建议,然后只在留出的验证集上接受那些确实能提升效果的改动。摘要里说,最好的技能文件通常在 1 到 4 次被接受的编辑后就会收敛,...
推荐理由:我会先打个折:目前只看到一个项目源和 Reddit 讨论,没有大规模落地数据,所以分数定在 78、featured 而不是 p1。但 HKR 三项都站得住——把技能文件当可训练参数这个 hook 够新鲜,留出验证集加 1-4 次编辑收敛的机制也讲得清楚,对做 agent 的人来说省手工调 prompt 的钱和时间是实打实的痒点。正文没披露验证集规模和任务多样性,这点先别太激动。
这篇 ACL 2026 主会论文提出了 Spatial-Agent,核心思路是在用户用自然语言提问和调用地图工具之间,插入一张“地理流程关系图”(GeoFlow Graph),让大模型先规划出可执行的地理分析步骤,再一步步调用 API。在 MapEval-API 评测集上,搭配 GPT-4o-mini 的 Spatial-Agent 准确率达到 45....
推荐理由:ACL 主会论文,机制和数字都拿得出手,H 和 K 能过。但 GIS 工作流这件事本身圈子小,缺了成本、安全或平台竞争这些能出圈的点,R 就够不着,放在 featured 刚好。
Verkor 的 Design Conductor 用一段 219 个英文单词的规格说明,在 12 小时内自动生成了 VerCore RISC-V CPU 的 ASAP7 7nm GDSII 版图,中间没有工程师介入。跑分结果是 1.48GHz 下 CoreMark 拿到 3261 分。不过先别太激动:这颗芯片还没实际流片验证,而且正文明确说没做缓存,...
推荐理由:我会先打个折:VerCore没流片、没缓存,现在只是跑分和版图层面的演示,离真能用还差验证和量产。但219词出GDSII这个点太直观了,12小时和1.48GHz也让效率对比有了抓手。正文没披露功耗、面积和设计规则检查结果,这些缺口让“独自跑完”的说法要打问号。不过作为自动化流程的阶段性成果,数字够硬、场景够刺激,给79分合理。
Anthropic 说,他们和大约 50 家合作伙伴用 Claude Mythos Preview 模型,在全球最关键的基础软件里找到了超过一万个高危或严重级别的漏洞。现在瓶颈已经不是找漏洞的速度,而是验证、通报和打补丁的速度。在开源软件扫描这块,模型自己估算发现了 6,202 个高危或严重漏洞,其中 1,752 个已经过独立安全公司或 Anthrop...
推荐理由:Anthropic 这次放出的不是模型跑分,而是 Claude 在真实关键系统里挖漏洞的战报。约 50 家合作伙伴用 Claude Mythos Preview 扫出超过一万个高危或严重漏洞,独立验证准确率 90.6%,说明模型在安全自动化这条线上已经从“能看”走到“能干活”了。我会先打个折:正文没披露漏洞类型分布、误报率和修复成本,也没说这 90.6% 是在什么条件下测的,所以准确率数字先别太激动。但不管怎么说,一万多个高危漏洞这个量级,加上 Mozilla、Cloudflare 这类合作方背书,对做安全自动化和关键基础设施防护的团队来说,是一个...
这篇研究来自香港理工大学和香港科技大学(广州),他们做了一个叫 ULSPB 的测试集,里面有 350 种场景。核心发现是:攻击者不需要写越狱提示词,只要在日常对话里夹带私货,就能慢慢把 AI 助手的长期记忆带偏。比如聊着聊着,让模型记住错误的用户偏好或事实,后续决策就会出错。团队还提出了一个防御方案叫 StateGuard,原理是在每次更新记忆前先检查...
推荐理由:这篇我会先打个折:正文没给出具体攻击成功率或防御对比数字,所以没法判断实际危害有多大。但选题本身很刁钻——大家盯着越狱攻击,它却告诉你正常对话也能让 Agent 慢慢“学坏”,这对把 Agent 放进业务流程的团队是个实在的提醒。ULSPB 的 350 个设置让测试面够宽,不是那种只测三五条样本的玩具基准。建议关注后续有没有开源测试集和修复方案,这点先别太激动。
西湖大学团队搞了个叫 HiF-VLA 的框架,核心想法是把机器人看世界的方式从“一帧帧静态图”换成“画面怎么动的”。它直接用 H.264 这类视频编码器从画面里提取紧凑的运动向量,再让一个联合专家模型同时预测未来的视觉动态和该做的动作序列。论文里给的数据是,在设定的历史窗口下,显存峰值 31.4GB,延迟 117.7 毫秒。不过正文因为环境验证问题没加...
推荐理由:这篇 HiF-VLA 我会先打个折:它还是一个单篇研究,没有落地案例或多方交叉验证,所以放在 featured 低位。但它的思路确实比多数 VLA 论文更“省”——直接用 H.264 运动向量代替逐帧视觉编码,把“看变化”和“想动作”塞进联合专家里一起算,显存压到 31.4GB、延迟 117.7ms,对想在真机上跑实时推理的团队是个可参考的方向。正文没披露在真实机械臂上的成功率或与主流 VLA 的 head-to-head 对比,这点先别太激动。
Google Research 在《自然》杂志上发表了他们基于 Gemini 的“经验研究助手”(ERA),同时通过 Google Labs 的可信测试者计划开放了早期访问。这个工具想帮研究人员自动完成文献综述、提出假设和设计实验这些耗时的工作。文章主要讲了 ERA 从一篇 Nature 论文走向实际计算发现工具的过程,但正文没披露它在真实科研场景里的...
推荐理由:Google Research 把基于 Gemini 的 ERA 发在了 Nature 上,同时通过 Google Labs 的可信赖测试者计划开放初步试用。我会先打个折:正文没给出具体指标、基准测试设置,也没讲可复现的工作流细节,所以没法判断它到底有多能打。但这件事本身值得关注——它不是在秀一个 demo,而是试图把论文里的研究助手推到真实科研场景里去验证。这点先别太激动,等看到实际使用反馈和量化结果再说。
这篇文章的正文被微信环境验证挡住了,具体实验细节看不到。从标题和现有摘要看,港中大和浙大的研究者戳破了一个常见说法:主流 AI Agent 的记忆模块,本质上是把过往信息存起来、用的时候再检索出来,相当于一个备忘录,而不是真正具备推理能力的记忆。他们指出,处理需要组合多个步骤的任务时,这种检索式记忆需要的案例数会按 k² 增长,成本很高。另外在一个叫 ...
推荐理由:我会先打个折:这篇不是模型发布,而是研究信号,但信号很强。标题把“记忆”的谎言直接戳破,正文用 Ω(k²) 和 90% 攻击成功率两个数字把问题量化得很清楚,不是空谈风险。对做 Agent 和外挂资料库的人,这三个点——记忆退化、检索投毒、案例爆炸——都是实打实的工程隐患,所以 H、K、R 全中。
这篇文章是机器之心翻译的 Sebastian Raschka 博客,盘点了几款新模型的架构改动,核心都在想办法降低长上下文的显存开销。Gemma 4 的 E2B 方案在 128K 上下文、bfloat16 精度下,KV 缓存能省大约 2.7GB,这个数字挺实在的。另外还提到了 Laguna XS.2 和 ZAYA1-8B,但正文因为微信环境验证拦截,具...
推荐理由:这是一篇编译的架构趋势梳理,不是一手发布,但信息密度不错。我会先打个折,不往 breaking 级别推。HKR 三档都站得住:标题有明确的模型名钩子,正文有可引用的 KV Cache 节省数字,话题本身也直接关系到推理成本和部署预算。整体放在 featured 中段比较合适,既不过度拔高,也不低估它对从业者的参考价值。
奥德赛实验室(Odyssey Labs)发了一个叫 Agora-1 的实时多 agent 世界模型,拿《黄金眼》死亡竞赛做了个演示:多个真人和 AI agent 在同一个模拟场景里跑动、射击、互相影响。现在放出了可玩的研究预览版,你可以直接上手试。正文把它说成是“首个实时多 agent 世界模型”,但没公布模型架构、参数量、延迟数据,也没说训练用了多少...
推荐理由:Agora-1 把多 agent 世界模型和真人同屏互动打包成一个可玩的预览,HKR 三项都踩中了。正文没写架构细节、延迟、成本和基准测试,所以分数压在 78–84 这个区间。
这篇讲的是让 AI 智能体在干活时,把成功和失败的经验都存下来,变成一个可复用的技能库。方法叫 EvolveR,核心是给经验打分、建库,再用 GRPO 训练智能体学会什么时候该去库里检索经验。论文在七个复杂问答基准上测了 Qwen2.5-3B 和 7B,说平均性能是目前最好的。不过正文因为微信环境验证没过去,具体实验数据、对比方法和消融实验都看不到,这...
推荐理由:标题的钩子很清晰——Agent 自己从失败轨迹里蒸馏经验,长出来的技能比人写的更强。正文给了 EvolveR 的方法名、7 个复杂问答基准和 Qwen2.5-3B/7B 的最优平均结果,信息量够。不过目前只有媒体摘要,没看到代码仓库、绝对分数和复现细节,所以分数先放在 82 这个研究发布档位。