# 港科大等十余所高校发 88 页综述，给“世界模型”画了一张统一地图

> 原标题：港科大、新加坡国立、牛津等十余所高校联合发了一篇 88 页的综述，试图解决一个越来越尴尬的问题：“世界模型”这四个字在不同圈子里意思完全不同。

- 来源：X · @dotey（宝玉）
- 发布时间：2026-04-28T18:03:23.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/11232
- 原文：https://x.com/dotey/status/2049187740084731991

## 摘要

这篇综述先捅破一层窗户纸：做强化学习、视频生成、Web Agent 的人嘴里说的“世界模型”根本不是一回事，论文之间没法比。作者团队拉出一个“能力等级 × 领域法则”的二维框架，把 400 多篇工作摆到同一张桌子上。能力分三层：L1 只预测下一步，L2 能做多步推演且遵守领域基本规则，L3 能在预测翻车时自己诊断原因、设计实验、修正模型。领域分物理、数...

## 推荐理由

我会先打个折：这不是新模型发布，是一篇梳理定义的综述。但它的价值在于把“世界模型”这个被用烂的词拆成可验证的层级和领域法则，400 多篇文献、26.2% 的物理一致性通过率、A-Lab 的闭环实验数据，都让讨论从玄学回到工程。对从业者来说，下次再有人说“我们做了世界模型”，可以直接拿这篇的框架去问到底在哪个层级、遵守什么领域法则。

## 锐评

这篇 88 页的综述先捅破一层窗户纸：做强化学习、视频生成、Web Agent 的人嘴里说的“世界模型”根本不是一回事，论文之间没法比。作者团队拉出一个“能力等级 × 领域法则”的二维框架，把 400 多篇工作摆到同一张桌子上，这事本身就有价值——至少以后吵架有个坐标系了。

几个数字值得留意。视频生成模型在物理一致性测试上通过率只有 26.2%，说明画面好看不等于懂物理，杯子穿桌子的 bug 还很多。LLM 驱动的社会模拟能复现舆论极化，但智能体有系统性趋同偏差，跟真实人类行为分布偏离大，拿来预测社会趋势要打折扣。目前 L3 进化器做得最成熟的是 A-Lab，用机械臂 17 天跑 353 次闭环实验合成 36 种化合物，失败实验被提炼成知识而非丢弃，这个闭环自修正的思路比单纯堆参数有意思。

论文末尾抛出一个根本问题：人类历史上最成功的世界模型都是符号化的、可编辑的，而现在的神经网络把所有规则藏在权重里，L1、L2 阶段够用，到了需要修改模型结构本身的 L3，这种隐式表示就成了障碍。正文没给出答案，但把问题摆对了位置。还缺的是：这个框架本身还没经过社区大规模验证，不同领域之间的迁移难度也没量化，先别把它当标准答案用。
