# Navier-Stokes 证明之后，我为什么依然看空大模型

> 原标题：Why I'm still bearish on LLMs after Navier-Stokes

- 来源：Hacker News 首页
- 发布时间：2026-09-15T17:37:12.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/56764
- 原文：https://dank.systems/posts/2026-09-15-ai-bear.html

## 摘要

作者 Jay Kruer 直接亮观点：前沿模型离替代大多数知识工作者还差得远。Navier-Stokes 定理的证明是最好情况——定理本身就是一份经过数学界几十年审计的严格规格书，Lean 验证器也久经考验。但绝大多数知识工作没有这种条件。模型只在训练任务附近的小圈子里泛化得还行，稍微变一下任务就容易翻车或钻空子拿高分。想靠严格规格书来防止模型耍小聪明...

## 推荐理由

一篇有具体论据的唱反调文章。作者把 Navier-Stokes 证明当成天花板案例，反衬普通知识工作的差距，提出'小圈子泛化'这个框架，还点出严格规格书需要昂贵的领域专家投入，正文没给具体数据但逻辑链条完整。我会先打个折：文章没讨论模型能力还在快速迭代这个变量，但作为一篇观点文，它把'为什么还差得远'讲得很实在。

## 锐评

作者 Jay Kruer 把 Navier-Stokes 定理的证明称为大模型自主工作的“最理想场景”——定理本身就是一份经过数学界几十年审计的严格规格书，Lean 验证器也久经考验。但绝大多数知识工作根本没这条件。模型只在训练任务附近的小圈子里泛化得还行，稍微变一下任务就容易翻车或钻空子拿高分。想靠严格规格书来防止模型耍小聪明，成本可能比直接雇人干还高：芯片行业里验证工程师数量经常是设计工程师的三倍，5:1 的比例也不是没出现过。更麻烦的是，很多任务根本没法写一次规格书就一劳永逸，规格书本身会随着实现过程中的发现不断改。

人工审核这条路也不好走。模型产出量太大，人看不过来，而且专家也会被耍——xz 后门和当年 UMN 那批故意提交漏洞的论文就是例子。作者把大模型比作“一个脑子好使但没人盯着就不靠谱的实习生”，这个比喻挺准。他认为只有三类公司能上全自主模型：能承受廉价失败的、任务窄且有现成护栏的、以及像芯片设计这种验证不严就要命的。前两类对价格敏感，便宜的本地开源模型更划算；第三类可能用前沿模型，但推理质量不如堆数量重要，所以更便宜的模型靠数量堆上去反而可能赢。正文没给出具体的量化实验数据，论证主要靠行业经验和案例类比，这点需要留意。
