# 知识工作的拟像：LLM 把表面功夫做得太好，反而让质量判断失灵了

> 原标题：Simulacrum of Knowledge Work

- 来源：Hacker News 首页
- 发布时间：2026-04-25T17:20:34.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/9879
- 原文：https://blog.happyfellow.dev/simulacrum-of-knowledge-work/

## 摘要

作者在 2026 年 4 月 25 日发了这篇博客，核心观点很直接：大语言模型（LLM）打破了知识工作里靠“表面质量”当质量代理的潜规则。他举了市场分析报告的例子——一份报告日期不对、有错别字、图表贴错，你直接就不看了，因为连表面功夫都没做好的人，研究大概率也不靠谱。这种“看表面”的代理判断以前很管用，成本低、相关性也高。但 LLM 太擅长模仿专业文风...

## 推荐理由

一篇个人视角的尖锐随笔：大模型让产出看起来专业，但审查和信任机制没跟上。用咨询报告和代码审查举例，指出团队现在只是快速扫一眼就通过，真正该盯的是模型背后的概率偏好和评估方式，而不是产出本身像不像真的。观点清晰，但没有实证支撑，我会先打个折，当一篇引发思考的评论看。

## 锐评

作者点出了一个很实在的困境：以前我们看一份报告，如果日期写错、图表贴错、错别字一堆，直接就不看了，因为连表面功夫都不肯做的人，研究大概率也不靠谱。这种“以貌取人”的判断方式虽然粗糙，但成本低，而且以前确实管用。现在LLM把这条路堵死了——它能轻松生成看起来像顶级咨询公司出品的东西，但内容可能跟现实毫无关系。

文章举的例子很具体：工程师用AI写代码，同事用AI做代码审查，AI找出问题，工程师再用AI修，整个工作流程看起来一丝不苟，实际上没人真正思考过代码质量。最后大家只能匆匆扫一眼，打个“LGTM”就开下一轮对话。

作者把矛头指向了训练目标本身——模型被优化的不是“答案对不对”，而是“答案像不像训练语料里的东西”或者“评判员满不满意”。这点说得挺狠，但正文没给出解决方案，也没讨论有没有团队在尝试用事实性指标替代表面质量指标。如果你正在做评估体系，这篇值得一看，但别指望找到解药。
