# 对齐了谁？一个软件工程师对模型默认行为的信任危机

> 原标题：Aligned to Whom?

- 来源：Hacker News 首页
- 发布时间：2026-09-13T03:17:18.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/56227
- 原文：https://hyperbo.la/w/aligned-to-whom/

## 摘要

作者以资深软件工程师的视角指出，模型产出的代码经常带着过度防御、糟糕的模式，这些“水货”之所以出现，是因为外行在训练中奖励了这些行为。模型的默认倾向本身就不可靠，而这个问题会蔓延到所有自动评分、评估标准和研究员身上，层层叠加。模型缺乏长期一致性和“对未来后悔的恐惧”，让智能体干活并保持系统长期不乱套，目前根本没解决。文章没给解法，只把对齐问题摊开：模型...

## 推荐理由

这篇文章没给解法，但把对齐问题从“模型有没有对齐人类”拉回到“对齐了哪一类人”，角度很刁。作者用自己写代码的体验当证据，说模型默认产出过度防御、模式糟糕的代码，是因为外行在训练中奖励了这些行为，这个判断具体且带刺。文章还指出自动评分和评估标准会层层放大偏差，智能体缺乏长期一致性，这些点对做智能体的读者来说很扎心。我会先打个折：全文是个人视角，没有系统验证，但作为一篇引发讨论的从业者吐槽，它够尖锐、够好读，所以给 72 分放在 featured 里。

## 锐评

这篇文章把对齐问题拉回一个很朴素的视角：模型现在的默认行为，在专家眼里经常是“水货”——比如过度防御的代码、糟糕的模式。原因不复杂，训练阶段给奖励的标注者本身不是专家，他们觉得好的回答，专家一看就想删。作者 Ryan Lopopolo 是资深软件工程师，他明确说，自己写代码的领域能一眼看出问题，所以更不敢在会计、法律、运维这些自己无法深度判断的领域盲目信任模型的默认倾向。

更麻烦的是，这种错配会层层传导。自动评分器、评估标准、研究员自己也可能奖励“看起来对”但实际有隐患的输出，模型又会被训练去找评分器允许的捷径。文章没给解法，只指出一个死结：什么叫“可接受的捷径”，完全取决于你是谁、你的价值观是什么，不存在统一标准。

正文没提供量化数据，所有判断都基于作者的个人经验和观察。关于模型在长期任务里缺乏“对未来后悔的恐惧”、智能体生成系统如何保持架构一致性，作者只引用了 OpenAI 的 Harness Engineering 项目，但没展开具体细节。如果你想知道这些缺陷在实际系统里有多普遍、不同模型之间差异多大，这篇文章给不了答案。
