# 提示词没那么重要，不如搭一套评估流水线来管住模型

> 原标题：Prompts Aren't Real

- 来源：Hacker News 首页
- 发布时间：2026-09-20T15:59:25.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/57752
- 原文：https://evaluation.club

## 摘要

Dan McKinley 在演讲里说，整天跟大模型来回改提示词是条死胡同。他做面向消费者的 agent 时发现，哪怕用了结构化输出，模型还是会在一小部分请求里发疯，比如把标题字段塞满废话直到爆掉。他试出来的一个离谱解法是把字段名从“title”改成“heading”，暂时管用，但随时可能失效。他的核心观点是，提示词本身靠不住，得靠 pass^k 测试和...

## 推荐理由

Dan McKinley 拿自己搭消费者 agent 的实战经验说话，案例具体、判断尖锐。但这是个人演讲，不是正式论文，正文也没披露 pass^k 测试的通过率和规模，所以我会先打个折。

## 锐评

Dan McKinley 这个演讲的核心判断很直白：别跟提示词死磕了，那是个死胡同。他做面向消费者的 agent 时发现，哪怕用了结构化输出，模型还是会在一小部分请求里彻底翻车，比如把标题字段塞满废话直到爆掉。他试出来的一个离谱解法是把字段名从“title”改成“heading”，暂时管用，但随时可能失效。这说明模型根本不理解你的指令，只是在统计上蒙答案。

他的主张是用 pass^k 测试和评估管线来约束模型行为，而不是靠改提示词去“驯服”它。但演讲本身是幻灯片，没给出具体的评估框架或指标，也没披露他用的模型、请求量和失败率的具体数字。所以这个思路方向对，但落地细节全是空白。

还缺什么：他说的评估管线到底怎么搭、成本多高、延迟多大，正文都没提。另外，改字段名这种“玄学”解法能撑多久，也没有任何量化结论。
