# 一句“别瞎猜”，让 AI 网页抓取时编造字段的比例从 71% 降到 20%

> 原标题：Calling the AI bluff: Adding "Do not guess" cut made-up fields from 71% to 20%

- 来源：Hacker News 首页
- 发布时间：2026-09-27T17:24:17.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/59259
- 原文：https://earnanhonestdollar.com/bench

## 摘要

Earn an Honest Dollar 用 16 个模型和 3 个付费 API 做了个网页信息提取测试，专门看它们遇到页面上没有的字段时会不会老实说“没有”。不加“别瞎猜”指令时，573 个缺失字段里模型编造了 405 个，比例高达 70.7%；加上这句指令后，574 个缺失字段里只编造了 116 个，降到 20.2%。表现最好的是 Gemini ...

## 推荐理由

一个双页对照实验，把一句 prompt 能压住多少模型编造给量化了。数据扎实，方法可复现，对做网页提取的人直接有用。不是产品发布或行业会议，所以没到 85 分以上那档，但 H、K、R 三项都踩实了。

## 锐评

这个测试很直接：用16个模型和3个付费API去提取网页上根本不存在的字段，看它们会不会老实说“没有”。不加“别瞎猜”时，573个缺失字段里模型编造了405个，比例高达70.7%；加上这句指令后，574个缺失字段里只编造了116个，降到20.2%。效果立竿见影，但别急着下结论——测试用的是作者自己写的合成页面，真实网站的表现可能不一样。

最省钱又靠谱的是 Gemini 3.8 Flash，36个缺失字段只编造了1个，跑完全部84页成本才0.16美元。反直觉的是付费API Firecrawl，36个缺失字段编造了24个，比13个模型都差，而且编造的全是页面上的干扰项。正文没披露 Firecrawl 的付费套餐表现是否更好，免费层的结果只能当参考。

他们还试了个省钱检查法：用便宜的 GPT-6 Luna 去验证提取结果是否真的在页面上。49个编造值它揪出38个，47个正确值一个没误杀，检查成本不到半分钱。这个思路挺实用——先用模型提取，再用另一个模型复核，比直接信任单一输出靠谱得多。但测试只跑了一轮，没做重复实验，稳定性还不好说。
