# 别让大模型自己报“信心分”，这分数基本没用

> 原标题：Don't ask an LLM for a confidence score

- 来源：Hacker News 首页
- 发布时间：2026-07-28T00:06:53.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/47132
- 原文：https://justinflick.com/2026/07/27/llm-confidence-scores.html

## 摘要

Justin Flick 直接给结论：让大模型输出一个 0 到 100 的“信心分”在科学上站不住脚。模型没法可靠地自我评估，连 Anthropic 自己的内省研究都说这种能力很不稳定、看场景。更麻烦的是，“信心”这个词把答案对不对、写得顺不顺、有没有满足用户意图全搅和成一个数了。传统机器学习里，概率分数有校准方法，但大模型把每个 token 的生成概...

## 推荐理由

作者把大模型信心分拆成正确性、流畅度和意图匹配三个维度，指出它们被硬塞进一个数字里，并引用Anthropic的内省研究来论证模型自我评估不可靠。观点清晰，但这是一篇个人博客，没有新的实验数据，话题偏工程实践，所以分数没给更高。

## 锐评

Justin Flick 这篇博客直接给“模型信心分”判了死刑。他的核心论据很清晰：模型没法可靠地自我评估。Anthropic 自己的内省研究都承认，这种能力极不稳定且高度依赖场景。更麻烦的是，“信心”这个词本身就是笔糊涂账——它把答案的正确性、文字的连贯性、是否满足用户意图全压缩成一个 0 到 100 的数字，等于什么都没说。

文章还点出了一个更深的死结：就算让模型用“思考链”来反思，那谁来给这个反思打分？这会陷入无限套娃。DeepMind 的研究也佐证了，没有外部反馈，模型自己改自己，表现经常不升反降。Flick 没给出具体替代方案，但指向了“语义熵”这个方向。全文最大的信息缺口是：没提供任何实验数据来量化这种信心分到底有多不准，论证主要基于逻辑推演和引用已有研究。
