别让大模型自己报“信心分”,这分数基本没用
Don't ask an LLM for a confidence score
Justin Flick 直接给结论:让大模型输出一个 0 到 100 的“信心分”在科学上站不住脚。模型没法可靠地自我评估,连 Anthropic 自己的内省研究都说这种能力很不稳定、看场景。更麻烦的是,“信心”这个词把答案对不对、写得顺不顺、有没有满足用户意图全搅和成一个数了。传统机器学习里,概率分数有校准方法,但大模型把每个 token 的生成概...
推荐理由:作者把大模型信心分拆成正确性、流畅度和意图匹配三个维度,指出它们被硬塞进一个数字里,并引用Anthropic的内省研究来论证模型自我评估不可靠。观点清晰,但这是一篇个人博客,没有新的实验数据,话题偏工程实践,所以分数没给更高。