LLM 裁判只会检查“有没有”,不会发现“缺了什么”:AI 病历漏写检测的盲点
LLM Judges Verify Presence, Not Absence: Omission Blindness in AI Clinical Notes
用大模型当裁判去检查 AI 写的病历,发现它特别不擅长抓“漏写”——信息在问诊里提到了,但病历没记。论文建了一个 500 对的测试集,每对只有一处改动。对于“多写了”或“改写了”的内容,裁判的识别准确率在 0.79-0.94 之间;但对于“漏写了”,准确率只有 0.50-0.63,基本等于瞎猜。换个做法能救:先让模型把问诊记录里所有事实列出来,再逐条核...