# OpenAI 开源心理健康评测集 MentalHealthBench，联合 80 多位持证心理医生，测模型在真实对话里靠不靠谱

> 原标题：Introducing MentalHealthBench

- 来源：OpenAI News
- 发布时间：2026-09-23T10:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/58609
- 原文：https://openai.com/index/introducing-mentalhealthbench

## 摘要

OpenAI 放出了一个叫 MentalHealthBench 的开源评测集，专门看 AI 在心理健康对话里表现怎么样。这个评测集是和 22 个国家、80 多位持证心理医生和精神科医生一起做的，覆盖了从日常情绪倾诉到紧急危机干预的各种场景，还分了成人、青少年、照顾者等不同角色。它不只看模型有没有触发安全红线，更会检查模型会不会主动追问背景、有没有尊重用...

## 推荐理由

OpenAI 放出了一个开源的、由 80 多位持证临床医生参与构建的心理健康评测集，覆盖场景很全，而且检查维度比常规安全测试更细，比如会看模型有没有主动追问背景、有没有尊重用户。这对做 AI 安全和产品的团队来说，是个能直接拿来用的工具。没给更高分是因为它目前还是个评测工具，不是产品落地或重大技术突破。

## 锐评

OpenAI 放出的 MentalHealthBench，是和 22 个国家、80 多位持证心理医生和精神科医生一起做的开源评测集。它不只看模型有没有触发安全红线，还会检查模型会不会主动追问背景、有没有尊重用户的自主权、能不能在合适的时候给出可操作的建议。场景覆盖从日常情绪倾诉到紧急危机干预，还分了成人、青少年、照顾者等不同角色，比之前只盯着紧急情况的评测要全面。

不过这篇公告没给具体数字。哪个模型跑分最高、各项指标差多少、评测一次要花多少钱，正文都没提。只说“结果显示了稳步提升”，但没数据支撑，这点先别太激动。另外，评测用的是合成对话，虽然做了隐私保护，但合成数据和真实用户聊天的差距有多大，也没交代。

还缺什么：一是具体模型得分和对比基线，二是合成数据与真实对话的偏差评估，三是这套评测在实际产品里怎么落地、多久更新一次。如果这些补上，对做 AI 心理健康应用的人会更有参考价值。
