OpenAI发布心理健康基准MentalHealthBench,评估AI应对真实场景能力
9月24日,OpenAI正式发布开放式基准测试MentalHealthBench,用于评估AI系统在真实心理健康场景下的应对能力。该基准包含1215段合成心理健康对话,覆盖从日常心理健康话题到紧急心理健康事件等不同情况。
据OpenAI介绍,该基准由来自22个国家和地区的80多名持证心理学家和精神科医生共同参与制定,专家使用19种语言,覆盖近20个心理健康专业领域,完整数据集共包含5262条由专家撰写的评分标准。数据集中,非急性对话占53.5%,高风险对话占18.2%,紧急对话占28.3%;用户画像方面,成年人占68.1%,青少年占21.2%,临床医生占5.8%,照护者占4.9%。
OpenAI使用论文中描述的隐私保护技术生成这些合成对话,其方法与Clio类似,目标是尽可能反映ChatGPT在现实世界中的心理健康使用模式。每段对话至少由3名专家审核,评分标准针对模型回答的具体方面赋予-10至+10的权重,正分奖励有益行为,负分惩罚有害行为。
评估中,自动评分器根据专家标准对模型回答评分,该评分器采用高推理强度的GPT-5.6 Sol,每项任务独立采样4个模型回答。根据公布的测试结果,GPT-6 Astra的任务截断得分最高,为57.3%;GPT-6 Sol为53.9%,Claude Opus 5.5为52.4%,GPT-4o(2025年3月版本)为32.1%。
OpenAI表示,此次公开发布MentalHealthBench,是希望其他研究人员能够审查其方法、开展独立评估,并在此基础上进一步研究。OpenAI同时强调,ChatGPT不能替代心理治疗或专业医疗服务。
- 2026-09-24 15:22 | IT之家:OpenAI 发布 MentalHealthBench:1215 段对话评估 AI 心理健康应对能力阅读原文
IT之家 9 月 24 日消息,OpenAI 今日推出了 MentalHealthBench,这是一个开放式基准测试,包含 1215 段合成心理健康对话,用于评估 AI 系统在真实场景下的应对能力,覆盖从日常心理健康话题到紧急心理健康事件等不同情况。据IT之家了解,该基准由来自 22 个国家和地区的 80 多名持证心理学家和精神科医生共同参与制定。这些专家共使用 19 种语言,覆盖近 20 个心理健康专业领域。每段对话都配有由专家团队制定的评分标准。根据配套研究论文,完整数据集共包含 5262 条由专家撰写的评分标准。OpenAI 表示,此次公开发布 MentalHealthBench,是希望...