OpenAI 联合全球 22 个国家的 80 多位心理健康专家,正式推出开源评估基准 MentalHealthBench。该基准旨在全面衡量 AI 模型在复杂心理健康与情感对话中的安全性、同理心及实用指导能力。

每周有超过 10 亿人使用 ChatGPT,越来越多的人开始向 AI 倾诉日常压力、人际困扰或寻求人生建议。这类对话不仅要求回答准确,更需要符合实际的判断力,并充分尊重用户的自主选择权。
过去,针对 AI 在心理健康领域的评估大多局限于极端紧急场景,且评估标准往往较为宽泛单一。这种方式难以全面反映模型在真实、多样的心理对话中的表现,也无法判断其回答是否符合专业心理专家的处置规范。
为此,OpenAI 联合来自全球 22 个国家的 80 多位执业心理健康专家,共同推出了开源基准 MentalHealthBench。该基准用于衡量大语言模型在真实心理健康对话中的应对能力,涵盖安全性、上下文主动获取、保护用户自主权以及适时提供可行建议等关键维度。
评估结果显示,主流 AI 模型在处理心理健康议题上的能力正稳步提升。OpenAI 强调,虽然 ChatGPT 无法替代专业心理治疗,但专家的深度参与有助于推动 AI 模型向具备同理心、能促进用户福祉并在危机时刻引导至本地危机热线或紧急联络人的方向演进。
涉及身心健康与情感咨询的对话在主题、紧急程度和文化背景上差异极大。MentalHealthBench 通过隐私保护技术生成了贴合真实使用场景的合成对话,并根据紧急程度划分为三大类:
测试集还覆盖了成年人、13 至 17 岁青少年、看护人以及临床医生等不同用户画像,跨越多种语言与文化区域。针对青少年画像的对话,团队专门邀请了青少年心理健康专家参与审阅,以确保模型回答符合年轻群体的特殊需求。
延续此前针对医疗场景开展的 HealthBench 系列研究,MentalHealthBench 由涵盖近 20 个心理细分专业的 80 多位精神科医生和心理学家协同构建。
专家针对合成对话中模型的最终回复制定了细致的评分准则。每条准则针对单一行为维度(例如是否提出了合适的澄清问题、是否给出了最佳应对建议等),权重分值在 -10 到 +10 之间:正分奖励有益行为,负分惩罚潜在危害,分值绝对值越大代表临床关键度越高。每段对话均经过至少三位专家独立审阅,仅保留达成共识的准则项。
最终的自动化评估采用先进模型根据专家标准进行打分。除了总分,MentalHealthBench 还能将模型表现拆解为 10 个心理行为维度,帮助研究人员清晰定位模型的具体短板。例如评估显示,随着模型能力的迭代,其在对话中「主动获取背景信息」的能力提升显著。
在发布基准的同时,OpenAI 还开展了一项辅助研究:邀请来自 16 个国家、曾借助 AI 获得心理支持的 44 名真实用户对模型回复进行评价。研究团队旨在探究,专家认为专业严谨的回答,是否会在普通人看来显得冰冷或缺乏实用性。
对比发现,普通用户更加看重回答的语气温度以及具体可操作的下一步建议,而专业心理学家则更强调全面收集背景信息以及对含糊信息的严谨界定。这一发现为弥合临床规范与用户情感体验之间的距离提供了宝贵线索。
目前,OpenAI 已将 MentalHealthBench 完全开源,供全球学术界与开发者开展独立测评与后续研究,同时 OpenAI 也通过心理健康研究资助计划支持更多外部合作,推动 AI 在情感支持领域的健康发展。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断