ChatGPT ニュース 2026/09/23 AI判定 重要度:中

OpenAI、80名超の有資格メンタルヘルス専門家と開発した「MentalHealthBench」を公開

#OpenAI#ChatGPT#メンタルヘルス#AI安全性#ベンチマーク

OpenAIは、AIシステムがメンタルヘルスに関する会話にどう対応するかを評価するオープンソースの評価枠組み「MentalHealthBench」を公開しました。緊急時のシナリオだけでなく、現実的な利用状況を反映するよう設計されています。

詳細

  • 開発体制: 22か国、80名を超える有資格メンタルヘルス専門家と共同開発。19言語、約20の専門分野を代表する専門家が合成会話をレビューし、有益な挙動には加点、有害な挙動には減点する形で-10から+10の重み付けスコアリング基準を構築。各会話は最低3名の専門家が評価し、2名以上が一致した基準のみを採用
  • 評価対象: 安全性、状況確認、ユーザーの主体性の維持、実行可能なガイダンスの提供を含む10の行動指標を、4種類のユーザー像(成人、13〜17歳の10代、介護者、臨床医)と3段階の緊急度(日常的な非緊急の会話、深刻な懸念を示す高緊急度の状況、現実世界での緊急支援を要する事態)にわたって評価
  • 結果: OpenAIは2026年9月時点でのフロンティアモデル間の比較結果を公表し、時間の経過とともに着実な改善が見られること、新しいモデルほど状況確認能力や総合的な成績が向上していることを示した
  • 提供状況: 独立した研究、検証、研究コミュニティによるさらなる発展のために公開

その後

このベンチマークにより、OpenAIおよび外部の研究者は、汎用的な能力ベンチマークでは評価しづらい特定の安全性の側面——メンタルヘルスに関する会話——を、専門家によって検証された共通の指標で測定できるようになります。今回の公開は、同じ週に発表されたミスアライメント報告の枠組みや第三者評価の原則とともに、AI安全性の透明性向上に向けたより広範な取り組みの一部として位置づけられます。