AI News JAPAN

世界のAIニュースを最速で把握できるメディア

Advertisement

OpenAI、80人超の専門家と共同開発したAIメンタルヘルス評価基準「MentalHealthBench」を公開

30秒サマリー

  • OpenAIが22カ国80人超のメンタルヘルス専門家と共同で、AIの精神的健康対応力を測るオープンベンチマークを公開した
  • 危機的場面だけでなく日常的なストレスから緊急事態まで幅広い会話シナリオを網羅し、専門家が個別ルーブリックを作成
  • 外部研究者も活用できるよう公開し、AI評価の共通基盤として業界全体での活用を促す

何が起きたか

OpenAIは2026年9月23日、AIシステムのメンタルヘルス対応能力を評価するオープンベンチマーク「MentalHealthBench」を公開した。22カ国・19言語を話す80人以上のライセンス取得済み心理士・精神科医が共同開発に参加しており、メンタルヘルスの約20の専門分野をカバーする。

同ベンチマークは、日常的なストレス(非急性)、深刻な精神的苦痛(高急性)、緊急事態の3つのカテゴリーにわたる合成会話シナリオを収録する。プライバシー保護技術を用いて生成された合成会話は実際の利用パターンを反映しており、成人・ティーン・介護者・臨床医などの多様なペルソナと複数言語・地域を含む。各会話は少なくとも3人の専門家がレビューし、2人以上が合意したルーブリック基準のみを採用する厳格なプロセスを経ている。

評価基準は「安全性」「文脈の確認」「ユーザーの自律性の尊重」「実行可能なアドバイスの提供」といった行動軸で構成される。各基準には−10から+10の重みが付与され、有益な対応を加点、有害な対応を減点する仕組みだ。モデル応答の採点には自動採点システム「GPT‑5.6 Sol」を使用している。同社は他の研究者も利用・発展できるよう、ベンチマークを公開リソースとして提供している。

原典ハイライト

「メンタルヘルスは良好な状態から日常的なストレス、急性の危機まで連続体として存在する。その全範囲でユーザーと関わるAIシステムは、臨床科学と実生活の経験の両方に根ざす必要がある」(米国心理学会CEO アーサー・エバンス博士)。また参加した精神科医は「臨床家の関与なしにはAIが利用者の健康を支援することはできない」と指摘しており、専門家の継続的な参画の重要性を強調している。

出典: OpenAI News/Research(公式ブログ)

So What?(なぜ重要か)

これまでのAIメンタルヘルス評価は主に緊急場面に偏っていたが、MentalHealthBenchは日常的な感情的会話から緊急事態まで連続的に評価できる初の包括的ベンチマークとなる。オープンリソースとして公開されることで、OpenAI以外のAI開発者・研究者も同一基準で自社モデルを評価でき、業界全体のメンタルヘルス対応品質の底上げと標準化が進む可能性がある。

日本企業への示唆

HR・EAP(従業員支援プログラム)領域やメンタルヘルスアプリにAIを導入・検討している日本企業にとって、MentalHealthBenchは導入候補モデルの安全性・適切性を比較評価する際の客観的指標となりうる。ベンチマークが公開されているため、自社ソリューションのベンダー選定時に「MentalHealthBenchのスコアや評価結果を提示させる」という調達基準を設けることが現実的な選択肢になる。また、同ベンチマークが「ユーザーの自律性の尊重」「文脈の確認」を重視している点は、AI導入後のガバナンス設計(過剰介入の防止・文化的文脈への配慮)を検討する上でも参考になる。

背景・経緯

OpenAIはこれ以前にも医療全般を対象とした「HealthBench」および「HealthBench Professional」を開発・公開しており、MentalHealthBenchはその専門特化版として位置づけられる。同社によれば、ChatGPTは週10億人超が利用しており、メンタルヘルスに関わる会話も多く発生していることが開発の背景にある。危機時の対応として、ローカライズされた危機相談窓線の案内機能や「信頼できる連絡先」機能もChatGPTに実装されている旨が原文で言及されている。