2026年9月23日、OpenAIが「MentalHealthBench」を公開しました1。メンタルヘルスに関する会話でAIがどう応答すべきかを測る、新しい評価ベンチマークです。

前回、同社の医療ベンチマーク HealthBench の5,000会話を数えて、日本語が9件だったことを書きました2。今回も同じことをしました。公開から2日後です。

MentalHealthBenchとは何か

1,215件の会話と、それぞれに対応する採点基準(ルーブリック)5,262項目からなります1。会話は実際のChatGPTの利用傾向をもとに合成されたもので、日常の悩みから精神科的な緊急事態までを含みます。緊急性の内訳は、非緊急が53.5%、高リスクが18.2%、緊急が28.3%。利用者像は成人68.1%、10代21.2%、臨床家5.8%、介護者4.9%です。

ルーブリックを書いたのは、20か国以上から集まった80人以上の精神科医・心理士で、合わせて19の言語を話します。各項目には-10から+10の重みが付き、望ましい振る舞いと避けるべき振る舞いが定義されています。

論文には、言語について明確な意図が書かれています。「LLMは言語や文化的文脈によって異なる振る舞いをしうる。メンタルヘルスの対話の幅を十分に捉えるため、非英語かつ非米国の利用者像を represent する会話を含めた」1。

数えた結果

公開されているデータセットをダウンロードし、1,215件すべての会話の language フィールドを集計しました3。

MentalHealthBench 収録会話の言語別内訳(全1,215件、2026年9月25日集計)
言語会話数割合
英語90374.32%
スペイン語1058.64%
ヒンディー語544.44%
アラビア語342.80%
ポルトガル語292.39%
ドイツ語252.06%
インドネシア語171.40%
ペルシア語171.40%
イタリア語171.40%
トルコ語131.07%
中国語10.08%
日本語00.00%

0件

MentalHealthBenchの全1,215会話のうち、
日本語で書かれた会話の数。韓国語も0件です。

念のため、前回と同じ方法でも確認しました。全会話のユーザー発話について、ひらがな・カタカナを1文字でも含むものを数える方法です。結果は同じく0件でした。互いに独立した2つの方法が一致しています。

医師が書いた5,262項目のルーブリックのうち、日本語の会話に紐づくものも0項目です。論文本文に「Japanese」「Japan」という語は一度も現れません。臨床家は19の言語を話しますが、データとして存在する言語は11でした。

なぜ、精神医療でこれが重いのか

前回の HealthBench は、身体疾患を含む医療全般のベンチマークでした。そこでの日本語0.18%も十分に低い数字です。しかし今回の対象は精神医療です。ここには、別の重さがあります。

精神医療の応答は、言語そのものが臨床行為の一部です。身体疾患であれば、検査値や画像という言語に依存しない情報が判断を支えます。しかし精神医療で医師が扱うのは、ほぼ言葉だけです。何をどう語るか、何を語らないか、どの表現が危険信号なのか。それらはすべて言語と文化の上に成り立っています。

「死にたい」と「消えたい」と「もう疲れた」の距離は、日本語話者の間でも文脈によって変わります。家族に打ち明けるか職場に伏せるか、精神科の受診をどう位置づけるか、「迷惑をかけたくない」という語が何を意味するか。これらは翻訳で移せるものではありません。

そして日本は、この領域で特に大きな課題を抱えている国です。自殺死亡率はG7のなかで最も高く、15歳から34歳の世代で死因の第1位が自殺であるのは、G7では日本だけです4。

日本語話者がChatGPTに深夜に打ち明ける言葉は、いまのところ、どの評価基準にも映っていません。

9件から、0件へ

2つのベンチマークを並べます。

OpenAIの2つの医療系ベンチマークにおける日本語の収録状況
ベンチマーク全会話数日本語割合
HealthBench(2025年5月)5,00090.18%
MentalHealthBench(2026年9月)1,21500.00%

これを「悪化した」と読むのは、おそらく正確ではありません。MentalHealthBench は HealthBench より小規模で、収録言語も11に絞られています。限られた枠の中で、どの言語を入れるかが選ばれた結果です。

だとすれば、問題はもっと単純です。枠が限られたとき、日本語は選ばれなかった。スペイン語、ヒンディー語、アラビア語、ポルトガル語、ドイツ語、インドネシア語、ペルシア語、イタリア語、トルコ語が選ばれ、日本語は選ばれませんでした。

これは非難ではありません。OpenAIは、自社のモデルが最も使われる市場と、専門家を集められた範囲で設計しています。合理的な判断です。ただし、その合理性の外側に日本が置かれているという事実は、変わりません。

評価がないと、何が起きないのか

前回も書いたとおり、ベンチマークは開発の照準になります。測られない性能は、改善の対象になりません。

今回のベンチマークで、各モデルのスコアは50%台です1。裏を返せば、ここから先の改善余地が大きいということでもあります。今後モデルが MentalHealthBench のスコアを上げていくとき、その改善は11の言語の上で起こります。日本語での応答が良くなるかどうかは、測られていない以上、偶然に委ねられます。

そして精神医療では、その偶然の帰結が重い。緊急性の判断を誤れば、人が死にます。

日本がすべきこと

前回、三つのものが必要だと書きました。日本語の実際の会話と症例、日本の医師が書くルーブリック、学習に入る構造化された日本の臨床データです。

今回の件は、二つ目の緊急度を上げます。MentalHealthBench は、80人以上の臨床家が書いたルーブリックという形で「何が良い応答か」を定義しました。日本の精神科医が同じものを書かなければ、日本語での「良い応答」は誰にも定義されないままです。

そしてこれは、誰かがやってくれるのを待てる種類のものではありません。OpenAIが次に作るベンチマークに日本語が入る保証はなく、入ったとしても、それを書くのは日本で診療している医師でなければ意味がありません。

おわりに

公開から2日で数えられる程度の作業です。特別な技術は要りません。データをダウンロードして、1,215行を数えるだけです。

それでも、この0という数字が日本語で報告されるのを待っていても、おそらく誰も報告しません。だから数えました。

次に医療AIのベンチマークが公開されたとき、私たちはまた数えます。その数字が0でなくなるまで続けます。

出典

  1. Malik, A., Grabb, D., Soskin Hicks, R., Arora, R. K., Bowman, P., Sharman, M., Ghalebikesabi, S., Trofimov, M., Monaco, V., Singhal, K., “MentalHealthBench: An Expert-Informed Benchmark of AI Capabilities in Realistic Mental Health Conversations,” OpenAI, 2026年9月23日. 会話数1,215件・ルーブリック5,262項目・臨床家80人以上/20か国以上/19言語・緊急度と利用者像の内訳・各モデルのスコア・2.1.5節の言語に関する記述の出典。 https://openai.com/index/introducing-mentalhealthbench/ ↩
  2. Mozu Health、「HealthBenchの5,000会話のうち、日本語は9件でした」2026年9月24日. https://mozuhealth.jp/blog/healthbench-japan ↩
  3. 集計方法:OpenAIが公開しているデータセット(OAI_MentalHealthBench.zip に含まれる mentalhealthbench_eval.jsonl、1,215行)をダウンロードし、各会話の language フィールドを集計した。あわせて、各会話の user ロールの発話にひらがな・カタカナ(Unicode U+3040〜U+30FF)が1文字以上含まれるかを判定する方法でも数え、両者が一致することを確認した。集計日:2026年9月25日。 https://cdn.openai.com/ctf-cdn/OAI_MentalHealthBench.zip ↩
  4. 厚生労働省『令和7年版 自殺対策白書』第1章「自殺の現状」のうち「海外の自殺の状況」および第2章「若年層の自殺の状況」。 https://www.mhlw.go.jp/stf/seisakunitsuite/bunya/hukushi_kaigo/seikatsuhogo/jisatsu/jisatsuhakusyo2025.html ↩