2025年5月、OpenAIは医療AIの評価ベンチマーク「HealthBench」を公開しました。それ以降、HealthBenchは医療分野における大規模言語モデルの事実上の物差しになっています。同年8月のGPT-5の発表では、HealthBench Hardのスコアが主要な成果のひとつとして掲げられました1。

ベンチマークは、モデルの「良さ」を定義します。つまり、HealthBenchの中身を見れば、いま世界最高水準の医療AIが「何を正解として育てられているか」がわかります。

そこで、公開されているデータを実際に数えてみました。

HealthBenchとは何か

HealthBenchは、262人の医師が作成した5,000件の医療に関する会話と、それぞれの会話に対して医師が書いた採点基準(ルーブリック)からなります2。ルーブリックの総数は48,562項目。モデルの回答は、この基準に照らして一項目ずつ採点されます。

医師は60か国での診療経験を持ち、49言語に対応し、26の専門領域にまたがっています。会話は「救急の見極め」「不足情報の確認」「グローバルヘルス」「医療データ処理」「相手に応じた説明」「不確実性への対応」「回答の深さ」の7テーマに分類されています。

スコアの推移は明確です。GPT-3.5 Turboが16%、GPT-4oが32%、o3が60%。難問だけを抽出したHealthBench Hardでは、公開時の最高スコアが32%(o3で31.6%)、GPT-5で46.2%に達しました12。

設計として優れたベンチマークであることは、まず認めるべきだと思います。医師が実際に基準を書き、医師の重みづけで採点される。医療AIの評価が、選択式の国家試験問題から実際の対話へと前進した意義は大きいものです。

「正解」は、何語で書かれているか

問題は、その5,000件の会話がどの医療の文脈を反映しているかです。

第三者による分析論文(Liu & Liu, Journal of Medical Systems, 2025)によれば、会話の85.0%(4,248件)は英語で、スペイン語が3.8%、ポルトガル語が3.5%。残りの7.7%(387件)を、29の言語で分け合っています3。

日本語は、この「残りの29言語」のどこかにあります。

正確な数字を知るために、OpenAIが公開しているデータセット(simple-evalsリポジトリのJSONLファイル)をダウンロードし、5,000件すべての会話について、ユーザー発話にひらがな・カタカナが含まれるものを数えました4。

9件

HealthBenchの全5,000会話のうち、日本語で書かれた会話の数。
全体の 0.18% にあたります。

参考までに、同じ方法で数えると韓国語(ハングル)は12件、かなを含まない漢字のみの会話(多くは中国語)は44件でした。

補足すると、日本語を話す医師がまったく参加していないわけではありません。論文のAppendix Aにある49言語のリストには、日本語も含まれています2。しかし、それは「医師の言語能力」のリストであって、会話やルーブリックの分布ではありません。日本の臨床規範がHealthBenchのどこに、どれだけ反映されているのかは、論文からは読み取れません。

なぜ評価データが、訓練を決めるのか

「HealthBenchは評価用であって、訓練データではない」という反論はありうると思います。実際、論文はHealthBenchを訓練に使うかどうかについて何も述べていません2。

しかし、この区別は実務上ほとんど意味を持ちません。理由は二つあります。

第一に、ベンチマークは開発の照準になります。HealthBench Hardのスコアが31.6%から46.2%に上がったのは、偶然ではありません。モデル開発の各段階で、この評価軸に沿った改善が選ばれ続けた結果です。評価で測られないものは、改善の対象になりません。

第二に、ルーブリック型の評価は、訓練の報酬信号と同じ構造をしています。「この回答は基準Aを満たすか、基準Bを満たすか」を採点し、そのスコアで回答の良し悪しを決める仕組みは、現在の大規模言語モデルの事後学習で使われる報酬モデルと形が同じです。医師が書いた48,562項目の基準は、評価に使えるなら、そのまま学習の目標にも使えます。

つまり、HealthBenchで「正解」とされた振る舞いは、次世代のモデルが目指す振る舞いになります。その正解の85%が英語圏の医療を前提に書かれているなら、モデルは英語圏の医療に最適化されていきます。

「正解」は、土地によって違う

医療の正解が国によって異なることは、医師にとっては当たり前の事実ですが、ベンチマークの設計ではしばしば見落とされます。

わかりやすい例が薬物代謝です。抗血小板薬クロピドグレルの効き方を左右するCYP2C19という酵素には、機能が低下する遺伝子型があります。この「代謝が遅い(poor metabolizer)」型の頻度は、欧州系で2〜3%なのに対し、東アジア系では約15%に達します。機能が中程度に低下した型まで含めると、東アジア系では45%を超えます56。

つまり、「クロピドグレルを標準用量で開始する」という回答は、米国の患者を前提にすれば妥当でも、日本の患者に対しては、遺伝子型の確認や代替薬の検討に触れなければ不十分になりえます。米国の医師が書いたルーブリックが、日本では必須の一項目を含んでいない可能性があるのです。

薬理だけではありません。国民皆保険のもとでのフリーアクセス、かかりつけ医と専門医の関係、添付文書に定められた日本独自の承認用量、救急受診の閾値、家族への告知の慣習。「適切な回答」を構成する要素は、制度と文化の上に成り立っています。

HealthBenchには「グローバルヘルス」というテーマがあり、「資源の可用性、臨床規範、地域ごとの疾患パターンの違いにモデルが適応できるか」を評価するとされています2。しかしこのテーマの主眼は、医療資源の乏しい環境への適応にあります。日本は資源が乏しいのではなく、規範が異なるのです。そのずれは、このテーマの軸では捉えられません。

日本が持つべきもの

HealthBenchを批判することが目的ではありません。OpenAIは、自分たちのモデルが最も使われる市場を前提にベンチマークを設計しました。それは合理的な判断です。

問題は、日本側に相当するものが存在しないことにあります。

医療AIが日本の患者のために正しく機能するには、三つのものが必要だと考えています。

一つ目は、日本語の実際の会話と症例です。 5,000件中9件ではなく、日本の患者が実際に何を尋ね、どう表現するかを反映した、十分な量のデータ。

二つ目は、日本の医師が書くルーブリックです。 「日本の臨床でこの回答は通用するか」を判断できるのは、日本で診療している医師だけです。評価基準の作成は、翻訳では代替できません。

三つ目は、学習に入る構造化された日本の臨床データです。 評価は、モデルの現在地を測ります。しかし現在地を動かすのは、学習データです。日本の人々の症例が学習に含まれなければ、評価でどれだけ差が見えても、モデルは変わりません。

Mozuは、この三つを日本でつくるために設立しました。日本の人々の医療データをAIが学べる形に構造化し、日本の臨床を知る医師による評価体制を構築します。HealthBenchが英語圏の医療AIに対して果たしている役割を、日本の医療AIに対して果たすことが、私たちの仕事です。

おわりに

HealthBenchの公開は、医療AIの評価を大きく前進させました。同時に、その5,000件の会話は、いまの医療AIが「誰のために」育てられているかを、正直に映しています。

日本語の会話は9件。この数字を、日本の医療AIの現在地として受け止めるべきだと考えています。

出典

  1. OpenAI, “GPT-5 System Card,” August 2025. HealthBench Hardのスコアについて、o3の31.6%からGPT-5(thinking)の46.2%への改善を報告。 https://cdn.openai.com/gpt-5-system-card.pdf ↩
  2. Arora, R. K., Wei, J., Soskin Hicks, R., et al., “HealthBench: Evaluating Large Language Models Towards Improved Human Health,” arXiv:2505.08775, May 2025. 会話数・医師数・国数・言語数・ルーブリック数・7テーマ・各モデルのスコア・Appendix Aの言語リストの出典。 https://arxiv.org/abs/2505.08775 ↩
  3. Liu, J. & Liu, S., “Dissecting HealthBench: Disease Spectrum, Clinical Diversity, and Data Insights from Multi-Turn Clinical AI Evaluation Benchmark,” Journal of Medical Systems, 2025. 会話の言語分布(英語85.0%、スペイン語3.8%、ポルトガル語3.5%、その他29言語7.7%)の出典。 https://pmc.ncbi.nlm.nih.gov/articles/PMC12304011/ ↩
  4. 日本語会話数の集計方法:OpenAIの simple-evals リポジトリが参照する公開データセット(2025-05-07-06-14-12_oss_eval.jsonl、5,000件)をダウンロードし、各会話の prompt 中の user ロールの発話にひらがな・カタカナ(Unicode U+3040〜U+30FF)が1文字以上含まれる会話を「日本語」として計数した。ローマ字のみ、または漢字のみで書かれた日本語の会話は含まれない。集計日:2026年9月18日。 https://github.com/openai/simple-evals ↩
  5. Dean, L., “Clopidogrel Therapy and CYP2C19 Genotype,” Medical Genetics Summaries, NCBI Bookshelf. https://www.ncbi.nlm.nih.gov/books/NBK84114/ ↩
  6. “Major Allele Frequencies in CYP2C9 and CYP2C19 in Asian and European Populations: A Case Study to Disaggregate Data Among Large Racial Categories,” Journal of Personalized Medicine, 15(7), 274, 2025. https://www.mdpi.com/2075-4426/15/7/274 ↩