大規模言語モデルの医療分野での能力は、主に英語圏のベンチマークで測られています。私たちはこれまでの調査で、OpenAIの医療ベンチマークに日本語がほとんど含まれていないこと、そして主要モデルが日本の臨床ガイドラインの改訂に追随できていないことを示しました1。

このページでは、日本の臨床に即した問題で主要モデルを測定し、その結果を継続的に掲載します。

総合スコアと層別の内訳。2名の判定者による平均。
モデル提供元総合薬理・用量ガイドラインの版制度・受診行動文化・言語
Claude Opus 5.5Anthropic91%92%85%88%100%
GPT-6 SolOpenAI81%83%62%83%95%
GPT-5OpenAI80%92%35%93%100%

最終更新:2026年9月30日 / 問題数12問、採点基準54項目 / 判定者間の一致率 98.8%

何を測っているか

「日本の臨床で通用するか」は単一の能力ではありません。性質の異なる4つの層に分け、各3問ずつを用意しています。

評価セットの構成
層問うていること
薬理・用量日本人に特有の薬物動態と、日本で承認されている用量
ガイドラインの版日本の学会が示す最新の基準に追随できているか
制度・受診行動日本の医療制度を前提に答えられるか
文化・言語翻訳では移せない、日本語での表現と臨床的な重み

各問には、満たすべき基準と避けるべき基準を重み付きで定義しています。重要なのは、誤りそのものではなく、古い基準を現行のものとして版を示さずに断定することに減点を置いている点です。臨床では、知らないことよりも、知らないと気づかないまま断定することのほうが危険だからです。

測定の方法

各モデルには、共通のシステム指示「臨床的に重要な点を漏れなく述べてください」を与えて回答させています。版に関する誘導は含めていません。

採点は、提供元の異なる2つのモデルを独立した判定者として用い、同じ基準で判定させています。判定者が自社のモデルに有利な採点をする可能性があるため、1社に依存しない構成としました。スコアは、満たした正の重みの合計を、正の重みの総和で割った値です。

この評価の限界

公開する以上、限界も示します。

12問は少なすぎます。26の専門領域を持つ医療において、12問が覆える範囲はごくわずかです。産科も小児外科も精神科の薬物療法も含まれていません。統計的な強度もありません。

採点は、回答の長さの影響を受けます。「〜に言及したか」という形式である以上、長く答えるモデルほど多くの項目を満たします。共通の指示を与えてもなお、モデル間で回答の長さには3倍の差がありました。スコアの差の一部は、知識ではなく文体の差です。

採点基準は、まだ査読の途中です。現在の基準は、日本での臨床経験にもとづく草案であり、学会が定めたものではありません。複数の医師による査読を進めており、確定後に基準の全文を公開する予定です。

Google のモデルは、本表に含めていません。測定は行いましたが、結果について追加の検証を進めているためです。確定しだい掲載します。

更新について

この測定は、一度行って終わるものではありません。次のいずれかが起きたときに更新します。

日本の臨床ガイドラインが改訂されたとき。診療報酬が改定されたとき。そして、新しいモデルが公開されたとき。日本の医療制度は2年ごとの診療報酬改定を含めて動き続けており、評価する側も同じ速さで動く必要があります。

ご協力のお願い

この評価セットに、異論のある方を探しています。

「この重みは重すぎる」「この観点が抜けている」「自分の領域ならこう書く」。そうした指摘が、基準を使えるものにします。ご専門の領域で1問だけ書いてみたい、という関わり方でも構いません。

産科、小児科、精神科、緩和ケア、救急、総合診療、病理、放射線科。どの領域にも、日本でしか通用しない正解と、日本では通用しない正解があります。それを書けるのは、そこで診療している方だけです。

ご連絡は info@mozuhealth.com までお願いします。

関連する調査

  1. Mozu Health のコラムに、この評価セットを用いた測定の詳細と、ベンチマーク・トークナイザの調査を掲載しています。 日本のガイドラインは、改訂されてもAIの中では改訂されません / コラムの一覧 ↩