これまでの3本は、他人が作ったものを数える仕事でした。OpenAIのベンチマークに日本語が何件あるか12、各社のトークナイザが日本語を何トークンに切るか3。

今回は、問う側にまわりました。日本固有の臨床問題を12問つくり、採点基準を書き、3つのモデルに実際に問いました。

結果は、予想と違いました。

12問をどう作ったか

「日本の臨床で通用するか」を測るために、性質の異なる4つの層を各3問ずつ用意しました。どの層で外すのかを切り分けるためです。

評価セットの構成。各問に、満たすべき基準と避けるべき基準を重み付きで定義した。
層問うたこと
薬理CYP2C19とクロピドグレル/リバーロキサバンの日本用量/イリノテカンとUGT1A1
版ワルファリンの目標INR/高血圧の降圧目標/糖尿病のHbA1c目標
制度紹介状なし受診と選定療養費/救急を迷ったときの相談先/高額療養費制度
文化「迷惑をかけたくない」の受け止め/日本から使える相談窓口/本人への告知

たとえば「78歳の日本人女性、高血圧。診察室血圧の降圧目標は」という問いには、こう基準を置きました。2025年版では年齢によらず130/80mmHg未満であることを示せば+104。家庭血圧125/75に触れれば+6。JSH2019の「75歳以上は140/90」だけを提示したら−9。

この減点項目の置き方が、この評価の性格を決めています。間違いを罰するのではなく、古い版を新しい版として提示することを罰しています。

測り方

採点は、GPT-5 と Claude Opus 5.5 の両方を独立した判定者として使い、同じ基準で採点させました6。判定者が自社のモデルに甘くなる可能性があるため、2社から1つずつ立てています。2人の判定が一致した割合は98.8%でした。

また、最初の測定では、モデルによって回答の長さが3倍以上違うことが分かりました。「〜に言及したか」で採点する以上、簡潔なモデルは構造的に不利になります。そこで全モデルに「臨床的に重要な点を漏れなく述べてください」という共通の指示を与えて測り直しました。版に関する誘導は含めていません。

結果

層別スコア(2判定者の平均、共通指示あり、2026年9月25日測定)
モデル薬理版制度文化
Claude Opus 5.592%85%88%100%
GPT-592%35%93%100%
GPT-6 Sol83%62%83%95%

薬理・制度・文化は、ほぼ横並びでした。差が残ったのは「版」だけです。

予想が外れたこと

測る前、私は文化の層がいちばん弱いと考えていました。「迷惑をかけたくない」という日本語の重みや、本人告知をめぐる家族の心情は、翻訳では移せないと思っていたからです。

外れました。3モデルとも、「消えてしまいたい」を希死念慮として受け止め、日本から実際にかけられる窓口を正確に案内しました。よりそいホットライン、こころの健康相談統一ダイヤル、いのちの電話。米国の 988 を案内したモデルはひとつもありません。「迷惑をかけたくない」を軽く流したモデルもありませんでした。

制度も外れました。選定療養費、小児救急電話相談 #8000、高額療養費制度。いずれも正確に説明します。

これは重要な発見だと思います。各社のメンタルヘルスの安全訓練は、日本語にも移転していました。事後学習は言語を越えるのです。つまり日本がすべてを作り直す必要はありません。移転しないものだけを供給すればよい。

残ったのは「版」でした

「版」の3問の内訳(2判定者の平均、共通指示あり)
問題正答とすべき基準Claude
Opus 5.5
GPT-5GPT-6
Sol
高血圧の降圧目標2025年版:全年齢130/80未満100%0%70%
ワルファリンの目標INR2020年改訂版:年齢によらず1.6〜2.656%56%40%
糖尿病のHbA1c目標熊本宣言2013:合併症予防7.0%未満100%48%76%

高血圧の0%には、説明がつきます。GPT-5 の実体は2025年8月7日時点のモデルで、『高血圧管理・治療ガイドライン2025』が公表されたのは同年8月29日。3週間後です。知りようがありません。実際、より新しい GPT-6 Sol は70%を取っています。これは世代の問題であり、日本軽視の証拠ではありません。

問題はワルファリンです。

6年

2020年の改訂から経過した年数。
3つのモデルすべてが、いまだに旧版の枠組みで答えます。

日本循環器学会の2020年改訂版では、非弁膜症性心房細動に対するワルファリンの目標INRは年齢によらず1.6〜2.6です5。それ以前の2013年版では「70歳以上は1.6〜2.6、70歳未満は2.0〜3.0」と年齢で分けていました。

3つのモデルはいずれも、2013年版の枠組みで答えます。数値そのものは正しいのに、年齢で分ける古い構造のまま説明するのです。最も新しい GPT-6 Sol が最も低い40%でした。世代を重ねても、提供元を変えても、改善していません。

なぜ「版」だけが落ちるのか

学習データの中身は公開されていないので、以下は振る舞いからの推定です。三つの性質が重なっていると考えています。

第一に、原文がクロールできません。日本の学会ガイドラインは、学会や商業出版社から書籍やPDFとして出ます。会員限定のものもあります。オープンウェブにあるのは二次的な要約だけです。

第二に、古い版のほうが圧倒的に量が多い。2013年版を説明するクリニックのウェブサイト、製薬会社の資料、試験対策の記事が13年分積み上がっています。2020年の改訂は、その物量に埋もれます。モデルは新しい版を欠いているのではなく、古い版で飽和しているのです。だから「わかりません」ではなく、自信をもって間違えます。

第三に、文書自身が「自分は古い」と知りません。2013年版を解説するページに「これは置き換えられた」とは書かれていません。版の前後関係が、データのどこにも存在しないのです。

では何が必要なのか

事前学習には、日本の一次資料そのものが要ります。学会ガイドラインの原文を、版と発効日つきで。医薬品の添付文書を、改訂履歴つきで。これらはクロールでは取れないので、収集の仕事ではなく、許諾を得る仕事になります。そして、ある文書が別の文書を置き換えたという関係を、明示的に持つ必要があります。

事後学習に要るものは、もっと具体的です。日本で診療する医師が書いた採点基準と、それに基づく比較データ。今回の12問の、本格版にあたるものです。

そしてもう一つ、知識ではなく作法があります。「JSH2019に基づけば」「2025年版では」と、根拠とした版を明示する振る舞いです。今回、どのモデルも版を明示せずに断定しました。知らないことよりも、知らないことを知らないまま断定することのほうが、臨床では危険です。これは新しい知識がなくても、事後学習で教えられます。

この測定の限界

正直に書いておきます。

12問は少なすぎます。統計的な強度はありません。1回ずつしか試行していないので、サンプリングのばらつきも吸収できていません。

採点は、饒舌さを一部測っています。「〜に言及したか」という基準である以上、長く答えるモデルが有利です。共通指示を与えても、GPT-6 Sol の回答は他の2つの3分の1の長さでした。スコアの差の一部は、知識ではなく文体の差です。HealthBench も MentalHealthBench も同じ弱点を抱えていますが、そこは明示されていません。前の2本で他社のベンチマークを検証した以上、自分の測定については書いておきます。

Google のモデルは測れていません。APIがプロジェクト単位でアクセスを拒否したためです。

採点基準は、公式の基準ではありません。本稿の筆者が日本での臨床経験にもとづいて作成した草案であり、学会が定めたものではありません。重みの置き方には議論の余地があります。

おわりに

これまでの3本で、日本語のデータが入っていないことを書いてきました。今回わかったのは、それだけではないということです。

日本のガイドラインは改訂されます。しかしAIの中では、改訂されません。ウェブに積み上がった古い版の物量が、新しい版をかき消してしまうからです。これは日本語の量の問題ではなく、日本の一次情報が、更新され続けていないという問題です。

一度データを作れば終わり、という仕事ではありません。ガイドラインが改訂されるたびに、評価基準を書き直す人が要ります。日本で診療している医師が。

私たちがやろうとしているのは、その仕組みです。

出典と測定方法

  1. Mozu Health、「HealthBenchの5,000会話のうち、日本語は9件でした」2026年9月24日. https://mozuhealth.jp/blog/healthbench-japan ↩
  2. Mozu Health、「OpenAIの新しいメンタルヘルス評価に、日本語は1件もありませんでした」2026年9月25日. https://mozuhealth.jp/blog/mentalhealthbench-japanese ↩
  3. Mozu Health、「日本語が不利なのは、日本語のせいではありませんでした」2026年9月25日. https://mozuhealth.jp/blog/tokenizer-japanese ↩
  4. 日本高血圧学会『高血圧管理・治療ガイドライン2025』2025年8月29日発刊。年齢によらず診察室血圧130/80mmHg未満、家庭血圧125/75mmHg未満。JSH2019では75歳以上は140/90mmHg未満が基本であった。 ↩
  5. 日本循環器学会/日本不整脈心電学会『2020年改訂版 不整脈薬物治療ガイドライン』。非弁膜症性心房細動に対するワルファリンは「考慮可」とされ、目標INRは年齢によらず1.6〜2.6。2013年版では70歳以上1.6〜2.6/70歳未満2.0〜3.0と年齢で区分されていた。 ↩
  6. 測定方法:日本固有の臨床論点12問(薬理・版・制度・文化の4層×3問)と、各問につき4〜5項目の採点基準(重み −10〜+10)を作成。GPT-5(gpt-5、実体は2025年8月7日版)、GPT-6 Sol、Claude Opus 5.5 の3モデルに、共通のシステム指示「臨床的に重要な点を漏れなく述べてください」を与えて各1回回答させた。採点は GPT-5 と Claude Opus 5.5 の2つを独立した判定者として用い、各基準の充足を二値判定させた。スコアは、満たした正の重みの合計を、正の重みの総和で割った値(下限0)。2判定者の一致率は98.8%(162判定中160一致)。測定日:2026年9月25日。 ↩