これまでの2本で、OpenAIの医療ベンチマークに日本語がほとんど、あるいはまったく含まれていないことを書きました12。
では、モデルそのものはどうなのか。学習データに日本語がどれだけ入っているのか。
これは測れません。主要なモデルの学習データ構成は公開されていないからです。「各社のモデルを調べて日本語の比率を比較する」という記事は、原理的に書けません。
しかし、測れるものがあります。トークナイザです。
トークナイザとは何か
言語モデルは文章をそのまま読むのではなく、「トークン」という単位に切り分けてから処理します。この切り分けを行うのがトークナイザです。
英語では、単語がおおむねそのまま1トークンになります。一方、日本語がどう切られるかは、そのトークナイザが日本語をどれだけ語彙に含めているかで決まります。語彙が乏しければ、1文字が2トークンにも3トークンにも分解されます。
トークナイザは学習データそのものではありませんが、開発者が日本語をどれだけ考慮したかが、設計に残ります。そして学習データと違い、公開されています。数えられます。
測り方
同じ内容を日本語と英語で用意した対訳文書を作りました。外来初診カルテ、退院サマリ、メンタルヘルスの相談、患者向けの説明文の4種類です。いずれも架空の症例で、実在の患者の記録ではありません。日本語で1,820文字、英語で853語になります3。
これを19のトークナイザに通し、それぞれが何トークンに切り分けるかを数えました。指標は「同じ内容を伝えるのに、日本語が英語の何倍のトークンを要するか」です。
結果
| トークナイザ | 開発 | 日本語 | 英語 | 日/英 |
|---|---|---|---|---|
| Stockmark ★ | ストックマーク | 1,038 | 1,286 | 0.81倍 |
| calm3 ★ | サイバーエージェント | 1,061 | 1,253 | 0.85倍 |
| LLM-jp-3 ★ | LLM-jp | 1,041 | 1,224 | 0.85倍 |
| RakutenAI ★ | 楽天 | 1,247 | 1,286 | 0.97倍 |
| Gemma 2 | 1,190 | 1,137 | 1.05倍 | |
| Gemma 3 | 1,196 | 1,135 | 1.05倍 | |
| Llama 4 | Meta | 1,243 | 1,113 | 1.12倍 |
| Qwen2.5 / Qwen3 | Alibaba | 1,348 | 1,158 | 1.16倍 |
| DeepSeek-V3 | DeepSeek | 1,285 | 1,102 | 1.17倍 |
| Llama 3 / 3.1 | Meta | 1,416 | 1,130 | 1.25倍 |
| Swallow ★ | 東京工業大学 | 1,416 | 1,130 | 1.25倍 |
| ELYZA ★ | ELYZA | 1,416 | 1,130 | 1.25倍 |
| GPT-4o / GPT-5 / GPT-6系 | OpenAI | 1,499 | 1,118 | 1.34倍 |
| gpt-oss | OpenAI | 1,499 | 1,118 | 1.34倍 |
| Mistral | Mistral AI | 2,187 | 1,286 | 1.70倍 |
| GPT-4 / GPT-3.5 | OpenAI | 2,074 | 1,130 | 1.84倍 |
| Phi-4 | Microsoft | 2,074 | 1,130 | 1.84倍 |
最も効率的なものと最も非効率なものの間には、2.3倍の開きがあります。
発見1:日本語の不利は、言語の性質ではない
0.81倍
日本で開発されたトークナイザでの日本語の所要トークン。
英語より少なく済みます。GPT系では1.34倍です。
表の上位4つは、いずれも日本で開発されたトークナイザです。そしてこの4つはすべて1.0を下回っています。同じ内容を伝えるのに、日本語のほうが英語より少ないトークンで済むということです。
これは重要な反証になります。「日本語は情報密度の関係でトークンを食う言語だ」という説明を聞くことがありますが、事実ではありません。日本語を語彙に十分含めたトークナイザでは、日本語は英語より効率的です。漢字1文字が持つ情報量を考えれば、むしろ当然の結果といえます。
日本語が不利なのは、日本語のせいではありません。そのトークナイザが日本語を主要な対象として設計されなかった、という判断の結果です。
発見2:日本製のモデルでも、不利は自動的には解消しない
表の中ほどに、Swallow(東京工業大学)と ELYZA が Llama 3 とまったく同じ数値で並んでいます。1,416トークンと1,130トークン、1桁まで一致しています。
この2つは、Llama 3 を基盤に日本語能力を強化したモデルです。日本語の学習を追加することでモデルの日本語性能は上がりますが、トークナイザを引き継いでいる場合、トークンの効率は基盤モデルのままです。
「日本製のモデルを使えば日本語の不利は解消する」とは限らない、ということです。語彙の拡張を行ったかどうかで結果は分かれます。日本で開発されたものでも、この測定では0.81倍から1.25倍まで幅があります。
発見3:OpenAIは改善している
公平に書いておきます。GPT-4/GPT-3.5世代の 1.84倍から、GPT-4o以降の世代では 1.34倍に改善しています。語彙が10万から20万に拡張された際に、日本語を含む非英語圏の扱いが良くなりました。
ただし、日本で開発されたトークナイザの水準には届いていません。また Google の Gemma は 1.05倍で、フロンティアモデルの中では最も効率的でした。
何が起きるのか
トークン数の差は、文脈長にそのまま効きます。
20万トークンの文脈を持つモデルに、今回測定した退院サマリと同じ長さの文書を入れるとします。英語なら645件、日本語なら451件です。同じモデル、同じ文脈長でありながら、日本語で扱える診療記録は3割少なくなります。
患者の経過を追う、過去のカルテを横断して参照する、複数の検査結果をまとめて読ませる——こうした使い方では、一度に何件を渡せるかが結果を左右します。日本語で運用する医療機関は、同じ製品を使いながら、狭い窓から見ていることになります。
この測定で分からないこと
明記しておきます。トークナイザの効率は、学習データに日本語がどれだけ含まれているかを示すものではありません。
トークナイザが効率的であることは、設計時に日本語が考慮されたことを意味します。しかし、そのモデルが日本の医療をどれだけ学んだかは、この測定からは何も言えません。学習データの構成が公開されていない以上、そこは依然として測れない領域です。
測れるものを測り、測れないものは測れないと書く。前の2本でベンチマークの中身を数えられたのは、OpenAIがデータを公開していたからでした。学習データについて同じことをするには、公開されていない情報が要ります。
おわりに
今回測ったのは、モデルの入口にあたる部分だけです。それでも、日本語で医療AIを使うときの条件が、モデルごとにこれだけ違うことは示せました。
そして、最も効率的だった4つが日本で作られたものだったという事実は、示唆的だと思います。日本語を主な対象として設計すれば、日本語は不利ではなくなる。誰かがそう設計しない限り、不利は続きます。
出典と測定方法
- Mozu Health、「HealthBenchの5,000会話のうち、日本語は9件でした」2026年9月24日. https://mozuhealth.jp/blog/healthbench-japan ↩
- Mozu Health、「OpenAIの新しいメンタルヘルス評価に、日本語は1件もありませんでした」2026年9月25日. https://mozuhealth.jp/blog/mentalhealthbench-japanese ↩
- 測定方法:同一内容の日英対訳文書4組(外来初診カルテ、退院サマリ、メンタルヘルスの相談、患者向け説明文。すべて架空の症例。日本語1,820文字/英語853語)を用意し、各トークナイザで符号化したトークン数を数えた。OpenAI系は
tiktokenのo200k_baseおよびcl100k_base、その他は Hugging Face 上で公開されている各モデルのtokenizer.jsonを用いた。特殊トークンは含めていない。測定日:2026年9月25日。なお Meta と Google のトークナイザは公式リポジトリでは利用申請が必要なため、公開ミラーを用いた。 ↩