診療の記録が音声から自動で作られるようになりつつあります。医師が会話に集中でき、記録の時間が減ることは、日本の医療にとって大きな意味を持ちます。ただしその前提は、会話が正しく文字になっていることです。
そこで、日本語の診療会話を音声から書き起こす能力を測るベンチマークを作り、17のシステムで測定しました。日本で2016年に承認された抗ヒスタミン薬ビラスチンは、12会話に6回現れます。6回とも書き起こせたのは、そのうち2つだけでした。
なぜ書き起こしを測るのか
診療の記録には時間がかかります。米国の調査では、外来の受診1件あたり医師が電子カルテに費やす時間は平均16分14秒で、そのうち24%がカルテの作成でした。約1億件の受診、約15万5千人の医師、417の医療システムを対象にした調査です1。
日本では2024年4月から、医師の時間外労働に上限規制が適用されました2。記録に要する時間は、個々の医師が我慢する話ではなく、制度上の制約になっています。会話から記録が自動で作られるなら、その制約は緩みます。ただしそれは、会話が正しく文字になっている場合に限られます。
ここにはもう一つ、別の問題があります。
日本の診療の大半は話し言葉で行われ、そのまま消えていきます。書き起こされなかった会話は、データとして残りません。音声認識の精度は、記録作業が楽になるかどうかだけでなく、日本語の医療AIが何を学べるかの上限を決めています。
この関係は循環します。日本語の診療データが少ないため、モデルは日本語の診療会話をうまく書き取れません。書き取れないため、診療会話はデータになりません。データにならないため、日本語の診療データは少ないままです。
この循環の入口がどこまで通っているのかを測るのが、本稿の目的です。
何を測ったか
模擬のオンライン診療12会話、合計72分の音声を用意しました。初診と再診の対になっているものを含みます。実際の患者ではなく、登場する氏名はすべて仮名です。この音声に対する正解は、日本人医師と日本語話者のクリニック従業員の2名が、一語ずつ確認して作った書き起こし文です。
各システムには同じ音声と同じ指示を与え、逐語的な書き起こしを求めました3。対象は次の17です(kotoba-whisper の v2.0 と v2.2 は出力が同一のため、出力としては16種類です)4。
| システム | 提供元 | 種別 |
|---|---|---|
| gemini-3.1-pro | 汎用モデル(音声入力) | |
| gemini-3.8-flash | 汎用モデル(音声入力) | |
| gpt-transcribe | OpenAI | 書き起こし専用 |
| gpt-4o-transcribe | OpenAI | 書き起こし専用 |
| gpt-4o-transcribe-diarize | OpenAI | 書き起こし専用 |
| whisper-1 | OpenAI | 書き起こし専用 |
| whisper-large-v3 | OpenAI(ローカル実行) | 書き起こし専用 |
| Scribe v1 | ElevenLabs | 書き起こし専用 |
| Scribe v2 | ElevenLabs | 書き起こし専用 |
| AWS Transcribe | Amazon Web Services | 書き起こし専用 |
| Qwen3.8-Omni-Flash | Alibaba | 汎用モデル(音声入力) |
| Qwen2.5-Omni-7B | Alibaba | 汎用モデル(音声入力) |
| Qwen3-ASR-1.7B | Alibaba(ローカル実行) | 多言語・小規模 |
| parakeet-tdt_ctc-0.6b-ja | NVIDIA | 日本語特化 |
| ReazonSpeech NeMo v2 | レアゾン・ホールディングス | 日本語特化 |
| kotoba-whisper-v2.0 | Kotoba Technologies | 日本語特化 |
| kotoba-whisper-v2.2 | Kotoba Technologies | 日本語特化 |
この一覧に Anthropic の Claude が入っていないのは、性能の問題ではありません。Claude の API は音声を受け付けないため、この課題では測りようがないからです5。このほか、Amazon の Nova 2 Omni など、今回は測定していないモデルもあります。
先に分かっていたこと
医療の音声認識を、全体の誤り率ではなく医学用語に絞って測るという考え方には先行例があります。2026年9月に公開された MedWER は、薬剤名・診断名・症状名など19,373語からなる固定の用語リストを分母に置く評価手順を提案しています。全体として95%正しい書き起こしでも、薬剤名が1つ入れ替わっていれば臨床的には別の記録になる、という理由からです6。
話者による差についても報告があります。2024年12月に JAMIA Open に掲載された研究は、在宅医療で交わされた看護師と患者の会話を4つの音声認識システムに書き起こさせ、黒人患者の単語誤り率が白人患者より高いことを示しました。AWS General で中央値50%対33%、医療に特化した AWS Medical でも54%対37%です。著者らは原因を、訓練データにその話し方が十分含まれていないことに求めています7。
日本語についても、薬局業務を対象に6つのエンジンを比較した事例が2024年12月に公開されています。漢数字やフィラーの表記ゆれを正規化したうえで医療用語に絞って誤り率を計算するという、本稿とほぼ同じ設計です。ただし、具体的な数値は公開されていません8。
医学用語に絞って測るという設計は、すでに確立しています。話者によって精度が変わるのは訓練データの偏りのためだ、という指摘もすでに出ています。欠けているのは、日本語の診療会話について、再現できる手順と数値が公開されていないことです。
文字誤り率は、精度を測っていませんでした
書き起こしの評価には文字誤り率(CER)が広く使われます。正解と出力がどれだけ文字単位で違うかを数えるものです。ところが、手元のデータでこれを検証したところ、問題がありました。
同じ音声に対する2系統の出力が食い違う318箇所を、一つずつ分類しました。
| 差の種類 | 件数 | 例 |
|---|---|---|
| 書き起こし規約だけの差 | 291件(91.5%) | えとえー、読点を打つ位置、℃と度 |
| 語そのものが違う差 | 27件(8.5%) | 作用と症状、少と小 |
食い違いの9割以上は、聞き取りの正誤ではありませんでした。えをえーと書くか、読点をどこに打つかは、日本語の書き起こしとしてどちらも成立する選択です。文字誤り率はこれを誤りとして数えます。つまり、中身は正しく聞き取れていても書き方の流儀が正解と違うシステムは、不当に低く出ます。
そこで、測るものを三つに分けました。
| 層 | 測るもの |
|---|---|
| 内容精度 | 何を聞き取れたか。薬剤名、数値・用量、規約を正規化したうえでの文字誤り率 |
| 逐語性 | 言い直しやフィラーをそのまま残しているか |
| 規約適合 | 書き方の流儀が正解と揃っているか |
指標が壊れていないことを確認するため、毎回2つの健全性検査を通しています。正解そのものを入力したときに満点になること、空の出力が0点になることです9。
結果
17のシステムに同じ音声と同じ指示を与えた結果です。薬剤名を正しく書き取れた割合は 37.2% から 100% まで開きました。
| システム | 薬剤名 [95%信頼区間] | 薬剤名 (近似を含む) | 数値・用量 | 内容CER | フィラー保持 |
|---|---|---|---|---|---|
| gemini-3.8-flash | 100.0% [91.8, 100.0] | 100.0% | 93.2% | 6.1% | 95.5% |
| gemini-3.1-pro | 90.7% [78.4, 96.3] | 97.7% | 97.3% | 6.7% | 95.3% |
| Qwen3.8-Omni-Flash | 90.7% [78.4, 96.3] | 97.7% | 94.6% | 7.1% | 66.0% |
| ElevenLabs Scribe v1 | 88.4% [75.5, 94.9] | 95.3% | 95.9% | 6.5% | 49.3% |
| gpt-transcribe | 88.4% [75.5, 94.9] | 95.3% | 87.8% | 8.0% | 21.7% |
| ElevenLabs Scribe v2 | 83.7% [70.0, 91.9] | 95.3% | 95.9% | 6.6% | 47.0% |
| gpt-4o-transcribe | 69.8% [54.9, 81.4] | 86.0% | 86.5% | 14.5% | 0.2% |
| Qwen3-ASR-1.7B | 65.1% [50.2, 77.6] | 81.4% | 89.2% | 10.7% | 38.7% |
| whisper-1 | 62.8% [47.9, 75.6] | 79.1% | 86.5% | 14.0% | 1.2% |
| whisper-large-v3 | 60.5% [45.6, 73.6] | 81.4% | 86.5% | 14.9% | 1.2% |
| gpt-4o-transcribe-diarize | 58.1% [43.3, 71.6] | 74.4% | 90.5% | 12.7% | 7.6% |
| AWS Transcribe | 51.2% [36.8, 65.4] | 79.1% | 89.2% | 9.0% | 73.6% |
| ReazonSpeech NeMo v2 | 44.2% [30.4, 58.9] | 76.7% | 81.1% | 20.9% | 5.9% |
| parakeet-tdt_ctc-0.6b-ja | 44.2% [30.4, 58.9] | 79.1% | 77.0% | 28.0% | 7.5% |
| Qwen2.5-Omni-7B | 39.5% [26.4, 54.4] | 65.1% | 87.8% | 32.7% | 10.4% |
| kotoba-whisper-v2.0 / v2.2 | 37.2% [24.4, 52.1] | 48.8% | 56.8% | 37.5% | 1.2% |
角括弧は95%信頼区間です。参照にある薬剤名は43箇所しかないため、区間は15〜30ポイントの幅を持ちます。上位3系統の区間はすべて重なっており、この3つの順位はデータから支持されません。17系統の総当たり136組のうち、区間が重ならないのは56組だけでした10。
内容CERにも別の下限があります。同じ音声を同じモデルに5回与えると、内容CERは0.8ポイントの幅で揺れました。0.8ポイント未満の差は、システム間の差ではありません。
この表に入っていないものが2つあります。OpenAI の gpt-audio-1.5 は、ある会話の冒頭3分でHTTP 500(「モデルが不正な内容を生成した」)を5回とも返し、その部分を書き起こせませんでした。Google の gemini-3.5-transcribe は書き起こし専用モデルとして公開されています。しかし、音声だけを渡しても、短い指示を添えても、60秒の断片に区切っても、返ってくる出力は空でした。どちらも12会話すべては揃わないため順位に含めていません11。
「薬剤名」は正解にある薬剤名がそのままの綴りで出力に現れた割合、「近似を含む」は綴りを外していても近い音のカナ語が出ている場合を含めた割合です。両者の差は、聞き取れてはいるが書き方を外した分にあたります。
フィラー保持率の低さは、聞き取れていないことを意味しません。whisper系、kotoba-whisper、日本語特化の各モデルは清書された文を出す設計で、えーや言い直しをほとんど残しません。診療録の下書きとしては妥当な設計ですが、逐語の書き起こしという課題では欠落として扱われます。
Qwen2.5-Omni-7B は、1会話(meeting_1151)で「え」を延々と繰り返す状態に陥り、その会話の出力は正解の約2.8倍の長さになりました。もう1会話でも出力が膨らんでおり、この2会話を除いても内容CERは約2割で、他の系統より大きく劣ります。再実行や設定の調整はしていません。ローカルでは24GBのメモリに収まらず、Alibaba Cloud のホスト版 API で測っています。
薬の名前
最も差が開いたのは薬剤名でした。正解に43箇所ある薬剤名のうち、正しく書き取れた割合は 37.2% から 100% まで開きました。
個別に見ると、次のようになります。
| 薬剤名 | 出現 | 結果 |
|---|---|---|
| ビラスチン | 6回 | 6回すべて取れたのは17のうち2つ(gemini-3.1-pro、gemini-3.8-flash)のみ。他は0〜5回にとどまりました(Qwen3.8-Omni-Flash は5回、AWS Transcribe は0回) |
| メプチンエアー | 1回 | 17のうち3つ。プチンエア、レプチンエア という出力が見られました |
| アモキシシリン | 2回 | 17のうち5つ。gemini の2モデル、ElevenLabs の2モデル、Qwen3.8-Omni-Flash だけが書き取りました |
| ミグシス | 1回 | 17のうち6つ |
| ベピオゲル | 3回 | 17のうち8つ。ベビオニエル という出力のほか、gemini-3.1-pro は音は合っていますがべピオゲルと、先頭をひらがなで書きました |
| ラメルテオン | 3回 | 17のうち8つ |
| レクサプロ | 1回 | 17のうち16が書き取りました(Qwen2.5-Omni-7B のみ書き取れず) |
ビラスチンは第2世代の抗ヒスタミン薬で、2016年9月に日本で製造販売承認を取得しています。6回の出現すべてを取れたのは2系統だけで、他は0〜5回にとどまりました(Qwen3.8-Omni-Flash は5回、AWS Transcribe は0回)。広く使われるペニシリン系の抗菌薬であるアモキシシリンも、17のうち12が書き取れませんでした12。
一方で、起きなかったこともあります。存在しない薬を書き加えたシステムは一つもありませんでした。評価音声に一度も登場しない実在の薬剤名を64語用意し、各システムの出力に現れるかを調べましたが、17系統すべてで0件でした13。薬剤名の誤りはすべて、聞き落としか書き誤りです。
誤り方にも幅があります。べピオゲルは音を正しく捉えており、カタカナとひらがなの選択を外しただけです。一方、該当する語がまったく出力されない場合は、その薬剤が処方されたという事実そのものが記録から消えます。診療録としては、後者の方が重い問題です。
上位の2モデルは、何を落としたか
薬剤名を100%取れたからといって、その書き起こしが安全とは限りません。上位の2モデルについて、減点された箇所を一つずつ見ました14。
gemini-3.8-flashは薬剤名の脱落も捏造もありませんでした。減点は数値と、文字単位の相違だけです。
| 種別 | 落とした内容 |
|---|---|
| 数値・用量 | 35度、4度(体温)、50 mg(用量)、1度、30日 |
| 取り違え | 「そうですね、飲み合わせ」を「お風呂に入ったり」と書いた |
| 付加 | 音声にない「はい、大丈夫です」などの相槌を補った |
体温は発熱と脱水の判断に、用量は処方の再現に使われます。飲み合わせの質問を入浴の話に取り違えたのは、内容そのものの誤りです。
gemini-3.1-proが落とした薬剤名は2種類ですが、中身は違います。
| 薬剤名 | 出現 | 出力側 |
|---|---|---|
| ベピオゲル | 3回 | べピオゲル — 3回とも先頭をひらがなで書いた |
| ムコダイン | 1回 | 該当する語なし |
つまり 90.7%(43箇所中39箇所)の内訳は、表記を外したものが3件、聞き取れていないものが1件です。近似一致まで含めれば 97.7% になります。
より気になるのは文字単位の相違の方です。
参照「り」 → 出力「…と、あと過去のご自身のアレルギー歴や家族歴、あと半年前に…」
参照「ほ」 → 出力「埃などによって息苦しさが誘発される」
参照に1文字しかない箇所に、長い発話が書き加えられています。アレルギー歴や家族歴の問診、埃による誘発という内容です。いずれも診療の文脈として自然で、読んでも違和感がありません。
ここに上位モデルの危うさがあります。gemini-3.8-flash の付加は「はい」程度の短いものですが、gemini-3.1-pro は文脈から補った長く滑らかな文を作ります。言語モデルとしては優れた性質ですが、逐語の書き起こしでは不利に働きます。そして診療録としては、患者が言っていないことが、言ったかのように残ることを意味します。
なお両モデルとも 50 mg と 4度 を落としています。性質の違う2つのモデルが同じ2箇所で失敗するのは、モデルではなく収録側に原因がある可能性を示します。確かめるにはその箇所の音声を聴く必要があります。
新しいほど、大きいほど良いとは限りません
同じ提供元の中でも、世代によって結果が大きく違いました。
| 提供元 | モデル | 薬剤名 | 内容CER |
|---|---|---|---|
| OpenAI | gpt-transcribe(現行) | 88.4% | 8.0% |
| gpt-4o-transcribe | 69.8% | 14.5% | |
| gpt-4o-transcribe-diarize | 58.1% | 12.7% | |
| gemini-3.8-flash(小型) | 100% | 6.1% | |
| gemini-3.1-pro(上位) | 90.7% | 6.7% |
OpenAI では、一世代前の gpt-4o-transcribe(69.8%)と現行の gpt-transcribe(88.4%)で、薬剤名の正答率が19ポイント違います。もし一世代前だけを測っていれば、「OpenAI は薬剤名の7割ほどしか書き取れない」という誤った結論になっていました。
Google では順序が逆になりました。小型の gemini-3.8-flash が、上位モデルの gemini-3.1-pro を上回っています。上位のモデルが書き起こしでも優れているとは限りません。
規模についても同じことが言えます。今回の測定で最も小さいモデルは Qwen3-ASR-1.7B です。GPUを使わず手元のノートパソコンのCPUで動かしましたが、内容CERは10.7%でした。規模のはるかに大きい whisper-large-v3(14.9%)を上回っています。
速度も測りました。47分の音声に対する処理時間は、最も速い gpt-transcribe が1.1分、最も遅い Qwen3-ASR-1.7B が11.1分です。実行環境が違うため直接は比較できませんが、最小のモデルでもGPUなしで実時間の4倍の速さで処理します15。
この測定を読むときも、作るときも、どの世代の話なのかを確かめてください。数か月前の評価結果は、数か月前のモデルについての事実でしかありません。そして規模は、日本語の診療会話を書き起こす能力の指標にはなりません。
話者による差
測定の過程で、予期していなかった偏りが見つかりました。正解の各文字が出力に現れたかを話者ごとに集計したところ、医師の発話と患者の発話で再現率が違っていました。
この所見には、先に片付けておくべき問題があります。12会話に登場する患者の声は、2種類しかありません。氏名は中村健太、高橋良太、伊藤拓也、林健太と4種類以上ありますが、声そのものを照合すると、前半6会話の患者は全員同一人物、後半6会話の患者も全員同一人物で、両者は別人でした16。同じ話者が複数の患者役を演じています。医師も同様に2名です。
そこで、この2つの声を別々に測りました。片方の声だけに現れる癖であれば、もう片方では再現しないはずです。
| システム | 声A(前半6会話) | 声B(後半6会話) | ||||
|---|---|---|---|---|---|---|
| 医師 | 患者 | 差 | 医師 | 患者 | 差 | |
| kotoba-whisper-v2.0 / v2.2 | 69.0% | 51.6% | 17.4pt | 64.0% | 65.6% | −1.6pt |
| parakeet-tdt_ctc-0.6b-ja | 80.0% | 70.8% | 9.2pt | 74.8% | 72.6% | 2.2pt |
| whisper-1 | 87.3% | 81.9% | 5.4pt | 89.6% | 87.4% | 2.2pt |
| Qwen2.5-Omni-7B | 82.7% | 77.6% | 5.2pt | 79.1% | 74.8% | 4.3pt |
| gpt-4o-transcribe-diarize | 88.6% | 83.5% | 5.0pt | 91.9% | 88.7% | 3.3pt |
| whisper-large-v3 | 89.3% | 85.3% | 4.0pt | 85.1% | 81.7% | 3.4pt |
| AWS Transcribe | 94.9% | 91.4% | 3.5pt | 94.7% | 91.3% | 3.4pt |
| ReazonSpeech NeMo v2 | 80.6% | 77.2% | 3.4pt | 85.6% | 81.1% | 4.6pt |
| gpt-transcribe | 93.4% | 91.3% | 2.1pt | 94.6% | 93.3% | 1.3pt |
| Qwen3-ASR-1.7B | 92.8% | 90.7% | 2.1pt | 94.6% | 92.5% | 2.1pt |
| gpt-4o-transcribe | 83.1% | 81.2% | 1.8pt | 90.0% | 85.4% | 4.6pt |
| ElevenLabs Scribe v1 | 95.0% | 93.2% | 1.8pt | 96.7% | 93.8% | 2.9pt |
| ElevenLabs Scribe v2 | 95.0% | 93.1% | 1.9pt | 96.7% | 93.7% | 3.0pt |
| Qwen3.8-Omni-Flash | 95.5% | 93.8% | 1.7pt | 97.7% | 95.3% | 2.3pt |
| gemini-3.8-flash | 96.0% | 95.1% | 1.0pt | 97.6% | 95.2% | 2.4pt |
| gemini-3.1-pro | 95.9% | 95.2% | 0.7pt | 97.8% | 96.1% | 1.8pt |
| 平均 | 医師側が高い系統 17/17 | +4.9pt | 15/17 | +2.4pt | ||
向きは第2の声でも再現しました。ただし差の大きさは +4.9pt から +2.4pt へ縮みます。kotoba-whisper は声Bでは逆転します。2つの声の両方で医師側が高かったのは17系統のうち15系統です。
何が落ちているのかを確かめました。患者の14字以上の発話192件について、正解の文字のうち出力に残っているものが8割未満の場合を「落とした」と数えると、17系統の半数以上が落とした発話が18件あり、うち3件は17系統のすべてが落としています17。18件には「分かりました、ありがとうございます」のような相槌に近いものも含まれますが、診療の中身を持つ発話も落ちています。次はその一部です(括弧内は落とした系統数)。
「そうですね、飲み合わせとかって大丈夫ですか?」(17/17系統)
「そうですね、今朝で37.4度でした。で、だるさは少しあるんですけど、寝込むほどではないです」(15/17系統)
「ちょっと吐く時にヒューってなる時します。長く吐けない」(13/17系統)
「ちょっと、えっと朝からもう5、6回で、なんかもうほぼなんか何ですか?水みたいな下痢で、血は混ざってないと思います」(10/17系統)
落ちたのは、薬の飲み合わせの質問、体温と全身のだるさ、吐くときの呼吸音、そして下痢の性状と血の混入の有無です。体温は感染症の経過の判断に使われ、「血は混ざってないと思います」は、血便がないという否定の情報です。この一文が落ちれば、血便があったのかどうかが記録から分からなくなります。いずれも医師が問診で取りにいく情報であり、診療録に残らなければ意味を持ちません。落ちているのは相槌だけではなく、患者が自分の状態について述べた部分です。
既往歴や感染の経路も落ちます。「心療内科に通っていて、一応、あの、ちょっと不安定障害があるので、それでもう何年か通っているっていう状況です」は17系統のうち9系統が、「子供が先週か、先週鼻風邪をひいちゃって、多分それが移ったんだと思います」も9系統が落としました。通院歴は薬の選択に、感染の経路は診断の見立てに関わります。
音響的な原因を4つ検討し、いずれも当てはまらないことを確認しました。
| 仮説 | 測定したこと | 結果 |
|---|---|---|
| 患者側の音量が小さい | 話者別の実効音圧 | 医師 −26.2dB、患者 −26.0dB。差は0.3dB |
| 遠隔の回線で高域が落ちている | 3.5kHz以上の成分の比率 | 医師 0.63%、患者 0.86%。患者の方が多い |
| 患者の発話が短いため | 発話長で層化して比較 | 3秒以上のすべての区間で差が残る(平均 2.6〜4.6pt) |
| 短い相槌が整列で偶然一致している | 10字以上の発話に限定 | 差はほぼ変わらない |
患者の発話は確かに短く、長さの中央値は医師の9.0秒に対して5.0秒でした。しかし同じ長さの発話同士で比べても差は残ります。音響条件では説明がつきません。
残る説明は、言語側にあります。医師は定型的な医学表現を使い、患者は口語で言い淀みます。音声認識は音だけでなく、次に来る語の確からしさも使って書き取ります。その確からしさが、どちらの話し方について豊富に蓄えられているか、という問題です。
公平に測るということ
測定にあたって、実行条件の影響を確認しました。NVIDIA の parakeet は長い音声を分割して渡す必要があり、この分割の長さで結果が大きく変わりました。
| 分割の長さ | 30秒 | 20秒 | 10秒 | 6秒 |
|---|---|---|---|---|
| 内容CER | 49.6% | 42.2% | 33.8% | 29.2% |
最初に選んだ120秒の設定のままであれば、このモデルは実際よりはるかに低い結果になっていました。復号器の切り替えでは差が出ず、分割長だけが効いていました。ReazonSpeech でも同じ調整を行いましたが、こちらは20秒が最良で、短くしすぎるとかえって悪化しました。モデルごとに最良の条件が違います。
同じことは指示文にも起こりました。gpt-audio-1.5 は、詳細な指示を与えると書き起こしではなく課題を説明する文章を返すことがあり、簡素な指示に変えると安定しました。
こうした調整は、測定する側の都合でモデルを低く見せないために必要です。裏を返せば、実行条件を書いていない評価結果は読めません。どの設定で測ったのかが分からなければ、低い数値がモデルの性能なのか測定者の設定なのかを区別できないからです。本稿の数値も、系統ごとに記録した実行条件とあわせて読む必要があります。
この測定の限界
いくつか明示しておきます。
第一に、順位の大半はこのデータから支持されません。薬剤名が43箇所しかないため、95%信頼区間の幅は15〜30ポイントになります。17系統の総当たり136組のうち、区間が重ならないのは56組だけでした。言えるのは「最上位と下位は違う」ということまでで、中位の順位差は読めません。内容CERにも0.8ポイントの揺らぎがあり、それ未満の差は意味を持ちません。
第二に、薬剤名の語彙に弱点が残ります。正解側の18語は、評価対象と同じ会話から抜き出したものです。捏造を測るための妨害語64語は外部から用意しましたが、正解側の語彙は依然として評価データに由来します。公的な医薬品マスタに置き換える必要があります。
第三に、正解の確からしさを測っていません。作成は2名で行っていますが、それぞれが独立に書き起こしたものを突き合わせたわけではないため、作成者間の一致率は出せません。正解を誤りのないものとして扱っていますが、その前提は検証されていません。
第四に、話者の役割と声そのものを切り分けられていません。12会話に登場する患者の声は2種類しかなく、同じ話者が複数の患者役を演じています。2つの声は別人なので、片方の声の癖でないことは確かめられましたが、「患者の発話だから落ちる」のか「その2つの声だから落ちる」のかは、このデータでは区別できません。
切り分けには、話者数を増やした収録が必要です。現時点で言えるのは、独立した2つの声の両方で患者側の発話が落ちる傾向が見られ、それが音量・帯域・発話長のいずれでも説明できない、というところまでです。
第五に、模擬診療であることです。実際の診療には、方言、高齢の患者の発話、同時発話、背景音が加わります。いずれも条件としては厳しくなる方向です。
おわりに
冒頭に挙げた循環の入口は、まだ十分に通っていませんでした。日本で日常的に処方される薬の名前が、システムによっては3分の1しか書き取れていません。ビラスチンのように、6回現れて6回とも書けたのが17のうち2つという薬もあります。
この差は、モデルの規模では説明がつきません。最小の Qwen3-ASR-1.7B が whisper-large-v3 を上回り、小型の gemini-3.8-flash が上位モデルを上回りました。残るのは、日本語の診療会話がどれだけ学習されているかという違いです。在宅医療の研究が話者による差を訓練データの代表性に帰したのと、同じ構図だと考えています。
この循環を断つには、どこかで日本語の診療会話をデータに変えなければなりません。私たちが日本の医療データを構造化しているのは、そのためです。
仕様と採点器は公開する準備を進めています。測定条件を明示し、同じ手順で誰でも再現できる形にすることが、こうした測定を意味のあるものにする条件だと考えています。
出典と測定方法
- J. Marc Overhage, David McCallie Jr., "Physician Time Spent Using the Electronic Health Record During Outpatient Encounters: A Descriptive Study", Annals of Internal Medicine 2020;172(3):169–174. https://doi.org/10.7326/M18-3684 米国の調査であり、対象施設がすべて同一ベンダーの電子カルテを用いているという限界が論文中に明記されている。↩
- 厚生労働省「医師の働き方改革」。2024年4月1日より医師の時間外労働に上限規制が適用された。 https://www.mhlw.go.jp/stf/seisakunitsuite/bunya/kenkou_iryou/iryou/ishi-hatarakikata_34355.html↩
- 測定方法:模擬オンライン診療12会話(72.3分、16kHz モノラル)。初診と再診の対を含む。正解は日本人医師と日本語話者のクリニック従業員の2名が、話者の帰属を含めて一語ずつ確認した書き起こし文。各システムに同一音声・同一指示を与え、逐語的な書き起こしを求めた。薬剤名の語彙は、正解12会話から機械抽出したカタカナ語を人手で薬剤名と非薬剤名に二分したもの(18語)を版管理して用いた。内容CERは、フィラーと書き起こし規約(句読点・長音記号・フィラー表記)を正規化したうえでの文字誤り率。話者別再現率は、正解の各文字が出力に現れたかを文字列整列で判定し、話者ラベルごとに集計した値。測定日:2026年9月30日〜10月1日。↩
- 対象システムの識別子:
gemini-3.1-pro-preview、gemini-3.8-flash(Google)、gpt-transcribe、gpt-4o-transcribe、gpt-4o-transcribe-diarize、whisper-1(OpenAI API)、openai/whisper-large-v3、Qwen/Qwen3-ASR-1.7B-hf、nvidia/parakeet-tdt_ctc-0.6b-ja、reazon-research/reazonspeech-nemo-v2、kotoba-tech/kotoba-whisper-v2.0、kotoba-tech/kotoba-whisper-v2.2(ローカル実行)、AWS Transcribe(ja-JP、話者分離あり・最大2人、カスタム語彙なし、既定設定。S3経由の非同期ジョブ)、qwen3.8-omni-flashとqwen2.5-omni-7b(Alibaba Cloud(QwenCloud)のホスト版 API、テキスト出力のみ、150秒ごとに分割)。kotoba-whisper の v2.0 と v2.2 は、標準の実行経路では出力がバイト単位で一致した。v2.2 の差分は句読点付与と話者分離を行う後処理にあり、本環境では依存ライブラリの非互換により実行できなかった。↩ - 2026年10月1日に確認。
audioブロック、OpenAI 形式のinput_audioブロック、documentブロックのいずれでも 400 が返る(documentが受け付ける media_type はapplication/pdfのみ)。claude-opus-5-5、claude-sonnet-5-5 とも同じ。↩ - Justin Behling, "MedWER: A Reproducible, Model-Free Evaluation Protocol for Medical Speech Recognition", arXiv:2609.05728, 2026年9月. https://arxiv.org/abs/2609.05728 対象は英語のみ。↩
- "Decoding disparities: evaluating automatic speech recognition system performance in transcribing Black and White patient verbal communication with nurses in home healthcare", JAMIA Open, 2024年12月. https://pmc.ncbi.nlm.nih.gov/articles/PMC11631515/ 対象は AWS General、AWS Medical、Whisper、Wav2Vec の4システム。↩
- ainoya(カケハシ 生成AI研究開発チーム)「薬局業務向けの音声認識エンジンの評価・選定基準」2024年12月7日. https://kakehashi-dev.hatenablog.com/entry/2024/12/07/090000 比較対象は Whisper API、Amazon Transcribe、Google Cloud Speech-to-Text、Gemini 1.5 Pro / Flash、gpt-4o-audio-preview。↩
- 正解そのものを入力して満点にならない指標、および退化した出力(空文字列など)が0点にならない指標は、システム間の識別力を持ちません。採点器を変更するたびにこの2点を自動で検査しています。↩
- 信頼区間は Wilson 法(比率、n=43)とブートストラップ法(内容CER、会話単位2,000回)による。実行ごとの揺らぎは gemini-3.8-flash に同一音声を5回与えて測定し、薬剤名は5回とも同一、内容CERは標準偏差0.3ポイント・幅0.8ポイントであった。↩
- gpt-audio-1.5 は長い音声を受け取れないため3分ごとに分割し、時刻を通しに補正して実行した。失敗した区間は meeting_1137 の 0:00–3:00 で、5回の再試行すべてが同じ誤りを返した。残る5会話は正常に書き起こしている。gemini-3.5-transcribe は
generateContentで HTTP 200 を返すが出力トークン数が0であった。別の呼び出し方法がある可能性があるが、特定できていない。↩ - 大鵬薬品工業「新規経口アレルギー性疾患治療薬『ビラノア®錠』製造販売承認取得のお知らせ」2016年9月28日. https://www.taiho.co.jp/release/2016/20160928.html (2016年11月発売)↩
- 妨害語は、評価音声に一度も現れない実在の医療用医薬品名64語(ノルバスク、クラビット、マイスリー等)。出力にこれらが現れれば、処方されていない薬を記録に加えたことになる。採点器には、語彙と妨害語の計82語を並べただけの出力を対照として常設しており、薬剤名F1 3.9%、内容CER 274.4%、捏造7,680回として検出される。↩
- 減点箇所の抽出は
errors_of.pyによる。参照に含まれる薬剤名・数値について出力との照合を取り、落とした箇所を列挙したうえで、文字単位の差分のうち6字以上のものを大きさ順に並べた。引用は見やすさのため句読点を補っている。↩ - 処理時間は音声47分(6会話)に対する合計。ローカル実行は Apple M4 Pro のノートパソコン、API は各社のサーバであり、直接比較できない。価格は測定していない。↩
- 話者の照合は
pyannote/wespeaker-voxceleb-resnet34-LMによる話者埋め込みで行った。各会話の話者ごとに2秒以上の発話を最大60秒分連結して埋め込みを作り、余弦類似度を比較した。前半6会話の患者どうしは 0.67〜0.95、後半6会話の患者どうしは 0.85〜0.94、両群のあいだは 0.14〜0.27 であった。医師も同様に2名である。↩ - 集計は
dropped_patient_utterances.pyによる。患者の発話のうち14字以上のもの(192件)について、フィラーと書き起こし規約を正規化したうえで正解の文字列と出力を整列し、発話の文字のうち一致した割合が8割未満の場合に、その系統が発話を落としたとみなした。対象は12会話すべてを出力した17系統(5会話のみの gpt-audio-1.5 は除く)。kotoba-whisper の v2.0 と v2.2 は出力が同一で、2系統として数えている。しきい値を7割にすると、半数以上が落とした発話は8件、全系統が落とした発話は2件、9割にすると64件と5件になる。しきい値の選び方で件数は大きく動くため、件数そのものより、落とされた発話の内容を読むべきである。↩