主要な商用音声認識システム5つの単語誤り率は、黒人話者で平均0.35、白人話者で平均0.19となり、黒人話者の音声の23%は誤りが多すぎて使えない文字起こしになった。白人話者ではこの割合はわずか1.6%だった(Koenecke ら、PNAS 2020)。 人間による文字起こしも、きれいな基準とは言えない。認定を受けたフィラデルフィアの法廷速記者は、アフリカ系アメリカ人英語を単語レベルの精度82.9%で文字起こしし、認定基準の95%を12ポイント以上下回った(Jones ら、Language 2019)。その一方で、記録を作る人々は減り続けている。10年間で21%減少した後、残る速記者は約23,000人(AAERT、2025年法廷速記業界動向調査)で、カリフォルニア州の家事、遺産、民事の審理の71.3%は、3年間にわたり逐語記録がまったくなかった(カリフォルニア州司法評議会、2026年)。当社は、PNAS、米国言語学会の学術誌Language、全米法廷速記者協会、カリフォルニア州司法評議会、Thomson Reuters Institute、全米州裁判所センター、フィリピン最高裁判所、英国司法省、査読付きのAI監査研究のデータを集約し、2026年の法廷文字起こしの精度の実態を示す。労働力全体の状況については、当社の法廷速記統計をご覧ください。
主なポイント
- 商用ASRの単語誤り率は、黒人話者で平均0.35、白人話者で平均0.19(Koenecke ら、PNAS 2020)
- 黒人話者のクリップの23%、白人話者のクリップの1.6%が、著者らが使用不能とみなすWER 0.5の閾値を超えた(PNAS 2020)
- 黒人男性の平均WERは0.41で、白人男性の0.21の2倍だった(PNAS 2020)
- フィラデルフィアの法廷速記者は、アフリカ系アメリカ人英語で単語の精度82.9%、文の精度59.5%だった(Jones ら、Language 2019)
- 法廷速記者の文字起こしの31%が、誰が、何を、いつ、どこで言ったか、あるいは発言の強さを変えてしまった(Language 2019)
- 10年間で21%減少した後、約23,000人の速記者が残り、養成校の入学者は74%減少した(AAERT 2025)
- NCRAの新規認定会員は243人(2023年)から205人(2025年)に減少し、法廷速記者の平均年齢は56歳(NCRA統計、2026年3月)
- カリフォルニア州の2026年第1四半期の家事、遺産、民事の審理の72.4%に逐語記録がなかった(カリフォルニア州司法評議会 2026)
- 州裁判所で生成AIを使っているのは17%にとどまり、70%は職員のAIツール利用を禁じている(Thomson Reuters Institute 2025年州裁判所調査)
- フィリピンの裁判所はAI試行で文字起こし時間を平均50%、最大80%短縮した(フィリピン最高裁判所、2025年)
- Whisperの文字起こしの約1%にハルシネーションによる語句が含まれ、そのうち38%が有害だった(Koenecke ら、ACM FAccT 2024)
- 法廷での音声テキスト変換に関する15人の連邦作業部会が、2026年3月19日にS. 4154で提案された(米国上院)
1. 人種、方言、性別によるASRの単語誤り率
法廷での音声認識の中心的な精度問題は、平均的な性能ではなく、話者間のばらつきにある。テストした5システムはすべて、黒人話者に対して白人話者のほぼ2倍の誤りを出した。5語から8語の同一フレーズでも同じ結果であり、これは語彙ではなく音響モデルに原因があることを示している。すべての証人に対して記録が等しく信頼できなければならない法廷では、平均では正確でも話者によって不平等なツールは、公平性の基本テストに不合格となる。
入手可能な最新データ:Koenecke ら、自動音声認識における人種間格差、PNAS 2020。同等の規模と設計の研究はその後発表されておらず、それ自体が一つの発見だ。法廷向けASR調達の根拠となるエビデンスは6年前のものなのである。
| 指標 | 値 | 出典 |
|---|---|---|
| ASR 5システムの平均WER、黒人話者 | 0.35 | Koenecke ら、PNAS 2020 |
| ASR 5システムの平均WER、白人話者 | 0.19 | Koenecke ら、PNAS 2020 |
| Apple(最低性能)のWER、黒人話者対白人話者 | 0.45対0.23 | Koenecke ら、PNAS 2020 |
| Microsoft(最高性能)のWER、黒人話者対白人話者 | 0.27対0.15 | Koenecke ら、PNAS 2020 |
| 平均WER、黒人男性対黒人女性 | 0.41対0.30 | Koenecke ら、PNAS 2020 |
| 平均WER、白人男性対白人女性 | 0.21対0.17 | Koenecke ら、PNAS 2020 |
| WERが0.5を超えるクリップ(使用不能)、黒人話者対白人話者 | 23%対1.6% | Koenecke ら、PNAS 2020 |
| 同一フレーズでのWER、Microsoft、黒人話者対白人話者 | 0.13対0.07 | Koenecke ら、PNAS 2020 |
背景:この研究は、各グループから2,141件の音声クリップ(黒人話者73人と白人話者42人による19.8時間分)を対応させた。WERの中央値は、ノースカロライナ州Princevilleで0.38、ワシントンD.C.で0.31だったのに対し、Sacramentoでは0.18、Humboldt郡では0.15であり、誤り率はアフリカ系アメリカ人口語英語の特徴の密度とともに上昇した。原因は語彙ではなかった。Googleのシステムの語彙には、黒人参加者が話した単語の98.7%、白人参加者が話した単語の98.6%が含まれていた。Stanford Engineeringの要約が述べるように、著者らは、法廷手続きを文字起こしする刑事司法機関を、こうした格差が害をもたらしかねない場面として特に指摘した。
より新しい研究は、主要な数値を置き換えることなく、そのメカニズムを裏付けている。MojaradとTangによるInterspeech 2025の論文は、子音連結の縮約とING語尾の縮約が、アフリカ系アメリカ人英語のWERに小さいながら有意な影響を与えることを見いだした。また、2024年に公開されたFair-Speechベンチマークは、人口統計上の公平性を測定する目的で、米国の参加者593人から約26.5千件の発話を収集した(Veliche ら、2024年)。ツール間の精度を比較したい方は、当社の音声テキスト変換統計で一般的なベンチマークをご覧いただける。
2. 方言音声に対する人間の法廷速記者の精度
法廷ASRにとって公平な比較対象は、完璧な文字起こしではなく人間の基準であり、その基準は認定が示唆するよりも低い。認定を受けた法廷速記者は、アフリカ系アメリカ人英語の文の40.5%を何らかの形で誤って書き起こした。しかも、静かな部屋、高品質の音声、すべての発話を2回再生、修正の時間は無制限という、法廷より恵まれた条件下でのことだ。認定と方言に対する実際の性能とのこのギャップは、法廷文字起こしにおいて最も報じられていない数字である。
この研究、黒人として証言する(Jones、Kalbfeld、Hancock、Clark、Language 2019)は、フィラデルフィアの裁判所で働く法廷速記者27人(市の公式速記者プールの約3分の1)を対象に、83の自然な発話を使って2,241件の文字起こしを得た。
| 指標 | 値 | 出典 |
|---|---|---|
| 法廷速記者の認定精度基準 | 95%または98% | Jones ら、Language 2019 |
| 文レベルの文字起こし精度の平均 | 59.5% | Jones ら、Language 2019 |
| 文レベルの精度、最高対最低 | 77%対18% | Jones ら、Language 2019 |
| 単語レベルの精度の平均 | 82.9%(基準を12.1ポイント下回る) | Jones ら、Language 2019 |
| 単語レベルの精度、最高対最低 | 91.2%対58.4% | Jones ら、Language 2019 |
| 誰が、何を、いつ、どこで、あるいは発言の強さを変えた文字起こし | 31%(2,241件中701件) | Jones ら、Language 2019 |
| 意味不明な文字列を記録に入れてしまう文字起こし | 11%(248件) | Jones ら、Language 2019 |
| 言い換え(理解度)の精度の平均 | 33% | Jones ら、Language 2019 |
外れ値に関する注記:予備段階では、アフリカ系アメリカ人英語の話者と自認する弁護士は90%の文字起こし精度に達し、標準アメリカ英語を話す弁護士の64.2%を上回った。黒人の法廷速記者は発話の52.5%を正しく言い換えたのに対し、黒人以外の速記者では33.7%であり、参加した全速記者の70%は、アフリカ系アメリカ人英語という用語を聞いたことがなかった。AI調達への教訓:標準英語のテストセットだけで性能を測るベンダーは、測るべきものを測っておらず、人間の認定も同じである。雇用における並行する問題は、当社のアクセント差別統計で扱っている。
3. 記録を支える法廷速記者の労働力
人間の供給が縮小しているため、精度をめぐる議論はいっそう重要になる。NCRAの新規認定は2年連続で減少し、2025年には205件となった。法廷速記者の平均年齢は今や56歳だ。裁判所は、速記者とソフトウェアのどちらかを抽象的に選んでいるわけではなく、すでに空いている席を何で埋めるかを決めている。
| 指標 | 値 | 出典 |
|---|---|---|
| 米国で残る認定速記者 | 約23,000人 | AAERT、2025年法廷速記業界動向調査 |
| 過去10年間の認定速記者の減少率 | 21% | AAERT、2025年法廷速記業界動向調査 |
| 速記養成校の入学者の減少率(2015年の3,083人から2024年の790人へ) | 74% | AAERT、2025年法廷速記業界動向調査 |
| 10年間に閉鎖された速記課程または学校 | 約42% | AAERT、2025年法廷速記業界動向調査 |
| NCRAの新規認定会員、2023年 / 2024年 / 2025年 | 243 / 211 / 205 | NCRA統計、2026年3月 |
| NCRAの法廷速記者会員の平均年齢 | 56 | NCRA統計、2026年3月 |
| 法廷速記者および同時字幕制作者の雇用数、2025年 | 19,900 | BLS職業展望ハンドブック |
| 予測される雇用の変化、2025-35年 | 0%(年間約1,800人の求人) | BLS職業展望ハンドブック |
AAERTのエンドユーザー調査(回答者550人以上、2024年第4四半期に実施)は、その波及効果を数値化している。76%が手続きの日程調整が難しいと答え、55%がコスト上昇、39%が遅延を報告し、26%はより低品質の文字起こしを受け入れていると述べた。また、96%が精度を最も重要な業績指標に挙げた。出典:AAERT業界レポート、NCRA統計、BLSの法廷速記者プロファイル。BLSは、AI文字起こしツールが将来の雇用の伸びを抑える一方で、デジタルで作成された記録を確認し編集する速記者は引き続き必要だと明示的に予測している。留意点:AAERTは電子速記者と文字起こし担当者を代表し、この調査を委託したため、その枠組みはデジタル速記に有利だが、労働力の数値はNCRAとBLSのデータに基づいている。
4. 逐語記録がまったくない手続き
最悪の文字起こし精度は、文字起こしが存在しないことだ。ほとんどの事件類型で電子録音を制限しているカリフォルニア州は、速記者が確保できないときに何が起こるかについて、米国で最も詳細な公開データを出している。3年間で、家事、遺産、無制限民事の審理3,007,651件が逐語記録なしで進行した。州自身のファクトシートは、これが控訴にとってしばしば致命的になると述べている。
| 指標 | 値 | 出典 |
|---|---|---|
| 逐語記録のない審理、2026年第1四半期 | 418,985件中303,430件(72.4%) | カリフォルニア州司法評議会、2026年 |
| 逐語記録のない審理、2023年4月から2026年3月 | 4,214,365件中3,007,651件(71.3%) | カリフォルニア州司法評議会、2026年 |
| 裁判所雇用の速記者対追加で必要なFTE | 1,101人対458人追加 | カリフォルニア州司法評議会、2026年 |
| 採用された速記者のFTE対退職者のFTE、2023年4月から2026年3月 | 381.8対366.3(純増15.5) | カリフォルニア州司法評議会、2026年 |
| 新規採用者のうち音声速記者が占める割合 | 48.1%(183.5 FTE) | カリフォルニア州司法評議会、2026年 |
| カリフォルニア州の免許保有者の減少、2013-14会計年度から2022-23会計年度 | 20.9%(新規申請は42.9%減) | カリフォルニア州司法評議会ファクトシート、2025年1月 |
| カリフォルニア州の裁判所の文字起こし支出、2023-24会計年度 | 23.7百万ドル | カリフォルニア州司法評議会ファクトシート、2025年1月 |
| 民間速記者の1日あたり費用、証言録取対裁判 | 2,580ドル対3,300ドル | カリフォルニア州司法評議会ファクトシート、2025年1月 |
背景:人材供給は周辺的には改善しており、2024-25会計年度には2022-23年の68件に対し176件の新規免許が発行され、直近の受験者294人の合格率は52.7%だった。しかし、新規採用者のほぼ半数は音声速記者であり、これ自体が音声認識のワークフローである。速記者はマスク装着型マイクに証言を復唱し、ソフトウェアがそれを文字に変換する。最新のデータは司法評議会の不足状況ダッシュボードにあり、費用の数値は2025年1月のファクトシートからのものだ。
5. AI文字起こしの導入と裁判所の試行
米国の州裁判所は慎重で、数字は期待と許可との間に大きな隔たりがあることを示している。州裁判所関係者の91%はAIが裁判所の運営に少なくとも中程度の影響を与えると予想しているが、70%は自分の裁判所が職員によるAIツールの利用をまったく認めていないと答えている。 最も進んだ導入は米国外にあり、そこでは国の司法機関が一つのプラットフォームに標準化できる。
| 指標 | 値 | 出典 |
|---|---|---|
| 現在、生成AIを使用している州裁判所 | 17% | Thomson Reuters Institute、2025年州裁判所調査 |
| 職員のAIツール利用を認めていない裁判所 | 70% | Thomson Reuters Institute、2025年州裁判所調査 |
| AIを最も重要なトレンドと評価した回答者 | 55% | Thomson Reuters Institute、2025年州裁判所調査 |
| AI研修を提供した裁判所システム | 25% | NCSC、将来の人材ニーズへの備え 2025年 |
| 人員不足が続くと予想する回答者 | 61% | NCSC、将来の人材ニーズへの備え 2025年 |
| フィリピンAI文字起こし試行の範囲(2023年7月から2024年9月) | Sandiganbayan + 41の第一審裁判所 | フィリピン最高裁判所、2025年 |
| フィリピンの試行における文字起こし時間の短縮 | 平均50%、最大80% | フィリピン最高裁判所、2025年 |
| フィリピンの試行期間中に報告された精度 | 70%から90-95%に向上 | フィリピン最高裁判所、2025年 |
この調査は、2025年3月から4月にかけて、州、郡、市の裁判所の裁判官と職員443人を対象に行われた(Thomson Reuters Institute、NCSCの要約)。首席裁判官のAlexander Gesmundo氏が発表したフィリピンの結果は、フィリピン語とタグリッシュ向けにカスタマイズされた言語モデルを備えたScriptixプラットフォームによるもので、最高裁判所は2024年11月に全国展開を承認した(フィリピン最高裁判所)。開始時の精度70%はどのような公式記録にも受け入れられないものであり、改善はツールを導入しただけでなく、継続的な利用と人間による編集から生まれたことに注意されたい。
英国は、法廷ではなく保護観察での事例だが、これまでで最大の件数のデータを示している。司法省によると、2025年10月7日から2026年9月14日までに、自社開発のJustice Transcribeツールで1,600,000件を超える面談が要約され、1面談あたり10分と仮定した場合の参考節約時間は約266,667時間にのぼる(GOV.UKのJustice Transcribeデータ)。同省自身の発表は、年間18,750暦日の削減を見込んでおり、英国の裁判所・審判所サービス(HMCTS)は現在、同じツールを刑事法院(Crown Court)の文字起こしで契約した人間の文字起こし担当者と比較して試験している。より広い法律分野でのAI導入については、当社の法律分野のAI統計をご覧ください。
6. ハルシネーション、警察の文字起こし、監督のギャップ
単語誤り率は、AI文字起こしの法的リスクを過小評価している。文字起こしには、誰も言っていない言葉が含まれることもあるからだ。Whisperのハルシネーションを起こした箇所の38%には、暴力、誤った関連づけ、権威の示唆といった明確な害が含まれていた。これは、裁判官や陪審員が証言を読む際の受け止め方を変えかねない内容である。法廷の音声には長い沈黙が多く、研究者がハルシネーションと関連づけたのはまさにそうした長い無音区間だった。
| 指標 | 値 | 出典 |
|---|---|---|
| 語句や文が丸ごとハルシネーションとなったWhisperの文字起こし | 約1%(平均1.4%) | Koenecke ら、ACM FAccT 2024 |
| 少なくとも1つの明確な害を含むハルシネーション | 38% | Koenecke ら、ACM FAccT 2024 |
| 暴力を助長するハルシネーション | 19% | Koenecke ら、ACM FAccT 2024 |
| 不正確な関連づけをするハルシネーション / 偽の権威を示唆するハルシネーション | 13% / 8% | Koenecke ら、ACM FAccT 2024 |
| Draft One AI警察報告書の試験:警察官と報告書 | 警察官85人、報告書755件 | Adams ら、実験犯罪学ジャーナル 2025 |
| Draft Oneが報告書作成時間に与えた影響 | 統計的に有意な短縮なし | Adams ら、実験犯罪学ジャーナル 2025 |
| Anchorage警察のAI報告書試験の期間と結果 | 3か月、有意な時間削減なし | Anchorage警察(EFF経由)、2025年 |
| 法廷の音声テキスト変換に関する連邦作業部会案 | 15人、18か月以内に報告 | S. 4154、2026年裁判所におけるAIの研究と監督に関する法律 |
背景:ハルシネーション研究(ACM FAccT 2024)は、失語症の話者で、無音区間が長いため、ハルシネーションが不釣り合いに多く発生したことを見いだした。ボディカメラの音声は、すでにAIが作成する警察報告書を通じて刑事記録に取り込まれている。Axon Draft Oneの事前登録済みランダム化試験(Springer)は、警察官が節約できた時間を誤りの削除や漏れた事実の追記に費やしたため、時間削減は見られなかったと報告し、ベンダーは50%の削減を謳っていた(EFF)。2026年3月19日に提出された連邦法案は、作業部会に文字起こしの精度、なまりや方言のある話者への影響、AIによって改変された記録の電子透かしを調べさせるものだ(S. 4154の本文、GovInfo)。裁判所にとっての問いは、もはや音声認識が平均的に十分良いかどうかではなく、正確な記録を最も必要とする話者について誰かが測定しているかどうかである。
数字で見る法廷音声認識の精度(まとめ)
| 指標 | 値 | 出典 |
|---|---|---|
| ASRの平均WER、黒人話者対白人話者 | 0.35対0.19 | Koenecke ら、PNAS 2020 |
| 使用不能な文字起こしのクリップ(WER 0.5超)、黒人対白人 | 23%対1.6% | Koenecke ら、PNAS 2020 |
| ASRのWER、黒人男性対白人男性 | 0.41対0.21 | Koenecke ら、PNAS 2020 |
| AppleのASRのWER、黒人話者対白人話者 | 0.45対0.23 | Koenecke ら、PNAS 2020 |
| アフリカ系アメリカ人英語に対する法廷速記者の単語レベルの精度 | 82.9% | Jones ら、Language 2019 |
| アフリカ系アメリカ人英語に対する法廷速記者の文レベルの精度 | 59.5% | Jones ら、Language 2019 |
| 意味を変えてしまった法廷速記者の文字起こし | 31% | Jones ら、Language 2019 |
| 法廷速記者の認定基準 | 95%から98% | Jones ら、Language 2019 |
| 米国で残る速記者 | 約23,000人 | AAERT 2025 |
| 速記養成校の入学者の減少、2015年から2024年 | 74% | AAERT 2025 |
| NCRAの新規認定会員、2025年 | 205 | NCRA統計、2026年3月 |
| 法廷速記者の平均年齢 | 56 | NCRA統計、2026年3月 |
| カリフォルニア州で逐語記録のない審理、2023年4月から2026年3月 | 71.3%(3,007,651件) | カリフォルニア州司法評議会 2026 |
| カリフォルニア州が追加で必要とする法廷速記者 | 458 FTE | カリフォルニア州司法評議会 2026 |
| 生成AIを使用している州裁判所 | 17% | Thomson Reuters Institute 2025 |
| 職員のAIツール利用を禁じている裁判所 | 70% | Thomson Reuters Institute 2025 |
| フィリピンAI試行での文字起こし時間の短縮 | 平均50%、最大80% | フィリピン最高裁判所 2025 |
| Justice Transcribeで要約された英国の面談、2025年10月から2026年9月 | 1,600,000件以上 | 英国司法省 2026 |
| 明確な害を含むWhisperのハルシネーション | 38% | Koenecke ら、ACM FAccT 2024 |
方法論と出典
- Koenecke ら、自動音声認識における人種間格差、PNAS 2020、およびStanford Engineeringの要約
- Jones、Kalbfeld、Hancock、Clark、黒人として証言する、Language 95(2)、2019年
- MojaradとTang、アフリカ系アメリカ人英語の自動音声認識、Interspeech 2025
- Veliche ら、Fair-Speechデータセット、2024年
- AAERT、2025年法廷速記業界動向調査(The Brand Consultancyが実施。インタビュー27件、調査回答550件以上)
- 全米法廷速記者協会、NCRA統計(2026年3月)
- 米国労働統計局、職業展望ハンドブック:法廷速記者および同時字幕制作者
- カリフォルニア州司法評議会、カリフォルニア州の法廷速記者不足ダッシュボードおよびファクトシート、2025年1月
- Thomson Reuters Institute、人員、運営、テクノロジー:2025年州裁判所調査
- 全米州裁判所センター、将来の人材ニーズへの備え
- フィリピン最高裁判所、AIによる文字起こしの成果
- 英国司法省、Justice Transcribeデータ、2025年10月から2026年9月およびAI技術構想の発表
- Koenecke ら、Careless Whisper:音声テキスト変換ハルシネーションの害、ACM FAccT 2024
- Adams ら、AI支援による警察報告書作成のランダム化試験、実験犯罪学ジャーナル 2025およびAnchorage警察の試験に関するEFFの記事、2025年
- S. 4154、2026年裁判所におけるAIの研究と監督に関する法律(GovInfo)
- データウォッチ:基盤となる2つの精度研究(PNAS 2020、Language 2019)は3年以上前のもので、当時の商用システムと速記者を対象にテストしたものである。この種の統制された測定としては今も最新だが、新しいASRモデルでは結果が異なる可能性がある。どちらの研究も、実際の法廷の音声はテストしていない。NCSCの要約は、回答者の70%超が人員不足に直面したと報告しているが、同じ2025年調査に関するThomson Reuters Instituteの記事は68%と引用している。当社は両者が一致する、不足が続くという61%の数値を用いる。米国の速記者数は手法によって異なる。AAERTは約23,000人の速記者と推定する一方、BLSは2025年の法廷速記者と字幕制作者の雇用を19,900人と数えている。フィリピンの精度の範囲(70%から90-95%)は裁判所自身による自己申告で、独立した監査は受けておらず、英国のJustice Transcribeの時間数は、1面談あたり10分の節約という仮定に基づく参考推計である。提案されている連邦作業部会は、S. 4154が成立すれば、法廷での音声テキスト変換について米国政府による初の精度評価を行うことになる。
最終更新日:2026年10月3日。当社はこのまとめを四半期ごとに更新しており、次回の更新は、カリフォルニア州司法評議会が2026年第2四半期の法廷速記者不足の最新情報を公表し、HMCTSがJustice Transcribeによる刑事法院の文字起こし研究の結果を報告した時点を予定している。