英国のテレビのライブ字幕は、Ofcomの測定ラウンドを通じて平均で発話より5.1〜5.8秒遅れており、第2ラウンドでは72サンプル中わずか4サンプルしか従来の3秒ガイドラインを満たしていなかった(Ofcom、ライブ字幕品質報告書2014〜2015年)。この問題は解消されていない。2024年の米国スペイン語ニュース番組の調査では平均遅延が8.2秒、個々のキャプションでは最大41秒に達し(Fresno、JoSTrans 2024)、2026年9月の調査では米国のライブテレビ映像で平均8.46秒だった。一方で、ストリーミング音声認識エンジンは現在、単語遅延の中央値が約300ミリ秒と報告されており(AssemblyAI、2025年6月)、ライブキャプションのボトルネックは人間のタイピストから放送の伝送経路へと移りつつある。本稿では、Ofcom、FCC、CRTC、Gallaudet大学とビゴ大学による査読付き研究、arXivのベンチマーク論文、Ai-MediaのASX提出資料、WHO、そして方法論に挙げたその他の一次資料のデータを集計した。全体像については、当社のライブキャプション統計もご覧ください。
主なポイント
- 英国のライブ字幕の平均遅延は、2014年4〜5月から10〜11月にかけて5.7秒から5.1秒に低下したが、3秒のガイドラインを大きく上回ったままだった(Ofcom、第3回ライブ字幕報告書、2015年)。
- 第2ラウンドで英国のサンプルのうち3秒ガイドラインを満たしたのは72件中4件のみで、最長の遅延は21秒に達した(Ofcom、第2回報告書、2014年)。
- Ofcomは現在、ライブ番組全体で平均遅延を4.5秒以内にするよう求めている(Ofcom、テレビおよびオンデマンドのアクセスサービス提供に関するガイドライン)。
- 米国のスペイン語ニュース番組のキャプション遅延は平均8.2秒で、キャプションの20%が10秒超遅れて届いた(Fresno、JoSTrans 42、2024年)。
- 元の放送遅延(平均8.46秒)のテレビキャプションは3.66/7と評価され、同期させると5.09/7だった(Thompsonほか、arXiv 2609.11408、2026年)。
- 英国のライブ字幕は、Ofcomの4回のラウンド全体で平均98.38%のNER精度となり、98%の閾値を上回った(Moores経由のOfcomデータ、JoSTrans 33)。
- 米国の英語の全国ニュース番組は平均98.8%のNER精度だった(Fresno、Universal Access in the Information Society、2024年)。
- ある自動キャプションシステムは、NERで英語98.56%、スペイン語98.26%を記録した(Romero-FrescoとVan Gauwbergen、2025年)。
- AssemblyAIはストリーミング遅延の中央値307 msを報告し、Deepgram Nova-3は516 msだった(AssemblyAI、2025年6月)。
- Whisper-Streamingは長時間の英語音声で平均遅延3.3秒に達した(Machacek、Dabre、Bojar、IJCNLP-AACL 2023)。
- 人間は10言語を通じて平均208 msで質問に答える(Stivers ほか、PNAS 2009)。これがリアルタイムシステムの追い求める基準だ。
- Ai-Mediaの自動キャプションLEXIは2025会計年度に7,920万分に達し、4年前の1,000万分未満から増加した(Ai-Media 2025会計年度決算、ASX)。
1. 測定された遅延:ライブ字幕は発話にどれだけ遅れるか
ライブ字幕の遅延に関する最も包括的な公開データセットは今も英国のものであり、一貫した傾向を示している。典型的なライブ字幕は、言葉が発せられてから5秒以上遅れて表示される。Ofcomは2013年から2015年にかけて4回のラウンドで、BBC、ITV、Channel 4、Channel 5、Skyのニュース、エンターテインメント、トーク番組をサンプリングした。第1回報告書では遅延の中央値が5.6秒(EPRAによるOfcom第1回報告書の要約、2014年4月)、第2回報告書では5.8秒で、3秒ガイドラインに収まったのは72サンプル中4サンプルのみだった(Limping ChickenによるOfcom第2回報告書の記事、2014年11月)。
その後の改善は実際にあったものの、小幅にとどまった。Ofcomの第3回報告書は、2014年4〜5月から10〜11月にかけて平均遅延が0.6秒、5.7秒から5.1秒へ低下したと記録している(Wired-Gov掲載のOfcomプレスリリース、2015年5月)。5秒の遅延から0.5秒を削るには、ソフトウェアだけでなく放送事業者のワークフロー変更が必要だったため、数値は頭打ちになった。これらはOfcomの遅延測定として入手可能な最新のもの(2014〜2015年)であり、放送事業者別のより新しいデータセットは公表されていない。
| 指標 | 値 | 出典 |
|---|---|---|
| 英国のライブ字幕遅延の中央値、第1ラウンド | 5.6秒 | Ofcom第1回ライブ字幕報告書、2014年4月 |
| 英国の遅延、第2ラウンド | 5.8秒 | Ofcom第2回報告書、2014年11月 |
| 3秒ガイドラインを満たしたサンプル、第2ラウンド | 72件中4件 | Ofcom第2回報告書、2014年 |
| 記録された最長の遅延、第2ラウンド | 21秒 | Ofcom第2回報告書、2014年 |
| 英国の平均遅延、2014年4〜5月から2014年10〜11月 | 5.7秒から5.1秒(-0.6秒) | Ofcom第3回報告書、2015年5月 |
| 4回のラウンド全体での英国の平均遅延 | 5.3秒 | Moores経由のOfcomデータ、JoSTrans 33 |
| 事前作成字幕をライブ同様に送出しない場合の遅延 | 7-8秒 | Moores経由のOfcomデータ、JoSTrans 33 |
補足:各ラウンドの数値は報告されたとおり中央値と平均値が混在しているため、ラウンド間の小さな差(5.6、5.7、5.8)を過大に解釈すべきではない。事前作成して送出する字幕のない番組で7-8秒という数値は、英国の平均がリアルタイムの文字起こしよりもいかに台本に依存しているかを示している。
英国以外では、遅延はさらに長い。TelemundoとUnivisionの米国スペイン語ニュース番組のキャプションは、発話より平均8.2秒遅れ、範囲は0.7秒から41秒に及び、キャプションの46%が8秒を超えて遅れていた(Fresno、Closed Captions en espanol、JoSTrans 42、2024年)。米国のライブテレビ映像を対象とした2026年の調査では、平均遅延は8.46秒(標準偏差3.62)で、7-12秒がテレビキャプションにとって典型的だと述べられている(Thompsonほか、arXiv 2609.11408)。
| 指標 | 値 | 出典 |
|---|---|---|
| 米国スペイン語ニュース番組の平均キャプション遅延 | 8.2秒 | Fresno、JoSTrans 42、2024年 |
| 同じサンプルでの遅延の範囲 | 0.7〜41秒 | Fresno、JoSTrans 42、2024年 |
| 8 / 10 / 12秒を超えて遅れたキャプション | 46% / 20% / 8% | Fresno、JoSTrans 42、2024年 |
| その調査で分析されたキャプション | 5,349件(10分間のセグメント20本) | Fresno、JoSTrans 42、2024年 |
| 米国のライブテレビ映像での平均遅延 | 8.46秒(標準偏差3.62) | Thompsonほか、arXiv 2609.11408、2026年9月 |
| 引用された米国テレビキャプションの典型的な遅延 | 7-12秒 | Thompsonほか、arXiv 2609.11408、2026年9月 |
| リスピーキングを用いたライブ(非放送)イベントでの平均遅延 | 5.8秒(範囲4.3-7.5秒) | Moores、JoSTrans 33 |
2. 規制上の目標:3秒から4.5秒へ
規制当局は遅延が重要だという点では一致しているが、ほとんどは数値を示していない。本稿で取り上げる主要規制当局のうち、遅延に数値目標を持つのはOfcomだけであり、その目標をより緩やかな方向へ動かした。テレビアクセスサービス規範の最大遅延3秒から、事業者のライブ番組全体で平均4.5秒以内へと変更したのだ。2023年の意見募集の中で、Ofcomは、放送事業者が最大3秒は非現実的だと述べており、4.5秒は個々の放送事業者が達成した最良の遅延に相当すると説明した(テレビおよびオンデマンドのアクセスサービス提供に関するOfcomのガイドライン)。
米国のアプローチは定性的だ。FCCは2014年2月20日に、正確性、同期性、完全性、配置を対象とするキャプション品質基準を採択し、ライブキャプションの遅延は「話されている内容の正確な提示と両立する範囲で最小限に抑えるべき」とだけ述べた(FCC、キャプション品質基準)。カナダは時間ではなく正確性を規制している。CRTCの放送規制方針2019-308は、英語のライブキャプションにNERモデルで98のスコアを求めている。実際上の効果として、10秒遅れて届くキャプションでも、世界の大半の地域では完全に準拠したものとなりうる。
| 指標 | 値 | 出典 |
|---|---|---|
| Ofcomの従来のガイドライン | 最大遅延3秒 | Ofcomテレビアクセスサービス規範 |
| Ofcomの現行ガイドライン | ライブ番組全体で平均4.5秒以内 | Ofcomテレビおよびオンデマンドのアクセスサービス提供に関するガイドライン |
| Ofcomの従来の字幕速度ガイダンス:収録番組 / ライブ | 160-180語/分 / 200語/分 | Ofcom 2023年意見募集(Liam O’Dell報道による) |
| FCCの数値による遅延上限 | なし(遅延は「最小限に抑える」) | FCC 14-12、2014年2月20日採択 |
| ライブ番組におけるテレプロンプターのみのENTキャプションに対するFCCの禁止 | 4大ネットワークと上位25市場の系列局 | FCC 14-12 |
| 免除対象外の新規番組に対するFCCのキャプション付与 | 2006年1月1日以降100% | 47 CFR 79.1 |
| CRTCの英語ライブキャプション精度要件 | NERスコア98、2019年9月1日から | CRTC 2019-308 |
| CRTCの監視義務 | 毎月ライブ番組2本(うちニュース1本) | CRTC 2019-308 |
補足:オーストラリアのACMAも、2023年10月1日から施行されている放送サービス(テレビキャプション)基準2023において数値による遅延を定めておらず、読みやすさ、正確性、理解しやすさを個別に評価している。
最新の規則は、遅延を厳しくするのではなく、ストリーミングへと義務を広げている。カナダのCRTC 2026-98は、オンライン配信事業者に2030年5月までにカタログの80%、2031年5月までに100%へキャプションを付けることを求めており、新規のオリジナルのライブ番組および収録番組には1年以内にキャプションを付けるとしている(CRTC 2026-98、2026年5月25日)。2026年5月14日に公表されたOfcomのTier 1アクセシビリティ規範案は、最大手の配信事業者に対し、公表から4年後に字幕付与率80%の割当を課すことを提案している(Ofcom、Tier 1アクセシビリティ規範の意見募集)。
| 指標 | 値 | 出典 |
|---|---|---|
| カナダの配信事業者のカタログへのキャプション付与 | 2030年5月までに80%、2031年5月までに100% | CRTC 2026-98 |
| 配信事業者の収録済みオリジナル番組に対するカナダの精度要件 | 100% | CRTC 2026-98 |
| OfcomのTier 1字幕割当、4年目 / 1年目 | 80% / 20% | Ofcom Tier 1アクセシビリティ規範案、2026年5月 |
| BBCのオンデマンド字幕割当、4年目 | 90% | Ofcom Tier 1アクセシビリティ規範案、2026年5月 |
| Tier 1の閾値 | 英国の月間平均利用者500,000人以上 | Ofcom Tier 1アクセシビリティ規範案、2026年5月 |
3. 精度:98%のNERラインと、それを超えるのは誰か
遅延と精度はトレードオフの関係にあるため、遅延の数値は精度の数値と並べて初めて意味を持つ。一般的な指標がNERモデルで、ライブ字幕を(単語数から編集誤りと認識誤りを引いたもの)÷単語数で採点する。98%が「許容」、98.5-98.99%が「良好」、99-99.49%が「非常に良好」、99.5%超が「優秀」である(Romero-FrescoとMartinez、NERモデル、2015年)。この閾値は寛容に見えるが、実際の数字に直すと印象が変わる。98%では、100語のうち2語が誤り、欠落、または重み付けされた誤りとなる。
英国の放送事業者は平均してこの基準を満たした。Ofcomの4回のラウンドで98.38%、最終ラウンドで98.55%で、78,000件の字幕と546,000語を対象に測定された(Moores、JoSTrans 33)。しかし平均は裾野を隠してしまう。2014年10〜11月には、英国の番組の77%が98%以上に達し、2014年4〜5月の74%から上昇しており、ニュースが最も正確なジャンルで98.75%だった(Ofcom第3回報告書、2015年)。米国の英語の全国ニュース番組はそれより良好で、平均98.8%、20サンプル中14サンプルが許容以上と評価された一方、スペイン語のニュース番組は97.04%にとどまった(Fresno、2024年)。
| 指標 | 値 | 出典 |
|---|---|---|
| NERの許容 / 優秀の閾値 | 98% / 99.5%超 | Romero-FrescoとMartinez、2015年 |
| 英国のライブ字幕精度、4ラウンド平均 | 98.38% | Moores経由のOfcomデータ、JoSTrans 33 |
| 英国のライブ字幕精度、最終ラウンド | 98.55% | Moores経由のOfcomデータ、JoSTrans 33 |
| 98%以上の英国番組、2014年10〜11月(2014年4〜5月との比較) | 77%(74%) | Ofcom第3回報告書、2015年 |
| 英国のニュースジャンルの精度 | 98.75% | Ofcom第3回報告書、2015年 |
| 米国の英語の全国ニュース番組、平均NER | 98.8%(20サンプル中14サンプルが許容以上) | Fresno、Universal Access in the Information Society、2024年 |
| 米国のスペイン語ニュース番組、平均NER | 97.04%(Telemundo 97.00%、Univision 97.10%) | Fresno、JoSTrans 42、2024年 |
| テキスト削減:スペイン語と英語のニュース番組 | 26%対5-6% | Fresno、JoSTrans 42、2024年 |
補足:速度は見えにくい第3の変数だ。Ofcomは字幕の平均を毎分180語未満にすることを推奨しているが、分析した番組のほぼすべてに毎分200語を超える短い突発的な区間があり、それらを誤りとして数えると、番組の68%が98%を下回った(Ofcom第3回報告書、2015年)。米国の英語ニュース番組の調査では、誤りのほぼ3分の2が軽微なものだったことがわかった。
4. 遅延が視聴者に与えるコスト
ライブ字幕の利用者は、ろう者だけよりはるかに多い。Ofcomは、英国の成人約760万人が字幕を利用したことがあり、そのうち聴覚障害があるのはわずか140万人と推定した(Wired-Gov掲載のOfcomプレスリリース、2013年5月)。つまり、聴覚障害のない字幕利用者が600万人を超える(760万人から140万人を引いた数)ということであり、その多くは騒がしい部屋や音量を下げた状態で視聴している。Ofcomのガイドラインは、18-24歳の61%が字幕をオンにしたい派だというYouGovのデータも引用している。世界全体では、WHOの推計で、障害を伴う難聴のためにリハビリテーションを必要とする人が現在4億3,000万人おり、2050年までに7億人を超える見込みだ。
| 指標 | 値 | 出典 |
|---|---|---|
| 字幕を利用したことがある英国の成人 | 約760万人(範囲700万-810万人) | Ofcom、2013年5月 |
| そのうち聴覚障害のある人 | 約140万人(範囲120万-160万人) | Ofcom、2013年5月 |
| 字幕をオンにしたい英国の18-24歳 | 61% | YouGov(Ofcomアクセスサービスガイドラインに引用) |
| 字幕付きの英国公共放送およびより大規模なオンデマンド番組の時間の割合、2024年 | 88% | Ofcomアクセスサービス報告書、2024年1〜12月(2025年5月19日公表) |
| 義務対象チャンネルにおける英国の字幕付き放送時間、2005年と2013年 | 40.5%対81.9% | Ofcom第1回ライブ字幕報告書、2014年 |
| 障害を伴う難聴でリハビリテーションを必要とする人 | 4億3,000万人 | WHOファクトシート、2026年3月更新 |
| 2050年までに何らかの難聴になると予測される人 | 約25億人 | WHOファクトシート、2026年3月更新 |
視聴者が最初に気づくのは遅延だ。最近で最大規模のユーザー調査では、ろう者および難聴者の視聴者216人に、4つの条件下で70本のライブテレビ映像を評価してもらい、4,832件の評価を得た。同じテレビキャプションが、元の放送遅延のままでは7点満点中3.66、同期させると5.09と評価され、同期したテレビとASRキャプションの差よりもはるかに大きな開きとなった(Thompsonほか、Are Caption Metrics Broken?、arXiv 2609.11408、2026年9月)。2秒の遅延があるASRキャプションは、同期時の5.20に対して4.81と、はるかに持ちこたえた。
同じ調査は、精度スコアが品質を捉えているという考えも覆している。NER 98の閾値に達したのはテレビ映像70本中11本、ASR映像70本中4本にすぎなかったが、視聴者は同期したASRとテレビのキャプションをほぼ同等に評価し、指標と評価の相関はASR出力で大きく低下した(WER r = -0.390、テレビキャプションでは-0.687)。Gallaudetによる以前のCHI 2024の研究も同様の結論に至り、参加者は放送の遅延を強く嫌い、標準的な精度指標は視聴者のキャプション評価とは弱くしか相関しなかった。
| 指標 | 値 | 出典 |
|---|---|---|
| 参加者 / 評価 / クリップ | 216 / 4,832 / 70 | Thompsonほか、arXiv 2609.11408、2026年 |
| テレビキャプションの評価:元の遅延と同期後(7段階評価) | 3.66対5.09 | Thompsonほか、2026年 |
| ASRキャプションの評価:2秒遅延と同期後 | 4.81対5.20 | Thompsonほか、2026年 |
| 平均WER:テレビキャプションとASRキャプション | 33.8%対17.2% | Thompsonほか、2026年 |
| 平均NER:テレビキャプションとASRキャプション | 95.28対94.34 | Thompsonほか、2026年 |
| NER 98を満たしたクリップ:テレビとASR | 70本中11本対70本中4本 | Thompsonほか、2026年 |
| WERと視聴者評価の相関:テレビとASR | r = -0.687対-0.390 | Thompsonほか、2026年 |
補足:テレビのWERが高いのは、一部には放送キャプションが言い換えや要約を行うことを反映している。WERはそれにペナルティを課すが、NERは課さない。この差こそが、著者らが現在の指標は技術中立ではないと主張する理由だ。
5. ASRエンジンの速度:ストリーミング遅延と人間の会話
エンジンの遅延は、もはや字幕遅延の主な原因ではない。AssemblyAIは、Universal-Streamingのストリーミング遅延の中央値を307 ms、Deepgram Nova-3を516 ms、P99をそれぞれ1,012 msと1,907 msと報告した。これは205時間以上の音声で、音声中の単語の終わりから部分的な文字起こしに最初に現れるまでを測定したものだ(AssemblyAI、Introducing Universal-Streaming、2025年6月2日)。Deepgram自身の発表データでは、Nova-3のストリーミングでの単語誤り率の中央値は6.84%で、比較した競合は14.92%だった(Deepgram、Introducing Nova-3、2025年2月)。どちらもベンダーによるベンチマークであり、最良のケースとして読むべきだ。当社の音声テキスト変換統計では、より多くのエンジンの精度を取り上げている。
オープンモデルは、安定性と引き換えにより大きな遅延を受け入れる。学術的なWhisper-Streamingシステムは、欧州議会のESICテストセットの長時間の英語音声で平均遅延3.3秒に達し、そのトレードオフは結果に明示されている。英語のWERは、0.5秒チャンクで遅延3.27秒のとき8.5%、2秒チャンクで5.45秒のとき8.0%だった(Machacek、Dabre、Bojar、arXiv 2307.14743、IJCNLP-AACL 2023)。5秒遅延のWhisper構成が、10年前の英国の放送平均とちょうど重なる点に注目したい。
| 指標 | 値 | 出典 |
|---|---|---|
| AssemblyAI Universal-Streamingの遅延、中央値 / P99 | 307 ms / 1,012 ms | AssemblyAI、2025年6月 |
| Deepgram Nova-3の遅延、中央値 / P99(AssemblyAIのテスト) | 516 ms / 1,907 ms | AssemblyAI、2025年6月 |
| Deepgram Nova-3のWER中央値:ストリーミング / バッチ | 6.84% / 5.26% | Deepgram、2025年2月 |
| Deepgram Nova-3のベンチマークセット | 2,703ファイル、81.69時間、9ドメイン | Deepgram、2025年2月 |
| Whisper-Streamingの平均遅延、英語 | 3.3秒 | Machacekほか、2023年 |
| Whisper-Streaming英語:0.5秒チャンクと2.0秒チャンク | 3.27秒でWER 8.5%対5.45秒でWER 8.0% | Machacekほか、2023年 |
| Whisper-Streamingの遅延、ドイツ語 / チェコ語(0.5秒チャンク) | 4.11秒 / 4.69秒 | Machacekほか、2023年 |
リアルタイムの上限は、人間の会話によって決まる。10言語を通じて、質問と回答の間隔の平均は+208 msで、日本語の+7 msからデンマーク語の+469 msまで幅があった(Stiversほか、PNAS 2009)。OpenAIのGPT-4oの発表は、音声応答が最短232 ms、平均320 msだと主張し、文字起こし、言語、音声の各モデルを連結していた以前のパイプライン型ボイスモードの2.8秒(GPT-3.5)と5.4秒(GPT-4)と対比させた。ライブ字幕への教訓も同じだ。伝送経路に段階が1つ増えるたびに数秒が加わり、かつて支配的だった認識そのものの段階が、今では最も小さい。
| 指標 | 値 | 出典 |
|---|---|---|
| 質問から回答までの平均間隔、10言語 | +208 ms | Stiversほか、PNAS 2009(入手可能な最新データ) |
| 最速 / 最遅の言語の平均 | +7 ms(日本語)/ +469 ms(デンマーク語) | Stiversほか、PNAS 2009 |
| GPT-4oの音声応答:最小 / 平均 | 232 ms / 320 ms | OpenAI、2024年5月 |
| パイプライン型ボイスモードの平均遅延:GPT-3.5 / GPT-4 | 2.8秒 / 5.4秒 | OpenAI、2024年5月 |
| 2026年の視聴者調査で使われたASRキャプションの遅延 | 平均2秒 | Thompsonほか、arXiv 2609.11408 |
6. 自動化がキャプションの伝送経路を担う
ライブ字幕を支える人的な労働力は、速度の上限によって規定されている。米国のリアルタイムの基準であるNCRA Certified Realtime Reporterは、**毎分200語、精度96%**での5分間のリアルタイムテストを求めており、EBUの報告書は、ライブ字幕を毎分最大200語の話者に追従するものと説明している。英国のリスピーカーは研究者に対し、基本的な訓練には2-3か月、自信が持てるようになるまでには1.5-2年かかると語った(Moores、JoSTrans 33)。これらの制約が、精度が近づいた途端に自動キャプションが急速に拡大した理由だ。
量的な変化は企業の提出資料に表れている。Ai-Mediaの自動キャプションLEXIは2025会計年度に7,920万分に達し、4年前の1,000万分未満から、4年間の年平均成長率(CAGR)は69%となり、LEXIは現在、同社のiCapネットワーク全体の利用の大半を占めている(Ai-Media 2025会計年度決算、ASX発表、2025年8月28日)。技術製品はAi-Mediaの収益の63%を占め、5年前はゼロだった。同じシステムを対象とした独立したテストでは、NER精度が英語98.56%、スペイン語98.26%と判明し、複数の話者がいる口語的な内容を除き、人間のキャプションに匹敵していた(Romero-FrescoとVan Gauwbergen、Fit for What Purpose?、2025年)。この職業の人間側については、当社の法廷での音声文字起こし精度統計もご覧ください。
| 指標 | 値 | 出典 |
|---|---|---|
| NCRA CRRのリアルタイム基準 | 精度96%で200語/分(5分間のテスト) | NCRA |
| リスピーカーの基本訓練 / 自信が持てるまでの期間 | 2-3か月 / 1.5-2年 | Moores、JoSTrans 33 |
| Ai-Mediaの自動キャプションLEXIの分数、2025会計年度 | 7,920万 | Ai-Media 2025会計年度決算、ASX |
| 4年前のLEXIの分数 | 1,000万未満(4年間CAGR 69%) | Ai-Media 2025会計年度決算、ASX |
| Ai-Mediaの収益に占める技術の割合 | 63%(総収益6,490万ドル) | Ai-Media 2025会計年度決算、ASX |
| 自動キャプションのNER精度:英語 / スペイン語 | 98.56% / 98.26% | Romero-FrescoとVan Gauwbergen、2025年 |
| 自動と人間の出力を比較するために分析されたライブキャプション、英国/米国/カナダ 2018-2022年 | 約17,000件 | Romero-FrescoとFresno、Linguistica Antverpiensia 22、2023年 |
補足:これまでで最大の人間対機械の比較(Romero-FrescoとFresno、Linguistica Antverpiensia、2023年)では、編集されていない自動キャプションは98%に迫ったが、句読点、固有名詞、数字、話者の識別には根強い弱点が残っていた。エンジンの遅延が下がってもこれらは解決しない。速く出た誤った名前は、やはり誤った名前なのだ。
数字で見るライブ・リアルタイム字幕の遅延(まとめ)
| 指標 | 値 | 出典 |
|---|---|---|
| 英国のライブ字幕の平均遅延、2014年後半 | 5.1秒 | Ofcom第3回報告書、2015年 |
| 3秒ガイドラインを満たした英国のサンプル、第2ラウンド | 72件中4件 | Ofcom第2回報告書、2014年 |
| 記録された英国の最長遅延 | 21秒 | Ofcom第2回報告書、2014年 |
| Ofcomの現行の遅延ガイドライン | 平均4.5秒以内 | Ofcomアクセスサービスガイドライン |
| FCCの数値による遅延上限 | なし | FCC 14-12、2014年 |
| CRTCの英語ライブキャプション精度 | NER 98 | CRTC 2019-308 |
| 米国スペイン語ニュース番組のキャプション遅延 | 平均8.2秒 | Fresno、JoSTrans 42、2024年 |
| 10秒超遅れた米国スペイン語ニュース番組のキャプション | 20% | Fresno、JoSTrans 42、2024年 |
| 米国のライブテレビ映像での平均遅延 | 8.46秒 | Thompsonほか、arXiv 2609.11408、2026年 |
| テレビキャプションの評価:遅延ありと同期後 | 7点満点中3.66対5.09 | Thompsonほか、2026年 |
| 英国のライブ字幕精度、4ラウンド平均 | 98.38% | Moores経由のOfcomデータ、JoSTrans 33 |
| 米国の英語の全国ニュース番組の精度 | 98.8% | Fresno、2024年 |
| 自動キャプションの精度、英語 | 98.56% | Romero-FrescoとVan Gauwbergen、2025年 |
| 字幕を利用したことがある英国の成人 | 約760万人 | Ofcom、2013年 |
| 字幕付きの英国公共放送およびより大規模なオンデマンドの時間、2024年 | 88% | Ofcomアクセスサービス報告書2024 |
| AssemblyAIのストリーミング遅延の中央値 | 307 ms | AssemblyAI、2025年6月 |
| Whisper-Streamingの平均遅延 | 3.3秒 | Machacekほか、2023年 |
| 人間の話者交替の平均間隔 | 208 ms | Stiversほか、PNAS 2009 |
| Ai-MediaのLEXIキャプションの分数、2025会計年度 | 7,920万 | Ai-Media 2025会計年度決算 |
| 2031年5月までのカナダの配信事業者のカタログへのキャプション付与 | 100% | CRTC 2026-98 |
方法論と出典
上記のすべての数値は、それを作成した規制当局、提出資料、または査読付き論文まで遡って確認した。OfcomのPDFのいくつかは直接取得できなかったため、英国の数値は、Ofcomのプレスリリース(Wired-Govで再掲)、規制当局による要約(EPRA)、Ofcomのデータセットに関する査読付き分析(Moores)から取っており、それぞれ本文中に明記している。ベンダーのベンチマークはベンダーのデータとして表記している。キャプションと字幕の市場および利用に関する一般的なデータについては、当社のキャプションと字幕の統計をご覧ください。
- Ofcom:第3回ライブ字幕報告書プレスリリース(Wired-Gov、2015年5月)、ライブ字幕意見募集プレスリリース(Wired-Gov、2013年5月)、テレビおよびオンデマンドのアクセスサービス提供に関するガイドライン、アクセスサービス報告書 2024年1〜12月、Tier 1アクセシビリティ規範の意見募集(2026年5月)
- EPRA:Ofcom第1回ライブ字幕報告書の要約(2014年4月)
- Limping Chicken:Ofcom第2回ライブ字幕報告書に関する記事(2014年11月)
- Liam O’Dell:Ofcomの2023年アクセス規範意見募集に関する記事およびTier 1規範の意見募集
- FCC:キャプション品質基準、FCC 14-12(2014年)および47 CFR 79.1
- CRTC:放送規制方針2019-308および放送規制方針2026-98
- ACMA / オーストラリア政府:放送サービス(テレビキャプション)基準2023
- EBU:アクセスサービスとライブ字幕に関する報告書(i044)およびTech 3370、EBU-TT Part 3 ライブ字幕
- Thompson、Kushalnagar、Voglerほか:Are Caption Metrics Broken?、arXiv 2609.11408(2026年9月);Glasser、Kushalnagar、Vogler:How Users Experience Closed Captions on Live Television、CHI 2024
- Fresno:Closed Captions en espanol、JoSTrans 42(2024年)および米国の英語ニュース番組におけるライブキャプションの精度(2024年)
- Moores:ライブイベントでのライブ字幕、JoSTrans 33(Ofcomデータセットの分析を含む)
- Romero-FrescoとFresno:英語における自動および人間によるライブキャプションの精度(2023年);Romero-FrescoとVan Gauwbergen:Fit for What Purpose?(2025年);Romero-FrescoとMartinez:NERモデル(2015年)
- Machacek、Dabre、Bojar:Turning Whisper into Real-Time Transcription System(2023年)
- AssemblyAI:Introducing Universal-Streaming(2025年6月);Deepgram:Introducing Nova-3(2025年2月)
- OpenAI:Hello GPT-4o(2024年5月)
- Stiversほか:Universals and cultural variation in turn-taking in conversation、PNAS(2009年)
- Ai-Media:2025会計年度決算、ASX発表(2025年8月)
- NCRA:Certified Realtime Reporter
- WHO:難聴に関するファクトシート(2026年3月更新)
- データウォッチ:Ofcomの放送事業者別の遅延測定(2013〜2015年)は3年以上前のもので、この種の公開データセットとしては依然として入手可能な最新のものだ。各ラウンドは中央値と平均値が混在して報告されており(5.6、5.8、5.7から5.1、およびMoores経由の4ラウンド平均5.3)、傾向線ではなく範囲として捉えるべきだ。Ofcomの字幕利用者の推定(760万人)は2013年、Stiversの話者交替データは2009年のものだ。AssemblyAIとDeepgramの数値はベンダーのベンチマークであり、AssemblyAIの比較は競合を自社のテストセットで測定したもので、Nova-3の独立したテストではDeepgramの数値より高いWERが報告されている。2026年のThompsonほかの論文はarXivのプレプリントで、まだ査読を受けていない。Ai-Mediaの収益の数値は、ASX発表に記載されたとおりに示している。同じ自動システムに対する2つの独立した評価は、内容の難易度によって異なる見出しの精度を報告しており、2026年の視聴者調査ではライブテレビ映像でNER合格率がはるかに低かったため、自動精度はジャンルに大きく左右される。OfcomのTier 1規範は案であり、2026年8月7日に意見募集が締め切られ、最終見解が待たれている。
最終更新日:2026年10月3日。当社はこのまとめを四半期ごとに更新しており、次回の更新は、OfcomがTier 1アクセシビリティ規範の最終見解と、2025年1〜12月のアクセスサービス報告書を公表する時期を予定している。