ライブ・リアルタイム字幕の遅延統計(2026年):遅延、精度、ASR速度に関する60以上のデータポイント

ライブ字幕の遅延統計2026:英国のライブ字幕は発話より5.1〜5.8秒遅れ、Ofcomは現在4.5秒を目標とし、米国のスペイン語ニュースでは平均8.2秒だった。遅延・精度・ASR速度の最新データを整理する。

英国のテレビのライブ字幕は、Ofcomの測定ラウンドを通じて平均で発話より5.1〜5.8秒遅れており、第2ラウンドでは72サンプル中わずか4サンプルしか従来の3秒ガイドラインを満たしていなかった(Ofcom、ライブ字幕品質報告書2014〜2015年)。この問題は解消されていない。2024年の米国スペイン語ニュース番組の調査では平均遅延が8.2秒、個々のキャプションでは最大41秒に達し(Fresno、JoSTrans 2024)、2026年9月の調査では米国のライブテレビ映像で平均8.46秒だった。一方で、ストリーミング音声認識エンジンは現在、単語遅延の中央値が約300ミリ秒と報告されており(AssemblyAI、2025年6月)、ライブキャプションのボトルネックは人間のタイピストから放送の伝送経路へと移りつつある。本稿では、Ofcom、FCC、CRTC、Gallaudet大学とビゴ大学による査読付き研究、arXivのベンチマーク論文、Ai-MediaのASX提出資料、WHO、そして方法論に挙げたその他の一次資料のデータを集計した。全体像については、当社のライブキャプション統計もご覧ください。

主なポイント

  • 英国のライブ字幕の平均遅延は、2014年4〜5月から10〜11月にかけて5.7秒から5.1秒に低下したが、3秒のガイドラインを大きく上回ったままだった(Ofcom、第3回ライブ字幕報告書、2015年)。
  • 第2ラウンドで英国のサンプルのうち3秒ガイドラインを満たしたのは72件中4件のみで、最長の遅延は21秒に達した(Ofcom、第2回報告書、2014年)。
  • Ofcomは現在、ライブ番組全体で平均遅延を4.5秒以内にするよう求めている(Ofcom、テレビおよびオンデマンドのアクセスサービス提供に関するガイドライン)。
  • 米国のスペイン語ニュース番組のキャプション遅延は平均8.2秒で、キャプションの20%が10秒超遅れて届いた(Fresno、JoSTrans 42、2024年)。
  • 元の放送遅延(平均8.46秒)のテレビキャプションは3.66/7と評価され、同期させると5.09/7だった(Thompsonほか、arXiv 2609.11408、2026年)。
  • 英国のライブ字幕は、Ofcomの4回のラウンド全体で平均98.38%のNER精度となり、98%の閾値を上回った(Moores経由のOfcomデータ、JoSTrans 33)。
  • 米国の英語の全国ニュース番組は平均98.8%のNER精度だった(Fresno、Universal Access in the Information Society、2024年)。
  • ある自動キャプションシステムは、NERで英語98.56%、スペイン語98.26%を記録した(Romero-FrescoとVan Gauwbergen、2025年)。
  • AssemblyAIはストリーミング遅延の中央値307 msを報告し、Deepgram Nova-3は516 msだった(AssemblyAI、2025年6月)。
  • Whisper-Streamingは長時間の英語音声で平均遅延3.3秒に達した(Machacek、Dabre、Bojar、IJCNLP-AACL 2023)。
  • 人間は10言語を通じて平均208 msで質問に答える(Stivers ほか、PNAS 2009)。これがリアルタイムシステムの追い求める基準だ。
  • Ai-Mediaの自動キャプションLEXIは2025会計年度に7,920万分に達し、4年前の1,000万分未満から増加した(Ai-Media 2025会計年度決算、ASX)。

1. 測定された遅延:ライブ字幕は発話にどれだけ遅れるか

ライブ字幕の遅延に関する最も包括的な公開データセットは今も英国のものであり、一貫した傾向を示している。典型的なライブ字幕は、言葉が発せられてから5秒以上遅れて表示される。Ofcomは2013年から2015年にかけて4回のラウンドで、BBC、ITV、Channel 4、Channel 5、Skyのニュース、エンターテインメント、トーク番組をサンプリングした。第1回報告書では遅延の中央値が5.6秒(EPRAによるOfcom第1回報告書の要約、2014年4月)、第2回報告書では5.8秒で、3秒ガイドラインに収まったのは72サンプル中4サンプルのみだった(Limping ChickenによるOfcom第2回報告書の記事、2014年11月)。

その後の改善は実際にあったものの、小幅にとどまった。Ofcomの第3回報告書は、2014年4〜5月から10〜11月にかけて平均遅延が0.6秒、5.7秒から5.1秒へ低下したと記録している(Wired-Gov掲載のOfcomプレスリリース、2015年5月)。5秒の遅延から0.5秒を削るには、ソフトウェアだけでなく放送事業者のワークフロー変更が必要だったため、数値は頭打ちになった。これらはOfcomの遅延測定として入手可能な最新のもの(2014〜2015年)であり、放送事業者別のより新しいデータセットは公表されていない。

指標値出典
英国のライブ字幕遅延の中央値、第1ラウンド5.6秒Ofcom第1回ライブ字幕報告書、2014年4月
英国の遅延、第2ラウンド5.8秒Ofcom第2回報告書、2014年11月
3秒ガイドラインを満たしたサンプル、第2ラウンド72件中4件Ofcom第2回報告書、2014年
記録された最長の遅延、第2ラウンド21秒Ofcom第2回報告書、2014年
英国の平均遅延、2014年4〜5月から2014年10〜11月5.7秒から5.1秒(-0.6秒)Ofcom第3回報告書、2015年5月
4回のラウンド全体での英国の平均遅延5.3秒Moores経由のOfcomデータ、JoSTrans 33
事前作成字幕をライブ同様に送出しない場合の遅延7-8秒Moores経由のOfcomデータ、JoSTrans 33

補足:各ラウンドの数値は報告されたとおり中央値と平均値が混在しているため、ラウンド間の小さな差(5.6、5.7、5.8)を過大に解釈すべきではない。事前作成して送出する字幕のない番組で7-8秒という数値は、英国の平均がリアルタイムの文字起こしよりもいかに台本に依存しているかを示している。

英国以外では、遅延はさらに長い。TelemundoとUnivisionの米国スペイン語ニュース番組のキャプションは、発話より平均8.2秒遅れ、範囲は0.7秒から41秒に及び、キャプションの46%が8秒を超えて遅れていた(Fresno、Closed Captions en espanol、JoSTrans 42、2024年)。米国のライブテレビ映像を対象とした2026年の調査では、平均遅延は8.46秒(標準偏差3.62)で、7-12秒がテレビキャプションにとって典型的だと述べられている(Thompsonほか、arXiv 2609.11408)。

指標値出典
米国スペイン語ニュース番組の平均キャプション遅延8.2秒Fresno、JoSTrans 42、2024年
同じサンプルでの遅延の範囲0.7〜41秒Fresno、JoSTrans 42、2024年
8 / 10 / 12秒を超えて遅れたキャプション46% / 20% / 8%Fresno、JoSTrans 42、2024年
その調査で分析されたキャプション5,349件(10分間のセグメント20本)Fresno、JoSTrans 42、2024年
米国のライブテレビ映像での平均遅延8.46秒(標準偏差3.62)Thompsonほか、arXiv 2609.11408、2026年9月
引用された米国テレビキャプションの典型的な遅延7-12秒Thompsonほか、arXiv 2609.11408、2026年9月
リスピーキングを用いたライブ(非放送)イベントでの平均遅延5.8秒(範囲4.3-7.5秒)Moores、JoSTrans 33

2. 規制上の目標:3秒から4.5秒へ

規制当局は遅延が重要だという点では一致しているが、ほとんどは数値を示していない。本稿で取り上げる主要規制当局のうち、遅延に数値目標を持つのはOfcomだけであり、その目標をより緩やかな方向へ動かした。テレビアクセスサービス規範の最大遅延3秒から、事業者のライブ番組全体で平均4.5秒以内へと変更したのだ。2023年の意見募集の中で、Ofcomは、放送事業者が最大3秒は非現実的だと述べており、4.5秒は個々の放送事業者が達成した最良の遅延に相当すると説明した(テレビおよびオンデマンドのアクセスサービス提供に関するOfcomのガイドライン)。

米国のアプローチは定性的だ。FCCは2014年2月20日に、正確性、同期性、完全性、配置を対象とするキャプション品質基準を採択し、ライブキャプションの遅延は「話されている内容の正確な提示と両立する範囲で最小限に抑えるべき」とだけ述べた(FCC、キャプション品質基準)。カナダは時間ではなく正確性を規制している。CRTCの放送規制方針2019-308は、英語のライブキャプションにNERモデルで98のスコアを求めている。実際上の効果として、10秒遅れて届くキャプションでも、世界の大半の地域では完全に準拠したものとなりうる。

指標値出典
Ofcomの従来のガイドライン最大遅延3秒Ofcomテレビアクセスサービス規範
Ofcomの現行ガイドラインライブ番組全体で平均4.5秒以内Ofcomテレビおよびオンデマンドのアクセスサービス提供に関するガイドライン
Ofcomの従来の字幕速度ガイダンス:収録番組 / ライブ160-180語/分 / 200語/分Ofcom 2023年意見募集(Liam O’Dell報道による)
FCCの数値による遅延上限なし(遅延は「最小限に抑える」)FCC 14-12、2014年2月20日採択
ライブ番組におけるテレプロンプターのみのENTキャプションに対するFCCの禁止4大ネットワークと上位25市場の系列局FCC 14-12
免除対象外の新規番組に対するFCCのキャプション付与2006年1月1日以降100%47 CFR 79.1
CRTCの英語ライブキャプション精度要件NERスコア98、2019年9月1日からCRTC 2019-308
CRTCの監視義務毎月ライブ番組2本(うちニュース1本)CRTC 2019-308

補足:オーストラリアのACMAも、2023年10月1日から施行されている放送サービス(テレビキャプション)基準2023において数値による遅延を定めておらず、読みやすさ、正確性、理解しやすさを個別に評価している。

最新の規則は、遅延を厳しくするのではなく、ストリーミングへと義務を広げている。カナダのCRTC 2026-98は、オンライン配信事業者に2030年5月までにカタログの80%、2031年5月までに100%へキャプションを付けることを求めており、新規のオリジナルのライブ番組および収録番組には1年以内にキャプションを付けるとしている(CRTC 2026-98、2026年5月25日)。2026年5月14日に公表されたOfcomのTier 1アクセシビリティ規範案は、最大手の配信事業者に対し、公表から4年後に字幕付与率80%の割当を課すことを提案している(Ofcom、Tier 1アクセシビリティ規範の意見募集)。

指標値出典
カナダの配信事業者のカタログへのキャプション付与2030年5月までに80%、2031年5月までに100%CRTC 2026-98
配信事業者の収録済みオリジナル番組に対するカナダの精度要件100%CRTC 2026-98
OfcomのTier 1字幕割当、4年目 / 1年目80% / 20%Ofcom Tier 1アクセシビリティ規範案、2026年5月
BBCのオンデマンド字幕割当、4年目90%Ofcom Tier 1アクセシビリティ規範案、2026年5月
Tier 1の閾値英国の月間平均利用者500,000人以上Ofcom Tier 1アクセシビリティ規範案、2026年5月

3. 精度:98%のNERラインと、それを超えるのは誰か

遅延と精度はトレードオフの関係にあるため、遅延の数値は精度の数値と並べて初めて意味を持つ。一般的な指標がNERモデルで、ライブ字幕を(単語数から編集誤りと認識誤りを引いたもの)÷単語数で採点する。98%が「許容」、98.5-98.99%が「良好」、99-99.49%が「非常に良好」、99.5%超が「優秀」である(Romero-FrescoとMartinez、NERモデル、2015年)。この閾値は寛容に見えるが、実際の数字に直すと印象が変わる。98%では、100語のうち2語が誤り、欠落、または重み付けされた誤りとなる。

英国の放送事業者は平均してこの基準を満たした。Ofcomの4回のラウンドで98.38%、最終ラウンドで98.55%で、78,000件の字幕と546,000語を対象に測定された(Moores、JoSTrans 33)。しかし平均は裾野を隠してしまう。2014年10〜11月には、英国の番組の77%が98%以上に達し、2014年4〜5月の74%から上昇しており、ニュースが最も正確なジャンルで98.75%だった(Ofcom第3回報告書、2015年)。米国の英語の全国ニュース番組はそれより良好で、平均98.8%、20サンプル中14サンプルが許容以上と評価された一方、スペイン語のニュース番組は97.04%にとどまった(Fresno、2024年)。

指標値出典
NERの許容 / 優秀の閾値98% / 99.5%超Romero-FrescoとMartinez、2015年
英国のライブ字幕精度、4ラウンド平均98.38%Moores経由のOfcomデータ、JoSTrans 33
英国のライブ字幕精度、最終ラウンド98.55%Moores経由のOfcomデータ、JoSTrans 33
98%以上の英国番組、2014年10〜11月(2014年4〜5月との比較)77%(74%)Ofcom第3回報告書、2015年
英国のニュースジャンルの精度98.75%Ofcom第3回報告書、2015年
米国の英語の全国ニュース番組、平均NER98.8%(20サンプル中14サンプルが許容以上)Fresno、Universal Access in the Information Society、2024年
米国のスペイン語ニュース番組、平均NER97.04%(Telemundo 97.00%、Univision 97.10%)Fresno、JoSTrans 42、2024年
テキスト削減:スペイン語と英語のニュース番組26%対5-6%Fresno、JoSTrans 42、2024年

補足:速度は見えにくい第3の変数だ。Ofcomは字幕の平均を毎分180語未満にすることを推奨しているが、分析した番組のほぼすべてに毎分200語を超える短い突発的な区間があり、それらを誤りとして数えると、番組の68%が98%を下回った(Ofcom第3回報告書、2015年)。米国の英語ニュース番組の調査では、誤りのほぼ3分の2が軽微なものだったことがわかった。

4. 遅延が視聴者に与えるコスト

ライブ字幕の利用者は、ろう者だけよりはるかに多い。Ofcomは、英国の成人約760万人が字幕を利用したことがあり、そのうち聴覚障害があるのはわずか140万人と推定した(Wired-Gov掲載のOfcomプレスリリース、2013年5月)。つまり、聴覚障害のない字幕利用者が600万人を超える(760万人から140万人を引いた数)ということであり、その多くは騒がしい部屋や音量を下げた状態で視聴している。Ofcomのガイドラインは、18-24歳の61%が字幕をオンにしたい派だというYouGovのデータも引用している。世界全体では、WHOの推計で、障害を伴う難聴のためにリハビリテーションを必要とする人が現在4億3,000万人おり、2050年までに7億人を超える見込みだ。

指標値出典
字幕を利用したことがある英国の成人約760万人(範囲700万-810万人)Ofcom、2013年5月
そのうち聴覚障害のある人約140万人(範囲120万-160万人)Ofcom、2013年5月
字幕をオンにしたい英国の18-24歳61%YouGov(Ofcomアクセスサービスガイドラインに引用)
字幕付きの英国公共放送およびより大規模なオンデマンド番組の時間の割合、2024年88%Ofcomアクセスサービス報告書、2024年1〜12月(2025年5月19日公表)
義務対象チャンネルにおける英国の字幕付き放送時間、2005年と2013年40.5%対81.9%Ofcom第1回ライブ字幕報告書、2014年
障害を伴う難聴でリハビリテーションを必要とする人4億3,000万人WHOファクトシート、2026年3月更新
2050年までに何らかの難聴になると予測される人約25億人WHOファクトシート、2026年3月更新

視聴者が最初に気づくのは遅延だ。最近で最大規模のユーザー調査では、ろう者および難聴者の視聴者216人に、4つの条件下で70本のライブテレビ映像を評価してもらい、4,832件の評価を得た。同じテレビキャプションが、元の放送遅延のままでは7点満点中3.66、同期させると5.09と評価され、同期したテレビとASRキャプションの差よりもはるかに大きな開きとなった(Thompsonほか、Are Caption Metrics Broken?、arXiv 2609.11408、2026年9月)。2秒の遅延があるASRキャプションは、同期時の5.20に対して4.81と、はるかに持ちこたえた。

同じ調査は、精度スコアが品質を捉えているという考えも覆している。NER 98の閾値に達したのはテレビ映像70本中11本、ASR映像70本中4本にすぎなかったが、視聴者は同期したASRとテレビのキャプションをほぼ同等に評価し、指標と評価の相関はASR出力で大きく低下した(WER r = -0.390、テレビキャプションでは-0.687)。Gallaudetによる以前のCHI 2024の研究も同様の結論に至り、参加者は放送の遅延を強く嫌い、標準的な精度指標は視聴者のキャプション評価とは弱くしか相関しなかった。

指標値出典
参加者 / 評価 / クリップ216 / 4,832 / 70Thompsonほか、arXiv 2609.11408、2026年
テレビキャプションの評価:元の遅延と同期後(7段階評価)3.66対5.09Thompsonほか、2026年
ASRキャプションの評価:2秒遅延と同期後4.81対5.20Thompsonほか、2026年
平均WER:テレビキャプションとASRキャプション33.8%対17.2%Thompsonほか、2026年
平均NER:テレビキャプションとASRキャプション95.28対94.34Thompsonほか、2026年
NER 98を満たしたクリップ:テレビとASR70本中11本対70本中4本Thompsonほか、2026年
WERと視聴者評価の相関:テレビとASRr = -0.687対-0.390Thompsonほか、2026年

補足:テレビのWERが高いのは、一部には放送キャプションが言い換えや要約を行うことを反映している。WERはそれにペナルティを課すが、NERは課さない。この差こそが、著者らが現在の指標は技術中立ではないと主張する理由だ。

5. ASRエンジンの速度:ストリーミング遅延と人間の会話

エンジンの遅延は、もはや字幕遅延の主な原因ではない。AssemblyAIは、Universal-Streamingのストリーミング遅延の中央値を307 ms、Deepgram Nova-3を516 ms、P99をそれぞれ1,012 msと1,907 msと報告した。これは205時間以上の音声で、音声中の単語の終わりから部分的な文字起こしに最初に現れるまでを測定したものだ(AssemblyAI、Introducing Universal-Streaming、2025年6月2日)。Deepgram自身の発表データでは、Nova-3のストリーミングでの単語誤り率の中央値は6.84%で、比較した競合は14.92%だった(Deepgram、Introducing Nova-3、2025年2月)。どちらもベンダーによるベンチマークであり、最良のケースとして読むべきだ。当社の音声テキスト変換統計では、より多くのエンジンの精度を取り上げている。

オープンモデルは、安定性と引き換えにより大きな遅延を受け入れる。学術的なWhisper-Streamingシステムは、欧州議会のESICテストセットの長時間の英語音声で平均遅延3.3秒に達し、そのトレードオフは結果に明示されている。英語のWERは、0.5秒チャンクで遅延3.27秒のとき8.5%、2秒チャンクで5.45秒のとき8.0%だった(Machacek、Dabre、Bojar、arXiv 2307.14743、IJCNLP-AACL 2023)。5秒遅延のWhisper構成が、10年前の英国の放送平均とちょうど重なる点に注目したい。

指標値出典
AssemblyAI Universal-Streamingの遅延、中央値 / P99307 ms / 1,012 msAssemblyAI、2025年6月
Deepgram Nova-3の遅延、中央値 / P99(AssemblyAIのテスト)516 ms / 1,907 msAssemblyAI、2025年6月
Deepgram Nova-3のWER中央値:ストリーミング / バッチ6.84% / 5.26%Deepgram、2025年2月
Deepgram Nova-3のベンチマークセット2,703ファイル、81.69時間、9ドメインDeepgram、2025年2月
Whisper-Streamingの平均遅延、英語3.3秒Machacekほか、2023年
Whisper-Streaming英語:0.5秒チャンクと2.0秒チャンク3.27秒でWER 8.5%対5.45秒でWER 8.0%Machacekほか、2023年
Whisper-Streamingの遅延、ドイツ語 / チェコ語(0.5秒チャンク)4.11秒 / 4.69秒Machacekほか、2023年

リアルタイムの上限は、人間の会話によって決まる。10言語を通じて、質問と回答の間隔の平均は+208 msで、日本語の+7 msからデンマーク語の+469 msまで幅があった(Stiversほか、PNAS 2009)。OpenAIのGPT-4oの発表は、音声応答が最短232 ms、平均320 msだと主張し、文字起こし、言語、音声の各モデルを連結していた以前のパイプライン型ボイスモードの2.8秒(GPT-3.5)と5.4秒(GPT-4)と対比させた。ライブ字幕への教訓も同じだ。伝送経路に段階が1つ増えるたびに数秒が加わり、かつて支配的だった認識そのものの段階が、今では最も小さい。

指標値出典
質問から回答までの平均間隔、10言語+208 msStiversほか、PNAS 2009(入手可能な最新データ)
最速 / 最遅の言語の平均+7 ms(日本語)/ +469 ms(デンマーク語)Stiversほか、PNAS 2009
GPT-4oの音声応答:最小 / 平均232 ms / 320 msOpenAI、2024年5月
パイプライン型ボイスモードの平均遅延:GPT-3.5 / GPT-42.8秒 / 5.4秒OpenAI、2024年5月
2026年の視聴者調査で使われたASRキャプションの遅延平均2秒Thompsonほか、arXiv 2609.11408

6. 自動化がキャプションの伝送経路を担う

ライブ字幕を支える人的な労働力は、速度の上限によって規定されている。米国のリアルタイムの基準であるNCRA Certified Realtime Reporterは、**毎分200語、精度96%**での5分間のリアルタイムテストを求めており、EBUの報告書は、ライブ字幕を毎分最大200語の話者に追従するものと説明している。英国のリスピーカーは研究者に対し、基本的な訓練には2-3か月、自信が持てるようになるまでには1.5-2年かかると語った(Moores、JoSTrans 33)。これらの制約が、精度が近づいた途端に自動キャプションが急速に拡大した理由だ。

量的な変化は企業の提出資料に表れている。Ai-Mediaの自動キャプションLEXIは2025会計年度に7,920万分に達し、4年前の1,000万分未満から、4年間の年平均成長率(CAGR)は69%となり、LEXIは現在、同社のiCapネットワーク全体の利用の大半を占めている(Ai-Media 2025会計年度決算、ASX発表、2025年8月28日)。技術製品はAi-Mediaの収益の63%を占め、5年前はゼロだった。同じシステムを対象とした独立したテストでは、NER精度が英語98.56%、スペイン語98.26%と判明し、複数の話者がいる口語的な内容を除き、人間のキャプションに匹敵していた(Romero-FrescoとVan Gauwbergen、Fit for What Purpose?、2025年)。この職業の人間側については、当社の法廷での音声文字起こし精度統計もご覧ください。

指標値出典
NCRA CRRのリアルタイム基準精度96%で200語/分(5分間のテスト)NCRA
リスピーカーの基本訓練 / 自信が持てるまでの期間2-3か月 / 1.5-2年Moores、JoSTrans 33
Ai-Mediaの自動キャプションLEXIの分数、2025会計年度7,920万Ai-Media 2025会計年度決算、ASX
4年前のLEXIの分数1,000万未満(4年間CAGR 69%)Ai-Media 2025会計年度決算、ASX
Ai-Mediaの収益に占める技術の割合63%(総収益6,490万ドル)Ai-Media 2025会計年度決算、ASX
自動キャプションのNER精度:英語 / スペイン語98.56% / 98.26%Romero-FrescoとVan Gauwbergen、2025年
自動と人間の出力を比較するために分析されたライブキャプション、英国/米国/カナダ 2018-2022年約17,000件Romero-FrescoとFresno、Linguistica Antverpiensia 22、2023年

補足:これまでで最大の人間対機械の比較(Romero-FrescoとFresno、Linguistica Antverpiensia、2023年)では、編集されていない自動キャプションは98%に迫ったが、句読点、固有名詞、数字、話者の識別には根強い弱点が残っていた。エンジンの遅延が下がってもこれらは解決しない。速く出た誤った名前は、やはり誤った名前なのだ。

数字で見るライブ・リアルタイム字幕の遅延(まとめ)

指標値出典
英国のライブ字幕の平均遅延、2014年後半5.1秒Ofcom第3回報告書、2015年
3秒ガイドラインを満たした英国のサンプル、第2ラウンド72件中4件Ofcom第2回報告書、2014年
記録された英国の最長遅延21秒Ofcom第2回報告書、2014年
Ofcomの現行の遅延ガイドライン平均4.5秒以内Ofcomアクセスサービスガイドライン
FCCの数値による遅延上限なしFCC 14-12、2014年
CRTCの英語ライブキャプション精度NER 98CRTC 2019-308
米国スペイン語ニュース番組のキャプション遅延平均8.2秒Fresno、JoSTrans 42、2024年
10秒超遅れた米国スペイン語ニュース番組のキャプション20%Fresno、JoSTrans 42、2024年
米国のライブテレビ映像での平均遅延8.46秒Thompsonほか、arXiv 2609.11408、2026年
テレビキャプションの評価:遅延ありと同期後7点満点中3.66対5.09Thompsonほか、2026年
英国のライブ字幕精度、4ラウンド平均98.38%Moores経由のOfcomデータ、JoSTrans 33
米国の英語の全国ニュース番組の精度98.8%Fresno、2024年
自動キャプションの精度、英語98.56%Romero-FrescoとVan Gauwbergen、2025年
字幕を利用したことがある英国の成人約760万人Ofcom、2013年
字幕付きの英国公共放送およびより大規模なオンデマンドの時間、2024年88%Ofcomアクセスサービス報告書2024
AssemblyAIのストリーミング遅延の中央値307 msAssemblyAI、2025年6月
Whisper-Streamingの平均遅延3.3秒Machacekほか、2023年
人間の話者交替の平均間隔208 msStiversほか、PNAS 2009
Ai-MediaのLEXIキャプションの分数、2025会計年度7,920万Ai-Media 2025会計年度決算
2031年5月までのカナダの配信事業者のカタログへのキャプション付与100%CRTC 2026-98

方法論と出典

上記のすべての数値は、それを作成した規制当局、提出資料、または査読付き論文まで遡って確認した。OfcomのPDFのいくつかは直接取得できなかったため、英国の数値は、Ofcomのプレスリリース(Wired-Govで再掲)、規制当局による要約(EPRA)、Ofcomのデータセットに関する査読付き分析(Moores)から取っており、それぞれ本文中に明記している。ベンダーのベンチマークはベンダーのデータとして表記している。キャプションと字幕の市場および利用に関する一般的なデータについては、当社のキャプションと字幕の統計をご覧ください。

最終更新日:2026年10月3日。当社はこのまとめを四半期ごとに更新しており、次回の更新は、OfcomがTier 1アクセシビリティ規範の最終見解と、2025年1〜12月のアクセスサービス報告書を公表する時期を予定している。

VoxBoosterを試す — 3日間無料。

リアルタイム音声クローン、サウンドボード、エフェクト — 会話するすべての場所で。

  • カード不要
  • ~30msのレイテンシ
  • Discord · Teams · OBS
3日間無料で試す