Статистика задержки субтитров в реальном времени (2026): более 60 показателей о задержке, точности и скорости ASR

Задержка живых субтитров 2026: в Великобритании субтитры отставали от речи на 5,1-5,8 с, Ofcom теперь целится в 4,5 с, а испаноязычные новости США дали 8,2 с.

Живые субтитры на британском телевидении отставали от речи в среднем на 5,1-5,8 секунды в измерительных раундах Ofcom, и лишь 4 из 72 выборок второго раунда укладывались в прежнюю рекомендацию в 3 секунды (Ofcom, отчёты о качестве живых субтитров 2014-2015). Проблема не исчезла: исследование 2024 года об испаноязычных новостях США зафиксировало среднюю задержку 8,2 секунды, причём отдельные субтитры опаздывали на целых 41 секунду (Fresno, JoSTrans 2024), а исследование сентября 2026 года показало среднее значение 8,46 секунды на фрагментах прямого телеэфира США. Тем временем потоковые системы распознавания речи сегодня заявляют медианную задержку на слово около 300 миллисекунд (AssemblyAI, июнь 2025), так что узкое место живых субтитров смещается от человека-наборщика к эфирной цепочке. Мы свели данные Ofcom, FCC, CRTC, рецензируемых исследований Gallaudet University и Universidade de Vigo, бенчмарк-статей на arXiv, документов Ai-Media для ASX, ВОЗ и других первичных источников, перечисленных в методологии. Более общую картину см. в нашем обзоре статистики живых субтитров.

Кратко (TL;DR)

  • Средняя задержка британских живых субтитров снизилась с 5,7 до 5,1 секунды между апрелем-маем и октябрём-ноябрём 2014 года, всё ещё заметно выше рекомендации в 3 секунды (Ofcom, третий отчёт о живых субтитрах, 2015).
  • Лишь 4 из 72 британских выборок уложились в рекомендацию в 3 секунды во втором раунде, а самая большая задержка достигла 21 секунды (Ofcom, второй отчёт, 2014).
  • Ofcom теперь требует среднюю задержку не более 4,5 секунды по всему прямому эфиру (Ofcom, Рекомендации по предоставлению услуг доступности на телевидении и по запросу).
  • Испаноязычные новости США показали среднюю задержку субтитров 8,2 секунды, а 20% субтитров опоздали более чем на 10 секунд (Fresno, JoSTrans 42, 2024).
  • Телевизионные субтитры с исходной эфирной задержкой (среднее 8,46 с) получили 3,66/7 против 5,09/7 после синхронизации (Thompson et al., arXiv 2609.11408, 2026).
  • Британские живые субтитры в среднем показали 98,38% точности NER за четыре раунда Ofcom, выше порога 98% (данные Ofcom через Moores, JoSTrans 33).
  • Англоязычные национальные новости США в среднем показали 98,8% точности NER (Fresno, Universal Access in the Information Society, 2024).
  • Автоматическая система субтитрования набрала 98,56% NER на английском и 98,26% на испанском (Romero-Fresco и Van Gauwbergen, 2025).
  • AssemblyAI сообщила о медианной потоковой задержке 307 мс против 516 мс у Deepgram Nova-3 (AssemblyAI, июнь 2025).
  • Whisper-Streaming показала среднюю задержку 3,3 секунды на длинной английской речи (Machacek, Dabre и Bojar, IJCNLP-AACL 2023).
  • Люди отвечают на вопрос в среднем за 208 мс на 10 языках (Stivers et al., PNAS 2009), и именно к этому ориентиру стремятся системы реального времени.
  • Автоматические субтитры LEXI от Ai-Media достигли 79,2 миллиона минут в 2025 финансовом году против менее чем 10 миллионов четырьмя годами ранее (результаты Ai-Media за 2025 финансовый год, ASX).

1. Измеренная задержка: насколько живые субтитры отстают от речи

Самым полным публичным набором данных о задержке живых субтитров по-прежнему остаётся британский, и он рассказывает последовательную историю: типичный живой субтитр появляется более чем через 5 секунд после произнесения слов. Ofcom отобрал выпуски новостей, развлекательные и ток-шоу BBC, ITV, Channel 4, Channel 5 и Sky в четырёх раундах между 2013 и 2015 годами. Первый отчёт выявил медианную задержку 5,6 секунды (обзор EPRA первого отчёта Ofcom, апрель 2014), а второй - 5,8 секунды, причём лишь 4 из 72 выборок уложились в рекомендацию в 3 секунды (материал Limping Chicken о втором отчёте Ofcom, ноябрь 2014).

Последовавшее улучшение было реальным, но небольшим. Третий отчёт Ofcom зафиксировал снижение средней задержки на 0,6 секунды, с 5,7 до 5,1 секунды, между апрелем-маем и октябрём-ноябрём 2014 года (пресс-релиз Ofcom через Wired-Gov, май 2015). Чтобы убрать полсекунды из пятисекундной задержки, вещателям пришлось менять рабочие процессы, а не только программы, поэтому показатель и застопорился. Это самые свежие доступные измерения задержки Ofcom (2014-2015); более новых наборов данных по вещателям не публиковалось.

ПоказательЗначениеИсточник
Медианная задержка британских живых субтитров, первый раунд5,6 секундыПервый отчёт Ofcom о живых субтитрах, апрель 2014
Задержка в Великобритании, второй раунд5,8 секундыВторой отчёт Ofcom, ноябрь 2014
Выборки, уложившиеся в рекомендацию в 3 секунды, второй раунд4 из 72Второй отчёт Ofcom, 2014
Самая большая зафиксированная задержка, второй раунд21 секундаВторой отчёт Ofcom, 2014
Средняя задержка в Великобритании, апрель-май 2014 - октябрь-ноябрь 2014с 5,7 с до 5,1 с (-0,6 с)Третий отчёт Ofcom, май 2015
Средняя задержка в Великобритании по всем четырём раундам5,3 секундыДанные Ofcom через Moores, JoSTrans 33
Задержка без подачи заранее подготовленных субтитров в режиме «как в прямом эфире»7-8 секундДанные Ofcom через Moores, JoSTrans 33

Примечание к контексту: показатели по раундам смешивают медианы и средние в том виде, в каком они были опубликованы, поэтому небольшие различия между раундами (5,6, 5,7, 5,8) не стоит переоценивать. Значение 7-8 секунд для программ без заранее подготовленных и поданных субтитров показывает, насколько британское среднее зависит от сценария, а не от транскрибирования в реальном времени.

За пределами Великобритании задержки больше. Субтитры в испаноязычных новостях США на Telemundo и Univision отставали от речи в среднем на 8,2 секунды при разбросе от 0,7 до 41 секунды, причём 46% субтитров опаздывали более чем на 8 секунд (Fresno, Closed Captions en español, JoSTrans 42, 2024). Исследование 2026 года на фрагментах прямого телеэфира США зафиксировало среднюю задержку 8,46 секунды (СО 3,62) и назвало 7-12 секунд типичным значением для телевизионных субтитров (Thompson et al., arXiv 2609.11408).

ПоказательЗначениеИсточник
Средняя задержка субтитров, испаноязычные новости США8,2 секундыFresno, JoSTrans 42, 2024
Диапазон задержек, та же выборкаот 0,7 до 41 секундыFresno, JoSTrans 42, 2024
Субтитры с задержкой более 8 / 10 / 12 секунд46% / 20% / 8%Fresno, JoSTrans 42, 2024
Субтитров проанализировано в этом исследовании5 349 (20 сегментов по десять минут)Fresno, JoSTrans 42, 2024
Средняя задержка на фрагментах прямого телеэфира США8,46 секунды (СО 3,62)Thompson et al., arXiv 2609.11408, сент. 2026
Типичная задержка телевизионных субтитров США по цитируемым данным7-12 секундThompson et al., arXiv 2609.11408, сент. 2026
Средняя задержка на живых (не телевизионных) мероприятиях с риспикингом5,8 секунды (диапазон 4,3-7,5 с)Moores, JoSTrans 33

2. Нормативные цели: от 3 секунд к 4,5 секунды

Регуляторы согласны, что задержка важна, но почти никто не называет конкретную цифру. Ofcom - единственный крупный регулятор в этом обзоре с числовой целью по задержке, и он сдвинул эту цель в более мягкую сторону: от максимальной задержки в 3 секунды в своём Кодексе по услугам доступности на телевидении к среднему значению не более 4,5 секунды по прямому эфиру поставщика. Во время консультации 2023 года Ofcom заявил, что вещатели назвали максимум в 3 секунды нереалистичным, а 4,5 секунды соответствуют лучшим показателям, которых достигали отдельные вещатели (Рекомендации Ofcom по предоставлению услуг доступности на телевидении и по запросу).

Подход США качественный. FCC приняла стандарты качества субтитров 20 февраля 2014 года, охватывающие точность, синхронность, полноту и размещение, и заявила лишь, что задержку живых субтитров ‘следует сводить к минимуму, совместимому с точной передачей сказанного’ (FCC, стандарты качества субтитров). Канада регулирует точность, а не время: Broadcasting Regulatory Policy 2019-308 от CRTC требует, чтобы англоязычные живые субтитры набирали 98 по модели NER. На практике это означает, что субтитр, опоздавший на 10 секунд, в большинстве стран мира может полностью соответствовать нормам.

ПоказательЗначениеИсточник
Прежняя рекомендация OfcomМаксимальная задержка 3 секундыКодекс Ofcom по услугам доступности на телевидении
Действующая рекомендация OfcomСреднее не более 4,5 секунды по прямому эфируРекомендации Ofcom по предоставлению услуг доступности на ТВ и по запросу
Прежняя рекомендация Ofcom по скорости субтитров: записанные / живые160-180 сл./мин / 200 сл./минКонсультация Ofcom 2023 года, по сообщению Liam O’Dell
Числовой предел задержки FCCОтсутствует (задержка ‘сводится к минимуму’)FCC 14-12, принято 20 февр. 2014
Запрет FCC на субтитрование ENT только с телесуфлёра в прямом эфире4 крупные сети и аффилированные станции на 25 крупнейших рынкахFCC 14-12
Субтитрование FCC новых программ, не подпадающих под исключения100% с 1 января 2006 года47 CFR 79.1
Требование CRTC к точности англоязычных живых субтитровОценка NER 98, с 1 сентября 2019 годаCRTC 2019-308
Обязанность CRTC по мониторингу2 прямые программы в месяц, включая 1 выпуск новостейCRTC 2019-308

Примечание к контексту: австралийский регулятор ACMA в рамках Broadcasting Services (Television Captioning) Standard 2023, действующего с 1 октября 2023 года, тоже не устанавливает числовую задержку и оценивает читаемость, точность и понятность в каждом случае отдельно.

Новейшие правила распространяют обязанности на стриминг, а не ужесточают задержку. CRTC 2026-98 в Канаде требует от онлайн-стримеров субтитрировать 80% каталога к маю 2030 года и 100% к маю 2031 года, с субтитрами на новые оригинальные прямые и записанные программы в течение года (CRTC 2026-98, 25 мая 2026). Проект Tier 1 Accessibility Code от Ofcom, опубликованный 14 мая 2026 года, предлагает квоту субтитрования 80% для крупнейших стримеров через четыре года после публикации (Ofcom, консультация по Tier 1 Accessibility Code).

ПоказательЗначениеИсточник
Субтитрование каталога канадских стримеров80% к маю 2030, 100% к маю 2031CRTC 2026-98
Канадское требование к точности для записанных оригинальных программ у стримеров100%CRTC 2026-98
Квота субтитрования Ofcom для Tier 1, год 4 / год 180% / 20%Проект Tier 1 Accessibility Code от Ofcom, май 2026
Квота субтитрования BBC по запросу, год 490%Проект Tier 1 Accessibility Code от Ofcom, май 2026
Порог Tier 1500 000+ среднемесячных пользователей в ВеликобританииПроект Tier 1 Accessibility Code от Ofcom, май 2026

3. Точность: линия 98% NER и кто её преодолевает

Задержка и точность компенсируют друг друга, поэтому цифры задержки имеют смысл только рядом с цифрами точности. Общая мерка - модель NER, которая оценивает живые субтитры как (слова минус ошибки редактирования и распознавания) к словам. 98% - это ‘приемлемо’, 98,5-98,99% - ‘хорошо’, 99-99,49% - ‘очень хорошо’, а выше 99,5% - ‘отлично’ (Romero-Fresco и Martínez, модель NER, 2015). Порог выглядит мягким, пока не переведёшь его в слова: при 98% два слова из 100 неверны, пропущены или относятся к взвешенным ошибкам.

Британские вещатели в среднем преодолели планку: 98,38% по четырём раундам Ofcom и 98,55% в последнем, на выборке из 78 000 субтитров и 546 000 слов (Moores, JoSTrans 33). Но средние скрывают хвост. В октябре-ноябре 2014 года 77% британских программ достигли 98% или выше против 74% в апреле-мае 2014 года, а новости были самым точным жанром - 98,75% (Ofcom, третий отчёт, 2015). Англоязычные национальные новости США показали лучший результат, в среднем 98,8%, причём 14 из 20 выборок получили оценку приемлемо или выше, тогда как испаноязычные новости упали до 97,04% (Fresno, 2024).

ПоказательЗначениеИсточник
Пороги NER: приемлемо / отлично98% / выше 99,5%Romero-Fresco и Martínez, 2015
Точность британских живых субтитров, среднее по четырём раундам98,38%Данные Ofcom через Moores, JoSTrans 33
Точность британских живых субтитров, последний раунд98,55%Данные Ofcom через Moores, JoSTrans 33
Британские программы с 98% или выше, окт.-нояб. 2014 (против апр.-мая 2014)77% (74%)Третий отчёт Ofcom, 2015
Точность жанра новостей в Великобритании98,75%Третий отчёт Ofcom, 2015
Англоязычные национальные новости США, средний NER98,8% (14 из 20 выборок приемлемо или лучше)Fresno, Universal Access in the Information Society, 2024
Испаноязычные новости США, средний NER97,04% (Telemundo 97,00%, Univision 97,10%)Fresno, JoSTrans 42, 2024
Сокращение текста: испаноязычные против англоязычных новостей26% против 5-6%Fresno, JoSTrans 42, 2024

Примечание к контексту: скорость - скрытая третья переменная. Ofcom рекомендует, чтобы субтитры в среднем шли медленнее 180 слов в минуту, но почти во всех проанализированных им программах были короткие всплески выше 200 сл./мин, и когда эти всплески засчитывали как ошибки, 68% программ оказывались ниже 98% (Ofcom, третий отчёт, 2015). Исследование англоязычных новостей США показало, что почти две трети ошибок были незначительными.

4. Во что задержка обходится зрителям

Аудитория живых субтитров намного шире одного лишь сообщества глухих. Ofcom оценил, что около 7,6 миллиона взрослых в Великобритании пользовались субтитрами, из них лишь 1,4 миллиона имели нарушение слуха (пресс-релиз Ofcom через Wired-Gov, май 2013). Это означает более 6 миллионов пользователей субтитров без нарушения слуха (7,6 миллиона минус 1,4 миллиона), многие из которых смотрят в шумной обстановке или на тихом звуке. Рекомендации Ofcom также приводят данные YouGov о том, что 61% людей 18-24 лет предпочитают включённые субтитры. В мире, по оценке ВОЗ, сегодня 430 миллионов человек нуждаются в реабилитации из-за инвалидизирующей потери слуха, а к 2050 году их число превысит 700 миллионов.

ПоказательЗначениеИсточник
Взрослые в Великобритании, пользовавшиеся субтитрамиОколо 7,6 миллиона (диапазон 7,0-8,1 миллиона)Ofcom, май 2013
Из них с нарушением слухаОколо 1,4 миллиона (диапазон 1,2-1,6 миллиона)Ofcom, май 2013
Британцы 18-24 лет, предпочитающие включённые субтитры61%YouGov, цитируется в рекомендациях Ofcom по услугам доступности
Доля часов программ британских общественных вещателей (PSB) и крупных сервисов по запросу с субтитрами, 202488%Отчёт Ofcom об услугах доступности, янв.-дек. 2024 (опубликован 19 мая 2025)
Субтитрованные часы на обязанных каналах в Великобритании, 2005 против 201340,5% против 81,9%Первый отчёт Ofcom о живых субтитрах, 2014
Люди, нуждающиеся в реабилитации из-за инвалидизирующей потери слуха430 миллионовИнформационный бюллетень ВОЗ, обновлён в марте 2026
Людей с той или иной потерей слуха к 2050 году по прогнозуПочти 2,5 миллиардаИнформационный бюллетень ВОЗ, обновлён в марте 2026

Задержку зрители замечают в первую очередь. В крупнейшем недавнем пользовательском исследовании 216 глухим и слабослышащим зрителям предложили оценить 70 фрагментов прямого телеэфира в четырёх условиях, что дало 4 832 оценки. Одни и те же телевизионные субтитры получили 3,66 из 7 с исходной эфирной задержкой и 5,09 после синхронизации, а это куда больший разброс, чем разница между синхронизированными телевизионными субтитрами и субтитрами ASR (Thompson et al., Are Caption Metrics Broken?, arXiv 2609.11408, сентябрь 2026). Субтитры ASR с задержкой в две секунды держались намного лучше: 4,81 против 5,20 после синхронизации.

То же исследование подрывает представление о том, что оценки точности отражают качество. Порог 98 NER достигли лишь 11 из 70 телевизионных фрагментов и 4 из 70 фрагментов ASR, и всё же зрители оценили синхронизированные субтитры ASR и телевизионные примерно одинаково, а корреляция между метриками и оценками резко упала для результатов ASR (WER r = -0,390 против -0,687 для телевизионных субтитров). Более раннее исследование Gallaudet на CHI 2024 пришло к схожему выводу: участники резко отрицательно относились к эфирным задержкам, а стандартные метрики точности лишь слабо коррелировали с тем, как зрители оценивали субтитры.

ПоказательЗначениеИсточник
Участники / оценки / фрагменты216 / 4 832 / 70Thompson et al., arXiv 2609.11408, 2026
Оценка телевизионных субтитров: исходная задержка против синхронизированных (7-балльная шкала)3,66 против 5,09Thompson et al., 2026
Оценка субтитров ASR: задержка 2 с против синхронизированных4,81 против 5,20Thompson et al., 2026
Средний WER: телевизионные субтитры против субтитров ASR33,8% против 17,2%Thompson et al., 2026
Средний NER: телевизионные субтитры против субтитров ASR95,28 против 94,34Thompson et al., 2026
Фрагменты, достигшие NER 98: ТВ против ASR11 из 70 против 4 из 70Thompson et al., 2026
Корреляция WER с оценками зрителей: ТВ против ASRr = -0,687 против -0,390Thompson et al., 2026

Примечание к контексту: высокий WER телевизионных субтитров отчасти отражает то, что эфирные субтитры перефразируют и сжимают текст, за что WER наказывает, а NER нет. Именно эта разница и служит причиной, по которой авторы утверждают, что нынешние метрики не нейтральны к технологии.

5. Скорость систем ASR: потоковая задержка против человеческого разговора

Задержка самой системы распознавания больше не главный источник задержки субтитров. AssemblyAI сообщила о медианной потоковой задержке 307 мс для Universal-Streaming против 516 мс у Deepgram Nova-3 и о P99 в 1 012 мс против 1 907 мс, измеренных от конца слова в аудио до его первого появления в частичной транскрипции на более чем 205 часах аудио (AssemblyAI, Introducing Universal-Streaming, 2 июня 2025). Собственные данные запуска Deepgram оценили медианный потоковый показатель ошибок по словам у Nova-3 в 6,84% против 14,92% у протестированных конкурентов (Deepgram, Introducing Nova-3, февраль 2025). Оба результата - бенчмарки вендоров, и читать их следует как наилучший случай. Наша статистика преобразования речи в текст охватывает точность большего числа систем.

Открытые модели обменивают дополнительную задержку на устойчивость. Академическая система Whisper-Streaming показала среднюю задержку 3,3 секунды на длинной английской речи из тестового набора ESIC Европейского парламента, и этот компромисс прямо виден в результатах: английский WER 8,5% при задержке 3,27 с и фрагментах по 0,5 с против 8,0% при 5,45 с и фрагментах по 2 с (Machacek, Dabre и Bojar, arXiv 2307.14743, IJCNLP-AACL 2023). Заметьте, что конфигурация Whisper на 5 секунд попадает точно на британское эфирное среднее десятилетней давности.

ПоказательЗначениеИсточник
Медианная / P99 задержка AssemblyAI Universal-Streaming307 мс / 1 012 мсAssemblyAI, июнь 2025
Медианная / P99 задержка Deepgram Nova-3 (тест AssemblyAI)516 мс / 1 907 мсAssemblyAI, июнь 2025
Медианный WER Deepgram Nova-3: потоковый / пакетный6,84% / 5,26%Deepgram, февр. 2025
Бенчмарк-набор Deepgram Nova-32 703 файла, 81,69 часа, 9 предметных областейDeepgram, февр. 2025
Средняя задержка Whisper-Streaming, английский3,3 секундыMachacek et al., 2023
Whisper-Streaming, английский: фрагмент 0,5 с против фрагмента 2,0 сWER 8,5% при 3,27 с против WER 8,0% при 5,45 сMachacek et al., 2023
Задержка Whisper-Streaming, немецкий / чешский (фрагмент 0,5 с)4,11 с / 4,69 сMachacek et al., 2023

Потолок реального времени задаёт человеческий разговор. На 10 языках средний промежуток между вопросом и ответом составил +208 мс при диапазоне от +7 мс в японском до +469 мс в датском (Stivers et al., PNAS 2009). При запуске GPT-4o OpenAI заявила о голосовых ответах всего за 232 мс и в среднем за 320 мс против 2,8 секунды (GPT-3.5) и 5,4 секунды (GPT-4) у прежнего конвейерного голосового режима, в котором друг за другом стояли отдельные модели транскрибирования, языка и речи. Вывод для живых субтитров тот же: каждый дополнительный этап цепочки добавляет секунды, а этап, который раньше доминировал, само распознавание, теперь самый малый.

ПоказательЗначениеИсточник
Средний промежуток между вопросом и ответом, 10 языков+208 мсStivers et al., PNAS 2009 (самые свежие доступные данные)
Среднее для самого быстрого / самого медленного языка+7 мс (японский) / +469 мс (датский)Stivers et al., PNAS 2009
Голосовой ответ GPT-4o: минимум / среднее232 мс / 320 мсOpenAI, май 2024
Средняя задержка конвейерного голосового режима: GPT-3.5 / GPT-42,8 с / 5,4 сOpenAI, май 2024
Задержка субтитров ASR в зрительском исследовании 2026 года2 секунды в среднемThompson et al., arXiv 2609.11408

6. Автоматизация берёт на себя цепочку субтитрования

Человеческие кадры, стоящие за живыми субтитрами, определяются пределами скорости. Американский стандарт реального времени, NCRA Certified Realtime Reporter, требует пятиминутного теста в реальном времени на 200 слов в минуту при 96% точности, а отчёт EBU описывает живое субтитрование как поспевание за говорящими на скорости до 200 сл./мин. Британские риспикеры рассказали исследователям, что базовое обучение занимает 2-3 месяца, а уверенность приходит через 1,5-2 года (Moores, JoSTrans 33). Эти ограничения объясняют, почему автоматическое субтитрование так быстро масштабировалось, как только точность приблизилась к нужной.

Сдвиг объёмов виден в отчётности компаний. Автоматические субтитры LEXI от Ai-Media достигли 79,2 миллиона минут в 2025 финансовом году против менее чем 10 миллионов четырьмя годами ранее, что даёт среднегодовой темп роста (CAGR) за четыре года 69%, и LEXI теперь составляет большую часть использования в её сети iCap (результаты Ai-Media за 2025 финансовый год, объявление для ASX, 28 августа 2025). Технологические продукты дали 63% выручки Ai-Media, тогда как пять лет назад - ноль. Независимое тестирование той же системы показало точность NER 98,56% на английском и 98,26% на испанском, на уровне человеческих субтитров, за исключением разговорного контента с несколькими говорящими (Romero-Fresco и Van Gauwbergen, Fit for What Purpose?, 2025). Подробнее о человеческой стороне профессии - в нашей статистике точности расшифровки в судах.

ПоказательЗначениеИсточник
Стандарт реального времени NCRA CRR200 сл./мин при 96% точности (5-минутный тест)NCRA
Базовое обучение риспикера / время до уверенности2-3 месяца / 1,5-2 годаMoores, JoSTrans 33
Минуты автоматических субтитров LEXI от Ai-Media, 2025 финансовый год79,2 миллионаРезультаты Ai-Media за 2025 финансовый год, ASX
Минуты LEXI четырьмя годами ранееМенее 10 миллионов (CAGR за четыре года 69%)Результаты Ai-Media за 2025 финансовый год, ASX
Доля технологий в выручке Ai-Media63% (общая выручка 64,9 млн USD)Результаты Ai-Media за 2025 финансовый год, ASX
Точность NER автоматических субтитров: английский / испанский98,56% / 98,26%Romero-Fresco и Van Gauwbergen, 2025
Проанализировано живых субтитров при сравнении автоматического и человеческого результата, Великобритания/США/Канада 2018-2022Около 17 000Romero-Fresco и Fresno, Linguistica Antverpiensia 22, 2023

Примечание к контексту: крупнейшее на сегодня сравнение человека и машины (Romero-Fresco и Fresno, Linguistica Antverpiensia, 2023) показало, что неотредактированные автоматические субтитры приближались к 98%, но сохраняли слабые места в пунктуации, именах собственных, числах и определении говорящего. Меньшая задержка системы этого не исправляет: быстро поданное неверное имя остаётся неверным именем.

Итоги: задержка субтитров в реальном времени в цифрах

ПоказательЗначениеИсточник
Средняя задержка британских живых субтитров, конец 2014 года5,1 секундыТретий отчёт Ofcom, 2015
Британские выборки, уложившиеся в рекомендацию 3 с, второй раунд4 из 72Второй отчёт Ofcom, 2014
Самая большая зафиксированная задержка в Великобритании21 секундаВторой отчёт Ofcom, 2014
Действующая рекомендация Ofcom по задержкеСреднее 4,5 секунды или меньшеРекомендации Ofcom по услугам доступности
Числовой предел задержки FCCОтсутствуетFCC 14-12, 2014
Точность англоязычных живых субтитров по CRTCNER 98CRTC 2019-308
Задержка субтитров в испаноязычных новостях США8,2 секунды в среднемFresno, JoSTrans 42, 2024
Субтитры испаноязычных новостей США с задержкой более 10 секунд20%Fresno, JoSTrans 42, 2024
Средняя задержка на фрагментах прямого телеэфира США8,46 секундыThompson et al., arXiv 2609.11408, 2026
Оценка телевизионных субтитров: с задержкой против синхронизированных3,66 против 5,09 из 7Thompson et al., 2026
Точность британских живых субтитров, среднее по четырём раундам98,38%Данные Ofcom через Moores, JoSTrans 33
Точность англоязычных национальных новостей США98,8%Fresno, 2024
Точность автоматических субтитров, английский98,56%Romero-Fresco и Van Gauwbergen, 2025
Взрослые в Великобритании, пользовавшиеся субтитрамиОколо 7,6 миллионаOfcom, 2013
Субтитрованные часы британских PSB и крупных сервисов по запросу, 202488%Отчёт Ofcom об услугах доступности 2024
Медианная потоковая задержка AssemblyAI307 мсAssemblyAI, июнь 2025
Средняя задержка Whisper-Streaming3,3 секундыMachacek et al., 2023
Средний человеческий промежуток при смене реплик208 мсStivers et al., PNAS 2009
Минуты субтитров LEXI от Ai-Media, 2025 финансовый год79,2 миллионаРезультаты Ai-Media за 2025 финансовый год
Субтитрование каталога канадских стримеров к маю 2031 года100%CRTC 2026-98

Методология и источники

Каждая приведённая выше цифра прослежена до регулятора, документа компании или рецензируемой статьи, которые её произвели. Несколько PDF-файлов Ofcom не удалось получить напрямую, поэтому британские цифры взяты из пресс-релизов Ofcom (перепубликованных на Wired-Gov), обзоров регуляторов (EPRA) и рецензируемого анализа набора данных Ofcom (Moores), каждый из которых указан по ходу текста. Бенчмарки вендоров помечены как данные вендоров. Общие рыночные данные и данные об использовании субтитров см. в нашей статистике субтитров и скрытых субтитров.

Последнее обновление: 3 октября 2026 года. Мы обновляем этот обзор ежеквартально, и следующее обновление ожидается, когда Ofcom опубликует итоговое заключение по Tier 1 Accessibility Code и свой Отчёт об услугах доступности за январь-декабрь 2025 года.

Попробуй VoxBooster — 3 дня бесплатно.

Клонирование голоса в реальном времени, саундборд и эффекты — везде, где ты говоришь.

  • Без карты
  • ~30 мс задержки
  • Discord · Teams · OBS
Попробовать 3 дня бесплатно