Живые субтитры на британском телевидении отставали от речи в среднем на 5,1-5,8 секунды в измерительных раундах Ofcom, и лишь 4 из 72 выборок второго раунда укладывались в прежнюю рекомендацию в 3 секунды (Ofcom, отчёты о качестве живых субтитров 2014-2015). Проблема не исчезла: исследование 2024 года об испаноязычных новостях США зафиксировало среднюю задержку 8,2 секунды, причём отдельные субтитры опаздывали на целых 41 секунду (Fresno, JoSTrans 2024), а исследование сентября 2026 года показало среднее значение 8,46 секунды на фрагментах прямого телеэфира США. Тем временем потоковые системы распознавания речи сегодня заявляют медианную задержку на слово около 300 миллисекунд (AssemblyAI, июнь 2025), так что узкое место живых субтитров смещается от человека-наборщика к эфирной цепочке. Мы свели данные Ofcom, FCC, CRTC, рецензируемых исследований Gallaudet University и Universidade de Vigo, бенчмарк-статей на arXiv, документов Ai-Media для ASX, ВОЗ и других первичных источников, перечисленных в методологии. Более общую картину см. в нашем обзоре статистики живых субтитров.
Кратко (TL;DR)
- Средняя задержка британских живых субтитров снизилась с 5,7 до 5,1 секунды между апрелем-маем и октябрём-ноябрём 2014 года, всё ещё заметно выше рекомендации в 3 секунды (Ofcom, третий отчёт о живых субтитрах, 2015).
- Лишь 4 из 72 британских выборок уложились в рекомендацию в 3 секунды во втором раунде, а самая большая задержка достигла 21 секунды (Ofcom, второй отчёт, 2014).
- Ofcom теперь требует среднюю задержку не более 4,5 секунды по всему прямому эфиру (Ofcom, Рекомендации по предоставлению услуг доступности на телевидении и по запросу).
- Испаноязычные новости США показали среднюю задержку субтитров 8,2 секунды, а 20% субтитров опоздали более чем на 10 секунд (Fresno, JoSTrans 42, 2024).
- Телевизионные субтитры с исходной эфирной задержкой (среднее 8,46 с) получили 3,66/7 против 5,09/7 после синхронизации (Thompson et al., arXiv 2609.11408, 2026).
- Британские живые субтитры в среднем показали 98,38% точности NER за четыре раунда Ofcom, выше порога 98% (данные Ofcom через Moores, JoSTrans 33).
- Англоязычные национальные новости США в среднем показали 98,8% точности NER (Fresno, Universal Access in the Information Society, 2024).
- Автоматическая система субтитрования набрала 98,56% NER на английском и 98,26% на испанском (Romero-Fresco и Van Gauwbergen, 2025).
- AssemblyAI сообщила о медианной потоковой задержке 307 мс против 516 мс у Deepgram Nova-3 (AssemblyAI, июнь 2025).
- Whisper-Streaming показала среднюю задержку 3,3 секунды на длинной английской речи (Machacek, Dabre и Bojar, IJCNLP-AACL 2023).
- Люди отвечают на вопрос в среднем за 208 мс на 10 языках (Stivers et al., PNAS 2009), и именно к этому ориентиру стремятся системы реального времени.
- Автоматические субтитры LEXI от Ai-Media достигли 79,2 миллиона минут в 2025 финансовом году против менее чем 10 миллионов четырьмя годами ранее (результаты Ai-Media за 2025 финансовый год, ASX).
1. Измеренная задержка: насколько живые субтитры отстают от речи
Самым полным публичным набором данных о задержке живых субтитров по-прежнему остаётся британский, и он рассказывает последовательную историю: типичный живой субтитр появляется более чем через 5 секунд после произнесения слов. Ofcom отобрал выпуски новостей, развлекательные и ток-шоу BBC, ITV, Channel 4, Channel 5 и Sky в четырёх раундах между 2013 и 2015 годами. Первый отчёт выявил медианную задержку 5,6 секунды (обзор EPRA первого отчёта Ofcom, апрель 2014), а второй - 5,8 секунды, причём лишь 4 из 72 выборок уложились в рекомендацию в 3 секунды (материал Limping Chicken о втором отчёте Ofcom, ноябрь 2014).
Последовавшее улучшение было реальным, но небольшим. Третий отчёт Ofcom зафиксировал снижение средней задержки на 0,6 секунды, с 5,7 до 5,1 секунды, между апрелем-маем и октябрём-ноябрём 2014 года (пресс-релиз Ofcom через Wired-Gov, май 2015). Чтобы убрать полсекунды из пятисекундной задержки, вещателям пришлось менять рабочие процессы, а не только программы, поэтому показатель и застопорился. Это самые свежие доступные измерения задержки Ofcom (2014-2015); более новых наборов данных по вещателям не публиковалось.
| Показатель | Значение | Источник |
|---|---|---|
| Медианная задержка британских живых субтитров, первый раунд | 5,6 секунды | Первый отчёт Ofcom о живых субтитрах, апрель 2014 |
| Задержка в Великобритании, второй раунд | 5,8 секунды | Второй отчёт Ofcom, ноябрь 2014 |
| Выборки, уложившиеся в рекомендацию в 3 секунды, второй раунд | 4 из 72 | Второй отчёт Ofcom, 2014 |
| Самая большая зафиксированная задержка, второй раунд | 21 секунда | Второй отчёт Ofcom, 2014 |
| Средняя задержка в Великобритании, апрель-май 2014 - октябрь-ноябрь 2014 | с 5,7 с до 5,1 с (-0,6 с) | Третий отчёт Ofcom, май 2015 |
| Средняя задержка в Великобритании по всем четырём раундам | 5,3 секунды | Данные Ofcom через Moores, JoSTrans 33 |
| Задержка без подачи заранее подготовленных субтитров в режиме «как в прямом эфире» | 7-8 секунд | Данные Ofcom через Moores, JoSTrans 33 |
Примечание к контексту: показатели по раундам смешивают медианы и средние в том виде, в каком они были опубликованы, поэтому небольшие различия между раундами (5,6, 5,7, 5,8) не стоит переоценивать. Значение 7-8 секунд для программ без заранее подготовленных и поданных субтитров показывает, насколько британское среднее зависит от сценария, а не от транскрибирования в реальном времени.
За пределами Великобритании задержки больше. Субтитры в испаноязычных новостях США на Telemundo и Univision отставали от речи в среднем на 8,2 секунды при разбросе от 0,7 до 41 секунды, причём 46% субтитров опаздывали более чем на 8 секунд (Fresno, Closed Captions en español, JoSTrans 42, 2024). Исследование 2026 года на фрагментах прямого телеэфира США зафиксировало среднюю задержку 8,46 секунды (СО 3,62) и назвало 7-12 секунд типичным значением для телевизионных субтитров (Thompson et al., arXiv 2609.11408).
| Показатель | Значение | Источник |
|---|---|---|
| Средняя задержка субтитров, испаноязычные новости США | 8,2 секунды | Fresno, JoSTrans 42, 2024 |
| Диапазон задержек, та же выборка | от 0,7 до 41 секунды | Fresno, JoSTrans 42, 2024 |
| Субтитры с задержкой более 8 / 10 / 12 секунд | 46% / 20% / 8% | Fresno, JoSTrans 42, 2024 |
| Субтитров проанализировано в этом исследовании | 5 349 (20 сегментов по десять минут) | Fresno, JoSTrans 42, 2024 |
| Средняя задержка на фрагментах прямого телеэфира США | 8,46 секунды (СО 3,62) | Thompson et al., arXiv 2609.11408, сент. 2026 |
| Типичная задержка телевизионных субтитров США по цитируемым данным | 7-12 секунд | Thompson et al., arXiv 2609.11408, сент. 2026 |
| Средняя задержка на живых (не телевизионных) мероприятиях с риспикингом | 5,8 секунды (диапазон 4,3-7,5 с) | Moores, JoSTrans 33 |
2. Нормативные цели: от 3 секунд к 4,5 секунды
Регуляторы согласны, что задержка важна, но почти никто не называет конкретную цифру. Ofcom - единственный крупный регулятор в этом обзоре с числовой целью по задержке, и он сдвинул эту цель в более мягкую сторону: от максимальной задержки в 3 секунды в своём Кодексе по услугам доступности на телевидении к среднему значению не более 4,5 секунды по прямому эфиру поставщика. Во время консультации 2023 года Ofcom заявил, что вещатели назвали максимум в 3 секунды нереалистичным, а 4,5 секунды соответствуют лучшим показателям, которых достигали отдельные вещатели (Рекомендации Ofcom по предоставлению услуг доступности на телевидении и по запросу).
Подход США качественный. FCC приняла стандарты качества субтитров 20 февраля 2014 года, охватывающие точность, синхронность, полноту и размещение, и заявила лишь, что задержку живых субтитров ‘следует сводить к минимуму, совместимому с точной передачей сказанного’ (FCC, стандарты качества субтитров). Канада регулирует точность, а не время: Broadcasting Regulatory Policy 2019-308 от CRTC требует, чтобы англоязычные живые субтитры набирали 98 по модели NER. На практике это означает, что субтитр, опоздавший на 10 секунд, в большинстве стран мира может полностью соответствовать нормам.
| Показатель | Значение | Источник |
|---|---|---|
| Прежняя рекомендация Ofcom | Максимальная задержка 3 секунды | Кодекс Ofcom по услугам доступности на телевидении |
| Действующая рекомендация Ofcom | Среднее не более 4,5 секунды по прямому эфиру | Рекомендации Ofcom по предоставлению услуг доступности на ТВ и по запросу |
| Прежняя рекомендация Ofcom по скорости субтитров: записанные / живые | 160-180 сл./мин / 200 сл./мин | Консультация Ofcom 2023 года, по сообщению Liam O’Dell |
| Числовой предел задержки FCC | Отсутствует (задержка ‘сводится к минимуму’) | FCC 14-12, принято 20 февр. 2014 |
| Запрет FCC на субтитрование ENT только с телесуфлёра в прямом эфире | 4 крупные сети и аффилированные станции на 25 крупнейших рынках | FCC 14-12 |
| Субтитрование FCC новых программ, не подпадающих под исключения | 100% с 1 января 2006 года | 47 CFR 79.1 |
| Требование CRTC к точности англоязычных живых субтитров | Оценка NER 98, с 1 сентября 2019 года | CRTC 2019-308 |
| Обязанность CRTC по мониторингу | 2 прямые программы в месяц, включая 1 выпуск новостей | CRTC 2019-308 |
Примечание к контексту: австралийский регулятор ACMA в рамках Broadcasting Services (Television Captioning) Standard 2023, действующего с 1 октября 2023 года, тоже не устанавливает числовую задержку и оценивает читаемость, точность и понятность в каждом случае отдельно.
Новейшие правила распространяют обязанности на стриминг, а не ужесточают задержку. CRTC 2026-98 в Канаде требует от онлайн-стримеров субтитрировать 80% каталога к маю 2030 года и 100% к маю 2031 года, с субтитрами на новые оригинальные прямые и записанные программы в течение года (CRTC 2026-98, 25 мая 2026). Проект Tier 1 Accessibility Code от Ofcom, опубликованный 14 мая 2026 года, предлагает квоту субтитрования 80% для крупнейших стримеров через четыре года после публикации (Ofcom, консультация по Tier 1 Accessibility Code).
| Показатель | Значение | Источник |
|---|---|---|
| Субтитрование каталога канадских стримеров | 80% к маю 2030, 100% к маю 2031 | CRTC 2026-98 |
| Канадское требование к точности для записанных оригинальных программ у стримеров | 100% | CRTC 2026-98 |
| Квота субтитрования Ofcom для Tier 1, год 4 / год 1 | 80% / 20% | Проект Tier 1 Accessibility Code от Ofcom, май 2026 |
| Квота субтитрования BBC по запросу, год 4 | 90% | Проект Tier 1 Accessibility Code от Ofcom, май 2026 |
| Порог Tier 1 | 500 000+ среднемесячных пользователей в Великобритании | Проект Tier 1 Accessibility Code от Ofcom, май 2026 |
3. Точность: линия 98% NER и кто её преодолевает
Задержка и точность компенсируют друг друга, поэтому цифры задержки имеют смысл только рядом с цифрами точности. Общая мерка - модель NER, которая оценивает живые субтитры как (слова минус ошибки редактирования и распознавания) к словам. 98% - это ‘приемлемо’, 98,5-98,99% - ‘хорошо’, 99-99,49% - ‘очень хорошо’, а выше 99,5% - ‘отлично’ (Romero-Fresco и Martínez, модель NER, 2015). Порог выглядит мягким, пока не переведёшь его в слова: при 98% два слова из 100 неверны, пропущены или относятся к взвешенным ошибкам.
Британские вещатели в среднем преодолели планку: 98,38% по четырём раундам Ofcom и 98,55% в последнем, на выборке из 78 000 субтитров и 546 000 слов (Moores, JoSTrans 33). Но средние скрывают хвост. В октябре-ноябре 2014 года 77% британских программ достигли 98% или выше против 74% в апреле-мае 2014 года, а новости были самым точным жанром - 98,75% (Ofcom, третий отчёт, 2015). Англоязычные национальные новости США показали лучший результат, в среднем 98,8%, причём 14 из 20 выборок получили оценку приемлемо или выше, тогда как испаноязычные новости упали до 97,04% (Fresno, 2024).
| Показатель | Значение | Источник |
|---|---|---|
| Пороги NER: приемлемо / отлично | 98% / выше 99,5% | Romero-Fresco и Martínez, 2015 |
| Точность британских живых субтитров, среднее по четырём раундам | 98,38% | Данные Ofcom через Moores, JoSTrans 33 |
| Точность британских живых субтитров, последний раунд | 98,55% | Данные Ofcom через Moores, JoSTrans 33 |
| Британские программы с 98% или выше, окт.-нояб. 2014 (против апр.-мая 2014) | 77% (74%) | Третий отчёт Ofcom, 2015 |
| Точность жанра новостей в Великобритании | 98,75% | Третий отчёт Ofcom, 2015 |
| Англоязычные национальные новости США, средний NER | 98,8% (14 из 20 выборок приемлемо или лучше) | Fresno, Universal Access in the Information Society, 2024 |
| Испаноязычные новости США, средний NER | 97,04% (Telemundo 97,00%, Univision 97,10%) | Fresno, JoSTrans 42, 2024 |
| Сокращение текста: испаноязычные против англоязычных новостей | 26% против 5-6% | Fresno, JoSTrans 42, 2024 |
Примечание к контексту: скорость - скрытая третья переменная. Ofcom рекомендует, чтобы субтитры в среднем шли медленнее 180 слов в минуту, но почти во всех проанализированных им программах были короткие всплески выше 200 сл./мин, и когда эти всплески засчитывали как ошибки, 68% программ оказывались ниже 98% (Ofcom, третий отчёт, 2015). Исследование англоязычных новостей США показало, что почти две трети ошибок были незначительными.
4. Во что задержка обходится зрителям
Аудитория живых субтитров намного шире одного лишь сообщества глухих. Ofcom оценил, что около 7,6 миллиона взрослых в Великобритании пользовались субтитрами, из них лишь 1,4 миллиона имели нарушение слуха (пресс-релиз Ofcom через Wired-Gov, май 2013). Это означает более 6 миллионов пользователей субтитров без нарушения слуха (7,6 миллиона минус 1,4 миллиона), многие из которых смотрят в шумной обстановке или на тихом звуке. Рекомендации Ofcom также приводят данные YouGov о том, что 61% людей 18-24 лет предпочитают включённые субтитры. В мире, по оценке ВОЗ, сегодня 430 миллионов человек нуждаются в реабилитации из-за инвалидизирующей потери слуха, а к 2050 году их число превысит 700 миллионов.
| Показатель | Значение | Источник |
|---|---|---|
| Взрослые в Великобритании, пользовавшиеся субтитрами | Около 7,6 миллиона (диапазон 7,0-8,1 миллиона) | Ofcom, май 2013 |
| Из них с нарушением слуха | Около 1,4 миллиона (диапазон 1,2-1,6 миллиона) | Ofcom, май 2013 |
| Британцы 18-24 лет, предпочитающие включённые субтитры | 61% | YouGov, цитируется в рекомендациях Ofcom по услугам доступности |
| Доля часов программ британских общественных вещателей (PSB) и крупных сервисов по запросу с субтитрами, 2024 | 88% | Отчёт Ofcom об услугах доступности, янв.-дек. 2024 (опубликован 19 мая 2025) |
| Субтитрованные часы на обязанных каналах в Великобритании, 2005 против 2013 | 40,5% против 81,9% | Первый отчёт Ofcom о живых субтитрах, 2014 |
| Люди, нуждающиеся в реабилитации из-за инвалидизирующей потери слуха | 430 миллионов | Информационный бюллетень ВОЗ, обновлён в марте 2026 |
| Людей с той или иной потерей слуха к 2050 году по прогнозу | Почти 2,5 миллиарда | Информационный бюллетень ВОЗ, обновлён в марте 2026 |
Задержку зрители замечают в первую очередь. В крупнейшем недавнем пользовательском исследовании 216 глухим и слабослышащим зрителям предложили оценить 70 фрагментов прямого телеэфира в четырёх условиях, что дало 4 832 оценки. Одни и те же телевизионные субтитры получили 3,66 из 7 с исходной эфирной задержкой и 5,09 после синхронизации, а это куда больший разброс, чем разница между синхронизированными телевизионными субтитрами и субтитрами ASR (Thompson et al., Are Caption Metrics Broken?, arXiv 2609.11408, сентябрь 2026). Субтитры ASR с задержкой в две секунды держались намного лучше: 4,81 против 5,20 после синхронизации.
То же исследование подрывает представление о том, что оценки точности отражают качество. Порог 98 NER достигли лишь 11 из 70 телевизионных фрагментов и 4 из 70 фрагментов ASR, и всё же зрители оценили синхронизированные субтитры ASR и телевизионные примерно одинаково, а корреляция между метриками и оценками резко упала для результатов ASR (WER r = -0,390 против -0,687 для телевизионных субтитров). Более раннее исследование Gallaudet на CHI 2024 пришло к схожему выводу: участники резко отрицательно относились к эфирным задержкам, а стандартные метрики точности лишь слабо коррелировали с тем, как зрители оценивали субтитры.
| Показатель | Значение | Источник |
|---|---|---|
| Участники / оценки / фрагменты | 216 / 4 832 / 70 | Thompson et al., arXiv 2609.11408, 2026 |
| Оценка телевизионных субтитров: исходная задержка против синхронизированных (7-балльная шкала) | 3,66 против 5,09 | Thompson et al., 2026 |
| Оценка субтитров ASR: задержка 2 с против синхронизированных | 4,81 против 5,20 | Thompson et al., 2026 |
| Средний WER: телевизионные субтитры против субтитров ASR | 33,8% против 17,2% | Thompson et al., 2026 |
| Средний NER: телевизионные субтитры против субтитров ASR | 95,28 против 94,34 | Thompson et al., 2026 |
| Фрагменты, достигшие NER 98: ТВ против ASR | 11 из 70 против 4 из 70 | Thompson et al., 2026 |
| Корреляция WER с оценками зрителей: ТВ против ASR | r = -0,687 против -0,390 | Thompson et al., 2026 |
Примечание к контексту: высокий WER телевизионных субтитров отчасти отражает то, что эфирные субтитры перефразируют и сжимают текст, за что WER наказывает, а NER нет. Именно эта разница и служит причиной, по которой авторы утверждают, что нынешние метрики не нейтральны к технологии.
5. Скорость систем ASR: потоковая задержка против человеческого разговора
Задержка самой системы распознавания больше не главный источник задержки субтитров. AssemblyAI сообщила о медианной потоковой задержке 307 мс для Universal-Streaming против 516 мс у Deepgram Nova-3 и о P99 в 1 012 мс против 1 907 мс, измеренных от конца слова в аудио до его первого появления в частичной транскрипции на более чем 205 часах аудио (AssemblyAI, Introducing Universal-Streaming, 2 июня 2025). Собственные данные запуска Deepgram оценили медианный потоковый показатель ошибок по словам у Nova-3 в 6,84% против 14,92% у протестированных конкурентов (Deepgram, Introducing Nova-3, февраль 2025). Оба результата - бенчмарки вендоров, и читать их следует как наилучший случай. Наша статистика преобразования речи в текст охватывает точность большего числа систем.
Открытые модели обменивают дополнительную задержку на устойчивость. Академическая система Whisper-Streaming показала среднюю задержку 3,3 секунды на длинной английской речи из тестового набора ESIC Европейского парламента, и этот компромисс прямо виден в результатах: английский WER 8,5% при задержке 3,27 с и фрагментах по 0,5 с против 8,0% при 5,45 с и фрагментах по 2 с (Machacek, Dabre и Bojar, arXiv 2307.14743, IJCNLP-AACL 2023). Заметьте, что конфигурация Whisper на 5 секунд попадает точно на британское эфирное среднее десятилетней давности.
| Показатель | Значение | Источник |
|---|---|---|
| Медианная / P99 задержка AssemblyAI Universal-Streaming | 307 мс / 1 012 мс | AssemblyAI, июнь 2025 |
| Медианная / P99 задержка Deepgram Nova-3 (тест AssemblyAI) | 516 мс / 1 907 мс | AssemblyAI, июнь 2025 |
| Медианный WER Deepgram Nova-3: потоковый / пакетный | 6,84% / 5,26% | Deepgram, февр. 2025 |
| Бенчмарк-набор Deepgram Nova-3 | 2 703 файла, 81,69 часа, 9 предметных областей | Deepgram, февр. 2025 |
| Средняя задержка Whisper-Streaming, английский | 3,3 секунды | Machacek et al., 2023 |
| Whisper-Streaming, английский: фрагмент 0,5 с против фрагмента 2,0 с | WER 8,5% при 3,27 с против WER 8,0% при 5,45 с | Machacek et al., 2023 |
| Задержка Whisper-Streaming, немецкий / чешский (фрагмент 0,5 с) | 4,11 с / 4,69 с | Machacek et al., 2023 |
Потолок реального времени задаёт человеческий разговор. На 10 языках средний промежуток между вопросом и ответом составил +208 мс при диапазоне от +7 мс в японском до +469 мс в датском (Stivers et al., PNAS 2009). При запуске GPT-4o OpenAI заявила о голосовых ответах всего за 232 мс и в среднем за 320 мс против 2,8 секунды (GPT-3.5) и 5,4 секунды (GPT-4) у прежнего конвейерного голосового режима, в котором друг за другом стояли отдельные модели транскрибирования, языка и речи. Вывод для живых субтитров тот же: каждый дополнительный этап цепочки добавляет секунды, а этап, который раньше доминировал, само распознавание, теперь самый малый.
| Показатель | Значение | Источник |
|---|---|---|
| Средний промежуток между вопросом и ответом, 10 языков | +208 мс | Stivers et al., PNAS 2009 (самые свежие доступные данные) |
| Среднее для самого быстрого / самого медленного языка | +7 мс (японский) / +469 мс (датский) | Stivers et al., PNAS 2009 |
| Голосовой ответ GPT-4o: минимум / среднее | 232 мс / 320 мс | OpenAI, май 2024 |
| Средняя задержка конвейерного голосового режима: GPT-3.5 / GPT-4 | 2,8 с / 5,4 с | OpenAI, май 2024 |
| Задержка субтитров ASR в зрительском исследовании 2026 года | 2 секунды в среднем | Thompson et al., arXiv 2609.11408 |
6. Автоматизация берёт на себя цепочку субтитрования
Человеческие кадры, стоящие за живыми субтитрами, определяются пределами скорости. Американский стандарт реального времени, NCRA Certified Realtime Reporter, требует пятиминутного теста в реальном времени на 200 слов в минуту при 96% точности, а отчёт EBU описывает живое субтитрование как поспевание за говорящими на скорости до 200 сл./мин. Британские риспикеры рассказали исследователям, что базовое обучение занимает 2-3 месяца, а уверенность приходит через 1,5-2 года (Moores, JoSTrans 33). Эти ограничения объясняют, почему автоматическое субтитрование так быстро масштабировалось, как только точность приблизилась к нужной.
Сдвиг объёмов виден в отчётности компаний. Автоматические субтитры LEXI от Ai-Media достигли 79,2 миллиона минут в 2025 финансовом году против менее чем 10 миллионов четырьмя годами ранее, что даёт среднегодовой темп роста (CAGR) за четыре года 69%, и LEXI теперь составляет большую часть использования в её сети iCap (результаты Ai-Media за 2025 финансовый год, объявление для ASX, 28 августа 2025). Технологические продукты дали 63% выручки Ai-Media, тогда как пять лет назад - ноль. Независимое тестирование той же системы показало точность NER 98,56% на английском и 98,26% на испанском, на уровне человеческих субтитров, за исключением разговорного контента с несколькими говорящими (Romero-Fresco и Van Gauwbergen, Fit for What Purpose?, 2025). Подробнее о человеческой стороне профессии - в нашей статистике точности расшифровки в судах.
| Показатель | Значение | Источник |
|---|---|---|
| Стандарт реального времени NCRA CRR | 200 сл./мин при 96% точности (5-минутный тест) | NCRA |
| Базовое обучение риспикера / время до уверенности | 2-3 месяца / 1,5-2 года | Moores, JoSTrans 33 |
| Минуты автоматических субтитров LEXI от Ai-Media, 2025 финансовый год | 79,2 миллиона | Результаты Ai-Media за 2025 финансовый год, ASX |
| Минуты LEXI четырьмя годами ранее | Менее 10 миллионов (CAGR за четыре года 69%) | Результаты Ai-Media за 2025 финансовый год, ASX |
| Доля технологий в выручке Ai-Media | 63% (общая выручка 64,9 млн USD) | Результаты Ai-Media за 2025 финансовый год, ASX |
| Точность NER автоматических субтитров: английский / испанский | 98,56% / 98,26% | Romero-Fresco и Van Gauwbergen, 2025 |
| Проанализировано живых субтитров при сравнении автоматического и человеческого результата, Великобритания/США/Канада 2018-2022 | Около 17 000 | Romero-Fresco и Fresno, Linguistica Antverpiensia 22, 2023 |
Примечание к контексту: крупнейшее на сегодня сравнение человека и машины (Romero-Fresco и Fresno, Linguistica Antverpiensia, 2023) показало, что неотредактированные автоматические субтитры приближались к 98%, но сохраняли слабые места в пунктуации, именах собственных, числах и определении говорящего. Меньшая задержка системы этого не исправляет: быстро поданное неверное имя остаётся неверным именем.
Итоги: задержка субтитров в реальном времени в цифрах
| Показатель | Значение | Источник |
|---|---|---|
| Средняя задержка британских живых субтитров, конец 2014 года | 5,1 секунды | Третий отчёт Ofcom, 2015 |
| Британские выборки, уложившиеся в рекомендацию 3 с, второй раунд | 4 из 72 | Второй отчёт Ofcom, 2014 |
| Самая большая зафиксированная задержка в Великобритании | 21 секунда | Второй отчёт Ofcom, 2014 |
| Действующая рекомендация Ofcom по задержке | Среднее 4,5 секунды или меньше | Рекомендации Ofcom по услугам доступности |
| Числовой предел задержки FCC | Отсутствует | FCC 14-12, 2014 |
| Точность англоязычных живых субтитров по CRTC | NER 98 | CRTC 2019-308 |
| Задержка субтитров в испаноязычных новостях США | 8,2 секунды в среднем | Fresno, JoSTrans 42, 2024 |
| Субтитры испаноязычных новостей США с задержкой более 10 секунд | 20% | Fresno, JoSTrans 42, 2024 |
| Средняя задержка на фрагментах прямого телеэфира США | 8,46 секунды | Thompson et al., arXiv 2609.11408, 2026 |
| Оценка телевизионных субтитров: с задержкой против синхронизированных | 3,66 против 5,09 из 7 | Thompson et al., 2026 |
| Точность британских живых субтитров, среднее по четырём раундам | 98,38% | Данные Ofcom через Moores, JoSTrans 33 |
| Точность англоязычных национальных новостей США | 98,8% | Fresno, 2024 |
| Точность автоматических субтитров, английский | 98,56% | Romero-Fresco и Van Gauwbergen, 2025 |
| Взрослые в Великобритании, пользовавшиеся субтитрами | Около 7,6 миллиона | Ofcom, 2013 |
| Субтитрованные часы британских PSB и крупных сервисов по запросу, 2024 | 88% | Отчёт Ofcom об услугах доступности 2024 |
| Медианная потоковая задержка AssemblyAI | 307 мс | AssemblyAI, июнь 2025 |
| Средняя задержка Whisper-Streaming | 3,3 секунды | Machacek et al., 2023 |
| Средний человеческий промежуток при смене реплик | 208 мс | Stivers et al., PNAS 2009 |
| Минуты субтитров LEXI от Ai-Media, 2025 финансовый год | 79,2 миллиона | Результаты Ai-Media за 2025 финансовый год |
| Субтитрование каталога канадских стримеров к маю 2031 года | 100% | CRTC 2026-98 |
Методология и источники
Каждая приведённая выше цифра прослежена до регулятора, документа компании или рецензируемой статьи, которые её произвели. Несколько PDF-файлов Ofcom не удалось получить напрямую, поэтому британские цифры взяты из пресс-релизов Ofcom (перепубликованных на Wired-Gov), обзоров регуляторов (EPRA) и рецензируемого анализа набора данных Ofcom (Moores), каждый из которых указан по ходу текста. Бенчмарки вендоров помечены как данные вендоров. Общие рыночные данные и данные об использовании субтитров см. в нашей статистике субтитров и скрытых субтитров.
- Ofcom: пресс-релиз о третьем отчёте по живым субтитрам (Wired-Gov, май 2015), пресс-релиз о консультации по живым субтитрам (Wired-Gov, май 2013), Рекомендации по предоставлению услуг доступности на телевидении и по запросу, Отчёт об услугах доступности, янв.-дек. 2024, консультация по Tier 1 Accessibility Code (май 2026)
- EPRA: обзор первого отчёта Ofcom по живым субтитрам (апрель 2014)
- Limping Chicken: материал о втором отчёте Ofcom по живым субтитрам (ноябрь 2014)
- Liam O’Dell: материал о консультации Ofcom по кодексу доступности 2023 года и консультация по кодексу Tier 1
- FCC: стандарты качества субтитров, FCC 14-12 (2014) и 47 CFR 79.1
- CRTC: Broadcasting Regulatory Policy 2019-308 и Broadcasting Regulatory Policy 2026-98
- ACMA / Правительство Австралии: Broadcasting Services (Television Captioning) Standard 2023
- EBU: отчёт об услугах доступности и живом субтитровании (i044) и Tech 3370, EBU-TT, часть 3, живое субтитрование
- Thompson, Kushalnagar, Vogler et al.: Are Caption Metrics Broken?, arXiv 2609.11408 (сентябрь 2026); Glasser, Kushalnagar и Vogler: How Users Experience Closed Captions on Live Television, CHI 2024
- Fresno: Closed Captions en español, JoSTrans 42 (2024) и Live captioning accuracy in English-language newscasts in the USA (2024)
- Moores: живое субтитрование на прямых мероприятиях, JoSTrans 33 (включает анализ набора данных Ofcom)
- Romero-Fresco и Fresno: The accuracy of automatic and human live captions in English (2023); Romero-Fresco и Van Gauwbergen: Fit for What Purpose? (2025); Romero-Fresco и Martínez: модель NER (2015)
- Machacek, Dabre и Bojar: Turning Whisper into Real-Time Transcription System (2023)
- AssemblyAI: Introducing Universal-Streaming (июнь 2025); Deepgram: Introducing Nova-3 (февраль 2025)
- OpenAI: Hello GPT-4o (май 2024)
- Stivers et al.: Universals and cultural variation in turn-taking in conversation, PNAS (2009)
- Ai-Media: результаты за 2025 финансовый год, объявление для ASX (август 2025)
- NCRA: Certified Realtime Reporter
- ВОЗ: информационный бюллетень о глухоте и потере слуха (обновлён в марте 2026)
- Наблюдение по данным: измерения задержки Ofcom по вещателям (2013-2015) старше трёх лет и остаются самым свежим доступным публичным набором данных такого рода; раунды сообщают смесь медиан и средних (5,6, 5,8, 5,7 до 5,1 и среднее по четырём раундам 5,3 через Moores), поэтому их следует рассматривать как диапазон, а не как линию тренда. Оценка Ofcom числа пользователей субтитров (7,6 миллиона) относится к 2013 году, а данные Stivers о смене реплик - к 2009 году. Цифры AssemblyAI и Deepgram - бенчмарки вендоров; в сравнении AssemblyAI конкурент измерялся на её собственном тестовом наборе, а независимые тесты Nova-3 показывают более высокий WER, чем цифра Deepgram. Статья Thompson et al. 2026 года - препринт на arXiv, ещё не прошедший рецензирование. Данные о выручке Ai-Media приведены так, как они указаны в её объявлении для ASX. Две независимые оценки одной и той же автоматической системы дают разные итоговые показатели точности в зависимости от сложности контента, а зрительское исследование 2026 года выявило намного более низкую долю прохождения порога NER на фрагментах прямого телеэфира, поэтому точность автоматических субтитров сильно зависит от жанра. Кодекс Tier 1 от Ofcom - это проект, консультация по которому закрылась 7 августа 2026 года, и ожидается итоговое заключение.
Последнее обновление: 3 октября 2026 года. Мы обновляем этот обзор ежеквартально, и следующее обновление ожидается, когда Ofcom опубликует итоговое заключение по Tier 1 Accessibility Code и свой Отчёт об услугах доступности за январь-декабрь 2025 года.