Napisy na żywo w brytyjskiej telewizji spóźniały się za mową średnio o 5,1 do 5,8 sekundy w rundach pomiarowych Ofcom, a tylko 4 z 72 próbek w drugiej rundzie spełniły dawną wytyczną 3 sekund (Ofcom, raporty o jakości napisów na żywo 2014-2015). Problem nie zniknął: badanie z 2024 roku dotyczące amerykańskich programów informacyjnych w języku hiszpańskim wykazało średnie opóźnienie 8,2 sekundy, a pojedyncze napisy spóźniały się nawet o 41 sekund (Fresno, JoSTrans 2024), natomiast badanie z września 2026 roku zmierzyło średnią 8,46 sekundy na fragmentach amerykańskiej telewizji na żywo. Tymczasem silniki rozpoznawania mowy w trybie strumieniowym raportują dziś medianę opóźnienia słowa blisko 300 milisekund (AssemblyAI, czerwiec 2025), więc wąskie gardło napisów na żywo przesuwa się z pisarza-człowieka na łańcuch nadawczy. Zebraliśmy dane od Ofcom, FCC, CRTC, z recenzowanych badań Gallaudet University i Universidade de Vigo, z prac porównawczych na arXiv, z komunikatów Ai-Media dla giełdy ASX, WHO oraz z innych źródeł pierwotnych wymienionych w metodologii. Szerszy obraz znajdziesz w naszym zestawieniu statystyk napisów na żywo.
TL;DR
- Średnie brytyjskie opóźnienie napisów na żywo spadło z 5,7 do 5,1 sekundy między kwietniem-majem a październikiem-listopadem 2014 roku, wciąż znacznie powyżej wytycznej 3 sekund (Ofcom, trzeci raport o napisach na żywo, 2015).
- Tylko 4 z 72 brytyjskich próbek spełniły wytyczną 3 sekund w drugiej rundzie, a najdłuższe opóźnienie wyniosło 21 sekund (Ofcom, drugi raport, 2014).
- Ofcom wymaga teraz średniego opóźnienia nie większego niż 4,5 sekundy w programach na żywo (Ofcom, wytyczne dotyczące świadczenia telewizyjnych i wideo na żądanie usług dostępności).
- Amerykańskie programy informacyjne po hiszpańsku miały średnio 8,2 sekundy opóźnienia napisów, a 20% napisów pojawiło się z ponad 10-sekundowym spóźnieniem (Fresno, JoSTrans 42, 2024).
- Napisy telewizyjne z oryginalnym opóźnieniem emisji (średnio 8,46 s) oceniono na 3,66/7 wobec 5,09/7 po synchronizacji (Thompson i in., arXiv 2609.11408, 2026).
- Brytyjskie napisy na żywo osiągnęły średnio 98,38% dokładności NER w czterech rundach Ofcom, powyżej progu 98% (dane Ofcom za Moores, JoSTrans 33).
- Amerykańskie krajowe programy informacyjne po angielsku osiągnęły średnio 98,8% dokładności NER (Fresno, Universal Access in the Information Society, 2024).
- Automatyczny system napisów uzyskał 98,56% NER po angielsku i 98,26% po hiszpańsku (Romero-Fresco i Van Gauwbergen, 2025).
- AssemblyAI podała medianę opóźnienia w trybie strumieniowym 307 ms wobec 516 ms dla Deepgram Nova-3 (AssemblyAI, czerwiec 2025).
- Whisper-Streaming osiągnął średnie opóźnienie 3,3 sekundy na długich nagraniach mowy angielskiej (Machacek, Dabre i Bojar, IJCNLP-AACL 2023).
- Ludzie odpowiadają na pytanie średnio po 208 ms w 10 językach (Stivers i in., PNAS 2009), czyli wzorzec, do którego dążą systemy czasu rzeczywistego.
- Automatyczne napisy LEXI firmy Ai-Media osiągnęły 79,2 miliona minut w roku obrotowym 2025, wobec mniej niż 10 milionów cztery lata wcześniej (wyniki Ai-Media za rok obrotowy 2025, ASX).
1. Zmierzone opóźnienie: jak bardzo napisy na żywo spóźniają się za mową
Najpełniejszym publicznym zbiorem danych o opóźnieniu napisów na żywo pozostaje zbiór brytyjski, a opowiada spójną historię: typowy napis na żywo pojawia się ponad 5 sekund po wypowiedzeniu słów. Ofcom badał próbki programów informacyjnych, rozrywkowych i talk-show z BBC, ITV, Channel 4, Channel 5 i Sky w czterech rundach w latach 2013-2015. Pierwszy raport wykazał medianę opóźnienia 5,6 sekundy (podsumowanie EPRA pierwszego raportu Ofcom, kwiecień 2014), a drugi 5,8 sekundy, przy czym tylko 4 z 72 próbek mieściły się w wytycznej 3 sekund (relacja Limping Chicken o drugim raporcie Ofcom, listopad 2014).
Późniejsza poprawa była realna, ale niewielka. Trzeci raport Ofcom odnotował spadek średniego opóźnienia o 0,6 sekundy, z 5,7 do 5,1 sekundy, między kwietniem-majem a październikiem-listopadem 2014 roku (komunikat prasowy Ofcom za Wired-Gov, maj 2015). Skrócenie pięciosekundowego opóźnienia o pół sekundy wymagało od nadawców zmiany procesów pracy, a nie tylko oprogramowania, dlatego wynik się ustabilizował. To najnowsze dostępne pomiary opóźnienia Ofcom (2014-2015); nie opublikowano nowszego zbioru danych dla poszczególnych nadawców.
| Metryka | Wartość | Źródło |
|---|---|---|
| Mediana opóźnienia napisów na żywo w Wielkiej Brytanii, pierwsza runda | 5,6 sekundy | Pierwszy raport Ofcom o napisach na żywo, kwiecień 2014 |
| Opóźnienie w Wielkiej Brytanii, druga runda | 5,8 sekundy | Drugi raport Ofcom, listopad 2014 |
| Próbki spełniające wytyczną 3 sekund, druga runda | 4 z 72 | Drugi raport Ofcom, 2014 |
| Najdłuższe zarejestrowane opóźnienie, druga runda | 21 sekund | Drugi raport Ofcom, 2014 |
| Średnie opóźnienie w Wielkiej Brytanii, od kwietnia-maja 2014 do października-listopada 2014 | od 5,7 s do 5,1 s (-0,6 s) | Trzeci raport Ofcom, maj 2015 |
| Średnie opóźnienie w Wielkiej Brytanii we wszystkich czterech rundach | 5,3 sekundy | Dane Ofcom za Moores, JoSTrans 33 |
| Opóźnienie bez wyzwalania jak na żywo wcześniej przygotowanych napisów | 7-8 sekund | Dane Ofcom za Moores, JoSTrans 33 |
Uwaga kontekstowa: wartości dla poszczególnych rund mieszają mediany i średnie, tak jak je podano, więc niewielkich różnic między rundami (5,6, 5,7, 5,8) nie należy nadinterpretować. Wynik 7-8 sekund dla programów bez wcześniej przygotowanych, wyzwalanych napisów pokazuje, jak bardzo brytyjska średnia zależy od skryptów, a nie od transkrypcji w czasie rzeczywistym.
Poza Wielką Brytanią opóźnienia są dłuższe. Napisy w amerykańskich programach informacyjnych po hiszpańsku, nadawanych przez Telemundo i Univision, spóźniały się za mową średnio o 8,2 sekundy, w zakresie od 0,7 do 41 sekund, a 46% napisów spóźniało się o ponad 8 sekund (Fresno, Closed Captions en espanol, JoSTrans 42, 2024). Badanie z 2026 roku dotyczące fragmentów amerykańskiej telewizji na żywo zmierzyło średnie opóźnienie 8,46 sekundy (SD 3,62) i opisało 7-12 sekund jako typowe dla napisów telewizyjnych (Thompson i in., arXiv 2609.11408).
| Metryka | Wartość | Źródło |
|---|---|---|
| Średnie opóźnienie napisów, amerykańskie programy informacyjne po hiszpańsku | 8,2 sekundy | Fresno, JoSTrans 42, 2024 |
| Zakres opóźnień w tej samej próbie | od 0,7 do 41 sekund | Fresno, JoSTrans 42, 2024 |
| Napisy opóźnione o ponad 8 / 10 / 12 sekund | 46% / 20% / 8% | Fresno, JoSTrans 42, 2024 |
| Napisy przeanalizowane w tym badaniu | 5 349 (20 segmentów po dziesięć minut) | Fresno, JoSTrans 42, 2024 |
| Średnie opóźnienie na fragmentach amerykańskiej telewizji na żywo | 8,46 sekundy (SD 3,62) | Thompson i in., arXiv 2609.11408, wrzesień 2026 |
| Przytaczane typowe opóźnienie napisów w telewizji amerykańskiej | 7-12 sekund | Thompson i in., arXiv 2609.11408, wrzesień 2026 |
| Średnie opóźnienie na wydarzeniach na żywo (nienadawanych) z respeakingiem | 5,8 sekundy (zakres 4,3-7,5 s) | Moores, JoSTrans 33 |
2. Cele regulacyjne: od 3 do 4,5 sekundy
Regulatorzy zgadzają się, że opóźnienie ma znaczenie, ale prawie żaden nie podaje liczby. Ofcom jest jedynym dużym regulatorem w tym zestawieniu z liczbowym celem opóźnienia, i przesunął ten cel w stronę łagodniejszą: z maksymalnego opóźnienia 3 sekund w Kodeksie dotyczącym telewizyjnych usług dostępności do średniej nie większej niż 4,5 sekundy w programach na żywo danego dostawcy. W konsultacjach z 2023 roku Ofcom stwierdził, że nadawcy uznali maksimum 3 sekund za nierealistyczne, a 4,5 sekundy odpowiada najlepszym opóźnieniom, jakie osiągnęli poszczególni nadawcy (wytyczne Ofcom dotyczące świadczenia telewizyjnych i wideo na żądanie usług dostępności).
Podejście amerykańskie ma charakter jakościowy. FCC przyjęła standardy jakości napisów 20 lutego 2014 roku, obejmujące dokładność, synchroniczność, kompletność i rozmieszczenie, i stwierdziła jedynie, że opóźnienie napisów na żywo ‘powinno być ograniczone do minimum, zgodnie z dokładnym oddaniem tego, co jest mówione’ (FCC, standardy jakości napisów). Kanada reguluje dokładność zamiast czasu: Broadcasting Regulatory Policy 2019-308 organu CRTC wymaga, aby napisy na żywo w języku angielskim uzyskiwały 98 w modelu NER. Praktyczny skutek jest taki, że napis spóźniony o 10 sekund może być w większości świata w pełni zgodny z przepisami.
| Metryka | Wartość | Źródło |
|---|---|---|
| Dawna wytyczna Ofcom | Maksymalne opóźnienie 3 sekundy | Kodeks Ofcom dotyczący telewizyjnych usług dostępności |
| Obecna wytyczna Ofcom | Średnia nie większa niż 4,5 sekundy w programach na żywo | Wytyczne Ofcom dotyczące świadczenia telewizyjnych i wideo na żądanie usług dostępności |
| Dawne wytyczne Ofcom co do szybkości napisów: nagrane wcześniej / na żywo | 160-180 wpm / 200 wpm | Konsultacje Ofcom 2023, wg relacji Liama O’Della |
| Liczbowy limit opóźnienia FCC | Brak (opóźnienie ‘ograniczone do minimum’) | FCC 14-12, przyjęte 20 lutego 2014 |
| Zakaz FCC dla napisów ENT opartych wyłącznie na teleprompterze w programach na żywo | 4 główne sieci i ich afiliaci w 25 największych rynkach | FCC 14-12 |
| Napisy FCC dla nowych programów niezwolnionych z obowiązku | 100% od 1 stycznia 2006 | 47 CFR 79.1 |
| Wymóg CRTC dotyczący dokładności napisów na żywo po angielsku | Wynik NER 98, od 1 września 2019 | CRTC 2019-308 |
| Obowiązek monitorowania CRTC | 2 programy na żywo miesięcznie, w tym 1 informacyjny | CRTC 2019-308 |
Uwaga kontekstowa: australijski ACMA, na podstawie Broadcasting Services (Television Captioning) Standard 2023 obowiązującego od 1 października 2023 roku, również nie ustala liczbowego opóźnienia, a czytelność, dokładność i zrozumiałość ocenia indywidualnie dla każdego przypadku.
Najnowsze przepisy rozszerzają obowiązki na streaming, zamiast zaostrzać opóźnienie. Kanadyjska CRTC 2026-98 wymaga od platform streamingowych opatrzenia napisami 80% katalogu do maja 2030 roku i 100% do maja 2031 roku, z napisami do nowych oryginalnych programów na żywo i nagranych w ciągu roku (CRTC 2026-98, 25 maja 2026). Projekt kodeksu dostępności Tier 1 Ofcom, opublikowany 14 maja 2026 roku, proponuje dla największych platform streamingowych kwotę napisów 80% po czterech latach od publikacji (Ofcom, konsultacje kodeksu dostępności Tier 1).
| Metryka | Wartość | Źródło |
|---|---|---|
| Napisy w katalogu kanadyjskich platform streamingowych | 80% do maja 2030, 100% do maja 2031 | CRTC 2026-98 |
| Kanadyjski wymóg dokładności dla nagranych wcześniej oryginalnych programów na platformach streamingowych | 100% | CRTC 2026-98 |
| Kwota napisów Tier 1 Ofcom, rok 4 / rok 1 | 80% / 20% | Projekt kodeksu dostępności Tier 1 Ofcom, maj 2026 |
| Kwota napisów BBC na żądanie, rok 4 | 90% | Projekt kodeksu dostępności Tier 1 Ofcom, maj 2026 |
| Próg Tier 1 | ponad 500 000 średnich miesięcznych użytkowników w Wielkiej Brytanii | Projekt kodeksu dostępności Tier 1 Ofcom, maj 2026 |
3. Dokładność: linia 98% NER i kto ją przekracza
Opóźnienie i dokładność są ze sobą w kompromisie, więc liczby opóźnienia mają sens dopiero obok liczb dokładności. Powszechną miarą jest model NER, który ocenia napisy na żywo jako (słowa minus błędy edycji i rozpoznawania) przez słowa. 98% to ‘akceptowalne’, 98,5-98,99% ‘dobre’, 99-99,49% ‘bardzo dobre’, a powyżej 99,5% ‘doskonałe’ (Romero-Fresco i Martinez, model NER, 2015). Próg wygląda łagodnie, dopóki go nie przeliczysz: przy 98% dwa na każde 100 słów są błędne, brakujące lub stanowią ważone błędy.
Brytyjscy nadawcy średnio przekroczyli ten próg: 98,38% w czterech rundach Ofcom i 98,55% w ostatniej, mierzone na 78 000 napisów i 546 000 słów (Moores, JoSTrans 33). Średnie jednak ukrywają ogon rozkładu. W październiku-listopadzie 2014 roku 77% brytyjskich programów osiągnęło 98% lub więcej, wobec 74% w kwietniu-maju 2014, a najdokładniejszym gatunkiem były wiadomości z wynikiem 98,75% (trzeci raport Ofcom, 2015). Amerykańskie krajowe programy informacyjne w języku angielskim wypadły lepiej, ze średnią 98,8% i 14 z 20 próbek ocenionych jako akceptowalne lub lepsze, podczas gdy programy po hiszpańsku spadły do 97,04% (Fresno, 2024).
| Metryka | Wartość | Źródło |
|---|---|---|
| Progi NER akceptowalny / doskonały | 98% / powyżej 99,5% | Romero-Fresco i Martinez, 2015 |
| Dokładność brytyjskich napisów na żywo, średnia z czterech rund | 98,38% | Dane Ofcom za Moores, JoSTrans 33 |
| Dokładność brytyjskich napisów na żywo, ostatnia runda | 98,55% | Dane Ofcom za Moores, JoSTrans 33 |
| Brytyjskie programy na poziomie 98% lub wyższym, paź-lis 2014 (wobec kwi-maj 2014) | 77% (74%) | Trzeci raport Ofcom, 2015 |
| Dokładność gatunku wiadomości w Wielkiej Brytanii | 98,75% | Trzeci raport Ofcom, 2015 |
| Amerykańskie krajowe programy informacyjne po angielsku, średni NER | 98,8% (14 z 20 próbek akceptowalnych lub lepszych) | Fresno, Universal Access in the Information Society, 2024 |
| Amerykańskie programy informacyjne po hiszpańsku, średni NER | 97,04% (Telemundo 97,00%, Univision 97,10%) | Fresno, JoSTrans 42, 2024 |
| Redukcja tekstu: programy po hiszpańsku wobec angielskich | 26% wobec 5-6% | Fresno, JoSTrans 42, 2024 |
Uwaga kontekstowa: szybkość to ukryta trzecia zmienna. Ofcom zaleca, aby napisy miały średnio mniej niż 180 słów na minutę, jednak niemal wszystkie przeanalizowane przez niego programy zawierały krótkie serie powyżej 200 wpm, a gdy te serie policzono jako błędy, 68% programów spadło poniżej 98% (trzeci raport Ofcom, 2015). Badanie amerykańskich programów informacyjnych po angielsku wykazało, że prawie dwie trzecie błędów miało charakter drobny.
4. Ile opóźnienie kosztuje widzów
Odbiorców napisów na żywo jest znacznie więcej niż samych osób niesłyszących. Ofcom oszacował, że około 7,6 miliona dorosłych Brytyjczyków korzystało z napisów, z czego tylko 1,4 miliona miało uszkodzenie słuchu (komunikat prasowy Ofcom za Wired-Gov, maj 2013). Oznacza to ponad 6 milionów użytkowników napisów bez uszkodzenia słuchu (7,6 miliona minus 1,4 miliona), z których wielu ogląda w hałaśliwych pomieszczeniach lub przy cichym dźwięku. Wytyczne Ofcom przytaczają też dane YouGov, według których 61% osób w wieku 18-24 lata woli mieć napisy włączone. Globalnie WHO szacuje, że 430 milionów osób potrzebuje rehabilitacji z powodu niepełnosprawności wynikającej z utraty słuchu, a do 2050 roku liczba ta wzrośnie do ponad 700 milionów.
| Metryka | Wartość | Źródło |
|---|---|---|
| Dorośli Brytyjczycy, którzy korzystali z napisów | Około 7,6 miliona (zakres 7,0-8,1 miliona) | Ofcom, maj 2013 |
| Z nich z uszkodzeniem słuchu | Około 1,4 miliona (zakres 1,2-1,6 miliona) | Ofcom, maj 2013 |
| Brytyjczycy w wieku 18-24 lata, którzy wolą napisy włączone | 61% | YouGov, cytowane w wytycznych Ofcom dotyczących usług dostępności |
| Udział godzin programów brytyjskich nadawców publicznych i większych serwisów na żądanie z napisami, 2024 | 88% | Raport Ofcom o usługach dostępności, styczeń-grudzień 2024 (opublikowany 19 maja 2025) |
| Godziny z napisami na wymaganych kanałach w Wielkiej Brytanii, 2005 wobec 2013 | 40,5% wobec 81,9% | Pierwszy raport Ofcom o napisach na żywo, 2014 |
| Osoby potrzebujące rehabilitacji z powodu niepełnosprawności wynikającej z utraty słuchu | 430 milionów | Karta informacyjna WHO, zaktualizowana w marcu 2026 |
| Osoby, u których do 2050 roku przewiduje się pewien stopień utraty słuchu | Prawie 2,5 miliarda | Karta informacyjna WHO, zaktualizowana w marcu 2026 |
Opóźnienie to pierwsze, co zauważają widzowie. W największym niedawnym badaniu użytkowników poproszono 216 widzów niesłyszących i słabosłyszących o ocenę 70 fragmentów telewizji na żywo w czterech warunkach, co dało 4 832 oceny. Te same napisy telewizyjne otrzymały 3,66 w skali do 7 z oryginalnym opóźnieniem emisji i 5,09 po synchronizacji, czyli znacznie większą rozpiętość niż różnica między zsynchronizowaną telewizją a napisami ASR (Thompson i in., Are Caption Metrics Broken?, arXiv 2609.11408, wrzesień 2026). Napisy ASR z dwusekundowym opóźnieniem wypadły znacznie lepiej: 4,81 wobec 5,20 po synchronizacji.
To samo badanie podważa przekonanie, że wyniki dokładności oddają jakość. Próg NER 98 osiągnęło tylko 11 z 70 fragmentów telewizyjnych i 4 z 70 fragmentów ASR, a mimo to widzowie ocenili zsynchronizowane napisy ASR i telewizyjne mniej więcej tak samo, a korelacja między metrykami a ocenami wyraźnie spadła dla wyników ASR (WER r = -0,390 wobec -0,687 dla napisów telewizyjnych). Wcześniejsze badanie Gallaudet z CHI 2024 doszło do podobnego wniosku: uczestnicy zdecydowanie nie lubili opóźnień emisji, a standardowe metryki dokładności tylko słabo korelowały z tym, jak widzowie oceniali napisy.
| Metryka | Wartość | Źródło |
|---|---|---|
| Uczestnicy / oceny / fragmenty | 216 / 4 832 / 70 | Thompson i in., arXiv 2609.11408, 2026 |
| Ocena napisów telewizyjnych: oryginalne opóźnienie wobec zsynchronizowanych (skala 7-stopniowa) | 3,66 wobec 5,09 | Thompson i in., 2026 |
| Ocena napisów ASR: opóźnienie 2 s wobec zsynchronizowanych | 4,81 wobec 5,20 | Thompson i in., 2026 |
| Średni WER: napisy telewizyjne wobec napisów ASR | 33,8% wobec 17,2% | Thompson i in., 2026 |
| Średni NER: napisy telewizyjne wobec napisów ASR | 95,28 wobec 94,34 | Thompson i in., 2026 |
| Fragmenty spełniające NER 98: telewizja wobec ASR | 11 z 70 wobec 4 z 70 | Thompson i in., 2026 |
| Korelacja WER z ocenami widzów: telewizja wobec ASR | r = -0,687 wobec -0,390 | Thompson i in., 2026 |
Uwaga kontekstowa: wysoki WER napisów telewizyjnych częściowo wynika z tego, że napisy nadawcze parafrazują i skracają, co WER karze, a NER nie. Ta luka jest dokładnie powodem, dla którego autorzy twierdzą, że obecne metryki nie są neutralne technologicznie.
5. Szybkość silników ASR: opóźnienie w trybie strumieniowym a ludzka rozmowa
Opóźnienie silnika nie jest już głównym źródłem opóźnienia napisów. AssemblyAI podała medianę opóźnienia w trybie strumieniowym 307 ms dla Universal-Streaming wobec 516 ms dla Deepgram Nova-3 oraz P99 1 012 ms wobec 1 907 ms, mierzone od końca słowa w nagraniu do jego pierwszego pojawienia się w częściowej transkrypcji w ponad 205 godzinach nagrań (AssemblyAI, Introducing Universal-Streaming, 2 czerwca 2025). Własne dane premierowe Deepgram podały medianę współczynnika błędów słów Nova-3 w trybie strumieniowym na poziomie 6,84%, wobec 14,92% dla testowanych konkurentów (Deepgram, Introducing Nova-3, luty 2025). Oba wyniki to testy dostawców i należy je czytać jako przypadek najlepszy. Nasze statystyki zamiany mowy na tekst obejmują dokładność większej liczby silników.
Otwarte modele wymieniają większe opóźnienie na stabilność. Akademicki system Whisper-Streaming osiągnął średnie opóźnienie 3,3 sekundy na długich nagraniach mowy angielskiej ze zbioru testowego ESIC z Parlamentu Europejskiego, a kompromis jest w jego wynikach jawny: WER dla angielskiego 8,5% przy opóźnieniu 3,27 s z fragmentami 0,5 s wobec 8,0% przy 5,45 s z fragmentami 2 s (Machacek, Dabre i Bojar, arXiv 2307.14743, IJCNLP-AACL 2023). Warto zauważyć, że konfiguracja Whisper z opóźnieniem 5 sekund ląduje dokładnie na brytyjskiej średniej telewizyjnej sprzed dekady.
| Metryka | Wartość | Źródło |
|---|---|---|
| AssemblyAI Universal-Streaming, mediana / P99 opóźnienia | 307 ms / 1 012 ms | AssemblyAI, czerwiec 2025 |
| Deepgram Nova-3, mediana / P99 opóźnienia (test AssemblyAI) | 516 ms / 1 907 ms | AssemblyAI, czerwiec 2025 |
| Mediana WER Deepgram Nova-3: strumieniowo / wsadowo | 6,84% / 5,26% | Deepgram, luty 2025 |
| Zbiór testowy Deepgram Nova-3 | 2 703 pliki, 81,69 godziny, 9 domen | Deepgram, luty 2025 |
| Średnie opóźnienie Whisper-Streaming, angielski | 3,3 sekundy | Machacek i in., 2023 |
| Whisper-Streaming, angielski: fragment 0,5 s wobec fragmentu 2,0 s | WER 8,5% przy 3,27 s wobec WER 8,0% przy 5,45 s | Machacek i in., 2023 |
| Opóźnienie Whisper-Streaming, niemiecki / czeski (fragment 0,5 s) | 4,11 s / 4,69 s | Machacek i in., 2023 |
Pułap czasu rzeczywistego wyznacza ludzka rozmowa. W 10 językach średnia przerwa między pytaniem a odpowiedzią wyniosła +208 ms, w zakresie od +7 ms w japońskim do +469 ms w duńskim (Stivers i in., PNAS 2009). Premiera GPT-4o firmy OpenAI zapowiadała odpowiedzi głosowe w zaledwie 232 ms i średnio 320 ms, wobec 2,8 sekundy (GPT-3.5) i 5,4 sekundy (GPT-4) dla wcześniejszego potokowego trybu głosowego, który łączył osobne modele transkrypcji, języka i mowy. Wniosek dla napisów na żywo jest ten sam: każdy dodatkowy etap w łańcuchu dodaje sekundy, a etap, który kiedyś dominował, czyli samo rozpoznawanie, jest dziś najmniejszy.
| Metryka | Wartość | Źródło |
|---|---|---|
| Średnia przerwa między pytaniem a odpowiedzią, 10 języków | +208 ms | Stivers i in., PNAS 2009 (najnowsze dostępne dane) |
| Średnia dla najszybszego / najwolniejszego języka | +7 ms (japoński) / +469 ms (duński) | Stivers i in., PNAS 2009 |
| Odpowiedź głosowa GPT-4o: minimum / średnia | 232 ms / 320 ms | OpenAI, maj 2024 |
| Średnie opóźnienie potokowego trybu głosowego: GPT-3.5 / GPT-4 | 2,8 s / 5,4 s | OpenAI, maj 2024 |
| Opóźnienie napisów ASR użyte w badaniu widzów z 2026 roku | średnio 2 sekundy | Thompson i in., arXiv 2609.11408 |
6. Automatyzacja przejmuje łańcuch napisów
Ludzką siłę roboczą stojącą za napisami na żywo określają limity szybkości. Amerykański wzorzec pracy w czasie rzeczywistym, NCRA Certified Realtime Reporter, wymaga pięciominutowego testu w czasie rzeczywistym przy 200 słowach na minutę i 96% dokładności, a raport EBU opisuje napisy na żywo jako nadążanie za mówcami do 200 wpm. Brytyjscy respeakerzy powiedzieli badaczom, że podstawowe szkolenie trwa 2-3 miesiące, a pewność siebie przychodzi po 1,5-2 latach (Moores, JoSTrans 33). Te ograniczenia sprawiły, że automatyczne napisy tak szybko się upowszechniły, gdy dokładność się zbliżyła.
Przesunięcie wolumenu widać w dokumentach spółek. Automatyczne napisy LEXI firmy Ai-Media osiągnęły 79,2 miliona minut w roku obrotowym 2025, wobec mniej niż 10 milionów cztery lata wcześniej, co daje czteroletnią średnioroczną stopę wzrostu (CAGR) 69%, a LEXI odpowiada teraz za większość użycia w jej sieci iCap (wyniki Ai-Media za rok obrotowy 2025, komunikat ASX, 28 sierpnia 2025). Produkty technologiczne stanowiły 63% przychodów Ai-Media, wobec zera pięć lat wcześniej. Niezależne testy tego samego systemu wykazały dokładność NER 98,56% po angielsku i 98,26% po hiszpańsku, na poziomie napisów tworzonych przez ludzi, z wyjątkiem treści potocznych z wieloma mówcami (Romero-Fresco i Van Gauwbergen, Fit for What Purpose?, 2025). Więcej o ludzkiej stronie zawodu znajdziesz w naszych statystykach dokładności transkrypcji w sądach.
| Metryka | Wartość | Źródło |
|---|---|---|
| Standard czasu rzeczywistego NCRA CRR | 200 wpm przy 96% dokładności (test 5-minutowy) | NCRA |
| Podstawowe szkolenie respeakera / czas do uzyskania pewności | 2-3 miesiące / 1,5-2 lata | Moores, JoSTrans 33 |
| Minuty automatycznych napisów LEXI Ai-Media, rok obrotowy 2025 | 79,2 miliona | Wyniki Ai-Media za rok obrotowy 2025, ASX |
| Minuty LEXI cztery lata wcześniej | Mniej niż 10 milionów (CAGR czteroletni 69%) | Wyniki Ai-Media za rok obrotowy 2025, ASX |
| Udział technologii w przychodach Ai-Media | 63% (przychody ogółem 64,9 miliona USD) | Wyniki Ai-Media za rok obrotowy 2025, ASX |
| Dokładność NER automatycznych napisów: angielski / hiszpański | 98,56% / 98,26% | Romero-Fresco i Van Gauwbergen, 2025 |
| Napisy na żywo przeanalizowane w porównaniu wyników automatycznych i ludzkich, Wielka Brytania/USA/Kanada 2018-2022 | Około 17 000 | Romero-Fresco i Fresno, Linguistica Antverpiensia 22, 2023 |
Uwaga kontekstowa: największe dotąd porównanie człowieka z maszyną (Romero-Fresco i Fresno, Linguistica Antverpiensia, 2023) wykazało, że nieredagowane napisy automatyczne zbliżały się do 98%, z trwałymi słabościami w interpunkcji, nazwach własnych, liczbach i identyfikacji mówców. Niższe opóźnienie silnika tego nie naprawia: szybkie błędne nazwisko nadal jest błędnym nazwiskiem.
Podsumowanie: opóźnienie napisów na żywo w czasie rzeczywistym w liczbach
| Metryka | Wartość | Źródło |
|---|---|---|
| Średnie opóźnienie brytyjskich napisów na żywo, koniec 2014 | 5,1 sekundy | Trzeci raport Ofcom, 2015 |
| Brytyjskie próbki spełniające wytyczną 3 s, druga runda | 4 z 72 | Drugi raport Ofcom, 2014 |
| Najdłuższe zarejestrowane opóźnienie w Wielkiej Brytanii | 21 sekund | Drugi raport Ofcom, 2014 |
| Obecna wytyczna Ofcom dotycząca opóźnienia | Średnia 4,5 sekundy lub mniej | Wytyczne Ofcom dotyczące usług dostępności |
| Liczbowy limit opóźnienia FCC | Brak | FCC 14-12, 2014 |
| Dokładność napisów na żywo po angielsku wg CRTC | NER 98 | CRTC 2019-308 |
| Opóźnienie napisów w amerykańskich programach informacyjnych po hiszpańsku | średnio 8,2 sekundy | Fresno, JoSTrans 42, 2024 |
| Napisy w amerykańskich programach informacyjnych po hiszpańsku spóźnione o ponad 10 sekund | 20% | Fresno, JoSTrans 42, 2024 |
| Średnie opóźnienie na fragmentach amerykańskiej telewizji na żywo | 8,46 sekundy | Thompson i in., arXiv 2609.11408, 2026 |
| Ocena napisów telewizyjnych: opóźnione wobec zsynchronizowanych | 3,66 wobec 5,09 w skali do 7 | Thompson i in., 2026 |
| Dokładność brytyjskich napisów na żywo, średnia z czterech rund | 98,38% | Dane Ofcom za Moores, JoSTrans 33 |
| Dokładność amerykańskich krajowych programów informacyjnych po angielsku | 98,8% | Fresno, 2024 |
| Dokładność automatycznych napisów, angielski | 98,56% | Romero-Fresco i Van Gauwbergen, 2025 |
| Dorośli Brytyjczycy, którzy korzystali z napisów | Około 7,6 miliona | Ofcom, 2013 |
| Godziny brytyjskich nadawców publicznych i większych serwisów na żądanie z napisami, 2024 | 88% | Raport Ofcom o usługach dostępności 2024 |
| Mediana opóźnienia AssemblyAI w trybie strumieniowym | 307 ms | AssemblyAI, czerwiec 2025 |
| Średnie opóźnienie Whisper-Streaming | 3,3 sekundy | Machacek i in., 2023 |
| Średnia ludzka przerwa przy zmianie mówcy | 208 ms | Stivers i in., PNAS 2009 |
| Minuty napisów LEXI Ai-Media, rok obrotowy 2025 | 79,2 miliona | Wyniki Ai-Media za rok obrotowy 2025 |
| Napisy w katalogu kanadyjskich platform streamingowych do maja 2031 | 100% | CRTC 2026-98 |
Metodologia i źródła
Każdą powyższą liczbę prześledzono do regulatora, dokumentu finansowego lub recenzowanej pracy, która ją wytworzyła. Kilku plików PDF Ofcom nie udało się pobrać bezpośrednio, więc dane brytyjskie pochodzą z komunikatów prasowych Ofcom (opublikowanych ponownie na Wired-Gov), podsumowań regulatorów (EPRA) oraz recenzowanej analizy zbioru danych Ofcom (Moores), każde wskazane w tekście. Testy dostawców są oznaczone jako dane dostawców. Ogólne dane o rynku i użyciu napisów znajdziesz w naszych statystykach napisów i napisów zamkniętych.
- Ofcom: komunikat prasowy o trzecim raporcie o napisach na żywo (Wired-Gov, maj 2015), komunikat prasowy o konsultacjach dotyczących napisów na żywo (Wired-Gov, maj 2013), wytyczne dotyczące świadczenia telewizyjnych i wideo na żądanie usług dostępności, raport o usługach dostępności, styczeń-grudzień 2024, konsultacje kodeksu dostępności Tier 1 (maj 2026)
- EPRA: podsumowanie pierwszego raportu Ofcom o napisach na żywo (kwiecień 2014)
- Limping Chicken: relacja o drugim raporcie Ofcom o napisach na żywo (listopad 2014)
- Liam O’Dell: relacja o konsultacjach Ofcom dotyczących kodeksu dostępności z 2023 roku oraz konsultacjach kodeksu Tier 1
- FCC: standardy jakości napisów, FCC 14-12 (2014) oraz 47 CFR 79.1
- CRTC: Broadcasting Regulatory Policy 2019-308 oraz Broadcasting Regulatory Policy 2026-98
- ACMA / rząd Australii: Broadcasting Services (Television Captioning) Standard 2023
- EBU: raport o usługach dostępności i napisach na żywo (i044) oraz Tech 3370, EBU-TT Part 3 Live Subtitling
- Thompson, Kushalnagar, Vogler i in.: Are Caption Metrics Broken?, arXiv 2609.11408 (wrzesień 2026); Glasser, Kushalnagar i Vogler: How Users Experience Closed Captions on Live Television, CHI 2024
- Fresno: Closed Captions en espanol, JoSTrans 42 (2024) oraz dokładność napisów na żywo w programach informacyjnych w języku angielskim w USA (2024)
- Moores: napisy na żywo na wydarzeniach na żywo, JoSTrans 33 (zawiera analizę zbioru danych Ofcom)
- Romero-Fresco i Fresno: dokładność automatycznych i ludzkich napisów na żywo w języku angielskim (2023); Romero-Fresco i Van Gauwbergen: Fit for What Purpose? (2025); Romero-Fresco i Martinez: model NER (2015)
- Machacek, Dabre i Bojar: Turning Whisper into Real-Time Transcription System (2023)
- AssemblyAI: Introducing Universal-Streaming (czerwiec 2025); Deepgram: Introducing Nova-3 (luty 2025)
- OpenAI: Hello GPT-4o (maj 2024)
- Stivers i in.: Universals and cultural variation in turn-taking in conversation, PNAS (2009)
- Ai-Media: wyniki za rok obrotowy 2025, komunikat ASX (sierpień 2025)
- NCRA: Certified Realtime Reporter
- WHO: karta informacyjna o głuchocie i utracie słuchu (zaktualizowana w marcu 2026)
- Uwaga o danych: pomiary opóźnienia Ofcom dla poszczególnych nadawców (2013-2015) są starsze niż trzy lata i pozostają najnowszym dostępnym publicznym zbiorem danych tego rodzaju; rundy raportują mieszankę median i średnich (5,6, 5,8, 5,7 do 5,1 oraz średnia z czterech rund 5,3 za Moores), więc należy je traktować jako zakres, a nie linię trendu. Szacunek Ofcom dotyczący użytkowników napisów (7,6 miliona) pochodzi z 2013 roku, a dane Stiversa o zmianie mówcy z 2009 roku. Dane AssemblyAI i Deepgram to testy dostawców; porównanie AssemblyAI mierzyło konkurenta na własnym zbiorze testowym, a niezależne testy Nova-3 podają wyższy WER niż liczba Deepgram. Praca Thompson i in. z 2026 roku to preprint na arXiv, jeszcze niezrecenzowany. Dane o przychodach Ai-Media przedstawiono tak, jak podano je w jej komunikacie ASX. Dwie niezależne oceny tego samego systemu automatycznego podają różną nagłówkową dokładność w zależności od trudności treści, a badanie widzów z 2026 roku wykazało znacznie niższe odsetki zaliczenia NER na fragmentach telewizji na żywo, więc dokładność automatyczna silnie zależy od gatunku. Kodeks Ofcom Tier 1 to projekt, którego konsultacje zamknięto 7 sierpnia 2026 roku, a oczekiwane jest stanowisko końcowe.
Ostatnia aktualizacja: 3 października 2026 roku. Aktualizujemy to zestawienie kwartalnie, a kolejnej aktualizacji można się spodziewać, gdy Ofcom opublikuje końcowe stanowisko w sprawie kodeksu dostępności Tier 1 oraz swój raport o usługach dostępności za okres styczeń-grudzień 2025.