Statystyki opóźnienia napisów na żywo w czasie rzeczywistym (2026): ponad 60 punktów danych o opóźnieniu, dokładności i szybkości ASR

Statystyki opóźnienia napisów na żywo 2026: brytyjskie napisy na żywo spóźniały się o 5,1 do 5,8 s, Ofcom celuje teraz w 4,5 s, a amerykańskie wiadomości po hiszpańsku miały 8,2 s.

Napisy na żywo w brytyjskiej telewizji spóźniały się za mową średnio o 5,1 do 5,8 sekundy w rundach pomiarowych Ofcom, a tylko 4 z 72 próbek w drugiej rundzie spełniły dawną wytyczną 3 sekund (Ofcom, raporty o jakości napisów na żywo 2014-2015). Problem nie zniknął: badanie z 2024 roku dotyczące amerykańskich programów informacyjnych w języku hiszpańskim wykazało średnie opóźnienie 8,2 sekundy, a pojedyncze napisy spóźniały się nawet o 41 sekund (Fresno, JoSTrans 2024), natomiast badanie z września 2026 roku zmierzyło średnią 8,46 sekundy na fragmentach amerykańskiej telewizji na żywo. Tymczasem silniki rozpoznawania mowy w trybie strumieniowym raportują dziś medianę opóźnienia słowa blisko 300 milisekund (AssemblyAI, czerwiec 2025), więc wąskie gardło napisów na żywo przesuwa się z pisarza-człowieka na łańcuch nadawczy. Zebraliśmy dane od Ofcom, FCC, CRTC, z recenzowanych badań Gallaudet University i Universidade de Vigo, z prac porównawczych na arXiv, z komunikatów Ai-Media dla giełdy ASX, WHO oraz z innych źródeł pierwotnych wymienionych w metodologii. Szerszy obraz znajdziesz w naszym zestawieniu statystyk napisów na żywo.

TL;DR

  • Średnie brytyjskie opóźnienie napisów na żywo spadło z 5,7 do 5,1 sekundy między kwietniem-majem a październikiem-listopadem 2014 roku, wciąż znacznie powyżej wytycznej 3 sekund (Ofcom, trzeci raport o napisach na żywo, 2015).
  • Tylko 4 z 72 brytyjskich próbek spełniły wytyczną 3 sekund w drugiej rundzie, a najdłuższe opóźnienie wyniosło 21 sekund (Ofcom, drugi raport, 2014).
  • Ofcom wymaga teraz średniego opóźnienia nie większego niż 4,5 sekundy w programach na żywo (Ofcom, wytyczne dotyczące świadczenia telewizyjnych i wideo na żądanie usług dostępności).
  • Amerykańskie programy informacyjne po hiszpańsku miały średnio 8,2 sekundy opóźnienia napisów, a 20% napisów pojawiło się z ponad 10-sekundowym spóźnieniem (Fresno, JoSTrans 42, 2024).
  • Napisy telewizyjne z oryginalnym opóźnieniem emisji (średnio 8,46 s) oceniono na 3,66/7 wobec 5,09/7 po synchronizacji (Thompson i in., arXiv 2609.11408, 2026).
  • Brytyjskie napisy na żywo osiągnęły średnio 98,38% dokładności NER w czterech rundach Ofcom, powyżej progu 98% (dane Ofcom za Moores, JoSTrans 33).
  • Amerykańskie krajowe programy informacyjne po angielsku osiągnęły średnio 98,8% dokładności NER (Fresno, Universal Access in the Information Society, 2024).
  • Automatyczny system napisów uzyskał 98,56% NER po angielsku i 98,26% po hiszpańsku (Romero-Fresco i Van Gauwbergen, 2025).
  • AssemblyAI podała medianę opóźnienia w trybie strumieniowym 307 ms wobec 516 ms dla Deepgram Nova-3 (AssemblyAI, czerwiec 2025).
  • Whisper-Streaming osiągnął średnie opóźnienie 3,3 sekundy na długich nagraniach mowy angielskiej (Machacek, Dabre i Bojar, IJCNLP-AACL 2023).
  • Ludzie odpowiadają na pytanie średnio po 208 ms w 10 językach (Stivers i in., PNAS 2009), czyli wzorzec, do którego dążą systemy czasu rzeczywistego.
  • Automatyczne napisy LEXI firmy Ai-Media osiągnęły 79,2 miliona minut w roku obrotowym 2025, wobec mniej niż 10 milionów cztery lata wcześniej (wyniki Ai-Media za rok obrotowy 2025, ASX).

1. Zmierzone opóźnienie: jak bardzo napisy na żywo spóźniają się za mową

Najpełniejszym publicznym zbiorem danych o opóźnieniu napisów na żywo pozostaje zbiór brytyjski, a opowiada spójną historię: typowy napis na żywo pojawia się ponad 5 sekund po wypowiedzeniu słów. Ofcom badał próbki programów informacyjnych, rozrywkowych i talk-show z BBC, ITV, Channel 4, Channel 5 i Sky w czterech rundach w latach 2013-2015. Pierwszy raport wykazał medianę opóźnienia 5,6 sekundy (podsumowanie EPRA pierwszego raportu Ofcom, kwiecień 2014), a drugi 5,8 sekundy, przy czym tylko 4 z 72 próbek mieściły się w wytycznej 3 sekund (relacja Limping Chicken o drugim raporcie Ofcom, listopad 2014).

Późniejsza poprawa była realna, ale niewielka. Trzeci raport Ofcom odnotował spadek średniego opóźnienia o 0,6 sekundy, z 5,7 do 5,1 sekundy, między kwietniem-majem a październikiem-listopadem 2014 roku (komunikat prasowy Ofcom za Wired-Gov, maj 2015). Skrócenie pięciosekundowego opóźnienia o pół sekundy wymagało od nadawców zmiany procesów pracy, a nie tylko oprogramowania, dlatego wynik się ustabilizował. To najnowsze dostępne pomiary opóźnienia Ofcom (2014-2015); nie opublikowano nowszego zbioru danych dla poszczególnych nadawców.

MetrykaWartośćŹródło
Mediana opóźnienia napisów na żywo w Wielkiej Brytanii, pierwsza runda5,6 sekundyPierwszy raport Ofcom o napisach na żywo, kwiecień 2014
Opóźnienie w Wielkiej Brytanii, druga runda5,8 sekundyDrugi raport Ofcom, listopad 2014
Próbki spełniające wytyczną 3 sekund, druga runda4 z 72Drugi raport Ofcom, 2014
Najdłuższe zarejestrowane opóźnienie, druga runda21 sekundDrugi raport Ofcom, 2014
Średnie opóźnienie w Wielkiej Brytanii, od kwietnia-maja 2014 do października-listopada 2014od 5,7 s do 5,1 s (-0,6 s)Trzeci raport Ofcom, maj 2015
Średnie opóźnienie w Wielkiej Brytanii we wszystkich czterech rundach5,3 sekundyDane Ofcom za Moores, JoSTrans 33
Opóźnienie bez wyzwalania jak na żywo wcześniej przygotowanych napisów7-8 sekundDane Ofcom za Moores, JoSTrans 33

Uwaga kontekstowa: wartości dla poszczególnych rund mieszają mediany i średnie, tak jak je podano, więc niewielkich różnic między rundami (5,6, 5,7, 5,8) nie należy nadinterpretować. Wynik 7-8 sekund dla programów bez wcześniej przygotowanych, wyzwalanych napisów pokazuje, jak bardzo brytyjska średnia zależy od skryptów, a nie od transkrypcji w czasie rzeczywistym.

Poza Wielką Brytanią opóźnienia są dłuższe. Napisy w amerykańskich programach informacyjnych po hiszpańsku, nadawanych przez Telemundo i Univision, spóźniały się za mową średnio o 8,2 sekundy, w zakresie od 0,7 do 41 sekund, a 46% napisów spóźniało się o ponad 8 sekund (Fresno, Closed Captions en espanol, JoSTrans 42, 2024). Badanie z 2026 roku dotyczące fragmentów amerykańskiej telewizji na żywo zmierzyło średnie opóźnienie 8,46 sekundy (SD 3,62) i opisało 7-12 sekund jako typowe dla napisów telewizyjnych (Thompson i in., arXiv 2609.11408).

MetrykaWartośćŹródło
Średnie opóźnienie napisów, amerykańskie programy informacyjne po hiszpańsku8,2 sekundyFresno, JoSTrans 42, 2024
Zakres opóźnień w tej samej próbieod 0,7 do 41 sekundFresno, JoSTrans 42, 2024
Napisy opóźnione o ponad 8 / 10 / 12 sekund46% / 20% / 8%Fresno, JoSTrans 42, 2024
Napisy przeanalizowane w tym badaniu5 349 (20 segmentów po dziesięć minut)Fresno, JoSTrans 42, 2024
Średnie opóźnienie na fragmentach amerykańskiej telewizji na żywo8,46 sekundy (SD 3,62)Thompson i in., arXiv 2609.11408, wrzesień 2026
Przytaczane typowe opóźnienie napisów w telewizji amerykańskiej7-12 sekundThompson i in., arXiv 2609.11408, wrzesień 2026
Średnie opóźnienie na wydarzeniach na żywo (nienadawanych) z respeakingiem5,8 sekundy (zakres 4,3-7,5 s)Moores, JoSTrans 33

2. Cele regulacyjne: od 3 do 4,5 sekundy

Regulatorzy zgadzają się, że opóźnienie ma znaczenie, ale prawie żaden nie podaje liczby. Ofcom jest jedynym dużym regulatorem w tym zestawieniu z liczbowym celem opóźnienia, i przesunął ten cel w stronę łagodniejszą: z maksymalnego opóźnienia 3 sekund w Kodeksie dotyczącym telewizyjnych usług dostępności do średniej nie większej niż 4,5 sekundy w programach na żywo danego dostawcy. W konsultacjach z 2023 roku Ofcom stwierdził, że nadawcy uznali maksimum 3 sekund za nierealistyczne, a 4,5 sekundy odpowiada najlepszym opóźnieniom, jakie osiągnęli poszczególni nadawcy (wytyczne Ofcom dotyczące świadczenia telewizyjnych i wideo na żądanie usług dostępności).

Podejście amerykańskie ma charakter jakościowy. FCC przyjęła standardy jakości napisów 20 lutego 2014 roku, obejmujące dokładność, synchroniczność, kompletność i rozmieszczenie, i stwierdziła jedynie, że opóźnienie napisów na żywo ‘powinno być ograniczone do minimum, zgodnie z dokładnym oddaniem tego, co jest mówione’ (FCC, standardy jakości napisów). Kanada reguluje dokładność zamiast czasu: Broadcasting Regulatory Policy 2019-308 organu CRTC wymaga, aby napisy na żywo w języku angielskim uzyskiwały 98 w modelu NER. Praktyczny skutek jest taki, że napis spóźniony o 10 sekund może być w większości świata w pełni zgodny z przepisami.

MetrykaWartośćŹródło
Dawna wytyczna OfcomMaksymalne opóźnienie 3 sekundyKodeks Ofcom dotyczący telewizyjnych usług dostępności
Obecna wytyczna OfcomŚrednia nie większa niż 4,5 sekundy w programach na żywoWytyczne Ofcom dotyczące świadczenia telewizyjnych i wideo na żądanie usług dostępności
Dawne wytyczne Ofcom co do szybkości napisów: nagrane wcześniej / na żywo160-180 wpm / 200 wpmKonsultacje Ofcom 2023, wg relacji Liama O’Della
Liczbowy limit opóźnienia FCCBrak (opóźnienie ‘ograniczone do minimum’)FCC 14-12, przyjęte 20 lutego 2014
Zakaz FCC dla napisów ENT opartych wyłącznie na teleprompterze w programach na żywo4 główne sieci i ich afiliaci w 25 największych rynkachFCC 14-12
Napisy FCC dla nowych programów niezwolnionych z obowiązku100% od 1 stycznia 200647 CFR 79.1
Wymóg CRTC dotyczący dokładności napisów na żywo po angielskuWynik NER 98, od 1 września 2019CRTC 2019-308
Obowiązek monitorowania CRTC2 programy na żywo miesięcznie, w tym 1 informacyjnyCRTC 2019-308

Uwaga kontekstowa: australijski ACMA, na podstawie Broadcasting Services (Television Captioning) Standard 2023 obowiązującego od 1 października 2023 roku, również nie ustala liczbowego opóźnienia, a czytelność, dokładność i zrozumiałość ocenia indywidualnie dla każdego przypadku.

Najnowsze przepisy rozszerzają obowiązki na streaming, zamiast zaostrzać opóźnienie. Kanadyjska CRTC 2026-98 wymaga od platform streamingowych opatrzenia napisami 80% katalogu do maja 2030 roku i 100% do maja 2031 roku, z napisami do nowych oryginalnych programów na żywo i nagranych w ciągu roku (CRTC 2026-98, 25 maja 2026). Projekt kodeksu dostępności Tier 1 Ofcom, opublikowany 14 maja 2026 roku, proponuje dla największych platform streamingowych kwotę napisów 80% po czterech latach od publikacji (Ofcom, konsultacje kodeksu dostępności Tier 1).

MetrykaWartośćŹródło
Napisy w katalogu kanadyjskich platform streamingowych80% do maja 2030, 100% do maja 2031CRTC 2026-98
Kanadyjski wymóg dokładności dla nagranych wcześniej oryginalnych programów na platformach streamingowych100%CRTC 2026-98
Kwota napisów Tier 1 Ofcom, rok 4 / rok 180% / 20%Projekt kodeksu dostępności Tier 1 Ofcom, maj 2026
Kwota napisów BBC na żądanie, rok 490%Projekt kodeksu dostępności Tier 1 Ofcom, maj 2026
Próg Tier 1ponad 500 000 średnich miesięcznych użytkowników w Wielkiej BrytaniiProjekt kodeksu dostępności Tier 1 Ofcom, maj 2026

3. Dokładność: linia 98% NER i kto ją przekracza

Opóźnienie i dokładność są ze sobą w kompromisie, więc liczby opóźnienia mają sens dopiero obok liczb dokładności. Powszechną miarą jest model NER, który ocenia napisy na żywo jako (słowa minus błędy edycji i rozpoznawania) przez słowa. 98% to ‘akceptowalne’, 98,5-98,99% ‘dobre’, 99-99,49% ‘bardzo dobre’, a powyżej 99,5% ‘doskonałe’ (Romero-Fresco i Martinez, model NER, 2015). Próg wygląda łagodnie, dopóki go nie przeliczysz: przy 98% dwa na każde 100 słów są błędne, brakujące lub stanowią ważone błędy.

Brytyjscy nadawcy średnio przekroczyli ten próg: 98,38% w czterech rundach Ofcom i 98,55% w ostatniej, mierzone na 78 000 napisów i 546 000 słów (Moores, JoSTrans 33). Średnie jednak ukrywają ogon rozkładu. W październiku-listopadzie 2014 roku 77% brytyjskich programów osiągnęło 98% lub więcej, wobec 74% w kwietniu-maju 2014, a najdokładniejszym gatunkiem były wiadomości z wynikiem 98,75% (trzeci raport Ofcom, 2015). Amerykańskie krajowe programy informacyjne w języku angielskim wypadły lepiej, ze średnią 98,8% i 14 z 20 próbek ocenionych jako akceptowalne lub lepsze, podczas gdy programy po hiszpańsku spadły do 97,04% (Fresno, 2024).

MetrykaWartośćŹródło
Progi NER akceptowalny / doskonały98% / powyżej 99,5%Romero-Fresco i Martinez, 2015
Dokładność brytyjskich napisów na żywo, średnia z czterech rund98,38%Dane Ofcom za Moores, JoSTrans 33
Dokładność brytyjskich napisów na żywo, ostatnia runda98,55%Dane Ofcom za Moores, JoSTrans 33
Brytyjskie programy na poziomie 98% lub wyższym, paź-lis 2014 (wobec kwi-maj 2014)77% (74%)Trzeci raport Ofcom, 2015
Dokładność gatunku wiadomości w Wielkiej Brytanii98,75%Trzeci raport Ofcom, 2015
Amerykańskie krajowe programy informacyjne po angielsku, średni NER98,8% (14 z 20 próbek akceptowalnych lub lepszych)Fresno, Universal Access in the Information Society, 2024
Amerykańskie programy informacyjne po hiszpańsku, średni NER97,04% (Telemundo 97,00%, Univision 97,10%)Fresno, JoSTrans 42, 2024
Redukcja tekstu: programy po hiszpańsku wobec angielskich26% wobec 5-6%Fresno, JoSTrans 42, 2024

Uwaga kontekstowa: szybkość to ukryta trzecia zmienna. Ofcom zaleca, aby napisy miały średnio mniej niż 180 słów na minutę, jednak niemal wszystkie przeanalizowane przez niego programy zawierały krótkie serie powyżej 200 wpm, a gdy te serie policzono jako błędy, 68% programów spadło poniżej 98% (trzeci raport Ofcom, 2015). Badanie amerykańskich programów informacyjnych po angielsku wykazało, że prawie dwie trzecie błędów miało charakter drobny.

4. Ile opóźnienie kosztuje widzów

Odbiorców napisów na żywo jest znacznie więcej niż samych osób niesłyszących. Ofcom oszacował, że około 7,6 miliona dorosłych Brytyjczyków korzystało z napisów, z czego tylko 1,4 miliona miało uszkodzenie słuchu (komunikat prasowy Ofcom za Wired-Gov, maj 2013). Oznacza to ponad 6 milionów użytkowników napisów bez uszkodzenia słuchu (7,6 miliona minus 1,4 miliona), z których wielu ogląda w hałaśliwych pomieszczeniach lub przy cichym dźwięku. Wytyczne Ofcom przytaczają też dane YouGov, według których 61% osób w wieku 18-24 lata woli mieć napisy włączone. Globalnie WHO szacuje, że 430 milionów osób potrzebuje rehabilitacji z powodu niepełnosprawności wynikającej z utraty słuchu, a do 2050 roku liczba ta wzrośnie do ponad 700 milionów.

MetrykaWartośćŹródło
Dorośli Brytyjczycy, którzy korzystali z napisówOkoło 7,6 miliona (zakres 7,0-8,1 miliona)Ofcom, maj 2013
Z nich z uszkodzeniem słuchuOkoło 1,4 miliona (zakres 1,2-1,6 miliona)Ofcom, maj 2013
Brytyjczycy w wieku 18-24 lata, którzy wolą napisy włączone61%YouGov, cytowane w wytycznych Ofcom dotyczących usług dostępności
Udział godzin programów brytyjskich nadawców publicznych i większych serwisów na żądanie z napisami, 202488%Raport Ofcom o usługach dostępności, styczeń-grudzień 2024 (opublikowany 19 maja 2025)
Godziny z napisami na wymaganych kanałach w Wielkiej Brytanii, 2005 wobec 201340,5% wobec 81,9%Pierwszy raport Ofcom o napisach na żywo, 2014
Osoby potrzebujące rehabilitacji z powodu niepełnosprawności wynikającej z utraty słuchu430 milionówKarta informacyjna WHO, zaktualizowana w marcu 2026
Osoby, u których do 2050 roku przewiduje się pewien stopień utraty słuchuPrawie 2,5 miliardaKarta informacyjna WHO, zaktualizowana w marcu 2026

Opóźnienie to pierwsze, co zauważają widzowie. W największym niedawnym badaniu użytkowników poproszono 216 widzów niesłyszących i słabosłyszących o ocenę 70 fragmentów telewizji na żywo w czterech warunkach, co dało 4 832 oceny. Te same napisy telewizyjne otrzymały 3,66 w skali do 7 z oryginalnym opóźnieniem emisji i 5,09 po synchronizacji, czyli znacznie większą rozpiętość niż różnica między zsynchronizowaną telewizją a napisami ASR (Thompson i in., Are Caption Metrics Broken?, arXiv 2609.11408, wrzesień 2026). Napisy ASR z dwusekundowym opóźnieniem wypadły znacznie lepiej: 4,81 wobec 5,20 po synchronizacji.

To samo badanie podważa przekonanie, że wyniki dokładności oddają jakość. Próg NER 98 osiągnęło tylko 11 z 70 fragmentów telewizyjnych i 4 z 70 fragmentów ASR, a mimo to widzowie ocenili zsynchronizowane napisy ASR i telewizyjne mniej więcej tak samo, a korelacja między metrykami a ocenami wyraźnie spadła dla wyników ASR (WER r = -0,390 wobec -0,687 dla napisów telewizyjnych). Wcześniejsze badanie Gallaudet z CHI 2024 doszło do podobnego wniosku: uczestnicy zdecydowanie nie lubili opóźnień emisji, a standardowe metryki dokładności tylko słabo korelowały z tym, jak widzowie oceniali napisy.

MetrykaWartośćŹródło
Uczestnicy / oceny / fragmenty216 / 4 832 / 70Thompson i in., arXiv 2609.11408, 2026
Ocena napisów telewizyjnych: oryginalne opóźnienie wobec zsynchronizowanych (skala 7-stopniowa)3,66 wobec 5,09Thompson i in., 2026
Ocena napisów ASR: opóźnienie 2 s wobec zsynchronizowanych4,81 wobec 5,20Thompson i in., 2026
Średni WER: napisy telewizyjne wobec napisów ASR33,8% wobec 17,2%Thompson i in., 2026
Średni NER: napisy telewizyjne wobec napisów ASR95,28 wobec 94,34Thompson i in., 2026
Fragmenty spełniające NER 98: telewizja wobec ASR11 z 70 wobec 4 z 70Thompson i in., 2026
Korelacja WER z ocenami widzów: telewizja wobec ASRr = -0,687 wobec -0,390Thompson i in., 2026

Uwaga kontekstowa: wysoki WER napisów telewizyjnych częściowo wynika z tego, że napisy nadawcze parafrazują i skracają, co WER karze, a NER nie. Ta luka jest dokładnie powodem, dla którego autorzy twierdzą, że obecne metryki nie są neutralne technologicznie.

5. Szybkość silników ASR: opóźnienie w trybie strumieniowym a ludzka rozmowa

Opóźnienie silnika nie jest już głównym źródłem opóźnienia napisów. AssemblyAI podała medianę opóźnienia w trybie strumieniowym 307 ms dla Universal-Streaming wobec 516 ms dla Deepgram Nova-3 oraz P99 1 012 ms wobec 1 907 ms, mierzone od końca słowa w nagraniu do jego pierwszego pojawienia się w częściowej transkrypcji w ponad 205 godzinach nagrań (AssemblyAI, Introducing Universal-Streaming, 2 czerwca 2025). Własne dane premierowe Deepgram podały medianę współczynnika błędów słów Nova-3 w trybie strumieniowym na poziomie 6,84%, wobec 14,92% dla testowanych konkurentów (Deepgram, Introducing Nova-3, luty 2025). Oba wyniki to testy dostawców i należy je czytać jako przypadek najlepszy. Nasze statystyki zamiany mowy na tekst obejmują dokładność większej liczby silników.

Otwarte modele wymieniają większe opóźnienie na stabilność. Akademicki system Whisper-Streaming osiągnął średnie opóźnienie 3,3 sekundy na długich nagraniach mowy angielskiej ze zbioru testowego ESIC z Parlamentu Europejskiego, a kompromis jest w jego wynikach jawny: WER dla angielskiego 8,5% przy opóźnieniu 3,27 s z fragmentami 0,5 s wobec 8,0% przy 5,45 s z fragmentami 2 s (Machacek, Dabre i Bojar, arXiv 2307.14743, IJCNLP-AACL 2023). Warto zauważyć, że konfiguracja Whisper z opóźnieniem 5 sekund ląduje dokładnie na brytyjskiej średniej telewizyjnej sprzed dekady.

MetrykaWartośćŹródło
AssemblyAI Universal-Streaming, mediana / P99 opóźnienia307 ms / 1 012 msAssemblyAI, czerwiec 2025
Deepgram Nova-3, mediana / P99 opóźnienia (test AssemblyAI)516 ms / 1 907 msAssemblyAI, czerwiec 2025
Mediana WER Deepgram Nova-3: strumieniowo / wsadowo6,84% / 5,26%Deepgram, luty 2025
Zbiór testowy Deepgram Nova-32 703 pliki, 81,69 godziny, 9 domenDeepgram, luty 2025
Średnie opóźnienie Whisper-Streaming, angielski3,3 sekundyMachacek i in., 2023
Whisper-Streaming, angielski: fragment 0,5 s wobec fragmentu 2,0 sWER 8,5% przy 3,27 s wobec WER 8,0% przy 5,45 sMachacek i in., 2023
Opóźnienie Whisper-Streaming, niemiecki / czeski (fragment 0,5 s)4,11 s / 4,69 sMachacek i in., 2023

Pułap czasu rzeczywistego wyznacza ludzka rozmowa. W 10 językach średnia przerwa między pytaniem a odpowiedzią wyniosła +208 ms, w zakresie od +7 ms w japońskim do +469 ms w duńskim (Stivers i in., PNAS 2009). Premiera GPT-4o firmy OpenAI zapowiadała odpowiedzi głosowe w zaledwie 232 ms i średnio 320 ms, wobec 2,8 sekundy (GPT-3.5) i 5,4 sekundy (GPT-4) dla wcześniejszego potokowego trybu głosowego, który łączył osobne modele transkrypcji, języka i mowy. Wniosek dla napisów na żywo jest ten sam: każdy dodatkowy etap w łańcuchu dodaje sekundy, a etap, który kiedyś dominował, czyli samo rozpoznawanie, jest dziś najmniejszy.

MetrykaWartośćŹródło
Średnia przerwa między pytaniem a odpowiedzią, 10 języków+208 msStivers i in., PNAS 2009 (najnowsze dostępne dane)
Średnia dla najszybszego / najwolniejszego języka+7 ms (japoński) / +469 ms (duński)Stivers i in., PNAS 2009
Odpowiedź głosowa GPT-4o: minimum / średnia232 ms / 320 msOpenAI, maj 2024
Średnie opóźnienie potokowego trybu głosowego: GPT-3.5 / GPT-42,8 s / 5,4 sOpenAI, maj 2024
Opóźnienie napisów ASR użyte w badaniu widzów z 2026 rokuśrednio 2 sekundyThompson i in., arXiv 2609.11408

6. Automatyzacja przejmuje łańcuch napisów

Ludzką siłę roboczą stojącą za napisami na żywo określają limity szybkości. Amerykański wzorzec pracy w czasie rzeczywistym, NCRA Certified Realtime Reporter, wymaga pięciominutowego testu w czasie rzeczywistym przy 200 słowach na minutę i 96% dokładności, a raport EBU opisuje napisy na żywo jako nadążanie za mówcami do 200 wpm. Brytyjscy respeakerzy powiedzieli badaczom, że podstawowe szkolenie trwa 2-3 miesiące, a pewność siebie przychodzi po 1,5-2 latach (Moores, JoSTrans 33). Te ograniczenia sprawiły, że automatyczne napisy tak szybko się upowszechniły, gdy dokładność się zbliżyła.

Przesunięcie wolumenu widać w dokumentach spółek. Automatyczne napisy LEXI firmy Ai-Media osiągnęły 79,2 miliona minut w roku obrotowym 2025, wobec mniej niż 10 milionów cztery lata wcześniej, co daje czteroletnią średnioroczną stopę wzrostu (CAGR) 69%, a LEXI odpowiada teraz za większość użycia w jej sieci iCap (wyniki Ai-Media za rok obrotowy 2025, komunikat ASX, 28 sierpnia 2025). Produkty technologiczne stanowiły 63% przychodów Ai-Media, wobec zera pięć lat wcześniej. Niezależne testy tego samego systemu wykazały dokładność NER 98,56% po angielsku i 98,26% po hiszpańsku, na poziomie napisów tworzonych przez ludzi, z wyjątkiem treści potocznych z wieloma mówcami (Romero-Fresco i Van Gauwbergen, Fit for What Purpose?, 2025). Więcej o ludzkiej stronie zawodu znajdziesz w naszych statystykach dokładności transkrypcji w sądach.

MetrykaWartośćŹródło
Standard czasu rzeczywistego NCRA CRR200 wpm przy 96% dokładności (test 5-minutowy)NCRA
Podstawowe szkolenie respeakera / czas do uzyskania pewności2-3 miesiące / 1,5-2 lataMoores, JoSTrans 33
Minuty automatycznych napisów LEXI Ai-Media, rok obrotowy 202579,2 milionaWyniki Ai-Media za rok obrotowy 2025, ASX
Minuty LEXI cztery lata wcześniejMniej niż 10 milionów (CAGR czteroletni 69%)Wyniki Ai-Media za rok obrotowy 2025, ASX
Udział technologii w przychodach Ai-Media63% (przychody ogółem 64,9 miliona USD)Wyniki Ai-Media za rok obrotowy 2025, ASX
Dokładność NER automatycznych napisów: angielski / hiszpański98,56% / 98,26%Romero-Fresco i Van Gauwbergen, 2025
Napisy na żywo przeanalizowane w porównaniu wyników automatycznych i ludzkich, Wielka Brytania/USA/Kanada 2018-2022Około 17 000Romero-Fresco i Fresno, Linguistica Antverpiensia 22, 2023

Uwaga kontekstowa: największe dotąd porównanie człowieka z maszyną (Romero-Fresco i Fresno, Linguistica Antverpiensia, 2023) wykazało, że nieredagowane napisy automatyczne zbliżały się do 98%, z trwałymi słabościami w interpunkcji, nazwach własnych, liczbach i identyfikacji mówców. Niższe opóźnienie silnika tego nie naprawia: szybkie błędne nazwisko nadal jest błędnym nazwiskiem.

Podsumowanie: opóźnienie napisów na żywo w czasie rzeczywistym w liczbach

MetrykaWartośćŹródło
Średnie opóźnienie brytyjskich napisów na żywo, koniec 20145,1 sekundyTrzeci raport Ofcom, 2015
Brytyjskie próbki spełniające wytyczną 3 s, druga runda4 z 72Drugi raport Ofcom, 2014
Najdłuższe zarejestrowane opóźnienie w Wielkiej Brytanii21 sekundDrugi raport Ofcom, 2014
Obecna wytyczna Ofcom dotycząca opóźnieniaŚrednia 4,5 sekundy lub mniejWytyczne Ofcom dotyczące usług dostępności
Liczbowy limit opóźnienia FCCBrakFCC 14-12, 2014
Dokładność napisów na żywo po angielsku wg CRTCNER 98CRTC 2019-308
Opóźnienie napisów w amerykańskich programach informacyjnych po hiszpańskuśrednio 8,2 sekundyFresno, JoSTrans 42, 2024
Napisy w amerykańskich programach informacyjnych po hiszpańsku spóźnione o ponad 10 sekund20%Fresno, JoSTrans 42, 2024
Średnie opóźnienie na fragmentach amerykańskiej telewizji na żywo8,46 sekundyThompson i in., arXiv 2609.11408, 2026
Ocena napisów telewizyjnych: opóźnione wobec zsynchronizowanych3,66 wobec 5,09 w skali do 7Thompson i in., 2026
Dokładność brytyjskich napisów na żywo, średnia z czterech rund98,38%Dane Ofcom za Moores, JoSTrans 33
Dokładność amerykańskich krajowych programów informacyjnych po angielsku98,8%Fresno, 2024
Dokładność automatycznych napisów, angielski98,56%Romero-Fresco i Van Gauwbergen, 2025
Dorośli Brytyjczycy, którzy korzystali z napisówOkoło 7,6 milionaOfcom, 2013
Godziny brytyjskich nadawców publicznych i większych serwisów na żądanie z napisami, 202488%Raport Ofcom o usługach dostępności 2024
Mediana opóźnienia AssemblyAI w trybie strumieniowym307 msAssemblyAI, czerwiec 2025
Średnie opóźnienie Whisper-Streaming3,3 sekundyMachacek i in., 2023
Średnia ludzka przerwa przy zmianie mówcy208 msStivers i in., PNAS 2009
Minuty napisów LEXI Ai-Media, rok obrotowy 202579,2 milionaWyniki Ai-Media za rok obrotowy 2025
Napisy w katalogu kanadyjskich platform streamingowych do maja 2031100%CRTC 2026-98

Metodologia i źródła

Każdą powyższą liczbę prześledzono do regulatora, dokumentu finansowego lub recenzowanej pracy, która ją wytworzyła. Kilku plików PDF Ofcom nie udało się pobrać bezpośrednio, więc dane brytyjskie pochodzą z komunikatów prasowych Ofcom (opublikowanych ponownie na Wired-Gov), podsumowań regulatorów (EPRA) oraz recenzowanej analizy zbioru danych Ofcom (Moores), każde wskazane w tekście. Testy dostawców są oznaczone jako dane dostawców. Ogólne dane o rynku i użyciu napisów znajdziesz w naszych statystykach napisów i napisów zamkniętych.

Ostatnia aktualizacja: 3 października 2026 roku. Aktualizujemy to zestawienie kwartalnie, a kolejnej aktualizacji można się spodziewać, gdy Ofcom opublikuje końcowe stanowisko w sprawie kodeksu dostępności Tier 1 oraz swój raport o usługach dostępności za okres styczeń-grudzień 2025.

Wypróbuj VoxBooster — 3 dni za darmo.

Klonowanie głosu w czasie rzeczywistym, soundboard i efekty — wszędzie, gdzie rozmawiasz.

  • Bez karty
  • ~30ms opóźnienia
  • Discord · Teams · OBS
Wypróbuj 3 dni za darmo