Statistiken zur Latenz von Live-Untertiteln in Echtzeit (2026): 60+ Datenpunkte zu Verzögerung, Genauigkeit und ASR-Geschwindigkeit

Latenz von Live-Untertiteln 2026: Britische Live-Untertitel lagen 5,1 bis 5,8 s hinter der Sprache, Ofcom zielt auf 4,5 s, spanische US-Nachrichten kamen auf 8,2 s.

Live-Untertitel im britischen Fernsehen hinkten der Sprache in Ofcoms Messrunden im Schnitt um 5,1 bis 5,8 Sekunden hinterher, und nur 4 von 72 Stichproben der zweiten Runde erfüllten die alte Vorgabe von 3 Sekunden (Ofcom, Berichte zur Qualität der Live-Untertitelung 2014-2015). Das Problem ist nicht verschwunden: Eine Studie von 2024 zu spanischsprachigen US-Nachrichtensendungen maß eine durchschnittliche Verzögerung von 8,2 Sekunden, wobei einzelne Untertitel bis zu 41 Sekunden zu spät kamen (Fresno, JoSTrans 2024), und eine Studie vom September 2026 maß bei Live-Fernsehausschnitten aus den USA einen Mittelwert von 8,46 Sekunden. Gleichzeitig melden Streaming-Spracherkennungssysteme inzwischen eine mediane Wortlatenz von rund 300 Millisekunden (AssemblyAI, Juni 2025), sodass sich der Engpass bei der Live-Untertitelung vom menschlichen Schreiber zur Sendekette verlagert. Wir haben Daten von Ofcom, der FCC, dem CRTC, begutachteten Studien der Gallaudet University und der Universidade de Vigo, arXiv-Benchmark-Papieren, den ASX-Meldungen von Ai-Media, der WHO und weiteren Primärquellen aggregiert, die in der Methodik aufgeführt sind. Das größere Bild liefert unsere Zusammenstellung der Statistiken zu Live-Untertiteln.

TL;DR

  • Die durchschnittliche Latenz britischer Live-Untertitel sank zwischen April-Mai und Oktober-November 2014 von 5,7 auf 5,1 Sekunden, weiterhin deutlich über der Vorgabe von 3 Sekunden (Ofcom, dritter Bericht zur Live-Untertitelung, 2015).
  • Nur 4 von 72 britischen Stichproben erfüllten in der zweiten Runde die Vorgabe von 3 Sekunden, und die längste Verzögerung betrug 21 Sekunden (Ofcom, zweiter Bericht, 2014).
  • Ofcom verlangt inzwischen eine mittlere Latenz von höchstens 4,5 Sekunden über das Live-Programm (Ofcom, Leitlinien zur Bereitstellung von Zugangsdiensten für Fernsehen und On-Demand).
  • Spanischsprachige US-Nachrichtensendungen hatten eine durchschnittliche Untertitelverzögerung von 8,2 Sekunden, und 20% der Untertitel kamen mehr als 10 Sekunden zu spät (Fresno, JoSTrans 42, 2024).
  • TV-Untertitel mit ursprünglicher Sendeverzögerung (Mittelwert 8,46 s) wurden mit 3,66/7 bewertet, synchronisiert mit 5,09/7 (Thompson et al., arXiv 2609.11408, 2026).
  • Britische Live-Untertitel erreichten über vier Ofcom-Runden im Schnitt 98,38% NER-Genauigkeit und lagen damit über der Schwelle von 98% (Ofcom-Daten über Moores, JoSTrans 33).
  • Englischsprachige nationale US-Nachrichtensendungen erreichten im Schnitt 98,8% NER-Genauigkeit (Fresno, Universal Access in the Information Society, 2024).
  • Ein automatisches Untertitelungssystem erzielte 98,56% NER auf Englisch und 98,26% auf Spanisch (Romero-Fresco und Van Gauwbergen, 2025).
  • AssemblyAI meldete 307 ms mediane Streaming-Latenz gegenüber 516 ms bei Deepgram Nova-3 (AssemblyAI, Juni 2025).
  • Whisper-Streaming erreichte bei langer englischer Sprache 3,3 Sekunden durchschnittliche Latenz (Machacek, Dabre und Bojar, IJCNLP-AACL 2023).
  • Menschen beantworten eine Frage in 10 Sprachen im Mittel innerhalb von 208 ms (Stivers et al., PNAS 2009), der Maßstab, dem Echtzeitsysteme hinterherjagen.
  • Ai-Medias automatische LEXI-Untertitel erreichten im Geschäftsjahr 2025 79,2 Millionen Minuten, gegenüber weniger als 10 Millionen vier Jahre zuvor (Ai-Media, Ergebnisse Geschäftsjahr 2025, ASX).

1. Gemessene Verzögerung: Wie weit Live-Untertitel der Sprache hinterherhinken

Der vollständigste öffentliche Datensatz zur Verzögerung von Live-Untertiteln ist weiterhin der britische, und er erzählt eine konsistente Geschichte: Ein typischer Live-Untertitel erscheint mehr als 5 Sekunden, nachdem die Worte gesprochen wurden. Ofcom prüfte Nachrichten-, Unterhaltungs- und Talkshows von BBC, ITV, Channel 4, Channel 5 und Sky in vier Runden zwischen 2013 und 2015. Der erste Bericht ergab eine mediane Latenz von 5,6 Sekunden (EPRA-Zusammenfassung von Ofcoms erstem Bericht, April 2014), der zweite 5,8 Sekunden, wobei nur 4 von 72 Stichproben innerhalb der Vorgabe von 3 Sekunden lagen (Limping-Chicken-Bericht zu Ofcoms zweitem Bericht, November 2014).

Die anschließende Verbesserung war real, aber klein. Ofcoms dritter Bericht verzeichnete einen Rückgang der durchschnittlichen Latenz um 0,6 Sekunden, von 5,7 auf 5,1 Sekunden, zwischen April-Mai und Oktober-November 2014 (Ofcom-Pressemitteilung über Wired-Gov, Mai 2015). Eine halbe Sekunde von einer Verzögerung von fünf Sekunden abzuziehen, erforderte von den Sendern geänderte Arbeitsabläufe und nicht nur Software, weshalb die Zahl stagnierte. Dies sind die jüngsten verfügbaren Ofcom-Latenzmessungen (2014-2015); neuere Datensätze je Sender wurden nicht veröffentlicht.

MetrikWertQuelle
Mediane Latenz britischer Live-Untertitel, erste Runde5,6 SekundenOfcom, erster Bericht zur Live-Untertitelung, April 2014
Latenz im Vereinigten Königreich, zweite Runde5,8 SekundenOfcom, zweiter Bericht, November 2014
Stichproben, die die Vorgabe von 3 Sekunden erfüllen, zweite Runde4 von 72Ofcom, zweiter Bericht, 2014
Längste erfasste Verzögerung, zweite Runde21 SekundenOfcom, zweiter Bericht, 2014
Durchschnittliche Latenz im Vereinigten Königreich, April-Mai 2014 bis Oktober-November 20145,7 s auf 5,1 s (-0,6 s)Ofcom, dritter Bericht, Mai 2015
Durchschnittliche Latenz im Vereinigten Königreich über alle vier Runden5,3 SekundenOfcom-Daten über Moores, JoSTrans 33
Latenz ohne ‘as-live’-Einspielung vorbereiteter Untertitel7-8 SekundenOfcom-Daten über Moores, JoSTrans 33

Kontext-Hinweis: Die Werte je Runde mischen Mediane und Mittelwerte, wie sie berichtet wurden, sodass die kleinen Unterschiede zwischen den Runden (5,6, 5,7, 5,8) nicht überinterpretiert werden sollten. Der Wert von 7-8 Sekunden für Sendungen ohne vorbereitete, eingespielte Untertitel zeigt, wie stark der britische Durchschnitt von Skripten statt von Echtzeit-Transkription abhängt.

Außerhalb des Vereinigten Königreichs sind die Verzögerungen länger. Untertitel in spanischsprachigen US-Nachrichtensendungen von Telemundo und Univision lagen im Schnitt 8,2 Sekunden hinter der Sprache, bei einer Spanne von 0,7 bis 41 Sekunden, wobei 46% der Untertitel mehr als 8 Sekunden zu spät kamen (Fresno, Closed Captions en español, JoSTrans 42, 2024). Eine Studie von 2026 zu Live-Fernsehausschnitten aus den USA maß eine mittlere Verzögerung von 8,46 Sekunden (SD 3,62) und beschrieb 7 bis 12 Sekunden als typisch für TV-Untertitel (Thompson et al., arXiv 2609.11408).

MetrikWertQuelle
Durchschnittliche Untertitelverzögerung, spanischsprachige US-Nachrichtensendungen8,2 SekundenFresno, JoSTrans 42, 2024
Spanne der Verzögerungen, gleiche Stichprobe0,7 bis 41 SekundenFresno, JoSTrans 42, 2024
Untertitel mit mehr als 8 / 10 / 12 Sekunden Verzögerung46% / 20% / 8%Fresno, JoSTrans 42, 2024
In dieser Studie analysierte Untertitel5.349 (20 Segmente à zehn Minuten)Fresno, JoSTrans 42, 2024
Mittlere Verzögerung bei Live-Fernsehausschnitten aus den USA8,46 Sekunden (SD 3,62)Thompson et al., arXiv 2609.11408, Sept. 2026
Genannte typische Verzögerung von US-TV-Untertiteln7-12 SekundenThompson et al., arXiv 2609.11408, Sept. 2026
Durchschnittliche Latenz bei Live-Veranstaltungen (nicht im Fernsehen) mit Respeaking5,8 Sekunden (Spanne 4,3-7,5 s)Moores, JoSTrans 33

2. Regulatorische Ziele: Von 3 Sekunden auf 4,5 Sekunden

Regulierer sind sich einig, dass Latenz wichtig ist, doch fast keiner nennt eine Zahl. Ofcom ist der einzige große Regulierer in dieser Zusammenstellung mit einem numerischen Latenzziel, und er hat dieses Ziel in die nachsichtigere Richtung verschoben: von einer maximalen Verzögerung von 3 Sekunden in seinem Kodex für Zugangsdienste im Fernsehen auf einen Durchschnitt von höchstens 4,5 Sekunden über das Live-Programm eines Anbieters. In der Konsultation 2023 erklärte Ofcom, Sender hätten das Maximum von 3 Sekunden als unrealistisch bezeichnet und 4,5 Sekunden entsprächen den besten Latenzen, die einzelne Sender erreicht hätten (Ofcom-Leitlinien zur Bereitstellung von Zugangsdiensten für Fernsehen und On-Demand).

Der US-Ansatz ist qualitativ. Die FCC verabschiedete am 20. Februar 2014 Qualitätsstandards für Untertitel, die Genauigkeit, Synchronität, Vollständigkeit und Platzierung abdecken, und sagte lediglich, die Verzögerung bei Live-Untertiteln ‘sollte auf ein Minimum begrenzt werden, vereinbar mit einer genauen Wiedergabe des Gesagten’ (FCC, Qualitätsstandards für Untertitel). Kanada reguliert die Genauigkeit statt der Zeit: Die Broadcasting Regulatory Policy 2019-308 des CRTC verlangt, dass englischsprachige Live-Untertitel im NER-Modell 98 erreichen. Praktisch bedeutet das, dass ein um 10 Sekunden verspäteter Untertitel in den meisten Teilen der Welt vollständig regelkonform sein kann.

MetrikWertQuelle
Frühere Ofcom-VorgabeMaximal 3 Sekunden VerzögerungOfcom-Kodex für Zugangsdienste im Fernsehen
Aktuelle Ofcom-VorgabeMittelwert von höchstens 4,5 Sekunden über das Live-ProgrammOfcom-Leitlinien zur Bereitstellung von Zugangsdiensten für TV und On-Demand
Frühere Ofcom-Vorgabe zur Untertitelgeschwindigkeit: vorproduziert / live160-180 WPM / 200 WPMOfcom-Konsultation 2023, laut Liam O’Dell
Numerische Latenzgrenze der FCCKeine (Verzögerung ‘auf ein Minimum begrenzt’)FCC 14-12, verabschiedet am 20. Feb. 2014
FCC-Verbot von reiner Teleprompter-ENT-Untertitelung bei Live-Programmen4 große Networks und Partnersender in den 25 größten MärktenFCC 14-12
FCC-Untertitelung neuer nicht ausgenommener Programme100% seit dem 1. Januar 200647 CFR 79.1
CRTC-Genauigkeitsanforderung für englische Live-UntertitelNER-Wert von 98, ab dem 1. September 2019CRTC 2019-308
CRTC-Überwachungspflicht2 Live-Sendungen pro Monat, davon 1 NachrichtensendungCRTC 2019-308

Kontext-Hinweis: Australiens ACMA setzt unter dem Broadcasting Services (Television Captioning) Standard 2023, in Kraft seit dem 1. Oktober 2023, ebenfalls keine numerische Latenz fest und beurteilt Lesbarkeit, Genauigkeit und Verständlichkeit im Einzelfall.

Die neuesten Regeln weiten die Pflichten auf das Streaming aus, statt die Verzögerung zu verschärfen. Kanadas CRTC 2026-98 verlangt von Online-Streamern, 80% ihres Katalogs bis Mai 2030 und 100% bis Mai 2031 zu untertiteln, mit Untertiteln bei neuen originalen Live- und vorproduzierten Programmen innerhalb eines Jahres (CRTC 2026-98, 25. Mai 2026). Ofcoms am 14. Mai 2026 veröffentlichter Entwurf des Tier 1 Accessibility Code schlägt vier Jahre nach Veröffentlichung eine Untertitelquote von 80% für die größten Streamer vor (Ofcom, Konsultation zum Tier 1 Accessibility Code).

MetrikWertQuelle
Untertitelung des Katalogs kanadischer Streamer80% bis Mai 2030, 100% bis Mai 2031CRTC 2026-98
Kanadische Genauigkeitsanforderung für vorproduzierte Originalprogramme bei Streamern100%CRTC 2026-98
Ofcom-Untertitelquote Tier 1, Jahr 4 / Jahr 180% / 20%Ofcom, Entwurf des Tier 1 Accessibility Code, Mai 2026
Untertitelquote der BBC On-Demand, Jahr 490%Ofcom, Entwurf des Tier 1 Accessibility Code, Mai 2026
Schwelle für Tier 1500.000+ durchschnittliche monatliche Nutzer im Vereinigten KönigreichOfcom, Entwurf des Tier 1 Accessibility Code, Mai 2026

3. Genauigkeit: Die 98%-NER-Linie und wer sie erreicht

Verzögerung und Genauigkeit stehen im Zielkonflikt, weshalb Latenzzahlen nur neben Genauigkeitszahlen Sinn ergeben. Der gängige Maßstab ist das NER-Modell, das Live-Untertitel als (Wörter minus Bearbeitungs- und Erkennungsfehler) im Verhältnis zu den Wörtern bewertet. 98% gelten als ‘akzeptabel’, 98,5-98,99% als ‘gut’, 99-99,49% als ‘sehr gut’ und über 99,5% als ‘hervorragend’ (Romero-Fresco und Martínez, NER-Modell, 2015). Die Schwelle wirkt großzügig, bis man sie übersetzt: Bei 98% sind zwei von 100 Wörtern falsch, fehlend oder gewichtete Fehler.

Britische Sender übersprangen die Latte im Durchschnitt: 98,38% über Ofcoms vier Runden und 98,55% in der letzten, gemessen an 78.000 Untertiteln und 546.000 Wörtern (Moores, JoSTrans 33). Doch Durchschnitte verbergen den schwachen Rand. Im Oktober-November 2014 erreichten 77% der britischen Sendungen 98% oder mehr, gegenüber 74% im April-Mai 2014, und Nachrichten waren mit 98,75% das genaueste Genre (Ofcom, dritter Bericht, 2015). Englischsprachige nationale US-Nachrichtensendungen schnitten besser ab, mit einem Schnitt von 98,8% und 14 von 20 Stichproben, die als akzeptabel oder besser bewertet wurden, während spanischsprachige Nachrichtensendungen auf 97,04% fielen (Fresno, 2024).

MetrikWertQuelle
NER-Schwellen akzeptabel / hervorragend98% / über 99,5%Romero-Fresco und Martínez, 2015
Genauigkeit britischer Live-Untertitel, Durchschnitt der vier Runden98,38%Ofcom-Daten über Moores, JoSTrans 33
Genauigkeit britischer Live-Untertitel, letzte Runde98,55%Ofcom-Daten über Moores, JoSTrans 33
Britische Sendungen mit 98% oder mehr, Okt.-Nov. 2014 (gegenüber Apr.-Mai 2014)77% (74%)Ofcom, dritter Bericht, 2015
Genauigkeit des Nachrichtengenres im Vereinigten Königreich98,75%Ofcom, dritter Bericht, 2015
Englischsprachige nationale US-Nachrichtensendungen, durchschnittlicher NER98,8% (14 von 20 Stichproben akzeptabel oder besser)Fresno, Universal Access in the Information Society, 2024
Spanischsprachige US-Nachrichtensendungen, durchschnittlicher NER97,04% (Telemundo 97,00%, Univision 97,10%)Fresno, JoSTrans 42, 2024
Textreduktion: spanische gegenüber englischen Nachrichtensendungen26% gegenüber 5-6%Fresno, JoSTrans 42, 2024

Kontext-Hinweis: Die Sprechgeschwindigkeit ist die versteckte dritte Variable. Ofcom empfiehlt, dass Untertitel im Schnitt unter 180 Wörtern pro Minute liegen, doch fast alle analysierten Sendungen hatten kurze Spitzen über 200 WPM, und wenn diese Spitzen als Fehler gezählt wurden, lagen 68% der Sendungen unter 98% (Ofcom, dritter Bericht, 2015). Die Studie zu englischsprachigen US-Nachrichtensendungen fand, dass fast zwei Drittel der Fehler geringfügig waren.

4. Was Verzögerung die Zuschauer kostet

Das Publikum für Live-Untertitel ist weit größer als die Gehörlosengemeinschaft allein. Ofcom schätzte, dass rund 7,6 Millionen Erwachsene im Vereinigten Königreich Untertitel genutzt hatten, von denen nur 1,4 Millionen eine Hörbeeinträchtigung hatten (Ofcom-Pressemitteilung über Wired-Gov, Mai 2013). Das bedeutet mehr als 6 Millionen Untertitelnutzer ohne Hörbeeinträchtigung (7,6 Millionen minus 1,4 Millionen), von denen viele in lauten Räumen oder mit leisem Ton schauen. Ofcoms Leitlinien zitieren außerdem YouGov-Daten, nach denen 61% der 18- bis 24-Jährigen Untertitel eingeschaltet bevorzugen. Weltweit schätzt die WHO, dass heute 430 Millionen Menschen eine Rehabilitation wegen behinderndem Hörverlust benötigen, bis 2050 mehr als 700 Millionen.

MetrikWertQuelle
Erwachsene im Vereinigten Königreich, die Untertitel genutzt habenEtwa 7,6 Millionen (Spanne 7,0-8,1 Millionen)Ofcom, Mai 2013
Davon mit HörbeeinträchtigungEtwa 1,4 Millionen (Spanne 1,2-1,6 Millionen)Ofcom, Mai 2013
18- bis 24-Jährige im Vereinigten Königreich, die Untertitel eingeschaltet bevorzugen61%YouGov, zitiert in den Ofcom-Leitlinien zu Zugangsdiensten
Anteil der Programmstunden der britischen öffentlich-rechtlichen Sender (PSB) und größeren On-Demand-Dienste mit Untertiteln, 202488%Ofcom-Bericht zu Zugangsdiensten, Jan.-Dez. 2024 (veröffentlicht am 19. Mai 2025)
Untertitelte Stunden auf verpflichteten Kanälen im Vereinigten Königreich, 2005 gegenüber 201340,5% gegenüber 81,9%Ofcom, erster Bericht zur Live-Untertitelung, 2014
Menschen, die eine Rehabilitation wegen behinderndem Hörverlust benötigen430 MillionenWHO-Faktenblatt, aktualisiert im März 2026
Menschen mit prognostiziertem Hörverlust bis 2050Knapp 2,5 MilliardenWHO-Faktenblatt, aktualisiert im März 2026

Die Verzögerung bemerken Zuschauer zuerst. Die größte jüngere Nutzerstudie bat 216 gehörlose und schwerhörige Zuschauer, 70 Live-TV-Clips unter vier Bedingungen zu bewerten, was 4.832 Bewertungen ergab. Dieselben TV-Untertitel erhielten mit ihrer ursprünglichen Sendeverzögerung 3,66 von 7 und synchronisiert 5,09, ein weit größerer Ausschlag als der Abstand zwischen synchronisierten TV- und ASR-Untertiteln (Thompson et al., Are Caption Metrics Broken?, arXiv 2609.11408, September 2026). ASR-Untertitel mit zwei Sekunden Verzögerung schnitten deutlich besser ab, mit 4,81 gegenüber 5,20 synchronisiert.

Dieselbe Studie untergräbt die Vorstellung, dass Genauigkeitswerte die Qualität erfassen. Nur 11 von 70 TV-Clips und 4 von 70 ASR-Clips erreichten die NER-Schwelle von 98, und doch bewerteten die Zuschauer synchronisierte ASR- und TV-Untertitel etwa gleich, und die Korrelation zwischen Metriken und Bewertungen sank bei ASR-Ausgaben stark (WER r = -0,390 gegenüber -0,687 bei TV-Untertiteln). Gallaudets frühere CHI-2024-Studie kam zu einem ähnlichen Schluss: Die Teilnehmer mochten Sendeverzögerungen ausdrücklich nicht, und gängige Genauigkeitsmetriken korrelierten nur schwach damit, wie Zuschauer Untertitel bewerteten.

MetrikWertQuelle
Teilnehmer / Bewertungen / Clips216 / 4.832 / 70Thompson et al., arXiv 2609.11408, 2026
Bewertung von TV-Untertiteln: ursprüngliche Verzögerung gegenüber synchronisiert (7-Punkte-Skala)3,66 gegenüber 5,09Thompson et al., 2026
Bewertung von ASR-Untertiteln: 2 s Verzögerung gegenüber synchronisiert4,81 gegenüber 5,20Thompson et al., 2026
Mittlerer WER: TV-Untertitel gegenüber ASR-Untertiteln33,8% gegenüber 17,2%Thompson et al., 2026
Mittlerer NER: TV-Untertitel gegenüber ASR-Untertiteln95,28 gegenüber 94,34Thompson et al., 2026
Clips, die NER 98 erreichen: TV gegenüber ASR11 von 70 gegenüber 4 von 70Thompson et al., 2026
Korrelation des WER mit Zuschauerbewertungen: TV gegenüber ASRr = -0,687 gegenüber -0,390Thompson et al., 2026

Kontext-Hinweis: Der hohe WER bei TV-Untertiteln spiegelt zum Teil wider, dass Sendeuntertitel paraphrasieren und verdichten, was der WER bestraft und der NER nicht. Genau diese Lücke ist der Grund, weshalb die Autoren argumentieren, dass aktuelle Metriken nicht technologieneutral sind.

5. ASR-Geschwindigkeit: Streaming-Latenz gegenüber menschlichem Gespräch

Die Latenz der Erkennungsengine ist nicht mehr die Hauptquelle der Untertitelverzögerung. AssemblyAI meldete eine mediane Streaming-Latenz von 307 ms für Universal-Streaming gegenüber 516 ms für Deepgram Nova-3 sowie einen P99 von 1.012 ms gegenüber 1.907 ms, gemessen vom Ende eines Wortes im Audio bis zu seinem ersten Erscheinen in einem Teiltranskript über 205+ Stunden Audio (AssemblyAI, Introducing Universal-Streaming, 2. Juni 2025). Deepgrams eigene Launch-Daten bezifferten die mediane Streaming-Wortfehlerrate von Nova-3 auf 6,84% gegenüber 14,92% bei den getesteten Wettbewerbern (Deepgram, Introducing Nova-3, Februar 2025). Beides sind Herstellerbenchmarks und als Bestwerte zu lesen. Unsere Speech-to-Text-Statistiken behandeln die Genauigkeit weiterer Engines.

Offene Modelle tauschen mehr Verzögerung gegen Stabilität. Das akademische System Whisper-Streaming erreichte 3,3 Sekunden durchschnittliche Latenz bei langer englischer Sprache aus dem ESIC-Testset des Europäischen Parlaments, und der Zielkonflikt ist in den Ergebnissen explizit: englischer WER von 8,5% bei 3,27 s Latenz mit 0,5-s-Chunks gegenüber 8,0% bei 5,45 s mit 2-s-Chunks (Machacek, Dabre und Bojar, arXiv 2307.14743, IJCNLP-AACL 2023). Bemerkenswert: Eine Whisper-Konfiguration mit 5 Sekunden landet genau auf dem britischen Sendedurchschnitt von vor einem Jahrzehnt.

MetrikWertQuelle
AssemblyAI Universal-Streaming, mediane / P99-Latenz307 ms / 1.012 msAssemblyAI, Juni 2025
Deepgram Nova-3, mediane / P99-Latenz (AssemblyAI-Test)516 ms / 1.907 msAssemblyAI, Juni 2025
Deepgram Nova-3, medianer WER: Streaming / Batch6,84% / 5,26%Deepgram, Feb. 2025
Deepgram-Nova-3-Benchmark-Set2.703 Dateien, 81,69 Stunden, 9 DomänenDeepgram, Feb. 2025
Durchschnittliche Latenz von Whisper-Streaming, Englisch3,3 SekundenMachacek et al., 2023
Whisper-Streaming Englisch: 0,5-s-Chunk gegenüber 2,0-s-Chunk8,5% WER bei 3,27 s gegenüber 8,0% WER bei 5,45 sMachacek et al., 2023
Latenz von Whisper-Streaming, Deutsch / Tschechisch (0,5-s-Chunk)4,11 s / 4,69 sMachacek et al., 2023

Die Obergrenze für Echtzeit setzt das menschliche Gespräch. In 10 Sprachen betrug die mittlere Lücke zwischen Frage und Antwort +208 ms, bei einer Spanne von +7 ms im Japanischen bis +469 ms im Dänischen (Stivers et al., PNAS 2009). Der GPT-4o-Launch von OpenAI nannte Audioantworten in nur 232 ms und im Schnitt 320 ms, gegenüber 2,8 Sekunden (GPT-3.5) und 5,4 Sekunden (GPT-4) beim früheren Pipeline-Sprachmodus, der getrennte Transkriptions-, Sprach- und Sprachausgabemodelle verkettete. Die Lehre für die Live-Untertitelung ist dieselbe: Jede zusätzliche Stufe in der Kette fügt Sekunden hinzu, und die Stufe, die früher dominierte, die Erkennung selbst, ist inzwischen die kleinste.

MetrikWertQuelle
Mittlere Lücke zwischen Frage und Antwort, 10 Sprachen+208 msStivers et al., PNAS 2009 (jüngste verfügbare Daten)
Mittelwert der schnellsten / langsamsten Sprache+7 ms (Japanisch) / +469 ms (Dänisch)Stivers et al., PNAS 2009
GPT-4o-Audioantwort: Minimum / Durchschnitt232 ms / 320 msOpenAI, Mai 2024
Durchschnittliche Latenz des Pipeline-Sprachmodus: GPT-3.5 / GPT-42,8 s / 5,4 sOpenAI, Mai 2024
In der Zuschauerstudie 2026 verwendete ASR-Untertitelverzögerung2 Sekunden im SchnittThompson et al., arXiv 2609.11408

6. Automatisierung übernimmt die Untertitelkette

Die menschlichen Fachkräfte hinter Live-Untertiteln sind durch Geschwindigkeitsgrenzen definiert. Der US-Echtzeit-Maßstab, der NCRA Certified Realtime Reporter, verlangt einen fünfminütigen Echtzeittest mit 200 Wörtern pro Minute bei 96% Genauigkeit, und ein EBU-Bericht beschreibt Live-Untertitelung als das Mithalten mit Sprechern von bis zu 200 WPM. Britische Respeaker sagten Forschern, die Grundausbildung dauere 2-3 Monate, bis zur Sicherheit vergingen 1,5-2 Jahre (Moores, JoSTrans 33). Diese Einschränkungen erklären, warum automatische Untertitelung so schnell skalierte, sobald die Genauigkeit nahe herankam.

Die Mengenverschiebung zeigt sich in Unternehmensmeldungen. Ai-Medias automatische LEXI-Untertitel erreichten im Geschäftsjahr 2025 79,2 Millionen Minuten, gegenüber weniger als 10 Millionen vier Jahre zuvor, eine vierjährige CAGR von 69%, und LEXI macht inzwischen den größten Teil der Nutzung in seinem iCap-Netzwerk aus (Ai-Media, Ergebnisse Geschäftsjahr 2025, ASX-Mitteilung, 28. August 2025). Technologieprodukte machten 63% des Umsatzes von Ai-Media aus, von null fünf Jahre zuvor. Unabhängige Tests desselben Systems ergaben eine NER-Genauigkeit von 98,56% auf Englisch und 98,26% auf Spanisch, auf Augenhöhe mit menschlichen Untertiteln, außer bei umgangssprachlichen Inhalten mit mehreren Sprechern (Romero-Fresco und Van Gauwbergen, Fit for What Purpose?, 2025). Mehr zur menschlichen Seite des Berufs finden Sie in unseren Statistiken zur Genauigkeit von Gerichtsprotokollen.

MetrikWertQuelle
NCRA-CRR-Echtzeitstandard200 WPM bei 96% Genauigkeit (5-Minuten-Test)NCRA
Respeaker-Grundausbildung / Zeit bis zur Sicherheit2-3 Monate / 1,5-2 JahreMoores, JoSTrans 33
Minuten automatischer LEXI-Untertitel von Ai-Media, Geschäftsjahr 202579,2 MillionenAi-Media, Ergebnisse Geschäftsjahr 2025, ASX
LEXI-Minuten vier Jahre zuvorWeniger als 10 Millionen (69% vierjährige CAGR)Ai-Media, Ergebnisse Geschäftsjahr 2025, ASX
Technologieanteil am Umsatz von Ai-Media63% (Gesamtumsatz 64,9 Millionen USD)Ai-Media, Ergebnisse Geschäftsjahr 2025, ASX
NER-Genauigkeit automatischer Untertitel: Englisch / Spanisch98,56% / 98,26%Romero-Fresco und Van Gauwbergen, 2025
Analysierte Live-Untertitel im Vergleich automatischer und menschlicher Ausgabe, Vereinigtes Königreich/USA/Kanada 2018-2022Etwa 17.000Romero-Fresco und Fresno, Linguistica Antverpiensia 22, 2023

Kontext-Hinweis: Der bislang größte Vergleich von Mensch und Maschine (Romero-Fresco und Fresno, Linguistica Antverpiensia, 2023) fand, dass unbearbeitete automatische Untertitel nahe an 98% herankamen, mit anhaltenden Schwächen bei Zeichensetzung, Eigennamen, Zahlen und Sprecheridentifikation. Eine geringere Engine-Latenz behebt das nicht: Ein schneller falscher Name bleibt ein falscher Name.

Zusammenfassung: Latenz von Live-Untertiteln in Echtzeit in Zahlen

MetrikWertQuelle
Durchschnittliche Latenz britischer Live-Untertitel, Ende 20145,1 SekundenOfcom, dritter Bericht, 2015
Britische Stichproben, die die 3-s-Vorgabe erfüllen, zweite Runde4 von 72Ofcom, zweiter Bericht, 2014
Längste erfasste Verzögerung im Vereinigten Königreich21 SekundenOfcom, zweiter Bericht, 2014
Aktuelle Latenzvorgabe von OfcomMittelwert von 4,5 Sekunden oder wenigerOfcom-Leitlinien zu Zugangsdiensten
Numerische Latenzgrenze der FCCKeineFCC 14-12, 2014
CRTC-Genauigkeit für englische Live-UntertitelNER 98CRTC 2019-308
Untertitelverzögerung bei spanischsprachigen US-Nachrichtensendungen8,2 Sekunden im SchnittFresno, JoSTrans 42, 2024
Untertitel spanischsprachiger US-Nachrichtensendungen mit mehr als 10 Sekunden Verzögerung20%Fresno, JoSTrans 42, 2024
Mittlere Verzögerung bei Live-Fernsehausschnitten aus den USA8,46 SekundenThompson et al., arXiv 2609.11408, 2026
Bewertung von TV-Untertiteln: verzögert gegenüber synchronisiert3,66 gegenüber 5,09 von 7Thompson et al., 2026
Genauigkeit britischer Live-Untertitel, Durchschnitt der vier Runden98,38%Ofcom-Daten über Moores, JoSTrans 33
Genauigkeit englischsprachiger nationaler US-Nachrichtensendungen98,8%Fresno, 2024
Genauigkeit automatischer Untertitel, Englisch98,56%Romero-Fresco und Van Gauwbergen, 2025
Erwachsene im Vereinigten Königreich, die Untertitel genutzt habenEtwa 7,6 MillionenOfcom, 2013
Untertitelte Stunden britischer PSB und größerer On-Demand-Dienste, 202488%Ofcom-Bericht zu Zugangsdiensten 2024
Mediane Streaming-Latenz von AssemblyAI307 msAssemblyAI, Juni 2025
Durchschnittliche Latenz von Whisper-Streaming3,3 SekundenMachacek et al., 2023
Mittlere menschliche Lücke beim Sprecherwechsel208 msStivers et al., PNAS 2009
LEXI-Untertitelminuten von Ai-Media, Geschäftsjahr 202579,2 MillionenAi-Media, Ergebnisse Geschäftsjahr 2025
Untertitelung des Katalogs kanadischer Streamer bis Mai 2031100%CRTC 2026-98

Methodik und Quellen

Jede Zahl oben wurde bis zu der Regulierungsbehörde, Meldung oder begutachteten Arbeit zurückverfolgt, die sie hervorgebracht hat. Mehrere Ofcom-PDFs ließen sich nicht direkt abrufen, daher stammen die britischen Zahlen aus Ofcom-Pressemitteilungen (nachveröffentlicht bei Wired-Gov), Zusammenfassungen von Regulierern (EPRA) und der begutachteten Analyse des Ofcom-Datensatzes (Moores), jeweils im Text genannt. Herstellerbenchmarks sind als Herstellerdaten gekennzeichnet. Allgemeine Markt- und Nutzungsdaten zu Untertiteln finden Sie in unseren Statistiken zu Untertiteln und Closed Captions.

Zuletzt aktualisiert: 3. Oktober 2026. Wir aktualisieren diese Zusammenstellung vierteljährlich, und die nächste Aktualisierung wird erwartet, wenn Ofcom seine abschließende Stellungnahme zum Tier 1 Accessibility Code und seinen Bericht zu Zugangsdiensten für Januar bis Dezember 2025 veröffentlicht.

VoxBooster testen — 3 Tage kostenlos.

Echtzeit-Stimmklon, Soundboard und Effekte — überall, wo du schon redest.

  • Keine Kreditkarte
  • ~30 ms Latenz
  • Discord · Teams · OBS
3 Tage kostenlos testen