Live-Untertitel im britischen Fernsehen hinkten der Sprache in Ofcoms Messrunden im Schnitt um 5,1 bis 5,8 Sekunden hinterher, und nur 4 von 72 Stichproben der zweiten Runde erfüllten die alte Vorgabe von 3 Sekunden (Ofcom, Berichte zur Qualität der Live-Untertitelung 2014-2015). Das Problem ist nicht verschwunden: Eine Studie von 2024 zu spanischsprachigen US-Nachrichtensendungen maß eine durchschnittliche Verzögerung von 8,2 Sekunden, wobei einzelne Untertitel bis zu 41 Sekunden zu spät kamen (Fresno, JoSTrans 2024), und eine Studie vom September 2026 maß bei Live-Fernsehausschnitten aus den USA einen Mittelwert von 8,46 Sekunden. Gleichzeitig melden Streaming-Spracherkennungssysteme inzwischen eine mediane Wortlatenz von rund 300 Millisekunden (AssemblyAI, Juni 2025), sodass sich der Engpass bei der Live-Untertitelung vom menschlichen Schreiber zur Sendekette verlagert. Wir haben Daten von Ofcom, der FCC, dem CRTC, begutachteten Studien der Gallaudet University und der Universidade de Vigo, arXiv-Benchmark-Papieren, den ASX-Meldungen von Ai-Media, der WHO und weiteren Primärquellen aggregiert, die in der Methodik aufgeführt sind. Das größere Bild liefert unsere Zusammenstellung der Statistiken zu Live-Untertiteln.
TL;DR
- Die durchschnittliche Latenz britischer Live-Untertitel sank zwischen April-Mai und Oktober-November 2014 von 5,7 auf 5,1 Sekunden, weiterhin deutlich über der Vorgabe von 3 Sekunden (Ofcom, dritter Bericht zur Live-Untertitelung, 2015).
- Nur 4 von 72 britischen Stichproben erfüllten in der zweiten Runde die Vorgabe von 3 Sekunden, und die längste Verzögerung betrug 21 Sekunden (Ofcom, zweiter Bericht, 2014).
- Ofcom verlangt inzwischen eine mittlere Latenz von höchstens 4,5 Sekunden über das Live-Programm (Ofcom, Leitlinien zur Bereitstellung von Zugangsdiensten für Fernsehen und On-Demand).
- Spanischsprachige US-Nachrichtensendungen hatten eine durchschnittliche Untertitelverzögerung von 8,2 Sekunden, und 20% der Untertitel kamen mehr als 10 Sekunden zu spät (Fresno, JoSTrans 42, 2024).
- TV-Untertitel mit ursprünglicher Sendeverzögerung (Mittelwert 8,46 s) wurden mit 3,66/7 bewertet, synchronisiert mit 5,09/7 (Thompson et al., arXiv 2609.11408, 2026).
- Britische Live-Untertitel erreichten über vier Ofcom-Runden im Schnitt 98,38% NER-Genauigkeit und lagen damit über der Schwelle von 98% (Ofcom-Daten über Moores, JoSTrans 33).
- Englischsprachige nationale US-Nachrichtensendungen erreichten im Schnitt 98,8% NER-Genauigkeit (Fresno, Universal Access in the Information Society, 2024).
- Ein automatisches Untertitelungssystem erzielte 98,56% NER auf Englisch und 98,26% auf Spanisch (Romero-Fresco und Van Gauwbergen, 2025).
- AssemblyAI meldete 307 ms mediane Streaming-Latenz gegenüber 516 ms bei Deepgram Nova-3 (AssemblyAI, Juni 2025).
- Whisper-Streaming erreichte bei langer englischer Sprache 3,3 Sekunden durchschnittliche Latenz (Machacek, Dabre und Bojar, IJCNLP-AACL 2023).
- Menschen beantworten eine Frage in 10 Sprachen im Mittel innerhalb von 208 ms (Stivers et al., PNAS 2009), der Maßstab, dem Echtzeitsysteme hinterherjagen.
- Ai-Medias automatische LEXI-Untertitel erreichten im Geschäftsjahr 2025 79,2 Millionen Minuten, gegenüber weniger als 10 Millionen vier Jahre zuvor (Ai-Media, Ergebnisse Geschäftsjahr 2025, ASX).
1. Gemessene Verzögerung: Wie weit Live-Untertitel der Sprache hinterherhinken
Der vollständigste öffentliche Datensatz zur Verzögerung von Live-Untertiteln ist weiterhin der britische, und er erzählt eine konsistente Geschichte: Ein typischer Live-Untertitel erscheint mehr als 5 Sekunden, nachdem die Worte gesprochen wurden. Ofcom prüfte Nachrichten-, Unterhaltungs- und Talkshows von BBC, ITV, Channel 4, Channel 5 und Sky in vier Runden zwischen 2013 und 2015. Der erste Bericht ergab eine mediane Latenz von 5,6 Sekunden (EPRA-Zusammenfassung von Ofcoms erstem Bericht, April 2014), der zweite 5,8 Sekunden, wobei nur 4 von 72 Stichproben innerhalb der Vorgabe von 3 Sekunden lagen (Limping-Chicken-Bericht zu Ofcoms zweitem Bericht, November 2014).
Die anschließende Verbesserung war real, aber klein. Ofcoms dritter Bericht verzeichnete einen Rückgang der durchschnittlichen Latenz um 0,6 Sekunden, von 5,7 auf 5,1 Sekunden, zwischen April-Mai und Oktober-November 2014 (Ofcom-Pressemitteilung über Wired-Gov, Mai 2015). Eine halbe Sekunde von einer Verzögerung von fünf Sekunden abzuziehen, erforderte von den Sendern geänderte Arbeitsabläufe und nicht nur Software, weshalb die Zahl stagnierte. Dies sind die jüngsten verfügbaren Ofcom-Latenzmessungen (2014-2015); neuere Datensätze je Sender wurden nicht veröffentlicht.
| Metrik | Wert | Quelle |
|---|---|---|
| Mediane Latenz britischer Live-Untertitel, erste Runde | 5,6 Sekunden | Ofcom, erster Bericht zur Live-Untertitelung, April 2014 |
| Latenz im Vereinigten Königreich, zweite Runde | 5,8 Sekunden | Ofcom, zweiter Bericht, November 2014 |
| Stichproben, die die Vorgabe von 3 Sekunden erfüllen, zweite Runde | 4 von 72 | Ofcom, zweiter Bericht, 2014 |
| Längste erfasste Verzögerung, zweite Runde | 21 Sekunden | Ofcom, zweiter Bericht, 2014 |
| Durchschnittliche Latenz im Vereinigten Königreich, April-Mai 2014 bis Oktober-November 2014 | 5,7 s auf 5,1 s (-0,6 s) | Ofcom, dritter Bericht, Mai 2015 |
| Durchschnittliche Latenz im Vereinigten Königreich über alle vier Runden | 5,3 Sekunden | Ofcom-Daten über Moores, JoSTrans 33 |
| Latenz ohne ‘as-live’-Einspielung vorbereiteter Untertitel | 7-8 Sekunden | Ofcom-Daten über Moores, JoSTrans 33 |
Kontext-Hinweis: Die Werte je Runde mischen Mediane und Mittelwerte, wie sie berichtet wurden, sodass die kleinen Unterschiede zwischen den Runden (5,6, 5,7, 5,8) nicht überinterpretiert werden sollten. Der Wert von 7-8 Sekunden für Sendungen ohne vorbereitete, eingespielte Untertitel zeigt, wie stark der britische Durchschnitt von Skripten statt von Echtzeit-Transkription abhängt.
Außerhalb des Vereinigten Königreichs sind die Verzögerungen länger. Untertitel in spanischsprachigen US-Nachrichtensendungen von Telemundo und Univision lagen im Schnitt 8,2 Sekunden hinter der Sprache, bei einer Spanne von 0,7 bis 41 Sekunden, wobei 46% der Untertitel mehr als 8 Sekunden zu spät kamen (Fresno, Closed Captions en español, JoSTrans 42, 2024). Eine Studie von 2026 zu Live-Fernsehausschnitten aus den USA maß eine mittlere Verzögerung von 8,46 Sekunden (SD 3,62) und beschrieb 7 bis 12 Sekunden als typisch für TV-Untertitel (Thompson et al., arXiv 2609.11408).
| Metrik | Wert | Quelle |
|---|---|---|
| Durchschnittliche Untertitelverzögerung, spanischsprachige US-Nachrichtensendungen | 8,2 Sekunden | Fresno, JoSTrans 42, 2024 |
| Spanne der Verzögerungen, gleiche Stichprobe | 0,7 bis 41 Sekunden | Fresno, JoSTrans 42, 2024 |
| Untertitel mit mehr als 8 / 10 / 12 Sekunden Verzögerung | 46% / 20% / 8% | Fresno, JoSTrans 42, 2024 |
| In dieser Studie analysierte Untertitel | 5.349 (20 Segmente à zehn Minuten) | Fresno, JoSTrans 42, 2024 |
| Mittlere Verzögerung bei Live-Fernsehausschnitten aus den USA | 8,46 Sekunden (SD 3,62) | Thompson et al., arXiv 2609.11408, Sept. 2026 |
| Genannte typische Verzögerung von US-TV-Untertiteln | 7-12 Sekunden | Thompson et al., arXiv 2609.11408, Sept. 2026 |
| Durchschnittliche Latenz bei Live-Veranstaltungen (nicht im Fernsehen) mit Respeaking | 5,8 Sekunden (Spanne 4,3-7,5 s) | Moores, JoSTrans 33 |
2. Regulatorische Ziele: Von 3 Sekunden auf 4,5 Sekunden
Regulierer sind sich einig, dass Latenz wichtig ist, doch fast keiner nennt eine Zahl. Ofcom ist der einzige große Regulierer in dieser Zusammenstellung mit einem numerischen Latenzziel, und er hat dieses Ziel in die nachsichtigere Richtung verschoben: von einer maximalen Verzögerung von 3 Sekunden in seinem Kodex für Zugangsdienste im Fernsehen auf einen Durchschnitt von höchstens 4,5 Sekunden über das Live-Programm eines Anbieters. In der Konsultation 2023 erklärte Ofcom, Sender hätten das Maximum von 3 Sekunden als unrealistisch bezeichnet und 4,5 Sekunden entsprächen den besten Latenzen, die einzelne Sender erreicht hätten (Ofcom-Leitlinien zur Bereitstellung von Zugangsdiensten für Fernsehen und On-Demand).
Der US-Ansatz ist qualitativ. Die FCC verabschiedete am 20. Februar 2014 Qualitätsstandards für Untertitel, die Genauigkeit, Synchronität, Vollständigkeit und Platzierung abdecken, und sagte lediglich, die Verzögerung bei Live-Untertiteln ‘sollte auf ein Minimum begrenzt werden, vereinbar mit einer genauen Wiedergabe des Gesagten’ (FCC, Qualitätsstandards für Untertitel). Kanada reguliert die Genauigkeit statt der Zeit: Die Broadcasting Regulatory Policy 2019-308 des CRTC verlangt, dass englischsprachige Live-Untertitel im NER-Modell 98 erreichen. Praktisch bedeutet das, dass ein um 10 Sekunden verspäteter Untertitel in den meisten Teilen der Welt vollständig regelkonform sein kann.
| Metrik | Wert | Quelle |
|---|---|---|
| Frühere Ofcom-Vorgabe | Maximal 3 Sekunden Verzögerung | Ofcom-Kodex für Zugangsdienste im Fernsehen |
| Aktuelle Ofcom-Vorgabe | Mittelwert von höchstens 4,5 Sekunden über das Live-Programm | Ofcom-Leitlinien zur Bereitstellung von Zugangsdiensten für TV und On-Demand |
| Frühere Ofcom-Vorgabe zur Untertitelgeschwindigkeit: vorproduziert / live | 160-180 WPM / 200 WPM | Ofcom-Konsultation 2023, laut Liam O’Dell |
| Numerische Latenzgrenze der FCC | Keine (Verzögerung ‘auf ein Minimum begrenzt’) | FCC 14-12, verabschiedet am 20. Feb. 2014 |
| FCC-Verbot von reiner Teleprompter-ENT-Untertitelung bei Live-Programmen | 4 große Networks und Partnersender in den 25 größten Märkten | FCC 14-12 |
| FCC-Untertitelung neuer nicht ausgenommener Programme | 100% seit dem 1. Januar 2006 | 47 CFR 79.1 |
| CRTC-Genauigkeitsanforderung für englische Live-Untertitel | NER-Wert von 98, ab dem 1. September 2019 | CRTC 2019-308 |
| CRTC-Überwachungspflicht | 2 Live-Sendungen pro Monat, davon 1 Nachrichtensendung | CRTC 2019-308 |
Kontext-Hinweis: Australiens ACMA setzt unter dem Broadcasting Services (Television Captioning) Standard 2023, in Kraft seit dem 1. Oktober 2023, ebenfalls keine numerische Latenz fest und beurteilt Lesbarkeit, Genauigkeit und Verständlichkeit im Einzelfall.
Die neuesten Regeln weiten die Pflichten auf das Streaming aus, statt die Verzögerung zu verschärfen. Kanadas CRTC 2026-98 verlangt von Online-Streamern, 80% ihres Katalogs bis Mai 2030 und 100% bis Mai 2031 zu untertiteln, mit Untertiteln bei neuen originalen Live- und vorproduzierten Programmen innerhalb eines Jahres (CRTC 2026-98, 25. Mai 2026). Ofcoms am 14. Mai 2026 veröffentlichter Entwurf des Tier 1 Accessibility Code schlägt vier Jahre nach Veröffentlichung eine Untertitelquote von 80% für die größten Streamer vor (Ofcom, Konsultation zum Tier 1 Accessibility Code).
| Metrik | Wert | Quelle |
|---|---|---|
| Untertitelung des Katalogs kanadischer Streamer | 80% bis Mai 2030, 100% bis Mai 2031 | CRTC 2026-98 |
| Kanadische Genauigkeitsanforderung für vorproduzierte Originalprogramme bei Streamern | 100% | CRTC 2026-98 |
| Ofcom-Untertitelquote Tier 1, Jahr 4 / Jahr 1 | 80% / 20% | Ofcom, Entwurf des Tier 1 Accessibility Code, Mai 2026 |
| Untertitelquote der BBC On-Demand, Jahr 4 | 90% | Ofcom, Entwurf des Tier 1 Accessibility Code, Mai 2026 |
| Schwelle für Tier 1 | 500.000+ durchschnittliche monatliche Nutzer im Vereinigten Königreich | Ofcom, Entwurf des Tier 1 Accessibility Code, Mai 2026 |
3. Genauigkeit: Die 98%-NER-Linie und wer sie erreicht
Verzögerung und Genauigkeit stehen im Zielkonflikt, weshalb Latenzzahlen nur neben Genauigkeitszahlen Sinn ergeben. Der gängige Maßstab ist das NER-Modell, das Live-Untertitel als (Wörter minus Bearbeitungs- und Erkennungsfehler) im Verhältnis zu den Wörtern bewertet. 98% gelten als ‘akzeptabel’, 98,5-98,99% als ‘gut’, 99-99,49% als ‘sehr gut’ und über 99,5% als ‘hervorragend’ (Romero-Fresco und Martínez, NER-Modell, 2015). Die Schwelle wirkt großzügig, bis man sie übersetzt: Bei 98% sind zwei von 100 Wörtern falsch, fehlend oder gewichtete Fehler.
Britische Sender übersprangen die Latte im Durchschnitt: 98,38% über Ofcoms vier Runden und 98,55% in der letzten, gemessen an 78.000 Untertiteln und 546.000 Wörtern (Moores, JoSTrans 33). Doch Durchschnitte verbergen den schwachen Rand. Im Oktober-November 2014 erreichten 77% der britischen Sendungen 98% oder mehr, gegenüber 74% im April-Mai 2014, und Nachrichten waren mit 98,75% das genaueste Genre (Ofcom, dritter Bericht, 2015). Englischsprachige nationale US-Nachrichtensendungen schnitten besser ab, mit einem Schnitt von 98,8% und 14 von 20 Stichproben, die als akzeptabel oder besser bewertet wurden, während spanischsprachige Nachrichtensendungen auf 97,04% fielen (Fresno, 2024).
| Metrik | Wert | Quelle |
|---|---|---|
| NER-Schwellen akzeptabel / hervorragend | 98% / über 99,5% | Romero-Fresco und Martínez, 2015 |
| Genauigkeit britischer Live-Untertitel, Durchschnitt der vier Runden | 98,38% | Ofcom-Daten über Moores, JoSTrans 33 |
| Genauigkeit britischer Live-Untertitel, letzte Runde | 98,55% | Ofcom-Daten über Moores, JoSTrans 33 |
| Britische Sendungen mit 98% oder mehr, Okt.-Nov. 2014 (gegenüber Apr.-Mai 2014) | 77% (74%) | Ofcom, dritter Bericht, 2015 |
| Genauigkeit des Nachrichtengenres im Vereinigten Königreich | 98,75% | Ofcom, dritter Bericht, 2015 |
| Englischsprachige nationale US-Nachrichtensendungen, durchschnittlicher NER | 98,8% (14 von 20 Stichproben akzeptabel oder besser) | Fresno, Universal Access in the Information Society, 2024 |
| Spanischsprachige US-Nachrichtensendungen, durchschnittlicher NER | 97,04% (Telemundo 97,00%, Univision 97,10%) | Fresno, JoSTrans 42, 2024 |
| Textreduktion: spanische gegenüber englischen Nachrichtensendungen | 26% gegenüber 5-6% | Fresno, JoSTrans 42, 2024 |
Kontext-Hinweis: Die Sprechgeschwindigkeit ist die versteckte dritte Variable. Ofcom empfiehlt, dass Untertitel im Schnitt unter 180 Wörtern pro Minute liegen, doch fast alle analysierten Sendungen hatten kurze Spitzen über 200 WPM, und wenn diese Spitzen als Fehler gezählt wurden, lagen 68% der Sendungen unter 98% (Ofcom, dritter Bericht, 2015). Die Studie zu englischsprachigen US-Nachrichtensendungen fand, dass fast zwei Drittel der Fehler geringfügig waren.
4. Was Verzögerung die Zuschauer kostet
Das Publikum für Live-Untertitel ist weit größer als die Gehörlosengemeinschaft allein. Ofcom schätzte, dass rund 7,6 Millionen Erwachsene im Vereinigten Königreich Untertitel genutzt hatten, von denen nur 1,4 Millionen eine Hörbeeinträchtigung hatten (Ofcom-Pressemitteilung über Wired-Gov, Mai 2013). Das bedeutet mehr als 6 Millionen Untertitelnutzer ohne Hörbeeinträchtigung (7,6 Millionen minus 1,4 Millionen), von denen viele in lauten Räumen oder mit leisem Ton schauen. Ofcoms Leitlinien zitieren außerdem YouGov-Daten, nach denen 61% der 18- bis 24-Jährigen Untertitel eingeschaltet bevorzugen. Weltweit schätzt die WHO, dass heute 430 Millionen Menschen eine Rehabilitation wegen behinderndem Hörverlust benötigen, bis 2050 mehr als 700 Millionen.
| Metrik | Wert | Quelle |
|---|---|---|
| Erwachsene im Vereinigten Königreich, die Untertitel genutzt haben | Etwa 7,6 Millionen (Spanne 7,0-8,1 Millionen) | Ofcom, Mai 2013 |
| Davon mit Hörbeeinträchtigung | Etwa 1,4 Millionen (Spanne 1,2-1,6 Millionen) | Ofcom, Mai 2013 |
| 18- bis 24-Jährige im Vereinigten Königreich, die Untertitel eingeschaltet bevorzugen | 61% | YouGov, zitiert in den Ofcom-Leitlinien zu Zugangsdiensten |
| Anteil der Programmstunden der britischen öffentlich-rechtlichen Sender (PSB) und größeren On-Demand-Dienste mit Untertiteln, 2024 | 88% | Ofcom-Bericht zu Zugangsdiensten, Jan.-Dez. 2024 (veröffentlicht am 19. Mai 2025) |
| Untertitelte Stunden auf verpflichteten Kanälen im Vereinigten Königreich, 2005 gegenüber 2013 | 40,5% gegenüber 81,9% | Ofcom, erster Bericht zur Live-Untertitelung, 2014 |
| Menschen, die eine Rehabilitation wegen behinderndem Hörverlust benötigen | 430 Millionen | WHO-Faktenblatt, aktualisiert im März 2026 |
| Menschen mit prognostiziertem Hörverlust bis 2050 | Knapp 2,5 Milliarden | WHO-Faktenblatt, aktualisiert im März 2026 |
Die Verzögerung bemerken Zuschauer zuerst. Die größte jüngere Nutzerstudie bat 216 gehörlose und schwerhörige Zuschauer, 70 Live-TV-Clips unter vier Bedingungen zu bewerten, was 4.832 Bewertungen ergab. Dieselben TV-Untertitel erhielten mit ihrer ursprünglichen Sendeverzögerung 3,66 von 7 und synchronisiert 5,09, ein weit größerer Ausschlag als der Abstand zwischen synchronisierten TV- und ASR-Untertiteln (Thompson et al., Are Caption Metrics Broken?, arXiv 2609.11408, September 2026). ASR-Untertitel mit zwei Sekunden Verzögerung schnitten deutlich besser ab, mit 4,81 gegenüber 5,20 synchronisiert.
Dieselbe Studie untergräbt die Vorstellung, dass Genauigkeitswerte die Qualität erfassen. Nur 11 von 70 TV-Clips und 4 von 70 ASR-Clips erreichten die NER-Schwelle von 98, und doch bewerteten die Zuschauer synchronisierte ASR- und TV-Untertitel etwa gleich, und die Korrelation zwischen Metriken und Bewertungen sank bei ASR-Ausgaben stark (WER r = -0,390 gegenüber -0,687 bei TV-Untertiteln). Gallaudets frühere CHI-2024-Studie kam zu einem ähnlichen Schluss: Die Teilnehmer mochten Sendeverzögerungen ausdrücklich nicht, und gängige Genauigkeitsmetriken korrelierten nur schwach damit, wie Zuschauer Untertitel bewerteten.
| Metrik | Wert | Quelle |
|---|---|---|
| Teilnehmer / Bewertungen / Clips | 216 / 4.832 / 70 | Thompson et al., arXiv 2609.11408, 2026 |
| Bewertung von TV-Untertiteln: ursprüngliche Verzögerung gegenüber synchronisiert (7-Punkte-Skala) | 3,66 gegenüber 5,09 | Thompson et al., 2026 |
| Bewertung von ASR-Untertiteln: 2 s Verzögerung gegenüber synchronisiert | 4,81 gegenüber 5,20 | Thompson et al., 2026 |
| Mittlerer WER: TV-Untertitel gegenüber ASR-Untertiteln | 33,8% gegenüber 17,2% | Thompson et al., 2026 |
| Mittlerer NER: TV-Untertitel gegenüber ASR-Untertiteln | 95,28 gegenüber 94,34 | Thompson et al., 2026 |
| Clips, die NER 98 erreichen: TV gegenüber ASR | 11 von 70 gegenüber 4 von 70 | Thompson et al., 2026 |
| Korrelation des WER mit Zuschauerbewertungen: TV gegenüber ASR | r = -0,687 gegenüber -0,390 | Thompson et al., 2026 |
Kontext-Hinweis: Der hohe WER bei TV-Untertiteln spiegelt zum Teil wider, dass Sendeuntertitel paraphrasieren und verdichten, was der WER bestraft und der NER nicht. Genau diese Lücke ist der Grund, weshalb die Autoren argumentieren, dass aktuelle Metriken nicht technologieneutral sind.
5. ASR-Geschwindigkeit: Streaming-Latenz gegenüber menschlichem Gespräch
Die Latenz der Erkennungsengine ist nicht mehr die Hauptquelle der Untertitelverzögerung. AssemblyAI meldete eine mediane Streaming-Latenz von 307 ms für Universal-Streaming gegenüber 516 ms für Deepgram Nova-3 sowie einen P99 von 1.012 ms gegenüber 1.907 ms, gemessen vom Ende eines Wortes im Audio bis zu seinem ersten Erscheinen in einem Teiltranskript über 205+ Stunden Audio (AssemblyAI, Introducing Universal-Streaming, 2. Juni 2025). Deepgrams eigene Launch-Daten bezifferten die mediane Streaming-Wortfehlerrate von Nova-3 auf 6,84% gegenüber 14,92% bei den getesteten Wettbewerbern (Deepgram, Introducing Nova-3, Februar 2025). Beides sind Herstellerbenchmarks und als Bestwerte zu lesen. Unsere Speech-to-Text-Statistiken behandeln die Genauigkeit weiterer Engines.
Offene Modelle tauschen mehr Verzögerung gegen Stabilität. Das akademische System Whisper-Streaming erreichte 3,3 Sekunden durchschnittliche Latenz bei langer englischer Sprache aus dem ESIC-Testset des Europäischen Parlaments, und der Zielkonflikt ist in den Ergebnissen explizit: englischer WER von 8,5% bei 3,27 s Latenz mit 0,5-s-Chunks gegenüber 8,0% bei 5,45 s mit 2-s-Chunks (Machacek, Dabre und Bojar, arXiv 2307.14743, IJCNLP-AACL 2023). Bemerkenswert: Eine Whisper-Konfiguration mit 5 Sekunden landet genau auf dem britischen Sendedurchschnitt von vor einem Jahrzehnt.
| Metrik | Wert | Quelle |
|---|---|---|
| AssemblyAI Universal-Streaming, mediane / P99-Latenz | 307 ms / 1.012 ms | AssemblyAI, Juni 2025 |
| Deepgram Nova-3, mediane / P99-Latenz (AssemblyAI-Test) | 516 ms / 1.907 ms | AssemblyAI, Juni 2025 |
| Deepgram Nova-3, medianer WER: Streaming / Batch | 6,84% / 5,26% | Deepgram, Feb. 2025 |
| Deepgram-Nova-3-Benchmark-Set | 2.703 Dateien, 81,69 Stunden, 9 Domänen | Deepgram, Feb. 2025 |
| Durchschnittliche Latenz von Whisper-Streaming, Englisch | 3,3 Sekunden | Machacek et al., 2023 |
| Whisper-Streaming Englisch: 0,5-s-Chunk gegenüber 2,0-s-Chunk | 8,5% WER bei 3,27 s gegenüber 8,0% WER bei 5,45 s | Machacek et al., 2023 |
| Latenz von Whisper-Streaming, Deutsch / Tschechisch (0,5-s-Chunk) | 4,11 s / 4,69 s | Machacek et al., 2023 |
Die Obergrenze für Echtzeit setzt das menschliche Gespräch. In 10 Sprachen betrug die mittlere Lücke zwischen Frage und Antwort +208 ms, bei einer Spanne von +7 ms im Japanischen bis +469 ms im Dänischen (Stivers et al., PNAS 2009). Der GPT-4o-Launch von OpenAI nannte Audioantworten in nur 232 ms und im Schnitt 320 ms, gegenüber 2,8 Sekunden (GPT-3.5) und 5,4 Sekunden (GPT-4) beim früheren Pipeline-Sprachmodus, der getrennte Transkriptions-, Sprach- und Sprachausgabemodelle verkettete. Die Lehre für die Live-Untertitelung ist dieselbe: Jede zusätzliche Stufe in der Kette fügt Sekunden hinzu, und die Stufe, die früher dominierte, die Erkennung selbst, ist inzwischen die kleinste.
| Metrik | Wert | Quelle |
|---|---|---|
| Mittlere Lücke zwischen Frage und Antwort, 10 Sprachen | +208 ms | Stivers et al., PNAS 2009 (jüngste verfügbare Daten) |
| Mittelwert der schnellsten / langsamsten Sprache | +7 ms (Japanisch) / +469 ms (Dänisch) | Stivers et al., PNAS 2009 |
| GPT-4o-Audioantwort: Minimum / Durchschnitt | 232 ms / 320 ms | OpenAI, Mai 2024 |
| Durchschnittliche Latenz des Pipeline-Sprachmodus: GPT-3.5 / GPT-4 | 2,8 s / 5,4 s | OpenAI, Mai 2024 |
| In der Zuschauerstudie 2026 verwendete ASR-Untertitelverzögerung | 2 Sekunden im Schnitt | Thompson et al., arXiv 2609.11408 |
6. Automatisierung übernimmt die Untertitelkette
Die menschlichen Fachkräfte hinter Live-Untertiteln sind durch Geschwindigkeitsgrenzen definiert. Der US-Echtzeit-Maßstab, der NCRA Certified Realtime Reporter, verlangt einen fünfminütigen Echtzeittest mit 200 Wörtern pro Minute bei 96% Genauigkeit, und ein EBU-Bericht beschreibt Live-Untertitelung als das Mithalten mit Sprechern von bis zu 200 WPM. Britische Respeaker sagten Forschern, die Grundausbildung dauere 2-3 Monate, bis zur Sicherheit vergingen 1,5-2 Jahre (Moores, JoSTrans 33). Diese Einschränkungen erklären, warum automatische Untertitelung so schnell skalierte, sobald die Genauigkeit nahe herankam.
Die Mengenverschiebung zeigt sich in Unternehmensmeldungen. Ai-Medias automatische LEXI-Untertitel erreichten im Geschäftsjahr 2025 79,2 Millionen Minuten, gegenüber weniger als 10 Millionen vier Jahre zuvor, eine vierjährige CAGR von 69%, und LEXI macht inzwischen den größten Teil der Nutzung in seinem iCap-Netzwerk aus (Ai-Media, Ergebnisse Geschäftsjahr 2025, ASX-Mitteilung, 28. August 2025). Technologieprodukte machten 63% des Umsatzes von Ai-Media aus, von null fünf Jahre zuvor. Unabhängige Tests desselben Systems ergaben eine NER-Genauigkeit von 98,56% auf Englisch und 98,26% auf Spanisch, auf Augenhöhe mit menschlichen Untertiteln, außer bei umgangssprachlichen Inhalten mit mehreren Sprechern (Romero-Fresco und Van Gauwbergen, Fit for What Purpose?, 2025). Mehr zur menschlichen Seite des Berufs finden Sie in unseren Statistiken zur Genauigkeit von Gerichtsprotokollen.
| Metrik | Wert | Quelle |
|---|---|---|
| NCRA-CRR-Echtzeitstandard | 200 WPM bei 96% Genauigkeit (5-Minuten-Test) | NCRA |
| Respeaker-Grundausbildung / Zeit bis zur Sicherheit | 2-3 Monate / 1,5-2 Jahre | Moores, JoSTrans 33 |
| Minuten automatischer LEXI-Untertitel von Ai-Media, Geschäftsjahr 2025 | 79,2 Millionen | Ai-Media, Ergebnisse Geschäftsjahr 2025, ASX |
| LEXI-Minuten vier Jahre zuvor | Weniger als 10 Millionen (69% vierjährige CAGR) | Ai-Media, Ergebnisse Geschäftsjahr 2025, ASX |
| Technologieanteil am Umsatz von Ai-Media | 63% (Gesamtumsatz 64,9 Millionen USD) | Ai-Media, Ergebnisse Geschäftsjahr 2025, ASX |
| NER-Genauigkeit automatischer Untertitel: Englisch / Spanisch | 98,56% / 98,26% | Romero-Fresco und Van Gauwbergen, 2025 |
| Analysierte Live-Untertitel im Vergleich automatischer und menschlicher Ausgabe, Vereinigtes Königreich/USA/Kanada 2018-2022 | Etwa 17.000 | Romero-Fresco und Fresno, Linguistica Antverpiensia 22, 2023 |
Kontext-Hinweis: Der bislang größte Vergleich von Mensch und Maschine (Romero-Fresco und Fresno, Linguistica Antverpiensia, 2023) fand, dass unbearbeitete automatische Untertitel nahe an 98% herankamen, mit anhaltenden Schwächen bei Zeichensetzung, Eigennamen, Zahlen und Sprecheridentifikation. Eine geringere Engine-Latenz behebt das nicht: Ein schneller falscher Name bleibt ein falscher Name.
Zusammenfassung: Latenz von Live-Untertiteln in Echtzeit in Zahlen
| Metrik | Wert | Quelle |
|---|---|---|
| Durchschnittliche Latenz britischer Live-Untertitel, Ende 2014 | 5,1 Sekunden | Ofcom, dritter Bericht, 2015 |
| Britische Stichproben, die die 3-s-Vorgabe erfüllen, zweite Runde | 4 von 72 | Ofcom, zweiter Bericht, 2014 |
| Längste erfasste Verzögerung im Vereinigten Königreich | 21 Sekunden | Ofcom, zweiter Bericht, 2014 |
| Aktuelle Latenzvorgabe von Ofcom | Mittelwert von 4,5 Sekunden oder weniger | Ofcom-Leitlinien zu Zugangsdiensten |
| Numerische Latenzgrenze der FCC | Keine | FCC 14-12, 2014 |
| CRTC-Genauigkeit für englische Live-Untertitel | NER 98 | CRTC 2019-308 |
| Untertitelverzögerung bei spanischsprachigen US-Nachrichtensendungen | 8,2 Sekunden im Schnitt | Fresno, JoSTrans 42, 2024 |
| Untertitel spanischsprachiger US-Nachrichtensendungen mit mehr als 10 Sekunden Verzögerung | 20% | Fresno, JoSTrans 42, 2024 |
| Mittlere Verzögerung bei Live-Fernsehausschnitten aus den USA | 8,46 Sekunden | Thompson et al., arXiv 2609.11408, 2026 |
| Bewertung von TV-Untertiteln: verzögert gegenüber synchronisiert | 3,66 gegenüber 5,09 von 7 | Thompson et al., 2026 |
| Genauigkeit britischer Live-Untertitel, Durchschnitt der vier Runden | 98,38% | Ofcom-Daten über Moores, JoSTrans 33 |
| Genauigkeit englischsprachiger nationaler US-Nachrichtensendungen | 98,8% | Fresno, 2024 |
| Genauigkeit automatischer Untertitel, Englisch | 98,56% | Romero-Fresco und Van Gauwbergen, 2025 |
| Erwachsene im Vereinigten Königreich, die Untertitel genutzt haben | Etwa 7,6 Millionen | Ofcom, 2013 |
| Untertitelte Stunden britischer PSB und größerer On-Demand-Dienste, 2024 | 88% | Ofcom-Bericht zu Zugangsdiensten 2024 |
| Mediane Streaming-Latenz von AssemblyAI | 307 ms | AssemblyAI, Juni 2025 |
| Durchschnittliche Latenz von Whisper-Streaming | 3,3 Sekunden | Machacek et al., 2023 |
| Mittlere menschliche Lücke beim Sprecherwechsel | 208 ms | Stivers et al., PNAS 2009 |
| LEXI-Untertitelminuten von Ai-Media, Geschäftsjahr 2025 | 79,2 Millionen | Ai-Media, Ergebnisse Geschäftsjahr 2025 |
| Untertitelung des Katalogs kanadischer Streamer bis Mai 2031 | 100% | CRTC 2026-98 |
Methodik und Quellen
Jede Zahl oben wurde bis zu der Regulierungsbehörde, Meldung oder begutachteten Arbeit zurückverfolgt, die sie hervorgebracht hat. Mehrere Ofcom-PDFs ließen sich nicht direkt abrufen, daher stammen die britischen Zahlen aus Ofcom-Pressemitteilungen (nachveröffentlicht bei Wired-Gov), Zusammenfassungen von Regulierern (EPRA) und der begutachteten Analyse des Ofcom-Datensatzes (Moores), jeweils im Text genannt. Herstellerbenchmarks sind als Herstellerdaten gekennzeichnet. Allgemeine Markt- und Nutzungsdaten zu Untertiteln finden Sie in unseren Statistiken zu Untertiteln und Closed Captions.
- Ofcom: Pressemitteilung zum dritten Bericht zur Live-Untertitelung (Wired-Gov, Mai 2015), Pressemitteilung zur Konsultation zur Live-Untertitelung (Wired-Gov, Mai 2013), Leitlinien zur Bereitstellung von Zugangsdiensten für Fernsehen und On-Demand, Bericht zu Zugangsdiensten Jan.-Dez. 2024, Konsultation zum Tier 1 Accessibility Code (Mai 2026)
- EPRA: Zusammenfassung von Ofcoms erstem Bericht zur Live-Untertitelung (April 2014)
- Limping Chicken: Bericht zu Ofcoms zweitem Bericht zur Live-Untertitelung (November 2014)
- Liam O’Dell: Bericht zu Ofcoms Konsultation zum Zugangskodex 2023 und Konsultation zum Tier-1-Kodex
- FCC: Qualitätsstandards für Untertitel, FCC 14-12 (2014) und 47 CFR 79.1
- CRTC: Broadcasting Regulatory Policy 2019-308 und Broadcasting Regulatory Policy 2026-98
- ACMA / Australische Regierung: Broadcasting Services (Television Captioning) Standard 2023
- EBU: Bericht zu Zugangsdiensten und Live-Untertitelung (i044) und Tech 3370, EBU-TT Teil 3 Live-Untertitelung
- Thompson, Kushalnagar, Vogler et al.: Are Caption Metrics Broken?, arXiv 2609.11408 (September 2026); Glasser, Kushalnagar und Vogler: How Users Experience Closed Captions on Live Television, CHI 2024
- Fresno: Closed Captions en español, JoSTrans 42 (2024) und Live captioning accuracy in English-language newscasts in the USA (2024)
- Moores: Live-Untertitelung bei Live-Veranstaltungen, JoSTrans 33 (enthält die Analyse des Ofcom-Datensatzes)
- Romero-Fresco und Fresno: The accuracy of automatic and human live captions in English (2023); Romero-Fresco und Van Gauwbergen: Fit for What Purpose? (2025); Romero-Fresco und Martínez: das NER-Modell (2015)
- Machacek, Dabre und Bojar: Turning Whisper into Real-Time Transcription System (2023)
- AssemblyAI: Introducing Universal-Streaming (Juni 2025); Deepgram: Introducing Nova-3 (Februar 2025)
- OpenAI: Hello GPT-4o (Mai 2024)
- Stivers et al.: Universals and cultural variation in turn-taking in conversation, PNAS (2009)
- Ai-Media: Ergebnisse Geschäftsjahr 2025, ASX-Mitteilung (August 2025)
- NCRA: Certified Realtime Reporter
- WHO: Faktenblatt zu Taubheit und Hörverlust (aktualisiert im März 2026)
- Daten-Hinweis: Ofcoms Latenzmessungen je Sender (2013-2015) sind älter als drei Jahre und bleiben der jüngste verfügbare öffentliche Datensatz dieser Art; die Runden berichten eine Mischung aus Medianen und Mittelwerten (5,6, 5,8, 5,7 auf 5,1 und ein Vier-Runden-Durchschnitt von 5,3 über Moores), daher sind sie als Spanne und nicht als Trendlinie zu verstehen. Die Ofcom-Schätzung zu Untertitelnutzern (7,6 Millionen) stammt aus dem Jahr 2013 und die Turn-Taking-Daten von Stivers aus 2009. Die Zahlen von AssemblyAI und Deepgram sind Herstellerbenchmarks; der Vergleich von AssemblyAI maß einen Wettbewerber an seinem eigenen Testset, und unabhängige Tests von Nova-3 berichten einen höheren WER als Deepgrams Zahl. Die Arbeit von Thompson et al. von 2026 ist ein arXiv-Preprint und noch nicht begutachtet. Die Umsatzzahl von Ai-Media wird so gezeigt, wie sie in ihrer ASX-Mitteilung berichtet wurde. Zwei unabhängige Bewertungen desselben automatischen Systems berichten je nach Schwierigkeit der Inhalte unterschiedliche Spitzenwerte der Genauigkeit, und die Zuschauerstudie von 2026 fand bei Live-Fernsehausschnitten weit niedrigere NER-Bestehensquoten, sodass die automatische Genauigkeit stark vom Genre abhängt. Ofcoms Tier-1-Kodex ist ein Entwurf, dessen Konsultation am 7. August 2026 endete, und eine abschließende Stellungnahme wird erwartet.
Zuletzt aktualisiert: 3. Oktober 2026. Wir aktualisieren diese Zusammenstellung vierteljährlich, und die nächste Aktualisierung wird erwartet, wenn Ofcom seine abschließende Stellungnahme zum Tier 1 Accessibility Code und seinen Bericht zu Zugangsdiensten für Januar bis Dezember 2025 veröffentlicht.