Los subtítulos en vivo de la televisión del Reino Unido iban de media entre 5,1 y 5,8 segundos por detrás del habla en las rondas de medición de Ofcom, y solo 4 de 72 muestras de su segunda ronda cumplieron la antigua directriz de 3 segundos (Ofcom, informes de calidad del subtitulado en vivo 2014-2015). El problema no ha desaparecido: un estudio de 2024 sobre noticieros en español de EE. UU. midió un retraso medio de 8,2 segundos, con subtítulos individuales que llegaron hasta 41 segundos tarde (Fresno, JoSTrans 2024), y un estudio de septiembre de 2026 midió una media de 8,46 segundos en fragmentos de televisión estadounidense en directo. Mientras tanto, los motores de reconocimiento de voz en streaming informan ahora una latencia mediana por palabra cercana a los 300 milisegundos (AssemblyAI, junio de 2025), de modo que el cuello de botella del subtitulado en vivo se está desplazando del mecanógrafo humano a la cadena de emisión. Reunimos datos de Ofcom, la FCC, el CRTC, estudios revisados por pares de la Universidad Gallaudet y de la Universidade de Vigo, artículos de benchmark de arXiv, los registros de Ai-Media ante la ASX, la OMS y otras fuentes primarias que figuran en la metodología. Para un panorama más amplio, consulta nuestro resumen de estadísticas de subtitulado en vivo.
TL;DR
- La latencia media de los subtítulos en vivo del Reino Unido bajó de 5,7 a 5,1 segundos entre abril-mayo y octubre-noviembre de 2014, aún muy por encima de la directriz de 3 segundos (Ofcom, tercer informe de subtitulado en vivo, 2015).
- Solo 4 de 72 muestras del Reino Unido cumplieron la directriz de 3 segundos en la segunda ronda, y el retraso más largo llegó a 21 segundos (Ofcom, segundo informe, 2014).
- Ofcom pide ahora una latencia media de no más de 4,5 segundos en la programación en directo (Ofcom, Directrices para la Prestación de Servicios de Accesibilidad en Televisión y a la Carta).
- Los noticieros en español de EE. UU. tuvieron un retraso medio de subtítulos de 8,2 segundos, y el 20% de los subtítulos llegó con más de 10 segundos de retraso (Fresno, JoSTrans 42, 2024).
- Los subtítulos de televisión con retraso original de emisión (media de 8,46 s) fueron valorados con 3,66/7 frente a 5,09/7 al sincronizarlos (Thompson et al., arXiv 2609.11408, 2026).
- Los subtítulos en vivo del Reino Unido promediaron un 98,38% de precisión NER en cuatro rondas de Ofcom, por encima del umbral del 98% (datos de Ofcom vía Moores, JoSTrans 33).
- Los noticieros nacionales en inglés de EE. UU. promediaron un 98,8% de precisión NER (Fresno, Universal Access in the Information Society, 2024).
- Un sistema de subtitulado automático obtuvo un 98,56% de NER en inglés y un 98,26% en español (Romero-Fresco y Van Gauwbergen, 2025).
- AssemblyAI informó una latencia mediana en streaming de 307 ms frente a 516 ms de Deepgram Nova-3 (AssemblyAI, junio de 2025).
- Whisper-Streaming alcanzó una latencia media de 3,3 segundos en habla larga en inglés (Machacek, Dabre y Bojar, IJCNLP-AACL 2023).
- Los humanos responden a una pregunta en una media de 208 ms en 10 idiomas (Stivers et al., PNAS 2009), la referencia que persiguen los sistemas en tiempo real.
- Los subtítulos automáticos LEXI de Ai-Media alcanzaron 79,2 millones de minutos en el ejercicio fiscal de 2025, frente a menos de 10 millones cuatro años antes (resultados del ejercicio fiscal de 2025 de Ai-Media, ASX).
1. Retraso Medido: Cuánto Se Quedan Atrás los Subtítulos en Vivo
El conjunto de datos público más completo sobre el retraso de los subtítulos en vivo sigue siendo el del Reino Unido, y cuenta una historia coherente: un subtítulo en vivo típico aparece más de 5 segundos después de pronunciadas las palabras. Ofcom muestreó programas de noticias, entretenimiento y tertulias de la BBC, ITV, Channel 4, Channel 5 y Sky a lo largo de cuatro rondas entre 2013 y 2015. El primer informe halló una latencia mediana de 5,6 segundos (resumen de la EPRA del primer informe de Ofcom, abril de 2014), y el segundo halló 5,8 segundos, con solo 4 de 72 muestras dentro de la directriz de 3 segundos (reportaje de Limping Chicken sobre el segundo informe de Ofcom, noviembre de 2014).
La mejora posterior fue real, pero pequeña. El tercer informe de Ofcom registró una caída de la latencia media de 0,6 segundos, de 5,7 a 5,1 segundos, entre abril-mayo y octubre-noviembre de 2014 (comunicado de prensa de Ofcom vía Wired-Gov, mayo de 2015). Recortar medio segundo de un retraso de cinco exigió que las cadenas cambiaran flujos de trabajo, no solo software, y por eso la cifra se estancó. Estas son las mediciones de latencia de Ofcom más recientes disponibles (2014-2015); no se ha publicado ningún conjunto de datos más nuevo por cadena.
| Métrica | Valor | Fuente |
|---|---|---|
| Latencia mediana de subtítulos en vivo en el Reino Unido, primera ronda | 5,6 segundos | Primer informe de subtitulado en vivo de Ofcom, abril de 2014 |
| Latencia en el Reino Unido, segunda ronda | 5,8 segundos | Segundo informe de Ofcom, noviembre de 2014 |
| Muestras que cumplen la directriz de 3 segundos, segunda ronda | 4 de 72 | Segundo informe de Ofcom, 2014 |
| Retraso más largo registrado, segunda ronda | 21 segundos | Segundo informe de Ofcom, 2014 |
| Latencia media en el Reino Unido, de abril-mayo de 2014 a octubre-noviembre de 2014 | 5,7 s a 5,1 s (-0,6 s) | Tercer informe de Ofcom, mayo de 2015 |
| Latencia media en el Reino Unido en las cuatro rondas | 5,3 segundos | Datos de Ofcom vía Moores, JoSTrans 33 |
| Latencia sin sincronización ‘como en vivo’ de subtítulos preparados | 7-8 segundos | Datos de Ofcom vía Moores, JoSTrans 33 |
Nota de contexto: las cifras por ronda mezclan medianas y medias tal como se informaron, por lo que las pequeñas diferencias entre rondas (5,6, 5,7, 5,8) no deben sobreinterpretarse. La cifra de 7-8 segundos para programas sin subtítulos preparados y sincronizados muestra cuánto de la media del Reino Unido depende del guion y no de la transcripción en tiempo real.
Fuera del Reino Unido, los retrasos son mayores. Los subtítulos de los noticieros en español de EE. UU. de Telemundo y Univision iban de media 8,2 segundos por detrás del habla, con un rango de 0,7 a 41 segundos, y el 46% de los subtítulos llegaba con más de 8 segundos de retraso (Fresno, Closed Captions en español, JoSTrans 42, 2024). Un estudio de 2026 con fragmentos de televisión estadounidense en directo midió un retraso medio de 8,46 segundos (DE 3,62) y describió de 7 a 12 segundos como lo típico en los subtítulos de televisión (Thompson et al., arXiv 2609.11408).
| Métrica | Valor | Fuente |
|---|---|---|
| Retraso medio de subtítulos, noticieros en español de EE. UU. | 8,2 segundos | Fresno, JoSTrans 42, 2024 |
| Rango de retrasos, misma muestra | De 0,7 a 41 segundos | Fresno, JoSTrans 42, 2024 |
| Subtítulos con más de 8 / 10 / 12 segundos de retraso | 46% / 20% / 8% | Fresno, JoSTrans 42, 2024 |
| Subtítulos analizados en ese estudio | 5.349 (20 segmentos de diez minutos) | Fresno, JoSTrans 42, 2024 |
| Retraso medio en fragmentos de televisión estadounidense en directo | 8,46 segundos (DE 3,62) | Thompson et al., arXiv 2609.11408, sept. de 2026 |
| Retraso típico citado en subtítulos de televisión de EE. UU. | 7-12 segundos | Thompson et al., arXiv 2609.11408, sept. de 2026 |
| Latencia media en eventos en vivo (no emitidos) con respeaking | 5,8 segundos (rango de 4,3 a 7,5 s) | Moores, JoSTrans 33 |
2. Objetivos Regulatorios: de 3 Segundos a 4,5 Segundos
Los reguladores coinciden en que la latencia importa, pero casi ninguno le pone un número. Ofcom es el único gran regulador de este informe con un objetivo numérico de latencia, y lo movió en la dirección más indulgente: de un retraso máximo de 3 segundos en su Código sobre Servicios de Accesibilidad en Televisión a una media de no más de 4,5 segundos en la programación en directo de un proveedor. Durante la consulta de 2023, Ofcom dijo que las cadenas habían calificado de poco realista el máximo de 3 segundos y que 4,5 segundos equivalían a las mejores latencias que cada cadena había logrado (Directrices de Ofcom para la Prestación de Servicios de Accesibilidad en Televisión y a la Carta).
El enfoque de EE. UU. es cualitativo. La FCC adoptó estándares de calidad de subtítulos el 20 de febrero de 2014 que abarcan precisión, sincronía, integridad y ubicación, y dijo solamente que el retraso de los subtítulos en vivo ‘debe mantenerse al mínimo, de forma coherente con una presentación precisa de lo que se dice’ (FCC, estándares de calidad de subtítulos). Canadá regula la precisión en lugar del tiempo: la Política Regulatoria de Radiodifusión 2019-308 del CRTC exige que los subtítulos en vivo en inglés obtengan 98 en el modelo NER. El efecto práctico es que un subtítulo que llega 10 segundos tarde puede cumplir plenamente la norma en la mayor parte del mundo.
| Métrica | Valor | Fuente |
|---|---|---|
| Directriz anterior de Ofcom | Retraso máximo de 3 segundos | Código de Ofcom sobre Servicios de Accesibilidad en Televisión |
| Directriz actual de Ofcom | Media de no más de 4,5 segundos en la programación en directo | Directrices de Ofcom para la Prestación de Servicios de Accesibilidad en TV y a la Carta |
| Antigua orientación de Ofcom sobre velocidad de subtítulos: pregrabados / en vivo | 160-180 ppm / 200 ppm | Consulta de Ofcom de 2023, según Liam O’Dell |
| Límite numérico de latencia de la FCC | Ninguno (retraso ‘mantenido al mínimo’) | FCC 14-12, adoptada el 20 de feb. de 2014 |
| Prohibición de la FCC del subtitulado ENT solo con teleprompter en programación en directo | 4 grandes cadenas y afiliadas en los 25 mayores mercados | FCC 14-12 |
| Subtitulado de la FCC de programación nueva no exenta | 100% desde el 1 de enero de 2006 | 47 CFR 79.1 |
| Requisito de precisión del CRTC para subtítulos en vivo en inglés | Puntuación NER de 98, desde el 1 de septiembre de 2019 | CRTC 2019-308 |
| Obligación de supervisión del CRTC | 2 programas en directo al mes, incluido 1 de noticias | CRTC 2019-308 |
Nota de contexto: la ACMA de Australia, bajo el Broadcasting Services (Television Captioning) Standard 2023, en vigor desde el 1 de octubre de 2023, tampoco fija una latencia numérica y evalúa la legibilidad, la precisión y la comprensibilidad caso por caso.
Las normas más recientes extienden obligaciones al streaming en lugar de endurecer el retraso. La decisión CRTC 2026-98 de Canadá exige a los servicios de streaming en línea subtitular el 80% de su catálogo para mayo de 2030 y el 100% para mayo de 2031, con subtítulos en los nuevos programas originales en directo y pregrabados en el plazo de un año (CRTC 2026-98, 25 de mayo de 2026). El borrador del Tier 1 Accessibility Code de Ofcom, publicado el 14 de mayo de 2026, propone una cuota de subtitulado del 80% para las mayores plataformas de streaming cuatro años después de su publicación (Ofcom, consulta sobre el Tier 1 Accessibility Code).
| Métrica | Valor | Fuente |
|---|---|---|
| Subtitulado del catálogo de las plataformas de streaming canadienses | 80% para mayo de 2030, 100% para mayo de 2031 | CRTC 2026-98 |
| Requisito canadiense de precisión para programas originales pregrabados en plataformas de streaming | 100% | CRTC 2026-98 |
| Cuota de subtitulado del Tier 1 de Ofcom, año 4 / año 1 | 80% / 20% | Borrador del Tier 1 Accessibility Code de Ofcom, mayo de 2026 |
| Cuota de subtitulado a la carta de la BBC, año 4 | 90% | Borrador del Tier 1 Accessibility Code de Ofcom, mayo de 2026 |
| Umbral del Tier 1 | Más de 500.000 usuarios mensuales medios en el Reino Unido | Borrador del Tier 1 Accessibility Code de Ofcom, mayo de 2026 |
3. Precisión: la Línea del 98% de NER y Quién la Supera
El retraso y la precisión se compensan entre sí, por lo que las cifras de latencia solo tienen sentido junto a las de precisión. La vara de medir habitual es el modelo NER, que puntúa los subtítulos en vivo como (palabras menos errores de edición y de reconocimiento) sobre las palabras. El 98% es ‘aceptable’, el 98,5-98,99% ‘bueno’, el 99-99,49% ‘muy bueno’ y más del 99,5% ‘excelente’ (Romero-Fresco y Martínez, modelo NER, 2015). El umbral parece indulgente hasta que se traduce: al 98%, dos de cada 100 palabras son errores, omisiones o errores ponderados.
Las cadenas del Reino Unido superaron la barra de media: 98,38% en las cuatro rondas de Ofcom y 98,55% en la última, medido sobre 78.000 subtítulos y 546.000 palabras (Moores, JoSTrans 33). Pero las medias esconden la cola. En octubre-noviembre de 2014, el 77% de los programas del Reino Unido alcanzó el 98% o más, frente al 74% en abril-mayo de 2014, y las noticias fueron el género más preciso, con un 98,75% (Ofcom, tercer informe, 2015). Los noticieros nacionales en inglés de EE. UU. lo hicieron mejor, con una media del 98,8% y 14 de 20 muestras valoradas como aceptables o mejores, mientras que los noticieros en español cayeron al 97,04% (Fresno, 2024).
| Métrica | Valor | Fuente |
|---|---|---|
| Umbrales NER de aceptable / excelente | 98% / más del 99,5% | Romero-Fresco y Martínez, 2015 |
| Precisión de los subtítulos en vivo del Reino Unido, media de cuatro rondas | 98,38% | Datos de Ofcom vía Moores, JoSTrans 33 |
| Precisión de los subtítulos en vivo del Reino Unido, última ronda | 98,55% | Datos de Ofcom vía Moores, JoSTrans 33 |
| Programas del Reino Unido con 98% o más, oct.-nov. de 2014 (frente a abr.-mayo de 2014) | 77% (74%) | Tercer informe de Ofcom, 2015 |
| Precisión del género de noticias en el Reino Unido | 98,75% | Tercer informe de Ofcom, 2015 |
| Noticieros nacionales en inglés de EE. UU., NER medio | 98,8% (14 de 20 muestras aceptables o mejores) | Fresno, Universal Access in the Information Society, 2024 |
| Noticieros en español de EE. UU., NER medio | 97,04% (Telemundo 97,00%, Univision 97,10%) | Fresno, JoSTrans 42, 2024 |
| Reducción de texto: noticieros en español frente a en inglés | 26% frente a 5-6% | Fresno, JoSTrans 42, 2024 |
Nota de contexto: la velocidad es la tercera variable oculta. Ofcom recomienda que los subtítulos promedien menos de 180 palabras por minuto, pero casi todos los programas que analizó tenían ráfagas cortas por encima de 200 ppm, y cuando esas ráfagas se contaron como errores, el 68% de los programas cayó por debajo del 98% (Ofcom, tercer informe, 2015). El estudio sobre noticieros en inglés de EE. UU. halló que casi dos tercios de los errores eran leves.
4. Lo Que el Retraso Cuesta a los Espectadores
La audiencia de los subtítulos en vivo es mucho mayor que la comunidad sorda por sí sola. Ofcom estimó que cerca de 7,6 millones de adultos del Reino Unido habían usado subtítulos, de los cuales solo 1,4 millones tenían una discapacidad auditiva (comunicado de prensa de Ofcom vía Wired-Gov, mayo de 2013). Eso significa más de 6 millones de usuarios de subtítulos sin discapacidad auditiva (7,6 millones menos 1,4 millones), muchos de los cuales ven la televisión en habitaciones ruidosas o con el volumen bajo. Las directrices de Ofcom también citan datos de YouGov según los cuales el 61% de los jóvenes de 18 a 24 años prefiere tener los subtítulos activados. A nivel mundial, la OMS estima que 430 millones de personas necesitan rehabilitación por pérdida de audición discapacitante hoy, cifra que superará los 700 millones en 2050.
| Métrica | Valor | Fuente |
|---|---|---|
| Adultos del Reino Unido que han usado subtítulos | Unos 7,6 millones (rango de 7,0-8,1 millones) | Ofcom, mayo de 2013 |
| De ellos, con discapacidad auditiva | Unos 1,4 millones (rango de 1,2-1,6 millones) | Ofcom, mayo de 2013 |
| Jóvenes de 18 a 24 años del Reino Unido que prefieren los subtítulos activados | 61% | YouGov, citado en las directrices de servicios de accesibilidad de Ofcom |
| Proporción de horas de programación de las cadenas PSB y de las plataformas a la carta mayores del Reino Unido con subtítulos, 2024 | 88% | Informe de Servicios de Accesibilidad de Ofcom, ene.-dic. de 2024 (publicado el 19 de mayo de 2025) |
| Horas subtituladas en los canales obligados del Reino Unido, 2005 frente a 2013 | 40,5% frente a 81,9% | Primer informe de subtitulado en vivo de Ofcom, 2014 |
| Personas que necesitan rehabilitación por pérdida de audición discapacitante | 430 millones | Hoja informativa de la OMS, actualizada en marzo de 2026 |
| Personas con alguna pérdida de audición proyectadas para 2050 | Casi 2.500 millones | Hoja informativa de la OMS, actualizada en marzo de 2026 |
El retraso es lo primero que notan los espectadores. El mayor estudio reciente con usuarios pidió a 216 espectadores sordos y con discapacidad auditiva que valoraran 70 fragmentos de televisión en directo en cuatro condiciones, lo que produjo 4.832 valoraciones. Los mismos subtítulos de televisión obtuvieron un 3,66 sobre 7 con su retraso original de emisión y un 5,09 al sincronizarlos, una variación mucho mayor que la diferencia entre los subtítulos de televisión sincronizados y los de ASR (Thompson et al., Are Caption Metrics Broken?, arXiv 2609.11408, septiembre de 2026). Los subtítulos de ASR con dos segundos de retraso se sostuvieron mucho mejor, con 4,81 frente a 5,20 sincronizados.
El mismo estudio socava la idea de que las puntuaciones de precisión capturan la calidad. Solo 11 de 70 fragmentos de televisión y 4 de 70 de ASR alcanzaron el umbral de 98 NER, y sin embargo los espectadores valoraron casi por igual los subtítulos sincronizados de ASR y de televisión, y la correlación entre las métricas y las valoraciones cayó con fuerza para la salida de ASR (WER r = -0,390 frente a -0,687 para los subtítulos de televisión). El estudio anterior de Gallaudet en CHI 2024 llegó a una conclusión similar: los participantes detestaron con fuerza los retrasos de emisión, y las métricas de precisión estándar se correlacionaron solo débilmente con cómo valoraban los espectadores los subtítulos.
| Métrica | Valor | Fuente |
|---|---|---|
| Participantes / valoraciones / fragmentos | 216 / 4.832 / 70 | Thompson et al., arXiv 2609.11408, 2026 |
| Valoración de subtítulos de televisión: retraso original frente a sincronizados (escala de 7 puntos) | 3,66 frente a 5,09 | Thompson et al., 2026 |
| Valoración de subtítulos de ASR: retraso de 2 s frente a sincronizados | 4,81 frente a 5,20 | Thompson et al., 2026 |
| WER medio: subtítulos de televisión frente a subtítulos de ASR | 33,8% frente a 17,2% | Thompson et al., 2026 |
| NER medio: subtítulos de televisión frente a subtítulos de ASR | 95,28 frente a 94,34 | Thompson et al., 2026 |
| Fragmentos que alcanzan NER 98: televisión frente a ASR | 11 de 70 frente a 4 de 70 | Thompson et al., 2026 |
| Correlación del WER con las valoraciones de los espectadores: televisión frente a ASR | r = -0,687 frente a -0,390 | Thompson et al., 2026 |
Nota de contexto: el WER alto de la televisión refleja en parte que los subtítulos de emisión parafrasean y condensan, algo que el WER penaliza y el NER no. Esa brecha es exactamente la razón por la que los autores sostienen que las métricas actuales no son neutrales respecto a la tecnología.
5. Velocidad de los Motores de ASR: Latencia en Streaming frente a la Conversación Humana
La latencia del motor ya no es la principal fuente de retraso de los subtítulos. AssemblyAI informó una latencia mediana en streaming de 307 ms para Universal-Streaming frente a 516 ms de Deepgram Nova-3, y un P99 de 1.012 ms frente a 1.907 ms, medida desde el final de una palabra en el audio hasta su primera aparición en una transcripción parcial, sobre más de 205 horas de audio (AssemblyAI, Introducing Universal-Streaming, 2 de junio de 2025). Los datos de lanzamiento del propio Deepgram situaron la tasa mediana de error de palabras en streaming de Nova-3 en 6,84%, frente a 14,92% de los competidores que probó (Deepgram, Introducing Nova-3, febrero de 2025). Ambos son benchmarks de proveedores y deben leerse como cifras del mejor caso. Nuestras estadísticas de speech-to-text cubren la precisión de más motores.
Los modelos abiertos cambian más retraso por estabilidad. El sistema académico Whisper-Streaming alcanzó una latencia media de 3,3 segundos en habla larga en inglés del conjunto de prueba ESIC del Parlamento Europeo, y el equilibrio es explícito en sus resultados: WER en inglés de 8,5% con 3,27 s de latencia y bloques de 0,5 s frente a 8,0% con 5,45 s y bloques de 2 s (Machacek, Dabre y Bojar, arXiv 2307.14743, IJCNLP-AACL 2023). Obsérvese que una configuración de Whisper de 5 segundos cae justo sobre la media de la emisión británica de una década antes.
| Métrica | Valor | Fuente |
|---|---|---|
| Latencia mediana / P99 de AssemblyAI Universal-Streaming | 307 ms / 1.012 ms | AssemblyAI, junio de 2025 |
| Latencia mediana / P99 de Deepgram Nova-3 (prueba de AssemblyAI) | 516 ms / 1.907 ms | AssemblyAI, junio de 2025 |
| WER mediano de Deepgram Nova-3: streaming / por lotes | 6,84% / 5,26% | Deepgram, feb. de 2025 |
| Conjunto de benchmark de Deepgram Nova-3 | 2.703 archivos, 81,69 horas, 9 dominios | Deepgram, feb. de 2025 |
| Latencia media de Whisper-Streaming, inglés | 3,3 segundos | Machacek et al., 2023 |
| Whisper-Streaming en inglés: bloque de 0,5 s frente a bloque de 2,0 s | 8,5% de WER a 3,27 s frente a 8,0% de WER a 5,45 s | Machacek et al., 2023 |
| Latencia de Whisper-Streaming, alemán / checo (bloque de 0,5 s) | 4,11 s / 4,69 s | Machacek et al., 2023 |
El techo del tiempo real lo marca la conversación humana. En 10 idiomas, el intervalo medio entre una pregunta y su respuesta fue de +208 ms, con un rango de +7 ms en japonés a +469 ms en danés (Stivers et al., PNAS 2009). El lanzamiento de GPT-4o de OpenAI afirmó respuestas de audio en tan solo 232 ms y 320 ms de media, frente a 2,8 segundos (GPT-3.5) y 5,4 segundos (GPT-4) del anterior Modo de Voz en cadena, que enlazaba modelos separados de transcripción, lenguaje y voz. La lección para el subtitulado en vivo es la misma: cada etapa extra de la cadena suma segundos, y la etapa que antes dominaba, el reconocimiento en sí, es ahora la más pequeña.
| Métrica | Valor | Fuente |
|---|---|---|
| Intervalo medio entre pregunta y respuesta, 10 idiomas | +208 ms | Stivers et al., PNAS 2009 (datos más recientes disponibles) |
| Media del idioma más rápido / más lento | +7 ms (japonés) / +469 ms (danés) | Stivers et al., PNAS 2009 |
| Respuesta de audio de GPT-4o: mínima / media | 232 ms / 320 ms | OpenAI, mayo de 2024 |
| Latencia media del Modo de Voz en cadena: GPT-3.5 / GPT-4 | 2,8 s / 5,4 s | OpenAI, mayo de 2024 |
| Retraso de los subtítulos de ASR usado en el estudio con espectadores de 2026 | 2 segundos de media | Thompson et al., arXiv 2609.11408 |
6. La Automatización Toma la Cadena de Subtitulado
La plantilla humana detrás de los subtítulos en vivo está definida por límites de velocidad. El referente de tiempo real de EE. UU., el NCRA Certified Realtime Reporter, exige una prueba en tiempo real de cinco minutos a 200 palabras por minuto con un 96% de precisión, y un informe de la EBU describe el subtitulado en vivo como seguir a locutores de hasta 200 ppm. Los respeakers del Reino Unido dijeron a los investigadores que la formación básica lleva de 2 a 3 meses, mientras que sentirse seguro lleva de 1,5 a 2 años (Moores, JoSTrans 33). Esas limitaciones explican por qué el subtitulado automático escaló tan rápido cuando la precisión se acercó.
El cambio de volumen es visible en los registros de las empresas. Los subtítulos automáticos LEXI de Ai-Media alcanzaron 79,2 millones de minutos en el ejercicio fiscal de 2025, frente a menos de 10 millones cuatro años antes, una TCAC de cuatro años del 69%, y LEXI representa ahora la mayor parte del uso en su red iCap (resultados del ejercicio fiscal de 2025 de Ai-Media, comunicado a la ASX, 28 de agosto de 2025). Los productos tecnológicos supusieron el 63% de los ingresos de Ai-Media, desde cero cinco años antes. Pruebas independientes de ese mismo sistema hallaron una precisión NER del 98,56% en inglés y del 98,26% en español, equivalente a la de los subtítulos humanos salvo en contenido coloquial con varios hablantes (Romero-Fresco y Van Gauwbergen, Fit for What Purpose?, 2025). Más sobre el lado humano de la profesión en nuestras estadísticas de precisión de la transcripción judicial.
| Métrica | Valor | Fuente |
|---|---|---|
| Estándar de tiempo real NCRA CRR | 200 ppm con 96% de precisión (prueba de 5 minutos) | NCRA |
| Formación básica de respeaker / tiempo hasta sentirse seguro | 2-3 meses / 1,5-2 años | Moores, JoSTrans 33 |
| Minutos de subtítulos automáticos LEXI de Ai-Media, ejercicio fiscal de 2025 | 79,2 millones | Resultados del ejercicio fiscal de 2025 de Ai-Media, ASX |
| Minutos de LEXI cuatro años antes | Menos de 10 millones (TCAC de cuatro años del 69%) | Resultados del ejercicio fiscal de 2025 de Ai-Media, ASX |
| Peso de la tecnología en los ingresos de Ai-Media | 63% (ingresos totales de 64,9 millones de USD) | Resultados del ejercicio fiscal de 2025 de Ai-Media, ASX |
| Precisión NER de los subtítulos automáticos: inglés / español | 98,56% / 98,26% | Romero-Fresco y Van Gauwbergen, 2025 |
| Subtítulos en vivo analizados comparando salida automática y humana, Reino Unido/EE. UU./Canadá 2018-2022 | Unos 17.000 | Romero-Fresco y Fresno, Linguistica Antverpiensia 22, 2023 |
Nota de contexto: la mayor comparación entre humanos y máquinas hasta la fecha (Romero-Fresco y Fresno, Linguistica Antverpiensia, 2023) halló que los subtítulos automáticos sin editar se acercaban al 98%, con debilidades persistentes en puntuación, nombres propios, números e identificación de hablantes. Una menor latencia del motor no corrige eso: un nombre erróneo rápido sigue siendo un nombre erróneo.
Resumen: la Latencia del Subtitulado en Vivo en Tiempo Real en Cifras
| Métrica | Valor | Fuente |
|---|---|---|
| Latencia media de subtítulos en vivo en el Reino Unido, finales de 2014 | 5,1 segundos | Tercer informe de Ofcom, 2015 |
| Muestras del Reino Unido que cumplen la directriz de 3 s, segunda ronda | 4 de 72 | Segundo informe de Ofcom, 2014 |
| Retraso más largo registrado en el Reino Unido | 21 segundos | Segundo informe de Ofcom, 2014 |
| Directriz actual de latencia de Ofcom | Media de 4,5 segundos o menos | Directrices de Ofcom sobre servicios de accesibilidad |
| Límite numérico de latencia de la FCC | Ninguno | FCC 14-12, 2014 |
| Precisión de subtítulos en vivo en inglés del CRTC | NER 98 | CRTC 2019-308 |
| Retraso de subtítulos en noticieros en español de EE. UU. | 8,2 segundos de media | Fresno, JoSTrans 42, 2024 |
| Subtítulos de noticieros en español de EE. UU. con más de 10 segundos de retraso | 20% | Fresno, JoSTrans 42, 2024 |
| Retraso medio en fragmentos de televisión estadounidense en directo | 8,46 segundos | Thompson et al., arXiv 2609.11408, 2026 |
| Valoración de subtítulos de televisión: con retraso frente a sincronizados | 3,66 frente a 5,09 sobre 7 | Thompson et al., 2026 |
| Precisión de subtítulos en vivo del Reino Unido, media de cuatro rondas | 98,38% | Datos de Ofcom vía Moores, JoSTrans 33 |
| Precisión de noticieros nacionales en inglés de EE. UU. | 98,8% | Fresno, 2024 |
| Precisión de subtítulos automáticos, inglés | 98,56% | Romero-Fresco y Van Gauwbergen, 2025 |
| Adultos del Reino Unido que han usado subtítulos | Unos 7,6 millones | Ofcom, 2013 |
| Horas subtituladas de las cadenas PSB y plataformas a la carta mayores del Reino Unido, 2024 | 88% | Informe de Servicios de Accesibilidad de Ofcom 2024 |
| Latencia mediana en streaming de AssemblyAI | 307 ms | AssemblyAI, junio de 2025 |
| Latencia media de Whisper-Streaming | 3,3 segundos | Machacek et al., 2023 |
| Intervalo medio humano en el cambio de turno | 208 ms | Stivers et al., PNAS 2009 |
| Minutos de subtítulos LEXI de Ai-Media, ejercicio fiscal de 2025 | 79,2 millones | Resultados del ejercicio fiscal de 2025 de Ai-Media |
| Subtitulado del catálogo de plataformas de streaming canadienses para mayo de 2031 | 100% | CRTC 2026-98 |
Metodología y Fuentes
Cada cifra anterior se rastreó hasta el regulador, el registro regulatorio o el artículo revisado por pares que la produjo. Varios PDF de Ofcom no pudieron obtenerse directamente, por lo que las cifras del Reino Unido proceden de comunicados de prensa de Ofcom (republicados en Wired-Gov), de resúmenes de reguladores (EPRA) y del análisis revisado por pares del conjunto de datos de Ofcom (Moores), cada uno citado en el texto. Los benchmarks de proveedores se etiquetan como datos de proveedor. Para datos generales de mercado y uso del subtitulado, consulta nuestras estadísticas de subtítulos y closed captions.
- Ofcom: comunicado de prensa del tercer informe de subtitulado en vivo (Wired-Gov, mayo de 2015), comunicado de prensa de la consulta sobre subtitulado en vivo (Wired-Gov, mayo de 2013), Directrices para la Prestación de Servicios de Accesibilidad en Televisión y a la Carta, Informe de Servicios de Accesibilidad ene.-dic. de 2024, consulta sobre el Tier 1 Accessibility Code (mayo de 2026)
- EPRA: resumen del primer informe de subtitulado en vivo de Ofcom (abril de 2014)
- Limping Chicken: reportaje sobre el segundo informe de subtitulado en vivo de Ofcom (noviembre de 2014)
- Liam O’Dell: reportaje sobre la consulta de Ofcom sobre el código de accesibilidad de 2023 y consulta sobre el código Tier 1
- FCC: estándares de calidad de subtítulos, FCC 14-12 (2014) y 47 CFR 79.1
- CRTC: Política Regulatoria de Radiodifusión 2019-308 y Política Regulatoria de Radiodifusión 2026-98
- ACMA / Gobierno de Australia: Broadcasting Services (Television Captioning) Standard 2023
- EBU: informe sobre servicios de accesibilidad y subtitulado en vivo (i044) y Tech 3370, EBU-TT Parte 3 Subtitulado en Vivo
- Thompson, Kushalnagar, Vogler et al.: Are Caption Metrics Broken?, arXiv 2609.11408 (septiembre de 2026); Glasser, Kushalnagar y Vogler: How Users Experience Closed Captions on Live Television, CHI 2024
- Fresno: Closed Captions en español, JoSTrans 42 (2024) y Live captioning accuracy in English-language newscasts in the USA (2024)
- Moores: subtitulado en vivo en eventos en directo, JoSTrans 33 (incluye el análisis del conjunto de datos de Ofcom)
- Romero-Fresco y Fresno: The accuracy of automatic and human live captions in English (2023); Romero-Fresco y Van Gauwbergen: Fit for What Purpose? (2025); Romero-Fresco y Martínez: el modelo NER (2015)
- Machacek, Dabre y Bojar: Turning Whisper into Real-Time Transcription System (2023)
- AssemblyAI: Introducing Universal-Streaming (junio de 2025); Deepgram: Introducing Nova-3 (febrero de 2025)
- OpenAI: Hello GPT-4o (mayo de 2024)
- Stivers et al.: Universals and cultural variation in turn-taking in conversation, PNAS (2009)
- Ai-Media: resultados del ejercicio fiscal de 2025, comunicado a la ASX (agosto de 2025)
- NCRA: Certified Realtime Reporter
- OMS: hoja informativa sobre sordera y pérdida de audición (actualizada en marzo de 2026)
- Nota sobre los datos: las mediciones de latencia por cadena de Ofcom (2013-2015) tienen más de tres años y siguen siendo el conjunto de datos públicos más reciente de su tipo; las rondas informan una mezcla de medianas y medias (5,6, 5,8, 5,7 a 5,1 y una media de cuatro rondas de 5,3 vía Moores), así que conviene tratarlas como un rango y no como una línea de tendencia. La estimación de Ofcom sobre usuarios de subtítulos (7,6 millones) data de 2013 y los datos de cambio de turno de Stivers, de 2009. Las cifras de AssemblyAI y Deepgram son benchmarks de proveedores; la comparación de AssemblyAI midió a un competidor en su propio conjunto de prueba, y las pruebas independientes de Nova-3 informan un WER mayor que la cifra de Deepgram. El artículo de 2026 de Thompson et al. es un preprint de arXiv y aún no ha sido revisado por pares. La cifra de ingresos de Ai-Media se muestra tal como se informó en su comunicado a la ASX. Dos evaluaciones independientes del mismo sistema automático informan precisiones destacadas distintas según la dificultad del contenido, y el estudio con espectadores de 2026 halló tasas de aprobación NER mucho más bajas en fragmentos de televisión en directo, por lo que la precisión automática depende mucho del género. El código Tier 1 de Ofcom es un borrador cuya consulta cerró el 7 de agosto de 2026, y se espera una declaración final.
Última actualización: 3 de octubre de 2026. Actualizamos este informe trimestralmente, y la próxima revisión se espera cuando Ofcom publique su declaración final sobre el Tier 1 Accessibility Code y su Informe de Servicios de Accesibilidad de enero a diciembre de 2025.