Estadísticas de Latencia del Subtitulado en Vivo en Tiempo Real (2026): Más de 60 Datos sobre Retraso, Precisión y Velocidad del ASR

Latencia de subtitulado en vivo 2026: en Reino Unido los subtítulos iban 5,1 a 5,8 s tras el habla, Ofcom apunta a 4,5 s y los noticieros en español de EE. UU., 8,2 s.

Los subtítulos en vivo de la televisión del Reino Unido iban de media entre 5,1 y 5,8 segundos por detrás del habla en las rondas de medición de Ofcom, y solo 4 de 72 muestras de su segunda ronda cumplieron la antigua directriz de 3 segundos (Ofcom, informes de calidad del subtitulado en vivo 2014-2015). El problema no ha desaparecido: un estudio de 2024 sobre noticieros en español de EE. UU. midió un retraso medio de 8,2 segundos, con subtítulos individuales que llegaron hasta 41 segundos tarde (Fresno, JoSTrans 2024), y un estudio de septiembre de 2026 midió una media de 8,46 segundos en fragmentos de televisión estadounidense en directo. Mientras tanto, los motores de reconocimiento de voz en streaming informan ahora una latencia mediana por palabra cercana a los 300 milisegundos (AssemblyAI, junio de 2025), de modo que el cuello de botella del subtitulado en vivo se está desplazando del mecanógrafo humano a la cadena de emisión. Reunimos datos de Ofcom, la FCC, el CRTC, estudios revisados por pares de la Universidad Gallaudet y de la Universidade de Vigo, artículos de benchmark de arXiv, los registros de Ai-Media ante la ASX, la OMS y otras fuentes primarias que figuran en la metodología. Para un panorama más amplio, consulta nuestro resumen de estadísticas de subtitulado en vivo.

TL;DR

  • La latencia media de los subtítulos en vivo del Reino Unido bajó de 5,7 a 5,1 segundos entre abril-mayo y octubre-noviembre de 2014, aún muy por encima de la directriz de 3 segundos (Ofcom, tercer informe de subtitulado en vivo, 2015).
  • Solo 4 de 72 muestras del Reino Unido cumplieron la directriz de 3 segundos en la segunda ronda, y el retraso más largo llegó a 21 segundos (Ofcom, segundo informe, 2014).
  • Ofcom pide ahora una latencia media de no más de 4,5 segundos en la programación en directo (Ofcom, Directrices para la Prestación de Servicios de Accesibilidad en Televisión y a la Carta).
  • Los noticieros en español de EE. UU. tuvieron un retraso medio de subtítulos de 8,2 segundos, y el 20% de los subtítulos llegó con más de 10 segundos de retraso (Fresno, JoSTrans 42, 2024).
  • Los subtítulos de televisión con retraso original de emisión (media de 8,46 s) fueron valorados con 3,66/7 frente a 5,09/7 al sincronizarlos (Thompson et al., arXiv 2609.11408, 2026).
  • Los subtítulos en vivo del Reino Unido promediaron un 98,38% de precisión NER en cuatro rondas de Ofcom, por encima del umbral del 98% (datos de Ofcom vía Moores, JoSTrans 33).
  • Los noticieros nacionales en inglés de EE. UU. promediaron un 98,8% de precisión NER (Fresno, Universal Access in the Information Society, 2024).
  • Un sistema de subtitulado automático obtuvo un 98,56% de NER en inglés y un 98,26% en español (Romero-Fresco y Van Gauwbergen, 2025).
  • AssemblyAI informó una latencia mediana en streaming de 307 ms frente a 516 ms de Deepgram Nova-3 (AssemblyAI, junio de 2025).
  • Whisper-Streaming alcanzó una latencia media de 3,3 segundos en habla larga en inglés (Machacek, Dabre y Bojar, IJCNLP-AACL 2023).
  • Los humanos responden a una pregunta en una media de 208 ms en 10 idiomas (Stivers et al., PNAS 2009), la referencia que persiguen los sistemas en tiempo real.
  • Los subtítulos automáticos LEXI de Ai-Media alcanzaron 79,2 millones de minutos en el ejercicio fiscal de 2025, frente a menos de 10 millones cuatro años antes (resultados del ejercicio fiscal de 2025 de Ai-Media, ASX).

1. Retraso Medido: Cuánto Se Quedan Atrás los Subtítulos en Vivo

El conjunto de datos público más completo sobre el retraso de los subtítulos en vivo sigue siendo el del Reino Unido, y cuenta una historia coherente: un subtítulo en vivo típico aparece más de 5 segundos después de pronunciadas las palabras. Ofcom muestreó programas de noticias, entretenimiento y tertulias de la BBC, ITV, Channel 4, Channel 5 y Sky a lo largo de cuatro rondas entre 2013 y 2015. El primer informe halló una latencia mediana de 5,6 segundos (resumen de la EPRA del primer informe de Ofcom, abril de 2014), y el segundo halló 5,8 segundos, con solo 4 de 72 muestras dentro de la directriz de 3 segundos (reportaje de Limping Chicken sobre el segundo informe de Ofcom, noviembre de 2014).

La mejora posterior fue real, pero pequeña. El tercer informe de Ofcom registró una caída de la latencia media de 0,6 segundos, de 5,7 a 5,1 segundos, entre abril-mayo y octubre-noviembre de 2014 (comunicado de prensa de Ofcom vía Wired-Gov, mayo de 2015). Recortar medio segundo de un retraso de cinco exigió que las cadenas cambiaran flujos de trabajo, no solo software, y por eso la cifra se estancó. Estas son las mediciones de latencia de Ofcom más recientes disponibles (2014-2015); no se ha publicado ningún conjunto de datos más nuevo por cadena.

MétricaValorFuente
Latencia mediana de subtítulos en vivo en el Reino Unido, primera ronda5,6 segundosPrimer informe de subtitulado en vivo de Ofcom, abril de 2014
Latencia en el Reino Unido, segunda ronda5,8 segundosSegundo informe de Ofcom, noviembre de 2014
Muestras que cumplen la directriz de 3 segundos, segunda ronda4 de 72Segundo informe de Ofcom, 2014
Retraso más largo registrado, segunda ronda21 segundosSegundo informe de Ofcom, 2014
Latencia media en el Reino Unido, de abril-mayo de 2014 a octubre-noviembre de 20145,7 s a 5,1 s (-0,6 s)Tercer informe de Ofcom, mayo de 2015
Latencia media en el Reino Unido en las cuatro rondas5,3 segundosDatos de Ofcom vía Moores, JoSTrans 33
Latencia sin sincronización ‘como en vivo’ de subtítulos preparados7-8 segundosDatos de Ofcom vía Moores, JoSTrans 33

Nota de contexto: las cifras por ronda mezclan medianas y medias tal como se informaron, por lo que las pequeñas diferencias entre rondas (5,6, 5,7, 5,8) no deben sobreinterpretarse. La cifra de 7-8 segundos para programas sin subtítulos preparados y sincronizados muestra cuánto de la media del Reino Unido depende del guion y no de la transcripción en tiempo real.

Fuera del Reino Unido, los retrasos son mayores. Los subtítulos de los noticieros en español de EE. UU. de Telemundo y Univision iban de media 8,2 segundos por detrás del habla, con un rango de 0,7 a 41 segundos, y el 46% de los subtítulos llegaba con más de 8 segundos de retraso (Fresno, Closed Captions en español, JoSTrans 42, 2024). Un estudio de 2026 con fragmentos de televisión estadounidense en directo midió un retraso medio de 8,46 segundos (DE 3,62) y describió de 7 a 12 segundos como lo típico en los subtítulos de televisión (Thompson et al., arXiv 2609.11408).

MétricaValorFuente
Retraso medio de subtítulos, noticieros en español de EE. UU.8,2 segundosFresno, JoSTrans 42, 2024
Rango de retrasos, misma muestraDe 0,7 a 41 segundosFresno, JoSTrans 42, 2024
Subtítulos con más de 8 / 10 / 12 segundos de retraso46% / 20% / 8%Fresno, JoSTrans 42, 2024
Subtítulos analizados en ese estudio5.349 (20 segmentos de diez minutos)Fresno, JoSTrans 42, 2024
Retraso medio en fragmentos de televisión estadounidense en directo8,46 segundos (DE 3,62)Thompson et al., arXiv 2609.11408, sept. de 2026
Retraso típico citado en subtítulos de televisión de EE. UU.7-12 segundosThompson et al., arXiv 2609.11408, sept. de 2026
Latencia media en eventos en vivo (no emitidos) con respeaking5,8 segundos (rango de 4,3 a 7,5 s)Moores, JoSTrans 33

2. Objetivos Regulatorios: de 3 Segundos a 4,5 Segundos

Los reguladores coinciden en que la latencia importa, pero casi ninguno le pone un número. Ofcom es el único gran regulador de este informe con un objetivo numérico de latencia, y lo movió en la dirección más indulgente: de un retraso máximo de 3 segundos en su Código sobre Servicios de Accesibilidad en Televisión a una media de no más de 4,5 segundos en la programación en directo de un proveedor. Durante la consulta de 2023, Ofcom dijo que las cadenas habían calificado de poco realista el máximo de 3 segundos y que 4,5 segundos equivalían a las mejores latencias que cada cadena había logrado (Directrices de Ofcom para la Prestación de Servicios de Accesibilidad en Televisión y a la Carta).

El enfoque de EE. UU. es cualitativo. La FCC adoptó estándares de calidad de subtítulos el 20 de febrero de 2014 que abarcan precisión, sincronía, integridad y ubicación, y dijo solamente que el retraso de los subtítulos en vivo ‘debe mantenerse al mínimo, de forma coherente con una presentación precisa de lo que se dice’ (FCC, estándares de calidad de subtítulos). Canadá regula la precisión en lugar del tiempo: la Política Regulatoria de Radiodifusión 2019-308 del CRTC exige que los subtítulos en vivo en inglés obtengan 98 en el modelo NER. El efecto práctico es que un subtítulo que llega 10 segundos tarde puede cumplir plenamente la norma en la mayor parte del mundo.

MétricaValorFuente
Directriz anterior de OfcomRetraso máximo de 3 segundosCódigo de Ofcom sobre Servicios de Accesibilidad en Televisión
Directriz actual de OfcomMedia de no más de 4,5 segundos en la programación en directoDirectrices de Ofcom para la Prestación de Servicios de Accesibilidad en TV y a la Carta
Antigua orientación de Ofcom sobre velocidad de subtítulos: pregrabados / en vivo160-180 ppm / 200 ppmConsulta de Ofcom de 2023, según Liam O’Dell
Límite numérico de latencia de la FCCNinguno (retraso ‘mantenido al mínimo’)FCC 14-12, adoptada el 20 de feb. de 2014
Prohibición de la FCC del subtitulado ENT solo con teleprompter en programación en directo4 grandes cadenas y afiliadas en los 25 mayores mercadosFCC 14-12
Subtitulado de la FCC de programación nueva no exenta100% desde el 1 de enero de 200647 CFR 79.1
Requisito de precisión del CRTC para subtítulos en vivo en inglésPuntuación NER de 98, desde el 1 de septiembre de 2019CRTC 2019-308
Obligación de supervisión del CRTC2 programas en directo al mes, incluido 1 de noticiasCRTC 2019-308

Nota de contexto: la ACMA de Australia, bajo el Broadcasting Services (Television Captioning) Standard 2023, en vigor desde el 1 de octubre de 2023, tampoco fija una latencia numérica y evalúa la legibilidad, la precisión y la comprensibilidad caso por caso.

Las normas más recientes extienden obligaciones al streaming en lugar de endurecer el retraso. La decisión CRTC 2026-98 de Canadá exige a los servicios de streaming en línea subtitular el 80% de su catálogo para mayo de 2030 y el 100% para mayo de 2031, con subtítulos en los nuevos programas originales en directo y pregrabados en el plazo de un año (CRTC 2026-98, 25 de mayo de 2026). El borrador del Tier 1 Accessibility Code de Ofcom, publicado el 14 de mayo de 2026, propone una cuota de subtitulado del 80% para las mayores plataformas de streaming cuatro años después de su publicación (Ofcom, consulta sobre el Tier 1 Accessibility Code).

MétricaValorFuente
Subtitulado del catálogo de las plataformas de streaming canadienses80% para mayo de 2030, 100% para mayo de 2031CRTC 2026-98
Requisito canadiense de precisión para programas originales pregrabados en plataformas de streaming100%CRTC 2026-98
Cuota de subtitulado del Tier 1 de Ofcom, año 4 / año 180% / 20%Borrador del Tier 1 Accessibility Code de Ofcom, mayo de 2026
Cuota de subtitulado a la carta de la BBC, año 490%Borrador del Tier 1 Accessibility Code de Ofcom, mayo de 2026
Umbral del Tier 1Más de 500.000 usuarios mensuales medios en el Reino UnidoBorrador del Tier 1 Accessibility Code de Ofcom, mayo de 2026

3. Precisión: la Línea del 98% de NER y Quién la Supera

El retraso y la precisión se compensan entre sí, por lo que las cifras de latencia solo tienen sentido junto a las de precisión. La vara de medir habitual es el modelo NER, que puntúa los subtítulos en vivo como (palabras menos errores de edición y de reconocimiento) sobre las palabras. El 98% es ‘aceptable’, el 98,5-98,99% ‘bueno’, el 99-99,49% ‘muy bueno’ y más del 99,5% ‘excelente’ (Romero-Fresco y Martínez, modelo NER, 2015). El umbral parece indulgente hasta que se traduce: al 98%, dos de cada 100 palabras son errores, omisiones o errores ponderados.

Las cadenas del Reino Unido superaron la barra de media: 98,38% en las cuatro rondas de Ofcom y 98,55% en la última, medido sobre 78.000 subtítulos y 546.000 palabras (Moores, JoSTrans 33). Pero las medias esconden la cola. En octubre-noviembre de 2014, el 77% de los programas del Reino Unido alcanzó el 98% o más, frente al 74% en abril-mayo de 2014, y las noticias fueron el género más preciso, con un 98,75% (Ofcom, tercer informe, 2015). Los noticieros nacionales en inglés de EE. UU. lo hicieron mejor, con una media del 98,8% y 14 de 20 muestras valoradas como aceptables o mejores, mientras que los noticieros en español cayeron al 97,04% (Fresno, 2024).

MétricaValorFuente
Umbrales NER de aceptable / excelente98% / más del 99,5%Romero-Fresco y Martínez, 2015
Precisión de los subtítulos en vivo del Reino Unido, media de cuatro rondas98,38%Datos de Ofcom vía Moores, JoSTrans 33
Precisión de los subtítulos en vivo del Reino Unido, última ronda98,55%Datos de Ofcom vía Moores, JoSTrans 33
Programas del Reino Unido con 98% o más, oct.-nov. de 2014 (frente a abr.-mayo de 2014)77% (74%)Tercer informe de Ofcom, 2015
Precisión del género de noticias en el Reino Unido98,75%Tercer informe de Ofcom, 2015
Noticieros nacionales en inglés de EE. UU., NER medio98,8% (14 de 20 muestras aceptables o mejores)Fresno, Universal Access in the Information Society, 2024
Noticieros en español de EE. UU., NER medio97,04% (Telemundo 97,00%, Univision 97,10%)Fresno, JoSTrans 42, 2024
Reducción de texto: noticieros en español frente a en inglés26% frente a 5-6%Fresno, JoSTrans 42, 2024

Nota de contexto: la velocidad es la tercera variable oculta. Ofcom recomienda que los subtítulos promedien menos de 180 palabras por minuto, pero casi todos los programas que analizó tenían ráfagas cortas por encima de 200 ppm, y cuando esas ráfagas se contaron como errores, el 68% de los programas cayó por debajo del 98% (Ofcom, tercer informe, 2015). El estudio sobre noticieros en inglés de EE. UU. halló que casi dos tercios de los errores eran leves.

4. Lo Que el Retraso Cuesta a los Espectadores

La audiencia de los subtítulos en vivo es mucho mayor que la comunidad sorda por sí sola. Ofcom estimó que cerca de 7,6 millones de adultos del Reino Unido habían usado subtítulos, de los cuales solo 1,4 millones tenían una discapacidad auditiva (comunicado de prensa de Ofcom vía Wired-Gov, mayo de 2013). Eso significa más de 6 millones de usuarios de subtítulos sin discapacidad auditiva (7,6 millones menos 1,4 millones), muchos de los cuales ven la televisión en habitaciones ruidosas o con el volumen bajo. Las directrices de Ofcom también citan datos de YouGov según los cuales el 61% de los jóvenes de 18 a 24 años prefiere tener los subtítulos activados. A nivel mundial, la OMS estima que 430 millones de personas necesitan rehabilitación por pérdida de audición discapacitante hoy, cifra que superará los 700 millones en 2050.

MétricaValorFuente
Adultos del Reino Unido que han usado subtítulosUnos 7,6 millones (rango de 7,0-8,1 millones)Ofcom, mayo de 2013
De ellos, con discapacidad auditivaUnos 1,4 millones (rango de 1,2-1,6 millones)Ofcom, mayo de 2013
Jóvenes de 18 a 24 años del Reino Unido que prefieren los subtítulos activados61%YouGov, citado en las directrices de servicios de accesibilidad de Ofcom
Proporción de horas de programación de las cadenas PSB y de las plataformas a la carta mayores del Reino Unido con subtítulos, 202488%Informe de Servicios de Accesibilidad de Ofcom, ene.-dic. de 2024 (publicado el 19 de mayo de 2025)
Horas subtituladas en los canales obligados del Reino Unido, 2005 frente a 201340,5% frente a 81,9%Primer informe de subtitulado en vivo de Ofcom, 2014
Personas que necesitan rehabilitación por pérdida de audición discapacitante430 millonesHoja informativa de la OMS, actualizada en marzo de 2026
Personas con alguna pérdida de audición proyectadas para 2050Casi 2.500 millonesHoja informativa de la OMS, actualizada en marzo de 2026

El retraso es lo primero que notan los espectadores. El mayor estudio reciente con usuarios pidió a 216 espectadores sordos y con discapacidad auditiva que valoraran 70 fragmentos de televisión en directo en cuatro condiciones, lo que produjo 4.832 valoraciones. Los mismos subtítulos de televisión obtuvieron un 3,66 sobre 7 con su retraso original de emisión y un 5,09 al sincronizarlos, una variación mucho mayor que la diferencia entre los subtítulos de televisión sincronizados y los de ASR (Thompson et al., Are Caption Metrics Broken?, arXiv 2609.11408, septiembre de 2026). Los subtítulos de ASR con dos segundos de retraso se sostuvieron mucho mejor, con 4,81 frente a 5,20 sincronizados.

El mismo estudio socava la idea de que las puntuaciones de precisión capturan la calidad. Solo 11 de 70 fragmentos de televisión y 4 de 70 de ASR alcanzaron el umbral de 98 NER, y sin embargo los espectadores valoraron casi por igual los subtítulos sincronizados de ASR y de televisión, y la correlación entre las métricas y las valoraciones cayó con fuerza para la salida de ASR (WER r = -0,390 frente a -0,687 para los subtítulos de televisión). El estudio anterior de Gallaudet en CHI 2024 llegó a una conclusión similar: los participantes detestaron con fuerza los retrasos de emisión, y las métricas de precisión estándar se correlacionaron solo débilmente con cómo valoraban los espectadores los subtítulos.

MétricaValorFuente
Participantes / valoraciones / fragmentos216 / 4.832 / 70Thompson et al., arXiv 2609.11408, 2026
Valoración de subtítulos de televisión: retraso original frente a sincronizados (escala de 7 puntos)3,66 frente a 5,09Thompson et al., 2026
Valoración de subtítulos de ASR: retraso de 2 s frente a sincronizados4,81 frente a 5,20Thompson et al., 2026
WER medio: subtítulos de televisión frente a subtítulos de ASR33,8% frente a 17,2%Thompson et al., 2026
NER medio: subtítulos de televisión frente a subtítulos de ASR95,28 frente a 94,34Thompson et al., 2026
Fragmentos que alcanzan NER 98: televisión frente a ASR11 de 70 frente a 4 de 70Thompson et al., 2026
Correlación del WER con las valoraciones de los espectadores: televisión frente a ASRr = -0,687 frente a -0,390Thompson et al., 2026

Nota de contexto: el WER alto de la televisión refleja en parte que los subtítulos de emisión parafrasean y condensan, algo que el WER penaliza y el NER no. Esa brecha es exactamente la razón por la que los autores sostienen que las métricas actuales no son neutrales respecto a la tecnología.

5. Velocidad de los Motores de ASR: Latencia en Streaming frente a la Conversación Humana

La latencia del motor ya no es la principal fuente de retraso de los subtítulos. AssemblyAI informó una latencia mediana en streaming de 307 ms para Universal-Streaming frente a 516 ms de Deepgram Nova-3, y un P99 de 1.012 ms frente a 1.907 ms, medida desde el final de una palabra en el audio hasta su primera aparición en una transcripción parcial, sobre más de 205 horas de audio (AssemblyAI, Introducing Universal-Streaming, 2 de junio de 2025). Los datos de lanzamiento del propio Deepgram situaron la tasa mediana de error de palabras en streaming de Nova-3 en 6,84%, frente a 14,92% de los competidores que probó (Deepgram, Introducing Nova-3, febrero de 2025). Ambos son benchmarks de proveedores y deben leerse como cifras del mejor caso. Nuestras estadísticas de speech-to-text cubren la precisión de más motores.

Los modelos abiertos cambian más retraso por estabilidad. El sistema académico Whisper-Streaming alcanzó una latencia media de 3,3 segundos en habla larga en inglés del conjunto de prueba ESIC del Parlamento Europeo, y el equilibrio es explícito en sus resultados: WER en inglés de 8,5% con 3,27 s de latencia y bloques de 0,5 s frente a 8,0% con 5,45 s y bloques de 2 s (Machacek, Dabre y Bojar, arXiv 2307.14743, IJCNLP-AACL 2023). Obsérvese que una configuración de Whisper de 5 segundos cae justo sobre la media de la emisión británica de una década antes.

MétricaValorFuente
Latencia mediana / P99 de AssemblyAI Universal-Streaming307 ms / 1.012 msAssemblyAI, junio de 2025
Latencia mediana / P99 de Deepgram Nova-3 (prueba de AssemblyAI)516 ms / 1.907 msAssemblyAI, junio de 2025
WER mediano de Deepgram Nova-3: streaming / por lotes6,84% / 5,26%Deepgram, feb. de 2025
Conjunto de benchmark de Deepgram Nova-32.703 archivos, 81,69 horas, 9 dominiosDeepgram, feb. de 2025
Latencia media de Whisper-Streaming, inglés3,3 segundosMachacek et al., 2023
Whisper-Streaming en inglés: bloque de 0,5 s frente a bloque de 2,0 s8,5% de WER a 3,27 s frente a 8,0% de WER a 5,45 sMachacek et al., 2023
Latencia de Whisper-Streaming, alemán / checo (bloque de 0,5 s)4,11 s / 4,69 sMachacek et al., 2023

El techo del tiempo real lo marca la conversación humana. En 10 idiomas, el intervalo medio entre una pregunta y su respuesta fue de +208 ms, con un rango de +7 ms en japonés a +469 ms en danés (Stivers et al., PNAS 2009). El lanzamiento de GPT-4o de OpenAI afirmó respuestas de audio en tan solo 232 ms y 320 ms de media, frente a 2,8 segundos (GPT-3.5) y 5,4 segundos (GPT-4) del anterior Modo de Voz en cadena, que enlazaba modelos separados de transcripción, lenguaje y voz. La lección para el subtitulado en vivo es la misma: cada etapa extra de la cadena suma segundos, y la etapa que antes dominaba, el reconocimiento en sí, es ahora la más pequeña.

MétricaValorFuente
Intervalo medio entre pregunta y respuesta, 10 idiomas+208 msStivers et al., PNAS 2009 (datos más recientes disponibles)
Media del idioma más rápido / más lento+7 ms (japonés) / +469 ms (danés)Stivers et al., PNAS 2009
Respuesta de audio de GPT-4o: mínima / media232 ms / 320 msOpenAI, mayo de 2024
Latencia media del Modo de Voz en cadena: GPT-3.5 / GPT-42,8 s / 5,4 sOpenAI, mayo de 2024
Retraso de los subtítulos de ASR usado en el estudio con espectadores de 20262 segundos de mediaThompson et al., arXiv 2609.11408

6. La Automatización Toma la Cadena de Subtitulado

La plantilla humana detrás de los subtítulos en vivo está definida por límites de velocidad. El referente de tiempo real de EE. UU., el NCRA Certified Realtime Reporter, exige una prueba en tiempo real de cinco minutos a 200 palabras por minuto con un 96% de precisión, y un informe de la EBU describe el subtitulado en vivo como seguir a locutores de hasta 200 ppm. Los respeakers del Reino Unido dijeron a los investigadores que la formación básica lleva de 2 a 3 meses, mientras que sentirse seguro lleva de 1,5 a 2 años (Moores, JoSTrans 33). Esas limitaciones explican por qué el subtitulado automático escaló tan rápido cuando la precisión se acercó.

El cambio de volumen es visible en los registros de las empresas. Los subtítulos automáticos LEXI de Ai-Media alcanzaron 79,2 millones de minutos en el ejercicio fiscal de 2025, frente a menos de 10 millones cuatro años antes, una TCAC de cuatro años del 69%, y LEXI representa ahora la mayor parte del uso en su red iCap (resultados del ejercicio fiscal de 2025 de Ai-Media, comunicado a la ASX, 28 de agosto de 2025). Los productos tecnológicos supusieron el 63% de los ingresos de Ai-Media, desde cero cinco años antes. Pruebas independientes de ese mismo sistema hallaron una precisión NER del 98,56% en inglés y del 98,26% en español, equivalente a la de los subtítulos humanos salvo en contenido coloquial con varios hablantes (Romero-Fresco y Van Gauwbergen, Fit for What Purpose?, 2025). Más sobre el lado humano de la profesión en nuestras estadísticas de precisión de la transcripción judicial.

MétricaValorFuente
Estándar de tiempo real NCRA CRR200 ppm con 96% de precisión (prueba de 5 minutos)NCRA
Formación básica de respeaker / tiempo hasta sentirse seguro2-3 meses / 1,5-2 añosMoores, JoSTrans 33
Minutos de subtítulos automáticos LEXI de Ai-Media, ejercicio fiscal de 202579,2 millonesResultados del ejercicio fiscal de 2025 de Ai-Media, ASX
Minutos de LEXI cuatro años antesMenos de 10 millones (TCAC de cuatro años del 69%)Resultados del ejercicio fiscal de 2025 de Ai-Media, ASX
Peso de la tecnología en los ingresos de Ai-Media63% (ingresos totales de 64,9 millones de USD)Resultados del ejercicio fiscal de 2025 de Ai-Media, ASX
Precisión NER de los subtítulos automáticos: inglés / español98,56% / 98,26%Romero-Fresco y Van Gauwbergen, 2025
Subtítulos en vivo analizados comparando salida automática y humana, Reino Unido/EE. UU./Canadá 2018-2022Unos 17.000Romero-Fresco y Fresno, Linguistica Antverpiensia 22, 2023

Nota de contexto: la mayor comparación entre humanos y máquinas hasta la fecha (Romero-Fresco y Fresno, Linguistica Antverpiensia, 2023) halló que los subtítulos automáticos sin editar se acercaban al 98%, con debilidades persistentes en puntuación, nombres propios, números e identificación de hablantes. Una menor latencia del motor no corrige eso: un nombre erróneo rápido sigue siendo un nombre erróneo.

Resumen: la Latencia del Subtitulado en Vivo en Tiempo Real en Cifras

MétricaValorFuente
Latencia media de subtítulos en vivo en el Reino Unido, finales de 20145,1 segundosTercer informe de Ofcom, 2015
Muestras del Reino Unido que cumplen la directriz de 3 s, segunda ronda4 de 72Segundo informe de Ofcom, 2014
Retraso más largo registrado en el Reino Unido21 segundosSegundo informe de Ofcom, 2014
Directriz actual de latencia de OfcomMedia de 4,5 segundos o menosDirectrices de Ofcom sobre servicios de accesibilidad
Límite numérico de latencia de la FCCNingunoFCC 14-12, 2014
Precisión de subtítulos en vivo en inglés del CRTCNER 98CRTC 2019-308
Retraso de subtítulos en noticieros en español de EE. UU.8,2 segundos de mediaFresno, JoSTrans 42, 2024
Subtítulos de noticieros en español de EE. UU. con más de 10 segundos de retraso20%Fresno, JoSTrans 42, 2024
Retraso medio en fragmentos de televisión estadounidense en directo8,46 segundosThompson et al., arXiv 2609.11408, 2026
Valoración de subtítulos de televisión: con retraso frente a sincronizados3,66 frente a 5,09 sobre 7Thompson et al., 2026
Precisión de subtítulos en vivo del Reino Unido, media de cuatro rondas98,38%Datos de Ofcom vía Moores, JoSTrans 33
Precisión de noticieros nacionales en inglés de EE. UU.98,8%Fresno, 2024
Precisión de subtítulos automáticos, inglés98,56%Romero-Fresco y Van Gauwbergen, 2025
Adultos del Reino Unido que han usado subtítulosUnos 7,6 millonesOfcom, 2013
Horas subtituladas de las cadenas PSB y plataformas a la carta mayores del Reino Unido, 202488%Informe de Servicios de Accesibilidad de Ofcom 2024
Latencia mediana en streaming de AssemblyAI307 msAssemblyAI, junio de 2025
Latencia media de Whisper-Streaming3,3 segundosMachacek et al., 2023
Intervalo medio humano en el cambio de turno208 msStivers et al., PNAS 2009
Minutos de subtítulos LEXI de Ai-Media, ejercicio fiscal de 202579,2 millonesResultados del ejercicio fiscal de 2025 de Ai-Media
Subtitulado del catálogo de plataformas de streaming canadienses para mayo de 2031100%CRTC 2026-98

Metodología y Fuentes

Cada cifra anterior se rastreó hasta el regulador, el registro regulatorio o el artículo revisado por pares que la produjo. Varios PDF de Ofcom no pudieron obtenerse directamente, por lo que las cifras del Reino Unido proceden de comunicados de prensa de Ofcom (republicados en Wired-Gov), de resúmenes de reguladores (EPRA) y del análisis revisado por pares del conjunto de datos de Ofcom (Moores), cada uno citado en el texto. Los benchmarks de proveedores se etiquetan como datos de proveedor. Para datos generales de mercado y uso del subtitulado, consulta nuestras estadísticas de subtítulos y closed captions.

Última actualización: 3 de octubre de 2026. Actualizamos este informe trimestralmente, y la próxima revisión se espera cuando Ofcom publique su declaración final sobre el Tier 1 Accessibility Code y su Informe de Servicios de Accesibilidad de enero a diciembre de 2025.

Prueba VoxBooster — 3 días gratis.

Clonación de voz en tiempo real, soundboard y efectos — donde ya hablas.

  • Sin tarjeta
  • ~30ms de latencia
  • Discord · Teams · OBS
Probar 3 días gratis