Estatísticas de Latência de Legendagem ao Vivo em Tempo Real (2026): Mais de 60 Dados sobre Atraso, Precisão e Velocidade de ASR

Latência de legendagem ao vivo 2026: legendas no Reino Unido atrasaram 5,1 a 5,8 segundos, a Ofcom agora mira 4,5 s e telejornais em espanhol nos EUA, 8,2 s.

As legendas ao vivo na televisão do Reino Unido ficaram, em média, de 5,1 a 5,8 segundos atrás da fala nas rodadas de medição da Ofcom, e apenas 4 de 72 amostras da segunda rodada atenderam à antiga diretriz de 3 segundos (Ofcom, relatórios de qualidade da legendagem ao vivo 2014-2015). O problema não desapareceu: um estudo de 2024 sobre telejornais em espanhol nos EUA mediu atraso médio de 8,2 segundos, com legendas individuais chegando a 41 segundos de atraso (Fresno, JoSTrans 2024), e um estudo de setembro de 2026 mediu média de 8,46 segundos em trechos de TV ao vivo dos EUA. Enquanto isso, os mecanismos de reconhecimento de fala em streaming hoje informam latência mediana por palavra próxima de 300 milissegundos (AssemblyAI, junho de 2025), de modo que o gargalo da legendagem ao vivo está passando do digitador humano para a cadeia de transmissão. Reunimos dados da Ofcom, da FCC, do CRTC, de estudos revisados por pares da Gallaudet University e da Universidade de Vigo, de artigos de benchmark no arXiv, dos registros da Ai-Media na ASX, da OMS e de outras fontes primárias listadas na metodologia. Para o panorama mais amplo, veja nosso levantamento de estatísticas de legendagem ao vivo.

TL;DR

  • A latência média das legendas ao vivo no Reino Unido caiu de 5,7 para 5,1 segundos entre abril-maio e outubro-novembro de 2014, ainda bem acima da diretriz de 3 segundos (Ofcom, terceiro relatório de legendagem ao vivo, 2015).
  • Apenas 4 de 72 amostras do Reino Unido atenderam à diretriz de 3 segundos na segunda rodada, e o maior atraso chegou a 21 segundos (Ofcom, segundo relatório, 2014).
  • A Ofcom agora pede latência média de no máximo 4,5 segundos em toda a programação ao vivo (Ofcom, Diretrizes para a Oferta de Serviços de Acesso em TV e sob Demanda).
  • Os telejornais em espanhol nos EUA tiveram atraso médio de legendas de 8,2 segundos, e 20% das legendas chegaram mais de 10 segundos atrasadas (Fresno, JoSTrans 42, 2024).
  • Legendas de TV com atraso original de transmissão (média de 8,46 s) foram avaliadas com 3,66/7, contra 5,09/7 quando sincronizadas (Thompson et al., arXiv 2609.11408, 2026).
  • As legendas ao vivo do Reino Unido tiveram média de 98,38% de precisão NER em quatro rodadas da Ofcom, acima do limite de 98% (dados da Ofcom via Moores, JoSTrans 33).
  • Os telejornais nacionais em inglês dos EUA tiveram média de 98,8% de precisão NER (Fresno, Universal Access in the Information Society, 2024).
  • Um sistema automático de legendagem marcou 98,56% de NER em inglês e 98,26% em espanhol (Romero-Fresco e Van Gauwbergen, 2025).
  • A AssemblyAI informou latência mediana em streaming de 307 ms, contra 516 ms do Deepgram Nova-3 (AssemblyAI, junho de 2025).
  • O Whisper-Streaming atingiu latência média de 3,3 segundos em fala longa em inglês (Machacek, Dabre e Bojar, IJCNLP-AACL 2023).
  • Os humanos respondem a uma pergunta em média em 208 ms em 10 idiomas (Stivers et al., PNAS 2009), a referência que os sistemas em tempo real tentam alcançar.
  • As legendas automáticas LEXI da Ai-Media chegaram a 79,2 milhões de minutos no ano fiscal de 2025, contra menos de 10 milhões quatro anos antes (resultados do ano fiscal de 2025 da Ai-Media, ASX).

1. Atraso Medido: Quanto as Legendas ao Vivo Ficam Atrás da Fala

O conjunto de dados públicos mais completo sobre o atraso de legendas ao vivo continua sendo o do Reino Unido, e ele conta uma história consistente: uma legenda ao vivo típica aparece mais de 5 segundos depois de as palavras serem ditas. A Ofcom amostrou programas de notícias, entretenimento e bate-papo da BBC, ITV, Channel 4, Channel 5 e Sky ao longo de quatro rodadas entre 2013 e 2015. O primeiro relatório encontrou latência mediana de 5,6 segundos (resumo da EPRA do primeiro relatório da Ofcom, abril de 2014), e o segundo encontrou 5,8 segundos, com apenas 4 de 72 amostras dentro da diretriz de 3 segundos (reportagem do Limping Chicken sobre o segundo relatório da Ofcom, novembro de 2014).

A melhora que veio depois foi real, mas pequena. O terceiro relatório da Ofcom registrou queda da latência média de 0,6 segundo, de 5,7 para 5,1 segundos, entre abril-maio e outubro-novembro de 2014 (comunicado de imprensa da Ofcom via Wired-Gov, maio de 2015). Tirar meio segundo de um atraso de cinco segundos exigiu que as emissoras mudassem fluxos de trabalho, não apenas software, e por isso o número estacionou. Estas são as medições de latência da Ofcom mais recentes disponíveis (2014-2015); nenhum conjunto de dados por emissora mais novo foi publicado.

MétricaValorFonte
Latência mediana de legendas ao vivo no Reino Unido, primeira rodada5,6 segundosPrimeiro relatório de legendagem ao vivo da Ofcom, abril de 2014
Latência no Reino Unido, segunda rodada5,8 segundosSegundo relatório da Ofcom, novembro de 2014
Amostras que atenderam à diretriz de 3 segundos, segunda rodada4 de 72Segundo relatório da Ofcom, 2014
Maior atraso registrado, segunda rodada21 segundosSegundo relatório da Ofcom, 2014
Latência média no Reino Unido, abril-maio de 2014 a outubro-novembro de 20145,7 s para 5,1 s (-0,6 s)Terceiro relatório da Ofcom, maio de 2015
Latência média no Reino Unido em todas as quatro rodadas5,3 segundosDados da Ofcom via Moores, JoSTrans 33
Latência sem sincronização ‘como ao vivo’ de legendas preparadas7-8 segundosDados da Ofcom via Moores, JoSTrans 33

Nota de contexto: os números por rodada misturam medianas e médias, conforme divulgados, de modo que as pequenas diferenças entre rodadas (5,6, 5,7, 5,8) não devem ser superinterpretadas. O número de 7-8 segundos para programas sem legendas preparadas e sincronizadas mostra o quanto da média do Reino Unido depende de roteiro, e não de transcrição em tempo real.

Fora do Reino Unido, os atrasos são maiores. As legendas dos telejornais em espanhol dos EUA da Telemundo e da Univision ficaram, em média, 8,2 segundos atrás da fala, variando de 0,7 a 41 segundos, com 46% das legendas atrasadas mais de 8 segundos (Fresno, Closed Captions en español, JoSTrans 42, 2024). Um estudo de 2026 com trechos de TV ao vivo dos EUA mediu atraso médio de 8,46 segundos (DP 3,62) e descreveu 7 a 12 segundos como típico para legendas de TV (Thompson et al., arXiv 2609.11408).

MétricaValorFonte
Atraso médio das legendas, telejornais em espanhol nos EUA8,2 segundosFresno, JoSTrans 42, 2024
Faixa de atrasos, mesma amostra0,7 a 41 segundosFresno, JoSTrans 42, 2024
Legendas atrasadas mais de 8 / 10 / 12 segundos46% / 20% / 8%Fresno, JoSTrans 42, 2024
Legendas analisadas nesse estudo5.349 (20 trechos de dez minutos)Fresno, JoSTrans 42, 2024
Atraso médio em trechos de TV ao vivo dos EUA8,46 segundos (DP 3,62)Thompson et al., arXiv 2609.11408, set. de 2026
Atraso típico citado para legendas de TV nos EUA7-12 segundosThompson et al., arXiv 2609.11408, set. de 2026
Latência média em eventos ao vivo (fora de transmissão) com respeaking5,8 segundos (faixa de 4,3 a 7,5 s)Moores, JoSTrans 33

2. Metas Regulatórias: de 3 Segundos para 4,5 Segundos

Os reguladores concordam que a latência importa, mas quase nenhum coloca um número nela. A Ofcom é o único grande regulador deste levantamento com uma meta numérica de latência, e ela moveu essa meta na direção mais branda: de um atraso máximo de 3 segundos em seu Código sobre Serviços de Acesso em Televisão para uma média de no máximo 4,5 segundos na programação ao vivo de um provedor. Durante a consulta pública de 2023, a Ofcom disse que as emissoras haviam chamado o máximo de 3 segundos de irrealista e que 4,5 segundos correspondiam às melhores latências que cada emissora havia alcançado (Diretrizes da Ofcom para a Oferta de Serviços de Acesso em Televisão e sob Demanda).

A abordagem dos EUA é qualitativa. A FCC adotou padrões de qualidade de legendas em 20 de fevereiro de 2014, cobrindo precisão, sincronia, completude e posicionamento, e disse apenas que o atraso das legendas ao vivo ‘deve ser mantido no mínimo, de forma consistente com uma apresentação precisa do que está sendo dito’ (FCC, padrões de qualidade de legendas). O Canadá regula a precisão em vez do tempo: a Política Regulatória de Radiodifusão 2019-308 do CRTC exige que as legendas ao vivo em inglês obtenham nota 98 no modelo NER. O efeito prático é que uma legenda que chega 10 segundos atrasada pode estar plenamente em conformidade na maior parte do mundo.

MétricaValorFonte
Diretriz anterior da OfcomAtraso máximo de 3 segundosCódigo da Ofcom sobre Serviços de Acesso em Televisão
Diretriz atual da OfcomMédia de no máximo 4,5 segundos na programação ao vivoDiretrizes da Ofcom para a Oferta de Serviços de Acesso em TV e sob Demanda
Antiga orientação da Ofcom sobre velocidade das legendas: pré-gravadas / ao vivo160-180 ppm / 200 ppmConsulta pública da Ofcom de 2023, segundo Liam O’Dell
Limite numérico de latência da FCCNenhum (atraso ‘mantido no mínimo’)FCC 14-12, adotada em 20 de fev. de 2014
Proibição da FCC de legendagem ENT apenas por teleprompter na programação ao vivo4 grandes redes e afiliadas nos 25 maiores mercadosFCC 14-12
Legendagem da FCC para programação nova não isenta100% desde 1º de janeiro de 200647 CFR 79.1
Exigência de precisão do CRTC para legendas ao vivo em inglêsNota NER de 98, a partir de 1º de setembro de 2019CRTC 2019-308
Obrigação de monitoramento do CRTC2 programas ao vivo por mês, incluindo 1 de notíciasCRTC 2019-308

Nota de contexto: a ACMA da Austrália, sob o Broadcasting Services (Television Captioning) Standard 2023, em vigor desde 1º de outubro de 2023, também não define latência numérica e avalia legibilidade, precisão e compreensibilidade caso a caso.

As regras mais novas estendem obrigações ao streaming em vez de endurecer o atraso. A decisão CRTC 2026-98, do Canadá, exige que os serviços de streaming online legendem 80% de seu catálogo até maio de 2030 e 100% até maio de 2031, com legendas em novos programas originais ao vivo e pré-gravados em até um ano (CRTC 2026-98, 25 de maio de 2026). O rascunho do Tier 1 Accessibility Code da Ofcom, publicado em 14 de maio de 2026, propõe uma cota de legendagem de 80% para os maiores serviços de streaming quatro anos após a publicação (Ofcom, consulta sobre o Tier 1 Accessibility Code).

MétricaValorFonte
Legendagem do catálogo dos serviços de streaming no Canadá80% até maio de 2030, 100% até maio de 2031CRTC 2026-98
Exigência canadense de precisão para programas originais pré-gravados nos serviços de streaming100%CRTC 2026-98
Cota de legendagem do Tier 1 da Ofcom, ano 4 / ano 180% / 20%Rascunho do Tier 1 Accessibility Code da Ofcom, maio de 2026
Cota de legendagem sob demanda da BBC, ano 490%Rascunho do Tier 1 Accessibility Code da Ofcom, maio de 2026
Limite do Tier 1mais de 500.000 usuários mensais médios no Reino UnidoRascunho do Tier 1 Accessibility Code da Ofcom, maio de 2026

3. Precisão: a Linha de 98% NER e Quem a Alcança

Atraso e precisão se contrapõem, de modo que os números de latência só fazem sentido ao lado dos de precisão. A régua comum é o modelo NER, que pontua as legendas ao vivo como (palavras menos erros de edição e de reconhecimento) sobre as palavras. 98% é ‘aceitável’, 98,5-98,99% ‘bom’, 99-99,49% ‘muito bom’ e acima de 99,5% ‘excelente’ (Romero-Fresco e Martínez, modelo NER, 2015). O limite parece generoso até você traduzi-lo: a 98%, duas de cada 100 palavras estão erradas, ausentes ou são erros ponderados.

As emissoras do Reino Unido superaram a barreira na média: 98,38% nas quatro rodadas da Ofcom e 98,55% na última, medidos em 78.000 legendas e 546.000 palavras (Moores, JoSTrans 33). Mas as médias escondem a cauda. Em outubro-novembro de 2014, 77% dos programas do Reino Unido atingiram 98% ou mais, contra 74% em abril-maio de 2014, e o jornalismo foi o gênero mais preciso, com 98,75% (Ofcom, terceiro relatório, 2015). Os telejornais nacionais em inglês dos EUA foram melhores, com média de 98,8% e 14 de 20 amostras avaliadas como aceitáveis ou melhores, enquanto os telejornais em espanhol caíram para 97,04% (Fresno, 2024).

MétricaValorFonte
Limites NER de aceitável / excelente98% / acima de 99,5%Romero-Fresco e Martínez, 2015
Precisão das legendas ao vivo no Reino Unido, média das quatro rodadas98,38%Dados da Ofcom via Moores, JoSTrans 33
Precisão das legendas ao vivo no Reino Unido, última rodada98,55%Dados da Ofcom via Moores, JoSTrans 33
Programas do Reino Unido com 98% ou mais, out.-nov. de 2014 (contra abr.-maio de 2014)77% (74%)Terceiro relatório da Ofcom, 2015
Precisão do gênero jornalístico no Reino Unido98,75%Terceiro relatório da Ofcom, 2015
Telejornais nacionais em inglês dos EUA, NER médio98,8% (14 de 20 amostras aceitáveis ou melhores)Fresno, Universal Access in the Information Society, 2024
Telejornais em espanhol dos EUA, NER médio97,04% (Telemundo 97,00%, Univision 97,10%)Fresno, JoSTrans 42, 2024
Redução de texto: telejornais em espanhol versus inglês26% contra 5-6%Fresno, JoSTrans 42, 2024

Nota de contexto: a velocidade é a terceira variável oculta. A Ofcom recomenda que as legendas tenham média abaixo de 180 palavras por minuto, mas quase todos os programas que ela analisou tinham picos curtos acima de 200 ppm, e, quando esses picos foram contados como erros, 68% dos programas ficaram abaixo de 98% (Ofcom, terceiro relatório, 2015). O estudo sobre telejornais em inglês dos EUA constatou que quase dois terços dos erros eram leves.

4. O Que o Atraso Custa aos Espectadores

O público das legendas ao vivo é muito maior do que a comunidade surda isoladamente. A Ofcom estimou que cerca de 7,6 milhões de adultos do Reino Unido já tinham usado legendas, dos quais apenas 1,4 milhão tinha deficiência auditiva (comunicado de imprensa da Ofcom via Wired-Gov, maio de 2013). Isso significa mais de 6 milhões de usuários de legendas sem deficiência auditiva (7,6 milhões menos 1,4 milhão), muitos dos quais assistem em ambientes barulhentos ou com o som baixo. As diretrizes da Ofcom também citam dados da YouGov segundo os quais 61% dos jovens de 18 a 24 anos preferem legendas ativadas. Globalmente, a OMS estima que 430 milhões de pessoas precisam de reabilitação por perda auditiva incapacitante hoje, número que sobe para mais de 700 milhões até 2050.

MétricaValorFonte
Adultos do Reino Unido que já usaram legendasCerca de 7,6 milhões (faixa de 7,0-8,1 milhões)Ofcom, maio de 2013
Desses, com deficiência auditivaCerca de 1,4 milhão (faixa de 1,2-1,6 milhão)Ofcom, maio de 2013
Jovens de 18 a 24 anos do Reino Unido que preferem legendas ativadas61%YouGov, citado nas diretrizes de serviços de acesso da Ofcom
Parcela das horas de programação das emissoras PSB e dos serviços sob demanda maiores do Reino Unido com legendas, 202488%Relatório de Serviços de Acesso da Ofcom, jan.-dez. de 2024 (publicado em 19 de maio de 2025)
Horas legendadas nos canais obrigados no Reino Unido, 2005 contra 201340,5% contra 81,9%Primeiro relatório de legendagem ao vivo da Ofcom, 2014
Pessoas que precisam de reabilitação por perda auditiva incapacitante430 milhõesFicha informativa da OMS, atualizada em março de 2026
Pessoas projetadas com alguma perda auditiva até 2050Quase 2,5 bilhõesFicha informativa da OMS, atualizada em março de 2026

O atraso é o que os espectadores percebem primeiro. O maior estudo recente com usuários pediu a 216 espectadores surdos e com deficiência auditiva que avaliassem 70 trechos de TV ao vivo em quatro condições, gerando 4.832 avaliações. As mesmas legendas de TV receberam nota 3,66 de 7 com o atraso original da transmissão e 5,09 quando sincronizadas, uma oscilação muito maior do que a diferença entre legendas de TV sincronizadas e legendas de ASR (Thompson et al., Are Caption Metrics Broken?, arXiv 2609.11408, setembro de 2026). As legendas de ASR com atraso de dois segundos se saíram bem melhor, com 4,81 contra 5,20 quando sincronizadas.

O mesmo estudo enfraquece a ideia de que as notas de precisão capturam a qualidade. Apenas 11 de 70 trechos de TV e 4 de 70 trechos de ASR atingiram o limite de 98 NER, mas os espectadores avaliaram as legendas sincronizadas de ASR e de TV de forma quase igual, e a correlação entre as métricas e as notas caiu bastante para a saída de ASR (WER r = -0,390 contra -0,687 para legendas de TV). O estudo anterior da Gallaudet na CHI 2024 chegou a conclusão semelhante: os participantes desgostaram fortemente dos atrasos de transmissão, e as métricas-padrão de precisão se correlacionaram apenas fracamente com a avaliação das legendas pelos espectadores.

MétricaValorFonte
Participantes / avaliações / trechos216 / 4.832 / 70Thompson et al., arXiv 2609.11408, 2026
Nota das legendas de TV: atraso original contra sincronizadas (escala de 7 pontos)3,66 contra 5,09Thompson et al., 2026
Nota das legendas de ASR: atraso de 2 s contra sincronizadas4,81 contra 5,20Thompson et al., 2026
WER médio: legendas de TV contra legendas de ASR33,8% contra 17,2%Thompson et al., 2026
NER médio: legendas de TV contra legendas de ASR95,28 contra 94,34Thompson et al., 2026
Trechos que atingiram NER 98: TV contra ASR11 de 70 contra 4 de 70Thompson et al., 2026
Correlação do WER com as notas dos espectadores: TV contra ASRr = -0,687 contra -0,390Thompson et al., 2026

Nota de contexto: o WER alto das legendas de TV reflete em parte o fato de que as legendas de transmissão parafraseiam e condensam, o que o WER pune e o NER não. Essa diferença é exatamente o motivo pelo qual os autores argumentam que as métricas atuais não são neutras em relação à tecnologia.

5. Velocidade dos Mecanismos de ASR: Latência em Streaming contra Conversa Humana

A latência do mecanismo deixou de ser a principal fonte de atraso das legendas. A AssemblyAI informou latência mediana em streaming de 307 ms para o Universal-Streaming contra 516 ms do Deepgram Nova-3, e um P99 de 1.012 ms contra 1.907 ms, medidos do fim de uma palavra no áudio até sua primeira aparição em uma transcrição parcial, em mais de 205 horas de áudio (AssemblyAI, Introducing Universal-Streaming, 2 de junho de 2025). Os dados de lançamento do próprio Deepgram colocaram a taxa mediana de erro de palavras em streaming do Nova-3 em 6,84%, contra 14,92% dos concorrentes testados (Deepgram, Introducing Nova-3, fevereiro de 2025). Ambos são benchmarks de fornecedores e devem ser lidos como números de melhor caso. Nossas estatísticas de speech-to-text cobrem a precisão de mais mecanismos.

Os modelos abertos trocam mais atraso por estabilidade. O sistema acadêmico Whisper-Streaming atingiu latência média de 3,3 segundos em fala longa em inglês do conjunto de testes ESIC do Parlamento Europeu, e a troca é explícita nos resultados: WER em inglês de 8,5% com latência de 3,27 s e blocos de 0,5 s contra 8,0% com 5,45 s e blocos de 2 s (Machacek, Dabre e Bojar, arXiv 2307.14743, IJCNLP-AACL 2023). Note que uma configuração de Whisper de 5 segundos cai exatamente em cima da média de transmissão do Reino Unido de uma década antes.

MétricaValorFonte
Latência mediana / P99 do AssemblyAI Universal-Streaming307 ms / 1.012 msAssemblyAI, junho de 2025
Latência mediana / P99 do Deepgram Nova-3 (teste da AssemblyAI)516 ms / 1.907 msAssemblyAI, junho de 2025
WER mediano do Deepgram Nova-3: streaming / em lote6,84% / 5,26%Deepgram, fev. de 2025
Conjunto de benchmark do Deepgram Nova-32.703 arquivos, 81,69 horas, 9 domíniosDeepgram, fev. de 2025
Latência média do Whisper-Streaming, inglês3,3 segundosMachacek et al., 2023
Whisper-Streaming em inglês: bloco de 0,5 s contra bloco de 2,0 s8,5% de WER a 3,27 s contra 8,0% de WER a 5,45 sMachacek et al., 2023
Latência do Whisper-Streaming, alemão / tcheco (bloco de 0,5 s)4,11 s / 4,69 sMachacek et al., 2023

O teto do tempo real é definido pela conversa humana. Em 10 idiomas, o intervalo médio entre uma pergunta e sua resposta foi de +208 ms, variando de +7 ms em japonês a +469 ms em dinamarquês (Stivers et al., PNAS 2009). O lançamento do GPT-4o da OpenAI afirmou respostas de áudio em apenas 232 ms e 320 ms em média, contra 2,8 segundos (GPT-3.5) e 5,4 segundos (GPT-4) do Modo de Voz anterior em pipeline, que encadeava modelos separados de transcrição, linguagem e fala. A lição para a legendagem ao vivo é a mesma: cada etapa extra na cadeia soma segundos, e a etapa que antes dominava, o próprio reconhecimento, agora é a menor delas.

MétricaValorFonte
Intervalo médio entre pergunta e resposta, 10 idiomas+208 msStivers et al., PNAS 2009 (dados mais recentes disponíveis)
Média do idioma mais rápido / mais lento+7 ms (japonês) / +469 ms (dinamarquês)Stivers et al., PNAS 2009
Resposta de áudio do GPT-4o: mínima / média232 ms / 320 msOpenAI, maio de 2024
Latência média do Modo de Voz em pipeline: GPT-3.5 / GPT-42,8 s / 5,4 sOpenAI, maio de 2024
Atraso das legendas de ASR usado no estudo com espectadores de 20262 segundos em médiaThompson et al., arXiv 2609.11408

6. A Automação Assume a Cadeia de Legendagem

A força de trabalho humana por trás das legendas ao vivo é definida por limites de velocidade. O padrão de tempo real dos EUA, o NCRA Certified Realtime Reporter, exige um teste em tempo real de cinco minutos a 200 palavras por minuto com 96% de precisão, e um relatório da EBU descreve a legendagem ao vivo como acompanhar falantes a até 200 ppm. Respeakers do Reino Unido disseram aos pesquisadores que o treinamento básico leva de 2 a 3 meses, enquanto sentir confiança leva de 1,5 a 2 anos (Moores, JoSTrans 33). Essas restrições explicam por que a legendagem automática escalou tão rápido quando a precisão chegou perto.

A mudança de volume é visível nos registros das empresas. As legendas automáticas LEXI da Ai-Media chegaram a 79,2 milhões de minutos no ano fiscal de 2025, contra menos de 10 milhões quatro anos antes, uma CAGR de quatro anos de 69%, e o LEXI hoje responde pela maior parte do uso em sua rede iCap (resultados do ano fiscal de 2025 da Ai-Media, comunicado à ASX, 28 de agosto de 2025). Os produtos de tecnologia representaram 63% da receita da Ai-Media, contra zero cinco anos antes. Testes independentes desse mesmo sistema encontraram precisão NER de 98,56% em inglês e 98,26% em espanhol, equivalente à das legendas humanas, exceto em conteúdo coloquial com vários falantes (Romero-Fresco e Van Gauwbergen, Fit for What Purpose?, 2025). Mais sobre o lado humano da profissão está em nossas estatísticas de precisão de transcrição em tribunais.

MétricaValorFonte
Padrão de tempo real do NCRA CRR200 ppm com 96% de precisão (teste de 5 minutos)NCRA
Treinamento básico de respeaker / tempo até a confiança2-3 meses / 1,5-2 anosMoores, JoSTrans 33
Minutos de legendas automáticas LEXI da Ai-Media, ano fiscal de 202579,2 milhõesResultados do ano fiscal de 2025 da Ai-Media, ASX
Minutos do LEXI quatro anos antesMenos de 10 milhões (CAGR de 69% em quatro anos)Resultados do ano fiscal de 2025 da Ai-Media, ASX
Participação da tecnologia na receita da Ai-Media63% (receita total de US$ 64,9 milhões)Resultados do ano fiscal de 2025 da Ai-Media, ASX
Precisão NER das legendas automáticas: inglês / espanhol98,56% / 98,26%Romero-Fresco e Van Gauwbergen, 2025
Legendas ao vivo analisadas comparando saída automática e humana, Reino Unido/EUA/Canadá 2018-2022Cerca de 17.000Romero-Fresco e Fresno, Linguistica Antverpiensia 22, 2023

Nota de contexto: a maior comparação entre humanos e máquinas até hoje (Romero-Fresco e Fresno, Linguistica Antverpiensia, 2023) constatou que as legendas automáticas sem edição chegaram perto de 98%, com fraquezas persistentes em pontuação, nomes próprios, números e identificação de falantes. A menor latência do mecanismo não resolve isso: um nome errado rápido continua sendo um nome errado.

Resumo: Latência de Legendagem ao Vivo em Tempo Real em Números

MétricaValorFonte
Latência média das legendas ao vivo no Reino Unido, final de 20145,1 segundosTerceiro relatório da Ofcom, 2015
Amostras do Reino Unido que atenderam à diretriz de 3 s, segunda rodada4 de 72Segundo relatório da Ofcom, 2014
Maior atraso registrado no Reino Unido21 segundosSegundo relatório da Ofcom, 2014
Diretriz atual de latência da OfcomMédia de 4,5 segundos ou menosDiretrizes da Ofcom sobre serviços de acesso
Limite numérico de latência da FCCNenhumFCC 14-12, 2014
Precisão das legendas ao vivo em inglês no CRTCNER 98CRTC 2019-308
Atraso das legendas em telejornais em espanhol nos EUA8,2 segundos em médiaFresno, JoSTrans 42, 2024
Legendas de telejornais em espanhol nos EUA com mais de 10 segundos de atraso20%Fresno, JoSTrans 42, 2024
Atraso médio em trechos de TV ao vivo dos EUA8,46 segundosThompson et al., arXiv 2609.11408, 2026
Nota das legendas de TV: com atraso contra sincronizadas3,66 contra 5,09 de 7Thompson et al., 2026
Precisão das legendas ao vivo no Reino Unido, média das quatro rodadas98,38%Dados da Ofcom via Moores, JoSTrans 33
Precisão dos telejornais nacionais em inglês dos EUA98,8%Fresno, 2024
Precisão das legendas automáticas, inglês98,56%Romero-Fresco e Van Gauwbergen, 2025
Adultos do Reino Unido que já usaram legendasCerca de 7,6 milhõesOfcom, 2013
Horas legendadas das emissoras PSB e dos serviços sob demanda maiores do Reino Unido, 202488%Relatório de Serviços de Acesso da Ofcom 2024
Latência mediana em streaming da AssemblyAI307 msAssemblyAI, junho de 2025
Latência média do Whisper-Streaming3,3 segundosMachacek et al., 2023
Intervalo médio humano na troca de turnos208 msStivers et al., PNAS 2009
Minutos de legendas LEXI da Ai-Media, ano fiscal de 202579,2 milhõesResultados do ano fiscal de 2025 da Ai-Media
Legendagem do catálogo dos serviços de streaming no Canadá até maio de 2031100%CRTC 2026-98

Metodologia e Fontes

Cada número acima foi rastreado até o regulador, o registro regulatório ou o artigo revisado por pares que o produziu. Vários PDFs da Ofcom não puderam ser obtidos diretamente, de modo que os números do Reino Unido foram tomados de comunicados de imprensa da Ofcom (republicados na Wired-Gov), de resumos de reguladores (EPRA) e de análise revisada por pares do conjunto de dados da Ofcom (Moores), cada um citado no texto. Os benchmarks de fornecedores estão identificados como dados de fornecedor. Para dados gerais de mercado e uso de legendagem, veja nossas estatísticas de legendas e closed captions.

Última atualização: 3 de outubro de 2026. Atualizamos este levantamento trimestralmente, e a próxima revisão é esperada quando a Ofcom publicar sua declaração final sobre o Tier 1 Accessibility Code e seu Relatório de Serviços de Acesso para janeiro-dezembro de 2025.

Experimente o VoxBooster — 3 dias grátis.

Clone de voz em tempo real, soundboard e efeitos — onde você já fala.

  • Sem cartão
  • ~30ms de latência
  • Discord · Teams · OBS
Experimentar 3 dias grátis