As legendas ao vivo na televisão do Reino Unido ficaram, em média, de 5,1 a 5,8 segundos atrás da fala nas rodadas de medição da Ofcom, e apenas 4 de 72 amostras da segunda rodada atenderam à antiga diretriz de 3 segundos (Ofcom, relatórios de qualidade da legendagem ao vivo 2014-2015). O problema não desapareceu: um estudo de 2024 sobre telejornais em espanhol nos EUA mediu atraso médio de 8,2 segundos, com legendas individuais chegando a 41 segundos de atraso (Fresno, JoSTrans 2024), e um estudo de setembro de 2026 mediu média de 8,46 segundos em trechos de TV ao vivo dos EUA. Enquanto isso, os mecanismos de reconhecimento de fala em streaming hoje informam latência mediana por palavra próxima de 300 milissegundos (AssemblyAI, junho de 2025), de modo que o gargalo da legendagem ao vivo está passando do digitador humano para a cadeia de transmissão. Reunimos dados da Ofcom, da FCC, do CRTC, de estudos revisados por pares da Gallaudet University e da Universidade de Vigo, de artigos de benchmark no arXiv, dos registros da Ai-Media na ASX, da OMS e de outras fontes primárias listadas na metodologia. Para o panorama mais amplo, veja nosso levantamento de estatísticas de legendagem ao vivo.
TL;DR
- A latência média das legendas ao vivo no Reino Unido caiu de 5,7 para 5,1 segundos entre abril-maio e outubro-novembro de 2014, ainda bem acima da diretriz de 3 segundos (Ofcom, terceiro relatório de legendagem ao vivo, 2015).
- Apenas 4 de 72 amostras do Reino Unido atenderam à diretriz de 3 segundos na segunda rodada, e o maior atraso chegou a 21 segundos (Ofcom, segundo relatório, 2014).
- A Ofcom agora pede latência média de no máximo 4,5 segundos em toda a programação ao vivo (Ofcom, Diretrizes para a Oferta de Serviços de Acesso em TV e sob Demanda).
- Os telejornais em espanhol nos EUA tiveram atraso médio de legendas de 8,2 segundos, e 20% das legendas chegaram mais de 10 segundos atrasadas (Fresno, JoSTrans 42, 2024).
- Legendas de TV com atraso original de transmissão (média de 8,46 s) foram avaliadas com 3,66/7, contra 5,09/7 quando sincronizadas (Thompson et al., arXiv 2609.11408, 2026).
- As legendas ao vivo do Reino Unido tiveram média de 98,38% de precisão NER em quatro rodadas da Ofcom, acima do limite de 98% (dados da Ofcom via Moores, JoSTrans 33).
- Os telejornais nacionais em inglês dos EUA tiveram média de 98,8% de precisão NER (Fresno, Universal Access in the Information Society, 2024).
- Um sistema automático de legendagem marcou 98,56% de NER em inglês e 98,26% em espanhol (Romero-Fresco e Van Gauwbergen, 2025).
- A AssemblyAI informou latência mediana em streaming de 307 ms, contra 516 ms do Deepgram Nova-3 (AssemblyAI, junho de 2025).
- O Whisper-Streaming atingiu latência média de 3,3 segundos em fala longa em inglês (Machacek, Dabre e Bojar, IJCNLP-AACL 2023).
- Os humanos respondem a uma pergunta em média em 208 ms em 10 idiomas (Stivers et al., PNAS 2009), a referência que os sistemas em tempo real tentam alcançar.
- As legendas automáticas LEXI da Ai-Media chegaram a 79,2 milhões de minutos no ano fiscal de 2025, contra menos de 10 milhões quatro anos antes (resultados do ano fiscal de 2025 da Ai-Media, ASX).
1. Atraso Medido: Quanto as Legendas ao Vivo Ficam Atrás da Fala
O conjunto de dados públicos mais completo sobre o atraso de legendas ao vivo continua sendo o do Reino Unido, e ele conta uma história consistente: uma legenda ao vivo típica aparece mais de 5 segundos depois de as palavras serem ditas. A Ofcom amostrou programas de notícias, entretenimento e bate-papo da BBC, ITV, Channel 4, Channel 5 e Sky ao longo de quatro rodadas entre 2013 e 2015. O primeiro relatório encontrou latência mediana de 5,6 segundos (resumo da EPRA do primeiro relatório da Ofcom, abril de 2014), e o segundo encontrou 5,8 segundos, com apenas 4 de 72 amostras dentro da diretriz de 3 segundos (reportagem do Limping Chicken sobre o segundo relatório da Ofcom, novembro de 2014).
A melhora que veio depois foi real, mas pequena. O terceiro relatório da Ofcom registrou queda da latência média de 0,6 segundo, de 5,7 para 5,1 segundos, entre abril-maio e outubro-novembro de 2014 (comunicado de imprensa da Ofcom via Wired-Gov, maio de 2015). Tirar meio segundo de um atraso de cinco segundos exigiu que as emissoras mudassem fluxos de trabalho, não apenas software, e por isso o número estacionou. Estas são as medições de latência da Ofcom mais recentes disponíveis (2014-2015); nenhum conjunto de dados por emissora mais novo foi publicado.
| Métrica | Valor | Fonte |
|---|---|---|
| Latência mediana de legendas ao vivo no Reino Unido, primeira rodada | 5,6 segundos | Primeiro relatório de legendagem ao vivo da Ofcom, abril de 2014 |
| Latência no Reino Unido, segunda rodada | 5,8 segundos | Segundo relatório da Ofcom, novembro de 2014 |
| Amostras que atenderam à diretriz de 3 segundos, segunda rodada | 4 de 72 | Segundo relatório da Ofcom, 2014 |
| Maior atraso registrado, segunda rodada | 21 segundos | Segundo relatório da Ofcom, 2014 |
| Latência média no Reino Unido, abril-maio de 2014 a outubro-novembro de 2014 | 5,7 s para 5,1 s (-0,6 s) | Terceiro relatório da Ofcom, maio de 2015 |
| Latência média no Reino Unido em todas as quatro rodadas | 5,3 segundos | Dados da Ofcom via Moores, JoSTrans 33 |
| Latência sem sincronização ‘como ao vivo’ de legendas preparadas | 7-8 segundos | Dados da Ofcom via Moores, JoSTrans 33 |
Nota de contexto: os números por rodada misturam medianas e médias, conforme divulgados, de modo que as pequenas diferenças entre rodadas (5,6, 5,7, 5,8) não devem ser superinterpretadas. O número de 7-8 segundos para programas sem legendas preparadas e sincronizadas mostra o quanto da média do Reino Unido depende de roteiro, e não de transcrição em tempo real.
Fora do Reino Unido, os atrasos são maiores. As legendas dos telejornais em espanhol dos EUA da Telemundo e da Univision ficaram, em média, 8,2 segundos atrás da fala, variando de 0,7 a 41 segundos, com 46% das legendas atrasadas mais de 8 segundos (Fresno, Closed Captions en español, JoSTrans 42, 2024). Um estudo de 2026 com trechos de TV ao vivo dos EUA mediu atraso médio de 8,46 segundos (DP 3,62) e descreveu 7 a 12 segundos como típico para legendas de TV (Thompson et al., arXiv 2609.11408).
| Métrica | Valor | Fonte |
|---|---|---|
| Atraso médio das legendas, telejornais em espanhol nos EUA | 8,2 segundos | Fresno, JoSTrans 42, 2024 |
| Faixa de atrasos, mesma amostra | 0,7 a 41 segundos | Fresno, JoSTrans 42, 2024 |
| Legendas atrasadas mais de 8 / 10 / 12 segundos | 46% / 20% / 8% | Fresno, JoSTrans 42, 2024 |
| Legendas analisadas nesse estudo | 5.349 (20 trechos de dez minutos) | Fresno, JoSTrans 42, 2024 |
| Atraso médio em trechos de TV ao vivo dos EUA | 8,46 segundos (DP 3,62) | Thompson et al., arXiv 2609.11408, set. de 2026 |
| Atraso típico citado para legendas de TV nos EUA | 7-12 segundos | Thompson et al., arXiv 2609.11408, set. de 2026 |
| Latência média em eventos ao vivo (fora de transmissão) com respeaking | 5,8 segundos (faixa de 4,3 a 7,5 s) | Moores, JoSTrans 33 |
2. Metas Regulatórias: de 3 Segundos para 4,5 Segundos
Os reguladores concordam que a latência importa, mas quase nenhum coloca um número nela. A Ofcom é o único grande regulador deste levantamento com uma meta numérica de latência, e ela moveu essa meta na direção mais branda: de um atraso máximo de 3 segundos em seu Código sobre Serviços de Acesso em Televisão para uma média de no máximo 4,5 segundos na programação ao vivo de um provedor. Durante a consulta pública de 2023, a Ofcom disse que as emissoras haviam chamado o máximo de 3 segundos de irrealista e que 4,5 segundos correspondiam às melhores latências que cada emissora havia alcançado (Diretrizes da Ofcom para a Oferta de Serviços de Acesso em Televisão e sob Demanda).
A abordagem dos EUA é qualitativa. A FCC adotou padrões de qualidade de legendas em 20 de fevereiro de 2014, cobrindo precisão, sincronia, completude e posicionamento, e disse apenas que o atraso das legendas ao vivo ‘deve ser mantido no mínimo, de forma consistente com uma apresentação precisa do que está sendo dito’ (FCC, padrões de qualidade de legendas). O Canadá regula a precisão em vez do tempo: a Política Regulatória de Radiodifusão 2019-308 do CRTC exige que as legendas ao vivo em inglês obtenham nota 98 no modelo NER. O efeito prático é que uma legenda que chega 10 segundos atrasada pode estar plenamente em conformidade na maior parte do mundo.
| Métrica | Valor | Fonte |
|---|---|---|
| Diretriz anterior da Ofcom | Atraso máximo de 3 segundos | Código da Ofcom sobre Serviços de Acesso em Televisão |
| Diretriz atual da Ofcom | Média de no máximo 4,5 segundos na programação ao vivo | Diretrizes da Ofcom para a Oferta de Serviços de Acesso em TV e sob Demanda |
| Antiga orientação da Ofcom sobre velocidade das legendas: pré-gravadas / ao vivo | 160-180 ppm / 200 ppm | Consulta pública da Ofcom de 2023, segundo Liam O’Dell |
| Limite numérico de latência da FCC | Nenhum (atraso ‘mantido no mínimo’) | FCC 14-12, adotada em 20 de fev. de 2014 |
| Proibição da FCC de legendagem ENT apenas por teleprompter na programação ao vivo | 4 grandes redes e afiliadas nos 25 maiores mercados | FCC 14-12 |
| Legendagem da FCC para programação nova não isenta | 100% desde 1º de janeiro de 2006 | 47 CFR 79.1 |
| Exigência de precisão do CRTC para legendas ao vivo em inglês | Nota NER de 98, a partir de 1º de setembro de 2019 | CRTC 2019-308 |
| Obrigação de monitoramento do CRTC | 2 programas ao vivo por mês, incluindo 1 de notícias | CRTC 2019-308 |
Nota de contexto: a ACMA da Austrália, sob o Broadcasting Services (Television Captioning) Standard 2023, em vigor desde 1º de outubro de 2023, também não define latência numérica e avalia legibilidade, precisão e compreensibilidade caso a caso.
As regras mais novas estendem obrigações ao streaming em vez de endurecer o atraso. A decisão CRTC 2026-98, do Canadá, exige que os serviços de streaming online legendem 80% de seu catálogo até maio de 2030 e 100% até maio de 2031, com legendas em novos programas originais ao vivo e pré-gravados em até um ano (CRTC 2026-98, 25 de maio de 2026). O rascunho do Tier 1 Accessibility Code da Ofcom, publicado em 14 de maio de 2026, propõe uma cota de legendagem de 80% para os maiores serviços de streaming quatro anos após a publicação (Ofcom, consulta sobre o Tier 1 Accessibility Code).
| Métrica | Valor | Fonte |
|---|---|---|
| Legendagem do catálogo dos serviços de streaming no Canadá | 80% até maio de 2030, 100% até maio de 2031 | CRTC 2026-98 |
| Exigência canadense de precisão para programas originais pré-gravados nos serviços de streaming | 100% | CRTC 2026-98 |
| Cota de legendagem do Tier 1 da Ofcom, ano 4 / ano 1 | 80% / 20% | Rascunho do Tier 1 Accessibility Code da Ofcom, maio de 2026 |
| Cota de legendagem sob demanda da BBC, ano 4 | 90% | Rascunho do Tier 1 Accessibility Code da Ofcom, maio de 2026 |
| Limite do Tier 1 | mais de 500.000 usuários mensais médios no Reino Unido | Rascunho do Tier 1 Accessibility Code da Ofcom, maio de 2026 |
3. Precisão: a Linha de 98% NER e Quem a Alcança
Atraso e precisão se contrapõem, de modo que os números de latência só fazem sentido ao lado dos de precisão. A régua comum é o modelo NER, que pontua as legendas ao vivo como (palavras menos erros de edição e de reconhecimento) sobre as palavras. 98% é ‘aceitável’, 98,5-98,99% ‘bom’, 99-99,49% ‘muito bom’ e acima de 99,5% ‘excelente’ (Romero-Fresco e Martínez, modelo NER, 2015). O limite parece generoso até você traduzi-lo: a 98%, duas de cada 100 palavras estão erradas, ausentes ou são erros ponderados.
As emissoras do Reino Unido superaram a barreira na média: 98,38% nas quatro rodadas da Ofcom e 98,55% na última, medidos em 78.000 legendas e 546.000 palavras (Moores, JoSTrans 33). Mas as médias escondem a cauda. Em outubro-novembro de 2014, 77% dos programas do Reino Unido atingiram 98% ou mais, contra 74% em abril-maio de 2014, e o jornalismo foi o gênero mais preciso, com 98,75% (Ofcom, terceiro relatório, 2015). Os telejornais nacionais em inglês dos EUA foram melhores, com média de 98,8% e 14 de 20 amostras avaliadas como aceitáveis ou melhores, enquanto os telejornais em espanhol caíram para 97,04% (Fresno, 2024).
| Métrica | Valor | Fonte |
|---|---|---|
| Limites NER de aceitável / excelente | 98% / acima de 99,5% | Romero-Fresco e Martínez, 2015 |
| Precisão das legendas ao vivo no Reino Unido, média das quatro rodadas | 98,38% | Dados da Ofcom via Moores, JoSTrans 33 |
| Precisão das legendas ao vivo no Reino Unido, última rodada | 98,55% | Dados da Ofcom via Moores, JoSTrans 33 |
| Programas do Reino Unido com 98% ou mais, out.-nov. de 2014 (contra abr.-maio de 2014) | 77% (74%) | Terceiro relatório da Ofcom, 2015 |
| Precisão do gênero jornalístico no Reino Unido | 98,75% | Terceiro relatório da Ofcom, 2015 |
| Telejornais nacionais em inglês dos EUA, NER médio | 98,8% (14 de 20 amostras aceitáveis ou melhores) | Fresno, Universal Access in the Information Society, 2024 |
| Telejornais em espanhol dos EUA, NER médio | 97,04% (Telemundo 97,00%, Univision 97,10%) | Fresno, JoSTrans 42, 2024 |
| Redução de texto: telejornais em espanhol versus inglês | 26% contra 5-6% | Fresno, JoSTrans 42, 2024 |
Nota de contexto: a velocidade é a terceira variável oculta. A Ofcom recomenda que as legendas tenham média abaixo de 180 palavras por minuto, mas quase todos os programas que ela analisou tinham picos curtos acima de 200 ppm, e, quando esses picos foram contados como erros, 68% dos programas ficaram abaixo de 98% (Ofcom, terceiro relatório, 2015). O estudo sobre telejornais em inglês dos EUA constatou que quase dois terços dos erros eram leves.
4. O Que o Atraso Custa aos Espectadores
O público das legendas ao vivo é muito maior do que a comunidade surda isoladamente. A Ofcom estimou que cerca de 7,6 milhões de adultos do Reino Unido já tinham usado legendas, dos quais apenas 1,4 milhão tinha deficiência auditiva (comunicado de imprensa da Ofcom via Wired-Gov, maio de 2013). Isso significa mais de 6 milhões de usuários de legendas sem deficiência auditiva (7,6 milhões menos 1,4 milhão), muitos dos quais assistem em ambientes barulhentos ou com o som baixo. As diretrizes da Ofcom também citam dados da YouGov segundo os quais 61% dos jovens de 18 a 24 anos preferem legendas ativadas. Globalmente, a OMS estima que 430 milhões de pessoas precisam de reabilitação por perda auditiva incapacitante hoje, número que sobe para mais de 700 milhões até 2050.
| Métrica | Valor | Fonte |
|---|---|---|
| Adultos do Reino Unido que já usaram legendas | Cerca de 7,6 milhões (faixa de 7,0-8,1 milhões) | Ofcom, maio de 2013 |
| Desses, com deficiência auditiva | Cerca de 1,4 milhão (faixa de 1,2-1,6 milhão) | Ofcom, maio de 2013 |
| Jovens de 18 a 24 anos do Reino Unido que preferem legendas ativadas | 61% | YouGov, citado nas diretrizes de serviços de acesso da Ofcom |
| Parcela das horas de programação das emissoras PSB e dos serviços sob demanda maiores do Reino Unido com legendas, 2024 | 88% | Relatório de Serviços de Acesso da Ofcom, jan.-dez. de 2024 (publicado em 19 de maio de 2025) |
| Horas legendadas nos canais obrigados no Reino Unido, 2005 contra 2013 | 40,5% contra 81,9% | Primeiro relatório de legendagem ao vivo da Ofcom, 2014 |
| Pessoas que precisam de reabilitação por perda auditiva incapacitante | 430 milhões | Ficha informativa da OMS, atualizada em março de 2026 |
| Pessoas projetadas com alguma perda auditiva até 2050 | Quase 2,5 bilhões | Ficha informativa da OMS, atualizada em março de 2026 |
O atraso é o que os espectadores percebem primeiro. O maior estudo recente com usuários pediu a 216 espectadores surdos e com deficiência auditiva que avaliassem 70 trechos de TV ao vivo em quatro condições, gerando 4.832 avaliações. As mesmas legendas de TV receberam nota 3,66 de 7 com o atraso original da transmissão e 5,09 quando sincronizadas, uma oscilação muito maior do que a diferença entre legendas de TV sincronizadas e legendas de ASR (Thompson et al., Are Caption Metrics Broken?, arXiv 2609.11408, setembro de 2026). As legendas de ASR com atraso de dois segundos se saíram bem melhor, com 4,81 contra 5,20 quando sincronizadas.
O mesmo estudo enfraquece a ideia de que as notas de precisão capturam a qualidade. Apenas 11 de 70 trechos de TV e 4 de 70 trechos de ASR atingiram o limite de 98 NER, mas os espectadores avaliaram as legendas sincronizadas de ASR e de TV de forma quase igual, e a correlação entre as métricas e as notas caiu bastante para a saída de ASR (WER r = -0,390 contra -0,687 para legendas de TV). O estudo anterior da Gallaudet na CHI 2024 chegou a conclusão semelhante: os participantes desgostaram fortemente dos atrasos de transmissão, e as métricas-padrão de precisão se correlacionaram apenas fracamente com a avaliação das legendas pelos espectadores.
| Métrica | Valor | Fonte |
|---|---|---|
| Participantes / avaliações / trechos | 216 / 4.832 / 70 | Thompson et al., arXiv 2609.11408, 2026 |
| Nota das legendas de TV: atraso original contra sincronizadas (escala de 7 pontos) | 3,66 contra 5,09 | Thompson et al., 2026 |
| Nota das legendas de ASR: atraso de 2 s contra sincronizadas | 4,81 contra 5,20 | Thompson et al., 2026 |
| WER médio: legendas de TV contra legendas de ASR | 33,8% contra 17,2% | Thompson et al., 2026 |
| NER médio: legendas de TV contra legendas de ASR | 95,28 contra 94,34 | Thompson et al., 2026 |
| Trechos que atingiram NER 98: TV contra ASR | 11 de 70 contra 4 de 70 | Thompson et al., 2026 |
| Correlação do WER com as notas dos espectadores: TV contra ASR | r = -0,687 contra -0,390 | Thompson et al., 2026 |
Nota de contexto: o WER alto das legendas de TV reflete em parte o fato de que as legendas de transmissão parafraseiam e condensam, o que o WER pune e o NER não. Essa diferença é exatamente o motivo pelo qual os autores argumentam que as métricas atuais não são neutras em relação à tecnologia.
5. Velocidade dos Mecanismos de ASR: Latência em Streaming contra Conversa Humana
A latência do mecanismo deixou de ser a principal fonte de atraso das legendas. A AssemblyAI informou latência mediana em streaming de 307 ms para o Universal-Streaming contra 516 ms do Deepgram Nova-3, e um P99 de 1.012 ms contra 1.907 ms, medidos do fim de uma palavra no áudio até sua primeira aparição em uma transcrição parcial, em mais de 205 horas de áudio (AssemblyAI, Introducing Universal-Streaming, 2 de junho de 2025). Os dados de lançamento do próprio Deepgram colocaram a taxa mediana de erro de palavras em streaming do Nova-3 em 6,84%, contra 14,92% dos concorrentes testados (Deepgram, Introducing Nova-3, fevereiro de 2025). Ambos são benchmarks de fornecedores e devem ser lidos como números de melhor caso. Nossas estatísticas de speech-to-text cobrem a precisão de mais mecanismos.
Os modelos abertos trocam mais atraso por estabilidade. O sistema acadêmico Whisper-Streaming atingiu latência média de 3,3 segundos em fala longa em inglês do conjunto de testes ESIC do Parlamento Europeu, e a troca é explícita nos resultados: WER em inglês de 8,5% com latência de 3,27 s e blocos de 0,5 s contra 8,0% com 5,45 s e blocos de 2 s (Machacek, Dabre e Bojar, arXiv 2307.14743, IJCNLP-AACL 2023). Note que uma configuração de Whisper de 5 segundos cai exatamente em cima da média de transmissão do Reino Unido de uma década antes.
| Métrica | Valor | Fonte |
|---|---|---|
| Latência mediana / P99 do AssemblyAI Universal-Streaming | 307 ms / 1.012 ms | AssemblyAI, junho de 2025 |
| Latência mediana / P99 do Deepgram Nova-3 (teste da AssemblyAI) | 516 ms / 1.907 ms | AssemblyAI, junho de 2025 |
| WER mediano do Deepgram Nova-3: streaming / em lote | 6,84% / 5,26% | Deepgram, fev. de 2025 |
| Conjunto de benchmark do Deepgram Nova-3 | 2.703 arquivos, 81,69 horas, 9 domínios | Deepgram, fev. de 2025 |
| Latência média do Whisper-Streaming, inglês | 3,3 segundos | Machacek et al., 2023 |
| Whisper-Streaming em inglês: bloco de 0,5 s contra bloco de 2,0 s | 8,5% de WER a 3,27 s contra 8,0% de WER a 5,45 s | Machacek et al., 2023 |
| Latência do Whisper-Streaming, alemão / tcheco (bloco de 0,5 s) | 4,11 s / 4,69 s | Machacek et al., 2023 |
O teto do tempo real é definido pela conversa humana. Em 10 idiomas, o intervalo médio entre uma pergunta e sua resposta foi de +208 ms, variando de +7 ms em japonês a +469 ms em dinamarquês (Stivers et al., PNAS 2009). O lançamento do GPT-4o da OpenAI afirmou respostas de áudio em apenas 232 ms e 320 ms em média, contra 2,8 segundos (GPT-3.5) e 5,4 segundos (GPT-4) do Modo de Voz anterior em pipeline, que encadeava modelos separados de transcrição, linguagem e fala. A lição para a legendagem ao vivo é a mesma: cada etapa extra na cadeia soma segundos, e a etapa que antes dominava, o próprio reconhecimento, agora é a menor delas.
| Métrica | Valor | Fonte |
|---|---|---|
| Intervalo médio entre pergunta e resposta, 10 idiomas | +208 ms | Stivers et al., PNAS 2009 (dados mais recentes disponíveis) |
| Média do idioma mais rápido / mais lento | +7 ms (japonês) / +469 ms (dinamarquês) | Stivers et al., PNAS 2009 |
| Resposta de áudio do GPT-4o: mínima / média | 232 ms / 320 ms | OpenAI, maio de 2024 |
| Latência média do Modo de Voz em pipeline: GPT-3.5 / GPT-4 | 2,8 s / 5,4 s | OpenAI, maio de 2024 |
| Atraso das legendas de ASR usado no estudo com espectadores de 2026 | 2 segundos em média | Thompson et al., arXiv 2609.11408 |
6. A Automação Assume a Cadeia de Legendagem
A força de trabalho humana por trás das legendas ao vivo é definida por limites de velocidade. O padrão de tempo real dos EUA, o NCRA Certified Realtime Reporter, exige um teste em tempo real de cinco minutos a 200 palavras por minuto com 96% de precisão, e um relatório da EBU descreve a legendagem ao vivo como acompanhar falantes a até 200 ppm. Respeakers do Reino Unido disseram aos pesquisadores que o treinamento básico leva de 2 a 3 meses, enquanto sentir confiança leva de 1,5 a 2 anos (Moores, JoSTrans 33). Essas restrições explicam por que a legendagem automática escalou tão rápido quando a precisão chegou perto.
A mudança de volume é visível nos registros das empresas. As legendas automáticas LEXI da Ai-Media chegaram a 79,2 milhões de minutos no ano fiscal de 2025, contra menos de 10 milhões quatro anos antes, uma CAGR de quatro anos de 69%, e o LEXI hoje responde pela maior parte do uso em sua rede iCap (resultados do ano fiscal de 2025 da Ai-Media, comunicado à ASX, 28 de agosto de 2025). Os produtos de tecnologia representaram 63% da receita da Ai-Media, contra zero cinco anos antes. Testes independentes desse mesmo sistema encontraram precisão NER de 98,56% em inglês e 98,26% em espanhol, equivalente à das legendas humanas, exceto em conteúdo coloquial com vários falantes (Romero-Fresco e Van Gauwbergen, Fit for What Purpose?, 2025). Mais sobre o lado humano da profissão está em nossas estatísticas de precisão de transcrição em tribunais.
| Métrica | Valor | Fonte |
|---|---|---|
| Padrão de tempo real do NCRA CRR | 200 ppm com 96% de precisão (teste de 5 minutos) | NCRA |
| Treinamento básico de respeaker / tempo até a confiança | 2-3 meses / 1,5-2 anos | Moores, JoSTrans 33 |
| Minutos de legendas automáticas LEXI da Ai-Media, ano fiscal de 2025 | 79,2 milhões | Resultados do ano fiscal de 2025 da Ai-Media, ASX |
| Minutos do LEXI quatro anos antes | Menos de 10 milhões (CAGR de 69% em quatro anos) | Resultados do ano fiscal de 2025 da Ai-Media, ASX |
| Participação da tecnologia na receita da Ai-Media | 63% (receita total de US$ 64,9 milhões) | Resultados do ano fiscal de 2025 da Ai-Media, ASX |
| Precisão NER das legendas automáticas: inglês / espanhol | 98,56% / 98,26% | Romero-Fresco e Van Gauwbergen, 2025 |
| Legendas ao vivo analisadas comparando saída automática e humana, Reino Unido/EUA/Canadá 2018-2022 | Cerca de 17.000 | Romero-Fresco e Fresno, Linguistica Antverpiensia 22, 2023 |
Nota de contexto: a maior comparação entre humanos e máquinas até hoje (Romero-Fresco e Fresno, Linguistica Antverpiensia, 2023) constatou que as legendas automáticas sem edição chegaram perto de 98%, com fraquezas persistentes em pontuação, nomes próprios, números e identificação de falantes. A menor latência do mecanismo não resolve isso: um nome errado rápido continua sendo um nome errado.
Resumo: Latência de Legendagem ao Vivo em Tempo Real em Números
| Métrica | Valor | Fonte |
|---|---|---|
| Latência média das legendas ao vivo no Reino Unido, final de 2014 | 5,1 segundos | Terceiro relatório da Ofcom, 2015 |
| Amostras do Reino Unido que atenderam à diretriz de 3 s, segunda rodada | 4 de 72 | Segundo relatório da Ofcom, 2014 |
| Maior atraso registrado no Reino Unido | 21 segundos | Segundo relatório da Ofcom, 2014 |
| Diretriz atual de latência da Ofcom | Média de 4,5 segundos ou menos | Diretrizes da Ofcom sobre serviços de acesso |
| Limite numérico de latência da FCC | Nenhum | FCC 14-12, 2014 |
| Precisão das legendas ao vivo em inglês no CRTC | NER 98 | CRTC 2019-308 |
| Atraso das legendas em telejornais em espanhol nos EUA | 8,2 segundos em média | Fresno, JoSTrans 42, 2024 |
| Legendas de telejornais em espanhol nos EUA com mais de 10 segundos de atraso | 20% | Fresno, JoSTrans 42, 2024 |
| Atraso médio em trechos de TV ao vivo dos EUA | 8,46 segundos | Thompson et al., arXiv 2609.11408, 2026 |
| Nota das legendas de TV: com atraso contra sincronizadas | 3,66 contra 5,09 de 7 | Thompson et al., 2026 |
| Precisão das legendas ao vivo no Reino Unido, média das quatro rodadas | 98,38% | Dados da Ofcom via Moores, JoSTrans 33 |
| Precisão dos telejornais nacionais em inglês dos EUA | 98,8% | Fresno, 2024 |
| Precisão das legendas automáticas, inglês | 98,56% | Romero-Fresco e Van Gauwbergen, 2025 |
| Adultos do Reino Unido que já usaram legendas | Cerca de 7,6 milhões | Ofcom, 2013 |
| Horas legendadas das emissoras PSB e dos serviços sob demanda maiores do Reino Unido, 2024 | 88% | Relatório de Serviços de Acesso da Ofcom 2024 |
| Latência mediana em streaming da AssemblyAI | 307 ms | AssemblyAI, junho de 2025 |
| Latência média do Whisper-Streaming | 3,3 segundos | Machacek et al., 2023 |
| Intervalo médio humano na troca de turnos | 208 ms | Stivers et al., PNAS 2009 |
| Minutos de legendas LEXI da Ai-Media, ano fiscal de 2025 | 79,2 milhões | Resultados do ano fiscal de 2025 da Ai-Media |
| Legendagem do catálogo dos serviços de streaming no Canadá até maio de 2031 | 100% | CRTC 2026-98 |
Metodologia e Fontes
Cada número acima foi rastreado até o regulador, o registro regulatório ou o artigo revisado por pares que o produziu. Vários PDFs da Ofcom não puderam ser obtidos diretamente, de modo que os números do Reino Unido foram tomados de comunicados de imprensa da Ofcom (republicados na Wired-Gov), de resumos de reguladores (EPRA) e de análise revisada por pares do conjunto de dados da Ofcom (Moores), cada um citado no texto. Os benchmarks de fornecedores estão identificados como dados de fornecedor. Para dados gerais de mercado e uso de legendagem, veja nossas estatísticas de legendas e closed captions.
- Ofcom: comunicado de imprensa do terceiro relatório de legendagem ao vivo (Wired-Gov, maio de 2015), comunicado de imprensa da consulta sobre legendagem ao vivo (Wired-Gov, maio de 2013), Diretrizes para a Oferta de Serviços de Acesso em Televisão e sob Demanda, Relatório de Serviços de Acesso jan.-dez. de 2024, consulta sobre o Tier 1 Accessibility Code (maio de 2026)
- EPRA: resumo do primeiro relatório de legendagem ao vivo da Ofcom (abril de 2014)
- Limping Chicken: reportagem sobre o segundo relatório de legendagem ao vivo da Ofcom (novembro de 2014)
- Liam O’Dell: reportagem sobre a consulta da Ofcom sobre o código de acesso de 2023 e consulta sobre o código do Tier 1
- FCC: padrões de qualidade de legendas, FCC 14-12 (2014) e 47 CFR 79.1
- CRTC: Política Regulatória de Radiodifusão 2019-308 e Política Regulatória de Radiodifusão 2026-98
- ACMA / Governo da Austrália: Broadcasting Services (Television Captioning) Standard 2023
- EBU: relatório sobre serviços de acesso e legendagem ao vivo (i044) e Tech 3370, EBU-TT Parte 3 Legendagem ao Vivo
- Thompson, Kushalnagar, Vogler et al.: Are Caption Metrics Broken?, arXiv 2609.11408 (setembro de 2026); Glasser, Kushalnagar e Vogler: How Users Experience Closed Captions on Live Television, CHI 2024
- Fresno: Closed Captions en español, JoSTrans 42 (2024) e Live captioning accuracy in English-language newscasts in the USA (2024)
- Moores: legendagem ao vivo em eventos ao vivo, JoSTrans 33 (inclui análise do conjunto de dados da Ofcom)
- Romero-Fresco e Fresno: The accuracy of automatic and human live captions in English (2023); Romero-Fresco e Van Gauwbergen: Fit for What Purpose? (2025); Romero-Fresco e Martínez: o modelo NER (2015)
- Machacek, Dabre e Bojar: Turning Whisper into Real-Time Transcription System (2023)
- AssemblyAI: Introducing Universal-Streaming (junho de 2025); Deepgram: Introducing Nova-3 (fevereiro de 2025)
- OpenAI: Hello GPT-4o (maio de 2024)
- Stivers et al.: Universals and cultural variation in turn-taking in conversation, PNAS (2009)
- Ai-Media: resultados do ano fiscal de 2025, comunicado à ASX (agosto de 2025)
- NCRA: Certified Realtime Reporter
- OMS: ficha informativa sobre surdez e perda auditiva (atualizada em março de 2026)
- Nota sobre os dados: as medições de latência por emissora da Ofcom (2013-2015) têm mais de três anos e continuam sendo o conjunto de dados públicos mais recente desse tipo; as rodadas divulgam uma mistura de medianas e médias (5,6, 5,8, 5,7 para 5,1 e uma média de quatro rodadas de 5,3 via Moores), portanto devem ser tratadas como uma faixa, e não como uma linha de tendência. A estimativa da Ofcom sobre usuários de legendas (7,6 milhões) data de 2013 e os dados de troca de turnos de Stivers, de 2009. Os números da AssemblyAI e da Deepgram são benchmarks de fornecedores; a comparação da AssemblyAI mediu um concorrente em seu próprio conjunto de testes, e testes independentes do Nova-3 relatam WER maior que o número da Deepgram. O artigo de 2026 de Thompson et al. é um preprint do arXiv e ainda não foi revisado por pares. O número de receita da Ai-Media é mostrado como informado em seu comunicado à ASX. Duas avaliações independentes do mesmo sistema automático relatam precisões de destaque diferentes conforme a dificuldade do conteúdo, e o estudo com espectadores de 2026 encontrou taxas de aprovação NER muito menores em trechos de TV ao vivo, de modo que a precisão automática depende muito do gênero. O código Tier 1 da Ofcom é um rascunho cuja consulta pública foi encerrada em 7 de agosto de 2026, e uma declaração final é esperada.
Última atualização: 3 de outubro de 2026. Atualizamos este levantamento trimestralmente, e a próxima revisão é esperada quando a Ofcom publicar sua declaração final sobre o Tier 1 Accessibility Code e seu Relatório de Serviços de Acesso para janeiro-dezembro de 2025.