Estatísticas de Precisão do Reconhecimento de Fala em Tribunais (2026): Mais de 55 Dados sobre Taxas de Erro de ASR, Precisão de Taquígrafos Judiciais e Pilotos de Transcrição por IA

Precisão de reconhecimento de fala em tribunais 2026: o ASR comercial errou 35% das palavras de falantes negros contra 19% de brancos, com mais de 50 dados.

Cinco dos principais sistemas comerciais de reconhecimento de fala tiveram taxa média de erro de palavras de 0,35 para falantes negros contra 0,19 para falantes brancos, e 23% do áudio de falantes negros gerou transcrições tão cheias de erros que ficaram inutilizáveis, contra apenas 1,6% para falantes brancos (Koenecke et al., PNAS 2020). A transcrição humana também não é um parâmetro limpo: taquígrafos judiciais certificados da Filadélfia transcreveram o inglês afro-americano com 82,9% de precisão por palavra, mais de 12 pontos abaixo do padrão de 95% pelo qual são certificados (Jones et al., Language 2019). Enquanto isso, quem produz o registro está desaparecendo, com cerca de 23.000 estenógrafos restantes após uma queda de 21% em uma década (AAERT, Court Reporting Industry Trends 2025), e 71,3% das audiências de família, sucessões e cíveis da Califórnia ao longo de três anos não tiveram registro literal algum (Judicial Council of California, 2026). Reunimos dados da PNAS, da revista Language da Linguistic Society of America, da National Court Reporters Association, do Judicial Council of California, do Thomson Reuters Institute e do National Center for State Courts, da Suprema Corte das Filipinas, do Ministério da Justiça do Reino Unido e de auditorias de IA revisadas por pares para mostrar onde a precisão da transcrição em tribunais realmente está em 2026. Para um panorama mais amplo da força de trabalho, veja nossas estatísticas de taquigrafia judicial.

TL;DR

  • O ASR comercial teve WER médio de 0,35 para falantes negros contra 0,19 para falantes brancos (Koenecke et al., PNAS 2020).
  • 23% dos trechos de falantes negros contra 1,6% dos de falantes brancos ultrapassaram o limite de WER de 0,5 que os autores consideram inutilizável (PNAS 2020).
  • Homens negros tiveram WER médio de 0,41, o dobro dos 0,21 dos homens brancos (PNAS 2020).
  • Taquígrafos judiciais da Filadélfia alcançaram 82,9% de precisão por palavra e 59,5% por frase em inglês afro-americano (Jones et al., Language 2019).
  • 31% das transcrições dos taquígrafos judiciais mudaram quem, o quê, quando, onde ou a força de um enunciado (Language 2019).
  • Restam cerca de 23.000 estenógrafos após uma queda de 21% em dez anos; as matrículas caíram 74% (AAERT 2025).
  • Os novos membros certificados da NCRA caíram de 243 (2023) para 205 (2025); a idade média dos taquígrafos judiciais é de 56 anos (NCRA Statistics, março de 2026).
  • 72,4% das audiências de família, sucessões e cíveis da Califórnia no 1º trimestre de 2026 não tiveram registro literal (Judicial Council of California 2026).
  • Apenas 17% dos tribunais estaduais usam IA generativa e 70% proíbem seus funcionários de usar ferramentas de IA (Thomson Reuters Institute, State Courts Survey 2025).
  • Os tribunais filipinos reduziram o tempo de transcrição em 50% em média, chegando a 80%, em um piloto de IA (Suprema Corte das Filipinas, 2025).
  • Cerca de 1% das transcrições do Whisper continham frases alucinadas, e 38% delas eram prejudiciais (Koenecke et al., ACM FAccT 2024).
  • Uma força-tarefa federal de 15 membros sobre conversão de fala em texto em tribunais foi proposta no S. 4154 em 19 de março de 2026 (Senado dos EUA).

1. Taxas de Erro de Palavras do ASR por Raça, Dialeto e Gênero

O problema central de precisão do reconhecimento de fala em tribunais não é o desempenho médio, e sim a variação entre os falantes. Cada um dos cinco sistemas testados cometeu quase o dobro de erros com falantes negros em comparação com falantes brancos, mesmo em frases idênticas de cinco a oito palavras, o que aponta para o modelo acústico e não para o vocabulário. Em um tribunal, onde o registro precisa ser igualmente confiável para toda testemunha, uma ferramenta precisa na média, mas desigual entre falantes, falha no teste básico de equidade.

Dado mais recente disponível: Koenecke et al., Racial disparities in automated speech recognition, PNAS 2020. Nenhum estudo de escala e desenho comparáveis foi publicado desde então, o que já é um achado em si: a base de evidências por trás da contratação de ASR para tribunais tem seis anos.

MétricaValorFonte
WER médio em 5 sistemas de ASR, falantes negros0,35Koenecke et al., PNAS 2020
WER médio em 5 sistemas de ASR, falantes brancos0,19Koenecke et al., PNAS 2020
WER da Apple (pior desempenho), falantes negros vs brancos0,45 vs 0,23Koenecke et al., PNAS 2020
WER da Microsoft (melhor desempenho), falantes negros vs brancos0,27 vs 0,15Koenecke et al., PNAS 2020
WER médio, homens negros vs mulheres negras0,41 vs 0,30Koenecke et al., PNAS 2020
WER médio, homens brancos vs mulheres brancas0,21 vs 0,17Koenecke et al., PNAS 2020
Trechos com WER acima de 0,5 (inutilizáveis), falantes negros vs brancos23% vs 1,6%Koenecke et al., PNAS 2020
WER em frases idênticas, Microsoft, falantes negros vs brancos0,13 vs 0,07Koenecke et al., PNAS 2020

Contexto: o estudo comparou 2.141 trechos de áudio de cada grupo (19,8 horas de 73 falantes negros e 42 brancos). O WER mediano foi de 0,38 em Princeville, Carolina do Norte, e 0,31 em Washington, D.C., contra 0,18 em Sacramento e 0,15 no condado de Humboldt, e as taxas de erro aumentaram com a densidade de traços do inglês vernacular afro-americano. O vocabulário não era a causa: o sistema do Google tinha 98,7% das palavras ditas por participantes negros em seu vocabulário, contra 98,6% para participantes brancos. Como observa o resumo da Stanford Engineering, os autores apontaram especificamente os órgãos de justiça criminal que transcrevem audiências como um contexto em que essas lacunas poderiam causar danos.

Trabalhos mais recentes confirmam o mecanismo sem substituir os números principais. Um artigo de Mojarad e Tang na Interspeech 2025 encontrou um efeito pequeno, porém significativo, da redução de encontros consonantais e da redução de ING sobre o WER no inglês afro-americano, e o benchmark Fair-Speech, lançado em 2024, reuniu cerca de 26,5 mil falas de 593 participantes dos EUA justamente para medir a equidade demográfica (Veliche et al., 2024). Quem quiser comparar a precisão entre ferramentas encontra benchmarks gerais em nossas estatísticas de conversão de fala em texto.

2. Precisão dos Taquígrafos Judiciais Humanos em Falas com Dialeto

A comparação justa para o ASR em tribunais não é uma transcrição perfeita, e sim a linha de base humana, que é mais fraca do que a certificação sugere. Taquígrafos judiciais certificados erraram de alguma forma 40,5% das frases em inglês afro-americano, em condições melhores do que as de um tribunal: sala silenciosa, áudio de alta qualidade, cada fala reproduzida duas vezes e tempo ilimitado para revisão. A distância entre a certificação e o desempenho real com dialetos é o número menos divulgado da transcrição judicial.

O estudo, Testifying while black (Jones, Kalbfeld, Hancock e Clark, Language 2019), testou 27 taquígrafos judiciais dos tribunais da Filadélfia, cerca de um terço do quadro oficial de taquígrafos da cidade, em 83 falas naturalistas, gerando 2.241 transcrições.

MétricaValorFonte
Padrão de precisão de certificação dos taquígrafos judiciais95% ou 98%Jones et al., Language 2019
Precisão média de transcrição por frase59,5%Jones et al., Language 2019
Melhor vs pior precisão por frase77% vs 18%Jones et al., Language 2019
Precisão média por palavra82,9% (12,1 pontos abaixo do padrão)Jones et al., Language 2019
Melhor vs pior precisão por palavra91,2% vs 58,4%Jones et al., Language 2019
Transcrições que mudaram quem, o quê, quando, onde ou a força31% (701 de 2.241)Jones et al., Language 2019
Transcrições que teriam inserido texto sem sentido no registro11% (248)Jones et al., Language 2019
Precisão média de paráfrase (compreensão)33%Jones et al., Language 2019

Nota sobre os extremos: na fase piloto, advogados que se identificaram como falantes de inglês afro-americano alcançaram 90% de precisão de transcrição, contra 64,2% dos advogados que falavam inglês americano padrão. Taquígrafos judiciais negros parafrasearam corretamente 52,5% das falas contra 33,7% dos não negros, e 70% de todos os taquígrafos participantes nunca tinham ouvido o termo inglês afro-americano. A lição para a contratação de IA: um fornecedor que faz benchmark apenas com conjuntos de teste em inglês padrão está medindo a coisa errada, e o mesmo vale para a certificação humana. Tratamos do problema paralelo no mercado de trabalho em nossas estatísticas de viés de sotaque.

3. A Força de Trabalho de Taquígrafos por Trás do Registro

O debate sobre precisão pesa mais porque a oferta humana está encolhendo. As novas certificações da NCRA caíram pelo segundo ano seguido, para 205 em 2025, enquanto a idade média dos taquígrafos judiciais agora é de 56 anos. Os tribunais não estão escolhendo entre estenógrafos e software em abstrato; estão decidindo o que ocupa as vagas que já estão vazias.

MétricaValorFonte
Estenógrafos certificados restantes nos EUACerca de 23.000AAERT, Court Reporting Industry Trends 2025
Queda de estenógrafos certificados na última década21%AAERT, Court Reporting Industry Trends 2025
Queda nas matrículas das escolas de estenografia (3.083 em 2015 para 790 em 2024)74%AAERT, Court Reporting Industry Trends 2025
Programas ou escolas de estenografia fechados na décadaCerca de 42%AAERT, Court Reporting Industry Trends 2025
Novos membros certificados da NCRA, 2023 / 2024 / 2025243 / 211 / 205NCRA Statistics, março de 2026
Idade média dos membros da NCRA que são taquígrafos judiciais56NCRA Statistics, março de 2026
Vagas de taquígrafo judicial e legendista simultâneo, 202519.900BLS Occupational Outlook Handbook
Variação projetada do emprego, 2025-350% (cerca de 1.800 vagas por ano)BLS Occupational Outlook Handbook

A pesquisa da AAERT com usuários finais (mais de 550 respondentes, realizada no 4º trimestre de 2024) quantifica o efeito a jusante: 76% relatam dificuldade para agendar audiências, 55% relatam custos mais altos, 39% relatam atrasos e 26% dizem estar aceitando transcrições de qualidade inferior. E 96% apontaram a precisão como o indicador de desempenho mais importante. Fontes: relatório do setor da AAERT, NCRA Statistics e o perfil dos taquígrafos judiciais do BLS, que prevê expressamente que as ferramentas de transcrição por IA limitarão o crescimento futuro do emprego, enquanto os taquígrafos continuarão necessários para revisar e editar os registros produzidos digitalmente. Ressalva: a AAERT representa taquígrafos e transcritores eletrônicos e encomendou o estudo, de modo que seu enquadramento favorece o registro digital, embora seus números sobre a força de trabalho se baseiem em dados da NCRA e do BLS.

4. Processos Sem Nenhum Registro Literal

A pior precisão de transcrição é a ausência de transcrição. A Califórnia, que restringe a gravação eletrônica na maioria dos tipos de caso, publica os dados públicos mais detalhados dos EUA sobre o que acontece quando não há taquígrafos disponíveis. Ao longo de três anos, 3.007.651 audiências de família, sucessões e cíveis ilimitadas seguiram sem registro literal, o que, segundo a própria ficha técnica do estado, frequentemente será fatal para um recurso.

MétricaValorFonte
Audiências sem registro literal, 1º tri. de 2026303.430 de 418.985 (72,4%)Judicial Council of California, 2026
Audiências sem registro literal, abr. de 2023 a mar. de 20263.007.651 de 4.214.365 (71,3%)Judicial Council of California, 2026
Taquígrafos empregados pelos tribunais vs FTE adicionais necessários1.101 vs mais 458Judicial Council of California, 2026
Taquígrafos FTE contratados vs desligados, abr. de 2023 a mar. de 2026381,8 vs 366,3 (ganho líquido de 15,5)Judicial Council of California, 2026
Parcela das novas contratações que eram voice writers48,1% (183,5 FTE)Judicial Council of California, 2026
Queda de profissionais licenciados na Califórnia, exercício 2013-14 a 2022-2320,9% (novos pedidos em queda de 42,9%)Judicial Council of California Fact Sheet, jan. de 2025
Gasto dos tribunais da Califórnia com transcrições, exercício 2023-24US$ 23,7 milhõesJudicial Council of California Fact Sheet, jan. de 2025
Custo diário de taquígrafo particular, depoimento vs julgamentoUS$ 2.580 vs US$ 3.300Judicial Council of California Fact Sheet, jan. de 2025

Contexto: a formação de novos profissionais melhora na margem, com 176 novas licenças emitidas no exercício 2024-25, contra 68 em 2022-23, e uma taxa de aprovação de 52,7% entre 294 candidatos recentes ao exame. Mas quase metade das novas contratações são voice writers, o que já é um fluxo de trabalho de reconhecimento de fala: o taquígrafo repete o testemunho em um microfone acoplado a uma máscara e o software o converte. Os dados atualizados estão no painel de escassez do Judicial Council, e os números de custo vêm de sua ficha técnica de janeiro de 2025.

5. Adoção de Transcrição por IA e Pilotos nos Tribunais

Os tribunais estaduais dos EUA são cautelosos, e os números mostram uma grande distância entre expectativa e permissão. 91% dos profissionais de tribunais estaduais esperam que a IA tenha ao menos um impacto moderado nas operações judiciais, mas 70% dizem que seu tribunal não permite que funcionários usem ferramentas baseadas em IA. As implantações mais avançadas estão fora dos EUA, onde os judiciários nacionais podem padronizar uma única plataforma.

MétricaValorFonte
Tribunais estaduais que usam IA generativa atualmente17%Thomson Reuters Institute, State Courts Survey 2025
Tribunais que não permitem que funcionários usem ferramentas baseadas em IA70%Thomson Reuters Institute, State Courts Survey 2025
Respondentes que apontam a IA como a tendência mais significativa55%Thomson Reuters Institute, State Courts Survey 2025
Sistemas judiciais que ofereceram treinamento em IA25%NCSC, Preparing for Future Workforce Needs 2025
Respondentes que esperam que a escassez de pessoal continue61%NCSC, Preparing for Future Workforce Needs 2025
Escopo do piloto filipino de transcrição por IA (jul. de 2023 a set. de 2024)Sandiganbayan + 41 tribunais de primeira instânciaSuprema Corte das Filipinas, 2025
Redução do tempo de transcrição no piloto filipino50% em média, até 80%Suprema Corte das Filipinas, 2025
Precisão relatada ao longo do piloto filipinoSubiu de 70% para 90-95%Suprema Corte das Filipinas, 2025

A pesquisa abrangeu 443 juízes e profissionais de tribunais estaduais, de condado e municipais em março e abril de 2025 (Thomson Reuters Institute; resumo do NCSC). Os resultados filipinos, apresentados pelo Presidente da Suprema Corte Alexander Gesmundo, vieram da plataforma Scriptix com um modelo de linguagem personalizado para filipino e taglish, e a Suprema Corte autorizou a implantação nacional em novembro de 2024 (Suprema Corte das Filipinas). Note que a precisão inicial de 70% seria inaceitável para qualquer registro oficial; os ganhos vieram do uso contínuo e da edição humana, não de simplesmente ligar a ferramenta.

O Reino Unido oferece o maior dado de volume até agora, embora vindo da liberdade condicional e não dos tribunais: o Ministério da Justiça informa que mais de 1.600.000 reuniões foram resumidas com sua ferramenta interna Justice Transcribe entre 7 de outubro de 2025 e 14 de setembro de 2026, uma economia ilustrativa de cerca de 266.667 horas a 10 minutos por reunião (dados do Justice Transcribe no GOV.UK). O próprio anúncio do ministério projeta 18.750 dias corridos liberados por ano, e o HM Courts and Tribunals Service agora está testando a mesma ferramenta contra transcritores humanos contratados para as transcrições da Crown Court. Para saber como o setor jurídico em geral está adotando a IA, veja nossas estatísticas de IA no setor jurídico.

6. Alucinações, Transcrições Policiais e a Lacuna de Fiscalização

A taxa de erro de palavras subestima o risco jurídico da transcrição por IA, porque uma transcrição também pode conter palavras que ninguém disse. 38% dos trechos alucinados do Whisper incluíam danos explícitos, como violência, associações falsas ou sugestão de autoridade, o tipo de conteúdo que poderia mudar a forma como um juiz ou júri lê um testemunho. O áudio de tribunal está cheio de pausas longas, e trechos longos sem fala são exatamente o que os pesquisadores associaram às alucinações.

MétricaValorFonte
Transcrições do Whisper com frases ou sentenças inteiramente alucinadasCerca de 1% (1,4% em média)Koenecke et al., ACM FAccT 2024
Alucinações com pelo menos um dano explícito38%Koenecke et al., ACM FAccT 2024
Alucinações que perpetuam violência19%Koenecke et al., ACM FAccT 2024
Alucinações com associações imprecisas / que sugerem autoridade falsa13% / 8%Koenecke et al., ACM FAccT 2024
Teste de relatórios policiais por IA do Draft One: policiais e relatórios85 policiais, 755 relatóriosAdams et al., Journal of Experimental Criminology 2025
Efeito do Draft One no tempo de redação de relatóriosSem redução estatisticamente significativaAdams et al., Journal of Experimental Criminology 2025
Duração e resultado do teste de relatórios por IA do Departamento de Polícia de Anchorage3 meses, sem economia de tempo significativaDepartamento de Polícia de Anchorage via EFF, 2025
Força-tarefa federal proposta sobre conversão de fala em texto em tribunais15 membros, relatório em 18 mesesS. 4154, Research and Oversight of AI in Courts Act of 2026

Contexto: o estudo sobre alucinações (ACM FAccT 2024) constatou que as alucinações ocorreram de forma desproporcional com falantes com afasia, que têm pausas sem fala mais longas. O áudio de câmeras corporais já alimenta o registro criminal por meio de relatórios policiais redigidos por IA; o ensaio randomizado pré-registrado do Axon Draft One (Springer) não encontrou economia de tempo, porque os policiais gastaram o ganho editando erros e acrescentando fatos omitidos, e o fornecedor havia divulgado uma redução de 50% (EFF). O projeto de lei federal em tramitação, apresentado em 19 de março de 2026, exigiria que a força-tarefa examinasse a precisão da transcrição, os efeitos sobre falantes com sotaque ou dialeto e marcas d’água para registros modificados por IA (texto do S. 4154, GovInfo). A questão para os tribunais não é mais se o reconhecimento de fala é bom o bastante na média; é se alguém está medindo isso para os falantes que mais precisam de um registro preciso.

Resumo: Precisão do Reconhecimento de Fala em Tribunais em Números

MétricaValorFonte
WER médio do ASR, falantes negros vs brancos0,35 vs 0,19Koenecke et al., PNAS 2020
Trechos com transcrições inutilizáveis (WER acima de 0,5), negros vs brancos23% vs 1,6%Koenecke et al., PNAS 2020
WER do ASR, homens negros vs homens brancos0,41 vs 0,21Koenecke et al., PNAS 2020
WER do ASR da Apple, falantes negros vs brancos0,45 vs 0,23Koenecke et al., PNAS 2020
Precisão por palavra dos taquígrafos judiciais em inglês afro-americano82,9%Jones et al., Language 2019
Precisão por frase dos taquígrafos judiciais em inglês afro-americano59,5%Jones et al., Language 2019
Transcrições de taquígrafos judiciais que mudaram o sentido31%Jones et al., Language 2019
Padrão de certificação dos taquígrafos judiciais95% a 98%Jones et al., Language 2019
Estenógrafos restantes nos EUACerca de 23.000AAERT 2025
Queda nas matrículas de estenografia, 2015 a 202474%AAERT 2025
Novos membros certificados da NCRA, 2025205NCRA Statistics, março de 2026
Idade média dos taquígrafos judiciais56NCRA Statistics, março de 2026
Audiências da Califórnia sem registro literal, abr. de 2023 a mar. de 202671,3% (3.007.651)Judicial Council of California 2026
Taquígrafos judiciais adicionais de que a Califórnia precisa458 FTEJudicial Council of California 2026
Tribunais estaduais que usam IA generativa17%Thomson Reuters Institute 2025
Tribunais que proíbem funcionários de usar ferramentas de IA70%Thomson Reuters Institute 2025
Redução do tempo de transcrição no piloto de IA filipino50% em média, até 80%Suprema Corte das Filipinas 2025
Reuniões do Reino Unido resumidas com o Justice Transcribe, out. de 2025 a set. de 2026Mais de 1.600.000Ministério da Justiça do Reino Unido 2026
Alucinações do Whisper com danos explícitos38%Koenecke et al., ACM FAccT 2024

Metodologia e Fontes

Última atualização: 3 de outubro de 2026. Atualizamos este levantamento trimestralmente, e a próxima revisão é esperada quando o Judicial Council of California publicar sua atualização do 2º trimestre de 2026 sobre a escassez de taquígrafos judiciais e o HMCTS divulgar os resultados de seu estudo do Justice Transcribe com transcrições da Crown Court.

Experimente o VoxBooster — 3 dias grátis.

Clone de voz em tempo real, soundboard e efeitos — onde você já fala.

  • Sem cartão
  • ~30ms de latência
  • Discord · Teams · OBS
Experimentar 3 dias grátis