Estadísticas de Precisión del Reconocimiento de Voz en Tribunales (2026): Más de 55 Datos sobre Tasas de Error del ASR, Precisión de los Taquígrafos Judiciales y Pilotos de Transcripción con IA

Precisión del reconocimiento de voz en tribunales 2026: el ASR comercial erró el 35% de las palabras de hablantes negros frente al 19% de blancos, con más de 50 datos.

Cinco de los principales sistemas comerciales de reconocimiento de voz tuvieron una tasa media de error de palabras de 0,35 para hablantes negros frente a 0,19 para hablantes blancos, y el 23% del audio de hablantes negros produjo transcripciones tan llenas de errores que resultaban inutilizables, frente a solo el 1,6% en el caso de hablantes blancos (Koenecke et al., PNAS 2020). La transcripción humana tampoco es una referencia limpia: taquígrafos judiciales certificados de Filadelfia transcribieron el inglés afroamericano con un 82,9% de precisión por palabra, más de 12 puntos por debajo del estándar del 95% con el que se certifican (Jones et al., Language 2019). Mientras tanto, quienes producen el registro están desapareciendo, con unos 23.000 estenógrafos restantes tras una caída del 21% en una década (AAERT, Court Reporting Industry Trends 2025), y el 71,3% de las audiencias de familia, sucesiones y civiles de California a lo largo de tres años no tuvo ningún registro textual (Judicial Council of California, 2026). Reunimos datos de PNAS, de la revista Language de la Linguistic Society of America, de la National Court Reporters Association, del Judicial Council of California, del Thomson Reuters Institute y el National Center for State Courts, de la Corte Suprema de Filipinas, del Ministerio de Justicia del Reino Unido y de auditorías de IA revisadas por pares para mostrar dónde se encuentra realmente la precisión de la transcripción en tribunales en 2026. Para una visión más amplia de la fuerza laboral, consulte nuestras estadísticas de taquigrafía judicial.

TL;DR

  • El ASR comercial tuvo un WER medio de 0,35 para hablantes negros frente a 0,19 para hablantes blancos (Koenecke et al., PNAS 2020).
  • El 23% de los fragmentos de hablantes negros frente al 1,6% de los de hablantes blancos superó el umbral de WER de 0,5 que los autores consideran inutilizable (PNAS 2020).
  • Los hombres negros tuvieron un WER medio de 0,41, el doble del 0,21 de los hombres blancos (PNAS 2020).
  • Los taquígrafos judiciales de Filadelfia alcanzaron un 82,9% de precisión por palabra y un 59,5% por oración en inglés afroamericano (Jones et al., Language 2019).
  • El 31% de las transcripciones de los taquígrafos judiciales cambió el quién, el qué, el cuándo, el dónde o la fuerza de un enunciado (Language 2019).
  • Quedan unos 23.000 estenógrafos tras una caída del 21% en diez años; las matrículas cayeron un 74% (AAERT 2025).
  • Los nuevos miembros certificados de NCRA bajaron de 243 (2023) a 205 (2025); la edad media de los taquígrafos judiciales es de 56 años (NCRA Statistics, marzo de 2026).
  • El 72,4% de las audiencias de familia, sucesiones y civiles de California en el primer trimestre de 2026 no tuvo registro textual (Judicial Council of California 2026).
  • Solo el 17% de los tribunales estatales usa IA generativa y el 70% impide a su personal usar herramientas de IA (Thomson Reuters Institute, State Courts Survey 2025).
  • Los tribunales filipinos redujeron el tiempo de transcripción un 50% de media, hasta un 80%, en un piloto de IA (Corte Suprema de Filipinas, 2025).
  • Aproximadamente el 1% de las transcripciones de Whisper contenía frases alucinadas, y el 38% de ellas eran dañinas (Koenecke et al., ACM FAccT 2024).
  • Un grupo de trabajo federal de 15 miembros sobre conversión de voz a texto en tribunales fue propuesto en el S. 4154 el 19 de marzo de 2026 (Senado de EE. UU.).

1. Tasas de Error de Palabras del ASR por Raza, Dialecto y Género

El problema central de la precisión del reconocimiento de voz en tribunales no es el rendimiento medio, sino la variación entre hablantes. Cada uno de los cinco sistemas evaluados cometió casi el doble de errores con hablantes negros que con hablantes blancos, incluso en frases idénticas de cinco a ocho palabras, lo que apunta al modelo acústico y no al vocabulario. En un tribunal, donde el registro debe ser igual de fiable para cada testigo, una herramienta precisa en promedio pero desigual según el hablante no supera la prueba básica de equidad.

Datos más recientes disponibles: Koenecke et al., Racial disparities in automated speech recognition, PNAS 2020. Desde entonces no se ha publicado ningún estudio de escala y diseño comparables, lo que ya es un hallazgo en sí mismo: la base de evidencia que respalda la contratación de ASR para tribunales tiene seis años.

MétricaValorFuente
WER medio en 5 sistemas de ASR, hablantes negros0,35Koenecke et al., PNAS 2020
WER medio en 5 sistemas de ASR, hablantes blancos0,19Koenecke et al., PNAS 2020
WER de Apple (peor resultado), hablantes negros vs blancos0,45 vs 0,23Koenecke et al., PNAS 2020
WER de Microsoft (mejor resultado), hablantes negros vs blancos0,27 vs 0,15Koenecke et al., PNAS 2020
WER medio, hombres negros vs mujeres negras0,41 vs 0,30Koenecke et al., PNAS 2020
WER medio, hombres blancos vs mujeres blancas0,21 vs 0,17Koenecke et al., PNAS 2020
Fragmentos con WER superior a 0,5 (inutilizables), hablantes negros vs blancos23% vs 1,6%Koenecke et al., PNAS 2020
WER en frases idénticas, Microsoft, hablantes negros vs blancos0,13 vs 0,07Koenecke et al., PNAS 2020

Contexto: el estudio emparejó 2.141 fragmentos de audio de cada grupo (19,8 horas de 73 hablantes negros y 42 blancos). El WER mediano fue de 0,38 en Princeville, Carolina del Norte, y de 0,31 en Washington, D. C., frente a 0,18 en Sacramento y 0,15 en el condado de Humboldt, y las tasas de error aumentaron con la densidad de rasgos del inglés vernáculo afroamericano. El vocabulario no era la causa: el sistema de Google tenía en su vocabulario el 98,7% de las palabras pronunciadas por participantes negros, frente al 98,6% de las de participantes blancos. Como señala el resumen de Stanford Engineering, los autores advirtieron específicamente que los organismos de justicia penal que transcriben procedimientos judiciales son un entorno donde estas brechas podrían causar daño.

Trabajos más recientes confirman el mecanismo sin sustituir las cifras principales. Un artículo de Mojarad y Tang en Interspeech 2025 halló un efecto pequeño pero significativo de la reducción de grupos consonánticos y de la reducción de ING sobre el WER en inglés afroamericano, y el benchmark Fair-Speech, publicado en 2024, reunió unas 26,5 mil expresiones de 593 participantes de EE. UU. específicamente para medir la equidad demográfica (Veliche et al., 2024). Quien quiera comparar la precisión entre herramientas encontrará benchmarks generales en nuestras estadísticas de voz a texto.

2. Precisión de los Taquígrafos Judiciales Humanos con el Habla Dialectal

La comparación justa para el ASR en tribunales no es una transcripción perfecta, sino la línea base humana, que es más débil de lo que implica la certificación. Los taquígrafos judiciales certificados se equivocaron de alguna manera en el 40,5% de las oraciones en inglés afroamericano, en condiciones mejores que las de un tribunal: una sala silenciosa, audio de alta calidad, cada enunciado reproducido dos veces y tiempo ilimitado para revisar. La brecha entre la certificación y el rendimiento real con dialectos es la cifra menos difundida de la transcripción judicial.

El estudio, Testifying while black (Jones, Kalbfeld, Hancock y Clark, Language 2019), evaluó a 27 taquígrafos judiciales de los tribunales de Filadelfia, aproximadamente un tercio de la plantilla oficial de taquígrafos de la ciudad, con 83 enunciados naturalistas, lo que dio 2.241 transcripciones.

MétricaValorFuente
Estándar de precisión de certificación de los taquígrafos judiciales95% o 98%Jones et al., Language 2019
Precisión media de transcripción por oración59,5%Jones et al., Language 2019
Mejor vs peor precisión por oración77% vs 18%Jones et al., Language 2019
Precisión media por palabra82,9% (12,1 puntos por debajo del estándar)Jones et al., Language 2019
Mejor vs peor precisión por palabra91,2% vs 58,4%Jones et al., Language 2019
Transcripciones que cambiaron el quién, el qué, el cuándo, el dónde o la fuerza31% (701 de 2.241)Jones et al., Language 2019
Transcripciones que habrían introducido texto sin sentido en el registro11% (248)Jones et al., Language 2019
Precisión media de paráfrasis (comprensión)33%Jones et al., Language 2019

Nota sobre los extremos: en la fase piloto, los abogados que se identificaron como hablantes de inglés afroamericano alcanzaron un 90% de precisión de transcripción, frente al 64,2% de los abogados que hablaban inglés estadounidense estándar. Los taquígrafos judiciales negros parafrasearon correctamente el 52,5% de los enunciados frente al 33,7% de los no negros, y el 70% de todos los taquígrafos participantes nunca había oído el término inglés afroamericano. La lección para la contratación de IA: un proveedor que solo hace benchmarks con conjuntos de prueba en inglés estándar está midiendo lo que no corresponde, y lo mismo vale para la certificación humana. Tratamos el problema paralelo en el ámbito laboral en nuestras estadísticas de sesgo por acento.

3. La Fuerza Laboral de Taquígrafos Detrás del Registro

El debate sobre la precisión importa más porque la oferta humana se está reduciendo. Las nuevas certificaciones de NCRA cayeron por segundo año consecutivo, hasta 205 en 2025, mientras que la edad media de los taquígrafos judiciales es ahora de 56 años. Los tribunales no eligen entre estenógrafos y software en abstracto; deciden qué ocupa los puestos que ya están vacíos.

MétricaValorFuente
Estenógrafos certificados que quedan en EE. UU.Unos 23.000AAERT, Court Reporting Industry Trends 2025
Caída de estenógrafos certificados en la última década21%AAERT, Court Reporting Industry Trends 2025
Caída de la matrícula en escuelas de estenografía (de 3.083 en 2015 a 790 en 2024)74%AAERT, Court Reporting Industry Trends 2025
Programas o escuelas de estenografía cerrados en la décadaAlrededor del 42%AAERT, Court Reporting Industry Trends 2025
Nuevos miembros certificados de NCRA, 2023 / 2024 / 2025243 / 211 / 205NCRA Statistics, marzo de 2026
Edad media de los miembros de NCRA que son taquígrafos judiciales56NCRA Statistics, marzo de 2026
Puestos de taquígrafo judicial y subtitulador simultáneo, 202519.900BLS Occupational Outlook Handbook
Variación proyectada del empleo, 2025-350% (unas 1.800 vacantes al año)BLS Occupational Outlook Handbook

La encuesta de AAERT a usuarios finales (más de 550 encuestados, realizada en el cuarto trimestre de 2024) cuantifica el efecto posterior: el 76% informa dificultades para programar audiencias, el 55% informa costos más altos, el 39% informa retrasos y el 26% dice que está aceptando transcripciones de menor calidad. Y el 96% señaló la precisión como el indicador de desempeño más importante. Fuentes: el informe del sector de AAERT, NCRA Statistics y el perfil de taquígrafos judiciales del BLS, que prevé expresamente que las herramientas de transcripción con IA limitarán el crecimiento futuro del empleo, aunque los taquígrafos seguirán siendo necesarios para revisar y editar los registros producidos digitalmente. Salvedad: AAERT representa a taquígrafos y transcriptores electrónicos y encargó el estudio, por lo que su enfoque favorece el registro digital, aunque sus cifras de fuerza laboral se basan en datos de NCRA y del BLS.

4. Procedimientos Sin Ningún Registro Textual

La peor precisión de transcripción es la ausencia de transcripción. California, que restringe la grabación electrónica en la mayoría de los tipos de casos, publica los datos públicos más detallados de EE. UU. sobre lo que ocurre cuando no hay taquígrafos disponibles. A lo largo de tres años, 3.007.651 audiencias de familia, sucesiones y civiles ilimitados se celebraron sin registro textual, lo que, según la propia hoja informativa del estado, con frecuencia será fatal para una apelación.

MétricaValorFuente
Audiencias sin registro textual, 1.er trim. de 2026303.430 de 418.985 (72,4%)Judicial Council of California, 2026
Audiencias sin registro textual, abr. de 2023 a mar. de 20263.007.651 de 4.214.365 (71,3%)Judicial Council of California, 2026
Taquígrafos empleados por los tribunales vs FTE adicionales necesarios1.101 vs 458 másJudicial Council of California, 2026
Taquígrafos FTE contratados vs salidos, abr. de 2023 a mar. de 2026381,8 vs 366,3 (ganancia neta de 15,5)Judicial Council of California, 2026
Proporción de nuevas contrataciones que eran voice writers48,1% (183,5 FTE)Judicial Council of California, 2026
Caída de profesionales con licencia en California, ejercicio 2013-14 a 2022-2320,9% (nuevas solicitudes a la baja un 42,9%)Judicial Council of California Fact Sheet, enero de 2025
Gasto de los tribunales de California en transcripciones, ejercicio 2023-24US$ 23,7 millonesJudicial Council of California Fact Sheet, enero de 2025
Costo diario de un taquígrafo privado, declaración vs juicioUS$ 2.580 vs US$ 3.300Judicial Council of California Fact Sheet, enero de 2025

Contexto: la cantera mejora en los márgenes, con 176 licencias nuevas emitidas en el ejercicio 2024-25 frente a 68 en 2022-23, y una tasa de aprobación del 52,7% entre 294 examinados recientes. Pero casi la mitad de las nuevas contrataciones son voice writers, que en sí mismo es un flujo de trabajo de reconocimiento de voz: el taquígrafo repite el testimonio en un micrófono montado en una mascarilla y el software lo convierte. Los datos actualizados están en el panel de escasez del Judicial Council, y las cifras de costos provienen de su hoja informativa de enero de 2025.

5. Adopción de la Transcripción con IA y Pilotos en Tribunales

Los tribunales estatales de EE. UU. son cautelosos, y los números muestran una amplia brecha entre las expectativas y los permisos. El 91% de los profesionales de tribunales estatales espera que la IA tenga al menos un impacto moderado en las operaciones judiciales, pero el 70% dice que su tribunal no permite en absoluto que los empleados usen herramientas basadas en IA. Los despliegues más avanzados están fuera de EE. UU., donde los poderes judiciales nacionales pueden estandarizarse en una sola plataforma.

MétricaValorFuente
Tribunales estatales que usan actualmente IA generativa17%Thomson Reuters Institute, State Courts Survey 2025
Tribunales que no permiten a los empleados usar herramientas basadas en IA70%Thomson Reuters Institute, State Courts Survey 2025
Encuestados que consideran la IA la tendencia más significativa55%Thomson Reuters Institute, State Courts Survey 2025
Sistemas judiciales que han ofrecido capacitación en IA25%NCSC, Preparing for Future Workforce Needs 2025
Encuestados que esperan que continúe la escasez de personal61%NCSC, Preparing for Future Workforce Needs 2025
Alcance del piloto filipino de transcripción con IA (jul. de 2023 a sep. de 2024)Sandiganbayan + 41 tribunales de primera instanciaCorte Suprema de Filipinas, 2025
Reducción del tiempo de transcripción en el piloto filipino50% de media, hasta 80%Corte Suprema de Filipinas, 2025
Precisión informada a lo largo del piloto filipinoMejoró del 70% al 90-95%Corte Suprema de Filipinas, 2025

La encuesta abarcó a 443 jueces y profesionales de tribunales estatales, de condado y municipales en marzo y abril de 2025 (Thomson Reuters Institute; resumen del NCSC). Los resultados filipinos, presentados por el presidente de la Corte Suprema Alexander Gesmundo, provinieron de la plataforma Scriptix con un modelo de lenguaje personalizado para filipino y taglish, y la Corte Suprema autorizó el despliegue nacional en noviembre de 2024 (Corte Suprema de Filipinas). Cabe señalar que la precisión inicial del 70% sería inaceptable para cualquier registro oficial; las mejoras vinieron del uso continuado y de la edición humana, no de simplemente encender la herramienta.

El Reino Unido ofrece el dato de mayor volumen hasta ahora, aunque procedente de la libertad condicional y no de los tribunales: el Ministerio de Justicia informa que se resumieron más de 1.600.000 reuniones con su herramienta interna Justice Transcribe entre el 7 de octubre de 2025 y el 14 de septiembre de 2026, un ahorro ilustrativo de unas 266.667 horas a 10 minutos por reunión (datos de Justice Transcribe en GOV.UK). El propio anuncio del departamento proyecta 18.750 días naturales liberados cada año, y HM Courts and Tribunals Service está probando ahora la misma herramienta frente a transcriptores humanos contratados para las transcripciones de la Crown Court. Para saber cómo adopta la IA el sector jurídico en general, consulte nuestras estadísticas de IA en el sector legal.

6. Alucinaciones, Transcripciones Policiales y la Brecha de Supervisión

La tasa de error de palabras subestima el riesgo legal de la transcripción con IA, porque una transcripción también puede contener palabras que nadie dijo. El 38% de los pasajes alucinados de Whisper incluía daños explícitos, como violencia, asociaciones falsas o insinuación de autoridad, el tipo de contenido que podría cambiar la forma en que un juez o un jurado interpreta un testimonio. El audio de los tribunales está lleno de pausas largas, y los tramos largos sin voz son exactamente lo que los investigadores vincularon con las alucinaciones.

MétricaValorFuente
Transcripciones de Whisper con frases u oraciones totalmente alucinadasAlrededor del 1% (1,4% de media)Koenecke et al., ACM FAccT 2024
Alucinaciones con al menos un daño explícito38%Koenecke et al., ACM FAccT 2024
Alucinaciones que perpetúan la violencia19%Koenecke et al., ACM FAccT 2024
Alucinaciones con asociaciones inexactas / que insinúan autoridad falsa13% / 8%Koenecke et al., ACM FAccT 2024
Prueba de informes policiales con IA de Draft One: agentes e informes85 agentes, 755 informesAdams et al., Journal of Experimental Criminology 2025
Efecto de Draft One en el tiempo de redacción de informesSin reducción estadísticamente significativaAdams et al., Journal of Experimental Criminology 2025
Duración y resultado de la prueba de informes con IA del Departamento de Policía de Anchorage3 meses, sin ahorro de tiempo significativoDepartamento de Policía de Anchorage vía EFF, 2025
Grupo de trabajo federal propuesto sobre conversión de voz a texto en tribunales15 miembros, informe en 18 mesesS. 4154, Research and Oversight of AI in Courts Act of 2026

Contexto: el estudio sobre alucinaciones (ACM FAccT 2024) halló que las alucinaciones ocurrían de forma desproporcionada en hablantes con afasia, que tienen pausas sin voz más largas. El audio de las cámaras corporales ya alimenta el registro penal mediante informes policiales redactados con IA; el ensayo aleatorizado preinscrito de Axon Draft One (Springer) no encontró ahorro de tiempo, porque los agentes gastaron la ganancia en corregir errores y añadir hechos omitidos, y el proveedor había anunciado una reducción del 50% (EFF). El proyecto de ley federal pendiente, presentado el 19 de marzo de 2026, exigiría que el grupo de trabajo examinara la precisión de la transcripción, los efectos sobre hablantes con acento o dialecto y las marcas de agua para registros modificados con IA (texto del S. 4154, GovInfo). La pregunta para los tribunales ya no es si el reconocimiento de voz es lo bastante bueno en promedio; es si alguien lo está midiendo para los hablantes que más necesitan un registro preciso.

Resumen: Precisión del Reconocimiento de Voz en Tribunales en Cifras

MétricaValorFuente
WER medio del ASR, hablantes negros vs blancos0,35 vs 0,19Koenecke et al., PNAS 2020
Fragmentos con transcripciones inutilizables (WER superior a 0,5), negros vs blancos23% vs 1,6%Koenecke et al., PNAS 2020
WER del ASR, hombres negros vs hombres blancos0,41 vs 0,21Koenecke et al., PNAS 2020
WER del ASR de Apple, hablantes negros vs blancos0,45 vs 0,23Koenecke et al., PNAS 2020
Precisión por palabra de los taquígrafos judiciales en inglés afroamericano82,9%Jones et al., Language 2019
Precisión por oración de los taquígrafos judiciales en inglés afroamericano59,5%Jones et al., Language 2019
Transcripciones de taquígrafos judiciales que cambiaron el significado31%Jones et al., Language 2019
Estándar de certificación de los taquígrafos judiciales95% a 98%Jones et al., Language 2019
Estenógrafos que quedan en EE. UU.Unos 23.000AAERT 2025
Caída de la matrícula en estenografía, 2015 a 202474%AAERT 2025
Nuevos miembros certificados de NCRA, 2025205NCRA Statistics, marzo de 2026
Edad media de los taquígrafos judiciales56NCRA Statistics, marzo de 2026
Audiencias de California sin registro textual, abr. de 2023 a mar. de 202671,3% (3.007.651)Judicial Council of California 2026
Taquígrafos judiciales adicionales que necesita California458 FTEJudicial Council of California 2026
Tribunales estatales que usan IA generativa17%Thomson Reuters Institute 2025
Tribunales que impiden al personal usar herramientas de IA70%Thomson Reuters Institute 2025
Reducción del tiempo de transcripción en el piloto de IA filipino50% de media, hasta 80%Corte Suprema de Filipinas 2025
Reuniones del Reino Unido resumidas con Justice Transcribe, oct. de 2025 a sep. de 2026Más de 1.600.000Ministerio de Justicia del Reino Unido 2026
Alucinaciones de Whisper con daños explícitos38%Koenecke et al., ACM FAccT 2024

Metodología y Fuentes

Última actualización: 3 de octubre de 2026. Actualizamos este informe trimestralmente, y la próxima revisión se espera cuando el Judicial Council of California publique su actualización del segundo trimestre de 2026 sobre la escasez de taquígrafos judiciales y HMCTS informe los resultados de su estudio de Justice Transcribe con transcripciones de la Crown Court.

Prueba VoxBooster — 3 días gratis.

Clonación de voz en tiempo real, soundboard y efectos — donde ya hablas.

  • Sin tarjeta
  • ~30ms de latencia
  • Discord · Teams · OBS
Probar 3 días gratis