Statistiques de précision de la reconnaissance vocale au tribunal (2026) : 55+ points de données sur les taux d'erreur ASR, la précision des sténographes judiciaires et les projets pilotes de transcription par IA

Précision de la reconnaissance vocale au tribunal en 2026 : les ASR commerciaux affichent un taux d'erreur de 35% pour les locuteurs noirs contre 19% pour les blancs.

Cinq systèmes commerciaux de reconnaissance vocale de premier plan ont affiché un taux d’erreur de mots moyen de 0,35 pour les locuteurs noirs contre 0,19 pour les locuteurs blancs, et 23% de l’audio des locuteurs noirs a produit des transcriptions trop truffées d’erreurs pour être exploitables, contre seulement 1,6% pour les locuteurs blancs (Koenecke et al., PNAS 2020). La transcription humaine n’est pas non plus une référence irréprochable : des sténographes judiciaires certifiés de Philadelphie ont transcrit l’anglais afro-américain avec une précision de 82,9% au niveau des mots, soit plus de 12 points sous le seuil de 95% auquel ils sont certifiés (Jones et al., Language 2019). Dans le même temps, les personnes qui produisent le procès-verbal disparaissent : il reste environ 23 000 sténographes après une baisse de 21% en dix ans (AAERT, 2025 Court Reporting Industry Trends), et 71,3% des audiences familiales, successorales et civiles de Californie sur trois ans n’ont fait l’objet d’aucun procès-verbal intégral (Judicial Council of California, 2026). Nous avons agrégé des données issues de PNAS, de la revue Language de la Linguistic Society of America, de la National Court Reporters Association, du Judicial Council of California, du Thomson Reuters Institute et du National Center for State Courts, de la Cour suprême des Philippines, du ministère britannique de la Justice et d’audits d’IA évalués par des pairs pour montrer où en est réellement la précision de la transcription judiciaire en 2026. Pour un tableau plus large des effectifs, consultez nos statistiques sur la sténographie judiciaire.

TL;DR

  • Les ASR commerciaux ont affiché un taux d’erreur de mots (WER) moyen de 0,35 pour les locuteurs noirs contre 0,19 pour les locuteurs blancs (Koenecke et al., PNAS 2020).
  • 23% des extraits de locuteurs noirs contre 1,6% de ceux de locuteurs blancs ont franchi le seuil de WER de 0,5 que les auteurs jugent inexploitable (PNAS 2020).
  • Les hommes noirs ont subi un WER moyen de 0,41, soit le double des 0,21 observés chez les hommes blancs (PNAS 2020).
  • Les sténographes judiciaires de Philadelphie ont atteint une précision de 82,9% au niveau des mots et de 59,5% au niveau des phrases sur l’anglais afro-américain (Jones et al., Language 2019).
  • 31% des transcriptions de sténographes judiciaires ont modifié qui, quoi, quand, où ou la portée d’un énoncé (Language 2019).
  • Il reste environ 23 000 sténographes après une baisse de 21% sur dix ans ; les inscriptions ont chuté de 74% (AAERT 2025).
  • Le nombre de nouveaux membres certifiés de la NCRA est passé de 243 (2023) à 205 (2025) ; l’âge moyen des sténographes judiciaires est de 56 ans (statistiques NCRA, mars 2026).
  • 72,4% des audiences familiales, successorales et civiles de Californie au premier trimestre 2026 n’avaient aucun procès-verbal intégral (Judicial Council of California 2026).
  • Seuls 17% des tribunaux d’État utilisent l’IA générative et 70% interdisent à leur personnel les outils d’IA (Thomson Reuters Institute 2025 State Courts Survey).
  • Les tribunaux philippins ont réduit le temps de transcription de 50% en moyenne, jusqu’à 80%, lors d’un projet pilote d’IA (Cour suprême des Philippines, 2025).
  • Environ 1% des transcriptions de Whisper contenaient des expressions hallucinées, et 38% d’entre elles étaient nuisibles (Koenecke et al., ACM FAccT 2024).
  • Un groupe de travail fédéral de 15 membres sur la transcription vocale au tribunal a été proposé dans le S. 4154 le 19 mars 2026 (Sénat américain).

1. Taux d’erreur de mots des ASR selon l’origine, le dialecte et le genre

Le principal problème de précision de la reconnaissance vocale au tribunal n’est pas la performance moyenne, mais la variance d’un locuteur à l’autre. Chacun des cinq systèmes testés a commis près de deux fois plus d’erreurs pour les locuteurs noirs que pour les locuteurs blancs, y compris sur des expressions identiques de cinq à huit mots, ce qui renvoie au modèle acoustique plutôt qu’au vocabulaire. Dans une salle d’audience, où le procès-verbal doit être aussi fiable pour chaque témoin, un outil précis en moyenne mais inégal selon les locuteurs échoue au test élémentaire d’équité.

Données les plus récentes disponibles : Koenecke et al., Racial disparities in automated speech recognition, PNAS 2020. Aucune étude d’une ampleur et d’une conception comparables n’a été publiée depuis, ce qui constitue en soi un constat : la base de preuves qui sous-tend les achats d’ASR pour les tribunaux a six ans.

MétriqueValeurSource
WER moyen sur 5 systèmes ASR, locuteurs noirs0,35Koenecke et al., PNAS 2020
WER moyen sur 5 systèmes ASR, locuteurs blancs0,19Koenecke et al., PNAS 2020
WER d’Apple (moins bonne performance), locuteurs noirs contre blancs0,45 contre 0,23Koenecke et al., PNAS 2020
WER de Microsoft (meilleure performance), locuteurs noirs contre blancs0,27 contre 0,15Koenecke et al., PNAS 2020
WER moyen, hommes noirs contre femmes noires0,41 contre 0,30Koenecke et al., PNAS 2020
WER moyen, hommes blancs contre femmes blanches0,21 contre 0,17Koenecke et al., PNAS 2020
Extraits avec un WER supérieur à 0,5 (inexploitables), locuteurs noirs contre blancs23% contre 1,6%Koenecke et al., PNAS 2020
WER sur des expressions identiques, Microsoft, locuteurs noirs contre blancs0,13 contre 0,07Koenecke et al., PNAS 2020

Contexte : l’étude a apparié 2 141 extraits audio de chaque groupe (19,8 heures issues de 73 locuteurs noirs et 42 locuteurs blancs). Le WER médian était de 0,38 à Princeville (Caroline du Nord) et de 0,31 à Washington, DC, contre 0,18 à Sacramento et 0,15 dans le comté de Humboldt, et les taux d’erreur augmentaient avec la densité des traits de l’anglais vernaculaire afro-américain. Le vocabulaire n’était pas en cause : le système de Google contenait dans son vocabulaire 98,7% des mots prononcés par les participants noirs, contre 98,6% pour les participants blancs. Comme le note le résumé de Stanford Engineering, les auteurs ont expressément signalé les services de justice pénale qui transcrivent les audiences comme un cadre où ces écarts pourraient causer des préjudices.

Des travaux plus récents confirment le mécanisme sans remplacer les chiffres phares. Un article d’Interspeech 2025 de Mojarad et Tang a mis en évidence un effet faible mais significatif de la réduction des groupes consonantiques et de la réduction de ING sur le WER pour l’anglais afro-américain, et le benchmark Fair-Speech publié en 2024 a rassemblé environ 26,5 mille énoncés de 593 participants américains spécifiquement pour mesurer l’équité démographique (Veliche et al., 2024). Les lecteurs qui comparent la précision entre outils trouveront des benchmarks généraux dans nos statistiques de la transcription vocale.

2. Précision des sténographes judiciaires humains sur la parole dialectale

La comparaison juste pour l’ASR judiciaire n’est pas une transcription parfaite mais la référence humaine, et cette référence est plus fragile que la certification ne le laisse croire. Des sténographes judiciaires certifiés se sont trompés, d’une manière ou d’une autre, sur 40,5% des phrases d’anglais afro-américain, dans des conditions meilleures qu’au tribunal : une pièce silencieuse, un audio de haute qualité, chaque énoncé diffusé deux fois et un temps de révision illimité. L’écart entre la certification et la performance réelle sur la parole dialectale est le chiffre le moins souvent cité de la transcription judiciaire.

L’étude, Testifying while black (Jones, Kalbfeld, Hancock et Clark, Language 2019), a testé 27 sténographes judiciaires en poste dans les tribunaux de Philadelphie, soit environ un tiers du vivier de sténographes officiels de la ville, sur 83 énoncés naturels, ce qui a donné 2 241 transcriptions.

MétriqueValeurSource
Norme de précision pour la certification des sténographes judiciaires95% ou 98%Jones et al., Language 2019
Précision moyenne de la transcription au niveau des phrases59,5%Jones et al., Language 2019
Meilleure contre pire précision au niveau des phrases77% contre 18%Jones et al., Language 2019
Précision moyenne au niveau des mots82,9% (12,1 points sous la norme)Jones et al., Language 2019
Meilleure contre pire précision au niveau des mots91,2% contre 58,4%Jones et al., Language 2019
Transcriptions qui ont modifié qui, quoi, quand, où ou la portée31% (701 sur 2 241)Jones et al., Language 2019
Transcriptions qui auraient fait entrer du charabia dans le procès-verbal11% (248)Jones et al., Language 2019
Précision moyenne de la paraphrase (compréhension)33%Jones et al., Language 2019

Note sur une valeur atypique : lors de la phase pilote, les avocats qui se déclaraient locuteurs d’anglais afro-américain ont atteint 90% de précision de transcription, contre 64,2% pour les avocats parlant l’anglais américain standard. Les sténographes noirs ont correctement paraphrasé 52,5% des énoncés, contre 33,7% pour les sténographes non noirs, et 70% de l’ensemble des sténographes participants n’avaient jamais entendu l’expression anglais afro-américain. La leçon pour les achats d’IA : un fournisseur qui ne se mesure qu’à des jeux de test en anglais standard mesure la mauvaise chose, et il en va de même pour la certification humaine. Nous traitons le problème parallèle dans l’emploi dans nos statistiques sur le biais d’accent.

3. Les effectifs de sténographes derrière le procès-verbal

Le débat sur la précision pèse d’autant plus que l’offre humaine se réduit. Les nouvelles certifications NCRA ont baissé pour la deuxième année consécutive, à 205 en 2025, tandis que l’âge moyen d’un sténographe judiciaire est désormais de 56 ans. Les tribunaux ne choisissent pas entre sténographes et logiciels dans l’abstrait ; ils décident de ce qui comble les postes déjà vacants.

MétriqueValeurSource
Sténographes certifiés restant aux États-UnisEnviron 23 000AAERT, 2025 Court Reporting Industry Trends
Baisse du nombre de sténographes certifiés sur la dernière décennie21%AAERT, 2025 Court Reporting Industry Trends
Chute des inscriptions dans les écoles de sténographie (3 083 en 2015 à 790 en 2024)74%AAERT, 2025 Court Reporting Industry Trends
Programmes ou écoles de sténographie fermés sur la décennieEnviron 42%AAERT, 2025 Court Reporting Industry Trends
Nouveaux membres certifiés de la NCRA, 2023 / 2024 / 2025243 / 211 / 205Statistiques NCRA, mars 2026
Âge moyen des membres sténographes judiciaires de la NCRA56Statistiques NCRA, mars 2026
Emplois de sténographes judiciaires et de sous-titreurs en simultané, 202519 900BLS Occupational Outlook Handbook
Évolution projetée de l’emploi, 2025-350% (environ 1 800 postes ouverts par an)BLS Occupational Outlook Handbook

L’enquête de l’AAERT auprès des utilisateurs finaux (plus de 550 répondants, menée au T4 2024) chiffre l’effet en aval : 76% signalent des difficultés à planifier les procédures, 55% des coûts plus élevés, 39% des retards, et 26% disent accepter des transcriptions de moindre qualité. Et 96% ont cité la précision comme l’indicateur de performance le plus important. Sources : rapport sectoriel de l’AAERT, statistiques NCRA et profil des sténographes judiciaires du BLS, qui s’attend explicitement à ce que les outils de transcription par IA limitent la croissance future de l’emploi, tout en jugeant les sténographes toujours nécessaires pour relire et corriger les procès-verbaux produits numériquement. Réserve : l’AAERT représente les sténographes et transcripteurs électroniques et a commandé l’étude, de sorte que son angle favorise l’enregistrement numérique, même si ses chiffres sur les effectifs s’appuient sur des données de la NCRA et du BLS.

4. Des procédures sans aucun procès-verbal intégral

La pire précision de transcription, c’est l’absence de transcription. La Californie, qui restreint l’enregistrement électronique dans la plupart des types d’affaires, publie les données publiques les plus détaillées des États-Unis sur ce qui se passe quand les sténographes manquent. Sur trois ans, 3 007 651 audiences en matière familiale, successorale et civile illimitée se sont tenues sans procès-verbal intégral, ce qui, selon la fiche d’information de l’État lui-même, sera fréquemment fatal pour un appel.

MétriqueValeurSource
Audiences sans procès-verbal intégral, T1 2026303 430 sur 418 985 (72,4%)Judicial Council of California, 2026
Audiences sans procès-verbal intégral, avr. 2023 à mars 20263 007 651 sur 4 214 365 (71,3%)Judicial Council of California, 2026
Sténographes employés par les tribunaux contre ETP supplémentaires nécessaires1 101 contre 458 de plusJudicial Council of California, 2026
ETP de sténographes recrutés contre partis, avr. 2023 à mars 2026381,8 contre 366,3 (gain net de 15,5)Judicial Council of California, 2026
Part des nouvelles recrues qui étaient des voice writers48,1% (183,5 ETP)Judicial Council of California, 2026
Baisse du nombre de titulaires de licence en Californie, exercice 2013-14 à exercice 2022-2320,9% (nouvelles candidatures en baisse de 42,9%)Judicial Council of California Fact Sheet, janv. 2025
Dépenses des tribunaux californiens pour les transcriptions, exercice 2023-2423,7 millions USDJudicial Council of California Fact Sheet, janv. 2025
Coût quotidien d’un sténographe privé, déposition contre procès2 580 USD contre 3 300 USDJudicial Council of California Fact Sheet, janv. 2025

Contexte : le vivier s’améliore à la marge, avec 176 nouvelles licences délivrées lors de l’exercice 2024-25 contre 68 en 2022-23, et un taux de réussite de 52,7% parmi 294 candidats récents à l’examen. Mais près de la moitié des nouvelles recrues sont des voice writers, ce qui est en soi un flux de travail de reconnaissance vocale : le sténographe répète le témoignage dans un microphone monté sur un masque et un logiciel le convertit. Les données en direct figurent sur le tableau de bord de la pénurie du Judicial Council, et les chiffres de coûts proviennent de sa fiche d’information de janvier 2025.

5. Adoption de la transcription par IA et projets pilotes judiciaires

Les tribunaux d’État américains sont prudents, et les chiffres montrent un large écart entre les attentes et les autorisations. 91% des professionnels des tribunaux d’État s’attendent à ce que l’IA ait au moins un impact modéré sur le fonctionnement des tribunaux, mais 70% disent que leur tribunal n’autorise pas du tout ses employés à utiliser des outils fondés sur l’IA. Les déploiements les plus avancés se situent hors des États-Unis, où les systèmes judiciaires nationaux peuvent se standardiser sur une seule plateforme.

MétriqueValeurSource
Tribunaux d’État utilisant actuellement l’IA générative17%Thomson Reuters Institute, 2025 State Courts Survey
Tribunaux qui n’autorisent pas leurs employés à utiliser des outils fondés sur l’IA70%Thomson Reuters Institute, 2025 State Courts Survey
Répondants jugeant l’IA comme la tendance la plus importante55%Thomson Reuters Institute, 2025 State Courts Survey
Systèmes judiciaires ayant proposé une formation à l’IA25%NCSC, Preparing for Future Workforce Needs 2025
Répondants s’attendant à ce que les pénuries de personnel se poursuivent61%NCSC, Preparing for Future Workforce Needs 2025
Périmètre du projet pilote philippin de transcription par IA (juil. 2023 à sept. 2024)Sandiganbayan + 41 tribunaux de première instanceCour suprême des Philippines, 2025
Réduction du temps de transcription dans le projet pilote philippin50% en moyenne, jusqu’à 80%Cour suprême des Philippines, 2025
Précision déclarée au fil du projet pilote philippinPassée de 70% à 90-95%Cour suprême des Philippines, 2025

L’enquête a couvert 443 juges et professionnels de tribunaux d’État, de comté et municipaux en mars et avril 2025 (Thomson Reuters Institute ; résumé du NCSC). Les résultats philippins, présentés par le président de la Cour suprême Alexander Gesmundo, proviennent de la plateforme Scriptix dotée d’un modèle de langue personnalisé pour le filipino et le taglish, et la Cour suprême a autorisé son déploiement national en novembre 2024 (Cour suprême des Philippines). Notons que la précision de départ de 70% serait inacceptable pour tout procès-verbal officiel ; les gains sont venus de l’usage continu et de la correction humaine, pas du simple fait d’activer l’outil.

Le Royaume-Uni offre à ce jour le plus gros volume de données, mais issu de la probation plutôt que des salles d’audience : le ministère de la Justice indique que plus de 1 600 000 entretiens ont été résumés avec son outil interne Justice Transcribe entre le 7 octobre 2025 et le 14 septembre 2026, soit une économie illustrative d’environ 266 667 heures à raison de 10 minutes par entretien (données GOV.UK sur Justice Transcribe). L’annonce du ministère prévoit 18 750 jours calendaires libérés chaque année, et le HM Courts and Tribunals Service teste désormais le même outil face à des transcripteurs humains sous contrat pour les transcriptions de la Crown Court. Pour savoir comment l’ensemble du secteur juridique adopte l’IA, consultez nos statistiques sur l’IA dans le droit.

6. Hallucinations, transcriptions de police et déficit de contrôle

Le taux d’erreur de mots sous-estime le risque juridique de la transcription par IA, car une transcription peut aussi contenir des mots que personne n’a prononcés. 38% des passages hallucinés de Whisper comportaient des préjudices explicites tels que la violence, de fausses associations ou une autorité sous-entendue, le genre de contenu susceptible de changer la façon dont un juge ou un jury lit un témoignage. L’audio des audiences est plein de longues pauses, et les longues plages sans voix sont précisément ce que les chercheurs ont associé aux hallucinations.

MétriqueValeurSource
Transcriptions Whisper contenant des expressions ou phrases entièrement hallucinéesEnviron 1% (1,4% en moyenne)Koenecke et al., ACM FAccT 2024
Hallucinations contenant au moins un préjudice explicite38%Koenecke et al., ACM FAccT 2024
Hallucinations perpétuant la violence19%Koenecke et al., ACM FAccT 2024
Hallucinations créant des associations inexactes / suggérant une fausse autorité13% / 8%Koenecke et al., ACM FAccT 2024
Essai de rapports de police par IA Draft One : agents et rapports85 agents, 755 rapportsAdams et al., Journal of Experimental Criminology 2025
Effet de Draft One sur le temps de rédaction des rapportsAucune réduction statistiquement significativeAdams et al., Journal of Experimental Criminology 2025
Durée et résultat de l’essai de rapports par IA du Anchorage Police Department3 mois, aucun gain de temps significatifAnchorage Police Department via l’EFF, 2025
Groupe de travail fédéral proposé sur la transcription vocale au tribunal15 membres, rapport sous 18 moisS. 4154, Research and Oversight of AI in Courts Act of 2026

Contexte : l’étude sur les hallucinations (ACM FAccT 2024) a constaté que les hallucinations survenaient de façon disproportionnée chez les locuteurs aphasiques, dont les pauses sans voix sont plus longues. L’audio des caméras-piétons alimente déjà le dossier pénal par le biais de rapports de police rédigés par IA ; l’essai randomisé préenregistré d’Axon Draft One (Springer) n’a trouvé aucun gain de temps, car les agents ont consacré le temps gagné à corriger les erreurs et à ajouter les faits omis, alors que l’éditeur avait annoncé une réduction de 50% (EFF). Le projet de loi fédéral en cours, présenté le 19 mars 2026, exigerait que le groupe de travail examine la précision de la transcription, les effets sur les locuteurs ayant un accent ou un dialecte, et les filigranes pour les documents modifiés par IA (texte du S. 4154, GovInfo). La question pour les tribunaux n’est plus de savoir si la reconnaissance vocale est assez bonne en moyenne ; c’est de savoir si quelqu’un la mesure pour les locuteurs qui ont le plus besoin d’un procès-verbal exact.

Résumé : la précision de la reconnaissance vocale au tribunal en chiffres

MétriqueValeurSource
WER moyen des ASR, locuteurs noirs contre blancs0,35 contre 0,19Koenecke et al., PNAS 2020
Extraits aux transcriptions inexploitables (WER supérieur à 0,5), noirs contre blancs23% contre 1,6%Koenecke et al., PNAS 2020
WER des ASR, hommes noirs contre hommes blancs0,41 contre 0,21Koenecke et al., PNAS 2020
WER de l’ASR d’Apple, locuteurs noirs contre blancs0,45 contre 0,23Koenecke et al., PNAS 2020
Précision des sténographes judiciaires au niveau des mots sur l’anglais afro-américain82,9%Jones et al., Language 2019
Précision des sténographes judiciaires au niveau des phrases sur l’anglais afro-américain59,5%Jones et al., Language 2019
Transcriptions de sténographes judiciaires qui ont modifié le sens31%Jones et al., Language 2019
Norme de certification des sténographes judiciaires95% à 98%Jones et al., Language 2019
Sténographes restant aux États-UnisEnviron 23 000AAERT 2025
Baisse des inscriptions en sténographie, 2015 à 202474%AAERT 2025
Nouveaux membres certifiés de la NCRA, 2025205Statistiques NCRA, mars 2026
Âge moyen des sténographes judiciaires56Statistiques NCRA, mars 2026
Audiences californiennes sans procès-verbal intégral, avr. 2023 à mars 202671,3% (3 007 651)Judicial Council of California 2026
Sténographes judiciaires supplémentaires nécessaires en Californie458 ETPJudicial Council of California 2026
Tribunaux d’État utilisant l’IA générative17%Thomson Reuters Institute 2025
Tribunaux interdisant à leur personnel les outils fondés sur l’IA70%Thomson Reuters Institute 2025
Réduction du temps de transcription dans le projet pilote philippin d’IA50% en moyenne, jusqu’à 80%Cour suprême des Philippines 2025
Entretiens britanniques résumés avec Justice Transcribe, oct. 2025 à sept. 20261 600 000+Ministère britannique de la Justice 2026
Hallucinations de Whisper contenant des préjudices explicites38%Koenecke et al., ACM FAccT 2024

Méthodologie et sources

Dernière mise à jour : 3 octobre 2026. Nous actualisons ce tour d’horizon chaque trimestre, et la prochaine révision est attendue lorsque le Judicial Council of California publiera sa mise à jour du T2 2026 sur la pénurie de sténographes judiciaires et que le HMCTS rendra compte des résultats de son étude Justice Transcribe sur les transcriptions de la Crown Court.

Essayez VoxBooster — essai gratuit de 3 jours.

Clonage vocal en temps réel, soundboard et effets — partout où vous parlez déjà.

  • Sans carte bancaire
  • ~30 ms de latence
  • Discord · Teams · OBS
Essayer gratuitement 3 jours