Statistiques sur la Latence du Sous-Titrage en Direct (2026) : 60+ Points de Données sur le Retard, la Précision et la Vitesse de l'ASR

Latence du sous-titrage en direct 2026 : les sous-titres britanniques accusaient 5,1 à 5,8 s de retard, l'Ofcom vise 4,5 s, et 8,2 s sur les JT américains en espagnol.

Les sous-titres en direct de la télévision britannique accusaient en moyenne 5,1 à 5,8 secondes de retard sur la parole lors des campagnes de mesure de l’Ofcom, et seuls 4 échantillons sur 72 de la deuxième campagne respectaient l’ancienne consigne de 3 secondes (Ofcom, rapports sur la qualité du sous-titrage en direct 2014-2015). Le problème n’a pas disparu : une étude de 2024 sur les journaux télévisés américains en espagnol a mesuré un retard moyen de 8,2 secondes, certains sous-titres arrivant jusqu’à 41 secondes plus tard (Fresno, JoSTrans 2024), et une étude de septembre 2026 a mesuré une moyenne de 8,46 secondes sur des extraits de télévision américaine en direct. Pendant ce temps, les moteurs de reconnaissance vocale en streaming annoncent désormais une latence médiane par mot proche de 300 millisecondes (AssemblyAI, juin 2025) : le goulot d’étranglement du sous-titrage en direct se déplace donc du sténotypiste humain vers la chaîne de diffusion. Nous avons agrégé des données de l’Ofcom, de la FCC, du CRTC, d’études évaluées par des pairs de l’Université Gallaudet et de l’Universidade de Vigo, d’articles de benchmark sur arXiv, des dépôts d’Ai-Media auprès de l’ASX, de l’OMS et d’autres sources primaires listées dans la méthodologie. Pour une vue d’ensemble, consultez notre tour d’horizon des statistiques du sous-titrage en direct.

TL;DR

  • La latence moyenne des sous-titres en direct au Royaume-Uni est passée de 5,7 à 5,1 secondes entre avril-mai et octobre-novembre 2014, soit encore bien au-dessus de la consigne de 3 secondes (Ofcom, troisième rapport sur le sous-titrage en direct, 2015).
  • Seuls 4 échantillons britanniques sur 72 respectaient la consigne de 3 secondes lors de la deuxième campagne, et le plus long retard a atteint 21 secondes (Ofcom, deuxième rapport, 2014).
  • L’Ofcom demande désormais une latence moyenne d’au plus 4,5 secondes sur l’ensemble des programmes en direct (Ofcom Guidelines on Providing TV and On-Demand Access Services).
  • Les journaux télévisés américains en espagnol affichaient 8,2 secondes de retard moyen des sous-titres, et 20% des sous-titres arrivaient avec plus de 10 secondes de retard (Fresno, JoSTrans 42, 2024).
  • Les sous-titres télévisés avec leur retard de diffusion d’origine (moyenne de 8,46 s) ont été notés 3,66/7 contre 5,09/7 une fois synchronisés (Thompson et al., arXiv 2609.11408, 2026).
  • Les sous-titres en direct britanniques ont atteint en moyenne 98,38% de précision NER sur quatre campagnes de l’Ofcom, au-dessus du seuil de 98% (données de l’Ofcom d’après Moores, JoSTrans 33).
  • Les journaux télévisés nationaux américains en anglais ont atteint en moyenne 98,8% de précision NER (Fresno, Universal Access in the Information Society, 2024).
  • Un système de sous-titrage automatique a obtenu 98,56% de NER en anglais et 98,26% en espagnol (Romero-Fresco et Van Gauwbergen, 2025).
  • AssemblyAI a annoncé une latence médiane en streaming de 307 ms contre 516 ms pour Deepgram Nova-3 (AssemblyAI, juin 2025).
  • Whisper-Streaming a atteint une latence moyenne de 3,3 secondes sur de la parole anglaise de longue durée (Machacek, Dabre et Bojar, IJCNLP-AACL 2023).
  • Les humains répondent à une question en 208 ms en moyenne dans 10 langues (Stivers et al., PNAS 2009), la référence que les systèmes en temps réel cherchent à atteindre.
  • Les sous-titres automatiques LEXI d’Ai-Media ont atteint 79,2 millions de minutes à l’exercice 2025, contre moins de 10 millions quatre ans plus tôt (résultats FY25 d’Ai-Media, ASX).

1. Retard mesuré : de combien les sous-titres en direct suivent la parole

Le jeu de données public le plus complet sur le retard des sous-titres en direct reste celui du Royaume-Uni, et il raconte une histoire cohérente : un sous-titre en direct typique apparaît plus de 5 secondes après que les mots ont été prononcés. L’Ofcom a échantillonné des journaux, des émissions de divertissement et des talk-shows de la BBC, d’ITV, de Channel 4, de Channel 5 et de Sky sur quatre campagnes entre 2013 et 2015. Le premier rapport a relevé une latence médiane de 5,6 secondes (synthèse de l’EPRA du premier rapport de l’Ofcom, avril 2014), et le deuxième 5,8 secondes, avec seulement 4 échantillons sur 72 dans la limite de la consigne de 3 secondes (article de Limping Chicken sur le deuxième rapport de l’Ofcom, novembre 2014).

L’amélioration qui a suivi était réelle mais modeste. Le troisième rapport de l’Ofcom a enregistré une baisse de la latence moyenne de 0,6 seconde, de 5,7 à 5,1 secondes, entre avril-mai et octobre-novembre 2014 (communiqué de presse de l’Ofcom via Wired-Gov, mai 2015). Gagner une demi-seconde sur un retard de cinq secondes a exigé des diffuseurs qu’ils changent leurs flux de travail, pas seulement leurs logiciels, ce qui explique que le chiffre ait plafonné. Ce sont les mesures de latence de l’Ofcom les plus récentes disponibles (2014-2015) ; aucun jeu de données plus récent par diffuseur n’a été publié.

MétriqueValeurSource
Latence médiane des sous-titres en direct au Royaume-Uni, première campagne5,6 secondesPremier rapport de l’Ofcom sur le sous-titrage en direct, avril 2014
Latence au Royaume-Uni, deuxième campagne5,8 secondesDeuxième rapport de l’Ofcom, novembre 2014
Échantillons respectant la consigne de 3 secondes, deuxième campagne4 sur 72Deuxième rapport de l’Ofcom, 2014
Plus long retard enregistré, deuxième campagne21 secondesDeuxième rapport de l’Ofcom, 2014
Latence moyenne au Royaume-Uni, d’avril-mai 2014 à octobre-novembre 2014de 5,7 s à 5,1 s (-0,6 s)Troisième rapport de l’Ofcom, mai 2015
Latence moyenne au Royaume-Uni sur les quatre campagnes5,3 secondesDonnées de l’Ofcom d’après Moores, JoSTrans 33
Latence sans déclenchement en direct de sous-titres préparés7 à 8 secondesDonnées de l’Ofcom d’après Moores, JoSTrans 33

Note de contexte : les chiffres par campagne mélangent médianes et moyennes telles que publiées, si bien que les petits écarts entre campagnes (5,6, 5,7, 5,8) ne doivent pas être surinterprétés. Le chiffre de 7 à 8 secondes pour les programmes sans sous-titres préparés et déclenchés montre à quel point la moyenne britannique dépend de la préparation de scripts plutôt que de la transcription en temps réel.

En dehors du Royaume-Uni, les retards sont plus longs. Les sous-titres des journaux télévisés américains en espagnol de Telemundo et Univision accusaient en moyenne 8,2 secondes de retard sur la parole, avec des valeurs allant de 0,7 à 41 secondes, 46% des sous-titres ayant plus de 8 secondes de retard (Fresno, Closed Captions en espanol, JoSTrans 42, 2024). Une étude de 2026 sur des extraits de télévision américaine en direct a mesuré un retard moyen de 8,46 secondes (écart type 3,62) et décrit 7 à 12 secondes comme typiques pour les sous-titres télévisés (Thompson et al., arXiv 2609.11408).

MétriqueValeurSource
Retard moyen des sous-titres, journaux télévisés américains en espagnol8,2 secondesFresno, JoSTrans 42, 2024
Plage des retards, même échantillonde 0,7 à 41 secondesFresno, JoSTrans 42, 2024
Sous-titres retardés de plus de 8 / 10 / 12 secondes46% / 20% / 8%Fresno, JoSTrans 42, 2024
Sous-titres analysés dans cette étude5 349 (20 segments de dix minutes)Fresno, JoSTrans 42, 2024
Retard moyen sur des extraits de télévision américaine en direct8,46 secondes (écart type 3,62)Thompson et al., arXiv 2609.11408, sept. 2026
Retard typique cité pour les sous-titres de télévision américaine7 à 12 secondesThompson et al., arXiv 2609.11408, sept. 2026
Latence moyenne lors d’événements en direct (hors diffusion) en réparlé5,8 secondes (plage 4,3 à 7,5 s)Moores, JoSTrans 33

2. Objectifs réglementaires : de 3 secondes à 4,5 secondes

Les régulateurs s’accordent sur l’importance de la latence, mais presque aucun n’y met un chiffre. L’Ofcom est le seul grand régulateur de ce tour d’horizon à avoir un objectif de latence chiffré, et il l’a déplacé dans un sens plus indulgent : d’un retard maximal de 3 secondes dans son Code on Television Access Services à une moyenne d’au plus 4,5 secondes sur l’ensemble des programmes en direct d’un fournisseur. Lors de la consultation de 2023, l’Ofcom a indiqué que les diffuseurs jugeaient le maximum de 3 secondes irréaliste et que 4,5 secondes correspondaient aux meilleures latences atteintes par chacun d’eux (Ofcom Guidelines on Providing Television and On-Demand Access Services).

L’approche américaine est qualitative. La FCC a adopté le 20 février 2014 des normes de qualité des sous-titres couvrant la précision, la synchronisation, l’exhaustivité et le placement, en disant seulement que le retard des sous-titres en direct ‘doit être réduit au minimum, de manière compatible avec une présentation fidèle de ce qui est dit’ (FCC, normes de qualité des sous-titres). Le Canada réglemente la précision plutôt que le temps : la politique réglementaire de radiodiffusion 2019-308 du CRTC exige que les sous-titres en direct en anglais obtiennent 98 au modèle NER. L’effet pratique est qu’un sous-titre arrivant avec 10 secondes de retard peut être entièrement conforme dans la plupart des pays.

MétriqueValeurSource
Ancienne consigne de l’OfcomRetard maximal de 3 secondesOfcom Code on Television Access Services
Consigne actuelle de l’OfcomMoyenne d’au plus 4,5 secondes sur les programmes en directOfcom Guidelines on Providing TV and On-Demand Access Services
Ancienne consigne de l’Ofcom sur la vitesse des sous-titres : préenregistrés / en direct160 à 180 mots par minute / 200 mots par minuteConsultation 2023 de l’Ofcom, rapportée par Liam O’Dell
Limite numérique de latence de la FCCAucune (retard ‘réduit au minimum’)FCC 14-12, adoptée le 20 février 2014
Interdiction par la FCC du sous-titrage ENT par téléprompteur seul pour les programmes en direct4 grands réseaux et leurs affiliés dans les 25 premiers marchésFCC 14-12
Sous-titrage des nouveaux programmes non exemptés (FCC)100% depuis le 1er janvier 200647 CFR 79.1
Exigence de précision du CRTC pour les sous-titres en direct en anglaisScore NER de 98, à partir du 1er septembre 2019CRTC 2019-308
Obligation de suivi du CRTC2 programmes en direct par mois, dont 1 d’informationCRTC 2019-308

Note de contexte : l’ACMA australienne, en vertu du Broadcasting Services (Television Captioning) Standard 2023 en vigueur depuis le 1er octobre 2023, ne fixe pas non plus de latence chiffrée, et évalue la lisibilité, la précision et la compréhensibilité au cas par cas.

Les règles les plus récentes étendent les obligations au streaming plutôt que de resserrer le retard. La décision CRTC 2026-98 du Canada exige des diffuseurs en ligne qu’ils sous-titrent 80% de leur catalogue d’ici mai 2030 et 100% d’ici mai 2031, avec des sous-titres sur les nouveaux programmes originaux, en direct comme préenregistrés, dans un délai d’un an (CRTC 2026-98, 25 mai 2026). Le projet de Tier 1 Accessibility Code de l’Ofcom, publié le 14 mai 2026, propose un quota de sous-titrage de 80% pour les plus grands services de streaming quatre ans après sa publication (Ofcom, consultation sur le Tier 1 Accessibility Code).

MétriqueValeurSource
Sous-titrage du catalogue des services de streaming canadiens80% d’ici mai 2030, 100% d’ici mai 2031CRTC 2026-98
Exigence canadienne de précision pour les programmes originaux préenregistrés des services de streaming100%CRTC 2026-98
Quota de sous-titrage Tier 1 de l’Ofcom, année 4 / année 180% / 20%Projet de Tier 1 Accessibility Code de l’Ofcom, mai 2026
Quota de sous-titrage de la BBC à la demande, année 490%Projet de Tier 1 Accessibility Code de l’Ofcom, mai 2026
Seuil du Tier 1500 000+ utilisateurs mensuels moyens au Royaume-UniProjet de Tier 1 Accessibility Code de l’Ofcom, mai 2026

3. Précision : la barre des 98% au modèle NER et qui la franchit

Retard et précision se compensent, de sorte que les chiffres de latence n’ont de sens qu’à côté des chiffres de précision. L’étalon courant est le modèle NER, qui note les sous-titres en direct selon le rapport (mots moins erreurs d’édition et de reconnaissance) sur mots. 98% est ‘acceptable’, 98,5 à 98,99% ‘bon’, 99 à 99,49% ‘très bon’ et au-delà de 99,5% ‘excellent’ (Romero-Fresco et Martinez, modèle NER, 2015). Le seuil paraît indulgent jusqu’à ce qu’on le traduise : à 98%, deux mots sur 100 sont faux, manquants ou des erreurs pondérées.

Les diffuseurs britanniques ont franchi la barre en moyenne : 98,38% sur les quatre campagnes de l’Ofcom et 98,55% lors de la dernière, mesurés sur 78 000 sous-titres et 546 000 mots (Moores, JoSTrans 33). Mais les moyennes masquent la queue de distribution. En octobre-novembre 2014, 77% des programmes britanniques atteignaient 98% ou plus, contre 74% en avril-mai 2014, et l’information était le genre le plus précis avec 98,75% (troisième rapport de l’Ofcom, 2015). Les journaux télévisés nationaux américains en anglais ont fait mieux, avec une moyenne de 98,8% et 14 échantillons sur 20 jugés acceptables ou mieux, tandis que ceux en espagnol sont tombés à 97,04% (Fresno, 2024).

MétriqueValeurSource
Seuils NER acceptable / excellent98% / plus de 99,5%Romero-Fresco et Martinez, 2015
Précision des sous-titres en direct au Royaume-Uni, moyenne des quatre campagnes98,38%Données de l’Ofcom d’après Moores, JoSTrans 33
Précision des sous-titres en direct au Royaume-Uni, dernière campagne98,55%Données de l’Ofcom d’après Moores, JoSTrans 33
Programmes britanniques à 98% ou plus, oct.-nov. 2014 (contre avr.-mai 2014)77% (74%)Troisième rapport de l’Ofcom, 2015
Précision du genre information au Royaume-Uni98,75%Troisième rapport de l’Ofcom, 2015
Journaux télévisés nationaux américains en anglais, NER moyen98,8% (14 échantillons sur 20 acceptables ou mieux)Fresno, Universal Access in the Information Society, 2024
Journaux télévisés américains en espagnol, NER moyen97,04% (Telemundo 97,00%, Univision 97,10%)Fresno, JoSTrans 42, 2024
Réduction du texte : journaux en espagnol contre en anglais26% contre 5 à 6%Fresno, JoSTrans 42, 2024

Note de contexte : la vitesse est la troisième variable cachée. L’Ofcom recommande que les sous-titres aient en moyenne moins de 180 mots par minute, pourtant presque tous les programmes qu’elle a analysés comportaient de brèves pointes au-dessus de 200 mots par minute, et lorsque ces pointes étaient comptées comme des erreurs, 68% des programmes tombaient sous 98% (troisième rapport de l’Ofcom, 2015). L’étude sur les journaux télévisés américains en anglais a constaté que près des deux tiers des erreurs étaient mineures.

4. Ce que le retard coûte aux spectateurs

Le public des sous-titres en direct est bien plus large que la seule communauté sourde. L’Ofcom a estimé qu’environ 7,6 millions d’adultes britanniques avaient utilisé des sous-titres, dont seulement 1,4 million avaient une déficience auditive (communiqué de presse de l’Ofcom via Wired-Gov, mai 2013). Cela représente plus de 6 millions d’utilisateurs de sous-titres sans déficience auditive (7,6 millions moins 1,4 million), dont beaucoup regardent dans des pièces bruyantes ou avec le son baissé. Les lignes directrices de l’Ofcom citent aussi des données de YouGov selon lesquelles 61% des 18-24 ans préfèrent avoir les sous-titres activés. À l’échelle mondiale, l’OMS estime que 430 millions de personnes ont aujourd’hui besoin d’une réadaptation pour une perte auditive invalidante, un chiffre qui dépassera 700 millions d’ici 2050.

MétriqueValeurSource
Adultes britanniques ayant déjà utilisé des sous-titresEnviron 7,6 millions (plage 7,0 à 8,1 millions)Ofcom, mai 2013
Dont ayant une déficience auditiveEnviron 1,4 million (plage 1,2 à 1,6 million)Ofcom, mai 2013
Britanniques de 18 à 24 ans préférant les sous-titres activés61%YouGov, cité dans les lignes directrices de l’Ofcom sur les services d’accès
Part des heures de programmes sous-titrées des chaînes PSB et des grands services à la demande au Royaume-Uni, 202488%Ofcom Access Services Report, janv.-déc. 2024 (publié le 19 mai 2025)
Heures sous-titrées sur les chaînes concernées au Royaume-Uni, 2005 contre 201340,5% contre 81,9%Premier rapport de l’Ofcom sur le sous-titrage en direct, 2014
Personnes ayant besoin d’une réadaptation pour une perte auditive invalidante430 millionsFiche d’information de l’OMS, mise à jour en mars 2026
Personnes devant présenter une perte auditive d’ici 2050Près de 2,5 milliardsFiche d’information de l’OMS, mise à jour en mars 2026

Le retard est ce que les spectateurs remarquent en premier. La plus grande étude récente auprès des utilisateurs a demandé à 216 spectateurs sourds et malentendants de noter 70 extraits de télévision en direct dans quatre conditions, produisant 4 832 notes. Les mêmes sous-titres télévisés ont obtenu 3,66 sur 7 avec leur retard de diffusion d’origine et 5,09 une fois synchronisés, un écart bien plus large que celui entre sous-titres télévisés synchronisés et sous-titres ASR (Thompson et al., Are Caption Metrics Broken?, arXiv 2609.11408, septembre 2026). Les sous-titres ASR avec deux secondes de retard ont beaucoup mieux résisté, avec 4,81 contre 5,20 une fois synchronisés.

La même étude met à mal l’idée que les scores de précision rendent compte de la qualité. Seuls 11 extraits de télévision sur 70 et 4 extraits ASR sur 70 ont atteint le seuil NER de 98, et pourtant les spectateurs ont noté à peu près de la même façon les sous-titres ASR et télévisés synchronisés, et la corrélation entre métriques et notes a chuté fortement pour la sortie ASR (WER r = -0,390 contre -0,687 pour les sous-titres télévisés). L’étude CHI 2024 antérieure de Gallaudet est parvenue à une conclusion similaire : les participants détestaient nettement les retards de diffusion, et les métriques de précision standard ne corrélaient que faiblement avec la façon dont les spectateurs notaient les sous-titres.

MétriqueValeurSource
Participants / notes / extraits216 / 4 832 / 70Thompson et al., arXiv 2609.11408, 2026
Note des sous-titres télévisés : retard d’origine contre synchronisés (échelle de 7 points)3,66 contre 5,09Thompson et al., 2026
Note des sous-titres ASR : retard de 2 s contre synchronisés4,81 contre 5,20Thompson et al., 2026
WER moyen : sous-titres télévisés contre sous-titres ASR33,8% contre 17,2%Thompson et al., 2026
NER moyen : sous-titres télévisés contre sous-titres ASR95,28 contre 94,34Thompson et al., 2026
Extraits atteignant NER 98 : télévision contre ASR11 sur 70 contre 4 sur 70Thompson et al., 2026
Corrélation du WER avec les notes des spectateurs : télévision contre ASRr = -0,687 contre -0,390Thompson et al., 2026

Note de contexte : le WER élevé des sous-titres télévisés reflète en partie le fait que les sous-titres de diffusion paraphrasent et condensent, ce que le WER pénalise et que le NER ne pénalise pas. Cet écart est précisément la raison pour laquelle les auteurs soutiennent que les métriques actuelles ne sont pas neutres sur le plan technologique.

5. Vitesse des moteurs ASR : latence en streaming contre conversation humaine

La latence du moteur n’est plus la principale source de retard des sous-titres. AssemblyAI a annoncé une latence médiane en streaming de 307 ms pour Universal-Streaming contre 516 ms pour Deepgram Nova-3, et un P99 de 1 012 ms contre 1 907 ms, mesurés entre la fin d’un mot dans l’audio et sa première apparition dans une transcription partielle sur plus de 205 heures d’audio (AssemblyAI, Introducing Universal-Streaming, 2 juin 2025). Les données de lancement de Deepgram situaient le taux d’erreur par mot médian de Nova-3 en streaming à 6,84%, contre 14,92% pour les concurrents testés (Deepgram, Introducing Nova-3, février 2025). Ce sont deux benchmarks d’éditeurs, à lire comme des chiffres de meilleur cas. Nos statistiques sur la reconnaissance vocale couvrent la précision de davantage de moteurs.

Les modèles ouverts échangent davantage de retard contre de la stabilité. Le système académique Whisper-Streaming a atteint 3,3 secondes de latence moyenne sur de la parole anglaise de longue durée issue du jeu de test ESIC du Parlement européen, et le compromis est explicite dans ses résultats : un WER anglais de 8,5% avec 3,27 s de latence et des segments de 0,5 s, contre 8,0% avec 5,45 s et des segments de 2 s (Machacek, Dabre et Bojar, arXiv 2307.14743, IJCNLP-AACL 2023). Remarquez qu’une configuration Whisper à 5 secondes tombe pile sur la moyenne de la diffusion britannique d’il y a dix ans.

MétriqueValeurSource
Latence médiane / P99 d’AssemblyAI Universal-Streaming307 ms / 1 012 msAssemblyAI, juin 2025
Latence médiane / P99 de Deepgram Nova-3 (test AssemblyAI)516 ms / 1 907 msAssemblyAI, juin 2025
WER médian de Deepgram Nova-3 : streaming / par lots6,84% / 5,26%Deepgram, févr. 2025
Jeu de benchmark de Deepgram Nova-32 703 fichiers, 81,69 heures, 9 domainesDeepgram, févr. 2025
Latence moyenne de Whisper-Streaming, anglais3,3 secondesMachacek et al., 2023
Whisper-Streaming en anglais : segment de 0,5 s contre segment de 2,0 s8,5% de WER à 3,27 s contre 8,0% de WER à 5,45 sMachacek et al., 2023
Latence de Whisper-Streaming, allemand / tchèque (segment de 0,5 s)4,11 s / 4,69 sMachacek et al., 2023

Le plafond du temps réel est fixé par la conversation humaine. Dans 10 langues, l’écart moyen entre une question et sa réponse était de +208 ms, allant de +7 ms en japonais à +469 ms en danois (Stivers et al., PNAS 2009). Le lancement de GPT-4o par OpenAI a revendiqué des réponses audio en seulement 232 ms et 320 ms en moyenne, contre 2,8 secondes (GPT-3.5) et 5,4 secondes (GPT-4) pour l’ancien Voice Mode en pipeline, qui enchaînait des modèles distincts de transcription, de langage et de parole. La leçon pour le sous-titrage en direct est la même : chaque étape supplémentaire de la chaîne ajoute des secondes, et l’étape qui dominait autrefois, la reconnaissance elle-même, est désormais la plus petite.

MétriqueValeurSource
Écart moyen entre question et réponse, 10 langues+208 msStivers et al., PNAS 2009 (données les plus récentes disponibles)
Moyenne de la langue la plus rapide / la plus lente+7 ms (japonais) / +469 ms (danois)Stivers et al., PNAS 2009
Réponse audio de GPT-4o : minimum / moyenne232 ms / 320 msOpenAI, mai 2024
Latence moyenne du Voice Mode en pipeline : GPT-3.5 / GPT-42,8 s / 5,4 sOpenAI, mai 2024
Retard des sous-titres ASR utilisé dans l’étude 2026 auprès des spectateurs2 secondes en moyenneThompson et al., arXiv 2609.11408

6. L’automatisation prend le contrôle de la chaîne de sous-titrage

La main-d’œuvre humaine derrière les sous-titres en direct est définie par des limites de vitesse. La référence américaine en temps réel, la certification NCRA Certified Realtime Reporter, exige un test en temps réel de cinq minutes à 200 mots par minute avec 96% de précision, et un rapport de l’EBU décrit le sous-titrage en direct comme le fait de suivre des locuteurs jusqu’à 200 mots par minute. Des spécialistes du réparlé britanniques ont indiqué aux chercheurs que la formation de base prend 2 à 3 mois, alors que gagner en assurance demande 1,5 à 2 ans (Moores, JoSTrans 33). Ces contraintes expliquent pourquoi le sous-titrage automatique a progressé aussi vite dès que la précision s’est rapprochée.

Le basculement des volumes est visible dans les dépôts des entreprises. Les sous-titres automatiques LEXI d’Ai-Media ont atteint 79,2 millions de minutes à l’exercice 2025, contre moins de 10 millions quatre ans plus tôt, soit un taux de croissance annuel composé de 69% sur quatre ans, et LEXI représente désormais l’essentiel de l’usage sur son réseau iCap (résultats FY25 d’Ai-Media, annonce ASX, 28 août 2025). Les produits technologiques représentaient 63% du chiffre d’affaires d’Ai-Media, contre zéro cinq ans plus tôt. Un test indépendant de ce même système a relevé une précision NER de 98,56% en anglais et de 98,26% en espagnol, équivalente à celle des sous-titres humains, sauf sur les contenus familiers avec plusieurs locuteurs (Romero-Fresco et Van Gauwbergen, Fit for What Purpose?, 2025). Pour en savoir plus sur le versant humain du métier, voir nos statistiques sur la précision de la transcription en salle d’audience.

MétriqueValeurSource
Norme temps réel NCRA CRR200 mots par minute avec 96% de précision (test de 5 minutes)NCRA
Formation de base du spécialiste du réparlé / délai pour gagner en assurance2 à 3 mois / 1,5 à 2 ansMoores, JoSTrans 33
Minutes de sous-titres automatiques LEXI d’Ai-Media, exercice 202579,2 millionsRésultats FY25 d’Ai-Media, ASX
Minutes LEXI quatre ans plus tôtMoins de 10 millions (TCAC de 69% sur quatre ans)Résultats FY25 d’Ai-Media, ASX
Part de la technologie dans le chiffre d’affaires d’Ai-Media63% (chiffre d’affaires total de 64,9 millions USD)Résultats FY25 d’Ai-Media, ASX
Précision NER des sous-titres automatiques : anglais / espagnol98,56% / 98,26%Romero-Fresco et Van Gauwbergen, 2025
Sous-titres en direct analysés pour comparer sorties automatiques et humaines, Royaume-Uni/États-Unis/Canada 2018-2022Environ 17 000Romero-Fresco et Fresno, Linguistica Antverpiensia 22, 2023

Note de contexte : la plus vaste comparaison humain-machine à ce jour (Romero-Fresco et Fresno, Linguistica Antverpiensia, 2023) a constaté que les sous-titres automatiques non édités approchaient 98%, avec des faiblesses persistantes sur la ponctuation, les noms propres, les nombres et l’identification des locuteurs. Une latence moteur plus faible n’y change rien : un nom faux mais rapide reste un nom faux.

Résumé : la latence du sous-titrage en direct en chiffres

MétriqueValeurSource
Latence moyenne des sous-titres en direct au Royaume-Uni, fin 20145,1 secondesTroisième rapport de l’Ofcom, 2015
Échantillons britanniques respectant la consigne de 3 s, deuxième campagne4 sur 72Deuxième rapport de l’Ofcom, 2014
Plus long retard enregistré au Royaume-Uni21 secondesDeuxième rapport de l’Ofcom, 2014
Consigne actuelle de latence de l’OfcomMoyenne de 4,5 secondes ou moinsLignes directrices de l’Ofcom sur les services d’accès
Limite numérique de latence de la FCCAucuneFCC 14-12, 2014
Précision des sous-titres en direct en anglais exigée par le CRTCNER 98CRTC 2019-308
Retard des sous-titres des journaux américains en espagnol8,2 secondes en moyenneFresno, JoSTrans 42, 2024
Sous-titres des journaux américains en espagnol avec plus de 10 secondes de retard20%Fresno, JoSTrans 42, 2024
Retard moyen sur des extraits de télévision américaine en direct8,46 secondesThompson et al., arXiv 2609.11408, 2026
Note des sous-titres télévisés : retardés contre synchronisés3,66 contre 5,09 sur 7Thompson et al., 2026
Précision des sous-titres en direct au Royaume-Uni, moyenne des quatre campagnes98,38%Données de l’Ofcom d’après Moores, JoSTrans 33
Précision des journaux nationaux américains en anglais98,8%Fresno, 2024
Précision des sous-titres automatiques, anglais98,56%Romero-Fresco et Van Gauwbergen, 2025
Adultes britanniques ayant déjà utilisé des sous-titresEnviron 7,6 millionsOfcom, 2013
Heures sous-titrées des chaînes PSB et grands services à la demande au Royaume-Uni, 202488%Ofcom Access Services Report 2024
Latence médiane en streaming d’AssemblyAI307 msAssemblyAI, juin 2025
Latence moyenne de Whisper-Streaming3,3 secondesMachacek et al., 2023
Écart moyen humain entre les tours de parole208 msStivers et al., PNAS 2009
Minutes de sous-titres LEXI d’Ai-Media, exercice 202579,2 millionsRésultats FY25 d’Ai-Media
Sous-titrage du catalogue des services de streaming canadiens d’ici mai 2031100%CRTC 2026-98

Méthodologie et sources

Chaque chiffre ci-dessus a été retracé jusqu’au régulateur, au dépôt ou à l’article évalué par des pairs qui l’a produit. Plusieurs PDF de l’Ofcom n’ont pas pu être récupérés directement ; les chiffres britanniques proviennent donc de communiqués de presse de l’Ofcom (republiés sur Wired-Gov), de synthèses de régulateurs (EPRA) et de l’analyse évaluée par des pairs du jeu de données de l’Ofcom (Moores), chacun étant nommé dans le texte. Les benchmarks d’éditeurs sont signalés comme des données d’éditeurs. Pour les données générales sur le marché et l’usage du sous-titrage, voir nos statistiques sur les sous-titres.

Dernière mise à jour : 3 octobre 2026. Nous actualisons ce tour d’horizon chaque trimestre, et la prochaine révision est attendue lorsque l’Ofcom publiera sa déclaration finale sur le Tier 1 Accessibility Code ainsi que son Access Services Report pour la période de janvier à décembre 2025.

Essayez VoxBooster — essai gratuit de 3 jours.

Clonage vocal en temps réel, soundboard et effets — partout où vous parlez déjà.

  • Sans carte bancaire
  • ~30 ms de latence
  • Discord · Teams · OBS
Essayer gratuitement 3 jours