Les sous-titres en direct de la télévision britannique accusaient en moyenne 5,1 à 5,8 secondes de retard sur la parole lors des campagnes de mesure de l’Ofcom, et seuls 4 échantillons sur 72 de la deuxième campagne respectaient l’ancienne consigne de 3 secondes (Ofcom, rapports sur la qualité du sous-titrage en direct 2014-2015). Le problème n’a pas disparu : une étude de 2024 sur les journaux télévisés américains en espagnol a mesuré un retard moyen de 8,2 secondes, certains sous-titres arrivant jusqu’à 41 secondes plus tard (Fresno, JoSTrans 2024), et une étude de septembre 2026 a mesuré une moyenne de 8,46 secondes sur des extraits de télévision américaine en direct. Pendant ce temps, les moteurs de reconnaissance vocale en streaming annoncent désormais une latence médiane par mot proche de 300 millisecondes (AssemblyAI, juin 2025) : le goulot d’étranglement du sous-titrage en direct se déplace donc du sténotypiste humain vers la chaîne de diffusion. Nous avons agrégé des données de l’Ofcom, de la FCC, du CRTC, d’études évaluées par des pairs de l’Université Gallaudet et de l’Universidade de Vigo, d’articles de benchmark sur arXiv, des dépôts d’Ai-Media auprès de l’ASX, de l’OMS et d’autres sources primaires listées dans la méthodologie. Pour une vue d’ensemble, consultez notre tour d’horizon des statistiques du sous-titrage en direct.
TL;DR
- La latence moyenne des sous-titres en direct au Royaume-Uni est passée de 5,7 à 5,1 secondes entre avril-mai et octobre-novembre 2014, soit encore bien au-dessus de la consigne de 3 secondes (Ofcom, troisième rapport sur le sous-titrage en direct, 2015).
- Seuls 4 échantillons britanniques sur 72 respectaient la consigne de 3 secondes lors de la deuxième campagne, et le plus long retard a atteint 21 secondes (Ofcom, deuxième rapport, 2014).
- L’Ofcom demande désormais une latence moyenne d’au plus 4,5 secondes sur l’ensemble des programmes en direct (Ofcom Guidelines on Providing TV and On-Demand Access Services).
- Les journaux télévisés américains en espagnol affichaient 8,2 secondes de retard moyen des sous-titres, et 20% des sous-titres arrivaient avec plus de 10 secondes de retard (Fresno, JoSTrans 42, 2024).
- Les sous-titres télévisés avec leur retard de diffusion d’origine (moyenne de 8,46 s) ont été notés 3,66/7 contre 5,09/7 une fois synchronisés (Thompson et al., arXiv 2609.11408, 2026).
- Les sous-titres en direct britanniques ont atteint en moyenne 98,38% de précision NER sur quatre campagnes de l’Ofcom, au-dessus du seuil de 98% (données de l’Ofcom d’après Moores, JoSTrans 33).
- Les journaux télévisés nationaux américains en anglais ont atteint en moyenne 98,8% de précision NER (Fresno, Universal Access in the Information Society, 2024).
- Un système de sous-titrage automatique a obtenu 98,56% de NER en anglais et 98,26% en espagnol (Romero-Fresco et Van Gauwbergen, 2025).
- AssemblyAI a annoncé une latence médiane en streaming de 307 ms contre 516 ms pour Deepgram Nova-3 (AssemblyAI, juin 2025).
- Whisper-Streaming a atteint une latence moyenne de 3,3 secondes sur de la parole anglaise de longue durée (Machacek, Dabre et Bojar, IJCNLP-AACL 2023).
- Les humains répondent à une question en 208 ms en moyenne dans 10 langues (Stivers et al., PNAS 2009), la référence que les systèmes en temps réel cherchent à atteindre.
- Les sous-titres automatiques LEXI d’Ai-Media ont atteint 79,2 millions de minutes à l’exercice 2025, contre moins de 10 millions quatre ans plus tôt (résultats FY25 d’Ai-Media, ASX).
1. Retard mesuré : de combien les sous-titres en direct suivent la parole
Le jeu de données public le plus complet sur le retard des sous-titres en direct reste celui du Royaume-Uni, et il raconte une histoire cohérente : un sous-titre en direct typique apparaît plus de 5 secondes après que les mots ont été prononcés. L’Ofcom a échantillonné des journaux, des émissions de divertissement et des talk-shows de la BBC, d’ITV, de Channel 4, de Channel 5 et de Sky sur quatre campagnes entre 2013 et 2015. Le premier rapport a relevé une latence médiane de 5,6 secondes (synthèse de l’EPRA du premier rapport de l’Ofcom, avril 2014), et le deuxième 5,8 secondes, avec seulement 4 échantillons sur 72 dans la limite de la consigne de 3 secondes (article de Limping Chicken sur le deuxième rapport de l’Ofcom, novembre 2014).
L’amélioration qui a suivi était réelle mais modeste. Le troisième rapport de l’Ofcom a enregistré une baisse de la latence moyenne de 0,6 seconde, de 5,7 à 5,1 secondes, entre avril-mai et octobre-novembre 2014 (communiqué de presse de l’Ofcom via Wired-Gov, mai 2015). Gagner une demi-seconde sur un retard de cinq secondes a exigé des diffuseurs qu’ils changent leurs flux de travail, pas seulement leurs logiciels, ce qui explique que le chiffre ait plafonné. Ce sont les mesures de latence de l’Ofcom les plus récentes disponibles (2014-2015) ; aucun jeu de données plus récent par diffuseur n’a été publié.
| Métrique | Valeur | Source |
|---|---|---|
| Latence médiane des sous-titres en direct au Royaume-Uni, première campagne | 5,6 secondes | Premier rapport de l’Ofcom sur le sous-titrage en direct, avril 2014 |
| Latence au Royaume-Uni, deuxième campagne | 5,8 secondes | Deuxième rapport de l’Ofcom, novembre 2014 |
| Échantillons respectant la consigne de 3 secondes, deuxième campagne | 4 sur 72 | Deuxième rapport de l’Ofcom, 2014 |
| Plus long retard enregistré, deuxième campagne | 21 secondes | Deuxième rapport de l’Ofcom, 2014 |
| Latence moyenne au Royaume-Uni, d’avril-mai 2014 à octobre-novembre 2014 | de 5,7 s à 5,1 s (-0,6 s) | Troisième rapport de l’Ofcom, mai 2015 |
| Latence moyenne au Royaume-Uni sur les quatre campagnes | 5,3 secondes | Données de l’Ofcom d’après Moores, JoSTrans 33 |
| Latence sans déclenchement en direct de sous-titres préparés | 7 à 8 secondes | Données de l’Ofcom d’après Moores, JoSTrans 33 |
Note de contexte : les chiffres par campagne mélangent médianes et moyennes telles que publiées, si bien que les petits écarts entre campagnes (5,6, 5,7, 5,8) ne doivent pas être surinterprétés. Le chiffre de 7 à 8 secondes pour les programmes sans sous-titres préparés et déclenchés montre à quel point la moyenne britannique dépend de la préparation de scripts plutôt que de la transcription en temps réel.
En dehors du Royaume-Uni, les retards sont plus longs. Les sous-titres des journaux télévisés américains en espagnol de Telemundo et Univision accusaient en moyenne 8,2 secondes de retard sur la parole, avec des valeurs allant de 0,7 à 41 secondes, 46% des sous-titres ayant plus de 8 secondes de retard (Fresno, Closed Captions en espanol, JoSTrans 42, 2024). Une étude de 2026 sur des extraits de télévision américaine en direct a mesuré un retard moyen de 8,46 secondes (écart type 3,62) et décrit 7 à 12 secondes comme typiques pour les sous-titres télévisés (Thompson et al., arXiv 2609.11408).
| Métrique | Valeur | Source |
|---|---|---|
| Retard moyen des sous-titres, journaux télévisés américains en espagnol | 8,2 secondes | Fresno, JoSTrans 42, 2024 |
| Plage des retards, même échantillon | de 0,7 à 41 secondes | Fresno, JoSTrans 42, 2024 |
| Sous-titres retardés de plus de 8 / 10 / 12 secondes | 46% / 20% / 8% | Fresno, JoSTrans 42, 2024 |
| Sous-titres analysés dans cette étude | 5 349 (20 segments de dix minutes) | Fresno, JoSTrans 42, 2024 |
| Retard moyen sur des extraits de télévision américaine en direct | 8,46 secondes (écart type 3,62) | Thompson et al., arXiv 2609.11408, sept. 2026 |
| Retard typique cité pour les sous-titres de télévision américaine | 7 à 12 secondes | Thompson et al., arXiv 2609.11408, sept. 2026 |
| Latence moyenne lors d’événements en direct (hors diffusion) en réparlé | 5,8 secondes (plage 4,3 à 7,5 s) | Moores, JoSTrans 33 |
2. Objectifs réglementaires : de 3 secondes à 4,5 secondes
Les régulateurs s’accordent sur l’importance de la latence, mais presque aucun n’y met un chiffre. L’Ofcom est le seul grand régulateur de ce tour d’horizon à avoir un objectif de latence chiffré, et il l’a déplacé dans un sens plus indulgent : d’un retard maximal de 3 secondes dans son Code on Television Access Services à une moyenne d’au plus 4,5 secondes sur l’ensemble des programmes en direct d’un fournisseur. Lors de la consultation de 2023, l’Ofcom a indiqué que les diffuseurs jugeaient le maximum de 3 secondes irréaliste et que 4,5 secondes correspondaient aux meilleures latences atteintes par chacun d’eux (Ofcom Guidelines on Providing Television and On-Demand Access Services).
L’approche américaine est qualitative. La FCC a adopté le 20 février 2014 des normes de qualité des sous-titres couvrant la précision, la synchronisation, l’exhaustivité et le placement, en disant seulement que le retard des sous-titres en direct ‘doit être réduit au minimum, de manière compatible avec une présentation fidèle de ce qui est dit’ (FCC, normes de qualité des sous-titres). Le Canada réglemente la précision plutôt que le temps : la politique réglementaire de radiodiffusion 2019-308 du CRTC exige que les sous-titres en direct en anglais obtiennent 98 au modèle NER. L’effet pratique est qu’un sous-titre arrivant avec 10 secondes de retard peut être entièrement conforme dans la plupart des pays.
| Métrique | Valeur | Source |
|---|---|---|
| Ancienne consigne de l’Ofcom | Retard maximal de 3 secondes | Ofcom Code on Television Access Services |
| Consigne actuelle de l’Ofcom | Moyenne d’au plus 4,5 secondes sur les programmes en direct | Ofcom Guidelines on Providing TV and On-Demand Access Services |
| Ancienne consigne de l’Ofcom sur la vitesse des sous-titres : préenregistrés / en direct | 160 à 180 mots par minute / 200 mots par minute | Consultation 2023 de l’Ofcom, rapportée par Liam O’Dell |
| Limite numérique de latence de la FCC | Aucune (retard ‘réduit au minimum’) | FCC 14-12, adoptée le 20 février 2014 |
| Interdiction par la FCC du sous-titrage ENT par téléprompteur seul pour les programmes en direct | 4 grands réseaux et leurs affiliés dans les 25 premiers marchés | FCC 14-12 |
| Sous-titrage des nouveaux programmes non exemptés (FCC) | 100% depuis le 1er janvier 2006 | 47 CFR 79.1 |
| Exigence de précision du CRTC pour les sous-titres en direct en anglais | Score NER de 98, à partir du 1er septembre 2019 | CRTC 2019-308 |
| Obligation de suivi du CRTC | 2 programmes en direct par mois, dont 1 d’information | CRTC 2019-308 |
Note de contexte : l’ACMA australienne, en vertu du Broadcasting Services (Television Captioning) Standard 2023 en vigueur depuis le 1er octobre 2023, ne fixe pas non plus de latence chiffrée, et évalue la lisibilité, la précision et la compréhensibilité au cas par cas.
Les règles les plus récentes étendent les obligations au streaming plutôt que de resserrer le retard. La décision CRTC 2026-98 du Canada exige des diffuseurs en ligne qu’ils sous-titrent 80% de leur catalogue d’ici mai 2030 et 100% d’ici mai 2031, avec des sous-titres sur les nouveaux programmes originaux, en direct comme préenregistrés, dans un délai d’un an (CRTC 2026-98, 25 mai 2026). Le projet de Tier 1 Accessibility Code de l’Ofcom, publié le 14 mai 2026, propose un quota de sous-titrage de 80% pour les plus grands services de streaming quatre ans après sa publication (Ofcom, consultation sur le Tier 1 Accessibility Code).
| Métrique | Valeur | Source |
|---|---|---|
| Sous-titrage du catalogue des services de streaming canadiens | 80% d’ici mai 2030, 100% d’ici mai 2031 | CRTC 2026-98 |
| Exigence canadienne de précision pour les programmes originaux préenregistrés des services de streaming | 100% | CRTC 2026-98 |
| Quota de sous-titrage Tier 1 de l’Ofcom, année 4 / année 1 | 80% / 20% | Projet de Tier 1 Accessibility Code de l’Ofcom, mai 2026 |
| Quota de sous-titrage de la BBC à la demande, année 4 | 90% | Projet de Tier 1 Accessibility Code de l’Ofcom, mai 2026 |
| Seuil du Tier 1 | 500 000+ utilisateurs mensuels moyens au Royaume-Uni | Projet de Tier 1 Accessibility Code de l’Ofcom, mai 2026 |
3. Précision : la barre des 98% au modèle NER et qui la franchit
Retard et précision se compensent, de sorte que les chiffres de latence n’ont de sens qu’à côté des chiffres de précision. L’étalon courant est le modèle NER, qui note les sous-titres en direct selon le rapport (mots moins erreurs d’édition et de reconnaissance) sur mots. 98% est ‘acceptable’, 98,5 à 98,99% ‘bon’, 99 à 99,49% ‘très bon’ et au-delà de 99,5% ‘excellent’ (Romero-Fresco et Martinez, modèle NER, 2015). Le seuil paraît indulgent jusqu’à ce qu’on le traduise : à 98%, deux mots sur 100 sont faux, manquants ou des erreurs pondérées.
Les diffuseurs britanniques ont franchi la barre en moyenne : 98,38% sur les quatre campagnes de l’Ofcom et 98,55% lors de la dernière, mesurés sur 78 000 sous-titres et 546 000 mots (Moores, JoSTrans 33). Mais les moyennes masquent la queue de distribution. En octobre-novembre 2014, 77% des programmes britanniques atteignaient 98% ou plus, contre 74% en avril-mai 2014, et l’information était le genre le plus précis avec 98,75% (troisième rapport de l’Ofcom, 2015). Les journaux télévisés nationaux américains en anglais ont fait mieux, avec une moyenne de 98,8% et 14 échantillons sur 20 jugés acceptables ou mieux, tandis que ceux en espagnol sont tombés à 97,04% (Fresno, 2024).
| Métrique | Valeur | Source |
|---|---|---|
| Seuils NER acceptable / excellent | 98% / plus de 99,5% | Romero-Fresco et Martinez, 2015 |
| Précision des sous-titres en direct au Royaume-Uni, moyenne des quatre campagnes | 98,38% | Données de l’Ofcom d’après Moores, JoSTrans 33 |
| Précision des sous-titres en direct au Royaume-Uni, dernière campagne | 98,55% | Données de l’Ofcom d’après Moores, JoSTrans 33 |
| Programmes britanniques à 98% ou plus, oct.-nov. 2014 (contre avr.-mai 2014) | 77% (74%) | Troisième rapport de l’Ofcom, 2015 |
| Précision du genre information au Royaume-Uni | 98,75% | Troisième rapport de l’Ofcom, 2015 |
| Journaux télévisés nationaux américains en anglais, NER moyen | 98,8% (14 échantillons sur 20 acceptables ou mieux) | Fresno, Universal Access in the Information Society, 2024 |
| Journaux télévisés américains en espagnol, NER moyen | 97,04% (Telemundo 97,00%, Univision 97,10%) | Fresno, JoSTrans 42, 2024 |
| Réduction du texte : journaux en espagnol contre en anglais | 26% contre 5 à 6% | Fresno, JoSTrans 42, 2024 |
Note de contexte : la vitesse est la troisième variable cachée. L’Ofcom recommande que les sous-titres aient en moyenne moins de 180 mots par minute, pourtant presque tous les programmes qu’elle a analysés comportaient de brèves pointes au-dessus de 200 mots par minute, et lorsque ces pointes étaient comptées comme des erreurs, 68% des programmes tombaient sous 98% (troisième rapport de l’Ofcom, 2015). L’étude sur les journaux télévisés américains en anglais a constaté que près des deux tiers des erreurs étaient mineures.
4. Ce que le retard coûte aux spectateurs
Le public des sous-titres en direct est bien plus large que la seule communauté sourde. L’Ofcom a estimé qu’environ 7,6 millions d’adultes britanniques avaient utilisé des sous-titres, dont seulement 1,4 million avaient une déficience auditive (communiqué de presse de l’Ofcom via Wired-Gov, mai 2013). Cela représente plus de 6 millions d’utilisateurs de sous-titres sans déficience auditive (7,6 millions moins 1,4 million), dont beaucoup regardent dans des pièces bruyantes ou avec le son baissé. Les lignes directrices de l’Ofcom citent aussi des données de YouGov selon lesquelles 61% des 18-24 ans préfèrent avoir les sous-titres activés. À l’échelle mondiale, l’OMS estime que 430 millions de personnes ont aujourd’hui besoin d’une réadaptation pour une perte auditive invalidante, un chiffre qui dépassera 700 millions d’ici 2050.
| Métrique | Valeur | Source |
|---|---|---|
| Adultes britanniques ayant déjà utilisé des sous-titres | Environ 7,6 millions (plage 7,0 à 8,1 millions) | Ofcom, mai 2013 |
| Dont ayant une déficience auditive | Environ 1,4 million (plage 1,2 à 1,6 million) | Ofcom, mai 2013 |
| Britanniques de 18 à 24 ans préférant les sous-titres activés | 61% | YouGov, cité dans les lignes directrices de l’Ofcom sur les services d’accès |
| Part des heures de programmes sous-titrées des chaînes PSB et des grands services à la demande au Royaume-Uni, 2024 | 88% | Ofcom Access Services Report, janv.-déc. 2024 (publié le 19 mai 2025) |
| Heures sous-titrées sur les chaînes concernées au Royaume-Uni, 2005 contre 2013 | 40,5% contre 81,9% | Premier rapport de l’Ofcom sur le sous-titrage en direct, 2014 |
| Personnes ayant besoin d’une réadaptation pour une perte auditive invalidante | 430 millions | Fiche d’information de l’OMS, mise à jour en mars 2026 |
| Personnes devant présenter une perte auditive d’ici 2050 | Près de 2,5 milliards | Fiche d’information de l’OMS, mise à jour en mars 2026 |
Le retard est ce que les spectateurs remarquent en premier. La plus grande étude récente auprès des utilisateurs a demandé à 216 spectateurs sourds et malentendants de noter 70 extraits de télévision en direct dans quatre conditions, produisant 4 832 notes. Les mêmes sous-titres télévisés ont obtenu 3,66 sur 7 avec leur retard de diffusion d’origine et 5,09 une fois synchronisés, un écart bien plus large que celui entre sous-titres télévisés synchronisés et sous-titres ASR (Thompson et al., Are Caption Metrics Broken?, arXiv 2609.11408, septembre 2026). Les sous-titres ASR avec deux secondes de retard ont beaucoup mieux résisté, avec 4,81 contre 5,20 une fois synchronisés.
La même étude met à mal l’idée que les scores de précision rendent compte de la qualité. Seuls 11 extraits de télévision sur 70 et 4 extraits ASR sur 70 ont atteint le seuil NER de 98, et pourtant les spectateurs ont noté à peu près de la même façon les sous-titres ASR et télévisés synchronisés, et la corrélation entre métriques et notes a chuté fortement pour la sortie ASR (WER r = -0,390 contre -0,687 pour les sous-titres télévisés). L’étude CHI 2024 antérieure de Gallaudet est parvenue à une conclusion similaire : les participants détestaient nettement les retards de diffusion, et les métriques de précision standard ne corrélaient que faiblement avec la façon dont les spectateurs notaient les sous-titres.
| Métrique | Valeur | Source |
|---|---|---|
| Participants / notes / extraits | 216 / 4 832 / 70 | Thompson et al., arXiv 2609.11408, 2026 |
| Note des sous-titres télévisés : retard d’origine contre synchronisés (échelle de 7 points) | 3,66 contre 5,09 | Thompson et al., 2026 |
| Note des sous-titres ASR : retard de 2 s contre synchronisés | 4,81 contre 5,20 | Thompson et al., 2026 |
| WER moyen : sous-titres télévisés contre sous-titres ASR | 33,8% contre 17,2% | Thompson et al., 2026 |
| NER moyen : sous-titres télévisés contre sous-titres ASR | 95,28 contre 94,34 | Thompson et al., 2026 |
| Extraits atteignant NER 98 : télévision contre ASR | 11 sur 70 contre 4 sur 70 | Thompson et al., 2026 |
| Corrélation du WER avec les notes des spectateurs : télévision contre ASR | r = -0,687 contre -0,390 | Thompson et al., 2026 |
Note de contexte : le WER élevé des sous-titres télévisés reflète en partie le fait que les sous-titres de diffusion paraphrasent et condensent, ce que le WER pénalise et que le NER ne pénalise pas. Cet écart est précisément la raison pour laquelle les auteurs soutiennent que les métriques actuelles ne sont pas neutres sur le plan technologique.
5. Vitesse des moteurs ASR : latence en streaming contre conversation humaine
La latence du moteur n’est plus la principale source de retard des sous-titres. AssemblyAI a annoncé une latence médiane en streaming de 307 ms pour Universal-Streaming contre 516 ms pour Deepgram Nova-3, et un P99 de 1 012 ms contre 1 907 ms, mesurés entre la fin d’un mot dans l’audio et sa première apparition dans une transcription partielle sur plus de 205 heures d’audio (AssemblyAI, Introducing Universal-Streaming, 2 juin 2025). Les données de lancement de Deepgram situaient le taux d’erreur par mot médian de Nova-3 en streaming à 6,84%, contre 14,92% pour les concurrents testés (Deepgram, Introducing Nova-3, février 2025). Ce sont deux benchmarks d’éditeurs, à lire comme des chiffres de meilleur cas. Nos statistiques sur la reconnaissance vocale couvrent la précision de davantage de moteurs.
Les modèles ouverts échangent davantage de retard contre de la stabilité. Le système académique Whisper-Streaming a atteint 3,3 secondes de latence moyenne sur de la parole anglaise de longue durée issue du jeu de test ESIC du Parlement européen, et le compromis est explicite dans ses résultats : un WER anglais de 8,5% avec 3,27 s de latence et des segments de 0,5 s, contre 8,0% avec 5,45 s et des segments de 2 s (Machacek, Dabre et Bojar, arXiv 2307.14743, IJCNLP-AACL 2023). Remarquez qu’une configuration Whisper à 5 secondes tombe pile sur la moyenne de la diffusion britannique d’il y a dix ans.
| Métrique | Valeur | Source |
|---|---|---|
| Latence médiane / P99 d’AssemblyAI Universal-Streaming | 307 ms / 1 012 ms | AssemblyAI, juin 2025 |
| Latence médiane / P99 de Deepgram Nova-3 (test AssemblyAI) | 516 ms / 1 907 ms | AssemblyAI, juin 2025 |
| WER médian de Deepgram Nova-3 : streaming / par lots | 6,84% / 5,26% | Deepgram, févr. 2025 |
| Jeu de benchmark de Deepgram Nova-3 | 2 703 fichiers, 81,69 heures, 9 domaines | Deepgram, févr. 2025 |
| Latence moyenne de Whisper-Streaming, anglais | 3,3 secondes | Machacek et al., 2023 |
| Whisper-Streaming en anglais : segment de 0,5 s contre segment de 2,0 s | 8,5% de WER à 3,27 s contre 8,0% de WER à 5,45 s | Machacek et al., 2023 |
| Latence de Whisper-Streaming, allemand / tchèque (segment de 0,5 s) | 4,11 s / 4,69 s | Machacek et al., 2023 |
Le plafond du temps réel est fixé par la conversation humaine. Dans 10 langues, l’écart moyen entre une question et sa réponse était de +208 ms, allant de +7 ms en japonais à +469 ms en danois (Stivers et al., PNAS 2009). Le lancement de GPT-4o par OpenAI a revendiqué des réponses audio en seulement 232 ms et 320 ms en moyenne, contre 2,8 secondes (GPT-3.5) et 5,4 secondes (GPT-4) pour l’ancien Voice Mode en pipeline, qui enchaînait des modèles distincts de transcription, de langage et de parole. La leçon pour le sous-titrage en direct est la même : chaque étape supplémentaire de la chaîne ajoute des secondes, et l’étape qui dominait autrefois, la reconnaissance elle-même, est désormais la plus petite.
| Métrique | Valeur | Source |
|---|---|---|
| Écart moyen entre question et réponse, 10 langues | +208 ms | Stivers et al., PNAS 2009 (données les plus récentes disponibles) |
| Moyenne de la langue la plus rapide / la plus lente | +7 ms (japonais) / +469 ms (danois) | Stivers et al., PNAS 2009 |
| Réponse audio de GPT-4o : minimum / moyenne | 232 ms / 320 ms | OpenAI, mai 2024 |
| Latence moyenne du Voice Mode en pipeline : GPT-3.5 / GPT-4 | 2,8 s / 5,4 s | OpenAI, mai 2024 |
| Retard des sous-titres ASR utilisé dans l’étude 2026 auprès des spectateurs | 2 secondes en moyenne | Thompson et al., arXiv 2609.11408 |
6. L’automatisation prend le contrôle de la chaîne de sous-titrage
La main-d’œuvre humaine derrière les sous-titres en direct est définie par des limites de vitesse. La référence américaine en temps réel, la certification NCRA Certified Realtime Reporter, exige un test en temps réel de cinq minutes à 200 mots par minute avec 96% de précision, et un rapport de l’EBU décrit le sous-titrage en direct comme le fait de suivre des locuteurs jusqu’à 200 mots par minute. Des spécialistes du réparlé britanniques ont indiqué aux chercheurs que la formation de base prend 2 à 3 mois, alors que gagner en assurance demande 1,5 à 2 ans (Moores, JoSTrans 33). Ces contraintes expliquent pourquoi le sous-titrage automatique a progressé aussi vite dès que la précision s’est rapprochée.
Le basculement des volumes est visible dans les dépôts des entreprises. Les sous-titres automatiques LEXI d’Ai-Media ont atteint 79,2 millions de minutes à l’exercice 2025, contre moins de 10 millions quatre ans plus tôt, soit un taux de croissance annuel composé de 69% sur quatre ans, et LEXI représente désormais l’essentiel de l’usage sur son réseau iCap (résultats FY25 d’Ai-Media, annonce ASX, 28 août 2025). Les produits technologiques représentaient 63% du chiffre d’affaires d’Ai-Media, contre zéro cinq ans plus tôt. Un test indépendant de ce même système a relevé une précision NER de 98,56% en anglais et de 98,26% en espagnol, équivalente à celle des sous-titres humains, sauf sur les contenus familiers avec plusieurs locuteurs (Romero-Fresco et Van Gauwbergen, Fit for What Purpose?, 2025). Pour en savoir plus sur le versant humain du métier, voir nos statistiques sur la précision de la transcription en salle d’audience.
| Métrique | Valeur | Source |
|---|---|---|
| Norme temps réel NCRA CRR | 200 mots par minute avec 96% de précision (test de 5 minutes) | NCRA |
| Formation de base du spécialiste du réparlé / délai pour gagner en assurance | 2 à 3 mois / 1,5 à 2 ans | Moores, JoSTrans 33 |
| Minutes de sous-titres automatiques LEXI d’Ai-Media, exercice 2025 | 79,2 millions | Résultats FY25 d’Ai-Media, ASX |
| Minutes LEXI quatre ans plus tôt | Moins de 10 millions (TCAC de 69% sur quatre ans) | Résultats FY25 d’Ai-Media, ASX |
| Part de la technologie dans le chiffre d’affaires d’Ai-Media | 63% (chiffre d’affaires total de 64,9 millions USD) | Résultats FY25 d’Ai-Media, ASX |
| Précision NER des sous-titres automatiques : anglais / espagnol | 98,56% / 98,26% | Romero-Fresco et Van Gauwbergen, 2025 |
| Sous-titres en direct analysés pour comparer sorties automatiques et humaines, Royaume-Uni/États-Unis/Canada 2018-2022 | Environ 17 000 | Romero-Fresco et Fresno, Linguistica Antverpiensia 22, 2023 |
Note de contexte : la plus vaste comparaison humain-machine à ce jour (Romero-Fresco et Fresno, Linguistica Antverpiensia, 2023) a constaté que les sous-titres automatiques non édités approchaient 98%, avec des faiblesses persistantes sur la ponctuation, les noms propres, les nombres et l’identification des locuteurs. Une latence moteur plus faible n’y change rien : un nom faux mais rapide reste un nom faux.
Résumé : la latence du sous-titrage en direct en chiffres
| Métrique | Valeur | Source |
|---|---|---|
| Latence moyenne des sous-titres en direct au Royaume-Uni, fin 2014 | 5,1 secondes | Troisième rapport de l’Ofcom, 2015 |
| Échantillons britanniques respectant la consigne de 3 s, deuxième campagne | 4 sur 72 | Deuxième rapport de l’Ofcom, 2014 |
| Plus long retard enregistré au Royaume-Uni | 21 secondes | Deuxième rapport de l’Ofcom, 2014 |
| Consigne actuelle de latence de l’Ofcom | Moyenne de 4,5 secondes ou moins | Lignes directrices de l’Ofcom sur les services d’accès |
| Limite numérique de latence de la FCC | Aucune | FCC 14-12, 2014 |
| Précision des sous-titres en direct en anglais exigée par le CRTC | NER 98 | CRTC 2019-308 |
| Retard des sous-titres des journaux américains en espagnol | 8,2 secondes en moyenne | Fresno, JoSTrans 42, 2024 |
| Sous-titres des journaux américains en espagnol avec plus de 10 secondes de retard | 20% | Fresno, JoSTrans 42, 2024 |
| Retard moyen sur des extraits de télévision américaine en direct | 8,46 secondes | Thompson et al., arXiv 2609.11408, 2026 |
| Note des sous-titres télévisés : retardés contre synchronisés | 3,66 contre 5,09 sur 7 | Thompson et al., 2026 |
| Précision des sous-titres en direct au Royaume-Uni, moyenne des quatre campagnes | 98,38% | Données de l’Ofcom d’après Moores, JoSTrans 33 |
| Précision des journaux nationaux américains en anglais | 98,8% | Fresno, 2024 |
| Précision des sous-titres automatiques, anglais | 98,56% | Romero-Fresco et Van Gauwbergen, 2025 |
| Adultes britanniques ayant déjà utilisé des sous-titres | Environ 7,6 millions | Ofcom, 2013 |
| Heures sous-titrées des chaînes PSB et grands services à la demande au Royaume-Uni, 2024 | 88% | Ofcom Access Services Report 2024 |
| Latence médiane en streaming d’AssemblyAI | 307 ms | AssemblyAI, juin 2025 |
| Latence moyenne de Whisper-Streaming | 3,3 secondes | Machacek et al., 2023 |
| Écart moyen humain entre les tours de parole | 208 ms | Stivers et al., PNAS 2009 |
| Minutes de sous-titres LEXI d’Ai-Media, exercice 2025 | 79,2 millions | Résultats FY25 d’Ai-Media |
| Sous-titrage du catalogue des services de streaming canadiens d’ici mai 2031 | 100% | CRTC 2026-98 |
Méthodologie et sources
Chaque chiffre ci-dessus a été retracé jusqu’au régulateur, au dépôt ou à l’article évalué par des pairs qui l’a produit. Plusieurs PDF de l’Ofcom n’ont pas pu être récupérés directement ; les chiffres britanniques proviennent donc de communiqués de presse de l’Ofcom (republiés sur Wired-Gov), de synthèses de régulateurs (EPRA) et de l’analyse évaluée par des pairs du jeu de données de l’Ofcom (Moores), chacun étant nommé dans le texte. Les benchmarks d’éditeurs sont signalés comme des données d’éditeurs. Pour les données générales sur le marché et l’usage du sous-titrage, voir nos statistiques sur les sous-titres.
- Ofcom : communiqué sur le troisième rapport de sous-titrage en direct (Wired-Gov, mai 2015), communiqué sur la consultation relative au sous-titrage en direct (Wired-Gov, mai 2013), Guidelines on Providing Television and On-Demand Access Services, Access Services Report janv.-déc. 2024, consultation sur le Tier 1 Accessibility Code (mai 2026)
- EPRA : synthèse du premier rapport de l’Ofcom sur le sous-titrage en direct (avril 2014)
- Limping Chicken : article sur le deuxième rapport de l’Ofcom sur le sous-titrage en direct (novembre 2014)
- Liam O’Dell : article sur la consultation 2023 de l’Ofcom sur le code d’accès et consultation sur le code Tier 1
- FCC : normes de qualité des sous-titres, FCC 14-12 (2014) et 47 CFR 79.1
- CRTC : Broadcasting Regulatory Policy 2019-308 et Broadcasting Regulatory Policy 2026-98
- ACMA / gouvernement australien : Broadcasting Services (Television Captioning) Standard 2023
- EBU : rapport sur les services d’accès et le sous-titrage en direct (i044) et Tech 3370, EBU-TT Part 3 Live Subtitling
- Thompson, Kushalnagar, Vogler et al. : Are Caption Metrics Broken?, arXiv 2609.11408 (septembre 2026) ; Glasser, Kushalnagar et Vogler : How Users Experience Closed Captions on Live Television, CHI 2024
- Fresno : Closed Captions en espanol, JoSTrans 42 (2024) et Live captioning accuracy in English-language newscasts in the USA (2024)
- Moores : le sous-titrage en direct lors d’événements en direct, JoSTrans 33 (inclut l’analyse du jeu de données de l’Ofcom)
- Romero-Fresco et Fresno : The accuracy of automatic and human live captions in English (2023) ; Romero-Fresco et Van Gauwbergen : Fit for What Purpose? (2025) ; Romero-Fresco et Martinez : le modèle NER (2015)
- Machacek, Dabre et Bojar : Turning Whisper into Real-Time Transcription System (2023)
- AssemblyAI : Introducing Universal-Streaming (juin 2025) ; Deepgram : Introducing Nova-3 (février 2025)
- OpenAI : Hello GPT-4o (mai 2024)
- Stivers et al. : Universals and cultural variation in turn-taking in conversation, PNAS (2009)
- Ai-Media : résultats FY25, annonce ASX (août 2025)
- NCRA : Certified Realtime Reporter
- OMS : fiche d’information Deafness and hearing loss (mise à jour en mars 2026)
- Note sur les données : les mesures de latence par diffuseur de l’Ofcom (2013-2015) ont plus de trois ans et restent le jeu de données public le plus récent de ce type ; les campagnes publient un mélange de médianes et de moyennes (5,6, 5,8, de 5,7 à 5,1, et une moyenne sur quatre campagnes de 5,3 d’après Moores), il faut donc les traiter comme une fourchette plutôt que comme une courbe de tendance. L’estimation de l’Ofcom du nombre d’utilisateurs de sous-titres (7,6 millions) date de 2013 et les données de Stivers sur la prise de parole de 2009. Les chiffres d’AssemblyAI et de Deepgram sont des benchmarks d’éditeurs ; la comparaison d’AssemblyAI a mesuré un concurrent sur son propre jeu de test, et des tests indépendants de Nova-3 rapportent un WER supérieur au chiffre de Deepgram. L’article de Thompson et al. de 2026 est un preprint arXiv, pas encore évalué par des pairs. Le chiffre d’affaires d’Ai-Media est présenté tel que publié dans son communiqué ASX. Deux évaluations indépendantes du même système automatique donnent des précisions affichées différentes selon la difficulté du contenu, et l’étude de 2026 auprès des spectateurs a trouvé des taux de réussite NER bien plus faibles sur des extraits de télévision en direct ; la précision automatique dépend donc fortement du genre. Le code Tier 1 de l’Ofcom est un projet dont la consultation s’est clôturée le 7 août 2026, et une déclaration finale est attendue.
Dernière mise à jour : 3 octobre 2026. Nous actualisons ce tour d’horizon chaque trimestre, et la prochaine révision est attendue lorsque l’Ofcom publiera sa déclaration finale sur le Tier 1 Accessibility Code ainsi que son Access Services Report pour la période de janvier à décembre 2025.