영국 TV의 라이브 자막은 Ofcom의 측정 라운드 전반에서 평균적으로 발화보다 5.1~5.8초 늦었고, 두 번째 라운드에서는 72개 표본 중 4개만이 기존의 3초 가이드라인을 충족했다 (Ofcom, 라이브 자막 품질 보고서 2014~2015년). 이 문제는 사라지지 않았다. 2024년 미국 스페인어 뉴스 방송 연구에서는 평균 지연이 8.2초, 개별 캡션은 최대 41초까지 늦었고 (Fresno, JoSTrans 2024), 2026년 9월의 연구에서는 미국 라이브 TV 클립에서 평균 8.46초가 측정되었다. 한편 스트리밍 음성 인식 엔진은 이제 단어 지연 중앙값이 300밀리초 안팎이라고 보고하고 있어 (AssemblyAI, 2025년 6월), 라이브 캡션의 병목은 사람 속기사에서 방송 전송 체인으로 옮겨 가고 있다. 우리는 Ofcom, FCC, CRTC, Gallaudet 대학교와 비고 대학교의 동료 평가 연구, arXiv 벤치마크 논문, Ai-Media의 ASX 공시, WHO, 그리고 방법론에 나열한 기타 1차 자료의 데이터를 종합했다. 더 넓은 그림은 저희 라이브 캡션 통계 정리를 참고하세요.
요약
- 영국 라이브 자막의 평균 지연은 2014년 4
5월에서 1011월 사이에 5.7초에서 5.1초로 줄었지만, 여전히 3초 가이드라인을 크게 웃돌았다 (Ofcom, 세 번째 라이브 자막 보고서, 2015년). - 두 번째 라운드에서 3초 가이드라인을 충족한 영국 표본은 72개 중 4개뿐이었고, 가장 긴 지연은 21초에 달했다 (Ofcom, 두 번째 보고서, 2014년).
- Ofcom은 현재 라이브 프로그램 전반에서 평균 지연을 4.5초 이하로 요구한다 (Ofcom, TV 및 주문형 접근성 서비스 제공 가이드라인).
- 미국 스페인어 뉴스 방송의 캡션 지연은 평균 8.2초였고, 캡션의 20%가 10초 넘게 늦게 도착했다 (Fresno, JoSTrans 42, 2024년).
- 원래 방송 지연(평균 8.46초)이 있는 TV 캡션은 3.66/7로 평가되었고, 동기화하면 5.09/7이었다 (Thompson 외, arXiv 2609.11408, 2026년).
- 영국 라이브 자막은 Ofcom의 네 차례 라운드 전체에서 평균 NER 정확도 98.38%로, 98% 기준선을 웃돌았다 (Moores를 통한 Ofcom 데이터, JoSTrans 33).
- 미국 영어 전국 뉴스 방송은 평균 NER 정확도 98.8%였다 (Fresno, Universal Access in the Information Society, 2024년).
- 한 자동 캡션 시스템은 NER에서 영어 98.56%, 스페인어 98.26%를 기록했다 (Romero-Fresco와 Van Gauwbergen, 2025년).
- AssemblyAI는 스트리밍 지연 중앙값 307 ms를 보고했고, Deepgram Nova-3는 516 ms였다 (AssemblyAI, 2025년 6월).
- Whisper-Streaming은 긴 영어 음성에서 평균 지연 3.3초에 도달했다 (Machacek, Dabre, Bojar, IJCNLP-AACL 2023).
- 사람은 10개 언어에 걸쳐 평균 208 ms 안에 질문에 답한다 (Stivers 외, PNAS 2009). 실시간 시스템이 쫓고 있는 기준이다.
- Ai-Media의 자동 캡션 LEXI는 2025 회계연도에 7,920만 분에 도달했으며, 4년 전의 1,000만 분 미만에서 늘어난 수치다 (Ai-Media 2025 회계연도 실적, ASX).
1. 측정된 지연: 라이브 자막은 발화에 얼마나 뒤처지는가
라이브 자막 지연에 관한 가장 완전한 공개 데이터셋은 여전히 영국의 것이며, 일관된 이야기를 들려준다. 전형적인 라이브 자막은 말이 나온 뒤 5초 넘게 지나서 나타난다. Ofcom은 2013년부터 2015년까지 네 차례 라운드에 걸쳐 BBC, ITV, Channel 4, Channel 5, Sky의 뉴스, 엔터테인먼트, 토크쇼를 표본으로 삼았다. 첫 번째 보고서는 지연 중앙값을 5.6초로 확인했고 (EPRA의 Ofcom 첫 번째 보고서 요약, 2014년 4월), 두 번째 보고서는 5.8초에 72개 표본 중 4개만이 3초 가이드라인 안에 들었다고 확인했다 (Limping Chicken의 Ofcom 두 번째 보고서 기사, 2014년 11월).
그 후의 개선은 실재했지만 작았다. Ofcom의 세 번째 보고서는 2014년 45월에서 1011월 사이 평균 지연이 0.6초, 즉 5.7초에서 5.1초로 줄었다고 기록했다 (Wired-Gov에 실린 Ofcom 보도자료, 2015년 5월). 5초 지연에서 0.5초를 줄이려면 소프트웨어만이 아니라 방송사의 작업 흐름을 바꿔야 했고, 그래서 수치가 정체되었다. 이는 입수 가능한 가장 최근의 Ofcom 지연 측정(2014~2015년)이며, 방송사별 더 새로운 데이터셋은 공개되지 않았다.
| 지표 | 값 | 출처 |
|---|---|---|
| 영국 라이브 자막 지연 중앙값, 첫 번째 라운드 | 5.6초 | Ofcom 첫 번째 라이브 자막 보고서, 2014년 4월 |
| 영국 지연, 두 번째 라운드 | 5.8초 | Ofcom 두 번째 보고서, 2014년 11월 |
| 3초 가이드라인을 충족한 표본, 두 번째 라운드 | 72개 중 4개 | Ofcom 두 번째 보고서, 2014년 |
| 기록된 가장 긴 지연, 두 번째 라운드 | 21초 | Ofcom 두 번째 보고서, 2014년 |
| 영국 평균 지연, 2014년 4 | 5.7초에서 5.1초 (-0.6초) | Ofcom 세 번째 보고서, 2015년 5월 |
| 네 차례 라운드 전체의 영국 평균 지연 | 5.3초 | Moores를 통한 Ofcom 데이터, JoSTrans 33 |
| 사전 제작 자막을 라이브처럼 송출하지 않은 경우의 지연 | 7-8초 | Moores를 통한 Ofcom 데이터, JoSTrans 33 |
참고: 라운드별 수치는 보고된 그대로 중앙값과 평균이 섞여 있으므로, 라운드 간의 작은 차이(5.6, 5.7, 5.8)를 지나치게 해석해서는 안 된다. 사전 제작되어 송출되는 자막이 없는 프로그램의 7-8초라는 수치는, 영국의 평균이 실시간 받아쓰기보다 대본에 얼마나 의존하는지를 보여준다.
영국 밖에서는 지연이 더 길다. Telemundo와 Univision의 미국 스페인어 뉴스 방송 캡션은 발화보다 평균 8.2초 늦었고, 범위는 0.7초에서 41초에 이르렀으며, 캡션의 46%가 8초 넘게 늦었다 (Fresno, Closed Captions en espanol, JoSTrans 42, 2024년). 미국 라이브 TV 클립을 대상으로 한 2026년 연구는 평균 지연 8.46초(표준편차 3.62)를 측정했고, 7-12초를 TV 캡션의 전형적인 수치로 설명했다 (Thompson 외, arXiv 2609.11408).
| 지표 | 값 | 출처 |
|---|---|---|
| 미국 스페인어 뉴스 방송의 평균 캡션 지연 | 8.2초 | Fresno, JoSTrans 42, 2024년 |
| 같은 표본의 지연 범위 | 0.7~41초 | Fresno, JoSTrans 42, 2024년 |
| 8 / 10 / 12초 넘게 늦은 캡션 | 46% / 20% / 8% | Fresno, JoSTrans 42, 2024년 |
| 해당 연구에서 분석한 캡션 | 5,349개 (10분 분량 구간 20개) | Fresno, JoSTrans 42, 2024년 |
| 미국 라이브 TV 클립의 평균 지연 | 8.46초 (표준편차 3.62) | Thompson 외, arXiv 2609.11408, 2026년 9월 |
| 인용된 미국 TV 캡션의 전형적인 지연 | 7-12초 | Thompson 외, arXiv 2609.11408, 2026년 9월 |
| 리스피킹을 사용한 라이브(비방송) 행사의 평균 지연 | 5.8초 (범위 4.3-7.5초) | Moores, JoSTrans 33 |
2. 규제 목표: 3초에서 4.5초로
규제 당국은 지연이 중요하다는 데 동의하지만, 숫자를 제시하는 곳은 거의 없다. Ofcom은 이 정리에서 지연에 수치 목표를 둔 유일한 주요 규제 당국이며, 그 목표를 더 느슨한 방향으로 옮겼다. TV 접근성 서비스 규범의 최대 지연 3초에서, 사업자의 라이브 프로그램 전반에서 평균 4.5초 이하로 바꾼 것이다. 2023년 의견 수렴 과정에서 Ofcom은 방송사들이 최대 3초를 비현실적이라고 말했으며 4.5초가 개별 방송사가 달성한 최선의 지연에 해당한다고 밝혔다 (TV 및 주문형 접근성 서비스 제공에 관한 Ofcom 가이드라인).
미국의 접근 방식은 정성적이다. FCC는 2014년 2월 20일에 정확성, 동기성, 완전성, 배치를 다루는 캡션 품질 기준을 채택했고, 라이브 캡션의 지연은 ‘말하는 내용을 정확하게 제시하는 것과 양립하는 범위에서 최소한으로 유지되어야 한다’고만 밝혔다 (FCC, 캡션 품질 기준). 캐나다는 시간이 아니라 정확도를 규제한다. CRTC의 방송 규제 정책 2019-308은 영어 라이브 캡션이 NER 모델에서 98점을 받을 것을 요구한다. 실질적인 효과는, 10초 늦게 도착한 캡션도 세계 대부분의 지역에서 완전히 규정을 준수할 수 있다는 것이다.
| 지표 | 값 | 출처 |
|---|---|---|
| Ofcom의 기존 가이드라인 | 최대 지연 3초 | Ofcom TV 접근성 서비스 규범 |
| Ofcom의 현행 가이드라인 | 라이브 프로그램 전반에서 평균 4.5초 이하 | Ofcom TV 및 주문형 접근성 서비스 제공 가이드라인 |
| Ofcom의 기존 자막 속도 지침: 사전 녹화 / 라이브 | 160-180 wpm / 200 wpm | Ofcom 2023년 의견 수렴, Liam O’Dell 보도 |
| FCC의 수치 지연 한도 | 없음 (지연은 ‘최소한으로 유지’) | FCC 14-12, 2014년 2월 20일 채택 |
| 라이브 프로그램에서 텔레프롬프터만 사용하는 ENT 캡션에 대한 FCC의 금지 | 4대 주요 네트워크와 상위 25개 시장의 제휴사 | FCC 14-12 |
| 면제되지 않는 신규 프로그램에 대한 FCC의 캡션 의무 | 2006년 1월 1일부터 100% | 47 CFR 79.1 |
| CRTC의 영어 라이브 캡션 정확도 요건 | NER 점수 98, 2019년 9월 1일부터 | CRTC 2019-308 |
| CRTC의 모니터링 의무 | 월 2개 라이브 프로그램 (뉴스 1개 포함) | CRTC 2019-308 |
참고: 호주의 ACMA 역시 2023년 10월 1일부터 시행 중인 방송 서비스(텔레비전 캡션) 기준 2023에서 수치 지연을 정하지 않으며, 가독성, 정확성, 이해 가능성을 사례별로 평가한다.
가장 최근의 규칙은 지연을 조이는 대신 스트리밍으로 의무를 넓힌다. 캐나다 CRTC 2026-98은 온라인 스트리밍 사업자에게 2030년 5월까지 카탈로그의 80%, 2031년 5월까지 100%에 캡션을 달도록 요구하며, 새로운 오리지널 라이브 및 사전 녹화 프로그램에는 1년 이내에 캡션을 달도록 한다 (CRTC 2026-98, 2026년 5월 25일). 2026년 5월 14일에 공개된 Ofcom의 Tier 1 접근성 규범 초안은 가장 큰 스트리밍 사업자에게 공개 4년 후 자막 80% 할당량을 두자고 제안한다 (Ofcom, Tier 1 접근성 규범 의견 수렴).
| 지표 | 값 | 출처 |
|---|---|---|
| 캐나다 스트리밍 사업자의 카탈로그 캡션 | 2030년 5월까지 80%, 2031년 5월까지 100% | CRTC 2026-98 |
| 스트리밍 사업자의 사전 녹화 오리지널 프로그램에 대한 캐나다의 정확도 요건 | 100% | CRTC 2026-98 |
| Ofcom Tier 1 자막 할당량, 4년 차 / 1년 차 | 80% / 20% | Ofcom Tier 1 접근성 규범 초안, 2026년 5월 |
| BBC 주문형 자막 할당량, 4년 차 | 90% | Ofcom Tier 1 접근성 규범 초안, 2026년 5월 |
| Tier 1 기준 | 영국 월평균 이용자 500,000명 이상 | Ofcom Tier 1 접근성 규범 초안, 2026년 5월 |
3. 정확도: 98% NER 기준선과 그것을 넘는 곳
지연과 정확도는 서로 맞바꾸는 관계이므로, 지연 수치는 정확도 수치와 함께 놓아야 의미가 있다. 흔히 쓰이는 척도는 NER 모델로, 라이브 자막을 (단어 수에서 편집 오류와 인식 오류를 뺀 값) ÷ 단어 수로 채점한다. 98%는 ‘허용’, 98.5-98.99%는 ‘양호’, 99-99.49%는 ‘매우 양호’, 99.5% 초과는 ‘우수’이다 (Romero-Fresco와 Martinez, NER 모델, 2015년). 이 기준선은 너그러워 보이지만, 풀어서 보면 달라진다. 98%에서는 100단어 중 2단어가 틀렸거나, 빠졌거나, 가중 오류다.
영국 방송사들은 평균적으로 이 기준을 넘었다. Ofcom의 네 차례 라운드 전체에서 98.38%, 마지막 라운드에서 98.55%였으며, 자막 78,000개와 단어 546,000개를 대상으로 측정되었다 (Moores, JoSTrans 33). 하지만 평균은 꼬리를 감춘다. 2014년 1011월에 영국 프로그램의 77%가 98% 이상에 도달했고, 2014년 45월의 74%에서 올랐으며, 뉴스가 98.75%로 가장 정확한 장르였다 (Ofcom 세 번째 보고서, 2015년). 미국 영어 전국 뉴스 방송은 더 좋아서 평균 98.8%였고 20개 표본 중 14개가 허용 이상으로 평가되었지만, 스페인어 뉴스 방송은 97.04%로 떨어졌다 (Fresno, 2024년).
| 지표 | 값 | 출처 |
|---|---|---|
| NER 허용 / 우수 기준선 | 98% / 99.5% 초과 | Romero-Fresco와 Martinez, 2015년 |
| 영국 라이브 자막 정확도, 네 차례 라운드 평균 | 98.38% | Moores를 통한 Ofcom 데이터, JoSTrans 33 |
| 영국 라이브 자막 정확도, 마지막 라운드 | 98.55% | Moores를 통한 Ofcom 데이터, JoSTrans 33 |
| 98% 이상인 영국 프로그램, 2014년 10 | 77% (74%) | Ofcom 세 번째 보고서, 2015년 |
| 영국 뉴스 장르 정확도 | 98.75% | Ofcom 세 번째 보고서, 2015년 |
| 미국 영어 전국 뉴스 방송, 평균 NER | 98.8% (20개 표본 중 14개가 허용 이상) | Fresno, Universal Access in the Information Society, 2024년 |
| 미국 스페인어 뉴스 방송, 평균 NER | 97.04% (Telemundo 97.00%, Univision 97.10%) | Fresno, JoSTrans 42, 2024년 |
| 텍스트 축약: 스페인어 대 영어 뉴스 방송 | 26% 대 5-6% | Fresno, JoSTrans 42, 2024년 |
참고: 속도는 숨겨진 세 번째 변수다. Ofcom은 자막의 평균을 분당 180단어 미만으로 권고하지만, 분석한 거의 모든 프로그램에 분당 200단어를 넘는 짧은 구간이 있었고, 그 구간을 오류로 계산하면 프로그램의 68%가 98% 아래로 떨어졌다 (Ofcom 세 번째 보고서, 2015년). 미국 영어 뉴스 방송 연구에서는 오류의 거의 3분의 2가 경미한 것으로 나타났다.
4. 지연이 시청자에게 치르게 하는 대가
라이브 자막의 이용자는 청각장애인 공동체만보다 훨씬 많다. Ofcom은 영국 성인 약 760만 명이 자막을 이용한 적이 있으며, 그중 청각 장애가 있는 사람은 140만 명뿐이라고 추산했다 (Wired-Gov에 실린 Ofcom 보도자료, 2013년 5월). 이는 청각 장애가 없는 자막 이용자가 600만 명이 넘는다는 뜻이며 (760만 명에서 140만 명을 뺀 값), 그중 상당수는 시끄러운 방에서 또는 소리를 낮춘 채 시청한다. Ofcom의 가이드라인은 18-24세의 61%가 자막을 켜 두는 것을 선호한다는 YouGov 데이터도 인용한다. 전 세계적으로는 WHO 추산에 따르면 장애를 동반한 난청으로 재활이 필요한 사람이 현재 4억 3천만 명이며, 2050년까지 7억 명을 넘을 전망이다.
| 지표 | 값 | 출처 |
|---|---|---|
| 자막을 이용한 적이 있는 영국 성인 | 약 760만 명 (범위 700만-810만 명) | Ofcom, 2013년 5월 |
| 그중 청각 장애가 있는 사람 | 약 140만 명 (범위 120만-160만 명) | Ofcom, 2013년 5월 |
| 자막을 켜 두는 것을 선호하는 영국 18-24세 | 61% | YouGov, Ofcom 접근성 서비스 가이드라인에서 인용 |
| 자막이 있는 영국 공영방송 및 더 큰 주문형 프로그램 시간의 비율, 2024년 | 88% | Ofcom 접근성 서비스 보고서, 2024년 1~12월 (2025년 5월 19일 공개) |
| 의무 채널의 영국 자막 방송 시간, 2005년 대 2013년 | 40.5% 대 81.9% | Ofcom 첫 번째 라이브 자막 보고서, 2014년 |
| 장애를 동반한 난청으로 재활이 필요한 사람 | 4억 3천만 명 | WHO 팩트시트, 2026년 3월 갱신 |
| 2050년까지 어느 정도 난청이 있을 것으로 전망되는 사람 | 약 25억 명 | WHO 팩트시트, 2026년 3월 갱신 |
시청자가 가장 먼저 알아채는 것은 지연이다. 최근 가장 큰 사용자 연구는 청각장애인과 난청 시청자 216명에게 네 가지 조건에서 라이브 TV 클립 70개를 평가하게 했고, 평가 4,832건을 얻었다. 같은 TV 캡션이 원래 방송 지연에서는 7점 만점에 3.66점, 동기화하면 5.09점을 받았고, 이는 동기화된 TV 캡션과 ASR 캡션 사이의 차이보다 훨씬 큰 폭이었다 (Thompson 외, Are Caption Metrics Broken?, arXiv 2609.11408, 2026년 9월). 2초 지연의 ASR 캡션은 동기화 시 5.20 대비 4.81로 훨씬 잘 버텼다.
같은 연구는 정확도 점수가 품질을 포착한다는 생각도 흔든다. NER 98 기준에 도달한 것은 TV 클립 70개 중 11개와 ASR 클립 70개 중 4개뿐이었지만, 시청자는 동기화된 ASR 캡션과 TV 캡션을 거의 같게 평가했고, 지표와 평가 사이의 상관은 ASR 출력에서 크게 떨어졌다 (WER r = -0.390, TV 캡션은 -0.687). Gallaudet의 이전 CHI 2024 연구도 비슷한 결론에 이르렀다. 참가자들은 방송 지연을 몹시 싫어했고, 표준 정확도 지표는 시청자가 캡션을 평가하는 방식과 약하게만 상관되었다.
| 지표 | 값 | 출처 |
|---|---|---|
| 참가자 / 평가 / 클립 | 216 / 4,832 / 70 | Thompson 외, arXiv 2609.11408, 2026년 |
| TV 캡션 평가: 원래 지연 대 동기화 (7점 척도) | 3.66 대 5.09 | Thompson 외, 2026년 |
| ASR 캡션 평가: 2초 지연 대 동기화 | 4.81 대 5.20 | Thompson 외, 2026년 |
| 평균 WER: TV 캡션 대 ASR 캡션 | 33.8% 대 17.2% | Thompson 외, 2026년 |
| 평균 NER: TV 캡션 대 ASR 캡션 | 95.28 대 94.34 | Thompson 외, 2026년 |
| NER 98을 충족한 클립: TV 대 ASR | 70개 중 11개 대 70개 중 4개 | Thompson 외, 2026년 |
| WER과 시청자 평가의 상관: TV 대 ASR | r = -0.687 대 -0.390 | Thompson 외, 2026년 |
참고: TV의 WER이 높은 것은 일부 방송 캡션이 의역하고 압축하기 때문이며, WER은 이를 감점하지만 NER은 그렇지 않다. 이 차이야말로 저자들이 현재의 지표가 기술 중립적이지 않다고 주장하는 이유다.
5. ASR 엔진 속도: 스트리밍 지연 대 사람의 대화
엔진 지연은 더 이상 자막 지연의 주된 원인이 아니다. AssemblyAI는 Universal-Streaming의 스트리밍 지연 중앙값이 307 ms, Deepgram Nova-3가 516 ms이고, P99는 각각 1,012 ms와 1,907 ms라고 보고했다. 이는 205시간 이상의 오디오에서 단어가 끝나는 시점부터 부분 받아쓰기에 처음 나타나기까지를 측정한 값이다 (AssemblyAI, Introducing Universal-Streaming, 2025년 6월 2일). Deepgram 자체의 출시 데이터는 Nova-3의 스트리밍 단어 오류율 중앙값을 6.84%로, 테스트한 경쟁 제품은 14.92%로 제시했다 (Deepgram, Introducing Nova-3, 2025년 2월). 둘 다 벤더 벤치마크이므로 최상의 경우로 읽어야 한다. 저희 음성-텍스트 변환 통계는 더 많은 엔진의 정확도를 다룬다.
오픈 모델은 안정성을 위해 더 많은 지연을 감수한다. 학술 시스템인 Whisper-Streaming은 유럽 의회 ESIC 테스트 세트의 긴 영어 음성에서 평균 지연 3.3초에 도달했으며, 그 절충은 결과에 명시되어 있다. 영어 WER은 0.5초 청크에서 지연 3.27초일 때 8.5%, 2초 청크에서 5.45초일 때 8.0%였다 (Machacek, Dabre, Bojar, arXiv 2307.14743, IJCNLP-AACL 2023). 5초 지연의 Whisper 구성이 10년 전 영국 방송 평균과 정확히 겹친다는 점에 주목할 만하다.
| 지표 | 값 | 출처 |
|---|---|---|
| AssemblyAI Universal-Streaming 지연 중앙값 / P99 | 307 ms / 1,012 ms | AssemblyAI, 2025년 6월 |
| Deepgram Nova-3 지연 중앙값 / P99 (AssemblyAI 테스트) | 516 ms / 1,907 ms | AssemblyAI, 2025년 6월 |
| Deepgram Nova-3 WER 중앙값: 스트리밍 / 배치 | 6.84% / 5.26% | Deepgram, 2025년 2월 |
| Deepgram Nova-3 벤치마크 세트 | 파일 2,703개, 81.69시간, 9개 도메인 | Deepgram, 2025년 2월 |
| Whisper-Streaming 평균 지연, 영어 | 3.3초 | Machacek 외, 2023년 |
| Whisper-Streaming 영어: 0.5초 청크 대 2.0초 청크 | 3.27초에서 WER 8.5% 대 5.45초에서 WER 8.0% | Machacek 외, 2023년 |
| Whisper-Streaming 지연, 독일어 / 체코어 (0.5초 청크) | 4.11초 / 4.69초 | Machacek 외, 2023년 |
실시간의 상한선은 사람의 대화가 정한다. 10개 언어에 걸쳐 질문과 답변 사이 간격의 평균은 +208 ms였고, 일본어의 +7 ms에서 덴마크어의 +469 ms까지 범위가 있었다 (Stivers 외, PNAS 2009). OpenAI의 GPT-4o 출시는 음성 응답이 최소 232 ms, 평균 320 ms라고 주장했고, 받아쓰기, 언어, 음성 모델을 따로 연결했던 이전 파이프라인 방식 음성 모드의 2.8초 (GPT-3.5)와 5.4초 (GPT-4)와 대비했다. 라이브 자막에 주는 교훈도 같다. 체인에 단계가 하나 늘 때마다 몇 초가 더해지며, 한때 지배적이었던 단계인 인식 자체가 이제는 가장 작은 단계가 되었다.
| 지표 | 값 | 출처 |
|---|---|---|
| 질문에서 답변까지의 평균 간격, 10개 언어 | +208 ms | Stivers 외, PNAS 2009 (입수 가능한 가장 최근 데이터) |
| 가장 빠른 / 가장 느린 언어의 평균 | +7 ms (일본어) / +469 ms (덴마크어) | Stivers 외, PNAS 2009 |
| GPT-4o 음성 응답: 최소 / 평균 | 232 ms / 320 ms | OpenAI, 2024년 5월 |
| 파이프라인 방식 음성 모드 평균 지연: GPT-3.5 / GPT-4 | 2.8초 / 5.4초 | OpenAI, 2024년 5월 |
| 2026년 시청자 연구에서 사용한 ASR 캡션 지연 | 평균 2초 | Thompson 외, arXiv 2609.11408 |
6. 자동화가 캡션 체인을 장악한다
라이브 자막 뒤의 인력은 속도의 한계로 규정된다. 미국의 실시간 기준인 NCRA Certified Realtime Reporter는 **분당 200단어, 정확도 96%**로 5분간의 실시간 시험을 요구하며, EBU 보고서는 라이브 자막을 분당 최대 200단어의 화자를 따라가는 일로 설명한다. 영국의 리스피커들은 연구자들에게 기본 훈련에 2-3개월이 걸리고 자신감이 붙기까지는 1.5-2년이 걸린다고 말했다 (Moores, JoSTrans 33). 이러한 제약 때문에 정확도가 가까워지자 자동 캡션이 그토록 빠르게 확산되었다.
물량의 변화는 기업 공시에서 드러난다. Ai-Media의 자동 캡션 LEXI는 2025 회계연도에 7,920만 분에 도달했고, 4년 전의 1,000만 분 미만에서 4년간 연평균 성장률(CAGR) 69%로 늘어났으며, LEXI는 이제 iCap 네트워크 전체 이용의 대부분을 차지한다 (Ai-Media 2025 회계연도 실적, ASX 공시, 2025년 8월 28일). 기술 제품은 Ai-Media 매출의 63%를 차지했는데, 5년 전에는 0이었다. 같은 시스템에 대한 독립 테스트에서는 NER 정확도가 영어 98.56%, 스페인어 98.26%로 나와, 여러 화자가 나오는 구어체 콘텐츠를 제외하면 사람의 캡션에 필적했다 (Romero-Fresco와 Van Gauwbergen, Fit for What Purpose?, 2025년). 이 직업의 사람 쪽 이야기는 저희 법정 속기 정확도 통계를 참고하세요.
| 지표 | 값 | 출처 |
|---|---|---|
| NCRA CRR 실시간 기준 | 정확도 96%에서 200 wpm (5분 시험) | NCRA |
| 리스피커 기본 훈련 / 자신감이 붙기까지의 기간 | 2-3개월 / 1.5-2년 | Moores, JoSTrans 33 |
| Ai-Media LEXI 자동 캡션 분량, 2025 회계연도 | 7,920만 분 | Ai-Media 2025 회계연도 실적, ASX |
| 4년 전 LEXI 분량 | 1,000만 분 미만 (4년간 CAGR 69%) | Ai-Media 2025 회계연도 실적, ASX |
| Ai-Media 매출에서 기술이 차지하는 비중 | 63% (총매출 6,490만 달러) | Ai-Media 2025 회계연도 실적, ASX |
| 자동 캡션 NER 정확도: 영어 / 스페인어 | 98.56% / 98.26% | Romero-Fresco와 Van Gauwbergen, 2025년 |
| 자동 출력과 사람 출력 비교를 위해 분석한 라이브 캡션, 영국/미국/캐나다 2018-2022년 | 약 17,000개 | Romero-Fresco와 Fresno, Linguistica Antverpiensia 22, 2023년 |
참고: 지금까지 가장 큰 사람 대 기계 비교 (Romero-Fresco와 Fresno, Linguistica Antverpiensia, 2023년)에서는 편집되지 않은 자동 캡션이 98%에 근접했지만, 문장부호, 고유명사, 숫자, 화자 식별에서는 약점이 지속되었다. 엔진 지연이 낮아져도 이것들은 해결되지 않는다. 빠르게 나온 잘못된 이름은 여전히 잘못된 이름이다.
숫자로 보는 라이브 실시간 자막 지연
| 지표 | 값 | 출처 |
|---|---|---|
| 영국 라이브 자막 평균 지연, 2014년 후반 | 5.1초 | Ofcom 세 번째 보고서, 2015년 |
| 3초 가이드라인을 충족한 영국 표본, 두 번째 라운드 | 72개 중 4개 | Ofcom 두 번째 보고서, 2014년 |
| 기록된 영국의 가장 긴 지연 | 21초 | Ofcom 두 번째 보고서, 2014년 |
| Ofcom의 현행 지연 가이드라인 | 평균 4.5초 이하 | Ofcom 접근성 서비스 가이드라인 |
| FCC의 수치 지연 한도 | 없음 | FCC 14-12, 2014년 |
| CRTC의 영어 라이브 캡션 정확도 | NER 98 | CRTC 2019-308 |
| 미국 스페인어 뉴스 방송 캡션 지연 | 평균 8.2초 | Fresno, JoSTrans 42, 2024년 |
| 10초 넘게 늦은 미국 스페인어 뉴스 방송 캡션 | 20% | Fresno, JoSTrans 42, 2024년 |
| 미국 라이브 TV 클립의 평균 지연 | 8.46초 | Thompson 외, arXiv 2609.11408, 2026년 |
| TV 캡션 평가: 지연 대 동기화 | 7점 만점에 3.66 대 5.09 | Thompson 외, 2026년 |
| 영국 라이브 자막 정확도, 네 차례 라운드 평균 | 98.38% | Moores를 통한 Ofcom 데이터, JoSTrans 33 |
| 미국 영어 전국 뉴스 방송 정확도 | 98.8% | Fresno, 2024년 |
| 자동 캡션 정확도, 영어 | 98.56% | Romero-Fresco와 Van Gauwbergen, 2025년 |
| 자막을 이용한 적이 있는 영국 성인 | 약 760만 명 | Ofcom, 2013년 |
| 자막이 있는 영국 공영방송 및 더 큰 주문형 시간, 2024년 | 88% | Ofcom 접근성 서비스 보고서 2024 |
| AssemblyAI 스트리밍 지연 중앙값 | 307 ms | AssemblyAI, 2025년 6월 |
| Whisper-Streaming 평균 지연 | 3.3초 | Machacek 외, 2023년 |
| 사람의 평균 발화 교대 간격 | 208 ms | Stivers 외, PNAS 2009 |
| Ai-Media LEXI 캡션 분량, 2025 회계연도 | 7,920만 분 | Ai-Media 2025 회계연도 실적 |
| 2031년 5월까지 캐나다 스트리밍 사업자의 카탈로그 캡션 | 100% | CRTC 2026-98 |
방법론과 출처
위의 모든 수치는 그것을 산출한 규제 당국, 공시, 또는 동료 평가 논문까지 추적해 확인했다. Ofcom의 PDF 여러 건은 직접 확보할 수 없었으므로, 영국 수치는 Ofcom 보도자료(Wired-Gov에 재게재), 규제 기관 요약(EPRA), Ofcom 데이터셋에 대한 동료 평가 분석(Moores)에서 가져왔으며, 각각 본문에 명시했다. 벤더 벤치마크는 벤더 데이터로 표기했다. 캡션과 자막의 시장 및 이용에 관한 일반 데이터는 저희 캡션과 자막 통계를 참고하세요.
- Ofcom: 세 번째 라이브 자막 보고서 보도자료 (Wired-Gov, 2015년 5월), 라이브 자막 의견 수렴 보도자료 (Wired-Gov, 2013년 5월), TV 및 주문형 접근성 서비스 제공 가이드라인, 접근성 서비스 보고서 2024년 1~12월, Tier 1 접근성 규범 의견 수렴 (2026년 5월)
- EPRA: Ofcom 첫 번째 라이브 자막 보고서 요약 (2014년 4월)
- Limping Chicken: Ofcom 두 번째 라이브 자막 보고서 기사 (2014년 11월)
- Liam O’Dell: Ofcom 2023년 접근성 규범 의견 수렴 기사 및 Tier 1 규범 의견 수렴
- FCC: 캡션 품질 기준, FCC 14-12 (2014년) 및 47 CFR 79.1
- CRTC: 방송 규제 정책 2019-308 및 방송 규제 정책 2026-98
- ACMA / 호주 정부: 방송 서비스(텔레비전 캡션) 기준 2023
- EBU: 접근성 서비스와 라이브 자막에 관한 보고서 (i044) 및 Tech 3370, EBU-TT Part 3 라이브 자막
- Thompson, Kushalnagar, Vogler 외: Are Caption Metrics Broken?, arXiv 2609.11408 (2026년 9월); Glasser, Kushalnagar, Vogler: How Users Experience Closed Captions on Live Television, CHI 2024
- Fresno: Closed Captions en espanol, JoSTrans 42 (2024년) 및 미국 영어 뉴스 방송의 라이브 캡션 정확도 (2024년)
- Moores: 라이브 행사의 라이브 자막, JoSTrans 33 (Ofcom 데이터셋 분석 포함)
- Romero-Fresco와 Fresno: 영어 자동 및 사람 라이브 캡션의 정확도 (2023년); Romero-Fresco와 Van Gauwbergen: Fit for What Purpose? (2025년); Romero-Fresco와 Martinez: NER 모델 (2015년)
- Machacek, Dabre, Bojar: Turning Whisper into Real-Time Transcription System (2023년)
- AssemblyAI: Introducing Universal-Streaming (2025년 6월); Deepgram: Introducing Nova-3 (2025년 2월)
- OpenAI: Hello GPT-4o (2024년 5월)
- Stivers 외: Universals and cultural variation in turn-taking in conversation, PNAS (2009년)
- Ai-Media: 2025 회계연도 실적, ASX 공시 (2025년 8월)
- NCRA: Certified Realtime Reporter
- WHO: 난청 팩트시트 (2026년 3월 갱신)
- 데이터 참고 사항: 방송사별 Ofcom 지연 측정(2013~2015년)은 3년이 넘은 것이며 이런 종류로는 입수 가능한 가장 최근의 공개 데이터셋으로 남아 있다. 라운드별로 중앙값과 평균이 섞여 보고되므로 (5.6, 5.8, 5.7에서 5.1, 그리고 Moores를 통한 네 차례 라운드 평균 5.3) 추세선이 아니라 범위로 다뤄야 한다. Ofcom의 자막 이용자 추정(760만 명)은 2013년, Stivers의 발화 교대 데이터는 2009년 것이다. AssemblyAI와 Deepgram의 수치는 벤더 벤치마크이며, AssemblyAI의 비교는 경쟁 제품을 자사 테스트 세트에서 측정한 것이고, Nova-3에 대한 독립 테스트는 Deepgram의 수치보다 높은 WER을 보고한다. 2026년 Thompson 외 논문은 arXiv 프리프린트로 아직 동료 평가를 거치지 않았다. Ai-Media의 매출 수치는 ASX 공시에 보고된 그대로 제시했다. 같은 자동 시스템에 대한 두 건의 독립 평가는 콘텐츠 난이도에 따라 서로 다른 대표 정확도를 보고하며, 2026년 시청자 연구는 라이브 TV 클립에서 훨씬 낮은 NER 통과율을 확인했으므로, 자동 정확도는 장르에 크게 좌우된다. Ofcom의 Tier 1 규범은 2026년 8월 7일에 의견 수렴이 마감된 초안이며 최종 성명이 나올 예정이다.
마지막 업데이트: 2026년 10월 3일. 저희는 이 정리를 분기마다 업데이트하며, 다음 갱신은 Ofcom이 Tier 1 접근성 규범의 최종 성명과 2025년 1~12월 접근성 서비스 보고서를 공개할 때 이루어질 것으로 예상한다.