Subtitle langsung di televisi Inggris tertinggal dari ucapan rata-rata 5,1 hingga 5,8 detik pada putaran pengukuran Ofcom, dan hanya 4 dari 72 sampel pada putaran kedua yang memenuhi pedoman lama 3 detik (Ofcom, laporan kualitas subtitle langsung 2014-2015). Masalah ini belum hilang: studi 2024 terhadap siaran berita berbahasa Spanyol di AS mengukur jeda rata-rata 8,2 detik, dengan beberapa takarir terlambat hingga 41 detik (Fresno, JoSTrans 2024), dan studi September 2026 mengukur rata-rata 8,46 detik pada klip TV langsung AS. Sementara itu, mesin pengenalan suara streaming kini melaporkan latensi kata median mendekati 300 milidetik (AssemblyAI, Juni 2025), sehingga hambatan dalam pembuatan takarir langsung bergeser dari juru ketik manusia ke rantai siaran. Kami menghimpun data dari Ofcom, FCC, CRTC, studi tertelaah sejawat dari Gallaudet University dan Universidade de Vigo, makalah benchmark arXiv, pengajuan Ai-Media ke ASX, WHO, serta sumber primer lain yang tercantum dalam metodologi. Untuk gambaran yang lebih luas, lihat rangkuman statistik takarir langsung kami.
TL;DR
- Latensi rata-rata subtitle langsung di Inggris turun dari 5,7 menjadi 5,1 detik antara April-Mei dan Oktober-November 2014, masih jauh di atas pedoman 3 detik (Ofcom, laporan subtitle langsung ketiga, 2015).
- Hanya 4 dari 72 sampel Inggris yang memenuhi pedoman 3 detik pada putaran kedua, dan jeda terpanjang mencapai 21 detik (Ofcom, laporan kedua, 2014).
- Ofcom kini meminta latensi rata-rata tidak lebih dari 4,5 detik pada program siaran langsung (Ofcom Guidelines on Providing TV and On-Demand Access Services).
- Siaran berita berbahasa Spanyol di AS memiliki jeda takarir rata-rata 8,2 detik, dan 20% takarir terlambat lebih dari 10 detik (Fresno, JoSTrans 42, 2024).
- Takarir TV dengan jeda siaran asli (rata-rata 8,46 dtk) dinilai 3,66/7 dibandingkan 5,09/7 saat disinkronkan (Thompson dkk., arXiv 2609.11408, 2026).
- Subtitle langsung di Inggris rata-rata mencapai akurasi NER 98,38% pada empat putaran Ofcom, di atas ambang 98% (data Ofcom melalui Moores, JoSTrans 33).
- Siaran berita nasional berbahasa Inggris di AS rata-rata mencapai akurasi NER 98,8% (Fresno, Universal Access in the Information Society, 2024).
- Sebuah sistem takarir otomatis meraih NER 98,56% untuk bahasa Inggris dan 98,26% untuk bahasa Spanyol (Romero-Fresco dan Van Gauwbergen, 2025).
- AssemblyAI melaporkan latensi streaming median 307 ms dibandingkan 516 ms untuk Deepgram Nova-3 (AssemblyAI, Juni 2025).
- Whisper-Streaming mencapai latensi rata-rata 3,3 detik pada ucapan bahasa Inggris berdurasi panjang (Machacek, Dabre, dan Bojar, IJCNLP-AACL 2023).
- Manusia menjawab pertanyaan dalam rata-rata 208 ms di 10 bahasa (Stivers dkk., PNAS 2009), tolok ukur yang dikejar sistem real-time.
- Takarir otomatis LEXI milik Ai-Media mencapai 79,2 juta menit pada FY25, naik dari kurang dari 10 juta menit empat tahun sebelumnya (hasil FY25 Ai-Media, ASX).
1. Jeda yang Terukur: Seberapa Jauh Subtitle Langsung Tertinggal dari Ucapan
Kumpulan data publik paling lengkap tentang jeda subtitle langsung masih berasal dari Inggris, dan ceritanya konsisten: subtitle langsung yang lazim muncul lebih dari 5 detik setelah kata diucapkan. Ofcom mengambil sampel acara berita, hiburan, dan bincang-bincang dari BBC, ITV, Channel 4, Channel 5, dan Sky dalam empat putaran antara 2013 dan 2015. Laporan pertama menemukan latensi median 5,6 detik (ringkasan EPRA atas laporan pertama Ofcom, April 2014), dan laporan kedua menemukan 5,8 detik dengan hanya 4 dari 72 sampel yang masuk dalam pedoman 3 detik (laporan Limping Chicken tentang laporan kedua Ofcom, November 2014).
Perbaikan setelahnya nyata tetapi kecil. Laporan ketiga Ofcom mencatat latensi rata-rata turun 0,6 detik, dari 5,7 menjadi 5,1 detik, antara April-Mei dan Oktober-November 2014 (siaran pers Ofcom melalui Wired-Gov, Mei 2015). Memangkas setengah detik dari jeda lima detik menuntut para penyiar mengubah alur kerja, bukan sekadar perangkat lunak, sehingga angkanya mandek. Ini adalah pengukuran latensi Ofcom terbaru yang tersedia (2014-2015); tidak ada kumpulan data per penyiar yang lebih baru yang dipublikasikan.
| Metrik | Nilai | Sumber |
|---|---|---|
| Latensi median subtitle langsung di Inggris, putaran pertama | 5,6 detik | Laporan subtitle langsung pertama Ofcom, April 2014 |
| Latensi di Inggris, putaran kedua | 5,8 detik | Laporan kedua Ofcom, November 2014 |
| Sampel yang memenuhi pedoman 3 detik, putaran kedua | 4 dari 72 | Laporan kedua Ofcom, 2014 |
| Jeda terpanjang yang tercatat, putaran kedua | 21 detik | Laporan kedua Ofcom, 2014 |
| Latensi rata-rata di Inggris, April-Mei 2014 hingga Oktober-November 2014 | 5,7 dtk menjadi 5,1 dtk (-0,6 dtk) | Laporan ketiga Ofcom, Mei 2015 |
| Latensi rata-rata di Inggris pada keempat putaran | 5,3 detik | Data Ofcom melalui Moores, JoSTrans 33 |
| Latensi tanpa pemicuan siaran langsung untuk subtitle yang disiapkan | 7-8 detik | Data Ofcom melalui Moores, JoSTrans 33 |
Catatan konteks: angka per putaran mencampur median dan rata-rata sebagaimana dilaporkan, sehingga selisih kecil antarputaran (5,6, 5,7, 5,8) tidak perlu ditafsirkan berlebihan. Angka 7-8 detik untuk program tanpa subtitle yang disiapkan dan dipicu menunjukkan betapa besar rata-rata Inggris bergantung pada naskah, bukan transkripsi real-time.
Di luar Inggris, jedanya lebih panjang. Takarir pada siaran berita berbahasa Spanyol di AS dari Telemundo dan Univision tertinggal rata-rata 8,2 detik dari ucapan, dengan rentang 0,7 hingga 41 detik, dan 46% takarir terlambat lebih dari 8 detik (Fresno, Closed Captions en espanol, JoSTrans 42, 2024). Studi 2026 terhadap klip TV langsung AS mengukur jeda rata-rata 8,46 detik (SD 3,62) dan menyebut 7-12 detik sebagai angka lazim untuk takarir TV (Thompson dkk., arXiv 2609.11408).
| Metrik | Nilai | Sumber |
|---|---|---|
| Jeda takarir rata-rata, siaran berita berbahasa Spanyol di AS | 8,2 detik | Fresno, JoSTrans 42, 2024 |
| Rentang jeda, sampel yang sama | 0,7 hingga 41 detik | Fresno, JoSTrans 42, 2024 |
| Takarir yang terlambat lebih dari 8 / 10 / 12 detik | 46% / 20% / 8% | Fresno, JoSTrans 42, 2024 |
| Takarir yang dianalisis dalam studi tersebut | 5.349 (20 segmen sepuluh menit) | Fresno, JoSTrans 42, 2024 |
| Jeda rata-rata pada klip TV langsung AS | 8,46 detik (SD 3,62) | Thompson dkk., arXiv 2609.11408, Sep 2026 |
| Jeda takarir TV AS yang lazim dikutip | 7-12 detik | Thompson dkk., arXiv 2609.11408, Sep 2026 |
| Latensi rata-rata pada acara langsung (non-siaran) dengan respeaking | 5,8 detik (rentang 4,3-7,5 dtk) | Moores, JoSTrans 33 |
2. Target Regulasi: Dari 3 Detik ke 4,5 Detik
Para regulator sepakat bahwa latensi penting, tetapi hampir tidak ada yang menetapkan angkanya. Ofcom adalah satu-satunya regulator besar dalam rangkuman ini yang memiliki target latensi numerik, dan ia menggeser target itu ke arah yang lebih longgar: dari jeda maksimum 3 detik dalam Code on Television Access Services menjadi rata-rata tidak lebih dari 4,5 detik pada seluruh program langsung penyedia. Selama konsultasi 2023, Ofcom menyatakan para penyiar menyebut batas maksimum 3 detik tidak realistis dan bahwa 4,5 detik sepadan dengan latensi terbaik yang pernah dicapai masing-masing penyiar (Ofcom Guidelines on Providing Television and On-Demand Access Services).
Pendekatan AS bersifat kualitatif. FCC mengadopsi standar kualitas takarir pada 20 Februari 2014 yang mencakup akurasi, sinkronisasi, kelengkapan, dan penempatan, dan hanya menyatakan bahwa jeda takarir langsung ‘harus ditekan seminimal mungkin, sejalan dengan penyajian yang akurat atas apa yang diucapkan’ (FCC, standar kualitas takarir). Kanada mengatur akurasi, bukan waktu: Broadcasting Regulatory Policy 2019-308 milik CRTC mewajibkan takarir langsung berbahasa Inggris meraih skor 98 pada model NER. Dampak praktisnya, takarir yang terlambat 10 detik bisa sepenuhnya patuh di sebagian besar dunia.
| Metrik | Nilai | Sumber |
|---|---|---|
| Pedoman lama Ofcom | Jeda maksimum 3 detik | Ofcom Code on Television Access Services |
| Pedoman Ofcom saat ini | Rata-rata tidak lebih dari 4,5 detik pada program langsung | Ofcom Guidelines on Providing TV and On-Demand Access Services |
| Panduan lama Ofcom tentang kecepatan subtitle: rekaman / langsung | 160-180 kata per menit / 200 kata per menit | Konsultasi Ofcom 2023, sebagaimana dilaporkan Liam O’Dell |
| Batas latensi numerik FCC | Tidak ada (jeda ‘ditekan seminimal mungkin’) | FCC 14-12, diadopsi 20 Feb 2014 |
| Larangan FCC atas takarir ENT hanya dengan teleprompter untuk program langsung | 4 jaringan utama dan afiliasinya di 25 pasar teratas | FCC 14-12 |
| Pemberian takarir pada program baru yang tidak dikecualikan (FCC) | 100% sejak 1 Januari 2006 | 47 CFR 79.1 |
| Persyaratan akurasi takarir langsung berbahasa Inggris CRTC | Skor NER 98, mulai 1 September 2019 | CRTC 2019-308 |
| Kewajiban pemantauan CRTC | 2 program langsung per bulan, termasuk 1 berita | CRTC 2019-308 |
Catatan konteks: ACMA Australia, berdasarkan Broadcasting Services (Television Captioning) Standard 2023 yang berlaku sejak 1 Oktober 2023, juga tidak menetapkan latensi numerik, dan menilai keterbacaan, akurasi, serta keterpahaman kasus demi kasus.
Aturan terbaru memperluas kewajiban ke layanan streaming alih-alih memperketat jeda. CRTC 2026-98 di Kanada mewajibkan layanan streaming daring memberi takarir pada 80% katalog mereka pada Mei 2030 dan 100% pada Mei 2031, dengan takarir pada program orisinal baru, baik langsung maupun rekaman, dalam waktu satu tahun (CRTC 2026-98, 25 Mei 2026). Draf Tier 1 Accessibility Code Ofcom, yang diterbitkan pada 14 Mei 2026, mengusulkan kuota subtitle 80% bagi layanan streaming terbesar empat tahun setelah publikasi (Ofcom, konsultasi Tier 1 Accessibility Code).
| Metrik | Nilai | Sumber |
|---|---|---|
| Pemberian takarir pada katalog layanan streaming Kanada | 80% pada Mei 2030, 100% pada Mei 2031 | CRTC 2026-98 |
| Persyaratan akurasi Kanada untuk program orisinal rekaman di layanan streaming | 100% | CRTC 2026-98 |
| Kuota subtitle Tier 1 Ofcom, tahun ke-4 / tahun ke-1 | 80% / 20% | Draf Tier 1 Accessibility Code Ofcom, Mei 2026 |
| Kuota subtitle BBC on-demand, tahun ke-4 | 90% | Draf Tier 1 Accessibility Code Ofcom, Mei 2026 |
| Ambang Tier 1 | 500.000+ pengguna bulanan rata-rata di Inggris | Draf Tier 1 Accessibility Code Ofcom, Mei 2026 |
3. Akurasi: Garis NER 98% dan Siapa yang Melampauinya
Jeda dan akurasi saling menukar, sehingga angka latensi baru bermakna jika disandingkan dengan angka akurasi. Tolok ukur yang umum adalah model NER, yang menilai subtitle langsung sebagai (kata dikurangi kesalahan penyuntingan dan pengenalan) dibagi kata. 98% ‘dapat diterima’, 98,5-98,99% ‘baik’, 99-99,49% ‘sangat baik’, dan di atas 99,5% ‘sangat unggul’ (Romero-Fresco dan Martinez, model NER, 2015). Ambang ini tampak longgar sampai diterjemahkan: pada 98%, dua dari setiap 100 kata salah, hilang, atau merupakan kesalahan berbobot.
Penyiar Inggris melampaui batas tersebut secara rata-rata: 98,38% pada empat putaran Ofcom dan 98,55% pada putaran terakhir, diukur pada 78.000 subtitle dan 546.000 kata (Moores, JoSTrans 33). Namun rata-rata menyembunyikan ekornya. Pada Oktober-November 2014, 77% program Inggris mencapai 98% atau lebih, naik dari 74% pada April-Mei 2014, dan berita adalah genre paling akurat dengan 98,75% (laporan ketiga Ofcom, 2015). Siaran berita nasional berbahasa Inggris di AS lebih baik, rata-rata 98,8% dengan 14 dari 20 sampel dinilai dapat diterima atau lebih tinggi, sementara siaran berita berbahasa Spanyol turun ke 97,04% (Fresno, 2024).
| Metrik | Nilai | Sumber |
|---|---|---|
| Ambang NER dapat diterima / sangat unggul | 98% / di atas 99,5% | Romero-Fresco dan Martinez, 2015 |
| Akurasi subtitle langsung di Inggris, rata-rata empat putaran | 98,38% | Data Ofcom melalui Moores, JoSTrans 33 |
| Akurasi subtitle langsung di Inggris, putaran terakhir | 98,55% | Data Ofcom melalui Moores, JoSTrans 33 |
| Program Inggris pada 98% atau lebih, Okt-Nov 2014 (dibandingkan Apr-Mei 2014) | 77% (74%) | Laporan ketiga Ofcom, 2015 |
| Akurasi genre berita di Inggris | 98,75% | Laporan ketiga Ofcom, 2015 |
| Siaran berita nasional berbahasa Inggris di AS, NER rata-rata | 98,8% (14 dari 20 sampel dapat diterima atau lebih baik) | Fresno, Universal Access in the Information Society, 2024 |
| Siaran berita berbahasa Spanyol di AS, NER rata-rata | 97,04% (Telemundo 97,00%, Univision 97,10%) | Fresno, JoSTrans 42, 2024 |
| Pengurangan teks: siaran berita Spanyol dibandingkan Inggris | 26% dibandingkan 5-6% | Fresno, JoSTrans 42, 2024 |
Catatan konteks: kecepatan adalah variabel ketiga yang tersembunyi. Ofcom merekomendasikan rata-rata subtitle di bawah 180 kata per menit, namun hampir semua program yang dianalisisnya memiliki lonjakan singkat di atas 200 kata per menit, dan ketika lonjakan itu dihitung sebagai kesalahan, 68% program turun di bawah 98% (laporan ketiga Ofcom, 2015). Studi siaran berita berbahasa Inggris di AS menemukan hampir dua pertiga kesalahan tergolong kecil.
4. Biaya Jeda bagi Penonton
Audiens subtitle langsung jauh lebih luas daripada komunitas tunarungu saja. Ofcom memperkirakan sekitar 7,6 juta orang dewasa di Inggris pernah menggunakan subtitle, yang hanya 1,4 juta di antaranya memiliki gangguan pendengaran (siaran pers Ofcom melalui Wired-Gov, Mei 2013). Artinya lebih dari 6 juta pengguna subtitle tanpa gangguan pendengaran (7,6 juta dikurangi 1,4 juta), yang banyak di antaranya menonton di ruangan bising atau dengan suara pelan. Pedoman Ofcom juga mengutip data YouGov bahwa 61% orang berusia 18-24 tahun lebih suka subtitle diaktifkan. Secara global, WHO memperkirakan 430 juta orang saat ini membutuhkan rehabilitasi akibat gangguan pendengaran yang melumpuhkan, naik menjadi lebih dari 700 juta pada 2050.
| Metrik | Nilai | Sumber |
|---|---|---|
| Orang dewasa Inggris yang pernah menggunakan subtitle | Sekitar 7,6 juta (rentang 7,0-8,1 juta) | Ofcom, Mei 2013 |
| Di antaranya, yang memiliki gangguan pendengaran | Sekitar 1,4 juta (rentang 1,2-1,6 juta) | Ofcom, Mei 2013 |
| Warga Inggris usia 18-24 tahun yang lebih suka subtitle aktif | 61% | YouGov, dikutip dalam pedoman layanan akses Ofcom |
| Porsi jam program PSB Inggris dan layanan on-demand yang lebih besar dengan subtitle, 2024 | 88% | Ofcom Access Services Report, Jan-Des 2024 (terbit 19 Mei 2025) |
| Jam bersubtitle pada kanal wajib di Inggris, 2005 dibandingkan 2013 | 40,5% dibandingkan 81,9% | Laporan subtitle langsung pertama Ofcom, 2014 |
| Orang yang membutuhkan rehabilitasi akibat gangguan pendengaran yang melumpuhkan | 430 juta | Lembar fakta WHO, diperbarui Maret 2026 |
| Orang yang diproyeksikan mengalami sebagian gangguan pendengaran pada 2050 | Hampir 2,5 miliar | Lembar fakta WHO, diperbarui Maret 2026 |
Jeda adalah hal pertama yang disadari penonton. Studi pengguna terbaru terbesar meminta 216 penonton tunarungu dan kurang dengar menilai 70 klip TV langsung dalam empat kondisi, menghasilkan 4.832 penilaian. Takarir TV yang sama dinilai 3,66 dari 7 dengan jeda siaran aslinya dan 5,09 saat disinkronkan, ayunan yang jauh lebih lebar daripada selisih antara TV tersinkronisasi dan takarir ASR (Thompson dkk., Are Caption Metrics Broken?, arXiv 2609.11408, September 2026). Takarir ASR dengan jeda dua detik bertahan jauh lebih baik, yaitu 4,81 dibandingkan 5,20 saat disinkronkan.
Studi yang sama melemahkan anggapan bahwa skor akurasi mencerminkan kualitas. Hanya 11 dari 70 klip TV dan 4 dari 70 klip ASR yang mencapai ambang NER 98, namun penonton menilai takarir ASR dan TV yang tersinkronisasi hampir setara, dan korelasi antara metrik dan penilaian turun tajam untuk keluaran ASR (WER r = -0,390 dibandingkan -0,687 untuk takarir TV). Studi CHI 2024 Gallaudet sebelumnya mencapai kesimpulan serupa: peserta sangat tidak menyukai jeda siaran, dan metrik akurasi standar hanya berkorelasi lemah dengan cara penonton menilai takarir.
| Metrik | Nilai | Sumber |
|---|---|---|
| Peserta / penilaian / klip | 216 / 4.832 / 70 | Thompson dkk., arXiv 2609.11408, 2026 |
| Penilaian takarir TV: jeda asli dibandingkan tersinkronisasi (skala 7 poin) | 3,66 dibandingkan 5,09 | Thompson dkk., 2026 |
| Penilaian takarir ASR: jeda 2 dtk dibandingkan tersinkronisasi | 4,81 dibandingkan 5,20 | Thompson dkk., 2026 |
| WER rata-rata: takarir TV dibandingkan takarir ASR | 33,8% dibandingkan 17,2% | Thompson dkk., 2026 |
| NER rata-rata: takarir TV dibandingkan takarir ASR | 95,28 dibandingkan 94,34 | Thompson dkk., 2026 |
| Klip yang memenuhi NER 98: TV dibandingkan ASR | 11 dari 70 dibandingkan 4 dari 70 | Thompson dkk., 2026 |
| Korelasi WER dengan penilaian penonton: TV dibandingkan ASR | r = -0,687 dibandingkan -0,390 | Thompson dkk., 2026 |
Catatan konteks: WER takarir TV yang tinggi sebagian mencerminkan bahwa takarir siaran memparafrasekan dan meringkas, hal yang dihukum WER tetapi tidak dihukum NER. Kesenjangan itulah alasan para penulis berpendapat bahwa metrik saat ini tidak netral terhadap teknologi.
5. Kecepatan Mesin ASR: Latensi Streaming dibandingkan Percakapan Manusia
Latensi mesin bukan lagi sumber utama jeda subtitle. AssemblyAI melaporkan latensi streaming median 307 ms untuk Universal-Streaming dibandingkan 516 ms untuk Deepgram Nova-3, dan P99 sebesar 1.012 ms dibandingkan 1.907 ms, diukur dari akhir sebuah kata dalam audio hingga kemunculan pertamanya dalam transkrip parsial pada 205+ jam audio (AssemblyAI, Introducing Universal-Streaming, 2 Juni 2025). Data peluncuran Deepgram sendiri menempatkan word error rate streaming median Nova-3 pada 6,84%, dibandingkan 14,92% untuk pesaing yang diuji (Deepgram, Introducing Nova-3, Februari 2025). Keduanya adalah benchmark vendor dan sebaiknya dibaca sebagai angka kasus terbaik. Statistik speech-to-text kami mencakup akurasi pada lebih banyak mesin.
Model terbuka menukar lebih banyak jeda demi stabilitas. Sistem akademik Whisper-Streaming mencapai latensi rata-rata 3,3 detik pada ucapan bahasa Inggris berdurasi panjang dari set uji ESIC Parlemen Eropa, dan pertukaran itu tampak jelas dalam hasilnya: WER bahasa Inggris 8,5% pada latensi 3,27 dtk dengan potongan 0,5 dtk dibandingkan 8,0% pada 5,45 dtk dengan potongan 2 dtk (Machacek, Dabre, dan Bojar, arXiv 2307.14743, IJCNLP-AACL 2023). Perhatikan bahwa konfigurasi Whisper 5 detik jatuh tepat pada rata-rata siaran Inggris satu dekade sebelumnya.
| Metrik | Nilai | Sumber |
|---|---|---|
| Latensi median / P99 AssemblyAI Universal-Streaming | 307 ms / 1.012 ms | AssemblyAI, Juni 2025 |
| Latensi median / P99 Deepgram Nova-3 (uji AssemblyAI) | 516 ms / 1.907 ms | AssemblyAI, Juni 2025 |
| WER median Deepgram Nova-3: streaming / batch | 6,84% / 5,26% | Deepgram, Feb 2025 |
| Set benchmark Deepgram Nova-3 | 2.703 berkas, 81,69 jam, 9 domain | Deepgram, Feb 2025 |
| Latensi rata-rata Whisper-Streaming, bahasa Inggris | 3,3 detik | Machacek dkk., 2023 |
| Whisper-Streaming bahasa Inggris: potongan 0,5 dtk dibandingkan potongan 2,0 dtk | WER 8,5% pada 3,27 dtk dibandingkan WER 8,0% pada 5,45 dtk | Machacek dkk., 2023 |
| Latensi Whisper-Streaming, bahasa Jerman / Ceko (potongan 0,5 dtk) | 4,11 dtk / 4,69 dtk | Machacek dkk., 2023 |
Batas atas real-time ditentukan oleh percakapan manusia. Di 10 bahasa, jeda rata-rata antara pertanyaan dan jawabannya adalah +208 ms, mulai dari +7 ms dalam bahasa Jepang hingga +469 ms dalam bahasa Denmark (Stivers dkk., PNAS 2009). Peluncuran GPT-4o dari OpenAI mengklaim respons audio secepat 232 ms dan rata-rata 320 ms, dibandingkan 2,8 detik (GPT-3.5) dan 5,4 detik (GPT-4) untuk Voice Mode berantai sebelumnya, yang merangkai model transkripsi, bahasa, dan suara yang terpisah. Pelajaran bagi subtitle langsung sama: setiap tahap tambahan dalam rantai menambah detik, dan tahap yang dulu mendominasi, yaitu pengenalan itu sendiri, kini menjadi yang terkecil.
| Metrik | Nilai | Sumber |
|---|---|---|
| Jeda rata-rata pertanyaan ke jawaban, 10 bahasa | +208 ms | Stivers dkk., PNAS 2009 (data terbaru yang tersedia) |
| Rata-rata bahasa tercepat / terlambat | +7 ms (Jepang) / +469 ms (Denmark) | Stivers dkk., PNAS 2009 |
| Respons audio GPT-4o: minimum / rata-rata | 232 ms / 320 ms | OpenAI, Mei 2024 |
| Latensi rata-rata Voice Mode berantai: GPT-3.5 / GPT-4 | 2,8 dtk / 5,4 dtk | OpenAI, Mei 2024 |
| Jeda takarir ASR yang dipakai dalam studi penonton 2026 | Rata-rata 2 detik | Thompson dkk., arXiv 2609.11408 |
6. Otomatisasi Mengambil Alih Rantai Takarir
Tenaga kerja manusia di balik subtitle langsung dibatasi oleh batas kecepatan. Tolok ukur realtime AS, NCRA Certified Realtime Reporter, mensyaratkan tes realtime lima menit pada 200 kata per menit dengan akurasi 96%, dan laporan EBU menggambarkan subtitle langsung sebagai upaya mengikuti pembicara hingga 200 kata per menit. Para respeaker di Inggris mengatakan kepada peneliti bahwa pelatihan dasar memakan waktu 2-3 bulan, sedangkan merasa percaya diri membutuhkan 1,5-2 tahun (Moores, JoSTrans 33). Kendala-kendala itulah yang membuat takarir otomatis berkembang begitu cepat begitu akurasinya mendekati.
Pergeseran volume terlihat dalam dokumen perusahaan. Takarir otomatis LEXI milik Ai-Media mencapai 79,2 juta menit pada FY25, naik dari kurang dari 10 juta empat tahun sebelumnya, dengan CAGR empat tahun sebesar 69%, dan LEXI kini menyumbang sebagian besar penggunaan di jaringan iCap-nya (hasil FY25 Ai-Media, pengumuman ASX, 28 Agustus 2025). Produk teknologi menyumbang 63% pendapatan Ai-Media, dari nol lima tahun sebelumnya. Pengujian independen atas sistem yang sama menemukan akurasi NER 98,56% untuk bahasa Inggris dan 98,26% untuk bahasa Spanyol, setara dengan takarir manusia kecuali pada konten percakapan sehari-hari dengan banyak pembicara (Romero-Fresco dan Van Gauwbergen, Fit for What Purpose?, 2025). Bahasan lebih lanjut tentang sisi manusia dari profesi ini ada di statistik akurasi transkripsi ruang sidang kami.
| Metrik | Nilai | Sumber |
|---|---|---|
| Standar realtime NCRA CRR | 200 kata per menit dengan akurasi 96% (tes 5 menit) | NCRA |
| Pelatihan dasar respeaker / waktu hingga percaya diri | 2-3 bulan / 1,5-2 tahun | Moores, JoSTrans 33 |
| Menit takarir otomatis Ai-Media LEXI, FY25 | 79,2 juta | Hasil FY25 Ai-Media, ASX |
| Menit LEXI empat tahun sebelumnya | Kurang dari 10 juta (CAGR empat tahun 69%) | Hasil FY25 Ai-Media, ASX |
| Porsi teknologi dalam pendapatan Ai-Media | 63% (total pendapatan USD 64,9 juta) | Hasil FY25 Ai-Media, ASX |
| Akurasi NER takarir otomatis: Inggris / Spanyol | 98,56% / 98,26% | Romero-Fresco dan Van Gauwbergen, 2025 |
| Takarir langsung yang dianalisis untuk membandingkan keluaran otomatis dan manusia, Inggris/AS/Kanada 2018-2022 | Sekitar 17.000 | Romero-Fresco dan Fresno, Linguistica Antverpiensia 22, 2023 |
Catatan konteks: perbandingan manusia lawan mesin terbesar sejauh ini (Romero-Fresco dan Fresno, Linguistica Antverpiensia, 2023) menemukan takarir otomatis tanpa penyuntingan mendekati 98%, dengan kelemahan yang menetap pada tanda baca, nama diri, angka, dan identifikasi pembicara. Latensi mesin yang lebih rendah tidak memperbaiki hal itu: nama yang salah tetapi cepat tetap nama yang salah.
Ringkasan: Latensi Subtitle Langsung Real-Time dalam Angka
| Metrik | Nilai | Sumber |
|---|---|---|
| Latensi rata-rata subtitle langsung di Inggris, akhir 2014 | 5,1 detik | Laporan ketiga Ofcom, 2015 |
| Sampel Inggris yang memenuhi pedoman 3 dtk, putaran kedua | 4 dari 72 | Laporan kedua Ofcom, 2014 |
| Jeda terpanjang di Inggris yang tercatat | 21 detik | Laporan kedua Ofcom, 2014 |
| Pedoman latensi Ofcom saat ini | Rata-rata 4,5 detik atau kurang | Pedoman layanan akses Ofcom |
| Batas latensi numerik FCC | Tidak ada | FCC 14-12, 2014 |
| Akurasi takarir langsung berbahasa Inggris CRTC | NER 98 | CRTC 2019-308 |
| Jeda takarir siaran berita Spanyol di AS | Rata-rata 8,2 detik | Fresno, JoSTrans 42, 2024 |
| Takarir siaran berita Spanyol di AS yang terlambat lebih dari 10 detik | 20% | Fresno, JoSTrans 42, 2024 |
| Jeda rata-rata pada klip TV langsung AS | 8,46 detik | Thompson dkk., arXiv 2609.11408, 2026 |
| Penilaian takarir TV: tertunda dibandingkan tersinkronisasi | 3,66 dibandingkan 5,09 dari 7 | Thompson dkk., 2026 |
| Akurasi subtitle langsung di Inggris, rata-rata empat putaran | 98,38% | Data Ofcom melalui Moores, JoSTrans 33 |
| Akurasi siaran berita nasional berbahasa Inggris di AS | 98,8% | Fresno, 2024 |
| Akurasi takarir otomatis, bahasa Inggris | 98,56% | Romero-Fresco dan Van Gauwbergen, 2025 |
| Orang dewasa Inggris yang pernah menggunakan subtitle | Sekitar 7,6 juta | Ofcom, 2013 |
| Jam PSB Inggris dan on-demand yang lebih besar yang bersubtitle, 2024 | 88% | Ofcom Access Services Report 2024 |
| Latensi streaming median AssemblyAI | 307 ms | AssemblyAI, Juni 2025 |
| Latensi rata-rata Whisper-Streaming | 3,3 detik | Machacek dkk., 2023 |
| Jeda rata-rata pergantian giliran bicara manusia | 208 ms | Stivers dkk., PNAS 2009 |
| Menit takarir LEXI Ai-Media, FY25 | 79,2 juta | Hasil FY25 Ai-Media |
| Pemberian takarir katalog layanan streaming Kanada pada Mei 2031 | 100% | CRTC 2026-98 |
Metodologi dan Sumber
Setiap angka di atas ditelusuri hingga regulator, pengajuan perusahaan, atau makalah tertelaah sejawat yang menghasilkannya. Beberapa PDF Ofcom tidak dapat diambil langsung, sehingga angka Inggris diambil dari siaran pers Ofcom (diterbitkan ulang di Wired-Gov), ringkasan regulator (EPRA), dan analisis tertelaah sejawat atas kumpulan data Ofcom (Moores), masing-masing disebutkan dalam teks. Benchmark vendor diberi label sebagai data vendor. Untuk data pasar dan penggunaan takarir secara umum, lihat statistik takarir dan subtitle kami.
- Ofcom: siaran pers laporan subtitle langsung ketiga (Wired-Gov, Mei 2015), siaran pers konsultasi subtitle langsung (Wired-Gov, Mei 2013), Guidelines on Providing Television and On-Demand Access Services, Access Services Report Jan-Des 2024, konsultasi Tier 1 Accessibility Code (Mei 2026)
- EPRA: ringkasan laporan subtitle langsung pertama Ofcom (April 2014)
- Limping Chicken: laporan tentang laporan subtitle langsung kedua Ofcom (November 2014)
- Liam O’Dell: laporan tentang konsultasi kode akses Ofcom 2023 dan konsultasi kode Tier 1
- FCC: standar kualitas takarir, FCC 14-12 (2014) dan 47 CFR 79.1
- CRTC: Broadcasting Regulatory Policy 2019-308 dan Broadcasting Regulatory Policy 2026-98
- ACMA / Pemerintah Australia: Broadcasting Services (Television Captioning) Standard 2023
- EBU: laporan tentang layanan akses dan subtitle langsung (i044) dan Tech 3370, EBU-TT Part 3 Live Subtitling
- Thompson, Kushalnagar, Vogler dkk.: Are Caption Metrics Broken?, arXiv 2609.11408 (September 2026); Glasser, Kushalnagar, dan Vogler: How Users Experience Closed Captions on Live Television, CHI 2024
- Fresno: Closed Captions en espanol, JoSTrans 42 (2024) dan Live captioning accuracy in English-language newscasts in the USA (2024)
- Moores: subtitle langsung pada acara langsung, JoSTrans 33 (memuat analisis kumpulan data Ofcom)
- Romero-Fresco dan Fresno: The accuracy of automatic and human live captions in English (2023); Romero-Fresco dan Van Gauwbergen: Fit for What Purpose? (2025); Romero-Fresco dan Martinez: model NER (2015)
- Machacek, Dabre, dan Bojar: Turning Whisper into Real-Time Transcription System (2023)
- AssemblyAI: Introducing Universal-Streaming (Juni 2025); Deepgram: Introducing Nova-3 (Februari 2025)
- OpenAI: Hello GPT-4o (Mei 2024)
- Stivers dkk.: Universals and cultural variation in turn-taking in conversation, PNAS (2009)
- Ai-Media: hasil FY25, pengumuman ASX (Agustus 2025)
- NCRA: Certified Realtime Reporter
- WHO: lembar fakta Deafness and hearing loss (diperbarui Maret 2026)
- Catatan data: pengukuran latensi per penyiar Ofcom (2013-2015) berusia lebih dari tiga tahun dan tetap menjadi kumpulan data publik terbaru yang tersedia untuk jenisnya; putaran-putaran tersebut melaporkan campuran median dan rata-rata (5,6, 5,8, 5,7 menjadi 5,1, dan rata-rata empat putaran 5,3 melalui Moores), sehingga perlakukan sebagai rentang, bukan garis tren. Estimasi pengguna subtitle Ofcom (7,6 juta) berasal dari 2013 dan data pergantian giliran bicara Stivers dari 2009. Angka AssemblyAI dan Deepgram adalah benchmark vendor; perbandingan AssemblyAI mengukur pesaing pada set uji miliknya sendiri, dan pengujian independen atas Nova-3 melaporkan WER lebih tinggi daripada angka Deepgram. Makalah Thompson dkk. 2026 adalah preprint arXiv dan belum ditelaah sejawat. Angka pendapatan Ai-Media ditampilkan sebagaimana dilaporkan dalam rilis ASX-nya. Dua evaluasi independen atas sistem otomatis yang sama melaporkan akurasi utama yang berbeda bergantung pada tingkat kesulitan konten, dan studi penonton 2026 menemukan tingkat kelulusan NER yang jauh lebih rendah pada klip TV langsung, sehingga akurasi otomatis sangat bergantung pada genre. Kode Tier 1 Ofcom adalah draf yang konsultasinya ditutup pada 7 Agustus 2026, dan pernyataan akhir diperkirakan akan terbit.
Terakhir diperbarui: 3 Oktober 2026. Kami memperbarui rangkuman ini setiap kuartal, dan pembaruan berikutnya diperkirakan terjadi ketika Ofcom menerbitkan pernyataan akhir Tier 1 Accessibility Code dan Access Services Report untuk periode Januari-Desember 2025.