ซับไตเติลสดบนโทรทัศน์ของสหราชอาณาจักรตามหลังเสียงพูดเฉลี่ย 5.1 ถึง 5.8 วินาทีในรอบการวัดผลของ Ofcom และมีเพียง 4 จาก 72 ตัวอย่างในรอบที่สองที่ผ่านแนวปฏิบัติเดิม 3 วินาที (Ofcom, รายงานคุณภาพซับไตเติลสด 2014-2015) ปัญหานี้ยังไม่หมดไป งานศึกษาปี 2024 เกี่ยวกับข่าวภาษาสเปนในสหรัฐฯ วัดความล่าช้าเฉลี่ยได้ 8.2 วินาที โดยบางคำบรรยายมาช้าถึง 41 วินาที (Fresno, JoSTrans 2024) และงานศึกษาเดือนกันยายน 2026 วัดค่าเฉลี่ยได้ 8.46 วินาทีกับคลิปทีวีสดของสหรัฐฯ ขณะเดียวกัน เอนจินรู้จำเสียงพูดแบบสตรีมมิงรายงานความหน่วงต่อคำระดับมัธยฐานใกล้ 300 มิลลิวินาที (AssemblyAI, มิถุนายน 2025) คอขวดของการทำคำบรรยายสดจึงกำลังเคลื่อนจากผู้พิมพ์ที่เป็นมนุษย์ไปสู่ห่วงโซ่การแพร่ภาพ เรารวบรวมข้อมูลจาก Ofcom, FCC, CRTC, งานวิจัยที่ผ่านการพิจารณาโดยผู้ทรงคุณวุฒิจากมหาวิทยาลัย Gallaudet และ Universidade de Vigo, เอกสารเกณฑ์วัดผลบน arXiv, เอกสารที่ Ai-Media ยื่นต่อ ASX, WHO และแหล่งข้อมูลปฐมภูมิอื่น ๆ ที่ระบุไว้ในส่วนระเบียบวิธี สำหรับภาพรวมที่กว้างขึ้น ดูสรุปสถิติคำบรรยายสดของเรา
สรุปโดยย่อ
- ความหน่วงเฉลี่ยของซับไตเติลสดในสหราชอาณาจักรลดจาก 5.7 เหลือ 5.1 วินาทีระหว่างเมษายน-พฤษภาคมถึงตุลาคม-พฤศจิกายน 2014 ซึ่งยังสูงกว่าแนวปฏิบัติ 3 วินาทีมาก (Ofcom, รายงานซับไตเติลสดฉบับที่สาม, 2015)
- มีเพียง 4 จาก 72 ตัวอย่างในสหราชอาณาจักรที่ผ่านแนวปฏิบัติ 3 วินาทีในรอบที่สอง และความล่าช้าสูงสุดอยู่ที่ 21 วินาที (Ofcom, รายงานฉบับที่สอง, 2014)
- ปัจจุบัน Ofcom ขอให้ความหน่วงเฉลี่ยไม่เกิน 4.5 วินาทีตลอดรายการสด (Ofcom Guidelines on Providing TV and On-Demand Access Services)
- ข่าวภาษาสเปนในสหรัฐฯ มีความล่าช้าของคำบรรยายเฉลี่ย 8.2 วินาที และ 20% ของคำบรรยายมาช้ากว่า 10 วินาที (Fresno, JoSTrans 42, 2024)
- คำบรรยายทีวีที่มีความล่าช้าตามการออกอากาศเดิม (เฉลี่ย 8.46 วินาที) ได้คะแนน 3.66/7 เทียบกับ 5.09/7 เมื่อปรับให้ตรงเวลา (Thompson และคณะ, arXiv 2609.11408, 2026)
- ซับไตเติลสดในสหราชอาณาจักรมีความแม่นยำ NER เฉลี่ย 98.38% จากการวัดของ Ofcom สี่รอบ สูงกว่าเกณฑ์ 98% (ข้อมูล Ofcom ผ่าน Moores, JoSTrans 33)
- ข่าวระดับประเทศภาษาอังกฤษในสหรัฐฯ มีความแม่นยำ NER เฉลี่ย 98.8% (Fresno, Universal Access in the Information Society, 2024)
- ระบบคำบรรยายอัตโนมัติระบบหนึ่งได้คะแนน NER 98.56% ในภาษาอังกฤษ และ 98.26% ในภาษาสเปน (Romero-Fresco และ Van Gauwbergen, 2025)
- AssemblyAI รายงานความหน่วงสตรีมมิงมัธยฐาน 307 ms เทียบกับ 516 ms ของ Deepgram Nova-3 (AssemblyAI, มิถุนายน 2025)
- Whisper-Streaming มีความหน่วงเฉลี่ย 3.3 วินาทีกับเสียงพูดภาษาอังกฤษแบบยาว (Machacek, Dabre และ Bojar, IJCNLP-AACL 2023)
- มนุษย์ตอบคำถามภายในเฉลี่ย 208 ms ใน 10 ภาษา (Stivers และคณะ, PNAS 2009) ซึ่งเป็นเกณฑ์ที่ระบบเรียลไทม์พยายามไล่ตาม
- คำบรรยายอัตโนมัติ LEXI ของ Ai-Media แตะ 79.2 ล้านนาทีในปีงบประมาณ FY25 เพิ่มจากไม่ถึง 10 ล้านนาทีเมื่อสี่ปีก่อน (ผลประกอบการ FY25 ของ Ai-Media, ASX)
1. ความล่าช้าที่วัดได้: ซับไตเติลสดตามหลังเสียงพูดเท่าไร
ชุดข้อมูลสาธารณะที่ครบถ้วนที่สุดเรื่องความล่าช้าของซับไตเติลสดยังคงเป็นของสหราชอาณาจักร และเล่าเรื่องไปในทิศทางเดียวกัน: ซับไตเติลสดทั่วไปปรากฏหลังคำพูดมากกว่า 5 วินาที Ofcom สุ่มตัวอย่างรายการข่าว บันเทิง และทอล์กโชว์จาก BBC, ITV, Channel 4, Channel 5 และ Sky ในสี่รอบระหว่างปี 2013 ถึง 2015 รายงานฉบับแรกพบความหน่วงมัธยฐาน 5.6 วินาที (สรุปของ EPRA เกี่ยวกับรายงานฉบับแรกของ Ofcom, เมษายน 2014) และฉบับที่สองพบ 5.8 วินาที โดยมีเพียง 4 จาก 72 ตัวอย่างที่อยู่ในแนวปฏิบัติ 3 วินาที (รายงานของ Limping Chicken เกี่ยวกับรายงานฉบับที่สองของ Ofcom, พฤศจิกายน 2014)
การปรับปรุงที่ตามมาเป็นของจริงแต่เล็กน้อย รายงานฉบับที่สามของ Ofcom บันทึกว่าความหน่วงเฉลี่ยลดลง 0.6 วินาที จาก 5.7 เหลือ 5.1 วินาที ระหว่างเมษายน-พฤษภาคมถึงตุลาคม-พฤศจิกายน 2014 (ข่าวประชาสัมพันธ์ของ Ofcom ผ่าน Wired-Gov, พฤษภาคม 2015) การลดครึ่งวินาทีจากความล่าช้าห้าวินาทีต้องให้ผู้แพร่ภาพเปลี่ยนขั้นตอนการทำงาน ไม่ใช่แค่ซอฟต์แวร์ ตัวเลขจึงหยุดนิ่ง นี่คือผลวัดความหน่วงของ Ofcom ล่าสุดที่มีอยู่ (2014-2015) และยังไม่มีการเผยแพร่ชุดข้อมูลรายผู้แพร่ภาพที่ใหม่กว่านี้
| ตัวชี้วัด | ค่า | แหล่งที่มา |
|---|---|---|
| ความหน่วงมัธยฐานของซับไตเติลสดในสหราชอาณาจักร รอบแรก | 5.6 วินาที | รายงานซับไตเติลสดฉบับแรกของ Ofcom, เมษายน 2014 |
| ความหน่วงในสหราชอาณาจักร รอบที่สอง | 5.8 วินาที | รายงานฉบับที่สองของ Ofcom, พฤศจิกายน 2014 |
| ตัวอย่างที่ผ่านแนวปฏิบัติ 3 วินาที รอบที่สอง | 4 จาก 72 | รายงานฉบับที่สองของ Ofcom, 2014 |
| ความล่าช้าสูงสุดที่บันทึกได้ รอบที่สอง | 21 วินาที | รายงานฉบับที่สองของ Ofcom, 2014 |
| ความหน่วงเฉลี่ยในสหราชอาณาจักร เมษายน-พฤษภาคม 2014 ถึงตุลาคม-พฤศจิกายน 2014 | 5.7 วินาทีเป็น 5.1 วินาที (ลด 0.6 วินาที) | รายงานฉบับที่สามของ Ofcom, พฤษภาคม 2015 |
| ความหน่วงเฉลี่ยในสหราชอาณาจักรตลอดทั้งสี่รอบ | 5.3 วินาที | ข้อมูล Ofcom ผ่าน Moores, JoSTrans 33 |
| ความหน่วงเมื่อไม่ได้สั่งเล่นซับไตเติลที่เตรียมไว้ล่วงหน้าแบบสด | 7-8 วินาที | ข้อมูล Ofcom ผ่าน Moores, JoSTrans 33 |
หมายเหตุบริบท: ตัวเลขรายรอบปะปนค่ามัธยฐานและค่าเฉลี่ยตามที่รายงานไว้ ความต่างเล็กน้อยระหว่างรอบ (5.6, 5.7, 5.8) จึงไม่ควรตีความเกินจริง ตัวเลข 7-8 วินาทีสำหรับรายการที่ไม่มีซับไตเติลที่เตรียมไว้และสั่งเล่นตามจังหวะ แสดงให้เห็นว่าค่าเฉลี่ยของสหราชอาณาจักรขึ้นอยู่กับการเตรียมบทล่วงหน้ามากเพียงใด มากกว่าการถอดเสียงแบบเรียลไทม์
นอกสหราชอาณาจักร ความล่าช้ายิ่งยาวขึ้น คำบรรยายในข่าวภาษาสเปนของ Telemundo และ Univision ในสหรัฐฯ ตามหลังเสียงพูดเฉลี่ย 8.2 วินาที ตั้งแต่ 0.7 ถึง 41 วินาที โดย 46% ของคำบรรยายมาช้ากว่า 8 วินาที (Fresno, Closed Captions en espanol, JoSTrans 42, 2024) งานศึกษาปี 2026 กับคลิปทีวีสดของสหรัฐฯ วัดความล่าช้าเฉลี่ย 8.46 วินาที (ส่วนเบี่ยงเบนมาตรฐาน 3.62) และระบุว่า 7-12 วินาทีเป็นค่าทั่วไปของคำบรรยายทีวี (Thompson และคณะ, arXiv 2609.11408)
| ตัวชี้วัด | ค่า | แหล่งที่มา |
|---|---|---|
| ความล่าช้าเฉลี่ยของคำบรรยาย ข่าวภาษาสเปนในสหรัฐฯ | 8.2 วินาที | Fresno, JoSTrans 42, 2024 |
| ช่วงความล่าช้า ในตัวอย่างเดียวกัน | 0.7 ถึง 41 วินาที | Fresno, JoSTrans 42, 2024 |
| คำบรรยายที่ล่าช้ากว่า 8 / 10 / 12 วินาที | 46% / 20% / 8% | Fresno, JoSTrans 42, 2024 |
| คำบรรยายที่วิเคราะห์ในงานศึกษานั้น | 5,349 (20 ช่วง ช่วงละสิบนาที) | Fresno, JoSTrans 42, 2024 |
| ความล่าช้าเฉลี่ยของคลิปทีวีสดในสหรัฐฯ | 8.46 วินาที (ส่วนเบี่ยงเบนมาตรฐาน 3.62) | Thompson และคณะ, arXiv 2609.11408, กันยายน 2026 |
| ความล่าช้าของคำบรรยายทีวีสหรัฐฯ โดยทั่วไปที่อ้างอิง | 7-12 วินาที | Thompson และคณะ, arXiv 2609.11408, กันยายน 2026 |
| ความหน่วงเฉลี่ยในงานสด (ไม่ใช่การแพร่ภาพ) ที่ใช้การพูดซ้ำ | 5.8 วินาที (ช่วง 4.3-7.5 วินาที) | Moores, JoSTrans 33 |
2. เป้าหมายเชิงกำกับดูแล: จาก 3 วินาทีเป็น 4.5 วินาที
หน่วยงานกำกับดูแลเห็นตรงกันว่าความหน่วงสำคัญ แต่แทบไม่มีใครกำหนดตัวเลข Ofcom เป็นหน่วยงานกำกับดูแลรายใหญ่เพียงรายเดียวในสรุปนี้ที่มีเป้าหมายความหน่วงเป็นตัวเลข และได้ขยับเป้าหมายนั้นไปในทิศทางที่ผ่อนปรนขึ้น จากความล่าช้าสูงสุด 3 วินาทีใน Code on Television Access Services มาเป็นค่าเฉลี่ยไม่เกิน 4.5 วินาทีตลอดรายการสดของผู้ให้บริการ ระหว่างการรับฟังความเห็นปี 2023 Ofcom ระบุว่าผู้แพร่ภาพมองว่าเพดาน 3 วินาทีไม่สอดคล้องกับความเป็นจริง และ 4.5 วินาทีตรงกับความหน่วงที่ดีที่สุดที่ผู้แพร่ภาพแต่ละรายเคยทำได้ (Ofcom Guidelines on Providing Television and On-Demand Access Services)
แนวทางของสหรัฐฯ เป็นเชิงคุณภาพ FCC รับรองมาตรฐานคุณภาพคำบรรยายเมื่อวันที่ 20 กุมภาพันธ์ 2014 ครอบคลุมความแม่นยำ ความสอดคล้องของเวลา ความครบถ้วน และตำแหน่งการแสดงผล และระบุเพียงว่าความล่าช้าของคำบรรยายสด ‘ควรอยู่ในระดับต่ำสุด โดยสอดคล้องกับการนำเสนอสิ่งที่พูดอย่างถูกต้อง’ (FCC, มาตรฐานคุณภาพคำบรรยาย) แคนาดากำกับดูแลความแม่นยำแทนเวลา: Broadcasting Regulatory Policy 2019-308 ของ CRTC กำหนดให้คำบรรยายสดภาษาอังกฤษต้องได้คะแนน 98 ตามโมเดล NER ผลในทางปฏิบัติคือคำบรรยายที่มาช้า 10 วินาทีอาจเป็นไปตามข้อกำหนดทุกประการในแทบทุกประเทศ
| ตัวชี้วัด | ค่า | แหล่งที่มา |
|---|---|---|
| แนวปฏิบัติเดิมของ Ofcom | ความล่าช้าสูงสุด 3 วินาที | Ofcom Code on Television Access Services |
| แนวปฏิบัติปัจจุบันของ Ofcom | ค่าเฉลี่ยไม่เกิน 4.5 วินาทีตลอดรายการสด | Ofcom Guidelines on Providing TV and On-Demand Access Services |
| แนวทางความเร็วซับไตเติลเดิมของ Ofcom: บันทึกไว้ล่วงหน้า / สด | 160-180 คำต่อนาที / 200 คำต่อนาที | การรับฟังความเห็นปี 2023 ของ Ofcom ตามที่ Liam O’Dell รายงาน |
| เพดานความหน่วงเป็นตัวเลขของ FCC | ไม่มี (ความล่าช้า ‘อยู่ในระดับต่ำสุด’) | FCC 14-12, รับรองเมื่อ 20 กุมภาพันธ์ 2014 |
| การห้ามของ FCC ต่อคำบรรยาย ENT ที่ใช้เทเลพรอมเตอร์อย่างเดียวสำหรับรายการสด | 4 เครือข่ายใหญ่และสถานีในเครือใน 25 ตลาดแรก | FCC 14-12 |
| การใส่คำบรรยายรายการใหม่ที่ไม่ได้รับการยกเว้น (FCC) | 100% ตั้งแต่ 1 มกราคม 2006 | 47 CFR 79.1 |
| ข้อกำหนดความแม่นยำคำบรรยายสดภาษาอังกฤษของ CRTC | คะแนน NER 98 ตั้งแต่ 1 กันยายน 2019 | CRTC 2019-308 |
| ข้อผูกพันด้านการติดตามตรวจสอบของ CRTC | 2 รายการสดต่อเดือน รวมรายการข่าว 1 รายการ | CRTC 2019-308 |
หมายเหตุบริบท: ACMA ของออสเตรเลีย ภายใต้ Broadcasting Services (Television Captioning) Standard 2023 ซึ่งมีผลบังคับใช้ตั้งแต่ 1 ตุลาคม 2023 ก็ไม่ได้กำหนดความหน่วงเป็นตัวเลขเช่นกัน และประเมินความอ่านง่าย ความแม่นยำ และความเข้าใจได้เป็นรายกรณี
กฎล่าสุดขยายภาระผูกพันไปสู่บริการสตรีมมิงแทนที่จะเข้มงวดเรื่องความล่าช้า CRTC 2026-98 ของแคนาดากำหนดให้ผู้ให้บริการสตรีมมิงออนไลน์ใส่คำบรรยายให้ 80% ของแคตตาล็อกภายในพฤษภาคม 2030 และ 100% ภายในพฤษภาคม 2031 โดยรายการต้นฉบับใหม่ทั้งแบบสดและบันทึกไว้ล่วงหน้าต้องมีคำบรรยายภายในหนึ่งปี (CRTC 2026-98, 25 พฤษภาคม 2026) ร่าง Tier 1 Accessibility Code ของ Ofcom ที่เผยแพร่เมื่อ 14 พฤษภาคม 2026 เสนอโควตาซับไตเติล 80% สำหรับผู้ให้บริการสตรีมมิงรายใหญ่ที่สุด เมื่อครบสี่ปีหลังการเผยแพร่ (Ofcom, การรับฟังความเห็น Tier 1 Accessibility Code)
| ตัวชี้วัด | ค่า | แหล่งที่มา |
|---|---|---|
| การใส่คำบรรยายแคตตาล็อกของผู้ให้บริการสตรีมมิงในแคนาดา | 80% ภายในพฤษภาคม 2030, 100% ภายในพฤษภาคม 2031 | CRTC 2026-98 |
| ข้อกำหนดความแม่นยำของแคนาดาสำหรับรายการต้นฉบับที่บันทึกไว้ล่วงหน้าบนบริการสตรีมมิง | 100% | CRTC 2026-98 |
| โควตาซับไตเติล Tier 1 ของ Ofcom ปีที่ 4 / ปีที่ 1 | 80% / 20% | ร่าง Tier 1 Accessibility Code ของ Ofcom, พฤษภาคม 2026 |
| โควตาซับไตเติลบริการตามคำขอของ BBC ปีที่ 4 | 90% | ร่าง Tier 1 Accessibility Code ของ Ofcom, พฤษภาคม 2026 |
| เกณฑ์ของ Tier 1 | ผู้ใช้เฉลี่ยต่อเดือนในสหราชอาณาจักร 500,000 คนขึ้นไป | ร่าง Tier 1 Accessibility Code ของ Ofcom, พฤษภาคม 2026 |
3. ความแม่นยำ: เส้น NER 98% และใครผ่านเกณฑ์
ความล่าช้ากับความแม่นยำต้องแลกกัน ตัวเลขความหน่วงจึงมีความหมายก็ต่อเมื่อวางเคียงกับตัวเลขความแม่นยำ เครื่องวัดที่ใช้กันทั่วไปคือโมเดล NER ซึ่งให้คะแนนซับไตเติลสดเป็น (จำนวนคำ ลบด้วยข้อผิดพลาดจากการแก้ไขและการรู้จำ) หารด้วยจำนวนคำ 98% คือ ‘ยอมรับได้’ 98.5-98.99% คือ ‘ดี’ 99-99.49% คือ ‘ดีมาก’ และสูงกว่า 99.5% คือ ‘ยอดเยี่ยม’ (Romero-Fresco และ Martinez, โมเดล NER, 2015) เกณฑ์นี้ดูผ่อนปรนจนกว่าจะแปลงเป็นตัวเลขจริง: ที่ 98% ทุก 100 คำจะมีสองคำที่ผิด ขาดหาย หรือเป็นข้อผิดพลาดถ่วงน้ำหนัก
ผู้แพร่ภาพของสหราชอาณาจักรผ่านเกณฑ์โดยเฉลี่ย: 98.38% จากสี่รอบของ Ofcom และ 98.55% ในรอบสุดท้าย วัดจากซับไตเติล 78,000 รายการและ 546,000 คำ (Moores, JoSTrans 33) แต่ค่าเฉลี่ยซ่อนส่วนหางของข้อมูลไว้ ในเดือนตุลาคม-พฤศจิกายน 2014 77% ของรายการในสหราชอาณาจักรได้ 98% ขึ้นไป เพิ่มจาก 74% ในเดือนเมษายน-พฤษภาคม 2014 และข่าวเป็นประเภทที่แม่นยำที่สุดที่ 98.75% (รายงานฉบับที่สามของ Ofcom, 2015) ข่าวระดับประเทศภาษาอังกฤษในสหรัฐฯ ทำได้ดีกว่า โดยเฉลี่ย 98.8% และ 14 จาก 20 ตัวอย่างได้ระดับยอมรับได้หรือสูงกว่า ส่วนข่าวภาษาสเปนตกลงมาที่ 97.04% (Fresno, 2024)
| ตัวชี้วัด | ค่า | แหล่งที่มา |
|---|---|---|
| เกณฑ์ NER ยอมรับได้ / ยอดเยี่ยม | 98% / สูงกว่า 99.5% | Romero-Fresco และ Martinez, 2015 |
| ความแม่นยำซับไตเติลสดในสหราชอาณาจักร ค่าเฉลี่ยสี่รอบ | 98.38% | ข้อมูล Ofcom ผ่าน Moores, JoSTrans 33 |
| ความแม่นยำซับไตเติลสดในสหราชอาณาจักร รอบสุดท้าย | 98.55% | ข้อมูล Ofcom ผ่าน Moores, JoSTrans 33 |
| รายการในสหราชอาณาจักรที่ได้ 98% ขึ้นไป ตุลาคม-พฤศจิกายน 2014 (เทียบกับเมษายน-พฤษภาคม 2014) | 77% (74%) | รายงานฉบับที่สามของ Ofcom, 2015 |
| ความแม่นยำประเภทข่าวในสหราชอาณาจักร | 98.75% | รายงานฉบับที่สามของ Ofcom, 2015 |
| ข่าวระดับประเทศภาษาอังกฤษในสหรัฐฯ NER เฉลี่ย | 98.8% (14 จาก 20 ตัวอย่างยอมรับได้หรือดีกว่า) | Fresno, Universal Access in the Information Society, 2024 |
| ข่าวภาษาสเปนในสหรัฐฯ NER เฉลี่ย | 97.04% (Telemundo 97.00%, Univision 97.10%) | Fresno, JoSTrans 42, 2024 |
| การลดทอนข้อความ: ข่าวภาษาสเปนเทียบกับภาษาอังกฤษ | 26% เทียบกับ 5-6% | Fresno, JoSTrans 42, 2024 |
หมายเหตุบริบท: ความเร็วคือตัวแปรที่สามที่ซ่อนอยู่ Ofcom แนะนำให้ซับไตเติลมีความเร็วเฉลี่ยต่ำกว่า 180 คำต่อนาที แต่รายการเกือบทั้งหมดที่วิเคราะห์มีช่วงสั้น ๆ ที่เร็วกว่า 200 คำต่อนาที และเมื่อนับช่วงเหล่านั้นเป็นข้อผิดพลาด 68% ของรายการจะได้ต่ำกว่า 98% (รายงานฉบับที่สามของ Ofcom, 2015) งานศึกษาข่าวภาษาอังกฤษในสหรัฐฯพบว่าเกือบสองในสามของข้อผิดพลาดเป็นข้อผิดพลาดเล็กน้อย
4. ความล่าช้าสร้างต้นทุนให้ผู้ชมอย่างไร
กลุ่มผู้ใช้ซับไตเติลสดกว้างกว่าชุมชนผู้หูหนวกมาก Ofcom ประเมินว่า ผู้ใหญ่ในสหราชอาณาจักรราว 7.6 ล้านคนเคยใช้ซับไตเติล ซึ่งมีเพียง 1.4 ล้านคนที่มีความบกพร่องทางการได้ยิน (ข่าวประชาสัมพันธ์ของ Ofcom ผ่าน Wired-Gov, พฤษภาคม 2013) นั่นหมายถึงผู้ใช้ซับไตเติลที่ไม่มีความบกพร่องทางการได้ยินมากกว่า 6 ล้านคน (7.6 ล้านลบ 1.4 ล้าน) ซึ่งหลายคนดูในห้องที่มีเสียงดังหรือเปิดเสียงเบา แนวปฏิบัติของ Ofcom ยังอ้างข้อมูลจาก YouGov ว่า 61% ของคนอายุ 18-24 ปีชอบเปิดซับไตเติล ในระดับโลก WHO ประมาณการว่าปัจจุบันมี 430 ล้านคนที่ต้องการการฟื้นฟูสมรรถภาพจากการสูญเสียการได้ยินระดับที่ส่งผลต่อการใช้ชีวิต และจะเพิ่มเป็นมากกว่า 700 ล้านคนภายในปี 2050
| ตัวชี้วัด | ค่า | แหล่งที่มา |
|---|---|---|
| ผู้ใหญ่ในสหราชอาณาจักรที่เคยใช้ซับไตเติล | ราว 7.6 ล้านคน (ช่วง 7.0-8.1 ล้านคน) | Ofcom, พฤษภาคม 2013 |
| ในจำนวนนั้นที่มีความบกพร่องทางการได้ยิน | ราว 1.4 ล้านคน (ช่วง 1.2-1.6 ล้านคน) | Ofcom, พฤษภาคม 2013 |
| ชาวสหราชอาณาจักรอายุ 18-24 ปีที่ชอบเปิดซับไตเติล | 61% | YouGov อ้างอิงในแนวปฏิบัติด้านบริการเข้าถึงของ Ofcom |
| สัดส่วนชั่วโมงรายการของ PSB ในสหราชอาณาจักรและบริการตามคำขอรายใหญ่ที่มีซับไตเติล ปี 2024 | 88% | Ofcom Access Services Report, มกราคม-ธันวาคม 2024 (เผยแพร่ 19 พฤษภาคม 2025) |
| ชั่วโมงที่มีซับไตเติลบนช่องที่ถูกกำหนดในสหราชอาณาจักร ปี 2005 เทียบกับ 2013 | 40.5% เทียบกับ 81.9% | รายงานซับไตเติลสดฉบับแรกของ Ofcom, 2014 |
| ผู้ที่ต้องการการฟื้นฟูสมรรถภาพจากการสูญเสียการได้ยินระดับที่ส่งผลต่อการใช้ชีวิต | 430 ล้านคน | เอกสารข้อเท็จจริงของ WHO, ปรับปรุงมีนาคม 2026 |
| ผู้ที่คาดว่าจะมีการสูญเสียการได้ยินในระดับใดระดับหนึ่งภายในปี 2050 | เกือบ 2.5 พันล้านคน | เอกสารข้อเท็จจริงของ WHO, ปรับปรุงมีนาคม 2026 |
ความล่าช้าคือสิ่งที่ผู้ชมสังเกตเห็นก่อน งานศึกษาผู้ใช้ล่าสุดที่ใหญ่ที่สุดขอให้ผู้ชมที่หูหนวกและมีปัญหาการได้ยิน 216 คนให้คะแนนคลิปทีวีสด 70 คลิปในสี่เงื่อนไข ได้คะแนนทั้งหมด 4,832 รายการ คำบรรยายทีวีชุดเดียวกันได้ 3.66 จาก 7 เมื่อมีความล่าช้าตามการออกอากาศเดิม และ 5.09 เมื่อปรับให้ตรงเวลา ซึ่งต่างกันมากกว่าช่องว่างระหว่างคำบรรยายทีวีที่ตรงเวลากับคำบรรยาย ASR อย่างชัดเจน (Thompson และคณะ, Are Caption Metrics Broken?, arXiv 2609.11408, กันยายน 2026) คำบรรยาย ASR ที่ล่าช้าสองวินาทีทนทานกว่ามาก โดยได้ 4.81 เทียบกับ 5.20 เมื่อตรงเวลา
งานศึกษาเดียวกันนี้ยังทำลายแนวคิดที่ว่าคะแนนความแม่นยำสะท้อนคุณภาพ มีเพียง 11 จาก 70 คลิปทีวีและ 4 จาก 70 คลิป ASR ที่ถึงเกณฑ์ NER 98 ทว่าผู้ชมให้คะแนนคำบรรยาย ASR และทีวีที่ตรงเวลาใกล้เคียงกัน และความสัมพันธ์ระหว่างตัวชี้วัดกับคะแนนลดลงอย่างมากสำหรับผลลัพธ์ของ ASR (WER r = -0.390 เทียบกับ -0.687 สำหรับคำบรรยายทีวี) งานศึกษา CHI 2024 ก่อนหน้านี้ของ Gallaudet ได้ข้อสรุปคล้ายกัน คือผู้เข้าร่วมไม่ชอบความล่าช้าของการออกอากาศอย่างมาก และตัวชี้วัดความแม่นยำมาตรฐานสัมพันธ์กับคะแนนที่ผู้ชมให้คำบรรยายเพียงเล็กน้อย
| ตัวชี้วัด | ค่า | แหล่งที่มา |
|---|---|---|
| ผู้เข้าร่วม / คะแนน / คลิป | 216 / 4,832 / 70 | Thompson และคณะ, arXiv 2609.11408, 2026 |
| คะแนนคำบรรยายทีวี: ความล่าช้าเดิมเทียบกับตรงเวลา (มาตราส่วน 7 คะแนน) | 3.66 เทียบกับ 5.09 | Thompson และคณะ, 2026 |
| คะแนนคำบรรยาย ASR: ล่าช้า 2 วินาทีเทียบกับตรงเวลา | 4.81 เทียบกับ 5.20 | Thompson และคณะ, 2026 |
| WER เฉลี่ย: คำบรรยายทีวีเทียบกับคำบรรยาย ASR | 33.8% เทียบกับ 17.2% | Thompson และคณะ, 2026 |
| NER เฉลี่ย: คำบรรยายทีวีเทียบกับคำบรรยาย ASR | 95.28 เทียบกับ 94.34 | Thompson และคณะ, 2026 |
| คลิปที่ถึง NER 98: ทีวีเทียบกับ ASR | 11 จาก 70 เทียบกับ 4 จาก 70 | Thompson และคณะ, 2026 |
| ความสัมพันธ์ของ WER กับคะแนนผู้ชม: ทีวีเทียบกับ ASR | r = -0.687 เทียบกับ -0.390 | Thompson และคณะ, 2026 |
หมายเหตุบริบท: WER ที่สูงของคำบรรยายทีวีส่วนหนึ่งสะท้อนว่าคำบรรยายสำหรับการแพร่ภาพมักเรียบเรียงและย่อความ ซึ่ง WER ลงโทษแต่ NER ไม่ลงโทษ ช่องว่างนี้เองคือเหตุผลที่ผู้เขียนโต้แย้งว่าตัวชี้วัดปัจจุบันไม่เป็นกลางต่อเทคโนโลยี
5. ความเร็วของเอนจิน ASR: ความหน่วงแบบสตรีมมิงเทียบกับบทสนทนาของมนุษย์
ความหน่วงของเอนจินไม่ใช่ต้นเหตุหลักของความล่าช้าของซับไตเติลอีกต่อไป AssemblyAI รายงานความหน่วงสตรีมมิงมัธยฐาน 307 ms สำหรับ Universal-Streaming เทียบกับ 516 ms ของ Deepgram Nova-3 และ P99 ที่ 1,012 ms เทียบกับ 1,907 ms วัดจากจุดสิ้นสุดของคำในเสียงถึงการปรากฏครั้งแรกในทรานสคริปต์บางส่วน จากเสียงกว่า 205 ชั่วโมง (AssemblyAI, Introducing Universal-Streaming, 2 มิถุนายน 2025) ข้อมูลเปิดตัวของ Deepgram เองระบุอัตราคำผิดพลาดมัธยฐานแบบสตรีมมิงของ Nova-3 ที่ 6.84% เทียบกับ 14.92% ของคู่แข่งที่ทดสอบ (Deepgram, Introducing Nova-3, กุมภาพันธ์ 2025) ทั้งสองเป็นเกณฑ์วัดผลจากผู้ให้บริการ จึงควรอ่านเป็นตัวเลขในกรณีที่ดีที่สุด สถิติการแปลงเสียงเป็นข้อความของเราครอบคลุมความแม่นยำของเอนจินอื่น ๆ เพิ่มเติม
โมเดลเปิดยอมแลกความล่าช้าที่มากขึ้นกับความเสถียร ระบบวิชาการ Whisper-Streaming มีความหน่วงเฉลี่ย 3.3 วินาทีกับเสียงพูดภาษาอังกฤษแบบยาว จากชุดทดสอบ ESIC ของรัฐสภายุโรป และการแลกเปลี่ยนนี้ปรากฏชัดในผลลัพธ์: WER ภาษาอังกฤษ 8.5% ที่ความหน่วง 3.27 วินาทีเมื่อใช้ช่วงเสียง 0.5 วินาที เทียบกับ 8.0% ที่ 5.45 วินาทีเมื่อใช้ช่วงเสียง 2 วินาที (Machacek, Dabre และ Bojar, arXiv 2307.14743, IJCNLP-AACL 2023) สังเกตว่าการตั้งค่า Whisper ที่ 5 วินาทีไปตกอยู่ตรงกับค่าเฉลี่ยของการแพร่ภาพในสหราชอาณาจักรเมื่อทศวรรษก่อนพอดี
| ตัวชี้วัด | ค่า | แหล่งที่มา |
|---|---|---|
| ความหน่วงมัธยฐาน / P99 ของ AssemblyAI Universal-Streaming | 307 ms / 1,012 ms | AssemblyAI, มิถุนายน 2025 |
| ความหน่วงมัธยฐาน / P99 ของ Deepgram Nova-3 (การทดสอบของ AssemblyAI) | 516 ms / 1,907 ms | AssemblyAI, มิถุนายน 2025 |
| WER มัธยฐานของ Deepgram Nova-3: สตรีมมิง / แบบแบตช์ | 6.84% / 5.26% | Deepgram, กุมภาพันธ์ 2025 |
| ชุดเกณฑ์วัดผลของ Deepgram Nova-3 | 2,703 ไฟล์ 81.69 ชั่วโมง 9 โดเมน | Deepgram, กุมภาพันธ์ 2025 |
| ความหน่วงเฉลี่ยของ Whisper-Streaming ภาษาอังกฤษ | 3.3 วินาที | Machacek และคณะ, 2023 |
| Whisper-Streaming ภาษาอังกฤษ: ช่วงเสียง 0.5 วินาทีเทียบกับ 2.0 วินาที | WER 8.5% ที่ 3.27 วินาที เทียบกับ WER 8.0% ที่ 5.45 วินาที | Machacek และคณะ, 2023 |
| ความหน่วงของ Whisper-Streaming ภาษาเยอรมัน / เช็ก (ช่วงเสียง 0.5 วินาที) | 4.11 วินาที / 4.69 วินาที | Machacek และคณะ, 2023 |
เพดานของเรียลไทม์ถูกกำหนดโดยบทสนทนาของมนุษย์ ใน 10 ภาษา ช่องว่างเฉลี่ยระหว่างคำถามกับคำตอบคือ +208 ms ตั้งแต่ +7 ms ในภาษาญี่ปุ่นไปจนถึง +469 ms ในภาษาเดนมาร์ก (Stivers และคณะ, PNAS 2009) การเปิดตัว GPT-4o ของ OpenAI อ้างว่าตอบกลับด้วยเสียงได้เร็วที่สุด 232 ms และเฉลี่ย 320 ms เทียบกับ 2.8 วินาที (GPT-3.5) และ 5.4 วินาที (GPT-4) ของ Voice Mode แบบไปป์ไลน์เดิม ซึ่งเชื่อมโมเดลถอดเสียง โมเดลภาษา และโมเดลเสียงพูดที่แยกจากกัน บทเรียนสำหรับซับไตเติลสดก็เหมือนกัน: ทุกขั้นตอนที่เพิ่มเข้าไปในห่วงโซ่เพิ่มเวลาเป็นวินาที และขั้นตอนที่เคยครองสัดส่วนมากที่สุด คือการรู้จำเสียงเอง ตอนนี้กลายเป็นขั้นตอนที่เล็กที่สุด
| ตัวชี้วัด | ค่า | แหล่งที่มา |
|---|---|---|
| ช่องว่างเฉลี่ยจากคำถามถึงคำตอบ 10 ภาษา | +208 ms | Stivers และคณะ, PNAS 2009 (ข้อมูลล่าสุดที่มี) |
| ค่าเฉลี่ยของภาษาที่เร็วที่สุด / ช้าที่สุด | +7 ms (ญี่ปุ่น) / +469 ms (เดนมาร์ก) | Stivers และคณะ, PNAS 2009 |
| การตอบกลับด้วยเสียงของ GPT-4o: ต่ำสุด / เฉลี่ย | 232 ms / 320 ms | OpenAI, พฤษภาคม 2024 |
| ความหน่วงเฉลี่ยของ Voice Mode แบบไปป์ไลน์: GPT-3.5 / GPT-4 | 2.8 วินาที / 5.4 วินาที | OpenAI, พฤษภาคม 2024 |
| ความล่าช้าของคำบรรยาย ASR ที่ใช้ในงานศึกษาผู้ชมปี 2026 | เฉลี่ย 2 วินาที | Thompson และคณะ, arXiv 2609.11408 |
6. ระบบอัตโนมัติเข้ามาแทนที่ห่วงโซ่การทำคำบรรยาย
แรงงานมนุษย์เบื้องหลังซับไตเติลสดถูกกำหนดด้วยขีดจำกัดด้านความเร็ว เกณฑ์เรียลไทม์ของสหรัฐฯ คือ NCRA Certified Realtime Reporter ซึ่งกำหนดการทดสอบเรียลไทม์ห้านาทีที่ 200 คำต่อนาทีด้วยความแม่นยำ 96% และรายงานของ EBUอธิบายว่าการทำซับไตเติลสดคือการตามให้ทันผู้พูดที่พูดเร็วถึง 200 คำต่อนาที ผู้พูดซ้ำ (respeaker) ในสหราชอาณาจักรบอกนักวิจัยว่าการฝึกพื้นฐานใช้เวลา 2-3 เดือน ส่วนการจะรู้สึกมั่นใจต้องใช้ 1.5-2 ปี (Moores, JoSTrans 33) ข้อจำกัดเหล่านี้คือเหตุผลที่คำบรรยายอัตโนมัติขยายตัวเร็วมากเมื่อความแม่นยำเริ่มใกล้เคียง
การเปลี่ยนแปลงด้านปริมาณเห็นได้จากเอกสารของบริษัท คำบรรยายอัตโนมัติ LEXI ของ Ai-Media แตะ 79.2 ล้านนาทีในปีงบประมาณ FY25 เพิ่มจากไม่ถึง 10 ล้านนาทีเมื่อสี่ปีก่อน หรืออัตราเติบโตเฉลี่ยต่อปีแบบทบต้นสี่ปีที่ 69% และ LEXI คิดเป็นการใช้งานส่วนใหญ่บนเครือข่าย iCap ของบริษัทในตอนนี้ (ผลประกอบการ FY25 ของ Ai-Media, ประกาศ ASX, 28 สิงหาคม 2025) ผลิตภัณฑ์เทคโนโลยีคิดเป็น 63% ของรายได้ Ai-Media จากศูนย์เมื่อห้าปีก่อน การทดสอบอิสระกับระบบเดียวกันพบความแม่นยำ NER 98.56% ในภาษาอังกฤษ และ 98.26% ในภาษาสเปน เทียบเท่าคำบรรยายที่มนุษย์ทำ ยกเว้นเนื้อหาภาษาพูดที่มีผู้พูดหลายคน (Romero-Fresco และ Van Gauwbergen, Fit for What Purpose?, 2025) อ่านเพิ่มเติมเกี่ยวกับด้านมนุษย์ของวิชาชีพนี้ได้ในสถิติความแม่นยำของการถอดเสียงในห้องพิจารณาคดีของเรา
| ตัวชี้วัด | ค่า | แหล่งที่มา |
|---|---|---|
| มาตรฐานเรียลไทม์ NCRA CRR | 200 คำต่อนาทีด้วยความแม่นยำ 96% (ทดสอบ 5 นาที) | NCRA |
| การฝึกพื้นฐานของผู้พูดซ้ำ / เวลาจนรู้สึกมั่นใจ | 2-3 เดือน / 1.5-2 ปี | Moores, JoSTrans 33 |
| นาทีคำบรรยายอัตโนมัติ LEXI ของ Ai-Media ปีงบประมาณ FY25 | 79.2 ล้านนาที | ผลประกอบการ FY25 ของ Ai-Media, ASX |
| นาที LEXI เมื่อสี่ปีก่อน | ไม่ถึง 10 ล้านนาที (อัตราเติบโตเฉลี่ยต่อปีแบบทบต้นสี่ปี 69%) | ผลประกอบการ FY25 ของ Ai-Media, ASX |
| สัดส่วนเทคโนโลยีในรายได้ของ Ai-Media | 63% (รายได้รวม 64.9 ล้านดอลลาร์สหรัฐ) | ผลประกอบการ FY25 ของ Ai-Media, ASX |
| ความแม่นยำ NER ของคำบรรยายอัตโนมัติ: อังกฤษ / สเปน | 98.56% / 98.26% | Romero-Fresco และ Van Gauwbergen, 2025 |
| คำบรรยายสดที่วิเคราะห์เปรียบเทียบผลลัพธ์อัตโนมัติกับมนุษย์ สหราชอาณาจักร/สหรัฐฯ/แคนาดา 2018-2022 | ราว 17,000 รายการ | Romero-Fresco และ Fresno, Linguistica Antverpiensia 22, 2023 |
หมายเหตุบริบท: การเปรียบเทียบมนุษย์กับเครื่องที่ใหญ่ที่สุดจนถึงตอนนี้ (Romero-Fresco และ Fresno, Linguistica Antverpiensia, 2023) พบว่าคำบรรยายอัตโนมัติที่ไม่ผ่านการแก้ไขใกล้เคียง 98% โดยยังมีจุดอ่อนต่อเนื่องเรื่องเครื่องหมายวรรคตอน ชื่อเฉพาะ ตัวเลข และการระบุตัวผู้พูด ความหน่วงของเอนจินที่ต่ำลงแก้เรื่องเหล่านี้ไม่ได้ ชื่อที่ผิดแต่มาเร็วก็ยังคือชื่อที่ผิด
สรุป: ความหน่วงของซับไตเติลสดแบบเรียลไทม์ในรูปแบบตัวเลข
| ตัวชี้วัด | ค่า | แหล่งที่มา |
|---|---|---|
| ความหน่วงเฉลี่ยของซับไตเติลสดในสหราชอาณาจักร ปลายปี 2014 | 5.1 วินาที | รายงานฉบับที่สามของ Ofcom, 2015 |
| ตัวอย่างในสหราชอาณาจักรที่ผ่านแนวปฏิบัติ 3 วินาที รอบที่สอง | 4 จาก 72 | รายงานฉบับที่สองของ Ofcom, 2014 |
| ความล่าช้าสูงสุดที่บันทึกได้ในสหราชอาณาจักร | 21 วินาที | รายงานฉบับที่สองของ Ofcom, 2014 |
| แนวปฏิบัติความหน่วงปัจจุบันของ Ofcom | ค่าเฉลี่ย 4.5 วินาทีหรือน้อยกว่า | แนวปฏิบัติด้านบริการเข้าถึงของ Ofcom |
| เพดานความหน่วงเป็นตัวเลขของ FCC | ไม่มี | FCC 14-12, 2014 |
| ความแม่นยำคำบรรยายสดภาษาอังกฤษของ CRTC | NER 98 | CRTC 2019-308 |
| ความล่าช้าของคำบรรยายข่าวภาษาสเปนในสหรัฐฯ | เฉลี่ย 8.2 วินาที | Fresno, JoSTrans 42, 2024 |
| คำบรรยายข่าวภาษาสเปนในสหรัฐฯ ที่ล่าช้ากว่า 10 วินาที | 20% | Fresno, JoSTrans 42, 2024 |
| ความล่าช้าเฉลี่ยของคลิปทีวีสดในสหรัฐฯ | 8.46 วินาที | Thompson และคณะ, arXiv 2609.11408, 2026 |
| คะแนนคำบรรยายทีวี: ล่าช้าเทียบกับตรงเวลา | 3.66 เทียบกับ 5.09 จาก 7 | Thompson และคณะ, 2026 |
| ความแม่นยำซับไตเติลสดในสหราชอาณาจักร ค่าเฉลี่ยสี่รอบ | 98.38% | ข้อมูล Ofcom ผ่าน Moores, JoSTrans 33 |
| ความแม่นยำข่าวระดับประเทศภาษาอังกฤษในสหรัฐฯ | 98.8% | Fresno, 2024 |
| ความแม่นยำคำบรรยายอัตโนมัติ ภาษาอังกฤษ | 98.56% | Romero-Fresco และ Van Gauwbergen, 2025 |
| ผู้ใหญ่ในสหราชอาณาจักรที่เคยใช้ซับไตเติล | ราว 7.6 ล้านคน | Ofcom, 2013 |
| ชั่วโมงที่มีซับไตเติลของ PSB ในสหราชอาณาจักรและบริการตามคำขอรายใหญ่ ปี 2024 | 88% | Ofcom Access Services Report 2024 |
| ความหน่วงสตรีมมิงมัธยฐานของ AssemblyAI | 307 ms | AssemblyAI, มิถุนายน 2025 |
| ความหน่วงเฉลี่ยของ Whisper-Streaming | 3.3 วินาที | Machacek และคณะ, 2023 |
| ช่องว่างเฉลี่ยในการสลับผลัดกันพูดของมนุษย์ | 208 ms | Stivers และคณะ, PNAS 2009 |
| นาทีคำบรรยาย LEXI ของ Ai-Media ปีงบประมาณ FY25 | 79.2 ล้านนาที | ผลประกอบการ FY25 ของ Ai-Media |
| การใส่คำบรรยายแคตตาล็อกของผู้ให้บริการสตรีมมิงในแคนาดาภายในพฤษภาคม 2031 | 100% | CRTC 2026-98 |
ระเบียบวิธีและแหล่งที่มา
ตัวเลขทุกตัวข้างต้นถูกสืบย้อนไปยังหน่วยงานกำกับดูแล เอกสารที่ยื่นต่อหน่วยงาน หรือบทความที่ผ่านการพิจารณาโดยผู้ทรงคุณวุฒิที่เป็นผู้จัดทำ ไฟล์ PDF ของ Ofcom หลายฉบับไม่สามารถดึงโดยตรงได้ ตัวเลขของสหราชอาณาจักรจึงนำมาจากข่าวประชาสัมพันธ์ของ Ofcom (เผยแพร่ซ้ำบน Wired-Gov) สรุปจากหน่วยงานกำกับดูแล (EPRA) และการวิเคราะห์ชุดข้อมูลของ Ofcom ที่ผ่านการพิจารณาโดยผู้ทรงคุณวุฒิ (Moores) โดยระบุแหล่งไว้ในเนื้อหาแต่ละจุด เกณฑ์วัดผลจากผู้ให้บริการถูกระบุว่าเป็นข้อมูลจากผู้ให้บริการ สำหรับข้อมูลตลาดและการใช้งานคำบรรยายโดยทั่วไป ดูสถิติคำบรรยายและซับไตเติลของเรา
- Ofcom: ข่าวประชาสัมพันธ์รายงานซับไตเติลสดฉบับที่สาม (Wired-Gov, พฤษภาคม 2015), ข่าวประชาสัมพันธ์การรับฟังความเห็นเรื่องซับไตเติลสด (Wired-Gov, พฤษภาคม 2013), Guidelines on Providing Television and On-Demand Access Services, Access Services Report มกราคม-ธันวาคม 2024, การรับฟังความเห็น Tier 1 Accessibility Code (พฤษภาคม 2026)
- EPRA: สรุปรายงานซับไตเติลสดฉบับแรกของ Ofcom (เมษายน 2014)
- Limping Chicken: รายงานเกี่ยวกับรายงานซับไตเติลสดฉบับที่สองของ Ofcom (พฤศจิกายน 2014)
- Liam O’Dell: รายงานเกี่ยวกับการรับฟังความเห็นเรื่องประมวลการเข้าถึงปี 2023 ของ Ofcom และการรับฟังความเห็นเรื่องประมวล Tier 1
- FCC: มาตรฐานคุณภาพคำบรรยาย, FCC 14-12 (2014) และ 47 CFR 79.1
- CRTC: Broadcasting Regulatory Policy 2019-308 และ Broadcasting Regulatory Policy 2026-98
- ACMA / รัฐบาลออสเตรเลีย: Broadcasting Services (Television Captioning) Standard 2023
- EBU: รายงานเกี่ยวกับบริการเข้าถึงและซับไตเติลสด (i044) และ Tech 3370, EBU-TT Part 3 Live Subtitling
- Thompson, Kushalnagar, Vogler และคณะ: Are Caption Metrics Broken?, arXiv 2609.11408 (กันยายน 2026); Glasser, Kushalnagar และ Vogler: How Users Experience Closed Captions on Live Television, CHI 2024
- Fresno: Closed Captions en espanol, JoSTrans 42 (2024) และ Live captioning accuracy in English-language newscasts in the USA (2024)
- Moores: ซับไตเติลสดในงานสด, JoSTrans 33 (รวมการวิเคราะห์ชุดข้อมูลของ Ofcom)
- Romero-Fresco และ Fresno: The accuracy of automatic and human live captions in English (2023); Romero-Fresco และ Van Gauwbergen: Fit for What Purpose? (2025); Romero-Fresco และ Martinez: โมเดล NER (2015)
- Machacek, Dabre และ Bojar: Turning Whisper into Real-Time Transcription System (2023)
- AssemblyAI: Introducing Universal-Streaming (มิถุนายน 2025); Deepgram: Introducing Nova-3 (กุมภาพันธ์ 2025)
- OpenAI: Hello GPT-4o (พฤษภาคม 2024)
- Stivers และคณะ: Universals and cultural variation in turn-taking in conversation, PNAS (2009)
- Ai-Media: ผลประกอบการ FY25, ประกาศ ASX (สิงหาคม 2025)
- NCRA: Certified Realtime Reporter
- WHO: เอกสารข้อเท็จจริง Deafness and hearing loss (ปรับปรุงมีนาคม 2026)
- ข้อสังเกตเกี่ยวกับข้อมูล: ผลวัดความหน่วงรายผู้แพร่ภาพของ Ofcom (2013-2015) มีอายุเกินสามปีและยังเป็นชุดข้อมูลสาธารณะล่าสุดของประเภทนี้ที่มีอยู่ แต่ละรอบรายงานค่าที่ปะปนกันระหว่างมัธยฐานและค่าเฉลี่ย (5.6, 5.8, 5.7 เป็น 5.1 และค่าเฉลี่ยสี่รอบ 5.3 ผ่าน Moores) จึงควรมองเป็นช่วงค่ามากกว่าเส้นแนวโน้ม ตัวเลขประมาณการผู้ใช้ซับไตเติลของ Ofcom (7.6 ล้านคน) มาจากปี 2013 และข้อมูลการสลับผลัดกันพูดของ Stivers มาจากปี 2009 ตัวเลขของ AssemblyAI และ Deepgram เป็นเกณฑ์วัดผลจากผู้ให้บริการ การเปรียบเทียบของ AssemblyAI วัดคู่แข่งบนชุดทดสอบของตนเอง และการทดสอบอิสระของ Nova-3 รายงาน WER สูงกว่าตัวเลขของ Deepgram บทความของ Thompson และคณะปี 2026 เป็นพรีปรินต์บน arXiv และยังไม่ผ่านการพิจารณาโดยผู้ทรงคุณวุฒิ ตัวเลขรายได้ของ Ai-Media แสดงตามที่รายงานในประกาศ ASX การประเมินอิสระสองครั้งของระบบอัตโนมัติเดียวกันรายงานความแม่นยำหลักต่างกันตามความยากของเนื้อหา และงานศึกษาผู้ชมปี 2026 พบอัตราผ่านเกณฑ์ NER ต่ำกว่ามากกับคลิปทีวีสด ความแม่นยำของระบบอัตโนมัติจึงขึ้นอยู่กับประเภทเนื้อหามาก ประมวล Tier 1 ของ Ofcom เป็นร่างที่ปิดรับฟังความเห็นเมื่อ 7 สิงหาคม 2026 และคาดว่าจะมีแถลงการณ์ฉบับสุดท้ายออกมา
อัปเดตล่าสุด: 3 ตุลาคม 2026 เราจะอัปเดตสรุปนี้ทุกไตรมาส และคาดว่าการทบทวนครั้งถัดไปจะเกิดขึ้นเมื่อ Ofcom เผยแพร่แถลงการณ์ฉบับสุดท้ายของ Tier 1 Accessibility Code และ Access Services Report สำหรับช่วงมกราคม-ธันวาคม 2025