สถิติความหน่วงของซับไตเติลสดแบบเรียลไทม์ (2026): ข้อมูลกว่า 60 จุดเกี่ยวกับความล่าช้า ความแม่นยำ และความเร็ว ASR

สถิติความหน่วงซับไตเติลสดปี 2026: ซับไตเติลสดในสหราชอาณาจักรตามหลังเสียงพูด 5.1 ถึง 5.8 วินาที Ofcom ตั้งเป้า 4.5 วินาที ข่าวภาษาสเปนในสหรัฐฯ เฉลี่ย 8.2 วินาที

ซับไตเติลสดบนโทรทัศน์ของสหราชอาณาจักรตามหลังเสียงพูดเฉลี่ย 5.1 ถึง 5.8 วินาทีในรอบการวัดผลของ Ofcom และมีเพียง 4 จาก 72 ตัวอย่างในรอบที่สองที่ผ่านแนวปฏิบัติเดิม 3 วินาที (Ofcom, รายงานคุณภาพซับไตเติลสด 2014-2015) ปัญหานี้ยังไม่หมดไป งานศึกษาปี 2024 เกี่ยวกับข่าวภาษาสเปนในสหรัฐฯ วัดความล่าช้าเฉลี่ยได้ 8.2 วินาที โดยบางคำบรรยายมาช้าถึง 41 วินาที (Fresno, JoSTrans 2024) และงานศึกษาเดือนกันยายน 2026 วัดค่าเฉลี่ยได้ 8.46 วินาทีกับคลิปทีวีสดของสหรัฐฯ ขณะเดียวกัน เอนจินรู้จำเสียงพูดแบบสตรีมมิงรายงานความหน่วงต่อคำระดับมัธยฐานใกล้ 300 มิลลิวินาที (AssemblyAI, มิถุนายน 2025) คอขวดของการทำคำบรรยายสดจึงกำลังเคลื่อนจากผู้พิมพ์ที่เป็นมนุษย์ไปสู่ห่วงโซ่การแพร่ภาพ เรารวบรวมข้อมูลจาก Ofcom, FCC, CRTC, งานวิจัยที่ผ่านการพิจารณาโดยผู้ทรงคุณวุฒิจากมหาวิทยาลัย Gallaudet และ Universidade de Vigo, เอกสารเกณฑ์วัดผลบน arXiv, เอกสารที่ Ai-Media ยื่นต่อ ASX, WHO และแหล่งข้อมูลปฐมภูมิอื่น ๆ ที่ระบุไว้ในส่วนระเบียบวิธี สำหรับภาพรวมที่กว้างขึ้น ดูสรุปสถิติคำบรรยายสดของเรา

สรุปโดยย่อ

  • ความหน่วงเฉลี่ยของซับไตเติลสดในสหราชอาณาจักรลดจาก 5.7 เหลือ 5.1 วินาทีระหว่างเมษายน-พฤษภาคมถึงตุลาคม-พฤศจิกายน 2014 ซึ่งยังสูงกว่าแนวปฏิบัติ 3 วินาทีมาก (Ofcom, รายงานซับไตเติลสดฉบับที่สาม, 2015)
  • มีเพียง 4 จาก 72 ตัวอย่างในสหราชอาณาจักรที่ผ่านแนวปฏิบัติ 3 วินาทีในรอบที่สอง และความล่าช้าสูงสุดอยู่ที่ 21 วินาที (Ofcom, รายงานฉบับที่สอง, 2014)
  • ปัจจุบัน Ofcom ขอให้ความหน่วงเฉลี่ยไม่เกิน 4.5 วินาทีตลอดรายการสด (Ofcom Guidelines on Providing TV and On-Demand Access Services)
  • ข่าวภาษาสเปนในสหรัฐฯ มีความล่าช้าของคำบรรยายเฉลี่ย 8.2 วินาที และ 20% ของคำบรรยายมาช้ากว่า 10 วินาที (Fresno, JoSTrans 42, 2024)
  • คำบรรยายทีวีที่มีความล่าช้าตามการออกอากาศเดิม (เฉลี่ย 8.46 วินาที) ได้คะแนน 3.66/7 เทียบกับ 5.09/7 เมื่อปรับให้ตรงเวลา (Thompson และคณะ, arXiv 2609.11408, 2026)
  • ซับไตเติลสดในสหราชอาณาจักรมีความแม่นยำ NER เฉลี่ย 98.38% จากการวัดของ Ofcom สี่รอบ สูงกว่าเกณฑ์ 98% (ข้อมูล Ofcom ผ่าน Moores, JoSTrans 33)
  • ข่าวระดับประเทศภาษาอังกฤษในสหรัฐฯ มีความแม่นยำ NER เฉลี่ย 98.8% (Fresno, Universal Access in the Information Society, 2024)
  • ระบบคำบรรยายอัตโนมัติระบบหนึ่งได้คะแนน NER 98.56% ในภาษาอังกฤษ และ 98.26% ในภาษาสเปน (Romero-Fresco และ Van Gauwbergen, 2025)
  • AssemblyAI รายงานความหน่วงสตรีมมิงมัธยฐาน 307 ms เทียบกับ 516 ms ของ Deepgram Nova-3 (AssemblyAI, มิถุนายน 2025)
  • Whisper-Streaming มีความหน่วงเฉลี่ย 3.3 วินาทีกับเสียงพูดภาษาอังกฤษแบบยาว (Machacek, Dabre และ Bojar, IJCNLP-AACL 2023)
  • มนุษย์ตอบคำถามภายในเฉลี่ย 208 ms ใน 10 ภาษา (Stivers และคณะ, PNAS 2009) ซึ่งเป็นเกณฑ์ที่ระบบเรียลไทม์พยายามไล่ตาม
  • คำบรรยายอัตโนมัติ LEXI ของ Ai-Media แตะ 79.2 ล้านนาทีในปีงบประมาณ FY25 เพิ่มจากไม่ถึง 10 ล้านนาทีเมื่อสี่ปีก่อน (ผลประกอบการ FY25 ของ Ai-Media, ASX)

1. ความล่าช้าที่วัดได้: ซับไตเติลสดตามหลังเสียงพูดเท่าไร

ชุดข้อมูลสาธารณะที่ครบถ้วนที่สุดเรื่องความล่าช้าของซับไตเติลสดยังคงเป็นของสหราชอาณาจักร และเล่าเรื่องไปในทิศทางเดียวกัน: ซับไตเติลสดทั่วไปปรากฏหลังคำพูดมากกว่า 5 วินาที Ofcom สุ่มตัวอย่างรายการข่าว บันเทิง และทอล์กโชว์จาก BBC, ITV, Channel 4, Channel 5 และ Sky ในสี่รอบระหว่างปี 2013 ถึง 2015 รายงานฉบับแรกพบความหน่วงมัธยฐาน 5.6 วินาที (สรุปของ EPRA เกี่ยวกับรายงานฉบับแรกของ Ofcom, เมษายน 2014) และฉบับที่สองพบ 5.8 วินาที โดยมีเพียง 4 จาก 72 ตัวอย่างที่อยู่ในแนวปฏิบัติ 3 วินาที (รายงานของ Limping Chicken เกี่ยวกับรายงานฉบับที่สองของ Ofcom, พฤศจิกายน 2014)

การปรับปรุงที่ตามมาเป็นของจริงแต่เล็กน้อย รายงานฉบับที่สามของ Ofcom บันทึกว่าความหน่วงเฉลี่ยลดลง 0.6 วินาที จาก 5.7 เหลือ 5.1 วินาที ระหว่างเมษายน-พฤษภาคมถึงตุลาคม-พฤศจิกายน 2014 (ข่าวประชาสัมพันธ์ของ Ofcom ผ่าน Wired-Gov, พฤษภาคม 2015) การลดครึ่งวินาทีจากความล่าช้าห้าวินาทีต้องให้ผู้แพร่ภาพเปลี่ยนขั้นตอนการทำงาน ไม่ใช่แค่ซอฟต์แวร์ ตัวเลขจึงหยุดนิ่ง นี่คือผลวัดความหน่วงของ Ofcom ล่าสุดที่มีอยู่ (2014-2015) และยังไม่มีการเผยแพร่ชุดข้อมูลรายผู้แพร่ภาพที่ใหม่กว่านี้

ตัวชี้วัดค่าแหล่งที่มา
ความหน่วงมัธยฐานของซับไตเติลสดในสหราชอาณาจักร รอบแรก5.6 วินาทีรายงานซับไตเติลสดฉบับแรกของ Ofcom, เมษายน 2014
ความหน่วงในสหราชอาณาจักร รอบที่สอง5.8 วินาทีรายงานฉบับที่สองของ Ofcom, พฤศจิกายน 2014
ตัวอย่างที่ผ่านแนวปฏิบัติ 3 วินาที รอบที่สอง4 จาก 72รายงานฉบับที่สองของ Ofcom, 2014
ความล่าช้าสูงสุดที่บันทึกได้ รอบที่สอง21 วินาทีรายงานฉบับที่สองของ Ofcom, 2014
ความหน่วงเฉลี่ยในสหราชอาณาจักร เมษายน-พฤษภาคม 2014 ถึงตุลาคม-พฤศจิกายน 20145.7 วินาทีเป็น 5.1 วินาที (ลด 0.6 วินาที)รายงานฉบับที่สามของ Ofcom, พฤษภาคม 2015
ความหน่วงเฉลี่ยในสหราชอาณาจักรตลอดทั้งสี่รอบ5.3 วินาทีข้อมูล Ofcom ผ่าน Moores, JoSTrans 33
ความหน่วงเมื่อไม่ได้สั่งเล่นซับไตเติลที่เตรียมไว้ล่วงหน้าแบบสด7-8 วินาทีข้อมูล Ofcom ผ่าน Moores, JoSTrans 33

หมายเหตุบริบท: ตัวเลขรายรอบปะปนค่ามัธยฐานและค่าเฉลี่ยตามที่รายงานไว้ ความต่างเล็กน้อยระหว่างรอบ (5.6, 5.7, 5.8) จึงไม่ควรตีความเกินจริง ตัวเลข 7-8 วินาทีสำหรับรายการที่ไม่มีซับไตเติลที่เตรียมไว้และสั่งเล่นตามจังหวะ แสดงให้เห็นว่าค่าเฉลี่ยของสหราชอาณาจักรขึ้นอยู่กับการเตรียมบทล่วงหน้ามากเพียงใด มากกว่าการถอดเสียงแบบเรียลไทม์

นอกสหราชอาณาจักร ความล่าช้ายิ่งยาวขึ้น คำบรรยายในข่าวภาษาสเปนของ Telemundo และ Univision ในสหรัฐฯ ตามหลังเสียงพูดเฉลี่ย 8.2 วินาที ตั้งแต่ 0.7 ถึง 41 วินาที โดย 46% ของคำบรรยายมาช้ากว่า 8 วินาที (Fresno, Closed Captions en espanol, JoSTrans 42, 2024) งานศึกษาปี 2026 กับคลิปทีวีสดของสหรัฐฯ วัดความล่าช้าเฉลี่ย 8.46 วินาที (ส่วนเบี่ยงเบนมาตรฐาน 3.62) และระบุว่า 7-12 วินาทีเป็นค่าทั่วไปของคำบรรยายทีวี (Thompson และคณะ, arXiv 2609.11408)

ตัวชี้วัดค่าแหล่งที่มา
ความล่าช้าเฉลี่ยของคำบรรยาย ข่าวภาษาสเปนในสหรัฐฯ8.2 วินาทีFresno, JoSTrans 42, 2024
ช่วงความล่าช้า ในตัวอย่างเดียวกัน0.7 ถึง 41 วินาทีFresno, JoSTrans 42, 2024
คำบรรยายที่ล่าช้ากว่า 8 / 10 / 12 วินาที46% / 20% / 8%Fresno, JoSTrans 42, 2024
คำบรรยายที่วิเคราะห์ในงานศึกษานั้น5,349 (20 ช่วง ช่วงละสิบนาที)Fresno, JoSTrans 42, 2024
ความล่าช้าเฉลี่ยของคลิปทีวีสดในสหรัฐฯ8.46 วินาที (ส่วนเบี่ยงเบนมาตรฐาน 3.62)Thompson และคณะ, arXiv 2609.11408, กันยายน 2026
ความล่าช้าของคำบรรยายทีวีสหรัฐฯ โดยทั่วไปที่อ้างอิง7-12 วินาทีThompson และคณะ, arXiv 2609.11408, กันยายน 2026
ความหน่วงเฉลี่ยในงานสด (ไม่ใช่การแพร่ภาพ) ที่ใช้การพูดซ้ำ5.8 วินาที (ช่วง 4.3-7.5 วินาที)Moores, JoSTrans 33

2. เป้าหมายเชิงกำกับดูแล: จาก 3 วินาทีเป็น 4.5 วินาที

หน่วยงานกำกับดูแลเห็นตรงกันว่าความหน่วงสำคัญ แต่แทบไม่มีใครกำหนดตัวเลข Ofcom เป็นหน่วยงานกำกับดูแลรายใหญ่เพียงรายเดียวในสรุปนี้ที่มีเป้าหมายความหน่วงเป็นตัวเลข และได้ขยับเป้าหมายนั้นไปในทิศทางที่ผ่อนปรนขึ้น จากความล่าช้าสูงสุด 3 วินาทีใน Code on Television Access Services มาเป็นค่าเฉลี่ยไม่เกิน 4.5 วินาทีตลอดรายการสดของผู้ให้บริการ ระหว่างการรับฟังความเห็นปี 2023 Ofcom ระบุว่าผู้แพร่ภาพมองว่าเพดาน 3 วินาทีไม่สอดคล้องกับความเป็นจริง และ 4.5 วินาทีตรงกับความหน่วงที่ดีที่สุดที่ผู้แพร่ภาพแต่ละรายเคยทำได้ (Ofcom Guidelines on Providing Television and On-Demand Access Services)

แนวทางของสหรัฐฯ เป็นเชิงคุณภาพ FCC รับรองมาตรฐานคุณภาพคำบรรยายเมื่อวันที่ 20 กุมภาพันธ์ 2014 ครอบคลุมความแม่นยำ ความสอดคล้องของเวลา ความครบถ้วน และตำแหน่งการแสดงผล และระบุเพียงว่าความล่าช้าของคำบรรยายสด ‘ควรอยู่ในระดับต่ำสุด โดยสอดคล้องกับการนำเสนอสิ่งที่พูดอย่างถูกต้อง’ (FCC, มาตรฐานคุณภาพคำบรรยาย) แคนาดากำกับดูแลความแม่นยำแทนเวลา: Broadcasting Regulatory Policy 2019-308 ของ CRTC กำหนดให้คำบรรยายสดภาษาอังกฤษต้องได้คะแนน 98 ตามโมเดล NER ผลในทางปฏิบัติคือคำบรรยายที่มาช้า 10 วินาทีอาจเป็นไปตามข้อกำหนดทุกประการในแทบทุกประเทศ

ตัวชี้วัดค่าแหล่งที่มา
แนวปฏิบัติเดิมของ Ofcomความล่าช้าสูงสุด 3 วินาทีOfcom Code on Television Access Services
แนวปฏิบัติปัจจุบันของ Ofcomค่าเฉลี่ยไม่เกิน 4.5 วินาทีตลอดรายการสดOfcom Guidelines on Providing TV and On-Demand Access Services
แนวทางความเร็วซับไตเติลเดิมของ Ofcom: บันทึกไว้ล่วงหน้า / สด160-180 คำต่อนาที / 200 คำต่อนาทีการรับฟังความเห็นปี 2023 ของ Ofcom ตามที่ Liam O’Dell รายงาน
เพดานความหน่วงเป็นตัวเลขของ FCCไม่มี (ความล่าช้า ‘อยู่ในระดับต่ำสุด’)FCC 14-12, รับรองเมื่อ 20 กุมภาพันธ์ 2014
การห้ามของ FCC ต่อคำบรรยาย ENT ที่ใช้เทเลพรอมเตอร์อย่างเดียวสำหรับรายการสด4 เครือข่ายใหญ่และสถานีในเครือใน 25 ตลาดแรกFCC 14-12
การใส่คำบรรยายรายการใหม่ที่ไม่ได้รับการยกเว้น (FCC)100% ตั้งแต่ 1 มกราคม 200647 CFR 79.1
ข้อกำหนดความแม่นยำคำบรรยายสดภาษาอังกฤษของ CRTCคะแนน NER 98 ตั้งแต่ 1 กันยายน 2019CRTC 2019-308
ข้อผูกพันด้านการติดตามตรวจสอบของ CRTC2 รายการสดต่อเดือน รวมรายการข่าว 1 รายการCRTC 2019-308

หมายเหตุบริบท: ACMA ของออสเตรเลีย ภายใต้ Broadcasting Services (Television Captioning) Standard 2023 ซึ่งมีผลบังคับใช้ตั้งแต่ 1 ตุลาคม 2023 ก็ไม่ได้กำหนดความหน่วงเป็นตัวเลขเช่นกัน และประเมินความอ่านง่าย ความแม่นยำ และความเข้าใจได้เป็นรายกรณี

กฎล่าสุดขยายภาระผูกพันไปสู่บริการสตรีมมิงแทนที่จะเข้มงวดเรื่องความล่าช้า CRTC 2026-98 ของแคนาดากำหนดให้ผู้ให้บริการสตรีมมิงออนไลน์ใส่คำบรรยายให้ 80% ของแคตตาล็อกภายในพฤษภาคม 2030 และ 100% ภายในพฤษภาคม 2031 โดยรายการต้นฉบับใหม่ทั้งแบบสดและบันทึกไว้ล่วงหน้าต้องมีคำบรรยายภายในหนึ่งปี (CRTC 2026-98, 25 พฤษภาคม 2026) ร่าง Tier 1 Accessibility Code ของ Ofcom ที่เผยแพร่เมื่อ 14 พฤษภาคม 2026 เสนอโควตาซับไตเติล 80% สำหรับผู้ให้บริการสตรีมมิงรายใหญ่ที่สุด เมื่อครบสี่ปีหลังการเผยแพร่ (Ofcom, การรับฟังความเห็น Tier 1 Accessibility Code)

ตัวชี้วัดค่าแหล่งที่มา
การใส่คำบรรยายแคตตาล็อกของผู้ให้บริการสตรีมมิงในแคนาดา80% ภายในพฤษภาคม 2030, 100% ภายในพฤษภาคม 2031CRTC 2026-98
ข้อกำหนดความแม่นยำของแคนาดาสำหรับรายการต้นฉบับที่บันทึกไว้ล่วงหน้าบนบริการสตรีมมิง100%CRTC 2026-98
โควตาซับไตเติล Tier 1 ของ Ofcom ปีที่ 4 / ปีที่ 180% / 20%ร่าง Tier 1 Accessibility Code ของ Ofcom, พฤษภาคม 2026
โควตาซับไตเติลบริการตามคำขอของ BBC ปีที่ 490%ร่าง Tier 1 Accessibility Code ของ Ofcom, พฤษภาคม 2026
เกณฑ์ของ Tier 1ผู้ใช้เฉลี่ยต่อเดือนในสหราชอาณาจักร 500,000 คนขึ้นไปร่าง Tier 1 Accessibility Code ของ Ofcom, พฤษภาคม 2026

3. ความแม่นยำ: เส้น NER 98% และใครผ่านเกณฑ์

ความล่าช้ากับความแม่นยำต้องแลกกัน ตัวเลขความหน่วงจึงมีความหมายก็ต่อเมื่อวางเคียงกับตัวเลขความแม่นยำ เครื่องวัดที่ใช้กันทั่วไปคือโมเดล NER ซึ่งให้คะแนนซับไตเติลสดเป็น (จำนวนคำ ลบด้วยข้อผิดพลาดจากการแก้ไขและการรู้จำ) หารด้วยจำนวนคำ 98% คือ ‘ยอมรับได้’ 98.5-98.99% คือ ‘ดี’ 99-99.49% คือ ‘ดีมาก’ และสูงกว่า 99.5% คือ ‘ยอดเยี่ยม’ (Romero-Fresco และ Martinez, โมเดล NER, 2015) เกณฑ์นี้ดูผ่อนปรนจนกว่าจะแปลงเป็นตัวเลขจริง: ที่ 98% ทุก 100 คำจะมีสองคำที่ผิด ขาดหาย หรือเป็นข้อผิดพลาดถ่วงน้ำหนัก

ผู้แพร่ภาพของสหราชอาณาจักรผ่านเกณฑ์โดยเฉลี่ย: 98.38% จากสี่รอบของ Ofcom และ 98.55% ในรอบสุดท้าย วัดจากซับไตเติล 78,000 รายการและ 546,000 คำ (Moores, JoSTrans 33) แต่ค่าเฉลี่ยซ่อนส่วนหางของข้อมูลไว้ ในเดือนตุลาคม-พฤศจิกายน 2014 77% ของรายการในสหราชอาณาจักรได้ 98% ขึ้นไป เพิ่มจาก 74% ในเดือนเมษายน-พฤษภาคม 2014 และข่าวเป็นประเภทที่แม่นยำที่สุดที่ 98.75% (รายงานฉบับที่สามของ Ofcom, 2015) ข่าวระดับประเทศภาษาอังกฤษในสหรัฐฯ ทำได้ดีกว่า โดยเฉลี่ย 98.8% และ 14 จาก 20 ตัวอย่างได้ระดับยอมรับได้หรือสูงกว่า ส่วนข่าวภาษาสเปนตกลงมาที่ 97.04% (Fresno, 2024)

ตัวชี้วัดค่าแหล่งที่มา
เกณฑ์ NER ยอมรับได้ / ยอดเยี่ยม98% / สูงกว่า 99.5%Romero-Fresco และ Martinez, 2015
ความแม่นยำซับไตเติลสดในสหราชอาณาจักร ค่าเฉลี่ยสี่รอบ98.38%ข้อมูล Ofcom ผ่าน Moores, JoSTrans 33
ความแม่นยำซับไตเติลสดในสหราชอาณาจักร รอบสุดท้าย98.55%ข้อมูล Ofcom ผ่าน Moores, JoSTrans 33
รายการในสหราชอาณาจักรที่ได้ 98% ขึ้นไป ตุลาคม-พฤศจิกายน 2014 (เทียบกับเมษายน-พฤษภาคม 2014)77% (74%)รายงานฉบับที่สามของ Ofcom, 2015
ความแม่นยำประเภทข่าวในสหราชอาณาจักร98.75%รายงานฉบับที่สามของ Ofcom, 2015
ข่าวระดับประเทศภาษาอังกฤษในสหรัฐฯ NER เฉลี่ย98.8% (14 จาก 20 ตัวอย่างยอมรับได้หรือดีกว่า)Fresno, Universal Access in the Information Society, 2024
ข่าวภาษาสเปนในสหรัฐฯ NER เฉลี่ย97.04% (Telemundo 97.00%, Univision 97.10%)Fresno, JoSTrans 42, 2024
การลดทอนข้อความ: ข่าวภาษาสเปนเทียบกับภาษาอังกฤษ26% เทียบกับ 5-6%Fresno, JoSTrans 42, 2024

หมายเหตุบริบท: ความเร็วคือตัวแปรที่สามที่ซ่อนอยู่ Ofcom แนะนำให้ซับไตเติลมีความเร็วเฉลี่ยต่ำกว่า 180 คำต่อนาที แต่รายการเกือบทั้งหมดที่วิเคราะห์มีช่วงสั้น ๆ ที่เร็วกว่า 200 คำต่อนาที และเมื่อนับช่วงเหล่านั้นเป็นข้อผิดพลาด 68% ของรายการจะได้ต่ำกว่า 98% (รายงานฉบับที่สามของ Ofcom, 2015) งานศึกษาข่าวภาษาอังกฤษในสหรัฐฯพบว่าเกือบสองในสามของข้อผิดพลาดเป็นข้อผิดพลาดเล็กน้อย

4. ความล่าช้าสร้างต้นทุนให้ผู้ชมอย่างไร

กลุ่มผู้ใช้ซับไตเติลสดกว้างกว่าชุมชนผู้หูหนวกมาก Ofcom ประเมินว่า ผู้ใหญ่ในสหราชอาณาจักรราว 7.6 ล้านคนเคยใช้ซับไตเติล ซึ่งมีเพียง 1.4 ล้านคนที่มีความบกพร่องทางการได้ยิน (ข่าวประชาสัมพันธ์ของ Ofcom ผ่าน Wired-Gov, พฤษภาคม 2013) นั่นหมายถึงผู้ใช้ซับไตเติลที่ไม่มีความบกพร่องทางการได้ยินมากกว่า 6 ล้านคน (7.6 ล้านลบ 1.4 ล้าน) ซึ่งหลายคนดูในห้องที่มีเสียงดังหรือเปิดเสียงเบา แนวปฏิบัติของ Ofcom ยังอ้างข้อมูลจาก YouGov ว่า 61% ของคนอายุ 18-24 ปีชอบเปิดซับไตเติล ในระดับโลก WHO ประมาณการว่าปัจจุบันมี 430 ล้านคนที่ต้องการการฟื้นฟูสมรรถภาพจากการสูญเสียการได้ยินระดับที่ส่งผลต่อการใช้ชีวิต และจะเพิ่มเป็นมากกว่า 700 ล้านคนภายในปี 2050

ตัวชี้วัดค่าแหล่งที่มา
ผู้ใหญ่ในสหราชอาณาจักรที่เคยใช้ซับไตเติลราว 7.6 ล้านคน (ช่วง 7.0-8.1 ล้านคน)Ofcom, พฤษภาคม 2013
ในจำนวนนั้นที่มีความบกพร่องทางการได้ยินราว 1.4 ล้านคน (ช่วง 1.2-1.6 ล้านคน)Ofcom, พฤษภาคม 2013
ชาวสหราชอาณาจักรอายุ 18-24 ปีที่ชอบเปิดซับไตเติล61%YouGov อ้างอิงในแนวปฏิบัติด้านบริการเข้าถึงของ Ofcom
สัดส่วนชั่วโมงรายการของ PSB ในสหราชอาณาจักรและบริการตามคำขอรายใหญ่ที่มีซับไตเติล ปี 202488%Ofcom Access Services Report, มกราคม-ธันวาคม 2024 (เผยแพร่ 19 พฤษภาคม 2025)
ชั่วโมงที่มีซับไตเติลบนช่องที่ถูกกำหนดในสหราชอาณาจักร ปี 2005 เทียบกับ 201340.5% เทียบกับ 81.9%รายงานซับไตเติลสดฉบับแรกของ Ofcom, 2014
ผู้ที่ต้องการการฟื้นฟูสมรรถภาพจากการสูญเสียการได้ยินระดับที่ส่งผลต่อการใช้ชีวิต430 ล้านคนเอกสารข้อเท็จจริงของ WHO, ปรับปรุงมีนาคม 2026
ผู้ที่คาดว่าจะมีการสูญเสียการได้ยินในระดับใดระดับหนึ่งภายในปี 2050เกือบ 2.5 พันล้านคนเอกสารข้อเท็จจริงของ WHO, ปรับปรุงมีนาคม 2026

ความล่าช้าคือสิ่งที่ผู้ชมสังเกตเห็นก่อน งานศึกษาผู้ใช้ล่าสุดที่ใหญ่ที่สุดขอให้ผู้ชมที่หูหนวกและมีปัญหาการได้ยิน 216 คนให้คะแนนคลิปทีวีสด 70 คลิปในสี่เงื่อนไข ได้คะแนนทั้งหมด 4,832 รายการ คำบรรยายทีวีชุดเดียวกันได้ 3.66 จาก 7 เมื่อมีความล่าช้าตามการออกอากาศเดิม และ 5.09 เมื่อปรับให้ตรงเวลา ซึ่งต่างกันมากกว่าช่องว่างระหว่างคำบรรยายทีวีที่ตรงเวลากับคำบรรยาย ASR อย่างชัดเจน (Thompson และคณะ, Are Caption Metrics Broken?, arXiv 2609.11408, กันยายน 2026) คำบรรยาย ASR ที่ล่าช้าสองวินาทีทนทานกว่ามาก โดยได้ 4.81 เทียบกับ 5.20 เมื่อตรงเวลา

งานศึกษาเดียวกันนี้ยังทำลายแนวคิดที่ว่าคะแนนความแม่นยำสะท้อนคุณภาพ มีเพียง 11 จาก 70 คลิปทีวีและ 4 จาก 70 คลิป ASR ที่ถึงเกณฑ์ NER 98 ทว่าผู้ชมให้คะแนนคำบรรยาย ASR และทีวีที่ตรงเวลาใกล้เคียงกัน และความสัมพันธ์ระหว่างตัวชี้วัดกับคะแนนลดลงอย่างมากสำหรับผลลัพธ์ของ ASR (WER r = -0.390 เทียบกับ -0.687 สำหรับคำบรรยายทีวี) งานศึกษา CHI 2024 ก่อนหน้านี้ของ Gallaudet ได้ข้อสรุปคล้ายกัน คือผู้เข้าร่วมไม่ชอบความล่าช้าของการออกอากาศอย่างมาก และตัวชี้วัดความแม่นยำมาตรฐานสัมพันธ์กับคะแนนที่ผู้ชมให้คำบรรยายเพียงเล็กน้อย

ตัวชี้วัดค่าแหล่งที่มา
ผู้เข้าร่วม / คะแนน / คลิป216 / 4,832 / 70Thompson และคณะ, arXiv 2609.11408, 2026
คะแนนคำบรรยายทีวี: ความล่าช้าเดิมเทียบกับตรงเวลา (มาตราส่วน 7 คะแนน)3.66 เทียบกับ 5.09Thompson และคณะ, 2026
คะแนนคำบรรยาย ASR: ล่าช้า 2 วินาทีเทียบกับตรงเวลา4.81 เทียบกับ 5.20Thompson และคณะ, 2026
WER เฉลี่ย: คำบรรยายทีวีเทียบกับคำบรรยาย ASR33.8% เทียบกับ 17.2%Thompson และคณะ, 2026
NER เฉลี่ย: คำบรรยายทีวีเทียบกับคำบรรยาย ASR95.28 เทียบกับ 94.34Thompson และคณะ, 2026
คลิปที่ถึง NER 98: ทีวีเทียบกับ ASR11 จาก 70 เทียบกับ 4 จาก 70Thompson และคณะ, 2026
ความสัมพันธ์ของ WER กับคะแนนผู้ชม: ทีวีเทียบกับ ASRr = -0.687 เทียบกับ -0.390Thompson และคณะ, 2026

หมายเหตุบริบท: WER ที่สูงของคำบรรยายทีวีส่วนหนึ่งสะท้อนว่าคำบรรยายสำหรับการแพร่ภาพมักเรียบเรียงและย่อความ ซึ่ง WER ลงโทษแต่ NER ไม่ลงโทษ ช่องว่างนี้เองคือเหตุผลที่ผู้เขียนโต้แย้งว่าตัวชี้วัดปัจจุบันไม่เป็นกลางต่อเทคโนโลยี

5. ความเร็วของเอนจิน ASR: ความหน่วงแบบสตรีมมิงเทียบกับบทสนทนาของมนุษย์

ความหน่วงของเอนจินไม่ใช่ต้นเหตุหลักของความล่าช้าของซับไตเติลอีกต่อไป AssemblyAI รายงานความหน่วงสตรีมมิงมัธยฐาน 307 ms สำหรับ Universal-Streaming เทียบกับ 516 ms ของ Deepgram Nova-3 และ P99 ที่ 1,012 ms เทียบกับ 1,907 ms วัดจากจุดสิ้นสุดของคำในเสียงถึงการปรากฏครั้งแรกในทรานสคริปต์บางส่วน จากเสียงกว่า 205 ชั่วโมง (AssemblyAI, Introducing Universal-Streaming, 2 มิถุนายน 2025) ข้อมูลเปิดตัวของ Deepgram เองระบุอัตราคำผิดพลาดมัธยฐานแบบสตรีมมิงของ Nova-3 ที่ 6.84% เทียบกับ 14.92% ของคู่แข่งที่ทดสอบ (Deepgram, Introducing Nova-3, กุมภาพันธ์ 2025) ทั้งสองเป็นเกณฑ์วัดผลจากผู้ให้บริการ จึงควรอ่านเป็นตัวเลขในกรณีที่ดีที่สุด สถิติการแปลงเสียงเป็นข้อความของเราครอบคลุมความแม่นยำของเอนจินอื่น ๆ เพิ่มเติม

โมเดลเปิดยอมแลกความล่าช้าที่มากขึ้นกับความเสถียร ระบบวิชาการ Whisper-Streaming มีความหน่วงเฉลี่ย 3.3 วินาทีกับเสียงพูดภาษาอังกฤษแบบยาว จากชุดทดสอบ ESIC ของรัฐสภายุโรป และการแลกเปลี่ยนนี้ปรากฏชัดในผลลัพธ์: WER ภาษาอังกฤษ 8.5% ที่ความหน่วง 3.27 วินาทีเมื่อใช้ช่วงเสียง 0.5 วินาที เทียบกับ 8.0% ที่ 5.45 วินาทีเมื่อใช้ช่วงเสียง 2 วินาที (Machacek, Dabre และ Bojar, arXiv 2307.14743, IJCNLP-AACL 2023) สังเกตว่าการตั้งค่า Whisper ที่ 5 วินาทีไปตกอยู่ตรงกับค่าเฉลี่ยของการแพร่ภาพในสหราชอาณาจักรเมื่อทศวรรษก่อนพอดี

ตัวชี้วัดค่าแหล่งที่มา
ความหน่วงมัธยฐาน / P99 ของ AssemblyAI Universal-Streaming307 ms / 1,012 msAssemblyAI, มิถุนายน 2025
ความหน่วงมัธยฐาน / P99 ของ Deepgram Nova-3 (การทดสอบของ AssemblyAI)516 ms / 1,907 msAssemblyAI, มิถุนายน 2025
WER มัธยฐานของ Deepgram Nova-3: สตรีมมิง / แบบแบตช์6.84% / 5.26%Deepgram, กุมภาพันธ์ 2025
ชุดเกณฑ์วัดผลของ Deepgram Nova-32,703 ไฟล์ 81.69 ชั่วโมง 9 โดเมนDeepgram, กุมภาพันธ์ 2025
ความหน่วงเฉลี่ยของ Whisper-Streaming ภาษาอังกฤษ3.3 วินาทีMachacek และคณะ, 2023
Whisper-Streaming ภาษาอังกฤษ: ช่วงเสียง 0.5 วินาทีเทียบกับ 2.0 วินาทีWER 8.5% ที่ 3.27 วินาที เทียบกับ WER 8.0% ที่ 5.45 วินาทีMachacek และคณะ, 2023
ความหน่วงของ Whisper-Streaming ภาษาเยอรมัน / เช็ก (ช่วงเสียง 0.5 วินาที)4.11 วินาที / 4.69 วินาทีMachacek และคณะ, 2023

เพดานของเรียลไทม์ถูกกำหนดโดยบทสนทนาของมนุษย์ ใน 10 ภาษา ช่องว่างเฉลี่ยระหว่างคำถามกับคำตอบคือ +208 ms ตั้งแต่ +7 ms ในภาษาญี่ปุ่นไปจนถึง +469 ms ในภาษาเดนมาร์ก (Stivers และคณะ, PNAS 2009) การเปิดตัว GPT-4o ของ OpenAI อ้างว่าตอบกลับด้วยเสียงได้เร็วที่สุด 232 ms และเฉลี่ย 320 ms เทียบกับ 2.8 วินาที (GPT-3.5) และ 5.4 วินาที (GPT-4) ของ Voice Mode แบบไปป์ไลน์เดิม ซึ่งเชื่อมโมเดลถอดเสียง โมเดลภาษา และโมเดลเสียงพูดที่แยกจากกัน บทเรียนสำหรับซับไตเติลสดก็เหมือนกัน: ทุกขั้นตอนที่เพิ่มเข้าไปในห่วงโซ่เพิ่มเวลาเป็นวินาที และขั้นตอนที่เคยครองสัดส่วนมากที่สุด คือการรู้จำเสียงเอง ตอนนี้กลายเป็นขั้นตอนที่เล็กที่สุด

ตัวชี้วัดค่าแหล่งที่มา
ช่องว่างเฉลี่ยจากคำถามถึงคำตอบ 10 ภาษา+208 msStivers และคณะ, PNAS 2009 (ข้อมูลล่าสุดที่มี)
ค่าเฉลี่ยของภาษาที่เร็วที่สุด / ช้าที่สุด+7 ms (ญี่ปุ่น) / +469 ms (เดนมาร์ก)Stivers และคณะ, PNAS 2009
การตอบกลับด้วยเสียงของ GPT-4o: ต่ำสุด / เฉลี่ย232 ms / 320 msOpenAI, พฤษภาคม 2024
ความหน่วงเฉลี่ยของ Voice Mode แบบไปป์ไลน์: GPT-3.5 / GPT-42.8 วินาที / 5.4 วินาทีOpenAI, พฤษภาคม 2024
ความล่าช้าของคำบรรยาย ASR ที่ใช้ในงานศึกษาผู้ชมปี 2026เฉลี่ย 2 วินาทีThompson และคณะ, arXiv 2609.11408

6. ระบบอัตโนมัติเข้ามาแทนที่ห่วงโซ่การทำคำบรรยาย

แรงงานมนุษย์เบื้องหลังซับไตเติลสดถูกกำหนดด้วยขีดจำกัดด้านความเร็ว เกณฑ์เรียลไทม์ของสหรัฐฯ คือ NCRA Certified Realtime Reporter ซึ่งกำหนดการทดสอบเรียลไทม์ห้านาทีที่ 200 คำต่อนาทีด้วยความแม่นยำ 96% และรายงานของ EBUอธิบายว่าการทำซับไตเติลสดคือการตามให้ทันผู้พูดที่พูดเร็วถึง 200 คำต่อนาที ผู้พูดซ้ำ (respeaker) ในสหราชอาณาจักรบอกนักวิจัยว่าการฝึกพื้นฐานใช้เวลา 2-3 เดือน ส่วนการจะรู้สึกมั่นใจต้องใช้ 1.5-2 ปี (Moores, JoSTrans 33) ข้อจำกัดเหล่านี้คือเหตุผลที่คำบรรยายอัตโนมัติขยายตัวเร็วมากเมื่อความแม่นยำเริ่มใกล้เคียง

การเปลี่ยนแปลงด้านปริมาณเห็นได้จากเอกสารของบริษัท คำบรรยายอัตโนมัติ LEXI ของ Ai-Media แตะ 79.2 ล้านนาทีในปีงบประมาณ FY25 เพิ่มจากไม่ถึง 10 ล้านนาทีเมื่อสี่ปีก่อน หรืออัตราเติบโตเฉลี่ยต่อปีแบบทบต้นสี่ปีที่ 69% และ LEXI คิดเป็นการใช้งานส่วนใหญ่บนเครือข่าย iCap ของบริษัทในตอนนี้ (ผลประกอบการ FY25 ของ Ai-Media, ประกาศ ASX, 28 สิงหาคม 2025) ผลิตภัณฑ์เทคโนโลยีคิดเป็น 63% ของรายได้ Ai-Media จากศูนย์เมื่อห้าปีก่อน การทดสอบอิสระกับระบบเดียวกันพบความแม่นยำ NER 98.56% ในภาษาอังกฤษ และ 98.26% ในภาษาสเปน เทียบเท่าคำบรรยายที่มนุษย์ทำ ยกเว้นเนื้อหาภาษาพูดที่มีผู้พูดหลายคน (Romero-Fresco และ Van Gauwbergen, Fit for What Purpose?, 2025) อ่านเพิ่มเติมเกี่ยวกับด้านมนุษย์ของวิชาชีพนี้ได้ในสถิติความแม่นยำของการถอดเสียงในห้องพิจารณาคดีของเรา

ตัวชี้วัดค่าแหล่งที่มา
มาตรฐานเรียลไทม์ NCRA CRR200 คำต่อนาทีด้วยความแม่นยำ 96% (ทดสอบ 5 นาที)NCRA
การฝึกพื้นฐานของผู้พูดซ้ำ / เวลาจนรู้สึกมั่นใจ2-3 เดือน / 1.5-2 ปีMoores, JoSTrans 33
นาทีคำบรรยายอัตโนมัติ LEXI ของ Ai-Media ปีงบประมาณ FY2579.2 ล้านนาทีผลประกอบการ FY25 ของ Ai-Media, ASX
นาที LEXI เมื่อสี่ปีก่อนไม่ถึง 10 ล้านนาที (อัตราเติบโตเฉลี่ยต่อปีแบบทบต้นสี่ปี 69%)ผลประกอบการ FY25 ของ Ai-Media, ASX
สัดส่วนเทคโนโลยีในรายได้ของ Ai-Media63% (รายได้รวม 64.9 ล้านดอลลาร์สหรัฐ)ผลประกอบการ FY25 ของ Ai-Media, ASX
ความแม่นยำ NER ของคำบรรยายอัตโนมัติ: อังกฤษ / สเปน98.56% / 98.26%Romero-Fresco และ Van Gauwbergen, 2025
คำบรรยายสดที่วิเคราะห์เปรียบเทียบผลลัพธ์อัตโนมัติกับมนุษย์ สหราชอาณาจักร/สหรัฐฯ/แคนาดา 2018-2022ราว 17,000 รายการRomero-Fresco และ Fresno, Linguistica Antverpiensia 22, 2023

หมายเหตุบริบท: การเปรียบเทียบมนุษย์กับเครื่องที่ใหญ่ที่สุดจนถึงตอนนี้ (Romero-Fresco และ Fresno, Linguistica Antverpiensia, 2023) พบว่าคำบรรยายอัตโนมัติที่ไม่ผ่านการแก้ไขใกล้เคียง 98% โดยยังมีจุดอ่อนต่อเนื่องเรื่องเครื่องหมายวรรคตอน ชื่อเฉพาะ ตัวเลข และการระบุตัวผู้พูด ความหน่วงของเอนจินที่ต่ำลงแก้เรื่องเหล่านี้ไม่ได้ ชื่อที่ผิดแต่มาเร็วก็ยังคือชื่อที่ผิด

สรุป: ความหน่วงของซับไตเติลสดแบบเรียลไทม์ในรูปแบบตัวเลข

ตัวชี้วัดค่าแหล่งที่มา
ความหน่วงเฉลี่ยของซับไตเติลสดในสหราชอาณาจักร ปลายปี 20145.1 วินาทีรายงานฉบับที่สามของ Ofcom, 2015
ตัวอย่างในสหราชอาณาจักรที่ผ่านแนวปฏิบัติ 3 วินาที รอบที่สอง4 จาก 72รายงานฉบับที่สองของ Ofcom, 2014
ความล่าช้าสูงสุดที่บันทึกได้ในสหราชอาณาจักร21 วินาทีรายงานฉบับที่สองของ Ofcom, 2014
แนวปฏิบัติความหน่วงปัจจุบันของ Ofcomค่าเฉลี่ย 4.5 วินาทีหรือน้อยกว่าแนวปฏิบัติด้านบริการเข้าถึงของ Ofcom
เพดานความหน่วงเป็นตัวเลขของ FCCไม่มีFCC 14-12, 2014
ความแม่นยำคำบรรยายสดภาษาอังกฤษของ CRTCNER 98CRTC 2019-308
ความล่าช้าของคำบรรยายข่าวภาษาสเปนในสหรัฐฯเฉลี่ย 8.2 วินาทีFresno, JoSTrans 42, 2024
คำบรรยายข่าวภาษาสเปนในสหรัฐฯ ที่ล่าช้ากว่า 10 วินาที20%Fresno, JoSTrans 42, 2024
ความล่าช้าเฉลี่ยของคลิปทีวีสดในสหรัฐฯ8.46 วินาทีThompson และคณะ, arXiv 2609.11408, 2026
คะแนนคำบรรยายทีวี: ล่าช้าเทียบกับตรงเวลา3.66 เทียบกับ 5.09 จาก 7Thompson และคณะ, 2026
ความแม่นยำซับไตเติลสดในสหราชอาณาจักร ค่าเฉลี่ยสี่รอบ98.38%ข้อมูล Ofcom ผ่าน Moores, JoSTrans 33
ความแม่นยำข่าวระดับประเทศภาษาอังกฤษในสหรัฐฯ98.8%Fresno, 2024
ความแม่นยำคำบรรยายอัตโนมัติ ภาษาอังกฤษ98.56%Romero-Fresco และ Van Gauwbergen, 2025
ผู้ใหญ่ในสหราชอาณาจักรที่เคยใช้ซับไตเติลราว 7.6 ล้านคนOfcom, 2013
ชั่วโมงที่มีซับไตเติลของ PSB ในสหราชอาณาจักรและบริการตามคำขอรายใหญ่ ปี 202488%Ofcom Access Services Report 2024
ความหน่วงสตรีมมิงมัธยฐานของ AssemblyAI307 msAssemblyAI, มิถุนายน 2025
ความหน่วงเฉลี่ยของ Whisper-Streaming3.3 วินาทีMachacek และคณะ, 2023
ช่องว่างเฉลี่ยในการสลับผลัดกันพูดของมนุษย์208 msStivers และคณะ, PNAS 2009
นาทีคำบรรยาย LEXI ของ Ai-Media ปีงบประมาณ FY2579.2 ล้านนาทีผลประกอบการ FY25 ของ Ai-Media
การใส่คำบรรยายแคตตาล็อกของผู้ให้บริการสตรีมมิงในแคนาดาภายในพฤษภาคม 2031100%CRTC 2026-98

ระเบียบวิธีและแหล่งที่มา

ตัวเลขทุกตัวข้างต้นถูกสืบย้อนไปยังหน่วยงานกำกับดูแล เอกสารที่ยื่นต่อหน่วยงาน หรือบทความที่ผ่านการพิจารณาโดยผู้ทรงคุณวุฒิที่เป็นผู้จัดทำ ไฟล์ PDF ของ Ofcom หลายฉบับไม่สามารถดึงโดยตรงได้ ตัวเลขของสหราชอาณาจักรจึงนำมาจากข่าวประชาสัมพันธ์ของ Ofcom (เผยแพร่ซ้ำบน Wired-Gov) สรุปจากหน่วยงานกำกับดูแล (EPRA) และการวิเคราะห์ชุดข้อมูลของ Ofcom ที่ผ่านการพิจารณาโดยผู้ทรงคุณวุฒิ (Moores) โดยระบุแหล่งไว้ในเนื้อหาแต่ละจุด เกณฑ์วัดผลจากผู้ให้บริการถูกระบุว่าเป็นข้อมูลจากผู้ให้บริการ สำหรับข้อมูลตลาดและการใช้งานคำบรรยายโดยทั่วไป ดูสถิติคำบรรยายและซับไตเติลของเรา

อัปเดตล่าสุด: 3 ตุลาคม 2026 เราจะอัปเดตสรุปนี้ทุกไตรมาส และคาดว่าการทบทวนครั้งถัดไปจะเกิดขึ้นเมื่อ Ofcom เผยแพร่แถลงการณ์ฉบับสุดท้ายของ Tier 1 Accessibility Code และ Access Services Report สำหรับช่วงมกราคม-ธันวาคม 2025

ลอง VoxBooster — ทดลองใช้ฟรี 3 วัน

โคลนเสียงเรียลไทม์ ซาวด์บอร์ด และเอฟเฟกต์ — ทุกที่ที่คุณคุย

  • ไม่ต้องใช้บัตรเครดิต
  • ความหน่วง ~30ms
  • Discord · Teams · OBS
ลองฟรี 3 วัน