إحصائيات زمن التأخر في الترجمة النصية المباشرة (2026): أكثر من 60 نقطة بيانات حول التأخر والدقة وسرعة التعرف التلقائي على الكلام

إحصائيات زمن تأخر الترجمة النصية المباشرة 2026: تأخرت الترجمة النصية المباشرة في بريطانيا بين 5.1 و5.8 ثانية عن الكلام، وتستهدف Ofcom الآن 4.5 ثانية، وبلغ متوسط التأخر 8.2 ثانية في نشرات الأخبار الأمريكية بالإسبانية.

تأخرت الترجمة النصية المباشرة على التلفزيون البريطاني عن الكلام بمتوسط 5.1 إلى 5.8 ثانية عبر جولات القياس التي أجرتها Ofcom، ولم تستوف سوى 4 عينات من أصل 72 في جولتها الثانية الإرشاد القديم البالغ 3 ثوان (Ofcom، تقارير جودة الترجمة النصية المباشرة 2014-2015). والمشكلة لم تختف: فقد قاست دراسة عام 2024 على نشرات الأخبار الأمريكية بالإسبانية متوسط تأخر قدره 8.2 ثانية، مع ترجمات منفردة تأخرت حتى 41 ثانية (Fresno، JoSTrans 2024)، وقاست دراسة في سبتمبر 2026 متوسطا قدره 8.46 ثانية على مقاطع تلفزيونية أمريكية مباشرة. وفي الوقت نفسه، تعلن محركات التعرف على الكلام المتدفقة الآن عن وسيط تأخر للكلمة يقارب 300 ميلي ثانية (AssemblyAI، يونيو 2025)، ما يعني أن عنق الزجاجة في التعليق المباشر ينتقل من الكاتب البشري إلى سلسلة البث. جمعنا بيانات من Ofcom وFCC وCRTC، ودراسات محكمة من جامعة Gallaudet وجامعة فيغو، وأوراق معايير على arXiv، وإفصاحات Ai-Media لدى بورصة ASX، ومنظمة الصحة العالمية، ومصادر أولية أخرى مذكورة في المنهجية. وللحصول على الصورة الأوسع، راجع استعراض إحصائيات التعليق المباشر.

أبرز النقاط

  • انخفض متوسط تأخر الترجمة النصية المباشرة في بريطانيا من 5.7 إلى 5.1 ثانية بين أبريل-مايو وأكتوبر-نوفمبر 2014، وهو ما زال أعلى بكثير من الإرشاد البالغ 3 ثوان (Ofcom، التقرير الثالث عن الترجمة النصية المباشرة، 2015).
  • لم تستوف سوى 4 عينات من أصل 72 في بريطانيا الإرشاد البالغ 3 ثوان في الجولة الثانية، وبلغ أطول تأخر 21 ثانية (Ofcom، التقرير الثاني، 2014).
  • تطلب Ofcom الآن متوسط تأخر لا يتجاوز 4.5 ثانية عبر البرامج المباشرة (Ofcom، إرشادات تقديم خدمات الوصول التلفزيونية وعند الطلب).
  • بلغ متوسط تأخر التعليق في نشرات الأخبار الأمريكية بالإسبانية 8.2 ثانية، وتأخر 20% من التعليقات أكثر من 10 ثوان (Fresno، JoSTrans 42، 2024).
  • قيمت ترجمات التلفزيون بتأخر البث الأصلي (متوسط 8.46 ثانية) بـ 3.66 من 7 مقابل 5.09 من 7 عند مزامنتها (Thompson وآخرون، arXiv 2609.11408، 2026).
  • بلغ متوسط دقة الترجمة النصية المباشرة في بريطانيا 98.38% وفق NER عبر أربع جولات لـ Ofcom، أي فوق عتبة 98% (بيانات Ofcom عبر Moores، JoSTrans 33).
  • بلغ متوسط دقة نشرات الأخبار الوطنية الأمريكية بالإنجليزية 98.8% وفق NER (Fresno، Universal Access in the Information Society، 2024).
  • سجل نظام تعليق تلقائي 98.56% وفق NER بالإنجليزية و98.26% بالإسبانية (Romero-Fresco وVan Gauwbergen، 2025).
  • أعلنت AssemblyAI عن وسيط تأخر في البث المتدفق قدره 307 ms مقابل 516 ms لـ Deepgram Nova-3 (AssemblyAI، يونيو 2025).
  • بلغ Whisper-Streaming متوسط تأخر قدره 3.3 ثانية على الكلام الإنجليزي الطويل (Machacek وDabre وBojar، IJCNLP-AACL 2023).
  • يجيب البشر عن السؤال خلال متوسط 208 ms عبر 10 لغات (Stivers وآخرون، PNAS 2009)، وهو المعيار الذي تسعى الأنظمة الفورية إلى بلوغه.
  • بلغت دقائق التعليق التلقائي LEXI لدى Ai-Media ما قدره 79.2 مليون دقيقة في السنة المالية 2025، ارتفاعا من أقل من 10 ملايين قبل أربع سنوات (نتائج Ai-Media للسنة المالية 2025، ASX).

1. التأخر المقاس: كم تتأخر الترجمة النصية المباشرة عن الكلام

أشمل مجموعة بيانات عامة عن تأخر الترجمة النصية المباشرة ما زالت المجموعة البريطانية، وهي ترسم صورة متسقة: تظهر الترجمة النصية المباشرة المعتادة بعد أكثر من 5 ثوان من نطق الكلمات. فقد أخذت Ofcom عينات من برامج الأخبار والترفيه والحوار من BBC وITV وChannel 4 وChannel 5 وSky عبر أربع جولات بين 2013 و2015. ووجد التقرير الأول وسيط تأخر قدره 5.6 ثانية (ملخص EPRA لتقرير Ofcom الأول، أبريل 2014)، ووجد الثاني 5.8 ثانية مع وقوع 4 عينات فقط من أصل 72 ضمن الإرشاد البالغ 3 ثوان (تقرير Limping Chicken عن تقرير Ofcom الثاني، نوفمبر 2014).

كان التحسن اللاحق حقيقيا لكنه صغير. فقد سجل تقرير Ofcom الثالث انخفاض متوسط التأخر بمقدار 0.6 ثانية، من 5.7 إلى 5.1 ثانية، بين أبريل-مايو وأكتوبر-نوفمبر 2014 (بيان Ofcom الصحفي عبر Wired-Gov، مايو 2015). واقتطاع نصف ثانية من تأخر مدته خمس ثوان تطلب من الهيئات الإذاعية تغيير سير العمل لا البرمجيات فحسب، ولهذا استقر الرقم عند مستوى ثابت. وهذه أحدث قياسات متاحة لتأخر Ofcom (2014-2015)؛ ولم تنشر أي مجموعة بيانات أحدث لكل هيئة إذاعية على حدة.

المقياسالقيمةالمصدر
وسيط تأخر الترجمة النصية المباشرة في بريطانيا، الجولة الأولى5.6 ثانيةتقرير Ofcom الأول عن الترجمة النصية المباشرة، أبريل 2014
التأخر في بريطانيا، الجولة الثانية5.8 ثانيةتقرير Ofcom الثاني، نوفمبر 2014
العينات المستوفية لإرشاد 3 ثوان، الجولة الثانية4 من 72تقرير Ofcom الثاني، 2014
أطول تأخر مسجل، الجولة الثانية21 ثانيةتقرير Ofcom الثاني، 2014
متوسط التأخر في بريطانيا، من أبريل-مايو 2014 إلى أكتوبر-نوفمبر 2014من 5.7 ثانية إلى 5.1 ثانية (-0.6 ثانية)تقرير Ofcom الثالث، مايو 2015
متوسط التأخر في بريطانيا عبر الجولات الأربع كلها5.3 ثانيةبيانات Ofcom عبر Moores، JoSTrans 33
التأخر دون توقيت البث المباشر للترجمات المعدة مسبقا7-8 ثوانبيانات Ofcom عبر Moores، JoSTrans 33

ملاحظة سياقية: تخلط أرقام كل جولة بين الوسيط والمتوسط كما أبلغ عنها، لذلك لا ينبغي المبالغة في تفسير الفروق الصغيرة بين الجولات (5.6 و5.7 و5.8). ويبين رقم 7-8 ثوان للبرامج التي لا تتضمن ترجمات معدة مسبقا ومؤقتة كم يعتمد المتوسط البريطاني على النصوص المكتوبة سلفا لا على النسخ الفوري.

خارج بريطانيا، يكون التأخر أطول. بلغ متوسط تأخر التعليق في نشرات أخبار Telemundo وUnivision الأمريكية بالإسبانية 8.2 ثانية خلف الكلام، بمدى يتراوح من 0.7 إلى 41 ثانية، مع تأخر 46% من التعليقات أكثر من 8 ثوان (Fresno، Closed Captions en espanol، JoSTrans 42، 2024). وقاست دراسة عام 2026 لمقاطع تلفزيونية أمريكية مباشرة متوسط تأخر قدره 8.46 ثانية (الانحراف المعياري 3.62) ووصفت 7-12 ثانية بأنها المعتادة لتعليق التلفزيون (Thompson وآخرون، arXiv 2609.11408).

المقياسالقيمةالمصدر
متوسط تأخر التعليق، نشرات الأخبار الأمريكية بالإسبانية8.2 ثانيةFresno، JoSTrans 42، 2024
مدى التأخر، العينة نفسهامن 0.7 إلى 41 ثانيةFresno، JoSTrans 42، 2024
التعليقات المتأخرة أكثر من 8 / 10 / 12 ثانية46% / 20% / 8%Fresno، JoSTrans 42، 2024
التعليقات المحللة في تلك الدراسة5,349 (20 مقطعا مدة كل منها عشر دقائق)Fresno، JoSTrans 42، 2024
متوسط التأخر في المقاطع التلفزيونية الأمريكية المباشرة8.46 ثانية (الانحراف المعياري 3.62)Thompson وآخرون، arXiv 2609.11408، سبتمبر 2026
تأخر التعليق التلفزيوني الأمريكي المعتاد المذكور7-12 ثانيةThompson وآخرون، arXiv 2609.11408، سبتمبر 2026
متوسط التأخر في الفعاليات المباشرة (غير المذاعة) بإعادة التحدث5.8 ثانية (المدى 4.3-7.5 ثانية)Moores، JoSTrans 33

2. الأهداف التنظيمية: من 3 ثوان إلى 4.5 ثانية

تتفق الجهات التنظيمية على أن زمن التأخر مهم، لكن لا تكاد أي منها تضع له رقما. Ofcom هي الجهة التنظيمية الكبرى الوحيدة في هذا الاستعراض التي لديها هدف رقمي لزمن التأخر، وقد حركت هذا الهدف في الاتجاه الأكثر تساهلا: من تأخر أقصى قدره 3 ثوان في مدونتها الخاصة بخدمات الوصول التلفزيونية إلى متوسط لا يزيد على 4.5 ثانية عبر البرامج المباشرة للمزود. وخلال مشاورة عام 2023، قالت Ofcom إن الهيئات الإذاعية وصفت الحد الأقصى البالغ 3 ثوان بأنه غير واقعي، وإن 4.5 ثانية توافق أفضل أزمنة التأخر التي حققتها هيئات إذاعية منفردة (إرشادات Ofcom لتقديم خدمات الوصول التلفزيونية وعند الطلب).

أما النهج الأمريكي فنوعي. فقد اعتمدت FCC معايير جودة التعليق في 20 فبراير 2014 تشمل الدقة والتزامن والاكتمال والموضع، وقالت فقط إن التأخر في التعليق المباشر ‘ينبغي إبقاؤه عند الحد الأدنى، بما يتسق مع عرض دقيق لما يقال’ (FCC، معايير جودة التعليق المغلق). وتنظم كندا الدقة بدلا من الزمن: إذ تشترط سياسة CRTC التنظيمية للبث 2019-308 أن يحقق التعليق المباشر بالإنجليزية درجة 98 وفق نموذج NER. والأثر العملي أن التعليق الذي يصل متأخرا 10 ثوان قد يكون متوافقا تماما في معظم أنحاء العالم.

المقياسالقيمةالمصدر
إرشاد Ofcom السابقتأخر أقصى 3 ثوانمدونة Ofcom لخدمات الوصول التلفزيونية
إرشاد Ofcom الحاليمتوسط لا يزيد على 4.5 ثانية عبر البرامج المباشرةإرشادات Ofcom لتقديم خدمات الوصول التلفزيونية وعند الطلب
إرشاد Ofcom السابق لسرعة الترجمة: المسجلة مسبقا / المباشرة160-180 كلمة في الدقيقة / 200 كلمة في الدقيقةمشاورة Ofcom 2023، كما أوردها Liam O’Dell
الحد الرقمي لتأخر FCCلا يوجد (التأخر ‘يبقى عند الحد الأدنى’)FCC 14-12، اعتمد في 20 فبراير 2014
حظر FCC للتعليق بالمسرع الآلي فقط (ENT) للبرامج المباشرة4 شبكات كبرى وفروعها في أكبر 25 سوقاFCC 14-12
تعليق FCC للبرامج الجديدة غير المعفاة100% منذ 1 يناير 200647 CFR 79.1
اشتراط CRTC لدقة التعليق المباشر بالإنجليزيةدرجة NER قدرها 98، اعتبارا من 1 سبتمبر 2019CRTC 2019-308
التزام CRTC بالرصدبرنامجان مباشران شهريا، منها نشرة أخبار واحدةCRTC 2019-308

ملاحظة سياقية: كما أن هيئة ACMA الأسترالية، بموجب معيار خدمات البث (التعليق التلفزيوني) لعام 2023 النافذ منذ 1 أكتوبر 2023، لا تضع زمن تأخر رقميا، وتقيم سهولة القراءة والدقة والفهم كل حالة على حدة.

أما القواعد الأحدث فتوسع الالتزامات لتشمل البث عبر الإنترنت بدلا من تشديد التأخر. تشترط CRTC 2026-98 في كندا على منصات البث عبر الإنترنت تعليق 80% من كتالوجها بحلول مايو 2030 و100% بحلول مايو 2031، مع تعليق البرامج الأصلية الجديدة المباشرة والمسجلة مسبقا خلال سنة (CRTC 2026-98، 25 مايو 2026). وتقترح مسودة مدونة الوصول من المستوى 1 الصادرة عن Ofcom في 14 مايو 2026 حصة ترجمة نصية قدرها 80% لأكبر منصات البث بعد أربع سنوات من النشر (Ofcom، مشاورة مدونة الوصول من المستوى 1).

المقياسالقيمةالمصدر
تعليق كتالوج منصات البث الكندية80% بحلول مايو 2030، 100% بحلول مايو 2031CRTC 2026-98
اشتراط الدقة الكندي للبرامج الأصلية المسجلة مسبقا على منصات البث100%CRTC 2026-98
حصة الترجمة النصية للمستوى 1 لدى Ofcom، السنة 4 / السنة 180% / 20%مسودة مدونة الوصول من المستوى 1 لدى Ofcom، مايو 2026
حصة الترجمة النصية لـ BBC عند الطلب، السنة 490%مسودة مدونة الوصول من المستوى 1 لدى Ofcom، مايو 2026
حد المستوى 1أكثر من 500,000 مستخدم بريطاني شهريا في المتوسطمسودة مدونة الوصول من المستوى 1 لدى Ofcom، مايو 2026

3. الدقة: خط 98% وفق NER ومن يتجاوزه

يتبادل التأخر والدقة المفاضلة فيما بينهما، لذلك لا معنى لأرقام التأخر إلا بجانب أرقام الدقة. والمعيار الشائع هو نموذج NER، الذي يقيم الترجمة النصية المباشرة بالصيغة (الكلمات ناقص أخطاء التحرير والتعرف) على الكلمات. 98% هي ‘مقبولة’، و98.5-98.99% ‘جيدة’، و99-99.49% ‘جيدة جدا’، وما فوق 99.5% ‘ممتازة’ (Romero-Fresco وMartinez، نموذج NER، 2015). وتبدو العتبة متسامحة حتى تترجمها إلى أرقام: عند 98%، تكون كلمتان من كل 100 كلمة خاطئتين أو ناقصتين أو أخطاء موزونة.

تجاوزت الهيئات الإذاعية البريطانية الحد في المتوسط: 98.38% عبر جولات Ofcom الأربع و98.55% في الأخيرة، مقاسة على 78,000 ترجمة نصية و546,000 كلمة (Moores، JoSTrans 33). لكن المتوسطات تخفي الذيل. ففي أكتوبر-نوفمبر 2014، بلغت 77% من البرامج البريطانية 98% أو أكثر، ارتفاعا من 74% في أبريل-مايو 2014، وكانت الأخبار أدق الأنواع بنسبة 98.75% (تقرير Ofcom الثالث، 2015). وكان أداء نشرات الأخبار الوطنية الأمريكية بالإنجليزية أفضل، بمتوسط 98.8% مع تقييم 14 من 20 عينة بأنها مقبولة أو أفضل، بينما هبطت نشرات الأخبار بالإسبانية إلى 97.04% (Fresno، 2024).

المقياسالقيمةالمصدر
عتبتا NER المقبولة / الممتازة98% / أكثر من 99.5%Romero-Fresco وMartinez، 2015
دقة الترجمة النصية المباشرة في بريطانيا، متوسط الجولات الأربع98.38%بيانات Ofcom عبر Moores، JoSTrans 33
دقة الترجمة النصية المباشرة في بريطانيا، الجولة الأخيرة98.55%بيانات Ofcom عبر Moores، JoSTrans 33
البرامج البريطانية عند 98% أو أكثر، أكتوبر-نوفمبر 2014 (مقابل أبريل-مايو 2014)77% (74%)تقرير Ofcom الثالث، 2015
دقة نوع الأخبار في بريطانيا98.75%تقرير Ofcom الثالث، 2015
نشرات الأخبار الوطنية الأمريكية بالإنجليزية، متوسط NER98.8% (14 من 20 عينة مقبولة أو أفضل)Fresno، Universal Access in the Information Society، 2024
نشرات الأخبار الأمريكية بالإسبانية، متوسط NER97.04% (Telemundo 97.00%، Univision 97.10%)Fresno، JoSTrans 42، 2024
تقليص النص: نشرات الأخبار بالإسبانية مقابل الإنجليزية26% مقابل 5-6%Fresno، JoSTrans 42، 2024

ملاحظة سياقية: السرعة هي المتغير الثالث الخفي. توصي Ofcom بأن يقل متوسط الترجمات النصية عن 180 كلمة في الدقيقة، ومع ذلك فإن كل البرامج تقريبا التي حللتها تضمنت دفعات قصيرة تتجاوز 200 كلمة في الدقيقة، وعند احتساب تلك الدفعات أخطاء، هبطت 68% من البرامج دون 98% (تقرير Ofcom الثالث، 2015). ووجدت دراسة نشرات الأخبار الأمريكية بالإنجليزية أن ما يقرب من ثلثي الأخطاء كانت طفيفة.

4. ما يكلفه التأخر المشاهدين

جمهور الترجمة النصية المباشرة أكبر بكثير من مجتمع الصم وحده. فقد قدرت Ofcom أن نحو 7.6 مليون بالغ في بريطانيا استخدموا الترجمة النصية، منهم 1.4 مليون فقط يعانون ضعفا في السمع (بيان Ofcom الصحفي عبر Wired-Gov، مايو 2013). وهذا يعني أن أكثر من 6 ملايين مستخدم للترجمة النصية لا يعانون ضعفا في السمع (7.6 مليون ناقص 1.4 مليون)، يشاهد كثير منهم في غرف صاخبة أو بصوت منخفض. وتستشهد إرشادات Ofcom أيضا ببيانات YouGov التي تفيد بأن 61% ممن تتراوح أعمارهم بين 18 و24 عاما يفضلون تشغيل الترجمة النصية. وعلى المستوى العالمي، تقدر منظمة الصحة العالمية أن 430 مليون شخص يحتاجون إلى إعادة تأهيل بسبب فقدان سمع مسبب للإعاقة اليوم، وسيرتفع العدد إلى أكثر من 700 مليون بحلول 2050.

المقياسالقيمةالمصدر
البالغون في بريطانيا الذين استخدموا الترجمة النصيةنحو 7.6 مليون (المدى 7.0-8.1 مليون)Ofcom، مايو 2013
منهم من يعانون ضعفا في السمعنحو 1.4 مليون (المدى 1.2-1.6 مليون)Ofcom، مايو 2013
من تتراوح أعمارهم بين 18 و24 عاما في بريطانيا ويفضلون تشغيل الترجمة النصية61%YouGov، مذكور في إرشادات Ofcom لخدمات الوصول
حصة ساعات البرامج لدى هيئات البث العام في بريطانيا ومنصات الطلب الأكبر المترجمة نصيا، 202488%تقرير Ofcom لخدمات الوصول، يناير-ديسمبر 2024 (نشر في 19 مايو 2025)
ساعات الترجمة النصية على القنوات المطلوبة في بريطانيا، 2005 مقابل 201340.5% مقابل 81.9%تقرير Ofcom الأول عن الترجمة النصية المباشرة، 2014
من يحتاجون إلى إعادة تأهيل بسبب فقدان سمع مسبب للإعاقة430 مليونصحيفة وقائع منظمة الصحة العالمية، محدثة في مارس 2026
من يتوقع أن يعانوا درجة ما من فقدان السمع بحلول 2050قرابة 2.5 مليارصحيفة وقائع منظمة الصحة العالمية، محدثة في مارس 2026

التأخر هو أول ما يلاحظه المشاهدون. فقد طلبت أكبر دراسة حديثة للمستخدمين من 216 مشاهدا من الصم وضعاف السمع تقييم 70 مقطعا تلفزيونيا مباشرا في أربع حالات، ما أنتج 4,832 تقييما. نالت ترجمات التلفزيون نفسها 3.66 من 7 بتأخرها الأصلي في البث و5.09 عند مزامنتها، وهو تفاوت أوسع بكثير من الفجوة بين التلفزيون المتزامن وترجمات ASR (Thompson وآخرون، Are Caption Metrics Broken?، arXiv 2609.11408، سبتمبر 2026). وصمدت ترجمات ASR ذات التأخر البالغ ثانيتين بشكل أفضل بكثير، عند 4.81 مقابل 5.20 عند المزامنة.

وتقوض الدراسة نفسها فكرة أن درجات الدقة تعبر عن الجودة. فلم تبلغ عتبة 98 وفق NER سوى 11 من 70 مقطعا تلفزيونيا و4 من 70 مقطعا من ASR، ومع ذلك قيم المشاهدون ترجمات ASR والتلفزيون المتزامنة بالقدر نفسه تقريبا، وانخفض الارتباط بين المقاييس والتقييمات انخفاضا حادا بالنسبة لمخرجات ASR (WER r = -0.390 مقابل -0.687 لترجمات التلفزيون). وخلصت دراسة CHI 2024 السابقة من Gallaudet إلى استنتاج مماثل: فقد كره المشاركون بشدة تأخر البث، ولم ترتبط مقاييس الدقة القياسية إلا ارتباطا ضعيفا بكيفية تقييم المشاهدين للتعليق.

المقياسالقيمةالمصدر
المشاركون / التقييمات / المقاطع216 / 4,832 / 70Thompson وآخرون، arXiv 2609.11408، 2026
تقييم ترجمات التلفزيون: التأخر الأصلي مقابل المتزامنة (مقياس من 7 نقاط)3.66 مقابل 5.09Thompson وآخرون، 2026
تقييم ترجمات ASR: تأخر ثانيتين مقابل المتزامنة4.81 مقابل 5.20Thompson وآخرون، 2026
متوسط WER: ترجمات التلفزيون مقابل ترجمات ASR33.8% مقابل 17.2%Thompson وآخرون، 2026
متوسط NER: ترجمات التلفزيون مقابل ترجمات ASR95.28 مقابل 94.34Thompson وآخرون، 2026
المقاطع المستوفية لـ NER 98: التلفزيون مقابل ASR11 من 70 مقابل 4 من 70Thompson وآخرون، 2026
ارتباط WER بتقييمات المشاهدين: التلفزيون مقابل ASRr = -0.687 مقابل -0.390Thompson وآخرون، 2026

ملاحظة سياقية: يعكس ارتفاع WER في ترجمات التلفزيون جزئيا أن التعليق المذاع يعيد الصياغة ويختصر، وهو ما يعاقب عليه WER ولا يعاقب عليه NER. وهذه الفجوة هي بالضبط ما يدفع المؤلفين إلى القول بأن المقاييس الحالية ليست محايدة تقنيا.

5. سرعة محركات ASR: زمن التأخر في البث المتدفق مقابل المحادثة البشرية

لم يعد تأخر المحرك المصدر الرئيسي لتأخر الترجمة النصية. أعلنت AssemblyAI عن وسيط تأخر في البث المتدفق قدره 307 ms لـ Universal-Streaming مقابل 516 ms لـ Deepgram Nova-3، وعن P99 قدره 1,012 ms مقابل 1,907 ms، مقاسا من نهاية الكلمة في الصوت إلى أول ظهور لها في نص جزئي عبر أكثر من 205 ساعات من الصوت (AssemblyAI، Introducing Universal-Streaming، 2 يونيو 2025). ووضعت بيانات إطلاق Deepgram نفسها وسيط معدل خطأ الكلمات في البث المتدفق لـ Nova-3 عند 6.84%، مقابل 14.92% للمنافسين الذين اختبرتهم (Deepgram، Introducing Nova-3، فبراير 2025). وكلاهما اختبار من الموردين ويجب قراءته بوصفه أفضل سيناريو. وتغطي إحصائيات تحويل الكلام إلى نص لدينا الدقة عبر مزيد من المحركات.

وتقايض النماذج المفتوحة مزيدا من التأخر مقابل الاستقرار. فقد بلغ نظام Whisper-Streaming الأكاديمي متوسط تأخر قدره 3.3 ثانية على الكلام الإنجليزي الطويل من مجموعة اختبار ESIC للبرلمان الأوروبي، والمقايضة صريحة في نتائجه: معدل WER بالإنجليزية 8.5% عند تأخر 3.27 ثانية بقطع مدتها 0.5 ثانية مقابل 8.0% عند 5.45 ثانية بقطع مدتها 2 ثانية (Machacek وDabre وBojar، arXiv 2307.14743، IJCNLP-AACL 2023). وانتبه إلى أن إعداد Whisper بتأخر 5 ثوان يقع تماما فوق متوسط البث البريطاني قبل عقد من الزمن.

المقياسالقيمةالمصدر
وسيط / P99 تأخر AssemblyAI Universal-Streaming307 ms / 1,012 msAssemblyAI، يونيو 2025
وسيط / P99 تأخر Deepgram Nova-3 (اختبار AssemblyAI)516 ms / 1,907 msAssemblyAI، يونيو 2025
وسيط WER لـ Deepgram Nova-3: متدفق / دفعي6.84% / 5.26%Deepgram، فبراير 2025
مجموعة اختبار Deepgram Nova-32,703 ملفا، 81.69 ساعة، 9 مجالاتDeepgram، فبراير 2025
متوسط تأخر Whisper-Streaming، بالإنجليزية3.3 ثانيةMachacek وآخرون، 2023
Whisper-Streaming بالإنجليزية: قطعة 0.5 ثانية مقابل قطعة 2.0 ثانيةWER 8.5% عند 3.27 ثانية مقابل WER 8.0% عند 5.45 ثانيةMachacek وآخرون، 2023
تأخر Whisper-Streaming، بالألمانية / التشيكية (قطعة 0.5 ثانية)4.11 ثانية / 4.69 ثانيةMachacek وآخرون، 2023

وسقف الزمن الفوري تحدده المحادثة البشرية. فعبر 10 لغات، بلغ متوسط الفجوة بين السؤال وجوابه +208 ms، بمدى من +7 ms في اليابانية إلى +469 ms في الدنماركية (Stivers وآخرون، PNAS 2009). وزعم إطلاق GPT-4o من OpenAI ردودا صوتية في أقل من 232 ms وبمتوسط 320 ms، مقابل 2.8 ثانية (GPT-3.5) و5.4 ثانية (GPT-4) للوضع الصوتي المتسلسل السابق، الذي كان يربط نماذج منفصلة للنسخ واللغة والكلام. والدرس للترجمة النصية المباشرة هو نفسه: كل مرحلة إضافية في السلسلة تضيف ثواني، والمرحلة التي كانت تهيمن، أي التعرف نفسه، صارت الأصغر.

المقياسالقيمةالمصدر
متوسط الفجوة بين السؤال والجواب، 10 لغات+208 msStivers وآخرون، PNAS 2009 (أحدث بيانات متاحة)
متوسط أسرع / أبطأ لغة+7 ms (اليابانية) / +469 ms (الدنماركية)Stivers وآخرون، PNAS 2009
الرد الصوتي لـ GPT-4o: الأدنى / المتوسط232 ms / 320 msOpenAI، مايو 2024
متوسط تأخر الوضع الصوتي المتسلسل: GPT-3.5 / GPT-42.8 ثانية / 5.4 ثانيةOpenAI، مايو 2024
تأخر تعليق ASR المستخدم في دراسة المشاهدين لعام 2026ثانيتان في المتوسطThompson وآخرون، arXiv 2609.11408

6. الأتمتة تستحوذ على سلسلة التعليق

القوى العاملة البشرية وراء الترجمة النصية المباشرة تحددها حدود السرعة. فمعيار الوقت الفعلي الأمريكي، مراسل الوقت الفعلي المعتمد من NCRA، يشترط اختبارا فوريا مدته خمس دقائق بمعدل 200 كلمة في الدقيقة وبدقة 96%، ويصف تقرير EBU الترجمة النصية المباشرة بأنها مواكبة للمتحدثين حتى 200 كلمة في الدقيقة. وأخبر المتحدثون المعيدون (respeakers) في بريطانيا الباحثين أن التدريب الأساسي يستغرق 2-3 أشهر، بينما يستغرق اكتساب الثقة من سنة ونصف إلى سنتين (Moores، JoSTrans 33). وهذه القيود هي سبب انتشار التعليق التلقائي بهذه السرعة متى اقتربت الدقة.

ويظهر التحول في الحجم في إفصاحات الشركات. بلغت دقائق التعليق التلقائي LEXI لدى Ai-Media ما قدره 79.2 مليون دقيقة في السنة المالية 2025، ارتفاعا من أقل من 10 ملايين قبل أربع سنوات، بمعدل نمو سنوي مركب قدره 69% على أربع سنوات، وتستأثر LEXI الآن بمعظم الاستخدام عبر شبكة iCap لديها (نتائج Ai-Media للسنة المالية 2025، إعلان ASX، 28 أغسطس 2025). وشكلت المنتجات التقنية 63% من إيرادات Ai-Media، بعد أن كانت صفرا قبل خمس سنوات. ووجد اختبار مستقل للنظام نفسه دقة NER بلغت 98.56% بالإنجليزية و98.26% بالإسبانية، بما يضاهي التعليق البشري إلا في المحتوى العامي ذي المتحدثين المتعددين (Romero-Fresco وVan Gauwbergen، Fit for What Purpose?، 2025). وللمزيد عن الجانب البشري من المهنة، راجع إحصائيات دقة النسخ في قاعات المحاكم لدينا.

المقياسالقيمةالمصدر
معيار الوقت الفعلي لـ NCRA CRR200 كلمة في الدقيقة بدقة 96% (اختبار 5 دقائق)NCRA
التدريب الأساسي للمتحدث المعيد / الوقت اللازم لاكتساب الثقة2-3 أشهر / من سنة ونصف إلى سنتينMoores، JoSTrans 33
دقائق التعليق التلقائي LEXI لدى Ai-Media، السنة المالية 202579.2 مليوننتائج Ai-Media للسنة المالية 2025، ASX
دقائق LEXI قبل أربع سنواتأقل من 10 ملايين (معدل نمو سنوي مركب 69% على أربع سنوات)نتائج Ai-Media للسنة المالية 2025، ASX
حصة التقنية من إيرادات Ai-Media63% (إجمالي الإيرادات 64.9 مليون دولار)نتائج Ai-Media للسنة المالية 2025، ASX
دقة NER للتعليق التلقائي: الإنجليزية / الإسبانية98.56% / 98.26%Romero-Fresco وVan Gauwbergen، 2025
التعليقات المباشرة المحللة في مقارنة المخرجات التلقائية والبشرية، بريطانيا/أمريكا/كندا 2018-2022نحو 17,000Romero-Fresco وFresno، Linguistica Antverpiensia 22، 2023

ملاحظة سياقية: وجدت أكبر مقارنة حتى الآن بين الإنسان والآلة (Romero-Fresco وFresno، Linguistica Antverpiensia، 2023) أن التعليق التلقائي غير المحرر اقترب من 98%، مع نقاط ضعف مستمرة في علامات الترقيم وأسماء العلم والأرقام وتحديد المتحدث. ولا يعالج انخفاض تأخر المحرك هذه المشكلات: فالاسم الخاطئ السريع يبقى اسما خاطئا.

الخلاصة: زمن التأخر في الترجمة النصية المباشرة بالأرقام

المقياسالقيمةالمصدر
متوسط تأخر الترجمة النصية المباشرة في بريطانيا، أواخر 20145.1 ثانيةتقرير Ofcom الثالث، 2015
العينات البريطانية المستوفية لإرشاد 3 ثوان، الجولة الثانية4 من 72تقرير Ofcom الثاني، 2014
أطول تأخر مسجل في بريطانيا21 ثانيةتقرير Ofcom الثاني، 2014
إرشاد Ofcom الحالي للتأخرمتوسط 4.5 ثانية أو أقلإرشادات Ofcom لخدمات الوصول
الحد الرقمي لتأخر FCCلا يوجدFCC 14-12، 2014
دقة التعليق المباشر بالإنجليزية لدى CRTCNER 98CRTC 2019-308
تأخر التعليق في نشرات الأخبار الأمريكية بالإسبانيةمتوسط 8.2 ثانيةFresno، JoSTrans 42، 2024
تعليقات نشرات الأخبار الأمريكية بالإسبانية المتأخرة أكثر من 10 ثوان20%Fresno، JoSTrans 42، 2024
متوسط التأخر في المقاطع التلفزيونية الأمريكية المباشرة8.46 ثانيةThompson وآخرون، arXiv 2609.11408، 2026
تقييم تعليق التلفزيون: المتأخر مقابل المتزامن3.66 مقابل 5.09 من 7Thompson وآخرون، 2026
دقة الترجمة النصية المباشرة في بريطانيا، متوسط الجولات الأربع98.38%بيانات Ofcom عبر Moores، JoSTrans 33
دقة نشرات الأخبار الوطنية الأمريكية بالإنجليزية98.8%Fresno، 2024
دقة التعليق التلقائي، بالإنجليزية98.56%Romero-Fresco وVan Gauwbergen، 2025
البالغون في بريطانيا الذين استخدموا الترجمة النصيةنحو 7.6 مليونOfcom، 2013
ساعات هيئات البث العام في بريطانيا ومنصات الطلب الأكبر المترجمة نصيا، 202488%تقرير Ofcom لخدمات الوصول 2024
وسيط تأخر البث المتدفق لدى AssemblyAI307 msAssemblyAI، يونيو 2025
متوسط تأخر Whisper-Streaming3.3 ثانيةMachacek وآخرون، 2023
متوسط فجوة تبادل الأدوار في الحديث البشري208 msStivers وآخرون، PNAS 2009
دقائق تعليق LEXI لدى Ai-Media، السنة المالية 202579.2 مليوننتائج Ai-Media للسنة المالية 2025
تعليق كتالوج منصات البث الكندية بحلول مايو 2031100%CRTC 2026-98

المنهجية والمصادر

تم تتبع كل رقم أعلاه إلى الجهة التنظيمية أو الإفصاح أو الورقة المحكمة التي أنتجته. ولم يمكن استرجاع عدة ملفات PDF لدى Ofcom مباشرة، لذلك أخذت الأرقام البريطانية من بيانات Ofcom الصحفية (المعاد نشرها على Wired-Gov)، وملخصات الجهات التنظيمية (EPRA)، والتحليل المحكم لمجموعة بيانات Ofcom (Moores)، وقد سمي كل منها ضمن النص. وتوسم اختبارات الموردين بأنها بيانات موردين. وللاطلاع على بيانات سوق التعليق والترجمة النصية واستخدامهما عموما، راجع إحصائيات التعليق والترجمة النصية لدينا.

آخر تحديث: 3 أكتوبر 2026. نحدث هذا الاستعراض كل ثلاثة أشهر، ومن المتوقع أن يأتي التحديث التالي عندما تنشر Ofcom بيانها النهائي لمدونة الوصول من المستوى 1 وتقرير خدمات الوصول عن الفترة من يناير إلى ديسمبر 2025.

جرّب VoxBooster — 3 أيام مجاناً.

استنساخ الصوت الفوري، لوحة الأصوات والمؤثرات — أينما تتحدث.

  • بدون بطاقة
  • ~30ms تأخير
  • Discord · Teams · OBS
جرّب 3 أيام مجاناً