تأخرت الترجمة النصية المباشرة على التلفزيون البريطاني عن الكلام بمتوسط 5.1 إلى 5.8 ثانية عبر جولات القياس التي أجرتها Ofcom، ولم تستوف سوى 4 عينات من أصل 72 في جولتها الثانية الإرشاد القديم البالغ 3 ثوان (Ofcom، تقارير جودة الترجمة النصية المباشرة 2014-2015). والمشكلة لم تختف: فقد قاست دراسة عام 2024 على نشرات الأخبار الأمريكية بالإسبانية متوسط تأخر قدره 8.2 ثانية، مع ترجمات منفردة تأخرت حتى 41 ثانية (Fresno، JoSTrans 2024)، وقاست دراسة في سبتمبر 2026 متوسطا قدره 8.46 ثانية على مقاطع تلفزيونية أمريكية مباشرة. وفي الوقت نفسه، تعلن محركات التعرف على الكلام المتدفقة الآن عن وسيط تأخر للكلمة يقارب 300 ميلي ثانية (AssemblyAI، يونيو 2025)، ما يعني أن عنق الزجاجة في التعليق المباشر ينتقل من الكاتب البشري إلى سلسلة البث. جمعنا بيانات من Ofcom وFCC وCRTC، ودراسات محكمة من جامعة Gallaudet وجامعة فيغو، وأوراق معايير على arXiv، وإفصاحات Ai-Media لدى بورصة ASX، ومنظمة الصحة العالمية، ومصادر أولية أخرى مذكورة في المنهجية. وللحصول على الصورة الأوسع، راجع استعراض إحصائيات التعليق المباشر.
أبرز النقاط
- انخفض متوسط تأخر الترجمة النصية المباشرة في بريطانيا من 5.7 إلى 5.1 ثانية بين أبريل-مايو وأكتوبر-نوفمبر 2014، وهو ما زال أعلى بكثير من الإرشاد البالغ 3 ثوان (Ofcom، التقرير الثالث عن الترجمة النصية المباشرة، 2015).
- لم تستوف سوى 4 عينات من أصل 72 في بريطانيا الإرشاد البالغ 3 ثوان في الجولة الثانية، وبلغ أطول تأخر 21 ثانية (Ofcom، التقرير الثاني، 2014).
- تطلب Ofcom الآن متوسط تأخر لا يتجاوز 4.5 ثانية عبر البرامج المباشرة (Ofcom، إرشادات تقديم خدمات الوصول التلفزيونية وعند الطلب).
- بلغ متوسط تأخر التعليق في نشرات الأخبار الأمريكية بالإسبانية 8.2 ثانية، وتأخر 20% من التعليقات أكثر من 10 ثوان (Fresno، JoSTrans 42، 2024).
- قيمت ترجمات التلفزيون بتأخر البث الأصلي (متوسط 8.46 ثانية) بـ 3.66 من 7 مقابل 5.09 من 7 عند مزامنتها (Thompson وآخرون، arXiv 2609.11408، 2026).
- بلغ متوسط دقة الترجمة النصية المباشرة في بريطانيا 98.38% وفق NER عبر أربع جولات لـ Ofcom، أي فوق عتبة 98% (بيانات Ofcom عبر Moores، JoSTrans 33).
- بلغ متوسط دقة نشرات الأخبار الوطنية الأمريكية بالإنجليزية 98.8% وفق NER (Fresno، Universal Access in the Information Society، 2024).
- سجل نظام تعليق تلقائي 98.56% وفق NER بالإنجليزية و98.26% بالإسبانية (Romero-Fresco وVan Gauwbergen، 2025).
- أعلنت AssemblyAI عن وسيط تأخر في البث المتدفق قدره 307 ms مقابل 516 ms لـ Deepgram Nova-3 (AssemblyAI، يونيو 2025).
- بلغ Whisper-Streaming متوسط تأخر قدره 3.3 ثانية على الكلام الإنجليزي الطويل (Machacek وDabre وBojar، IJCNLP-AACL 2023).
- يجيب البشر عن السؤال خلال متوسط 208 ms عبر 10 لغات (Stivers وآخرون، PNAS 2009)، وهو المعيار الذي تسعى الأنظمة الفورية إلى بلوغه.
- بلغت دقائق التعليق التلقائي LEXI لدى Ai-Media ما قدره 79.2 مليون دقيقة في السنة المالية 2025، ارتفاعا من أقل من 10 ملايين قبل أربع سنوات (نتائج Ai-Media للسنة المالية 2025، ASX).
1. التأخر المقاس: كم تتأخر الترجمة النصية المباشرة عن الكلام
أشمل مجموعة بيانات عامة عن تأخر الترجمة النصية المباشرة ما زالت المجموعة البريطانية، وهي ترسم صورة متسقة: تظهر الترجمة النصية المباشرة المعتادة بعد أكثر من 5 ثوان من نطق الكلمات. فقد أخذت Ofcom عينات من برامج الأخبار والترفيه والحوار من BBC وITV وChannel 4 وChannel 5 وSky عبر أربع جولات بين 2013 و2015. ووجد التقرير الأول وسيط تأخر قدره 5.6 ثانية (ملخص EPRA لتقرير Ofcom الأول، أبريل 2014)، ووجد الثاني 5.8 ثانية مع وقوع 4 عينات فقط من أصل 72 ضمن الإرشاد البالغ 3 ثوان (تقرير Limping Chicken عن تقرير Ofcom الثاني، نوفمبر 2014).
كان التحسن اللاحق حقيقيا لكنه صغير. فقد سجل تقرير Ofcom الثالث انخفاض متوسط التأخر بمقدار 0.6 ثانية، من 5.7 إلى 5.1 ثانية، بين أبريل-مايو وأكتوبر-نوفمبر 2014 (بيان Ofcom الصحفي عبر Wired-Gov، مايو 2015). واقتطاع نصف ثانية من تأخر مدته خمس ثوان تطلب من الهيئات الإذاعية تغيير سير العمل لا البرمجيات فحسب، ولهذا استقر الرقم عند مستوى ثابت. وهذه أحدث قياسات متاحة لتأخر Ofcom (2014-2015)؛ ولم تنشر أي مجموعة بيانات أحدث لكل هيئة إذاعية على حدة.
| المقياس | القيمة | المصدر |
|---|---|---|
| وسيط تأخر الترجمة النصية المباشرة في بريطانيا، الجولة الأولى | 5.6 ثانية | تقرير Ofcom الأول عن الترجمة النصية المباشرة، أبريل 2014 |
| التأخر في بريطانيا، الجولة الثانية | 5.8 ثانية | تقرير Ofcom الثاني، نوفمبر 2014 |
| العينات المستوفية لإرشاد 3 ثوان، الجولة الثانية | 4 من 72 | تقرير Ofcom الثاني، 2014 |
| أطول تأخر مسجل، الجولة الثانية | 21 ثانية | تقرير Ofcom الثاني، 2014 |
| متوسط التأخر في بريطانيا، من أبريل-مايو 2014 إلى أكتوبر-نوفمبر 2014 | من 5.7 ثانية إلى 5.1 ثانية (-0.6 ثانية) | تقرير Ofcom الثالث، مايو 2015 |
| متوسط التأخر في بريطانيا عبر الجولات الأربع كلها | 5.3 ثانية | بيانات Ofcom عبر Moores، JoSTrans 33 |
| التأخر دون توقيت البث المباشر للترجمات المعدة مسبقا | 7-8 ثوان | بيانات Ofcom عبر Moores، JoSTrans 33 |
ملاحظة سياقية: تخلط أرقام كل جولة بين الوسيط والمتوسط كما أبلغ عنها، لذلك لا ينبغي المبالغة في تفسير الفروق الصغيرة بين الجولات (5.6 و5.7 و5.8). ويبين رقم 7-8 ثوان للبرامج التي لا تتضمن ترجمات معدة مسبقا ومؤقتة كم يعتمد المتوسط البريطاني على النصوص المكتوبة سلفا لا على النسخ الفوري.
خارج بريطانيا، يكون التأخر أطول. بلغ متوسط تأخر التعليق في نشرات أخبار Telemundo وUnivision الأمريكية بالإسبانية 8.2 ثانية خلف الكلام، بمدى يتراوح من 0.7 إلى 41 ثانية، مع تأخر 46% من التعليقات أكثر من 8 ثوان (Fresno، Closed Captions en espanol، JoSTrans 42، 2024). وقاست دراسة عام 2026 لمقاطع تلفزيونية أمريكية مباشرة متوسط تأخر قدره 8.46 ثانية (الانحراف المعياري 3.62) ووصفت 7-12 ثانية بأنها المعتادة لتعليق التلفزيون (Thompson وآخرون، arXiv 2609.11408).
| المقياس | القيمة | المصدر |
|---|---|---|
| متوسط تأخر التعليق، نشرات الأخبار الأمريكية بالإسبانية | 8.2 ثانية | Fresno، JoSTrans 42، 2024 |
| مدى التأخر، العينة نفسها | من 0.7 إلى 41 ثانية | Fresno، JoSTrans 42، 2024 |
| التعليقات المتأخرة أكثر من 8 / 10 / 12 ثانية | 46% / 20% / 8% | Fresno، JoSTrans 42، 2024 |
| التعليقات المحللة في تلك الدراسة | 5,349 (20 مقطعا مدة كل منها عشر دقائق) | Fresno، JoSTrans 42، 2024 |
| متوسط التأخر في المقاطع التلفزيونية الأمريكية المباشرة | 8.46 ثانية (الانحراف المعياري 3.62) | Thompson وآخرون، arXiv 2609.11408، سبتمبر 2026 |
| تأخر التعليق التلفزيوني الأمريكي المعتاد المذكور | 7-12 ثانية | Thompson وآخرون، arXiv 2609.11408، سبتمبر 2026 |
| متوسط التأخر في الفعاليات المباشرة (غير المذاعة) بإعادة التحدث | 5.8 ثانية (المدى 4.3-7.5 ثانية) | Moores، JoSTrans 33 |
2. الأهداف التنظيمية: من 3 ثوان إلى 4.5 ثانية
تتفق الجهات التنظيمية على أن زمن التأخر مهم، لكن لا تكاد أي منها تضع له رقما. Ofcom هي الجهة التنظيمية الكبرى الوحيدة في هذا الاستعراض التي لديها هدف رقمي لزمن التأخر، وقد حركت هذا الهدف في الاتجاه الأكثر تساهلا: من تأخر أقصى قدره 3 ثوان في مدونتها الخاصة بخدمات الوصول التلفزيونية إلى متوسط لا يزيد على 4.5 ثانية عبر البرامج المباشرة للمزود. وخلال مشاورة عام 2023، قالت Ofcom إن الهيئات الإذاعية وصفت الحد الأقصى البالغ 3 ثوان بأنه غير واقعي، وإن 4.5 ثانية توافق أفضل أزمنة التأخر التي حققتها هيئات إذاعية منفردة (إرشادات Ofcom لتقديم خدمات الوصول التلفزيونية وعند الطلب).
أما النهج الأمريكي فنوعي. فقد اعتمدت FCC معايير جودة التعليق في 20 فبراير 2014 تشمل الدقة والتزامن والاكتمال والموضع، وقالت فقط إن التأخر في التعليق المباشر ‘ينبغي إبقاؤه عند الحد الأدنى، بما يتسق مع عرض دقيق لما يقال’ (FCC، معايير جودة التعليق المغلق). وتنظم كندا الدقة بدلا من الزمن: إذ تشترط سياسة CRTC التنظيمية للبث 2019-308 أن يحقق التعليق المباشر بالإنجليزية درجة 98 وفق نموذج NER. والأثر العملي أن التعليق الذي يصل متأخرا 10 ثوان قد يكون متوافقا تماما في معظم أنحاء العالم.
| المقياس | القيمة | المصدر |
|---|---|---|
| إرشاد Ofcom السابق | تأخر أقصى 3 ثوان | مدونة Ofcom لخدمات الوصول التلفزيونية |
| إرشاد Ofcom الحالي | متوسط لا يزيد على 4.5 ثانية عبر البرامج المباشرة | إرشادات Ofcom لتقديم خدمات الوصول التلفزيونية وعند الطلب |
| إرشاد Ofcom السابق لسرعة الترجمة: المسجلة مسبقا / المباشرة | 160-180 كلمة في الدقيقة / 200 كلمة في الدقيقة | مشاورة Ofcom 2023، كما أوردها Liam O’Dell |
| الحد الرقمي لتأخر FCC | لا يوجد (التأخر ‘يبقى عند الحد الأدنى’) | FCC 14-12، اعتمد في 20 فبراير 2014 |
| حظر FCC للتعليق بالمسرع الآلي فقط (ENT) للبرامج المباشرة | 4 شبكات كبرى وفروعها في أكبر 25 سوقا | FCC 14-12 |
| تعليق FCC للبرامج الجديدة غير المعفاة | 100% منذ 1 يناير 2006 | 47 CFR 79.1 |
| اشتراط CRTC لدقة التعليق المباشر بالإنجليزية | درجة NER قدرها 98، اعتبارا من 1 سبتمبر 2019 | CRTC 2019-308 |
| التزام CRTC بالرصد | برنامجان مباشران شهريا، منها نشرة أخبار واحدة | CRTC 2019-308 |
ملاحظة سياقية: كما أن هيئة ACMA الأسترالية، بموجب معيار خدمات البث (التعليق التلفزيوني) لعام 2023 النافذ منذ 1 أكتوبر 2023، لا تضع زمن تأخر رقميا، وتقيم سهولة القراءة والدقة والفهم كل حالة على حدة.
أما القواعد الأحدث فتوسع الالتزامات لتشمل البث عبر الإنترنت بدلا من تشديد التأخر. تشترط CRTC 2026-98 في كندا على منصات البث عبر الإنترنت تعليق 80% من كتالوجها بحلول مايو 2030 و100% بحلول مايو 2031، مع تعليق البرامج الأصلية الجديدة المباشرة والمسجلة مسبقا خلال سنة (CRTC 2026-98، 25 مايو 2026). وتقترح مسودة مدونة الوصول من المستوى 1 الصادرة عن Ofcom في 14 مايو 2026 حصة ترجمة نصية قدرها 80% لأكبر منصات البث بعد أربع سنوات من النشر (Ofcom، مشاورة مدونة الوصول من المستوى 1).
| المقياس | القيمة | المصدر |
|---|---|---|
| تعليق كتالوج منصات البث الكندية | 80% بحلول مايو 2030، 100% بحلول مايو 2031 | CRTC 2026-98 |
| اشتراط الدقة الكندي للبرامج الأصلية المسجلة مسبقا على منصات البث | 100% | CRTC 2026-98 |
| حصة الترجمة النصية للمستوى 1 لدى Ofcom، السنة 4 / السنة 1 | 80% / 20% | مسودة مدونة الوصول من المستوى 1 لدى Ofcom، مايو 2026 |
| حصة الترجمة النصية لـ BBC عند الطلب، السنة 4 | 90% | مسودة مدونة الوصول من المستوى 1 لدى Ofcom، مايو 2026 |
| حد المستوى 1 | أكثر من 500,000 مستخدم بريطاني شهريا في المتوسط | مسودة مدونة الوصول من المستوى 1 لدى Ofcom، مايو 2026 |
3. الدقة: خط 98% وفق NER ومن يتجاوزه
يتبادل التأخر والدقة المفاضلة فيما بينهما، لذلك لا معنى لأرقام التأخر إلا بجانب أرقام الدقة. والمعيار الشائع هو نموذج NER، الذي يقيم الترجمة النصية المباشرة بالصيغة (الكلمات ناقص أخطاء التحرير والتعرف) على الكلمات. 98% هي ‘مقبولة’، و98.5-98.99% ‘جيدة’، و99-99.49% ‘جيدة جدا’، وما فوق 99.5% ‘ممتازة’ (Romero-Fresco وMartinez، نموذج NER، 2015). وتبدو العتبة متسامحة حتى تترجمها إلى أرقام: عند 98%، تكون كلمتان من كل 100 كلمة خاطئتين أو ناقصتين أو أخطاء موزونة.
تجاوزت الهيئات الإذاعية البريطانية الحد في المتوسط: 98.38% عبر جولات Ofcom الأربع و98.55% في الأخيرة، مقاسة على 78,000 ترجمة نصية و546,000 كلمة (Moores، JoSTrans 33). لكن المتوسطات تخفي الذيل. ففي أكتوبر-نوفمبر 2014، بلغت 77% من البرامج البريطانية 98% أو أكثر، ارتفاعا من 74% في أبريل-مايو 2014، وكانت الأخبار أدق الأنواع بنسبة 98.75% (تقرير Ofcom الثالث، 2015). وكان أداء نشرات الأخبار الوطنية الأمريكية بالإنجليزية أفضل، بمتوسط 98.8% مع تقييم 14 من 20 عينة بأنها مقبولة أو أفضل، بينما هبطت نشرات الأخبار بالإسبانية إلى 97.04% (Fresno، 2024).
| المقياس | القيمة | المصدر |
|---|---|---|
| عتبتا NER المقبولة / الممتازة | 98% / أكثر من 99.5% | Romero-Fresco وMartinez، 2015 |
| دقة الترجمة النصية المباشرة في بريطانيا، متوسط الجولات الأربع | 98.38% | بيانات Ofcom عبر Moores، JoSTrans 33 |
| دقة الترجمة النصية المباشرة في بريطانيا، الجولة الأخيرة | 98.55% | بيانات Ofcom عبر Moores، JoSTrans 33 |
| البرامج البريطانية عند 98% أو أكثر، أكتوبر-نوفمبر 2014 (مقابل أبريل-مايو 2014) | 77% (74%) | تقرير Ofcom الثالث، 2015 |
| دقة نوع الأخبار في بريطانيا | 98.75% | تقرير Ofcom الثالث، 2015 |
| نشرات الأخبار الوطنية الأمريكية بالإنجليزية، متوسط NER | 98.8% (14 من 20 عينة مقبولة أو أفضل) | Fresno، Universal Access in the Information Society، 2024 |
| نشرات الأخبار الأمريكية بالإسبانية، متوسط NER | 97.04% (Telemundo 97.00%، Univision 97.10%) | Fresno، JoSTrans 42، 2024 |
| تقليص النص: نشرات الأخبار بالإسبانية مقابل الإنجليزية | 26% مقابل 5-6% | Fresno، JoSTrans 42، 2024 |
ملاحظة سياقية: السرعة هي المتغير الثالث الخفي. توصي Ofcom بأن يقل متوسط الترجمات النصية عن 180 كلمة في الدقيقة، ومع ذلك فإن كل البرامج تقريبا التي حللتها تضمنت دفعات قصيرة تتجاوز 200 كلمة في الدقيقة، وعند احتساب تلك الدفعات أخطاء، هبطت 68% من البرامج دون 98% (تقرير Ofcom الثالث، 2015). ووجدت دراسة نشرات الأخبار الأمريكية بالإنجليزية أن ما يقرب من ثلثي الأخطاء كانت طفيفة.
4. ما يكلفه التأخر المشاهدين
جمهور الترجمة النصية المباشرة أكبر بكثير من مجتمع الصم وحده. فقد قدرت Ofcom أن نحو 7.6 مليون بالغ في بريطانيا استخدموا الترجمة النصية، منهم 1.4 مليون فقط يعانون ضعفا في السمع (بيان Ofcom الصحفي عبر Wired-Gov، مايو 2013). وهذا يعني أن أكثر من 6 ملايين مستخدم للترجمة النصية لا يعانون ضعفا في السمع (7.6 مليون ناقص 1.4 مليون)، يشاهد كثير منهم في غرف صاخبة أو بصوت منخفض. وتستشهد إرشادات Ofcom أيضا ببيانات YouGov التي تفيد بأن 61% ممن تتراوح أعمارهم بين 18 و24 عاما يفضلون تشغيل الترجمة النصية. وعلى المستوى العالمي، تقدر منظمة الصحة العالمية أن 430 مليون شخص يحتاجون إلى إعادة تأهيل بسبب فقدان سمع مسبب للإعاقة اليوم، وسيرتفع العدد إلى أكثر من 700 مليون بحلول 2050.
| المقياس | القيمة | المصدر |
|---|---|---|
| البالغون في بريطانيا الذين استخدموا الترجمة النصية | نحو 7.6 مليون (المدى 7.0-8.1 مليون) | Ofcom، مايو 2013 |
| منهم من يعانون ضعفا في السمع | نحو 1.4 مليون (المدى 1.2-1.6 مليون) | Ofcom، مايو 2013 |
| من تتراوح أعمارهم بين 18 و24 عاما في بريطانيا ويفضلون تشغيل الترجمة النصية | 61% | YouGov، مذكور في إرشادات Ofcom لخدمات الوصول |
| حصة ساعات البرامج لدى هيئات البث العام في بريطانيا ومنصات الطلب الأكبر المترجمة نصيا، 2024 | 88% | تقرير Ofcom لخدمات الوصول، يناير-ديسمبر 2024 (نشر في 19 مايو 2025) |
| ساعات الترجمة النصية على القنوات المطلوبة في بريطانيا، 2005 مقابل 2013 | 40.5% مقابل 81.9% | تقرير Ofcom الأول عن الترجمة النصية المباشرة، 2014 |
| من يحتاجون إلى إعادة تأهيل بسبب فقدان سمع مسبب للإعاقة | 430 مليون | صحيفة وقائع منظمة الصحة العالمية، محدثة في مارس 2026 |
| من يتوقع أن يعانوا درجة ما من فقدان السمع بحلول 2050 | قرابة 2.5 مليار | صحيفة وقائع منظمة الصحة العالمية، محدثة في مارس 2026 |
التأخر هو أول ما يلاحظه المشاهدون. فقد طلبت أكبر دراسة حديثة للمستخدمين من 216 مشاهدا من الصم وضعاف السمع تقييم 70 مقطعا تلفزيونيا مباشرا في أربع حالات، ما أنتج 4,832 تقييما. نالت ترجمات التلفزيون نفسها 3.66 من 7 بتأخرها الأصلي في البث و5.09 عند مزامنتها، وهو تفاوت أوسع بكثير من الفجوة بين التلفزيون المتزامن وترجمات ASR (Thompson وآخرون، Are Caption Metrics Broken?، arXiv 2609.11408، سبتمبر 2026). وصمدت ترجمات ASR ذات التأخر البالغ ثانيتين بشكل أفضل بكثير، عند 4.81 مقابل 5.20 عند المزامنة.
وتقوض الدراسة نفسها فكرة أن درجات الدقة تعبر عن الجودة. فلم تبلغ عتبة 98 وفق NER سوى 11 من 70 مقطعا تلفزيونيا و4 من 70 مقطعا من ASR، ومع ذلك قيم المشاهدون ترجمات ASR والتلفزيون المتزامنة بالقدر نفسه تقريبا، وانخفض الارتباط بين المقاييس والتقييمات انخفاضا حادا بالنسبة لمخرجات ASR (WER r = -0.390 مقابل -0.687 لترجمات التلفزيون). وخلصت دراسة CHI 2024 السابقة من Gallaudet إلى استنتاج مماثل: فقد كره المشاركون بشدة تأخر البث، ولم ترتبط مقاييس الدقة القياسية إلا ارتباطا ضعيفا بكيفية تقييم المشاهدين للتعليق.
| المقياس | القيمة | المصدر |
|---|---|---|
| المشاركون / التقييمات / المقاطع | 216 / 4,832 / 70 | Thompson وآخرون، arXiv 2609.11408، 2026 |
| تقييم ترجمات التلفزيون: التأخر الأصلي مقابل المتزامنة (مقياس من 7 نقاط) | 3.66 مقابل 5.09 | Thompson وآخرون، 2026 |
| تقييم ترجمات ASR: تأخر ثانيتين مقابل المتزامنة | 4.81 مقابل 5.20 | Thompson وآخرون، 2026 |
| متوسط WER: ترجمات التلفزيون مقابل ترجمات ASR | 33.8% مقابل 17.2% | Thompson وآخرون، 2026 |
| متوسط NER: ترجمات التلفزيون مقابل ترجمات ASR | 95.28 مقابل 94.34 | Thompson وآخرون، 2026 |
| المقاطع المستوفية لـ NER 98: التلفزيون مقابل ASR | 11 من 70 مقابل 4 من 70 | Thompson وآخرون، 2026 |
| ارتباط WER بتقييمات المشاهدين: التلفزيون مقابل ASR | r = -0.687 مقابل -0.390 | Thompson وآخرون، 2026 |
ملاحظة سياقية: يعكس ارتفاع WER في ترجمات التلفزيون جزئيا أن التعليق المذاع يعيد الصياغة ويختصر، وهو ما يعاقب عليه WER ولا يعاقب عليه NER. وهذه الفجوة هي بالضبط ما يدفع المؤلفين إلى القول بأن المقاييس الحالية ليست محايدة تقنيا.
5. سرعة محركات ASR: زمن التأخر في البث المتدفق مقابل المحادثة البشرية
لم يعد تأخر المحرك المصدر الرئيسي لتأخر الترجمة النصية. أعلنت AssemblyAI عن وسيط تأخر في البث المتدفق قدره 307 ms لـ Universal-Streaming مقابل 516 ms لـ Deepgram Nova-3، وعن P99 قدره 1,012 ms مقابل 1,907 ms، مقاسا من نهاية الكلمة في الصوت إلى أول ظهور لها في نص جزئي عبر أكثر من 205 ساعات من الصوت (AssemblyAI، Introducing Universal-Streaming، 2 يونيو 2025). ووضعت بيانات إطلاق Deepgram نفسها وسيط معدل خطأ الكلمات في البث المتدفق لـ Nova-3 عند 6.84%، مقابل 14.92% للمنافسين الذين اختبرتهم (Deepgram، Introducing Nova-3، فبراير 2025). وكلاهما اختبار من الموردين ويجب قراءته بوصفه أفضل سيناريو. وتغطي إحصائيات تحويل الكلام إلى نص لدينا الدقة عبر مزيد من المحركات.
وتقايض النماذج المفتوحة مزيدا من التأخر مقابل الاستقرار. فقد بلغ نظام Whisper-Streaming الأكاديمي متوسط تأخر قدره 3.3 ثانية على الكلام الإنجليزي الطويل من مجموعة اختبار ESIC للبرلمان الأوروبي، والمقايضة صريحة في نتائجه: معدل WER بالإنجليزية 8.5% عند تأخر 3.27 ثانية بقطع مدتها 0.5 ثانية مقابل 8.0% عند 5.45 ثانية بقطع مدتها 2 ثانية (Machacek وDabre وBojar، arXiv 2307.14743، IJCNLP-AACL 2023). وانتبه إلى أن إعداد Whisper بتأخر 5 ثوان يقع تماما فوق متوسط البث البريطاني قبل عقد من الزمن.
| المقياس | القيمة | المصدر |
|---|---|---|
| وسيط / P99 تأخر AssemblyAI Universal-Streaming | 307 ms / 1,012 ms | AssemblyAI، يونيو 2025 |
| وسيط / P99 تأخر Deepgram Nova-3 (اختبار AssemblyAI) | 516 ms / 1,907 ms | AssemblyAI، يونيو 2025 |
| وسيط WER لـ Deepgram Nova-3: متدفق / دفعي | 6.84% / 5.26% | Deepgram، فبراير 2025 |
| مجموعة اختبار Deepgram Nova-3 | 2,703 ملفا، 81.69 ساعة، 9 مجالات | Deepgram، فبراير 2025 |
| متوسط تأخر Whisper-Streaming، بالإنجليزية | 3.3 ثانية | Machacek وآخرون، 2023 |
| Whisper-Streaming بالإنجليزية: قطعة 0.5 ثانية مقابل قطعة 2.0 ثانية | WER 8.5% عند 3.27 ثانية مقابل WER 8.0% عند 5.45 ثانية | Machacek وآخرون، 2023 |
| تأخر Whisper-Streaming، بالألمانية / التشيكية (قطعة 0.5 ثانية) | 4.11 ثانية / 4.69 ثانية | Machacek وآخرون، 2023 |
وسقف الزمن الفوري تحدده المحادثة البشرية. فعبر 10 لغات، بلغ متوسط الفجوة بين السؤال وجوابه +208 ms، بمدى من +7 ms في اليابانية إلى +469 ms في الدنماركية (Stivers وآخرون، PNAS 2009). وزعم إطلاق GPT-4o من OpenAI ردودا صوتية في أقل من 232 ms وبمتوسط 320 ms، مقابل 2.8 ثانية (GPT-3.5) و5.4 ثانية (GPT-4) للوضع الصوتي المتسلسل السابق، الذي كان يربط نماذج منفصلة للنسخ واللغة والكلام. والدرس للترجمة النصية المباشرة هو نفسه: كل مرحلة إضافية في السلسلة تضيف ثواني، والمرحلة التي كانت تهيمن، أي التعرف نفسه، صارت الأصغر.
| المقياس | القيمة | المصدر |
|---|---|---|
| متوسط الفجوة بين السؤال والجواب، 10 لغات | +208 ms | Stivers وآخرون، PNAS 2009 (أحدث بيانات متاحة) |
| متوسط أسرع / أبطأ لغة | +7 ms (اليابانية) / +469 ms (الدنماركية) | Stivers وآخرون، PNAS 2009 |
| الرد الصوتي لـ GPT-4o: الأدنى / المتوسط | 232 ms / 320 ms | OpenAI، مايو 2024 |
| متوسط تأخر الوضع الصوتي المتسلسل: GPT-3.5 / GPT-4 | 2.8 ثانية / 5.4 ثانية | OpenAI، مايو 2024 |
| تأخر تعليق ASR المستخدم في دراسة المشاهدين لعام 2026 | ثانيتان في المتوسط | Thompson وآخرون، arXiv 2609.11408 |
6. الأتمتة تستحوذ على سلسلة التعليق
القوى العاملة البشرية وراء الترجمة النصية المباشرة تحددها حدود السرعة. فمعيار الوقت الفعلي الأمريكي، مراسل الوقت الفعلي المعتمد من NCRA، يشترط اختبارا فوريا مدته خمس دقائق بمعدل 200 كلمة في الدقيقة وبدقة 96%، ويصف تقرير EBU الترجمة النصية المباشرة بأنها مواكبة للمتحدثين حتى 200 كلمة في الدقيقة. وأخبر المتحدثون المعيدون (respeakers) في بريطانيا الباحثين أن التدريب الأساسي يستغرق 2-3 أشهر، بينما يستغرق اكتساب الثقة من سنة ونصف إلى سنتين (Moores، JoSTrans 33). وهذه القيود هي سبب انتشار التعليق التلقائي بهذه السرعة متى اقتربت الدقة.
ويظهر التحول في الحجم في إفصاحات الشركات. بلغت دقائق التعليق التلقائي LEXI لدى Ai-Media ما قدره 79.2 مليون دقيقة في السنة المالية 2025، ارتفاعا من أقل من 10 ملايين قبل أربع سنوات، بمعدل نمو سنوي مركب قدره 69% على أربع سنوات، وتستأثر LEXI الآن بمعظم الاستخدام عبر شبكة iCap لديها (نتائج Ai-Media للسنة المالية 2025، إعلان ASX، 28 أغسطس 2025). وشكلت المنتجات التقنية 63% من إيرادات Ai-Media، بعد أن كانت صفرا قبل خمس سنوات. ووجد اختبار مستقل للنظام نفسه دقة NER بلغت 98.56% بالإنجليزية و98.26% بالإسبانية، بما يضاهي التعليق البشري إلا في المحتوى العامي ذي المتحدثين المتعددين (Romero-Fresco وVan Gauwbergen، Fit for What Purpose?، 2025). وللمزيد عن الجانب البشري من المهنة، راجع إحصائيات دقة النسخ في قاعات المحاكم لدينا.
| المقياس | القيمة | المصدر |
|---|---|---|
| معيار الوقت الفعلي لـ NCRA CRR | 200 كلمة في الدقيقة بدقة 96% (اختبار 5 دقائق) | NCRA |
| التدريب الأساسي للمتحدث المعيد / الوقت اللازم لاكتساب الثقة | 2-3 أشهر / من سنة ونصف إلى سنتين | Moores، JoSTrans 33 |
| دقائق التعليق التلقائي LEXI لدى Ai-Media، السنة المالية 2025 | 79.2 مليون | نتائج Ai-Media للسنة المالية 2025، ASX |
| دقائق LEXI قبل أربع سنوات | أقل من 10 ملايين (معدل نمو سنوي مركب 69% على أربع سنوات) | نتائج Ai-Media للسنة المالية 2025، ASX |
| حصة التقنية من إيرادات Ai-Media | 63% (إجمالي الإيرادات 64.9 مليون دولار) | نتائج Ai-Media للسنة المالية 2025، ASX |
| دقة NER للتعليق التلقائي: الإنجليزية / الإسبانية | 98.56% / 98.26% | Romero-Fresco وVan Gauwbergen، 2025 |
| التعليقات المباشرة المحللة في مقارنة المخرجات التلقائية والبشرية، بريطانيا/أمريكا/كندا 2018-2022 | نحو 17,000 | Romero-Fresco وFresno، Linguistica Antverpiensia 22، 2023 |
ملاحظة سياقية: وجدت أكبر مقارنة حتى الآن بين الإنسان والآلة (Romero-Fresco وFresno، Linguistica Antverpiensia، 2023) أن التعليق التلقائي غير المحرر اقترب من 98%، مع نقاط ضعف مستمرة في علامات الترقيم وأسماء العلم والأرقام وتحديد المتحدث. ولا يعالج انخفاض تأخر المحرك هذه المشكلات: فالاسم الخاطئ السريع يبقى اسما خاطئا.
الخلاصة: زمن التأخر في الترجمة النصية المباشرة بالأرقام
| المقياس | القيمة | المصدر |
|---|---|---|
| متوسط تأخر الترجمة النصية المباشرة في بريطانيا، أواخر 2014 | 5.1 ثانية | تقرير Ofcom الثالث، 2015 |
| العينات البريطانية المستوفية لإرشاد 3 ثوان، الجولة الثانية | 4 من 72 | تقرير Ofcom الثاني، 2014 |
| أطول تأخر مسجل في بريطانيا | 21 ثانية | تقرير Ofcom الثاني، 2014 |
| إرشاد Ofcom الحالي للتأخر | متوسط 4.5 ثانية أو أقل | إرشادات Ofcom لخدمات الوصول |
| الحد الرقمي لتأخر FCC | لا يوجد | FCC 14-12، 2014 |
| دقة التعليق المباشر بالإنجليزية لدى CRTC | NER 98 | CRTC 2019-308 |
| تأخر التعليق في نشرات الأخبار الأمريكية بالإسبانية | متوسط 8.2 ثانية | Fresno، JoSTrans 42، 2024 |
| تعليقات نشرات الأخبار الأمريكية بالإسبانية المتأخرة أكثر من 10 ثوان | 20% | Fresno، JoSTrans 42، 2024 |
| متوسط التأخر في المقاطع التلفزيونية الأمريكية المباشرة | 8.46 ثانية | Thompson وآخرون، arXiv 2609.11408، 2026 |
| تقييم تعليق التلفزيون: المتأخر مقابل المتزامن | 3.66 مقابل 5.09 من 7 | Thompson وآخرون، 2026 |
| دقة الترجمة النصية المباشرة في بريطانيا، متوسط الجولات الأربع | 98.38% | بيانات Ofcom عبر Moores، JoSTrans 33 |
| دقة نشرات الأخبار الوطنية الأمريكية بالإنجليزية | 98.8% | Fresno، 2024 |
| دقة التعليق التلقائي، بالإنجليزية | 98.56% | Romero-Fresco وVan Gauwbergen، 2025 |
| البالغون في بريطانيا الذين استخدموا الترجمة النصية | نحو 7.6 مليون | Ofcom، 2013 |
| ساعات هيئات البث العام في بريطانيا ومنصات الطلب الأكبر المترجمة نصيا، 2024 | 88% | تقرير Ofcom لخدمات الوصول 2024 |
| وسيط تأخر البث المتدفق لدى AssemblyAI | 307 ms | AssemblyAI، يونيو 2025 |
| متوسط تأخر Whisper-Streaming | 3.3 ثانية | Machacek وآخرون، 2023 |
| متوسط فجوة تبادل الأدوار في الحديث البشري | 208 ms | Stivers وآخرون، PNAS 2009 |
| دقائق تعليق LEXI لدى Ai-Media، السنة المالية 2025 | 79.2 مليون | نتائج Ai-Media للسنة المالية 2025 |
| تعليق كتالوج منصات البث الكندية بحلول مايو 2031 | 100% | CRTC 2026-98 |
المنهجية والمصادر
تم تتبع كل رقم أعلاه إلى الجهة التنظيمية أو الإفصاح أو الورقة المحكمة التي أنتجته. ولم يمكن استرجاع عدة ملفات PDF لدى Ofcom مباشرة، لذلك أخذت الأرقام البريطانية من بيانات Ofcom الصحفية (المعاد نشرها على Wired-Gov)، وملخصات الجهات التنظيمية (EPRA)، والتحليل المحكم لمجموعة بيانات Ofcom (Moores)، وقد سمي كل منها ضمن النص. وتوسم اختبارات الموردين بأنها بيانات موردين. وللاطلاع على بيانات سوق التعليق والترجمة النصية واستخدامهما عموما، راجع إحصائيات التعليق والترجمة النصية لدينا.
- Ofcom: البيان الصحفي لتقرير الترجمة النصية المباشرة الثالث (Wired-Gov، مايو 2015)، البيان الصحفي لمشاورة الترجمة النصية المباشرة (Wired-Gov، مايو 2013)، إرشادات تقديم خدمات الوصول التلفزيونية وعند الطلب، تقرير خدمات الوصول يناير-ديسمبر 2024، مشاورة مدونة الوصول من المستوى 1 (مايو 2026)
- EPRA: ملخص تقرير Ofcom الأول عن الترجمة النصية المباشرة (أبريل 2014)
- Limping Chicken: تقرير عن تقرير Ofcom الثاني عن الترجمة النصية المباشرة (نوفمبر 2014)
- Liam O’Dell: تقرير عن مشاورة Ofcom لمدونة الوصول لعام 2023 ومشاورة مدونة المستوى 1
- FCC: معايير جودة التعليق، FCC 14-12 (2014) و47 CFR 79.1
- CRTC: سياسة البث التنظيمية 2019-308 وسياسة البث التنظيمية 2026-98
- ACMA / الحكومة الأسترالية: معيار خدمات البث (التعليق التلفزيوني) لعام 2023
- EBU: تقرير عن خدمات الوصول والترجمة النصية المباشرة (i044) وTech 3370، EBU-TT الجزء 3 الترجمة النصية المباشرة
- Thompson وKushalnagar وVogler وآخرون: Are Caption Metrics Broken?، arXiv 2609.11408 (سبتمبر 2026)؛ Glasser وKushalnagar وVogler: How Users Experience Closed Captions on Live Television، CHI 2024
- Fresno: Closed Captions en espanol، JoSTrans 42 (2024) ودقة التعليق المباشر في نشرات الأخبار بالإنجليزية في الولايات المتحدة (2024)
- Moores: الترجمة النصية المباشرة في الفعاليات المباشرة، JoSTrans 33 (يتضمن تحليلا لمجموعة بيانات Ofcom)
- Romero-Fresco وFresno: دقة التعليق المباشر الآلي والبشري بالإنجليزية (2023)؛ Romero-Fresco وVan Gauwbergen: Fit for What Purpose? (2025)؛ Romero-Fresco وMartinez: نموذج NER (2015)
- Machacek وDabre وBojar: Turning Whisper into Real-Time Transcription System (2023)
- AssemblyAI: Introducing Universal-Streaming (يونيو 2025)؛ Deepgram: Introducing Nova-3 (فبراير 2025)
- OpenAI: Hello GPT-4o (مايو 2024)
- Stivers وآخرون: Universals and cultural variation in turn-taking in conversation، PNAS (2009)
- Ai-Media: نتائج السنة المالية 2025، إعلان ASX (أغسطس 2025)
- NCRA: مراسل الوقت الفعلي المعتمد
- منظمة الصحة العالمية: صحيفة وقائع الصمم وفقدان السمع (محدثة في مارس 2026)
- ملاحظة حول البيانات: قياسات Ofcom لتأخر كل هيئة إذاعية (2013-2015) أقدم من ثلاث سنوات وتبقى أحدث مجموعة بيانات عامة من نوعها؛ وتجمع الجولات بين الوسيط والمتوسط (5.6 و5.8 و5.7 إلى 5.1، ومتوسط الجولات الأربع البالغ 5.3 عبر Moores)، لذا ينبغي التعامل معها بوصفها مدى لا خط اتجاه. وتقدير Ofcom لمستخدمي الترجمة النصية (7.6 مليون) يعود إلى 2013، وبيانات تبادل الأدوار لدى Stivers إلى 2009. وأرقام AssemblyAI وDeepgram اختبارات موردين؛ فقد قاست مقارنة AssemblyAI منافسا على مجموعة اختبارها الخاصة، وتفيد اختبارات مستقلة لـ Nova-3 بمعدل WER أعلى من رقم Deepgram. وورقة Thompson وآخرين لعام 2026 نسخة أولية على arXiv ولم تخضع بعد للتحكيم. ورقم إيرادات Ai-Media معروض كما ورد في إعلانها لدى ASX. ويفيد تقييمان مستقلان للنظام التلقائي نفسه بدقة رئيسية مختلفة بحسب صعوبة المحتوى، ووجدت دراسة المشاهدين لعام 2026 معدلات نجاح أقل بكثير وفق NER في المقاطع التلفزيونية المباشرة، لذلك تعتمد الدقة التلقائية اعتمادا كبيرا على نوع المحتوى. ومدونة Ofcom للمستوى 1 مسودة أغلقت للمشاورة في 7 أغسطس 2026، ومن المتوقع صدور بيان نهائي.
آخر تحديث: 3 أكتوبر 2026. نحدث هذا الاستعراض كل ثلاثة أشهر، ومن المتوقع أن يأتي التحديث التالي عندما تنشر Ofcom بيانها النهائي لمدونة الوصول من المستوى 1 وتقرير خدمات الوصول عن الفترة من يناير إلى ديسمبر 2025.