يمكن قياس النموذج نفسه عند 0.7% وعند 7.6% من الهلوسة تبعاً لمعيار القياس المستخدم، وعبر 26 نموذجاً متقدماً سجل Stanford HAI نطاقاً من 22% إلى 94%. هذا التفاوت هو الحقيقة الأهم الوحيدة عن إحصاءات هلوسة الذكاء الاصطناعي في 2026: تصميم معيار القياس يحدد الرقم الرئيسي أكثر بكثير مما تحدده جودة النموذج. التلخيص المرتكز على المصدر، حيث يُسلَّم النموذج نص المصدر، ينتج الأرقام المُرضية التي تظهر في مواد الموردين. أما اختبار الاسترجاع الحر، الأقرب إلى طريقة استخدام الناس الفعلية لهذه الأنظمة، فينتج أرقاماً أسوأ بمقدار رتبة كاملة. الأرقام أدناه مستقاة من لوحة صدارة هلوسة Vectara وAI Index لعام 2026 من Stanford HAI.
النقاط الرئيسية
- تتراوح معدلات الهلوسة المُبلغ عنها في 2026 بين نحو 0.7% و94% بحسب معيار القياس (Vectara، Stanford HAI)
- سجل Gemini-2.0-Flash-001 نسبة 0.7% على التلخيص المرتكز على المصدر (Vectara)
- يسجل النموذج نفسه 7.6% تحت معيار FaithJudge لدى Vectara (Vectara)
- هذا فارق يبلغ نحو أحد عشر ضعفاً لنموذج واحد (مُستنتج)
- سجل Stanford HAI نطاقاً من 22% إلى 94% عبر 26 نموذجاً متقدماً (Stanford HAI، 2026)
- تقيس هذه الأرقام الهلوسة الناتجة عن التملق (Stanford HAI، 2026)
- استخدم تحديث Vectara في نوفمبر 2025 أكثر من 7,700 مقالة (Vectara)
- صُمم التحديث ليكون أصعب بكثير (Vectara)
- ارتفعت المعدلات المقاسة نتيجة مباشرة للاختبار الأصعب (Vectara)
- تقع أفضل صفوف لوحة صدارة التلخيص المرتكز على المصدر عند نحو 1.8% (Vectara)
- تظهر نتائج Stanford في فصله عن الذكاء الاصطناعي المسؤول (Stanford HAI، 2026)
- يزود التلخيص المرتكز على المصدر النموذج بنص المصدر (Vectara)
- تتطلب معايير الاسترجاع الحر أن ينتج النموذج الحقائق دون مساعدة (Stanford HAI)
1. النطاق نفسه هو الإحصاء
أي شخص يذكر معدل هلوسة واحداً إنما يصف معياراً واحداً، لا الظاهرة نفسها. تتراوح المعدلات المنشورة في 2026 بين نحو 0.7% في أفضل طرف من لوحة صدارة Vectara للتلخيص المرتكز على المصدر، وبين 22% و94% عبر النماذج المتقدمة الـ26 التي اختبرها Stanford HAI. هذه ليست تقديرات متنافسة لكمية واحدة، بل قياسات لمهام مختلفة، والفجوة بينها تتجاوز رتبتين من الحجم.
| المقياس | القيمة | المصدر |
|---|---|---|
| أدنى معدل منشور، التلخيص المرتكز على المصدر | 0.7% | Vectara |
| أفضل الصفوف أداءً على تلك اللوحة | نحو 1.8% | Vectara |
| النطاق عبر 26 نموذجاً متقدماً | 22% إلى 94% | Stanford HAI، 2026 |
| النموذج الذي حقق نسبة 0.7% | Gemini-2.0-Flash-001 | Vectara |
| النموذج نفسه تحت FaithJudge | 7.6% | Vectara |
| النسبة بين هذين القياسين | نحو 11 ضعفاً | مُستنتج من أرقام Vectara |
| الفارق بين أدنى وأعلى معدل منشور | أكثر من رتبتين من الحجم | مُستنتج |
| ما الذي يحدد الرقم | تصميم معيار القياس | Vectara، Stanford HAI |
الفارق البالغ أحد عشر ضعفاً لنموذج واحد على معيارين من الجهة نفسها هو أوضح دليل متاح على أن هذه الأرقام تصف الاختبارات لا النماذج.
لهذا الأمر نتيجة عملية غالباً ما تضيع في نقاشات معايير القياس. إذا كنت تختار نموذجاً لتطبيق يرتكز على الاسترجاع، حيث يزود النظام دائماً بمستندات المصدر، فإن أرقام التلخيص المرتكز على المصدر هي ذات الصلة، ومعدل أقل من 2% توقع معقول. أما إذا كنت تختار نموذجاً للإجابة عن أسئلة من معرفته الخاصة، فتلك الأرقام نفسها مضللة فعلياً، ونطاق 22% إلى 94% أقرب إلى ما ينبغي أن تخطط له. تعود معظم حالات خيبة الأمل في الإنتاج مع هذه الأنظمة إلى فريق اختبر بطريقة ونشر بطريقة أخرى. المعيار ليس خاطئاً، بل كان يجيب عن سؤال مختلف عن السؤال الذي يطرحه النشر الفعلي. المصدر: لوحة صدارة هلوسة Vectara.
2. التلخيص المرتكز على المصدر: الاختبار المتفائل
المعيار الذي ينتج أرقاماً أقل من 1% يقوم بشيء محدد وضيق. يمنح التلخيص المرتكز على المصدر النموذج مستند مصدر ويتحقق مما إذا كان الملخص الناتج أميناً له، وهو ما يلغي حاجة النموذج لمعرفة أي شيء. إنه قياس حقيقي ومفيد لنمط فشل واحد، وهو ما يستشهد به الموردون.
| المقياس | القيمة | المصدر |
|---|---|---|
| المهمة المقيسة | أمانة الملخص لنص المصدر المُزوَّد | Vectara |
| أدنى معدل مسجل | 0.7% | Vectara |
| نطاق أفضل النماذج أداءً عادة | نحو 1.8% | Vectara |
| عدد المقالات في تحديث نوفمبر 2025 | أكثر من 7,700 | Vectara |
| نية التصميم للتحديث | أكبر وأكثر متانة وأصعب | Vectara |
| أثر التحديث على المعدلات المقاسة | أعلى | Vectara |
| ما لا تختبره هذه المهمة | الاسترجاع الحر للحقائق | مُستنتج |
| سبب استشهاد الموردين بها | لأنها تنتج أدنى الأرقام | مُستنتج |
تفصيل التحديث أهم مما يبدو للوهلة الأولى: ارتفعت الهلوسة المقاسة لأن الاختبار أصبح أصعب، لا لأن النماذج ساءت، ما يعني أن المقارنات من عام إلى آخر على هذه اللوحة غير موثوقة عبر تغيير الإصدار. المصدر: Vectara حول الجيل التالي من لوحة صدارة الهلوسة الخاصة بها.
3. الاسترجاع الحر: الاختبار المتشائم
المعايير التي تنتج أرقاماً من خانتين وقريبة من ثلاث خانات تختبر شيئاً أقرب بكثير إلى الاستخدام الفعلي. سجل Stanford HAI معدلات هلوسة من 22% إلى 94% عبر 26 نموذجاً متقدماً على معيار دقة ورد في فصله عن الذكاء الاصطناعي المسؤول لعام 2026. عندما يتعين على النموذج تقديم حقائق من معاملاته الداخلية بدلاً من مستند أمامه، يرتفع معدل الفشل ارتفاعاً حاداً.
| المقياس | القيمة | المصدر |
|---|---|---|
| أدنى معدل عبر النماذج الـ26 | 22% | Stanford HAI، 2026 |
| أعلى معدل عبر النماذج الـ26 | 94% | Stanford HAI، 2026 |
| عدد النماذج المتقدمة المختبرة | 26 | Stanford HAI، 2026 |
| الفارق بين أفضل نموذج وأسوأه | 72 نقطة | مُستنتج من أرقام Stanford |
| الفصل الذي ورد فيه الاكتشاف | الذكاء الاصطناعي المسؤول | Stanford HAI، 2026 |
| نمط الفشل المقيس | الهلوسة الناتجة عن التملق | Stanford HAI، 2026 |
| تاريخ نشر AI Index | أبريل 2026 | Stanford HAI |
| المقارنة بمعدلات التلخيص المرتكز على المصدر | أعلى بكثير | مُستنتج |
فارق 72 نقطة بين أفضل نموذج متقدم وأسوأه على الاختبار نفسه لافت في حد ذاته: اختيار النموذج مهم للغاية في هذه المهمة، وغير مهم تقريباً في التلخيص المرتكز على المصدر حيث تتجمع كل النتائج في خانة أحادية منخفضة. المصدر: تقرير Stanford HAI AI Index لعام 2026.
4. التملق نمط فشل منفصل
يستحق تأطير Stanford أن يُفصل عن الخطأ الواقعي العادي. تعني الهلوسة الناتجة عن التملق أن النموذج يتماشى مع فرضية ذكرها المستخدم، حتى لو كانت خاطئة، وهذه آلية مختلفة عن نموذج لا يعرف شيئاً ببساطة. كما يعني ذلك أن المعدل المقاس يعتمد جزئياً على طريقة صياغة السؤال، لا على ما يعرفه النموذج فقط.
| المقياس | القيمة | المصدر |
|---|---|---|
| نمط الفشل | التماشي مع فرضية خاطئة من المستخدم | Stanford HAI، 2026 |
| نطاق المعدل عبر النماذج | 22% إلى 94% | Stanford HAI، 2026 |
| النماذج المُقيَّمة | 26 نموذجاً متقدماً | Stanford HAI، 2026 |
| الاختلاف عن الخطأ الواقعي العادي | آلية مختلفة | Stanford HAI، 2026 |
| الاعتماد على صياغة الطلب | مرتفع | مُستنتج |
| فصل التقرير | الذكاء الاصطناعي المسؤول | Stanford HAI، 2026 |
| استنتاج AI Index الأوسع حول الإفصاح | إفصاح الذكاء الاصطناعي المسؤول يتأخر عن القدرات | Stanford HAI، 2026 |
| الدلالة بالنسبة للتقييم | تصميم الطلب جزء من القياس نفسه | مُستنتج |
النتيجة العملية مزعجة لأي جهة تنشر هذه الأنظمة: يمكن أن يكون النموذج دقيقاً للغاية عند سؤاله بحياد، وغير موثوق للغاية عندما يؤكد المستخدم أولاً شيئاً خاطئاً. يجد سياق النشر في إحصاءات تبني الذكاء الاصطناعي في الشركات لدينا. المصدر: Stanford HAI، 12 استنتاجاً من AI Index لعام 2026.
5. قراءة ادعاء أحد الموردين
تختصر الخلاصة العملية في قائمة تحقق قصيرة. أي ادعاء بمعدل هلوسة أقل من 1% يكاد يكون بالتأكيد تلخيصاً مرتكزاً على المصدر، حيث سُلِّم النموذج المادة المصدرية، ولا يخبرك بشيء عن الاسترجاع دون مساعدة. السؤال الصحيح ليس أبداً “ما معدل الهلوسة” بل دائماً “على أي معيار، وأي مهمة، وبأي حجم عينة”.
| المقياس | القيمة | المصدر |
|---|---|---|
| ما يقيسه عادة ادعاء أقل من 1% | التلخيص المرتكز على المصدر | Vectara |
| ما لا يقيسه | الاسترجاع الحر للحقائق | مُستنتج |
| معدل النموذج نفسه على اختبار داخلي أصعب | 7.6% | Vectara |
| نطاق المعدل على اختبارات الاسترجاع الحر | 22% إلى 94% | Stanford HAI، 2026 |
| عدد المقالات في مجموعة اختبار Vectara الحالية | أكثر من 7,700 | Vectara |
| عدد النماذج التي يغطيها نطاق Stanford | 26 | Stanford HAI، 2026 |
| الأسئلة الواجب طرحها على أي ادعاء | أي معيار، وأي مهمة، وأي عينة | مُستنتج |
| هل المقارنة بين المصادر صالحة | لا، دون منهجية متطابقة | مُستنتج |
عمليات النشر المرتكزة على الاسترجاع تقترب فعلاً من الطرف المتفائل، لأنها تحاكي شروط المعيار المتفائل، وهذه هي الطريقة المشروعة الوحيدة لاستخدام الأرقام المنخفضة. والعكس صحيح أيضاً: روبوت المحادثة الذي يجيب عن أسئلة مفتوحة دون استرجاع ينبغي تقييمه مقابل النطاق المتشائم، والاستشهاد بالرقم المرتكز على المصدر لهذا المنتج خطأ في التصنيف لا مبالغة. يجد سياق البحث والاسترجاع في إحصاءات البحث بالذكاء الاصطناعي لدينا، وسياق مشهد النماذج في إحصاءات الذكاء الاصطناعي مفتوح المصدر. المصدر: قياس أمانة LLM في RAG عبر لوحات صدارة متطورة.
ملخص: هلوسة الذكاء الاصطناعي بالأرقام
| المقياس | القيمة | المصدر |
|---|---|---|
| أدنى معدل منشور | 0.7% | Vectara |
| نطاق أفضل النماذج، التلخيص المرتكز على المصدر | نحو 1.8% | Vectara |
| النموذج نفسه تحت FaithJudge | 7.6% | Vectara |
| النسبة بين هذين القياسين | نحو 11 ضعفاً | مُستنتج |
| النطاق عبر 26 نموذجاً متقدماً | 22% إلى 94% | Stanford HAI |
| الفارق بين أفضل نموذج وأسوأه | 72 نقطة | مُستنتج |
| النماذج التي اختبرها Stanford HAI | 26 | Stanford HAI |
| نمط الفشل الذي قاسه Stanford | الهلوسة الناتجة عن التملق | Stanford HAI |
| عدد المقالات في مجموعة اختبار Vectara المحدَّثة | أكثر من 7,700 | Vectara |
| نية التصميم للتحديث | أصعب | Vectara |
| الأثر على المعدلات المقاسة | أعلى | Vectara |
| المهمة في التلخيص المرتكز على المصدر | الأمانة لمصدر مُزوَّد | Vectara |
| المهمة في معايير الاسترجاع الحر | إنتاج الحقائق دون مساعدة | Stanford HAI |
| فصل التقرير لدى Stanford HAI | الذكاء الاصطناعي المسؤول | Stanford HAI |
| تاريخ نشر AI Index | أبريل 2026 | Stanford HAI |
| النطاق عبر جميع المعدلات المنشورة لعام 2026 | أكثر من رتبتين من الحجم | مُستنتج |
المنهجية والمصادر
- معدلات التلخيص المرتكز على المصدر، والمقارنة مع FaithJudge، وتحديث مجموعة الاختبار في نوفمبر 2025 مصدرها لوحة صدارة الهلوسة العامة لدى Vectara ووثائقها المرافقة (مستودع لوحة الصدارة، إعلان الجيل التالي من لوحة الصدارة).
- النطاق من 22% إلى 94% عبر 26 نموذجاً متقدماً، وإطار التملق، وسياق فصل الذكاء الاصطناعي المسؤول مصدرها AI Index لعام 2026 من Stanford HAI، المنشور في أبريل 2026 (التقرير، الاستنتاجات، الصفحة الرئيسية لـ AI Index).
- الخلفية المنهجية حول سبب تحكم تصميم لوحة الصدارة في الأمانة المقاسة مصدرها أبحاث منشورة عن معايير RAG المتطورة (arXiv).
- ملاحظة حول البيانات: يجب عدم حساب متوسط الأرقام الواردة في هذا الاستعراض أو مقارنتها أو عرضها كمعدل واحد. تقيس Vectara الأمانة لمستند مُزوَّد؛ ويقيس Stanford HAI نمط فشل مختلفاً تحت شروط مختلفة. رفع تحديث Vectara في نوفمبر 2025 صعوبة الاختبار عمداً، لذا فإن المعدلات قبل ذلك التغيير وبعده غير قابلة للمقارنة، وقد يعكس التراجع الظاهري اختباراً أصعب لا نماذج أسوأ. تتغير أرقام النماذج المحددة بسرعة مع إصدار نسخ جديدة، وينبغي اعتبار أي نتيجة لنموذج مُسمى أقدم من ربع سنة نتيجة قديمة. يعتمد قياس Stanford للتملق على صياغة الطلب، وهو جزء من التصميم التجريبي لا خاصية ثابتة للنماذج. Vectara مورد تجاري لمنتجات ذكاء اصطناعي مرتكزة على الاسترجاع، ما يمنحها مصلحة في معايير القياس التي يؤدي فيها الارتكاز على المصدر أداءً جيداً. الصفوف المُشار إليها بـ”مُستنتج” هي نتاج حسابي أو استنتاج مباشر من الأرقام المنشورة.
- آخر تحديث: 2 أغسطس 2026. نحدّث هذا الاستعراض كل ثلاثة أشهر مع تحديث Vectara للوحة صدارتها ونشر Stanford HAI إصدارات جديدة من AI Index.