إحصاءات هلوسة الذكاء الاصطناعي (2026): أكثر من 40 نقطة بيانات حول المعدلات ومعايير القياس وسبب تضاربها

إحصاءات هلوسة الذكاء الاصطناعي لعام 2026: معدلات لوحة صدارة Vectara، ونطاق Stanford HAI من 22% إلى 94%، وكيف يغير تصميم معيار القياس النتيجة، وقراءة ادعاءات الموردين.

يمكن قياس النموذج نفسه عند 0.7% وعند 7.6% من الهلوسة تبعاً لمعيار القياس المستخدم، وعبر 26 نموذجاً متقدماً سجل Stanford HAI نطاقاً من 22% إلى 94%. هذا التفاوت هو الحقيقة الأهم الوحيدة عن إحصاءات هلوسة الذكاء الاصطناعي في 2026: تصميم معيار القياس يحدد الرقم الرئيسي أكثر بكثير مما تحدده جودة النموذج. التلخيص المرتكز على المصدر، حيث يُسلَّم النموذج نص المصدر، ينتج الأرقام المُرضية التي تظهر في مواد الموردين. أما اختبار الاسترجاع الحر، الأقرب إلى طريقة استخدام الناس الفعلية لهذه الأنظمة، فينتج أرقاماً أسوأ بمقدار رتبة كاملة. الأرقام أدناه مستقاة من لوحة صدارة هلوسة Vectara وAI Index لعام 2026 من Stanford HAI.

النقاط الرئيسية

  • تتراوح معدلات الهلوسة المُبلغ عنها في 2026 بين نحو 0.7% و94% بحسب معيار القياس (Vectara، Stanford HAI)
  • سجل Gemini-2.0-Flash-001 نسبة 0.7% على التلخيص المرتكز على المصدر (Vectara)
  • يسجل النموذج نفسه 7.6% تحت معيار FaithJudge لدى Vectara (Vectara)
  • هذا فارق يبلغ نحو أحد عشر ضعفاً لنموذج واحد (مُستنتج)
  • سجل Stanford HAI نطاقاً من 22% إلى 94% عبر 26 نموذجاً متقدماً (Stanford HAI، 2026)
  • تقيس هذه الأرقام الهلوسة الناتجة عن التملق (Stanford HAI، 2026)
  • استخدم تحديث Vectara في نوفمبر 2025 أكثر من 7,700 مقالة (Vectara)
  • صُمم التحديث ليكون أصعب بكثير (Vectara)
  • ارتفعت المعدلات المقاسة نتيجة مباشرة للاختبار الأصعب (Vectara)
  • تقع أفضل صفوف لوحة صدارة التلخيص المرتكز على المصدر عند نحو 1.8% (Vectara)
  • تظهر نتائج Stanford في فصله عن الذكاء الاصطناعي المسؤول (Stanford HAI، 2026)
  • يزود التلخيص المرتكز على المصدر النموذج بنص المصدر (Vectara)
  • تتطلب معايير الاسترجاع الحر أن ينتج النموذج الحقائق دون مساعدة (Stanford HAI)

1. النطاق نفسه هو الإحصاء

أي شخص يذكر معدل هلوسة واحداً إنما يصف معياراً واحداً، لا الظاهرة نفسها. تتراوح المعدلات المنشورة في 2026 بين نحو 0.7% في أفضل طرف من لوحة صدارة Vectara للتلخيص المرتكز على المصدر، وبين 22% و94% عبر النماذج المتقدمة الـ26 التي اختبرها Stanford HAI. هذه ليست تقديرات متنافسة لكمية واحدة، بل قياسات لمهام مختلفة، والفجوة بينها تتجاوز رتبتين من الحجم.

المقياسالقيمةالمصدر
أدنى معدل منشور، التلخيص المرتكز على المصدر0.7%Vectara
أفضل الصفوف أداءً على تلك اللوحةنحو 1.8%Vectara
النطاق عبر 26 نموذجاً متقدماً22% إلى 94%Stanford HAI، 2026
النموذج الذي حقق نسبة 0.7%Gemini-2.0-Flash-001Vectara
النموذج نفسه تحت FaithJudge7.6%Vectara
النسبة بين هذين القياسيننحو 11 ضعفاًمُستنتج من أرقام Vectara
الفارق بين أدنى وأعلى معدل منشورأكثر من رتبتين من الحجممُستنتج
ما الذي يحدد الرقمتصميم معيار القياسVectara، Stanford HAI

الفارق البالغ أحد عشر ضعفاً لنموذج واحد على معيارين من الجهة نفسها هو أوضح دليل متاح على أن هذه الأرقام تصف الاختبارات لا النماذج.

لهذا الأمر نتيجة عملية غالباً ما تضيع في نقاشات معايير القياس. إذا كنت تختار نموذجاً لتطبيق يرتكز على الاسترجاع، حيث يزود النظام دائماً بمستندات المصدر، فإن أرقام التلخيص المرتكز على المصدر هي ذات الصلة، ومعدل أقل من 2% توقع معقول. أما إذا كنت تختار نموذجاً للإجابة عن أسئلة من معرفته الخاصة، فتلك الأرقام نفسها مضللة فعلياً، ونطاق 22% إلى 94% أقرب إلى ما ينبغي أن تخطط له. تعود معظم حالات خيبة الأمل في الإنتاج مع هذه الأنظمة إلى فريق اختبر بطريقة ونشر بطريقة أخرى. المعيار ليس خاطئاً، بل كان يجيب عن سؤال مختلف عن السؤال الذي يطرحه النشر الفعلي. المصدر: لوحة صدارة هلوسة Vectara.

2. التلخيص المرتكز على المصدر: الاختبار المتفائل

المعيار الذي ينتج أرقاماً أقل من 1% يقوم بشيء محدد وضيق. يمنح التلخيص المرتكز على المصدر النموذج مستند مصدر ويتحقق مما إذا كان الملخص الناتج أميناً له، وهو ما يلغي حاجة النموذج لمعرفة أي شيء. إنه قياس حقيقي ومفيد لنمط فشل واحد، وهو ما يستشهد به الموردون.

المقياسالقيمةالمصدر
المهمة المقيسةأمانة الملخص لنص المصدر المُزوَّدVectara
أدنى معدل مسجل0.7%Vectara
نطاق أفضل النماذج أداءً عادةنحو 1.8%Vectara
عدد المقالات في تحديث نوفمبر 2025أكثر من 7,700Vectara
نية التصميم للتحديثأكبر وأكثر متانة وأصعبVectara
أثر التحديث على المعدلات المقاسةأعلىVectara
ما لا تختبره هذه المهمةالاسترجاع الحر للحقائقمُستنتج
سبب استشهاد الموردين بهالأنها تنتج أدنى الأرقاممُستنتج

تفصيل التحديث أهم مما يبدو للوهلة الأولى: ارتفعت الهلوسة المقاسة لأن الاختبار أصبح أصعب، لا لأن النماذج ساءت، ما يعني أن المقارنات من عام إلى آخر على هذه اللوحة غير موثوقة عبر تغيير الإصدار. المصدر: Vectara حول الجيل التالي من لوحة صدارة الهلوسة الخاصة بها.

3. الاسترجاع الحر: الاختبار المتشائم

المعايير التي تنتج أرقاماً من خانتين وقريبة من ثلاث خانات تختبر شيئاً أقرب بكثير إلى الاستخدام الفعلي. سجل Stanford HAI معدلات هلوسة من 22% إلى 94% عبر 26 نموذجاً متقدماً على معيار دقة ورد في فصله عن الذكاء الاصطناعي المسؤول لعام 2026. عندما يتعين على النموذج تقديم حقائق من معاملاته الداخلية بدلاً من مستند أمامه، يرتفع معدل الفشل ارتفاعاً حاداً.

المقياسالقيمةالمصدر
أدنى معدل عبر النماذج الـ2622%Stanford HAI، 2026
أعلى معدل عبر النماذج الـ2694%Stanford HAI، 2026
عدد النماذج المتقدمة المختبرة26Stanford HAI، 2026
الفارق بين أفضل نموذج وأسوأه72 نقطةمُستنتج من أرقام Stanford
الفصل الذي ورد فيه الاكتشافالذكاء الاصطناعي المسؤولStanford HAI، 2026
نمط الفشل المقيسالهلوسة الناتجة عن التملقStanford HAI، 2026
تاريخ نشر AI Indexأبريل 2026Stanford HAI
المقارنة بمعدلات التلخيص المرتكز على المصدرأعلى بكثيرمُستنتج

فارق 72 نقطة بين أفضل نموذج متقدم وأسوأه على الاختبار نفسه لافت في حد ذاته: اختيار النموذج مهم للغاية في هذه المهمة، وغير مهم تقريباً في التلخيص المرتكز على المصدر حيث تتجمع كل النتائج في خانة أحادية منخفضة. المصدر: تقرير Stanford HAI AI Index لعام 2026.

4. التملق نمط فشل منفصل

يستحق تأطير Stanford أن يُفصل عن الخطأ الواقعي العادي. تعني الهلوسة الناتجة عن التملق أن النموذج يتماشى مع فرضية ذكرها المستخدم، حتى لو كانت خاطئة، وهذه آلية مختلفة عن نموذج لا يعرف شيئاً ببساطة. كما يعني ذلك أن المعدل المقاس يعتمد جزئياً على طريقة صياغة السؤال، لا على ما يعرفه النموذج فقط.

المقياسالقيمةالمصدر
نمط الفشلالتماشي مع فرضية خاطئة من المستخدمStanford HAI، 2026
نطاق المعدل عبر النماذج22% إلى 94%Stanford HAI، 2026
النماذج المُقيَّمة26 نموذجاً متقدماًStanford HAI، 2026
الاختلاف عن الخطأ الواقعي العاديآلية مختلفةStanford HAI، 2026
الاعتماد على صياغة الطلبمرتفعمُستنتج
فصل التقريرالذكاء الاصطناعي المسؤولStanford HAI، 2026
استنتاج AI Index الأوسع حول الإفصاحإفصاح الذكاء الاصطناعي المسؤول يتأخر عن القدراتStanford HAI، 2026
الدلالة بالنسبة للتقييمتصميم الطلب جزء من القياس نفسهمُستنتج

النتيجة العملية مزعجة لأي جهة تنشر هذه الأنظمة: يمكن أن يكون النموذج دقيقاً للغاية عند سؤاله بحياد، وغير موثوق للغاية عندما يؤكد المستخدم أولاً شيئاً خاطئاً. يجد سياق النشر في إحصاءات تبني الذكاء الاصطناعي في الشركات لدينا. المصدر: Stanford HAI، 12 استنتاجاً من AI Index لعام 2026.

5. قراءة ادعاء أحد الموردين

تختصر الخلاصة العملية في قائمة تحقق قصيرة. أي ادعاء بمعدل هلوسة أقل من 1% يكاد يكون بالتأكيد تلخيصاً مرتكزاً على المصدر، حيث سُلِّم النموذج المادة المصدرية، ولا يخبرك بشيء عن الاسترجاع دون مساعدة. السؤال الصحيح ليس أبداً “ما معدل الهلوسة” بل دائماً “على أي معيار، وأي مهمة، وبأي حجم عينة”.

المقياسالقيمةالمصدر
ما يقيسه عادة ادعاء أقل من 1%التلخيص المرتكز على المصدرVectara
ما لا يقيسهالاسترجاع الحر للحقائقمُستنتج
معدل النموذج نفسه على اختبار داخلي أصعب7.6%Vectara
نطاق المعدل على اختبارات الاسترجاع الحر22% إلى 94%Stanford HAI، 2026
عدد المقالات في مجموعة اختبار Vectara الحاليةأكثر من 7,700Vectara
عدد النماذج التي يغطيها نطاق Stanford26Stanford HAI، 2026
الأسئلة الواجب طرحها على أي ادعاءأي معيار، وأي مهمة، وأي عينةمُستنتج
هل المقارنة بين المصادر صالحةلا، دون منهجية متطابقةمُستنتج

عمليات النشر المرتكزة على الاسترجاع تقترب فعلاً من الطرف المتفائل، لأنها تحاكي شروط المعيار المتفائل، وهذه هي الطريقة المشروعة الوحيدة لاستخدام الأرقام المنخفضة. والعكس صحيح أيضاً: روبوت المحادثة الذي يجيب عن أسئلة مفتوحة دون استرجاع ينبغي تقييمه مقابل النطاق المتشائم، والاستشهاد بالرقم المرتكز على المصدر لهذا المنتج خطأ في التصنيف لا مبالغة. يجد سياق البحث والاسترجاع في إحصاءات البحث بالذكاء الاصطناعي لدينا، وسياق مشهد النماذج في إحصاءات الذكاء الاصطناعي مفتوح المصدر. المصدر: قياس أمانة LLM في RAG عبر لوحات صدارة متطورة.

ملخص: هلوسة الذكاء الاصطناعي بالأرقام

المقياسالقيمةالمصدر
أدنى معدل منشور0.7%Vectara
نطاق أفضل النماذج، التلخيص المرتكز على المصدرنحو 1.8%Vectara
النموذج نفسه تحت FaithJudge7.6%Vectara
النسبة بين هذين القياسيننحو 11 ضعفاًمُستنتج
النطاق عبر 26 نموذجاً متقدماً22% إلى 94%Stanford HAI
الفارق بين أفضل نموذج وأسوأه72 نقطةمُستنتج
النماذج التي اختبرها Stanford HAI26Stanford HAI
نمط الفشل الذي قاسه Stanfordالهلوسة الناتجة عن التملقStanford HAI
عدد المقالات في مجموعة اختبار Vectara المحدَّثةأكثر من 7,700Vectara
نية التصميم للتحديثأصعبVectara
الأثر على المعدلات المقاسةأعلىVectara
المهمة في التلخيص المرتكز على المصدرالأمانة لمصدر مُزوَّدVectara
المهمة في معايير الاسترجاع الحرإنتاج الحقائق دون مساعدةStanford HAI
فصل التقرير لدى Stanford HAIالذكاء الاصطناعي المسؤولStanford HAI
تاريخ نشر AI Indexأبريل 2026Stanford HAI
النطاق عبر جميع المعدلات المنشورة لعام 2026أكثر من رتبتين من الحجممُستنتج

المنهجية والمصادر

  • معدلات التلخيص المرتكز على المصدر، والمقارنة مع FaithJudge، وتحديث مجموعة الاختبار في نوفمبر 2025 مصدرها لوحة صدارة الهلوسة العامة لدى Vectara ووثائقها المرافقة (مستودع لوحة الصدارة، إعلان الجيل التالي من لوحة الصدارة).
  • النطاق من 22% إلى 94% عبر 26 نموذجاً متقدماً، وإطار التملق، وسياق فصل الذكاء الاصطناعي المسؤول مصدرها AI Index لعام 2026 من Stanford HAI، المنشور في أبريل 2026 (التقرير، الاستنتاجات، الصفحة الرئيسية لـ AI Index).
  • الخلفية المنهجية حول سبب تحكم تصميم لوحة الصدارة في الأمانة المقاسة مصدرها أبحاث منشورة عن معايير RAG المتطورة (arXiv).
  • ملاحظة حول البيانات: يجب عدم حساب متوسط الأرقام الواردة في هذا الاستعراض أو مقارنتها أو عرضها كمعدل واحد. تقيس Vectara الأمانة لمستند مُزوَّد؛ ويقيس Stanford HAI نمط فشل مختلفاً تحت شروط مختلفة. رفع تحديث Vectara في نوفمبر 2025 صعوبة الاختبار عمداً، لذا فإن المعدلات قبل ذلك التغيير وبعده غير قابلة للمقارنة، وقد يعكس التراجع الظاهري اختباراً أصعب لا نماذج أسوأ. تتغير أرقام النماذج المحددة بسرعة مع إصدار نسخ جديدة، وينبغي اعتبار أي نتيجة لنموذج مُسمى أقدم من ربع سنة نتيجة قديمة. يعتمد قياس Stanford للتملق على صياغة الطلب، وهو جزء من التصميم التجريبي لا خاصية ثابتة للنماذج. Vectara مورد تجاري لمنتجات ذكاء اصطناعي مرتكزة على الاسترجاع، ما يمنحها مصلحة في معايير القياس التي يؤدي فيها الارتكاز على المصدر أداءً جيداً. الصفوف المُشار إليها بـ”مُستنتج” هي نتاج حسابي أو استنتاج مباشر من الأرقام المنشورة.
  • آخر تحديث: 2 أغسطس 2026. نحدّث هذا الاستعراض كل ثلاثة أشهر مع تحديث Vectara للوحة صدارتها ونشر Stanford HAI إصدارات جديدة من AI Index.

جرّب VoxBooster — 3 أيام مجاناً.

استنساخ الصوت الفوري، لوحة الأصوات والمؤثرات — أينما تتحدث.

  • بدون بطاقة
  • ~30ms تأخير
  • Discord · Teams · OBS
جرّب 3 أيام مجاناً