Statistik Halusinasi AI (2026): 40+ Data Poin tentang Tingkat, Benchmark, dan Alasan Perbedaannya

Statistik halusinasi AI 2026: tingkat papan peringkat Vectara, rentang 22 hingga 94 persen dari Stanford HAI, dan cara membaca klaim vendor tentang akurasi model.

Model yang sama bisa terukur pada 0,7% dan pada 7,6% tingkat halusinasi tergantung benchmark mana yang dijalankan, dan pada 26 model garda depan Stanford HAI mencatat rentang 22% hingga 94%. Rentang itulah fakta paling penting tentang statistik halusinasi AI pada 2026: desain benchmark jauh lebih menentukan angka utama dibandingkan kualitas model. Peringkasan berbasis sumber, tempat model diberi teks sumber, menghasilkan angka-angka menguntungkan yang muncul dalam materi vendor. Pengujian pengingatan terbuka, yang lebih dekat dengan cara orang benar-benar menggunakan sistem ini, menghasilkan angka yang lebih buruk satu orde besaran. Data di bawah ini berasal dari papan peringkat halusinasi Vectara dan AI Index 2026 Stanford HAI.

Ringkasan Singkat

  • Tingkat halusinasi yang dilaporkan pada 2026 berkisar dari sekitar 0,7% hingga 94% tergantung benchmark (Vectara, Stanford HAI)
  • Gemini-2.0-Flash-001 mencatat 0,7% pada peringkasan berbasis sumber (Vectara)
  • Model yang sama mendapat skor 7,6% pada benchmark FaithJudge Vectara (Vectara)
  • Itu setara dengan perbedaan sekitar sebelas kali lipat untuk satu model (turunan)
  • Stanford HAI mencatat 22% hingga 94% pada 26 model garda depan (Stanford HAI, 2026)
  • Angka-angka itu mengukur halusinasi akibat penjilatan (Stanford HAI, 2026)
  • Pembaruan Vectara pada November 2025 menggunakan lebih dari 7.700 artikel (Vectara)
  • Pembaruan itu dirancang agar jauh lebih menantang (Vectara)
  • Tingkat terukur naik sebagai akibat langsung dari pengujian yang lebih sulit (Vectara)
  • Baris terbaik pada papan peringkat peringkasan berbasis sumber berada dekat 1,8% (Vectara)
  • Temuan Stanford muncul dalam bab AI Bertanggung Jawab (Stanford HAI, 2026)
  • Peringkasan berbasis sumber memberikan teks sumber kepada model (Vectara)
  • Benchmark pengingatan terbuka menuntut model menghasilkan fakta tanpa bantuan (Stanford HAI)

1. Rentang Itulah Statistiknya

Siapa pun yang mengutip satu tingkat halusinasi sebenarnya sedang menggambarkan satu benchmark, bukan fenomenanya. Tingkat yang dipublikasikan pada 2026 berkisar dari sekitar 0,7% pada ujung terbaik papan peringkat peringkasan berbasis sumber Vectara hingga antara 22% dan 94% pada 26 model garda depan yang diuji Stanford HAI. Itu bukan estimasi yang bersaing untuk besaran yang sama; itu adalah pengukuran tugas yang berbeda, dan jaraknya lebih dari dua orde besaran.

MetrikNilaiSumber
Tingkat terendah yang dipublikasikan, peringkasan berbasis sumber0,7%Vectara
Baris berkinerja terbaik pada papan peringkat itudekat 1,8%Vectara
Rentang pada 26 model garda depan22% hingga 94%Stanford HAI, 2026
Model yang mencapai angka 0,7%Gemini-2.0-Flash-001Vectara
Model yang sama pada FaithJudge7,6%Vectara
Rasio antara dua pengukuran itusekitar 11xTurunan dari angka Vectara
Jarak antara tingkat terendah dan tertinggi yang dipublikasikanlebih dari dua orde besaranTurunan
Yang menentukan angka tersebutdesain benchmarkVectara, Stanford HAI

Selisih sebelas kali lipat untuk satu model pada dua benchmark dari organisasi yang sama adalah bukti paling jelas yang ada bahwa angka-angka ini menggambarkan pengujian, bukan model.

Hal ini punya konsekuensi praktis yang sering terlewat dalam diskusi soal benchmark. Jika Anda memilih model untuk aplikasi berbasis pengambilan, tempat sistem selalu menyediakan dokumen sumber, angka peringkasan berbasis sumber adalah yang relevan, dan tingkat di bawah 2% adalah ekspektasi yang wajar. Jika Anda memilih model untuk menjawab pertanyaan dari pengetahuannya sendiri, angka yang sama itu justru menyesatkan, dan kisaran 22% hingga 94% lebih mendekati apa yang seharusnya Anda antisipasi. Sebagian besar kekecewaan di lingkungan produksi dengan sistem ini berakar dari tim yang menguji dengan satu cara lalu menerapkannya dengan cara lain. Benchmarknya tidak salah; ia hanya menjawab pertanyaan yang berbeda dari yang diajukan oleh penerapan tersebut. Sumber: papan peringkat halusinasi Vectara.

2. Peringkasan Berbasis Sumber: Uji Coba yang Optimistis

Benchmark yang menghasilkan angka di bawah 1% sedang melakukan sesuatu yang spesifik dan sempit. Peringkasan berbasis sumber memberikan dokumen sumber kepada model dan memeriksa apakah ringkasan yang dihasilkan tetap setia padanya, yang menghilangkan kebutuhan model untuk mengetahui apa pun. Ini adalah pengukuran yang sah dan berguna untuk satu moda kegagalan, dan inilah yang dikutip para vendor.

MetrikNilaiSumber
Tugas yang diukurkesetiaan ringkasan pada teks sumber yang diberikanVectara
Tingkat terendah yang tercatat0,7%Vectara
Kisaran khas model berkinerja terbaikdekat 1,8%Vectara
Artikel dalam pembaruan November 2025lebih dari 7.700Vectara
Tujuan desain pembaruanlebih besar, lebih tangguh, lebih menantangVectara
Efek pembaruan pada tingkat terukurlebih tinggiVectara
Yang tidak diuji oleh tugas inipengingatan faktual tanpa bantuanTurunan
Alasan para vendor mengutipnyamenghasilkan angka paling rendahTurunan

Detail pembaruan ini lebih penting daripada yang terlihat sekilas: halusinasi yang terukur naik karena pengujiannya menjadi lebih sulit, bukan karena model-modelnya memburuk, yang berarti perbandingan tahun ke tahun pada papan peringkat ini tidak dapat diandalkan lintas perubahan versi. Sumber: Vectara tentang generasi berikutnya dari papan peringkat halusinasinya.

3. Pengingatan Terbuka: Uji Coba yang Pesimistis

Benchmark yang menghasilkan angka dua digit dan mendekati tiga digit sedang menguji sesuatu yang jauh lebih mirip penggunaan nyata. Stanford HAI mencatat tingkat halusinasi dari 22% hingga 94% pada 26 model garda depan dalam benchmark akurasi yang dilaporkan pada bab AI Bertanggung Jawab 2026 miliknya. Ketika sebuah model harus menyediakan fakta dari parameternya sendiri alih-alih dari dokumen di depannya, tingkat kegagalannya melonjak drastis.

MetrikNilaiSumber
Tingkat terendah di antara 26 model22%Stanford HAI, 2026
Tingkat tertinggi di antara 26 model94%Stanford HAI, 2026
Jumlah model garda depan yang diuji26Stanford HAI, 2026
Selisih antara model terbaik dan terburuk72 poinTurunan dari angka Stanford
Bab yang melaporkan temuan iniAI Bertanggung JawabStanford HAI, 2026
Moda kegagalan yang diukurhalusinasi akibat penjilatanStanford HAI, 2026
Tanggal terbit AI IndexApril 2026Stanford HAI
Perbandingan dengan tingkat peringkasan berbasis sumberjauh lebih tinggiTurunan

Selisih 72 poin antara model garda depan terbaik dan terburuk pada pengujian yang sama sudah cukup mencolok dengan sendirinya: pemilihan model sangat berpengaruh pada tugas ini, dan nyaris tidak berpengaruh pada peringkasan berbasis sumber, tempat semuanya berkumpul pada angka satu digit rendah. Sumber: Laporan AI Index 2026 Stanford HAI.

4. Penjilatan Adalah Moda Kegagalan yang Berbeda

Sudut pandang Stanford ini layak dipisahkan dari kesalahan faktual biasa. Halusinasi akibat penjilatan berarti model mengikuti premis yang dinyatakan pengguna, bahkan ketika premis itu salah, yang merupakan mekanisme berbeda dari model yang sekadar tidak mengetahui sesuatu. Ini juga berarti bahwa tingkat yang terukur sebagian bergantung pada cara pertanyaan diajukan, bukan hanya pada apa yang diketahui model.

MetrikNilaiSumber
Moda kegagalanmengikuti premis palsu dari penggunaStanford HAI, 2026
Rentang tingkat antarmodel22% hingga 94%Stanford HAI, 2026
Model yang dievaluasi26 model garda depanStanford HAI, 2026
Perbedaan dengan kesalahan faktual biasamekanismenya berbedaStanford HAI, 2026
Ketergantungan pada penyusunan prompttinggiTurunan
Bab pelaporanAI Bertanggung JawabStanford HAI, 2026
Temuan AI Index yang lebih luas soal pengungkapanpengungkapan AI bertanggung jawab tertinggal dari kemampuannyaStanford HAI, 2026
Implikasi untuk evaluasidesain prompt adalah bagian dari pengukuranTurunan

Konsekuensi praktisnya cukup mengganggu bagi siapa pun yang menerapkan sistem ini: sebuah model bisa sangat akurat ketika ditanya secara netral dan sangat tidak dapat diandalkan ketika pengguna lebih dulu menyatakan sesuatu yang salah. Konteks penerapannya ada di statistik adopsi AI perusahaan kami. Sumber: Stanford HAI, 12 temuan dari AI Index 2026.

5. Cara Membaca Klaim Vendor

Kesimpulan praktisnya adalah daftar periksa singkat. Klaim halusinasi di bawah 1% hampir pasti berupa peringkasan berbasis sumber, tempat model diberi materi sumber, dan itu tidak mengatakan apa pun tentang pengingatan tanpa bantuan. Pertanyaan yang tepat tidak pernah “berapa tingkat halusinasinya” melainkan “pada benchmark mana, pada tugas apa, dengan ukuran sampel berapa”.

MetrikNilaiSumber
Yang biasanya diukur oleh klaim di bawah 1%peringkasan berbasis sumberVectara
Yang tidak diukurnyapengingatan faktual tanpa bantuanTurunan
Tingkat model yang sama pada pengujian internal yang lebih sulit7,6%Vectara
Kisaran tingkat pada pengujian bergaya pengingatan terbuka22% hingga 94%Stanford HAI, 2026
Artikel dalam kumpulan pengujian Vectara saat inilebih dari 7.700Vectara
Model yang tercakup dalam rentang Stanford26Stanford HAI, 2026
Pertanyaan yang perlu diajukan untuk klaim apa punbenchmark mana, tugas apa, sampel seperti apaTurunan
Apakah perbandingan antarsumber validtidak, tanpa metodologi yang setaraTurunan

Penerapan berbasis pengambilan memang lebih dekat ke ujung yang optimistis, karena mereplikasi kondisi benchmark optimistis tersebut, yang merupakan satu-satunya cara sah untuk memakai angka-angka rendah itu. Sebaliknya juga berlaku: chatbot yang menjawab pertanyaan terbuka tanpa pengambilan seharusnya dievaluasi terhadap kisaran pesimistis, dan mengutip angka peringkasan berbasis sumber untuk produk semacam itu adalah kesalahan kategori, bukan sekadar melebih-lebihkan. Konteks pencarian dan pengambilan ada di statistik pencarian AI kami, dan konteks lanskap model ada di statistik AI sumber terbuka kami. Sumber: Mengukur kesetiaan LLM dalam RAG dengan papan peringkat yang terus berkembang.

Ringkasan: Halusinasi AI dalam Angka

MetrikNilaiSumber
Tingkat terendah yang dipublikasikan0,7%Vectara
Kisaran model berkinerja terbaik, peringkasan berbasis sumberdekat 1,8%Vectara
Model yang sama pada FaithJudge7,6%Vectara
Rasio antara pengukuran-pengukuran itusekitar 11xTurunan
Rentang pada 26 model garda depan22% hingga 94%Stanford HAI
Selisih antara model terbaik dan terburuk72 poinTurunan
Model yang diuji Stanford HAI26Stanford HAI
Moda kegagalan yang diukur Stanfordhalusinasi akibat penjilatanStanford HAI
Artikel dalam kumpulan pengujian Vectara yang diperbaruilebih dari 7.700Vectara
Tujuan desain pembaruanlebih menantangVectara
Efek pada tingkat terukurlebih tinggiVectara
Tugas pada peringkasan berbasis sumberkesetiaan pada sumber yang diberikanVectara
Tugas pada benchmark pengingatan terbukaproduksi faktual tanpa bantuanStanford HAI
Bab pelaporan di Stanford HAIAI Bertanggung JawabStanford HAI
Tanggal terbit AI IndexApril 2026Stanford HAI
Rentang di seluruh tingkat yang dipublikasikan pada 2026lebih dari dua orde besaranTurunan

Metodologi dan Sumber

  • Tingkat peringkasan berbasis sumber, perbandingan dengan FaithJudge, dan pembaruan kumpulan pengujian November 2025 berasal dari papan peringkat halusinasi publik Vectara beserta dokumentasi pendampingnya (repositori papan peringkat, pengumuman generasi berikutnya papan peringkat).
  • Rentang 22% hingga 94% pada 26 model garda depan, sudut pandang penjilatan, dan konteks bab AI Bertanggung Jawab berasal dari AI Index 2026 Stanford HAI, diterbitkan April 2026 (laporan, temuan utama, beranda AI Index).
  • Latar belakang metodologis tentang alasan desain papan peringkat menentukan kesetiaan yang terukur berasal dari riset yang dipublikasikan soal papan peringkat RAG yang terus berkembang (arXiv).
  • Catatan data: angka-angka dalam rangkuman ini tidak boleh dirata-ratakan, dibandingkan, atau disajikan sebagai satu tingkat tunggal. Vectara mengukur kesetiaan pada dokumen yang diberikan; Stanford HAI mengukur moda kegagalan yang berbeda dalam kondisi yang berbeda. Pembaruan Vectara pada November 2025 sengaja meningkatkan tingkat kesulitan pengujian, sehingga tingkat sebelum dan sesudah perubahan itu tidak dapat dibandingkan, dan yang tampak seperti perburukan bisa jadi mencerminkan pengujian yang lebih sulit, bukan model yang lebih buruk. Angka spesifik per model berubah cepat seiring rilis versi baru, dan hasil model tertentu yang berusia lebih dari satu kuartal harus dianggap sudah usang. Pengukuran penjilatan Stanford bergantung pada penyusunan prompt, yang merupakan bagian dari desain eksperimen, bukan sifat tetap dari model-modelnya. Vectara adalah vendor komersial produk AI berbasis pengambilan, sehingga memiliki kepentingan pada benchmark yang menguntungkan pendekatan berbasis sumber. Baris yang ditandai sebagai turunan merupakan perhitungan aritmetika atau inferensi langsung dari angka yang dipublikasikan.
  • Terakhir diperbarui: 2 Agustus 2026. Kami memperbarui rangkuman ini setiap kuartal seiring Vectara memperbarui papan peringkatnya dan Stanford HAI menerbitkan edisi baru AI Index.

Coba VoxBooster — uji coba gratis 3 hari.

Kloning suara real-time, soundboard, dan efek — di mana pun kamu sudah biasa bicara.

  • Tanpa kartu kredit
  • ~30ms latensi
  • Discord · Teams · OBS
Coba gratis 3 hari