Model yang sama bisa terukur pada 0,7% dan pada 7,6% tingkat halusinasi tergantung benchmark mana yang dijalankan, dan pada 26 model garda depan Stanford HAI mencatat rentang 22% hingga 94%. Rentang itulah fakta paling penting tentang statistik halusinasi AI pada 2026: desain benchmark jauh lebih menentukan angka utama dibandingkan kualitas model. Peringkasan berbasis sumber, tempat model diberi teks sumber, menghasilkan angka-angka menguntungkan yang muncul dalam materi vendor. Pengujian pengingatan terbuka, yang lebih dekat dengan cara orang benar-benar menggunakan sistem ini, menghasilkan angka yang lebih buruk satu orde besaran. Data di bawah ini berasal dari papan peringkat halusinasi Vectara dan AI Index 2026 Stanford HAI.
Ringkasan Singkat
- Tingkat halusinasi yang dilaporkan pada 2026 berkisar dari sekitar 0,7% hingga 94% tergantung benchmark (Vectara, Stanford HAI)
- Gemini-2.0-Flash-001 mencatat 0,7% pada peringkasan berbasis sumber (Vectara)
- Model yang sama mendapat skor 7,6% pada benchmark FaithJudge Vectara (Vectara)
- Itu setara dengan perbedaan sekitar sebelas kali lipat untuk satu model (turunan)
- Stanford HAI mencatat 22% hingga 94% pada 26 model garda depan (Stanford HAI, 2026)
- Angka-angka itu mengukur halusinasi akibat penjilatan (Stanford HAI, 2026)
- Pembaruan Vectara pada November 2025 menggunakan lebih dari 7.700 artikel (Vectara)
- Pembaruan itu dirancang agar jauh lebih menantang (Vectara)
- Tingkat terukur naik sebagai akibat langsung dari pengujian yang lebih sulit (Vectara)
- Baris terbaik pada papan peringkat peringkasan berbasis sumber berada dekat 1,8% (Vectara)
- Temuan Stanford muncul dalam bab AI Bertanggung Jawab (Stanford HAI, 2026)
- Peringkasan berbasis sumber memberikan teks sumber kepada model (Vectara)
- Benchmark pengingatan terbuka menuntut model menghasilkan fakta tanpa bantuan (Stanford HAI)
1. Rentang Itulah Statistiknya
Siapa pun yang mengutip satu tingkat halusinasi sebenarnya sedang menggambarkan satu benchmark, bukan fenomenanya. Tingkat yang dipublikasikan pada 2026 berkisar dari sekitar 0,7% pada ujung terbaik papan peringkat peringkasan berbasis sumber Vectara hingga antara 22% dan 94% pada 26 model garda depan yang diuji Stanford HAI. Itu bukan estimasi yang bersaing untuk besaran yang sama; itu adalah pengukuran tugas yang berbeda, dan jaraknya lebih dari dua orde besaran.
| Metrik | Nilai | Sumber |
|---|---|---|
| Tingkat terendah yang dipublikasikan, peringkasan berbasis sumber | 0,7% | Vectara |
| Baris berkinerja terbaik pada papan peringkat itu | dekat 1,8% | Vectara |
| Rentang pada 26 model garda depan | 22% hingga 94% | Stanford HAI, 2026 |
| Model yang mencapai angka 0,7% | Gemini-2.0-Flash-001 | Vectara |
| Model yang sama pada FaithJudge | 7,6% | Vectara |
| Rasio antara dua pengukuran itu | sekitar 11x | Turunan dari angka Vectara |
| Jarak antara tingkat terendah dan tertinggi yang dipublikasikan | lebih dari dua orde besaran | Turunan |
| Yang menentukan angka tersebut | desain benchmark | Vectara, Stanford HAI |
Selisih sebelas kali lipat untuk satu model pada dua benchmark dari organisasi yang sama adalah bukti paling jelas yang ada bahwa angka-angka ini menggambarkan pengujian, bukan model.
Hal ini punya konsekuensi praktis yang sering terlewat dalam diskusi soal benchmark. Jika Anda memilih model untuk aplikasi berbasis pengambilan, tempat sistem selalu menyediakan dokumen sumber, angka peringkasan berbasis sumber adalah yang relevan, dan tingkat di bawah 2% adalah ekspektasi yang wajar. Jika Anda memilih model untuk menjawab pertanyaan dari pengetahuannya sendiri, angka yang sama itu justru menyesatkan, dan kisaran 22% hingga 94% lebih mendekati apa yang seharusnya Anda antisipasi. Sebagian besar kekecewaan di lingkungan produksi dengan sistem ini berakar dari tim yang menguji dengan satu cara lalu menerapkannya dengan cara lain. Benchmarknya tidak salah; ia hanya menjawab pertanyaan yang berbeda dari yang diajukan oleh penerapan tersebut. Sumber: papan peringkat halusinasi Vectara.
2. Peringkasan Berbasis Sumber: Uji Coba yang Optimistis
Benchmark yang menghasilkan angka di bawah 1% sedang melakukan sesuatu yang spesifik dan sempit. Peringkasan berbasis sumber memberikan dokumen sumber kepada model dan memeriksa apakah ringkasan yang dihasilkan tetap setia padanya, yang menghilangkan kebutuhan model untuk mengetahui apa pun. Ini adalah pengukuran yang sah dan berguna untuk satu moda kegagalan, dan inilah yang dikutip para vendor.
| Metrik | Nilai | Sumber |
|---|---|---|
| Tugas yang diukur | kesetiaan ringkasan pada teks sumber yang diberikan | Vectara |
| Tingkat terendah yang tercatat | 0,7% | Vectara |
| Kisaran khas model berkinerja terbaik | dekat 1,8% | Vectara |
| Artikel dalam pembaruan November 2025 | lebih dari 7.700 | Vectara |
| Tujuan desain pembaruan | lebih besar, lebih tangguh, lebih menantang | Vectara |
| Efek pembaruan pada tingkat terukur | lebih tinggi | Vectara |
| Yang tidak diuji oleh tugas ini | pengingatan faktual tanpa bantuan | Turunan |
| Alasan para vendor mengutipnya | menghasilkan angka paling rendah | Turunan |
Detail pembaruan ini lebih penting daripada yang terlihat sekilas: halusinasi yang terukur naik karena pengujiannya menjadi lebih sulit, bukan karena model-modelnya memburuk, yang berarti perbandingan tahun ke tahun pada papan peringkat ini tidak dapat diandalkan lintas perubahan versi. Sumber: Vectara tentang generasi berikutnya dari papan peringkat halusinasinya.
3. Pengingatan Terbuka: Uji Coba yang Pesimistis
Benchmark yang menghasilkan angka dua digit dan mendekati tiga digit sedang menguji sesuatu yang jauh lebih mirip penggunaan nyata. Stanford HAI mencatat tingkat halusinasi dari 22% hingga 94% pada 26 model garda depan dalam benchmark akurasi yang dilaporkan pada bab AI Bertanggung Jawab 2026 miliknya. Ketika sebuah model harus menyediakan fakta dari parameternya sendiri alih-alih dari dokumen di depannya, tingkat kegagalannya melonjak drastis.
| Metrik | Nilai | Sumber |
|---|---|---|
| Tingkat terendah di antara 26 model | 22% | Stanford HAI, 2026 |
| Tingkat tertinggi di antara 26 model | 94% | Stanford HAI, 2026 |
| Jumlah model garda depan yang diuji | 26 | Stanford HAI, 2026 |
| Selisih antara model terbaik dan terburuk | 72 poin | Turunan dari angka Stanford |
| Bab yang melaporkan temuan ini | AI Bertanggung Jawab | Stanford HAI, 2026 |
| Moda kegagalan yang diukur | halusinasi akibat penjilatan | Stanford HAI, 2026 |
| Tanggal terbit AI Index | April 2026 | Stanford HAI |
| Perbandingan dengan tingkat peringkasan berbasis sumber | jauh lebih tinggi | Turunan |
Selisih 72 poin antara model garda depan terbaik dan terburuk pada pengujian yang sama sudah cukup mencolok dengan sendirinya: pemilihan model sangat berpengaruh pada tugas ini, dan nyaris tidak berpengaruh pada peringkasan berbasis sumber, tempat semuanya berkumpul pada angka satu digit rendah. Sumber: Laporan AI Index 2026 Stanford HAI.
4. Penjilatan Adalah Moda Kegagalan yang Berbeda
Sudut pandang Stanford ini layak dipisahkan dari kesalahan faktual biasa. Halusinasi akibat penjilatan berarti model mengikuti premis yang dinyatakan pengguna, bahkan ketika premis itu salah, yang merupakan mekanisme berbeda dari model yang sekadar tidak mengetahui sesuatu. Ini juga berarti bahwa tingkat yang terukur sebagian bergantung pada cara pertanyaan diajukan, bukan hanya pada apa yang diketahui model.
| Metrik | Nilai | Sumber |
|---|---|---|
| Moda kegagalan | mengikuti premis palsu dari pengguna | Stanford HAI, 2026 |
| Rentang tingkat antarmodel | 22% hingga 94% | Stanford HAI, 2026 |
| Model yang dievaluasi | 26 model garda depan | Stanford HAI, 2026 |
| Perbedaan dengan kesalahan faktual biasa | mekanismenya berbeda | Stanford HAI, 2026 |
| Ketergantungan pada penyusunan prompt | tinggi | Turunan |
| Bab pelaporan | AI Bertanggung Jawab | Stanford HAI, 2026 |
| Temuan AI Index yang lebih luas soal pengungkapan | pengungkapan AI bertanggung jawab tertinggal dari kemampuannya | Stanford HAI, 2026 |
| Implikasi untuk evaluasi | desain prompt adalah bagian dari pengukuran | Turunan |
Konsekuensi praktisnya cukup mengganggu bagi siapa pun yang menerapkan sistem ini: sebuah model bisa sangat akurat ketika ditanya secara netral dan sangat tidak dapat diandalkan ketika pengguna lebih dulu menyatakan sesuatu yang salah. Konteks penerapannya ada di statistik adopsi AI perusahaan kami. Sumber: Stanford HAI, 12 temuan dari AI Index 2026.
5. Cara Membaca Klaim Vendor
Kesimpulan praktisnya adalah daftar periksa singkat. Klaim halusinasi di bawah 1% hampir pasti berupa peringkasan berbasis sumber, tempat model diberi materi sumber, dan itu tidak mengatakan apa pun tentang pengingatan tanpa bantuan. Pertanyaan yang tepat tidak pernah “berapa tingkat halusinasinya” melainkan “pada benchmark mana, pada tugas apa, dengan ukuran sampel berapa”.
| Metrik | Nilai | Sumber |
|---|---|---|
| Yang biasanya diukur oleh klaim di bawah 1% | peringkasan berbasis sumber | Vectara |
| Yang tidak diukurnya | pengingatan faktual tanpa bantuan | Turunan |
| Tingkat model yang sama pada pengujian internal yang lebih sulit | 7,6% | Vectara |
| Kisaran tingkat pada pengujian bergaya pengingatan terbuka | 22% hingga 94% | Stanford HAI, 2026 |
| Artikel dalam kumpulan pengujian Vectara saat ini | lebih dari 7.700 | Vectara |
| Model yang tercakup dalam rentang Stanford | 26 | Stanford HAI, 2026 |
| Pertanyaan yang perlu diajukan untuk klaim apa pun | benchmark mana, tugas apa, sampel seperti apa | Turunan |
| Apakah perbandingan antarsumber valid | tidak, tanpa metodologi yang setara | Turunan |
Penerapan berbasis pengambilan memang lebih dekat ke ujung yang optimistis, karena mereplikasi kondisi benchmark optimistis tersebut, yang merupakan satu-satunya cara sah untuk memakai angka-angka rendah itu. Sebaliknya juga berlaku: chatbot yang menjawab pertanyaan terbuka tanpa pengambilan seharusnya dievaluasi terhadap kisaran pesimistis, dan mengutip angka peringkasan berbasis sumber untuk produk semacam itu adalah kesalahan kategori, bukan sekadar melebih-lebihkan. Konteks pencarian dan pengambilan ada di statistik pencarian AI kami, dan konteks lanskap model ada di statistik AI sumber terbuka kami. Sumber: Mengukur kesetiaan LLM dalam RAG dengan papan peringkat yang terus berkembang.
Ringkasan: Halusinasi AI dalam Angka
| Metrik | Nilai | Sumber |
|---|---|---|
| Tingkat terendah yang dipublikasikan | 0,7% | Vectara |
| Kisaran model berkinerja terbaik, peringkasan berbasis sumber | dekat 1,8% | Vectara |
| Model yang sama pada FaithJudge | 7,6% | Vectara |
| Rasio antara pengukuran-pengukuran itu | sekitar 11x | Turunan |
| Rentang pada 26 model garda depan | 22% hingga 94% | Stanford HAI |
| Selisih antara model terbaik dan terburuk | 72 poin | Turunan |
| Model yang diuji Stanford HAI | 26 | Stanford HAI |
| Moda kegagalan yang diukur Stanford | halusinasi akibat penjilatan | Stanford HAI |
| Artikel dalam kumpulan pengujian Vectara yang diperbarui | lebih dari 7.700 | Vectara |
| Tujuan desain pembaruan | lebih menantang | Vectara |
| Efek pada tingkat terukur | lebih tinggi | Vectara |
| Tugas pada peringkasan berbasis sumber | kesetiaan pada sumber yang diberikan | Vectara |
| Tugas pada benchmark pengingatan terbuka | produksi faktual tanpa bantuan | Stanford HAI |
| Bab pelaporan di Stanford HAI | AI Bertanggung Jawab | Stanford HAI |
| Tanggal terbit AI Index | April 2026 | Stanford HAI |
| Rentang di seluruh tingkat yang dipublikasikan pada 2026 | lebih dari dua orde besaran | Turunan |
Metodologi dan Sumber
- Tingkat peringkasan berbasis sumber, perbandingan dengan FaithJudge, dan pembaruan kumpulan pengujian November 2025 berasal dari papan peringkat halusinasi publik Vectara beserta dokumentasi pendampingnya (repositori papan peringkat, pengumuman generasi berikutnya papan peringkat).
- Rentang 22% hingga 94% pada 26 model garda depan, sudut pandang penjilatan, dan konteks bab AI Bertanggung Jawab berasal dari AI Index 2026 Stanford HAI, diterbitkan April 2026 (laporan, temuan utama, beranda AI Index).
- Latar belakang metodologis tentang alasan desain papan peringkat menentukan kesetiaan yang terukur berasal dari riset yang dipublikasikan soal papan peringkat RAG yang terus berkembang (arXiv).
- Catatan data: angka-angka dalam rangkuman ini tidak boleh dirata-ratakan, dibandingkan, atau disajikan sebagai satu tingkat tunggal. Vectara mengukur kesetiaan pada dokumen yang diberikan; Stanford HAI mengukur moda kegagalan yang berbeda dalam kondisi yang berbeda. Pembaruan Vectara pada November 2025 sengaja meningkatkan tingkat kesulitan pengujian, sehingga tingkat sebelum dan sesudah perubahan itu tidak dapat dibandingkan, dan yang tampak seperti perburukan bisa jadi mencerminkan pengujian yang lebih sulit, bukan model yang lebih buruk. Angka spesifik per model berubah cepat seiring rilis versi baru, dan hasil model tertentu yang berusia lebih dari satu kuartal harus dianggap sudah usang. Pengukuran penjilatan Stanford bergantung pada penyusunan prompt, yang merupakan bagian dari desain eksperimen, bukan sifat tetap dari model-modelnya. Vectara adalah vendor komersial produk AI berbasis pengambilan, sehingga memiliki kepentingan pada benchmark yang menguntungkan pendekatan berbasis sumber. Baris yang ditandai sebagai turunan merupakan perhitungan aritmetika atau inferensi langsung dari angka yang dipublikasikan.
- Terakhir diperbarui: 2 Agustus 2026. Kami memperbarui rangkuman ini setiap kuartal seiring Vectara memperbarui papan peringkatnya dan Stanford HAI menerbitkan edisi baru AI Index.