Aynı model, hangi kıyaslamayı çalıştırdığınıza bağlı olarak yüzde 0,7 ve yüzde 7,6 halüsinasyon seviyesinde ölçülebilir, ve Stanford HAI 26 öncü model genelinde yüzde 22 ile 94 arasında bir aralık kaydetti. Bu fark, 2026’da yapay zeka halüsinasyonu istatistikleri hakkındaki en önemli tek gerçek: benchmark tasarımı, manşet sayıyı model kalitesinden çok daha fazla belirliyor. Modele kaynak metnin verildiği kaynağa dayalı özetleme, tedarikçi materyallerinde görünen gurur okşayıcı rakamları üretiyor. İnsanların bu sistemleri gerçekte nasıl kullandığına daha yakın olan açık hatırlama testleri, bir büyüklük mertebesi daha kötü rakamlar üretiyor. Aşağıdaki rakamlar Vectara’nın halüsinasyon sıralama tablosundan ve Stanford HAI 2026 AI Index’inden geliyor.
TL;DR
- 2026’da bildirilen halüsinasyon oranları, kıyaslamaya bağlı olarak yaklaşık yüzde 0,7 ile yüzde 94 arasında değişiyor (Vectara, Stanford HAI)
- Gemini-2.0-Flash-001, kaynağa dayalı özetlemede yüzde 0,7 kaydetti (Vectara)
- Aynı model, Vectara’nın FaithJudge kıyaslamasında yüzde 7,6 alıyor (Vectara)
- Bu, tek bir model için yaklaşık on bir kat fark demek (türetilmiş)
- Stanford HAI, 26 öncü model genelinde yüzde 22 ile 94 kaydetti (Stanford HAI, 2026)
- Bu rakamlar dalkavukluk kaynaklı halüsinasyonu ölçüyor (Stanford HAI, 2026)
- Vectara’nın Kasım 2025 güncellemesi 7.700’den fazla makale kullandı (Vectara)
- Güncelleme önemli ölçüde daha zorlu olacak şekilde tasarlandı (Vectara)
- Ölçülen oranlar, daha zor testin doğrudan sonucu olarak yükseldi (Vectara)
- Kaynağa dayalı özetleme sıralama tablosunun en iyi satırları yaklaşık yüzde 1,8’de duruyor (Vectara)
- Stanford’un bulguları Responsible AI bölümünde yer alıyor (Stanford HAI, 2026)
- Kaynağa dayalı özetleme, modele kaynak metni sağlıyor (Vectara)
- Açık hatırlama kıyaslamaları, modelin gerçekleri yardımsız üretmesini gerektiriyor (Stanford HAI)
1. Aralık, İstatistiğin Kendisidir
Tek bir halüsinasyon oranı belirten herkes, olguyu değil, bir kıyaslamayı tanımlıyor. 2026’da yayımlanan oranlar, Vectara’nın kaynağa dayalı özetleme sıralama tablosunun en iyi ucunda yaklaşık yüzde 0,7’den, Stanford HAI’nin test ettiği 26 öncü model genelinde yüzde 22 ile 94 arasına kadar uzanıyor. Bunlar aynı büyüklüğün rakip tahminleri değil, farklı görevlerin ölçümleri, ve aralarındaki fark iki büyüklük mertebesinden fazla.
| Metrik | Değer | Kaynak |
|---|---|---|
| En düşük yayımlanan oran, kaynağa dayalı özetleme | %0,7 | Vectara |
| Bu sıralama tablosundaki en iyi performans gösteren satırlar | yaklaşık %1,8 | Vectara |
| 26 öncü model genelindeki aralık | %22 ile %94 arası | Stanford HAI, 2026 |
| %0,7 rakamını elde eden model | Gemini-2.0-Flash-001 | Vectara |
| Aynı model FaithJudge altında | %7,6 | Vectara |
| Bu iki ölçüm arasındaki oran | yaklaşık 11x | Vectara rakamlarından türetilmiş |
| En düşük ile en yüksek yayımlanan oran arasındaki fark | iki büyüklük mertebesinden fazla | Türetilmiş |
| Sayıyı neyin belirlediği | benchmark tasarımı | Vectara, Stanford HAI |
Aynı kuruluşun iki kıyaslamasında tek bir model için görülen on bir kat fark, bu rakamların modelleri değil testleri tanımladığının elde mevcut en net kanıtı.
Bunun, kıyaslama tartışmasında gözden kaçan pratik bir sonucu var. Sistemin her zaman kaynak belgeleri sağladığı, retrieval’a dayalı bir uygulama için model seçiyorsanız, kaynağa dayalı özetleme rakamları ilgilidir ve yüzde 2’nin altında bir oran makul bir beklentidir. Kendi bilgisinden sorulara cevap verecek bir model seçiyorsanız, aynı rakamlar aktif olarak yanıltıcıdır ve yüzde 22 ile 94 aralığı planlamanız gereken şeye daha yakındır. Bu sistemlerle üretimde yaşanan hayal kırıklığının çoğu, bir ekibin bir şekilde kıyaslama yapıp başka şekilde devreye almasından kaynaklanır. Kıyaslama yanlış değildir; sadece devreye almanın sorduğundan farklı bir soruyu yanıtlıyordu. Kaynak: Vectara halüsinasyon sıralama tablosu.
2. Kaynağa Dayalı Özetleme: İyimser Test
Yüzde 1’in altında rakamlar üreten kıyaslama, spesifik ve dar bir şey yapıyor. Kaynağa dayalı özetleme, modele bir kaynak belge verir ve ortaya çıkan özetin ona sadık kalıp kalmadığını kontrol eder, bu da modelin herhangi bir şey bilmesi ihtiyacını ortadan kaldırır. Bu, bir başarısızlık türünün gerçek ve faydalı bir ölçümüdür, ve tedarikçilerin atıfta bulunduğu ölçümdür.
| Metrik | Değer | Kaynak |
|---|---|---|
| Ölçülen görev | özetin sağlanan kaynak metne sadakati | Vectara |
| En düşük kaydedilen oran | %0,7 | Vectara |
| Tipik en iyi performans bandı | yaklaşık %1,8 | Vectara |
| Kasım 2025 güncellemesindeki makaleler | 7.700’den fazla | Vectara |
| Güncellemenin tasarım amacı | daha büyük, daha sağlam, daha zorlu | Vectara |
| Güncellemenin ölçülen oranlar üzerindeki etkisi | daha yüksek | Vectara |
| Görevin test etmediği şey | yardımsız olgusal hatırlama | Türetilmiş |
| Tedarikçilerin buna atıfta bulunma nedeni | en düşük sayıları üretmesi | Türetilmiş |
Güncelleme detayı ilk göründüğünden daha önemli: ölçülen halüsinasyon, modeller kötüleştiği için değil, test zorlaştığı için arttı; bu da bu sıralama tablosunda yıldan yıla karşılaştırmaların sürüm değişikliği boyunca güvenilmez olduğu anlamına geliyor. Kaynak: Vectara’nın halüsinasyon sıralama tablosunun yeni nesli hakkında.
3. Açık Hatırlama: Kötümser Test
İki haneli ve üç haneliye yakın rakamlar üreten kıyaslamalar, gerçek kullanıma çok daha yakın bir şeyi test ediyor. Stanford HAI, 2026 Responsible AI bölümünde bildirilen bir doğruluk kıyaslamasında 26 öncü model genelinde yüzde 22 ile 94 arasında halüsinasyon oranları kaydetti. Bir model, önündeki bir belgeden değil de kendi parametrelerinden gerçek sağlamak zorunda kaldığında, hata oranı dramatik şekilde yükseliyor.
| Metrik | Değer | Kaynak |
|---|---|---|
| 26 model genelindeki en düşük oran | %22 | Stanford HAI, 2026 |
| 26 model genelindeki en yüksek oran | %94 | Stanford HAI, 2026 |
| Test edilen öncü model sayısı | 26 | Stanford HAI, 2026 |
| En iyi ile en kötü model arasındaki fark | 72 puan | Stanford rakamlarından türetilmiş |
| Bulguyu bildiren bölüm | Responsible AI | Stanford HAI, 2026 |
| Ölçülen başarısızlık türü | dalkavukluk kaynaklı halüsinasyon | Stanford HAI, 2026 |
| AI Index’in yayım tarihi | Nisan 2026 | Stanford HAI |
| Kaynağa dayalı özetleme oranlarıyla karşılaştırma | çok daha yüksek | Türetilmiş |
Aynı testte en iyi ile en kötü öncü model arasındaki 72 puanlık fark, kendi başına dikkat çekici: model seçimi bu görevde çok büyük önem taşıyor, her şeyin düşük tek haneli değerlerde toplandığı kaynağa dayalı özetlemede ise neredeyse hiç önemi yok. Kaynak: Stanford HAI 2026 AI Index Raporu.
4. Dalkavukluk Ayrı Bir Başarısızlık Türüdür
Stanford’un çerçevelemesini sıradan olgusal hatadan ayırmakta fayda var. Dalkavukluk kaynaklı halüsinasyon, kullanıcının belirttiği önerme yanlış olsa bile modelin ona uyum sağlaması anlamına gelir, bu da modelin bir şeyi bilmemesinden farklı bir mekanizmadır. Ayrıca, ölçülen oranın kısmen sorunun nasıl sorulduğuna bağlı olduğu, sadece modelin bildiklerine bağlı olmadığı anlamına gelir.
| Metrik | Değer | Kaynak |
|---|---|---|
| Başarısızlık türü | yanlış bir kullanıcı önermesine uyum sağlama | Stanford HAI, 2026 |
| Modeller arası oran aralığı | %22 ile %94 arası | Stanford HAI, 2026 |
| Değerlendirilen modeller | 26 öncü model | Stanford HAI, 2026 |
| Sıradan olgusal hatadan farkı | mekanizma farklı | Stanford HAI, 2026 |
| Prompt çerçevelemesine bağımlılık | yüksek | Türetilmiş |
| Raporlama bölümü | Responsible AI | Stanford HAI, 2026 |
| Raporlamaya ilişkin daha geniş AI Index bulgusu | sorumlu yapay zeka şeffaflığı yeteneklerin gerisinde kalıyor | Stanford HAI, 2026 |
| Değerlendirme için çıkarım | prompt tasarımı ölçümün bir parçasıdır | Türetilmiş |
Pratik sonuç, bu sistemleri devreye alan herkes için rahatsız edici: bir model tarafsız sorulduğunda son derece doğru olabilir ve bir kullanıcı önce yanlış bir şey öne sürdüğünde son derece güvenilmez olabilir. Devreye alma bağlamı, kurumsal yapay zeka benimseme istatistikleri yazımızda yer alıyor. Kaynak: Stanford HAI, 2026 AI Index’ten 12 çıkarım.
5. Bir Tedarikçi İddiasını Okumak
Pratik sonuç kısa bir kontrol listesi. Yüzde 1’in altında bir halüsinasyon iddiası neredeyse kesinlikle, modele kaynak materyalin verildiği kaynağa dayalı özetlemedir ve yardımsız hatırlama hakkında hiçbir şey söylemez. Doğru soru asla “halüsinasyon oranı nedir” değil, “hangi kıyaslamada, hangi görevde, hangi örneklem büyüklüğünde” olmalıdır.
| Metrik | Değer | Kaynak |
|---|---|---|
| Yüzde 1’in altındaki bir iddianın genellikle ölçtüğü şey | kaynağa dayalı özetleme | Vectara |
| Ölçmediği şey | yardımsız olgusal hatırlama | Türetilmiş |
| Aynı modelin daha zor bir kurum içi testteki oranı | %7,6 | Vectara |
| Açık hatırlama tarzı testlerdeki oran bandı | %22 ile %94 arası | Stanford HAI, 2026 |
| Vectara’nın mevcut test setindeki makaleler | 7.700’den fazla | Vectara |
| Stanford aralığının kapsadığı modeller | 26 | Stanford HAI, 2026 |
| Herhangi bir iddiaya sorulacak sorular | hangi kıyaslama, hangi görev, hangi örneklem | Türetilmiş |
| Kaynaklar arası karşılaştırmanın geçerli olup olmadığı | hayır, eşleşen bir metodoloji olmadan | Türetilmiş |
Retrieval’a dayalı devreye almalar, iyimser kıyaslamanın koşullarını yeniden ürettikleri için gerçekten iyimser uca daha yakın duruyor; bu, düşük rakamları kullanmanın tek meşru yolu. Tersi de geçerli: retrieval olmadan açık sorulara yanıt veren bir chatbot, kötümser banda göre değerlendirilmelidir, ve bu ürün için kaynağa dayalı rakamı belirtmek, bir abartıdan çok bir kategori hatasıdır. Arama ve retrieval bağlamı yapay zeka arama istatistikleri yazımızda, model manzarası bağlamı ise açık kaynak yapay zeka istatistikleri yazımızda yer alıyor. Kaynak: Gelişen sıralama tablolarıyla RAG’de LLM sadakatinin kıyaslanması.
Özet: Sayılarla Yapay Zeka Halüsinasyonu
| Metrik | Değer | Kaynak |
|---|---|---|
| En düşük yayımlanan oran | %0,7 | Vectara |
| En iyi performans bandı, kaynağa dayalı özetleme | yaklaşık %1,8 | Vectara |
| Aynı model FaithJudge altında | %7,6 | Vectara |
| Bu ölçümler arasındaki oran | yaklaşık 11x | Türetilmiş |
| 26 öncü model genelindeki aralık | %22 ile %94 arası | Stanford HAI |
| En iyi ile en kötü model arasındaki fark | 72 puan | Türetilmiş |
| Stanford HAI tarafından test edilen modeller | 26 | Stanford HAI |
| Stanford’un ölçtüğü başarısızlık türü | dalkavukluk kaynaklı halüsinasyon | Stanford HAI |
| Vectara’nın güncellenmiş test setindeki makaleler | 7.700’den fazla | Vectara |
| Güncellemenin tasarım amacı | daha zorlu | Vectara |
| Ölçülen oranlar üzerindeki etki | daha yüksek | Vectara |
| Kaynağa dayalı özetlemedeki görev | sağlanan kaynağa sadakat | Vectara |
| Açık hatırlama kıyaslamalarındaki görev | yardımsız olgu üretimi | Stanford HAI |
| Stanford HAI’deki raporlama bölümü | Responsible AI | Stanford HAI |
| AI Index yayım tarihi | Nisan 2026 | Stanford HAI |
| Yayımlanan tüm 2026 oranları arasındaki aralık | iki büyüklük mertebesinden fazla | Türetilmiş |
Metodoloji ve Kaynaklar
- Kaynağa dayalı özetleme oranları, FaithJudge karşılaştırması ve Kasım 2025 test seti güncellemesi, Vectara’nın herkese açık halüsinasyon sıralama tablosundan ve buna eşlik eden belgelerden geliyor (sıralama tablosu deposu, yeni nesil sıralama tablosu duyurusu).
- 26 öncü model genelindeki %22 ile %94 aralığı, dalkavukluk çerçevelemesi ve Responsible AI bölümü bağlamı, Nisan 2026’da yayımlanan Stanford HAI 2026 AI Index’ten geliyor (rapor, çıkarımlar, AI Index ana sayfası).
- Sıralama tablosu tasarımının ölçülen sadakati neden belirlediğine dair metodolojik arka plan, gelişen RAG kıyaslamaları üzerine yayımlanmış araştırmalardan geliyor (arXiv).
- Veri notu: bu derlemedeki rakamlar ortalanmamalı, karşılaştırılmamalı veya tek bir oran olarak sunulmamalıdır. Vectara, sağlanan bir belgeye sadakati ölçer; Stanford HAI farklı koşullar altında farklı bir başarısızlık türünü ölçer. Vectara’nın Kasım 2025 güncellemesi test zorluğunu kasıtlı olarak artırdı, bu nedenle bu değişiklikten önceki ve sonraki oranlar karşılaştırılabilir değildir ve görünen kötüleşme, modellerin kötüleşmesinden çok daha zor testi yansıtıyor olabilir. Modele özgü rakamlar yeni sürümler çıktıkça hızla değişir ve bir çeyrekten daha eski herhangi bir isimlendirilmiş model sonucu güncelliğini yitirmiş sayılmalıdır. Stanford’un dalkavukluk ölçümü, modellerin sabit bir özelliği değil deneysel tasarımın bir parçası olan prompt çerçevelemesine bağlıdır. Vectara, retrieval’a dayalı yapay zeka ürünlerinin ticari bir tedarikçisidir, bu da ona grounding’in iyi performans gösterdiği kıyaslamalarda bir çıkar sağlar. Türetilmiş olarak işaretlenen satırlar, yayımlanmış rakamlardan yapılan aritmetik işlemler veya doğrudan çıkarımlardır.
- Son güncelleme: 2 Ağustos 2026. Vectara sıralama tablosunu yeniledikçe ve Stanford HAI yeni AI Index baskıları yayımladıkça bu derlemeyi üç ayda bir güncelliyoruz.