Yapay Zeka Halüsinasyon İstatistikleri (2026): Oranlar, Kıyaslamalar ve Neden Çeliştikleri Hakkında 40'tan Fazla Veri Noktası

Yapay zeka halüsinasyon istatistikleri 2026: Vectara oranları, Stanford HAI'nin yüzde 22-94 aralığı, benchmark tasarımı ve tedarikçi iddialarını okuma rehberi.

Aynı model, hangi kıyaslamayı çalıştırdığınıza bağlı olarak yüzde 0,7 ve yüzde 7,6 halüsinasyon seviyesinde ölçülebilir, ve Stanford HAI 26 öncü model genelinde yüzde 22 ile 94 arasında bir aralık kaydetti. Bu fark, 2026’da yapay zeka halüsinasyonu istatistikleri hakkındaki en önemli tek gerçek: benchmark tasarımı, manşet sayıyı model kalitesinden çok daha fazla belirliyor. Modele kaynak metnin verildiği kaynağa dayalı özetleme, tedarikçi materyallerinde görünen gurur okşayıcı rakamları üretiyor. İnsanların bu sistemleri gerçekte nasıl kullandığına daha yakın olan açık hatırlama testleri, bir büyüklük mertebesi daha kötü rakamlar üretiyor. Aşağıdaki rakamlar Vectara’nın halüsinasyon sıralama tablosundan ve Stanford HAI 2026 AI Index’inden geliyor.

TL;DR

  • 2026’da bildirilen halüsinasyon oranları, kıyaslamaya bağlı olarak yaklaşık yüzde 0,7 ile yüzde 94 arasında değişiyor (Vectara, Stanford HAI)
  • Gemini-2.0-Flash-001, kaynağa dayalı özetlemede yüzde 0,7 kaydetti (Vectara)
  • Aynı model, Vectara’nın FaithJudge kıyaslamasında yüzde 7,6 alıyor (Vectara)
  • Bu, tek bir model için yaklaşık on bir kat fark demek (türetilmiş)
  • Stanford HAI, 26 öncü model genelinde yüzde 22 ile 94 kaydetti (Stanford HAI, 2026)
  • Bu rakamlar dalkavukluk kaynaklı halüsinasyonu ölçüyor (Stanford HAI, 2026)
  • Vectara’nın Kasım 2025 güncellemesi 7.700’den fazla makale kullandı (Vectara)
  • Güncelleme önemli ölçüde daha zorlu olacak şekilde tasarlandı (Vectara)
  • Ölçülen oranlar, daha zor testin doğrudan sonucu olarak yükseldi (Vectara)
  • Kaynağa dayalı özetleme sıralama tablosunun en iyi satırları yaklaşık yüzde 1,8’de duruyor (Vectara)
  • Stanford’un bulguları Responsible AI bölümünde yer alıyor (Stanford HAI, 2026)
  • Kaynağa dayalı özetleme, modele kaynak metni sağlıyor (Vectara)
  • Açık hatırlama kıyaslamaları, modelin gerçekleri yardımsız üretmesini gerektiriyor (Stanford HAI)

1. Aralık, İstatistiğin Kendisidir

Tek bir halüsinasyon oranı belirten herkes, olguyu değil, bir kıyaslamayı tanımlıyor. 2026’da yayımlanan oranlar, Vectara’nın kaynağa dayalı özetleme sıralama tablosunun en iyi ucunda yaklaşık yüzde 0,7’den, Stanford HAI’nin test ettiği 26 öncü model genelinde yüzde 22 ile 94 arasına kadar uzanıyor. Bunlar aynı büyüklüğün rakip tahminleri değil, farklı görevlerin ölçümleri, ve aralarındaki fark iki büyüklük mertebesinden fazla.

MetrikDeğerKaynak
En düşük yayımlanan oran, kaynağa dayalı özetleme%0,7Vectara
Bu sıralama tablosundaki en iyi performans gösteren satırlaryaklaşık %1,8Vectara
26 öncü model genelindeki aralık%22 ile %94 arasıStanford HAI, 2026
%0,7 rakamını elde eden modelGemini-2.0-Flash-001Vectara
Aynı model FaithJudge altında%7,6Vectara
Bu iki ölçüm arasındaki oranyaklaşık 11xVectara rakamlarından türetilmiş
En düşük ile en yüksek yayımlanan oran arasındaki farkiki büyüklük mertebesinden fazlaTüretilmiş
Sayıyı neyin belirlediğibenchmark tasarımıVectara, Stanford HAI

Aynı kuruluşun iki kıyaslamasında tek bir model için görülen on bir kat fark, bu rakamların modelleri değil testleri tanımladığının elde mevcut en net kanıtı.

Bunun, kıyaslama tartışmasında gözden kaçan pratik bir sonucu var. Sistemin her zaman kaynak belgeleri sağladığı, retrieval’a dayalı bir uygulama için model seçiyorsanız, kaynağa dayalı özetleme rakamları ilgilidir ve yüzde 2’nin altında bir oran makul bir beklentidir. Kendi bilgisinden sorulara cevap verecek bir model seçiyorsanız, aynı rakamlar aktif olarak yanıltıcıdır ve yüzde 22 ile 94 aralığı planlamanız gereken şeye daha yakındır. Bu sistemlerle üretimde yaşanan hayal kırıklığının çoğu, bir ekibin bir şekilde kıyaslama yapıp başka şekilde devreye almasından kaynaklanır. Kıyaslama yanlış değildir; sadece devreye almanın sorduğundan farklı bir soruyu yanıtlıyordu. Kaynak: Vectara halüsinasyon sıralama tablosu.

2. Kaynağa Dayalı Özetleme: İyimser Test

Yüzde 1’in altında rakamlar üreten kıyaslama, spesifik ve dar bir şey yapıyor. Kaynağa dayalı özetleme, modele bir kaynak belge verir ve ortaya çıkan özetin ona sadık kalıp kalmadığını kontrol eder, bu da modelin herhangi bir şey bilmesi ihtiyacını ortadan kaldırır. Bu, bir başarısızlık türünün gerçek ve faydalı bir ölçümüdür, ve tedarikçilerin atıfta bulunduğu ölçümdür.

MetrikDeğerKaynak
Ölçülen görevözetin sağlanan kaynak metne sadakatiVectara
En düşük kaydedilen oran%0,7Vectara
Tipik en iyi performans bandıyaklaşık %1,8Vectara
Kasım 2025 güncellemesindeki makaleler7.700’den fazlaVectara
Güncellemenin tasarım amacıdaha büyük, daha sağlam, daha zorluVectara
Güncellemenin ölçülen oranlar üzerindeki etkisidaha yüksekVectara
Görevin test etmediği şeyyardımsız olgusal hatırlamaTüretilmiş
Tedarikçilerin buna atıfta bulunma nedenien düşük sayıları üretmesiTüretilmiş

Güncelleme detayı ilk göründüğünden daha önemli: ölçülen halüsinasyon, modeller kötüleştiği için değil, test zorlaştığı için arttı; bu da bu sıralama tablosunda yıldan yıla karşılaştırmaların sürüm değişikliği boyunca güvenilmez olduğu anlamına geliyor. Kaynak: Vectara’nın halüsinasyon sıralama tablosunun yeni nesli hakkında.

3. Açık Hatırlama: Kötümser Test

İki haneli ve üç haneliye yakın rakamlar üreten kıyaslamalar, gerçek kullanıma çok daha yakın bir şeyi test ediyor. Stanford HAI, 2026 Responsible AI bölümünde bildirilen bir doğruluk kıyaslamasında 26 öncü model genelinde yüzde 22 ile 94 arasında halüsinasyon oranları kaydetti. Bir model, önündeki bir belgeden değil de kendi parametrelerinden gerçek sağlamak zorunda kaldığında, hata oranı dramatik şekilde yükseliyor.

MetrikDeğerKaynak
26 model genelindeki en düşük oran%22Stanford HAI, 2026
26 model genelindeki en yüksek oran%94Stanford HAI, 2026
Test edilen öncü model sayısı26Stanford HAI, 2026
En iyi ile en kötü model arasındaki fark72 puanStanford rakamlarından türetilmiş
Bulguyu bildiren bölümResponsible AIStanford HAI, 2026
Ölçülen başarısızlık türüdalkavukluk kaynaklı halüsinasyonStanford HAI, 2026
AI Index’in yayım tarihiNisan 2026Stanford HAI
Kaynağa dayalı özetleme oranlarıyla karşılaştırmaçok daha yüksekTüretilmiş

Aynı testte en iyi ile en kötü öncü model arasındaki 72 puanlık fark, kendi başına dikkat çekici: model seçimi bu görevde çok büyük önem taşıyor, her şeyin düşük tek haneli değerlerde toplandığı kaynağa dayalı özetlemede ise neredeyse hiç önemi yok. Kaynak: Stanford HAI 2026 AI Index Raporu.

4. Dalkavukluk Ayrı Bir Başarısızlık Türüdür

Stanford’un çerçevelemesini sıradan olgusal hatadan ayırmakta fayda var. Dalkavukluk kaynaklı halüsinasyon, kullanıcının belirttiği önerme yanlış olsa bile modelin ona uyum sağlaması anlamına gelir, bu da modelin bir şeyi bilmemesinden farklı bir mekanizmadır. Ayrıca, ölçülen oranın kısmen sorunun nasıl sorulduğuna bağlı olduğu, sadece modelin bildiklerine bağlı olmadığı anlamına gelir.

MetrikDeğerKaynak
Başarısızlık türüyanlış bir kullanıcı önermesine uyum sağlamaStanford HAI, 2026
Modeller arası oran aralığı%22 ile %94 arasıStanford HAI, 2026
Değerlendirilen modeller26 öncü modelStanford HAI, 2026
Sıradan olgusal hatadan farkımekanizma farklıStanford HAI, 2026
Prompt çerçevelemesine bağımlılıkyüksekTüretilmiş
Raporlama bölümüResponsible AIStanford HAI, 2026
Raporlamaya ilişkin daha geniş AI Index bulgususorumlu yapay zeka şeffaflığı yeteneklerin gerisinde kalıyorStanford HAI, 2026
Değerlendirme için çıkarımprompt tasarımı ölçümün bir parçasıdırTüretilmiş

Pratik sonuç, bu sistemleri devreye alan herkes için rahatsız edici: bir model tarafsız sorulduğunda son derece doğru olabilir ve bir kullanıcı önce yanlış bir şey öne sürdüğünde son derece güvenilmez olabilir. Devreye alma bağlamı, kurumsal yapay zeka benimseme istatistikleri yazımızda yer alıyor. Kaynak: Stanford HAI, 2026 AI Index’ten 12 çıkarım.

5. Bir Tedarikçi İddiasını Okumak

Pratik sonuç kısa bir kontrol listesi. Yüzde 1’in altında bir halüsinasyon iddiası neredeyse kesinlikle, modele kaynak materyalin verildiği kaynağa dayalı özetlemedir ve yardımsız hatırlama hakkında hiçbir şey söylemez. Doğru soru asla “halüsinasyon oranı nedir” değil, “hangi kıyaslamada, hangi görevde, hangi örneklem büyüklüğünde” olmalıdır.

MetrikDeğerKaynak
Yüzde 1’in altındaki bir iddianın genellikle ölçtüğü şeykaynağa dayalı özetlemeVectara
Ölçmediği şeyyardımsız olgusal hatırlamaTüretilmiş
Aynı modelin daha zor bir kurum içi testteki oranı%7,6Vectara
Açık hatırlama tarzı testlerdeki oran bandı%22 ile %94 arasıStanford HAI, 2026
Vectara’nın mevcut test setindeki makaleler7.700’den fazlaVectara
Stanford aralığının kapsadığı modeller26Stanford HAI, 2026
Herhangi bir iddiaya sorulacak sorularhangi kıyaslama, hangi görev, hangi örneklemTüretilmiş
Kaynaklar arası karşılaştırmanın geçerli olup olmadığıhayır, eşleşen bir metodoloji olmadanTüretilmiş

Retrieval’a dayalı devreye almalar, iyimser kıyaslamanın koşullarını yeniden ürettikleri için gerçekten iyimser uca daha yakın duruyor; bu, düşük rakamları kullanmanın tek meşru yolu. Tersi de geçerli: retrieval olmadan açık sorulara yanıt veren bir chatbot, kötümser banda göre değerlendirilmelidir, ve bu ürün için kaynağa dayalı rakamı belirtmek, bir abartıdan çok bir kategori hatasıdır. Arama ve retrieval bağlamı yapay zeka arama istatistikleri yazımızda, model manzarası bağlamı ise açık kaynak yapay zeka istatistikleri yazımızda yer alıyor. Kaynak: Gelişen sıralama tablolarıyla RAG’de LLM sadakatinin kıyaslanması.

Özet: Sayılarla Yapay Zeka Halüsinasyonu

MetrikDeğerKaynak
En düşük yayımlanan oran%0,7Vectara
En iyi performans bandı, kaynağa dayalı özetlemeyaklaşık %1,8Vectara
Aynı model FaithJudge altında%7,6Vectara
Bu ölçümler arasındaki oranyaklaşık 11xTüretilmiş
26 öncü model genelindeki aralık%22 ile %94 arasıStanford HAI
En iyi ile en kötü model arasındaki fark72 puanTüretilmiş
Stanford HAI tarafından test edilen modeller26Stanford HAI
Stanford’un ölçtüğü başarısızlık türüdalkavukluk kaynaklı halüsinasyonStanford HAI
Vectara’nın güncellenmiş test setindeki makaleler7.700’den fazlaVectara
Güncellemenin tasarım amacıdaha zorluVectara
Ölçülen oranlar üzerindeki etkidaha yüksekVectara
Kaynağa dayalı özetlemedeki görevsağlanan kaynağa sadakatVectara
Açık hatırlama kıyaslamalarındaki görevyardımsız olgu üretimiStanford HAI
Stanford HAI’deki raporlama bölümüResponsible AIStanford HAI
AI Index yayım tarihiNisan 2026Stanford HAI
Yayımlanan tüm 2026 oranları arasındaki aralıkiki büyüklük mertebesinden fazlaTüretilmiş

Metodoloji ve Kaynaklar

  • Kaynağa dayalı özetleme oranları, FaithJudge karşılaştırması ve Kasım 2025 test seti güncellemesi, Vectara’nın herkese açık halüsinasyon sıralama tablosundan ve buna eşlik eden belgelerden geliyor (sıralama tablosu deposu, yeni nesil sıralama tablosu duyurusu).
  • 26 öncü model genelindeki %22 ile %94 aralığı, dalkavukluk çerçevelemesi ve Responsible AI bölümü bağlamı, Nisan 2026’da yayımlanan Stanford HAI 2026 AI Index’ten geliyor (rapor, çıkarımlar, AI Index ana sayfası).
  • Sıralama tablosu tasarımının ölçülen sadakati neden belirlediğine dair metodolojik arka plan, gelişen RAG kıyaslamaları üzerine yayımlanmış araştırmalardan geliyor (arXiv).
  • Veri notu: bu derlemedeki rakamlar ortalanmamalı, karşılaştırılmamalı veya tek bir oran olarak sunulmamalıdır. Vectara, sağlanan bir belgeye sadakati ölçer; Stanford HAI farklı koşullar altında farklı bir başarısızlık türünü ölçer. Vectara’nın Kasım 2025 güncellemesi test zorluğunu kasıtlı olarak artırdı, bu nedenle bu değişiklikten önceki ve sonraki oranlar karşılaştırılabilir değildir ve görünen kötüleşme, modellerin kötüleşmesinden çok daha zor testi yansıtıyor olabilir. Modele özgü rakamlar yeni sürümler çıktıkça hızla değişir ve bir çeyrekten daha eski herhangi bir isimlendirilmiş model sonucu güncelliğini yitirmiş sayılmalıdır. Stanford’un dalkavukluk ölçümü, modellerin sabit bir özelliği değil deneysel tasarımın bir parçası olan prompt çerçevelemesine bağlıdır. Vectara, retrieval’a dayalı yapay zeka ürünlerinin ticari bir tedarikçisidir, bu da ona grounding’in iyi performans gösterdiği kıyaslamalarda bir çıkar sağlar. Türetilmiş olarak işaretlenen satırlar, yayımlanmış rakamlardan yapılan aritmetik işlemler veya doğrudan çıkarımlardır.
  • Son güncelleme: 2 Ağustos 2026. Vectara sıralama tablosunu yeniledikçe ve Stanford HAI yeni AI Index baskıları yayımladıkça bu derlemeyi üç ayda bir güncelliyoruz.

VoxBooster'ı dene — 3 günlük ücretsiz deneme.

Gerçek zamanlı ses klonlama, ses tahtası ve efektler — zaten konuştuğun her yerde.

  • Kart gerekmez
  • ~30ms gecikme
  • Discord · Teams · OBS
3 gün ücretsiz dene