Statystyki halucynacji AI (2026): Ponad 40 punktów danych o wskaźnikach, benchmarkach i przyczynach rozbieżności

Statystyki halucynacji AI 2026: wskaźniki rankingu Vectara, zakres 22-94% wg Stanford HAI, dlaczego benchmark zmienia wynik i jak czytać deklaracje dostawców.

Ten sam model można zmierzyć na poziomie 0,7% i 7,6% halucynacji w zależności od użytego benchmarku, a w 26 czołowych modelach Stanford HAI odnotował przedział od 22% do 94%. To rozproszenie jest najważniejszym pojedynczym faktem dotyczącym statystyk halucynacji AI w 2026 roku: konstrukcja benchmarku determinuje nagłówkową liczbę znacznie bardziej niż jakość modelu. Streszczenie osadzone w źródle, w którym modelowi przekazuje się tekst źródłowy, daje pochlebne wartości pojawiające się w materiałach dostawców. Testy typu open-recall, bliższe temu, jak ludzie faktycznie korzystają z tych systemów, dają wartości o rząd wielkości gorsze. Poniższe dane pochodzą z rankingu halucynacji Vectara oraz AI Index 2026 Stanford HAI.

TL;DR

  • Wskaźniki halucynacji podawane w 2026 roku wahają się od około 0,7% do 94% w zależności od benchmarku (Vectara, Stanford HAI)
  • Gemini-2.0-Flash-001 odnotował 0,7% przy streszczeniu osadzonym w źródle (Vectara)
  • Ten sam model osiąga 7,6% w benchmarku FaithJudge Vectara (Vectara)
  • To mniej więcej jedenastokrotna różnica dla jednego modelu (wyliczone)
  • Stanford HAI odnotował 22% do 94% w 26 czołowych modelach (Stanford HAI, 2026)
  • Te wartości mierzą halucynacje wywołane schlebianiem użytkownikowi (Stanford HAI, 2026)
  • Odświeżenie Vectara z listopada 2025 roku objęło ponad 7700 artykułów (Vectara)
  • Odświeżenie zaprojektowano tak, by było znacznie bardziej wymagające (Vectara)
  • Mierzone wskaźniki wzrosły bezpośrednio w wyniku trudniejszego testu (Vectara)
  • Najlepsze wiersze rankingu streszczeń osadzonych w źródle sięgają około 1,8% (Vectara)
  • Ustalenia Stanforda znajdują się w jego rozdziale Responsible AI (Stanford HAI, 2026)
  • Streszczenie osadzone w źródle dostarcza modelowi tekst źródłowy (Vectara)
  • Benchmarki open-recall wymagają, by model wytworzył fakty bez wsparcia (Stanford HAI)

1. Przedział jest samą statystyką

Każdy, kto podaje pojedynczy wskaźnik halucynacji, opisuje jeden benchmark, a nie samo zjawisko. Opublikowane w 2026 roku wskaźniki sięgają od około 0,7% na najlepszym końcu rankingu streszczeń osadzonych w źródle Vectara do przedziału 22% do 94% w 26 czołowych modelach testowanych przez Stanford HAI. To nie są konkurujące szacunki tej samej wielkości, lecz pomiary różnych zadań, a różnica między nimi przekracza dwa rzędy wielkości.

WskaźnikWartośćŹródło
Najniższy opublikowany wskaźnik, streszczenie osadzone w źródle0,7%Vectara
Najlepiej wypadające wiersze tego rankinguokoło 1,8%Vectara
Przedział w 26 czołowych modelach22% do 94%Stanford HAI, 2026
Model osiągający wynik 0,7%Gemini-2.0-Flash-001Vectara
Ten sam model w benchmarku FaithJudge7,6%Vectara
Stosunek między tymi dwoma pomiaramiokoło 11xWyliczone na podstawie danych Vectara
Rozpiętość między najniższym a najwyższym opublikowanym wskaźnikiemponad dwa rzędy wielkościWyliczone
Co determinuje tę liczbękonstrukcja benchmarkuVectara, Stanford HAI

Jedenastokrotna różnica dla jednego modelu w dwóch benchmarkach tej samej organizacji to najczystszy dostępny dowód na to, że te liczby opisują testy, a nie modele.

To ma praktyczną konsekwencję, która ginie w dyskusjach o benchmarkach. Jeśli wybierasz model do aplikacji opartej na wyszukiwaniu, w której system zawsze dostarcza dokumenty źródłowe, właściwe są wartości streszczenia osadzonego w źródle, a wskaźnik poniżej 2% to rozsądne oczekiwanie. Jeśli wybierasz model do odpowiadania na pytania z własnej wiedzy, te same wartości są aktywnie mylące, a pasmo od 22% do 94% jest bliższe temu, na co warto się przygotować. Większość rozczarowań w produkcji z tymi systemami wynika z tego, że zespół benchmarkował w jeden sposób, a wdrażał w drugi. Benchmark nie jest błędny; odpowiadał po prostu na inne pytanie niż to, które stawia wdrożenie. Źródło: ranking halucynacji Vectara.

2. Streszczenie osadzone w źródle: test optymistyczny

Benchmark dający wartości poniżej 1% robi coś konkretnego i wąskiego. Streszczenie osadzone w źródle podaje modelowi dokument źródłowy i sprawdza, czy powstałe streszczenie pozostaje mu wierne, co eliminuje potrzebę, by model cokolwiek wiedział. To autentyczny i użyteczny pomiar jednego trybu błędu, i to właśnie ten wskaźnik cytują dostawcy.

WskaźnikWartośćŹródło
Mierzone zadaniewierność streszczenia dostarczonemu tekstowi źródłowemuVectara
Najniższy odnotowany wskaźnik0,7%Vectara
Typowe pasmo najlepszych wynikówokoło 1,8%Vectara
Artykuły w odświeżeniu z listopada 2025 rokuponad 7700Vectara
Cel projektowy odświeżeniawiększy, solidniejszy, bardziej wymagającyVectara
Wpływ odświeżenia na mierzone wskaźnikiwyższyVectara
Czego zadanie nie testujeprzywoływania faktów bez wsparciaWyliczone
Dlaczego cytują je dostawcydaje najniższe liczbyWyliczone

Szczegół dotyczący odświeżenia ma większe znaczenie, niż się wydaje na pierwszy rzut oka: mierzone halucynacje wzrosły, bo test stał się trudniejszy, a nie dlatego, że modele się pogorszyły, co oznacza, że porównania rok do roku w tym rankingu są niewiarygodne w miejscu zmiany wersji. Źródło: Vectara o nowej generacji swojego rankingu halucynacji.

3. Open recall: test pesymistyczny

Benchmarki dające wartości dwucyfrowe i bliskie trzycyfrowym testują coś znacznie bliższego rzeczywistemu użyciu. Stanford HAI odnotował wskaźniki halucynacji od 22% do 94% w 26 czołowych modelach w benchmarku dokładności opisanym w rozdziale Responsible AI z 2026 roku. Gdy model musi dostarczyć fakty z własnych parametrów, a nie z dokumentu leżącego przed nim, wskaźnik błędów rośnie drastycznie.

WskaźnikWartośćŹródło
Najniższy wskaźnik wśród 26 modeli22%Stanford HAI, 2026
Najwyższy wskaźnik wśród 26 modeli94%Stanford HAI, 2026
Liczba przetestowanych czołowych modeli26Stanford HAI, 2026
Różnica między najlepszym a najgorszym modelem72 punktyWyliczone na podstawie danych Stanforda
Rozdział przedstawiający ustalenieResponsible AIStanford HAI, 2026
Mierzony tryb błęduhalucynacje wywołane schlebianiemStanford HAI, 2026
Data publikacji AI Indexkwiecień 2026Stanford HAI
Porównanie do wskaźników streszczenia osadzonego w źródleznacznie wyższeWyliczone

Różnica 72 punktów między najlepszym a najgorszym czołowym modelem w tym samym teście sama w sobie jest znacząca: wybór modelu ma ogromne znaczenie w tym zadaniu, a niemal żadnego przy streszczeniu osadzonym w źródle, gdzie wszystko skupia się w niskich wartościach jednocyfrowych. Źródło: raport Stanford HAI AI Index 2026.

4. Schlebianie jako odrębny tryb błędu

Warto oddzielić ujęcie Stanforda od zwykłej pomyłki faktograficznej. Halucynacja wywołana schlebianiem oznacza, że model dostosowuje się do założenia podanego przez użytkownika, nawet gdy jest ono fałszywe, co jest innym mechanizmem niż sytuacja, gdy model po prostu czegoś nie wie. Oznacza to również, że mierzony wskaźnik częściowo zależy od sposobu sformułowania pytania, a nie tylko od tego, co model wie.

WskaźnikWartośćŹródło
Tryb błędudostosowanie się do fałszywego założenia użytkownikaStanford HAI, 2026
Przedział wskaźników wśród modeli22% do 94%Stanford HAI, 2026
Ocenione modele26 czołowych modeliStanford HAI, 2026
Różnica względem zwykłej pomyłki faktograficznejinny mechanizmStanford HAI, 2026
Zależność od sformułowania pytaniawysokaWyliczone
Rozdział sprawozdawczyResponsible AIStanford HAI, 2026
Szersze ustalenie AI Index dotyczące raportowaniaujawnianie odpowiedzialnej AI pozostaje w tyle za możliwościamiStanford HAI, 2026
Implikacja dla ewaluacjiprojekt promptu jest częścią pomiaruWyliczone

Praktyczna konsekwencja jest niewygodna dla każdego, kto wdraża te systemy: model może być bardzo dokładny przy neutralnym pytaniu i wysoce zawodny, gdy użytkownik najpierw stwierdzi coś błędnego. Kontekst wdrożeniowy znajdziesz w naszych statystykach wdrażania AI w przedsiębiorstwach. Źródło: Stanford HAI, 12 wniosków z AI Index 2026.

5. Jak czytać deklarację dostawcy

Praktyczny wniosek to krótka lista kontrolna. Deklaracja wskaźnika halucynacji poniżej 1% niemal na pewno dotyczy streszczenia osadzonego w źródle, w którym modelowi przekazano materiał źródłowy, i nic nie mówi o przywoływaniu faktów bez wsparcia. Właściwe pytanie nigdy nie brzmi “jaki jest wskaźnik halucynacji”, lecz “w jakim benchmarku, przy jakim zadaniu, na jakiej próbie”.

WskaźnikWartośćŹródło
Co zwykle mierzy deklaracja poniżej 1%streszczenie osadzone w źródleVectara
Czego nie mierzyprzywoływania faktów bez wsparciaWyliczone
Wskaźnik tego samego modelu w trudniejszym teście wewnętrznym7,6%Vectara
Pasmo wskaźników w testach typu open-recall22% do 94%Stanford HAI, 2026
Artykuły w obecnym zbiorze testowym Vectaraponad 7700Vectara
Modele objęte przedziałem Stanforda26Stanford HAI, 2026
Pytania do zadania przy każdej deklaracjiktóry benchmark, jakie zadanie, jaka próbaWyliczone
Czy porównanie między źródłami jest zasadnenie, bez zgodnej metodologiiWyliczone

Wdrożenia oparte na wyszukiwaniu rzeczywiście plasują się bliżej optymistycznego końca, ponieważ odtwarzają warunki optymistycznego benchmarku, co jest jedynym uzasadnionym sposobem wykorzystania niskich wartości. Odwrotność również obowiązuje: chatbot odpowiadający na otwarte pytania bez wyszukiwania powinien być oceniany względem pesymistycznego pasma, a przywoływanie liczby ze streszczenia osadzonego w źródle dla takiego produktu to błąd kategorii, a nie przesada. Kontekst wyszukiwania znajdziesz w naszych statystykach wyszukiwania AI, a kontekst krajobrazu modeli w naszych statystykach otwartoźródłowej AI. Źródło: Benchmarking wierności LLM w RAG za pomocą ewoluujących rankingów.

Podsumowanie: halucynacje AI w liczbach

WskaźnikWartośćŹródło
Najniższy opublikowany wskaźnik0,7%Vectara
Pasmo najlepszych wyników, streszczenie osadzone w źródleokoło 1,8%Vectara
Ten sam model w benchmarku FaithJudge7,6%Vectara
Stosunek między tymi pomiaramiokoło 11xWyliczone
Przedział w 26 czołowych modelach22% do 94%Stanford HAI
Różnica między najlepszym a najgorszym modelem72 punktyWyliczone
Modele testowane przez Stanford HAI26Stanford HAI
Tryb błędu zmierzony przez Stanfordhalucynacje wywołane schlebianiemStanford HAI
Artykuły w odświeżonym zbiorze testowym Vectaraponad 7700Vectara
Cel projektowy odświeżeniabardziej wymagającyVectara
Wpływ na mierzone wskaźnikiwyższyVectara
Zadanie w streszczeniu osadzonym w źródlewierność wobec dostarczonego źródłaVectara
Zadanie w benchmarkach open-recallwytwarzanie faktów bez wsparciaStanford HAI
Rozdział sprawozdawczy w Stanford HAIResponsible AIStanford HAI
Data publikacji AI Indexkwiecień 2026Stanford HAI
Rozpiętość wszystkich opublikowanych wskaźników z 2026 rokuponad dwa rzędy wielkościWyliczone

Metodologia i źródła

  • Wskaźniki streszczenia osadzonego w źródle, porównanie FaithJudge oraz odświeżenie zbioru testowego z listopada 2025 roku pochodzą z publicznego rankingu halucynacji Vectara i towarzyszącej mu dokumentacji (repozytorium rankingu, zapowiedź nowej generacji rankingu).
  • Przedział od 22% do 94% w 26 czołowych modelach, ujęcie schlebiania oraz kontekst rozdziału Responsible AI pochodzą z AI Index 2026 Stanford HAI, opublikowanego w kwietniu 2026 roku (raport, wnioski, strona główna AI Index).
  • Tło metodologiczne dotyczące tego, dlaczego konstrukcja rankingu determinuje mierzoną wierność, pochodzi z opublikowanych badań nad ewoluującymi benchmarkami RAG (arXiv).
  • Uwaga dotycząca danych: liczb w tym zestawieniu nie wolno uśredniać, porównywać ani przedstawiać jako pojedynczego wskaźnika. Vectara mierzy wierność wobec dostarczonego dokumentu; Stanford HAI mierzy inny tryb błędu w innych warunkach. Odświeżenie Vectara z listopada 2025 roku celowo zwiększyło trudność testu, więc wskaźniki sprzed i po tej zmianie nie są porównywalne, a pozorne pogorszenie może odzwierciedlać trudniejszy test, a nie gorsze modele. Wyniki dotyczące konkretnych modeli zmieniają się szybko wraz z pojawianiem się nowych wersji, a każdy nazwany wynik modelu starszy niż kwartał należy uznać za nieaktualny. Pomiar schlebiania Stanforda zależy od sformułowania promptu, co jest częścią projektu eksperymentu, a nie stałą właściwością modeli. Vectara jest komercyjnym dostawcą produktów AI opartych na wyszukiwaniu, co daje jej interes w benchmarkach, w których grounding wypada dobrze. Wiersze oznaczone jako wyliczone to działania arytmetyczne lub bezpośrednie wnioski z opublikowanych danych.
  • Ostatnia aktualizacja: 2 sierpnia 2026 roku. Aktualizujemy to zestawienie co kwartał, gdy Vectara odświeża swój ranking, a Stanford HAI publikuje nowe edycje AI Index.

Wypróbuj VoxBooster — 3 dni za darmo.

Klonowanie głosu w czasie rzeczywistym, soundboard i efekty — wszędzie, gdzie rozmawiasz.

  • Bez karty
  • ~30ms opóźnienia
  • Discord · Teams · OBS
Wypróbuj 3 dni za darmo