Ten sam model można zmierzyć na poziomie 0,7% i 7,6% halucynacji w zależności od użytego benchmarku, a w 26 czołowych modelach Stanford HAI odnotował przedział od 22% do 94%. To rozproszenie jest najważniejszym pojedynczym faktem dotyczącym statystyk halucynacji AI w 2026 roku: konstrukcja benchmarku determinuje nagłówkową liczbę znacznie bardziej niż jakość modelu. Streszczenie osadzone w źródle, w którym modelowi przekazuje się tekst źródłowy, daje pochlebne wartości pojawiające się w materiałach dostawców. Testy typu open-recall, bliższe temu, jak ludzie faktycznie korzystają z tych systemów, dają wartości o rząd wielkości gorsze. Poniższe dane pochodzą z rankingu halucynacji Vectara oraz AI Index 2026 Stanford HAI.
TL;DR
- Wskaźniki halucynacji podawane w 2026 roku wahają się od około 0,7% do 94% w zależności od benchmarku (Vectara, Stanford HAI)
- Gemini-2.0-Flash-001 odnotował 0,7% przy streszczeniu osadzonym w źródle (Vectara)
- Ten sam model osiąga 7,6% w benchmarku FaithJudge Vectara (Vectara)
- To mniej więcej jedenastokrotna różnica dla jednego modelu (wyliczone)
- Stanford HAI odnotował 22% do 94% w 26 czołowych modelach (Stanford HAI, 2026)
- Te wartości mierzą halucynacje wywołane schlebianiem użytkownikowi (Stanford HAI, 2026)
- Odświeżenie Vectara z listopada 2025 roku objęło ponad 7700 artykułów (Vectara)
- Odświeżenie zaprojektowano tak, by było znacznie bardziej wymagające (Vectara)
- Mierzone wskaźniki wzrosły bezpośrednio w wyniku trudniejszego testu (Vectara)
- Najlepsze wiersze rankingu streszczeń osadzonych w źródle sięgają około 1,8% (Vectara)
- Ustalenia Stanforda znajdują się w jego rozdziale Responsible AI (Stanford HAI, 2026)
- Streszczenie osadzone w źródle dostarcza modelowi tekst źródłowy (Vectara)
- Benchmarki open-recall wymagają, by model wytworzył fakty bez wsparcia (Stanford HAI)
1. Przedział jest samą statystyką
Każdy, kto podaje pojedynczy wskaźnik halucynacji, opisuje jeden benchmark, a nie samo zjawisko. Opublikowane w 2026 roku wskaźniki sięgają od około 0,7% na najlepszym końcu rankingu streszczeń osadzonych w źródle Vectara do przedziału 22% do 94% w 26 czołowych modelach testowanych przez Stanford HAI. To nie są konkurujące szacunki tej samej wielkości, lecz pomiary różnych zadań, a różnica między nimi przekracza dwa rzędy wielkości.
| Wskaźnik | Wartość | Źródło |
|---|---|---|
| Najniższy opublikowany wskaźnik, streszczenie osadzone w źródle | 0,7% | Vectara |
| Najlepiej wypadające wiersze tego rankingu | około 1,8% | Vectara |
| Przedział w 26 czołowych modelach | 22% do 94% | Stanford HAI, 2026 |
| Model osiągający wynik 0,7% | Gemini-2.0-Flash-001 | Vectara |
| Ten sam model w benchmarku FaithJudge | 7,6% | Vectara |
| Stosunek między tymi dwoma pomiarami | około 11x | Wyliczone na podstawie danych Vectara |
| Rozpiętość między najniższym a najwyższym opublikowanym wskaźnikiem | ponad dwa rzędy wielkości | Wyliczone |
| Co determinuje tę liczbę | konstrukcja benchmarku | Vectara, Stanford HAI |
Jedenastokrotna różnica dla jednego modelu w dwóch benchmarkach tej samej organizacji to najczystszy dostępny dowód na to, że te liczby opisują testy, a nie modele.
To ma praktyczną konsekwencję, która ginie w dyskusjach o benchmarkach. Jeśli wybierasz model do aplikacji opartej na wyszukiwaniu, w której system zawsze dostarcza dokumenty źródłowe, właściwe są wartości streszczenia osadzonego w źródle, a wskaźnik poniżej 2% to rozsądne oczekiwanie. Jeśli wybierasz model do odpowiadania na pytania z własnej wiedzy, te same wartości są aktywnie mylące, a pasmo od 22% do 94% jest bliższe temu, na co warto się przygotować. Większość rozczarowań w produkcji z tymi systemami wynika z tego, że zespół benchmarkował w jeden sposób, a wdrażał w drugi. Benchmark nie jest błędny; odpowiadał po prostu na inne pytanie niż to, które stawia wdrożenie. Źródło: ranking halucynacji Vectara.
2. Streszczenie osadzone w źródle: test optymistyczny
Benchmark dający wartości poniżej 1% robi coś konkretnego i wąskiego. Streszczenie osadzone w źródle podaje modelowi dokument źródłowy i sprawdza, czy powstałe streszczenie pozostaje mu wierne, co eliminuje potrzebę, by model cokolwiek wiedział. To autentyczny i użyteczny pomiar jednego trybu błędu, i to właśnie ten wskaźnik cytują dostawcy.
| Wskaźnik | Wartość | Źródło |
|---|---|---|
| Mierzone zadanie | wierność streszczenia dostarczonemu tekstowi źródłowemu | Vectara |
| Najniższy odnotowany wskaźnik | 0,7% | Vectara |
| Typowe pasmo najlepszych wyników | około 1,8% | Vectara |
| Artykuły w odświeżeniu z listopada 2025 roku | ponad 7700 | Vectara |
| Cel projektowy odświeżenia | większy, solidniejszy, bardziej wymagający | Vectara |
| Wpływ odświeżenia na mierzone wskaźniki | wyższy | Vectara |
| Czego zadanie nie testuje | przywoływania faktów bez wsparcia | Wyliczone |
| Dlaczego cytują je dostawcy | daje najniższe liczby | Wyliczone |
Szczegół dotyczący odświeżenia ma większe znaczenie, niż się wydaje na pierwszy rzut oka: mierzone halucynacje wzrosły, bo test stał się trudniejszy, a nie dlatego, że modele się pogorszyły, co oznacza, że porównania rok do roku w tym rankingu są niewiarygodne w miejscu zmiany wersji. Źródło: Vectara o nowej generacji swojego rankingu halucynacji.
3. Open recall: test pesymistyczny
Benchmarki dające wartości dwucyfrowe i bliskie trzycyfrowym testują coś znacznie bliższego rzeczywistemu użyciu. Stanford HAI odnotował wskaźniki halucynacji od 22% do 94% w 26 czołowych modelach w benchmarku dokładności opisanym w rozdziale Responsible AI z 2026 roku. Gdy model musi dostarczyć fakty z własnych parametrów, a nie z dokumentu leżącego przed nim, wskaźnik błędów rośnie drastycznie.
| Wskaźnik | Wartość | Źródło |
|---|---|---|
| Najniższy wskaźnik wśród 26 modeli | 22% | Stanford HAI, 2026 |
| Najwyższy wskaźnik wśród 26 modeli | 94% | Stanford HAI, 2026 |
| Liczba przetestowanych czołowych modeli | 26 | Stanford HAI, 2026 |
| Różnica między najlepszym a najgorszym modelem | 72 punkty | Wyliczone na podstawie danych Stanforda |
| Rozdział przedstawiający ustalenie | Responsible AI | Stanford HAI, 2026 |
| Mierzony tryb błędu | halucynacje wywołane schlebianiem | Stanford HAI, 2026 |
| Data publikacji AI Index | kwiecień 2026 | Stanford HAI |
| Porównanie do wskaźników streszczenia osadzonego w źródle | znacznie wyższe | Wyliczone |
Różnica 72 punktów między najlepszym a najgorszym czołowym modelem w tym samym teście sama w sobie jest znacząca: wybór modelu ma ogromne znaczenie w tym zadaniu, a niemal żadnego przy streszczeniu osadzonym w źródle, gdzie wszystko skupia się w niskich wartościach jednocyfrowych. Źródło: raport Stanford HAI AI Index 2026.
4. Schlebianie jako odrębny tryb błędu
Warto oddzielić ujęcie Stanforda od zwykłej pomyłki faktograficznej. Halucynacja wywołana schlebianiem oznacza, że model dostosowuje się do założenia podanego przez użytkownika, nawet gdy jest ono fałszywe, co jest innym mechanizmem niż sytuacja, gdy model po prostu czegoś nie wie. Oznacza to również, że mierzony wskaźnik częściowo zależy od sposobu sformułowania pytania, a nie tylko od tego, co model wie.
| Wskaźnik | Wartość | Źródło |
|---|---|---|
| Tryb błędu | dostosowanie się do fałszywego założenia użytkownika | Stanford HAI, 2026 |
| Przedział wskaźników wśród modeli | 22% do 94% | Stanford HAI, 2026 |
| Ocenione modele | 26 czołowych modeli | Stanford HAI, 2026 |
| Różnica względem zwykłej pomyłki faktograficznej | inny mechanizm | Stanford HAI, 2026 |
| Zależność od sformułowania pytania | wysoka | Wyliczone |
| Rozdział sprawozdawczy | Responsible AI | Stanford HAI, 2026 |
| Szersze ustalenie AI Index dotyczące raportowania | ujawnianie odpowiedzialnej AI pozostaje w tyle za możliwościami | Stanford HAI, 2026 |
| Implikacja dla ewaluacji | projekt promptu jest częścią pomiaru | Wyliczone |
Praktyczna konsekwencja jest niewygodna dla każdego, kto wdraża te systemy: model może być bardzo dokładny przy neutralnym pytaniu i wysoce zawodny, gdy użytkownik najpierw stwierdzi coś błędnego. Kontekst wdrożeniowy znajdziesz w naszych statystykach wdrażania AI w przedsiębiorstwach. Źródło: Stanford HAI, 12 wniosków z AI Index 2026.
5. Jak czytać deklarację dostawcy
Praktyczny wniosek to krótka lista kontrolna. Deklaracja wskaźnika halucynacji poniżej 1% niemal na pewno dotyczy streszczenia osadzonego w źródle, w którym modelowi przekazano materiał źródłowy, i nic nie mówi o przywoływaniu faktów bez wsparcia. Właściwe pytanie nigdy nie brzmi “jaki jest wskaźnik halucynacji”, lecz “w jakim benchmarku, przy jakim zadaniu, na jakiej próbie”.
| Wskaźnik | Wartość | Źródło |
|---|---|---|
| Co zwykle mierzy deklaracja poniżej 1% | streszczenie osadzone w źródle | Vectara |
| Czego nie mierzy | przywoływania faktów bez wsparcia | Wyliczone |
| Wskaźnik tego samego modelu w trudniejszym teście wewnętrznym | 7,6% | Vectara |
| Pasmo wskaźników w testach typu open-recall | 22% do 94% | Stanford HAI, 2026 |
| Artykuły w obecnym zbiorze testowym Vectara | ponad 7700 | Vectara |
| Modele objęte przedziałem Stanforda | 26 | Stanford HAI, 2026 |
| Pytania do zadania przy każdej deklaracji | który benchmark, jakie zadanie, jaka próba | Wyliczone |
| Czy porównanie między źródłami jest zasadne | nie, bez zgodnej metodologii | Wyliczone |
Wdrożenia oparte na wyszukiwaniu rzeczywiście plasują się bliżej optymistycznego końca, ponieważ odtwarzają warunki optymistycznego benchmarku, co jest jedynym uzasadnionym sposobem wykorzystania niskich wartości. Odwrotność również obowiązuje: chatbot odpowiadający na otwarte pytania bez wyszukiwania powinien być oceniany względem pesymistycznego pasma, a przywoływanie liczby ze streszczenia osadzonego w źródle dla takiego produktu to błąd kategorii, a nie przesada. Kontekst wyszukiwania znajdziesz w naszych statystykach wyszukiwania AI, a kontekst krajobrazu modeli w naszych statystykach otwartoźródłowej AI. Źródło: Benchmarking wierności LLM w RAG za pomocą ewoluujących rankingów.
Podsumowanie: halucynacje AI w liczbach
| Wskaźnik | Wartość | Źródło |
|---|---|---|
| Najniższy opublikowany wskaźnik | 0,7% | Vectara |
| Pasmo najlepszych wyników, streszczenie osadzone w źródle | około 1,8% | Vectara |
| Ten sam model w benchmarku FaithJudge | 7,6% | Vectara |
| Stosunek między tymi pomiarami | około 11x | Wyliczone |
| Przedział w 26 czołowych modelach | 22% do 94% | Stanford HAI |
| Różnica między najlepszym a najgorszym modelem | 72 punkty | Wyliczone |
| Modele testowane przez Stanford HAI | 26 | Stanford HAI |
| Tryb błędu zmierzony przez Stanford | halucynacje wywołane schlebianiem | Stanford HAI |
| Artykuły w odświeżonym zbiorze testowym Vectara | ponad 7700 | Vectara |
| Cel projektowy odświeżenia | bardziej wymagający | Vectara |
| Wpływ na mierzone wskaźniki | wyższy | Vectara |
| Zadanie w streszczeniu osadzonym w źródle | wierność wobec dostarczonego źródła | Vectara |
| Zadanie w benchmarkach open-recall | wytwarzanie faktów bez wsparcia | Stanford HAI |
| Rozdział sprawozdawczy w Stanford HAI | Responsible AI | Stanford HAI |
| Data publikacji AI Index | kwiecień 2026 | Stanford HAI |
| Rozpiętość wszystkich opublikowanych wskaźników z 2026 roku | ponad dwa rzędy wielkości | Wyliczone |
Metodologia i źródła
- Wskaźniki streszczenia osadzonego w źródle, porównanie FaithJudge oraz odświeżenie zbioru testowego z listopada 2025 roku pochodzą z publicznego rankingu halucynacji Vectara i towarzyszącej mu dokumentacji (repozytorium rankingu, zapowiedź nowej generacji rankingu).
- Przedział od 22% do 94% w 26 czołowych modelach, ujęcie schlebiania oraz kontekst rozdziału Responsible AI pochodzą z AI Index 2026 Stanford HAI, opublikowanego w kwietniu 2026 roku (raport, wnioski, strona główna AI Index).
- Tło metodologiczne dotyczące tego, dlaczego konstrukcja rankingu determinuje mierzoną wierność, pochodzi z opublikowanych badań nad ewoluującymi benchmarkami RAG (arXiv).
- Uwaga dotycząca danych: liczb w tym zestawieniu nie wolno uśredniać, porównywać ani przedstawiać jako pojedynczego wskaźnika. Vectara mierzy wierność wobec dostarczonego dokumentu; Stanford HAI mierzy inny tryb błędu w innych warunkach. Odświeżenie Vectara z listopada 2025 roku celowo zwiększyło trudność testu, więc wskaźniki sprzed i po tej zmianie nie są porównywalne, a pozorne pogorszenie może odzwierciedlać trudniejszy test, a nie gorsze modele. Wyniki dotyczące konkretnych modeli zmieniają się szybko wraz z pojawianiem się nowych wersji, a każdy nazwany wynik modelu starszy niż kwartał należy uznać za nieaktualny. Pomiar schlebiania Stanforda zależy od sformułowania promptu, co jest częścią projektu eksperymentu, a nie stałą właściwością modeli. Vectara jest komercyjnym dostawcą produktów AI opartych na wyszukiwaniu, co daje jej interes w benchmarkach, w których grounding wypada dobrze. Wiersze oznaczone jako wyliczone to działania arytmetyczne lub bezpośrednie wnioski z opublikowanych danych.
- Ostatnia aktualizacja: 2 sierpnia 2026 roku. Aktualizujemy to zestawienie co kwartał, gdy Vectara odświeża swój ranking, a Stanford HAI publikuje nowe edycje AI Index.