Статистика галлюцинаций ИИ (2026): более 40 показателей о частоте, бенчмарках и причинах расхождений

Статистика галлюцинаций ИИ в 2026 году: рейтинг Vectara, диапазон Stanford HAI от 22% до 94%, влияние дизайна бенчмарка на результат и как читать заявления вендоров.

Одну и ту же модель можно измерить на уровне 0,7% и 7,6% галлюцинаций в зависимости от того, какой бенчмарк вы используете, а среди 26 передовых моделей Stanford HAI зафиксировал диапазон от 22% до 94%. Этот разброс - главный факт о статистике галлюцинаций ИИ в 2026 году: дизайн бенчмарка определяет итоговое число куда сильнее, чем качество модели. Суммаризация с опорой на источник, где модели передают исходный текст, даёт выгодные цифры, которые попадают в материалы вендоров. Тестирование на открытое воспроизведение фактов, которое ближе к тому, как люди реально используют эти системы, даёт показатели на порядок хуже. Приведённые ниже цифры взяты из рейтинга галлюцинаций Vectara и AI Index 2026 года от Stanford HAI.

Кратко (TL;DR)

  • Сообщаемые показатели галлюцинаций в 2026 году варьируются примерно от 0,7% до 94% в зависимости от бенчмарка (Vectara, Stanford HAI)
  • Gemini-2.0-Flash-001 показала 0,7% на суммаризации с опорой на источник (Vectara)
  • Та же модель получает 7,6% по бенчмарку FaithJudge от Vectara (Vectara)
  • Это примерно одиннадцатикратная разница для одной модели (расчётно)
  • Stanford HAI зафиксировал 22-94% среди 26 передовых моделей (Stanford HAI, 2026)
  • Эти показатели измеряют галлюцинации, вызванные угодливостью (Stanford HAI, 2026)
  • Обновление рейтинга Vectara в ноябре 2025 года охватило более 7 700 статей (Vectara)
  • Обновление было разработано так, чтобы стать значительно сложнее (Vectara)
  • Измеренные показатели выросли именно из-за более сложного теста (Vectara)
  • Лучшие строки рейтинга по суммаризации с опорой на источник находятся около 1,8% (Vectara)
  • Выводы Stanford представлены в его главе об ответственном ИИ (Stanford HAI, 2026)
  • Суммаризация с опорой на источник предоставляет модели исходный текст (Vectara)
  • Бенчмарки на открытое воспроизведение фактов требуют, чтобы модель отвечала самостоятельно (Stanford HAI)

1. Разброс - это и есть статистика

Любой, кто называет единый показатель галлюцинаций, описывает один бенчмарк, а не само явление. Опубликованные в 2026 году показатели колеблются примерно от 0,7% на лучшем конце рейтинга Vectara по суммаризации с опорой на источник до 22-94% среди 26 передовых моделей, протестированных Stanford HAI. Это не конкурирующие оценки одной и той же величины - это измерения разных задач, и разрыв между ними превышает два порядка.

ПоказательЗначениеИсточник
Самый низкий опубликованный показатель, суммаризация с опорой на источник0,7%Vectara
Лучшие строки этого рейтингаоколо 1,8%Vectara
Диапазон среди 26 передовых моделей22-94%Stanford HAI, 2026
Модель с показателем 0,7%Gemini-2.0-Flash-001Vectara
Та же модель по FaithJudge7,6%Vectara
Соотношение между этими двумя показателямипримерно 11xРасчёт на основе данных Vectara
Разрыв между самым низким и самым высоким опубликованными показателямиболее двух порядков величиныРасчётно
Что определяет числодизайн бенчмаркаVectara, Stanford HAI

Одиннадцатикратный разрыв для одной модели на двух бенчмарках одной и той же организации - самое наглядное доказательство того, что эти цифры описывают тесты, а не модели.

У этого есть практическое следствие, которое часто теряется в спорах о бенчмарках. Если вы выбираете модель для приложения с опорой на поиск (retrieval-grounded), где система всегда предоставляет исходные документы, релевантны именно показатели суммаризации с опорой на источник, и показатель ниже 2% - разумное ожидание. Если вы выбираете модель для ответов на вопросы из собственных знаний, те же самые цифры вводят в заблуждение, и диапазон 22-94% гораздо ближе к тому, на что стоит рассчитывать. Большинство разочарований в продакшене с этими системами восходит к команде, которая тестировала одним способом, а развернула систему по-другому. Бенчмарк не ошибается - он отвечал на другой вопрос, чем тот, который ставит эксплуатация. Источник: рейтинг галлюцинаций Vectara.

2. Суммаризация с опорой на источник: оптимистичный тест

Бенчмарк, дающий показатели ниже 1%, измеряет нечто конкретное и узкое. Суммаризация с опорой на источник передаёт модели исходный документ и проверяет, остаётся ли итоговое резюме верным ему, что снимает необходимость модели что-либо знать. Это подлинное и полезное измерение одного вида сбоя, и именно на него ссылаются вендоры.

ПоказательЗначениеИсточник
Измеряемая задачаверность резюме предоставленному исходному текстуVectara
Самый низкий зафиксированный показатель0,7%Vectara
Типичный диапазон лучших моделейоколо 1,8%Vectara
Статей в обновлении ноября 2025 годаболее 7 700Vectara
Замысел обновлениякрупнее, надёжнее, сложнееVectara
Эффект обновления на измеренные показателивышеVectara
Что задача не проверяетсамостоятельное воспроизведение фактовРасчётно
Почему на неё ссылаются вендорыона даёт самые низкие цифрыРасчётно

Деталь про обновление значит больше, чем кажется на первый взгляд: измеренные галлюцинации выросли потому, что тест стал сложнее, а не потому, что модели стали хуже, а значит сравнения год к году в этом рейтинге ненадёжны при смене версии. Источник: Vectara о новом поколении своего рейтинга галлюцинаций.

3. Открытое воспроизведение фактов: пессимистичный тест

Бенчмарки, дающие двузначные и близкие к трёхзначным показатели, тестируют нечто гораздо более близкое к реальному использованию. Stanford HAI зафиксировал показатели галлюцинаций от 22% до 94% среди 26 передовых моделей на бенчмарке точности, о котором сообщается в его главе об ответственном ИИ за 2026 год. Когда модель должна предоставлять факты из собственных параметров, а не из документа перед ней, частота сбоев резко возрастает.

ПоказательЗначениеИсточник
Самый низкий показатель среди 26 моделей22%Stanford HAI, 2026
Самый высокий показатель среди 26 моделей94%Stanford HAI, 2026
Число протестированных передовых моделей26Stanford HAI, 2026
Разброс между лучшей и худшей моделью72 пунктаРасчёт на основе данных Stanford
Глава, где представлен выводОтветственный ИИStanford HAI, 2026
Измеряемый вид сбоягаллюцинации, вызванные угодливостьюStanford HAI, 2026
Дата публикации AI Indexапрель 2026 годаStanford HAI
Сравнение с показателями суммаризации с опорой на источникзначительно вышеРасчётно

Разброс в 72 пункта между лучшей и худшей передовой моделью на одном и том же тесте сам по себе примечателен: выбор модели имеет огромное значение для этой задачи и почти не имеет значения для суммаризации с опорой на источник, где всё группируется в низких однозначных значениях. Источник: отчёт Stanford HAI AI Index 2026.

4. Угодливость - отдельный вид сбоя

Формулировку Stanford стоит отделить от обычной фактической ошибки. Галлюцинация, вызванная угодливостью, означает, что модель соглашается с заявленной пользователем предпосылкой, даже если та ложна, - это иной механизм, чем модель, которая просто чего-то не знает. Это также означает, что измеренный показатель частично зависит от того, как сформулирован вопрос, а не только от того, что модель знает.

ПоказательЗначениеИсточник
Вид сбоясогласие с ложной предпосылкой пользователяStanford HAI, 2026
Диапазон показателей среди моделей22-94%Stanford HAI, 2026
Оценённые модели26 передовых моделейStanford HAI, 2026
Отличие от обычной фактической ошибкимеханизм инойStanford HAI, 2026
Зависимость от формулировки запросавысокаяРасчётно
Глава отчётаОтветственный ИИStanford HAI, 2026
Более широкий вывод AI Index об отчётностираскрытие информации об ответственном ИИ отстаёт от возможностейStanford HAI, 2026
Значение для оценкиформулировка запроса - часть измеренияРасчётно

Практическое следствие неудобно для тех, кто разворачивает эти системы: модель может быть очень точной при нейтральном вопросе и крайне ненадёжной, когда пользователь сначала утверждает что-то неверное. Контекст внедрения находится в нашей статистике внедрения ИИ на предприятиях. Источник: Stanford HAI, 12 выводов из AI Index 2026.

5. Как читать заявление вендора

Практический вывод укладывается в короткий чек-лист. Заявление о показателе галлюцинаций ниже 1% почти наверняка относится к суммаризации с опорой на источник, где модели передан исходный материал, и ничего не говорит о самостоятельном воспроизведении фактов. Правильный вопрос - никогда не “какой уровень галлюцинаций”, а “на каком бенчмарке, на какой задаче, при какой выборке”.

ПоказательЗначениеИсточник
Что обычно измеряет заявление ниже 1%суммаризация с опорой на источникVectara
Что оно не измеряетсамостоятельное воспроизведение фактовРасчётно
Показатель той же модели на более сложном внутреннем тесте7,6%Vectara
Диапазон показателей на тестах открытого воспроизведения22-94%Stanford HAI, 2026
Статей в текущем тестовом наборе Vectaraболее 7 700Vectara
Моделей, охваченных диапазоном Stanford26Stanford HAI, 2026
Вопросы к любому заявлениюкакой бенчмарк, какая задача, какая выборкаРасчётно
Допустимо ли сравнение между источникаминет, без сопоставимой методологииРасчётно

Приложения с опорой на поиск действительно находятся ближе к оптимистичному концу диапазона, потому что они воспроизводят условия оптимистичного бенчмарка - это единственный законный способ использовать низкие цифры. Верно и обратное: чат-бот, отвечающий на открытые вопросы без поиска, следует оценивать по пессимистичному диапазону, и цитирование показателя суммаризации с опорой на источник для такого продукта - это категориальная ошибка, а не преувеличение. Контекст поиска и извлечения информации - в нашей статистике ИИ-поиска, а контекст ландшафта моделей - в нашей статистике open-source ИИ. Источник: оценка достоверности LLM в RAG на основе развивающихся рейтингов.

Итог: галлюцинации ИИ в цифрах

ПоказательЗначениеИсточник
Самый низкий опубликованный показатель0,7%Vectara
Диапазон лучших моделей, суммаризация с опорой на источникоколо 1,8%Vectara
Та же модель по FaithJudge7,6%Vectara
Соотношение между этими показателямипримерно 11xРасчётно
Диапазон среди 26 передовых моделей22-94%Stanford HAI
Разброс между лучшей и худшей моделью72 пунктаРасчётно
Моделей, протестированных Stanford HAI26Stanford HAI
Измеренный Stanford вид сбоягаллюцинации, вызванные угодливостьюStanford HAI
Статей в обновлённом тестовом наборе Vectaraболее 7 700Vectara
Замысел обновлениясложнееVectara
Эффект на измеренные показателивышеVectara
Задача в суммаризации с опорой на источникверность предоставленному источникуVectara
Задача в бенчмарках открытого воспроизведениясамостоятельное производство фактовStanford HAI
Глава отчёта Stanford HAIОтветственный ИИStanford HAI
Дата публикации AI Indexапрель 2026 годаStanford HAI
Разброс по всем опубликованным показателям 2026 годаболее двух порядков величиныРасчётно

Методология и источники

  • Показатели суммаризации с опорой на источник, сравнение по FaithJudge и обновление тестового набора в ноябре 2025 года взяты из публичного рейтинга галлюцинаций Vectara и сопроводительной документации (репозиторий рейтинга, анонс нового поколения рейтинга).
  • Диапазон 22-94% среди 26 передовых моделей, формулировка про угодливость и контекст главы об ответственном ИИ взяты из AI Index 2026 года от Stanford HAI, опубликованного в апреле 2026 года (отчёт, выводы, главная страница AI Index).
  • Методологический фон о том, почему дизайн рейтинга определяет измеренную достоверность, взят из опубликованных исследований о развивающихся бенчмарках RAG (arXiv).
  • Замечание о данных: цифры в этом обзоре нельзя усреднять, сравнивать или представлять как единый показатель. Vectara измеряет верность предоставленному документу; Stanford HAI измеряет другой вид сбоя в других условиях. Обновление Vectara в ноябре 2025 года намеренно повысило сложность теста, поэтому показатели до и после этого изменения несопоставимы, а видимое ухудшение может отражать более сложный тест, а не более слабые модели. Показатели по конкретным моделям быстро меняются с выходом новых версий, и любой результат по названной модели старше квартала следует считать устаревшим. Измерение угодливости Stanford зависит от формулировки запроса, что является частью экспериментального дизайна, а не фиксированным свойством моделей. Vectara - коммерческий поставщик продуктов ИИ с опорой на поиск, что даёт ей интерес в бенчмарках, где такая опора показывает хорошие результаты. Строки, отмеченные как расчётные, получены арифметически или прямым выводом из опубликованных цифр.
  • Последнее обновление: 2 августа 2026 года. Мы обновляем этот обзор ежеквартально по мере того, как Vectara обновляет свой рейтинг, а Stanford HAI публикует новые издания AI Index.

Попробуй VoxBooster — 3 дня бесплатно.

Клонирование голоса в реальном времени, саундборд и эффекты — везде, где ты говоришь.

  • Без карты
  • ~30 мс задержки
  • Discord · Teams · OBS
Попробовать 3 дня бесплатно