Одну и ту же модель можно измерить на уровне 0,7% и 7,6% галлюцинаций в зависимости от того, какой бенчмарк вы используете, а среди 26 передовых моделей Stanford HAI зафиксировал диапазон от 22% до 94%. Этот разброс - главный факт о статистике галлюцинаций ИИ в 2026 году: дизайн бенчмарка определяет итоговое число куда сильнее, чем качество модели. Суммаризация с опорой на источник, где модели передают исходный текст, даёт выгодные цифры, которые попадают в материалы вендоров. Тестирование на открытое воспроизведение фактов, которое ближе к тому, как люди реально используют эти системы, даёт показатели на порядок хуже. Приведённые ниже цифры взяты из рейтинга галлюцинаций Vectara и AI Index 2026 года от Stanford HAI.
Кратко (TL;DR)
- Сообщаемые показатели галлюцинаций в 2026 году варьируются примерно от 0,7% до 94% в зависимости от бенчмарка (Vectara, Stanford HAI)
- Gemini-2.0-Flash-001 показала 0,7% на суммаризации с опорой на источник (Vectara)
- Та же модель получает 7,6% по бенчмарку FaithJudge от Vectara (Vectara)
- Это примерно одиннадцатикратная разница для одной модели (расчётно)
- Stanford HAI зафиксировал 22-94% среди 26 передовых моделей (Stanford HAI, 2026)
- Эти показатели измеряют галлюцинации, вызванные угодливостью (Stanford HAI, 2026)
- Обновление рейтинга Vectara в ноябре 2025 года охватило более 7 700 статей (Vectara)
- Обновление было разработано так, чтобы стать значительно сложнее (Vectara)
- Измеренные показатели выросли именно из-за более сложного теста (Vectara)
- Лучшие строки рейтинга по суммаризации с опорой на источник находятся около 1,8% (Vectara)
- Выводы Stanford представлены в его главе об ответственном ИИ (Stanford HAI, 2026)
- Суммаризация с опорой на источник предоставляет модели исходный текст (Vectara)
- Бенчмарки на открытое воспроизведение фактов требуют, чтобы модель отвечала самостоятельно (Stanford HAI)
1. Разброс - это и есть статистика
Любой, кто называет единый показатель галлюцинаций, описывает один бенчмарк, а не само явление. Опубликованные в 2026 году показатели колеблются примерно от 0,7% на лучшем конце рейтинга Vectara по суммаризации с опорой на источник до 22-94% среди 26 передовых моделей, протестированных Stanford HAI. Это не конкурирующие оценки одной и той же величины - это измерения разных задач, и разрыв между ними превышает два порядка.
| Показатель | Значение | Источник |
|---|---|---|
| Самый низкий опубликованный показатель, суммаризация с опорой на источник | 0,7% | Vectara |
| Лучшие строки этого рейтинга | около 1,8% | Vectara |
| Диапазон среди 26 передовых моделей | 22-94% | Stanford HAI, 2026 |
| Модель с показателем 0,7% | Gemini-2.0-Flash-001 | Vectara |
| Та же модель по FaithJudge | 7,6% | Vectara |
| Соотношение между этими двумя показателями | примерно 11x | Расчёт на основе данных Vectara |
| Разрыв между самым низким и самым высоким опубликованными показателями | более двух порядков величины | Расчётно |
| Что определяет число | дизайн бенчмарка | Vectara, Stanford HAI |
Одиннадцатикратный разрыв для одной модели на двух бенчмарках одной и той же организации - самое наглядное доказательство того, что эти цифры описывают тесты, а не модели.
У этого есть практическое следствие, которое часто теряется в спорах о бенчмарках. Если вы выбираете модель для приложения с опорой на поиск (retrieval-grounded), где система всегда предоставляет исходные документы, релевантны именно показатели суммаризации с опорой на источник, и показатель ниже 2% - разумное ожидание. Если вы выбираете модель для ответов на вопросы из собственных знаний, те же самые цифры вводят в заблуждение, и диапазон 22-94% гораздо ближе к тому, на что стоит рассчитывать. Большинство разочарований в продакшене с этими системами восходит к команде, которая тестировала одним способом, а развернула систему по-другому. Бенчмарк не ошибается - он отвечал на другой вопрос, чем тот, который ставит эксплуатация. Источник: рейтинг галлюцинаций Vectara.
2. Суммаризация с опорой на источник: оптимистичный тест
Бенчмарк, дающий показатели ниже 1%, измеряет нечто конкретное и узкое. Суммаризация с опорой на источник передаёт модели исходный документ и проверяет, остаётся ли итоговое резюме верным ему, что снимает необходимость модели что-либо знать. Это подлинное и полезное измерение одного вида сбоя, и именно на него ссылаются вендоры.
| Показатель | Значение | Источник |
|---|---|---|
| Измеряемая задача | верность резюме предоставленному исходному тексту | Vectara |
| Самый низкий зафиксированный показатель | 0,7% | Vectara |
| Типичный диапазон лучших моделей | около 1,8% | Vectara |
| Статей в обновлении ноября 2025 года | более 7 700 | Vectara |
| Замысел обновления | крупнее, надёжнее, сложнее | Vectara |
| Эффект обновления на измеренные показатели | выше | Vectara |
| Что задача не проверяет | самостоятельное воспроизведение фактов | Расчётно |
| Почему на неё ссылаются вендоры | она даёт самые низкие цифры | Расчётно |
Деталь про обновление значит больше, чем кажется на первый взгляд: измеренные галлюцинации выросли потому, что тест стал сложнее, а не потому, что модели стали хуже, а значит сравнения год к году в этом рейтинге ненадёжны при смене версии. Источник: Vectara о новом поколении своего рейтинга галлюцинаций.
3. Открытое воспроизведение фактов: пессимистичный тест
Бенчмарки, дающие двузначные и близкие к трёхзначным показатели, тестируют нечто гораздо более близкое к реальному использованию. Stanford HAI зафиксировал показатели галлюцинаций от 22% до 94% среди 26 передовых моделей на бенчмарке точности, о котором сообщается в его главе об ответственном ИИ за 2026 год. Когда модель должна предоставлять факты из собственных параметров, а не из документа перед ней, частота сбоев резко возрастает.
| Показатель | Значение | Источник |
|---|---|---|
| Самый низкий показатель среди 26 моделей | 22% | Stanford HAI, 2026 |
| Самый высокий показатель среди 26 моделей | 94% | Stanford HAI, 2026 |
| Число протестированных передовых моделей | 26 | Stanford HAI, 2026 |
| Разброс между лучшей и худшей моделью | 72 пункта | Расчёт на основе данных Stanford |
| Глава, где представлен вывод | Ответственный ИИ | Stanford HAI, 2026 |
| Измеряемый вид сбоя | галлюцинации, вызванные угодливостью | Stanford HAI, 2026 |
| Дата публикации AI Index | апрель 2026 года | Stanford HAI |
| Сравнение с показателями суммаризации с опорой на источник | значительно выше | Расчётно |
Разброс в 72 пункта между лучшей и худшей передовой моделью на одном и том же тесте сам по себе примечателен: выбор модели имеет огромное значение для этой задачи и почти не имеет значения для суммаризации с опорой на источник, где всё группируется в низких однозначных значениях. Источник: отчёт Stanford HAI AI Index 2026.
4. Угодливость - отдельный вид сбоя
Формулировку Stanford стоит отделить от обычной фактической ошибки. Галлюцинация, вызванная угодливостью, означает, что модель соглашается с заявленной пользователем предпосылкой, даже если та ложна, - это иной механизм, чем модель, которая просто чего-то не знает. Это также означает, что измеренный показатель частично зависит от того, как сформулирован вопрос, а не только от того, что модель знает.
| Показатель | Значение | Источник |
|---|---|---|
| Вид сбоя | согласие с ложной предпосылкой пользователя | Stanford HAI, 2026 |
| Диапазон показателей среди моделей | 22-94% | Stanford HAI, 2026 |
| Оценённые модели | 26 передовых моделей | Stanford HAI, 2026 |
| Отличие от обычной фактической ошибки | механизм иной | Stanford HAI, 2026 |
| Зависимость от формулировки запроса | высокая | Расчётно |
| Глава отчёта | Ответственный ИИ | Stanford HAI, 2026 |
| Более широкий вывод AI Index об отчётности | раскрытие информации об ответственном ИИ отстаёт от возможностей | Stanford HAI, 2026 |
| Значение для оценки | формулировка запроса - часть измерения | Расчётно |
Практическое следствие неудобно для тех, кто разворачивает эти системы: модель может быть очень точной при нейтральном вопросе и крайне ненадёжной, когда пользователь сначала утверждает что-то неверное. Контекст внедрения находится в нашей статистике внедрения ИИ на предприятиях. Источник: Stanford HAI, 12 выводов из AI Index 2026.
5. Как читать заявление вендора
Практический вывод укладывается в короткий чек-лист. Заявление о показателе галлюцинаций ниже 1% почти наверняка относится к суммаризации с опорой на источник, где модели передан исходный материал, и ничего не говорит о самостоятельном воспроизведении фактов. Правильный вопрос - никогда не “какой уровень галлюцинаций”, а “на каком бенчмарке, на какой задаче, при какой выборке”.
| Показатель | Значение | Источник |
|---|---|---|
| Что обычно измеряет заявление ниже 1% | суммаризация с опорой на источник | Vectara |
| Что оно не измеряет | самостоятельное воспроизведение фактов | Расчётно |
| Показатель той же модели на более сложном внутреннем тесте | 7,6% | Vectara |
| Диапазон показателей на тестах открытого воспроизведения | 22-94% | Stanford HAI, 2026 |
| Статей в текущем тестовом наборе Vectara | более 7 700 | Vectara |
| Моделей, охваченных диапазоном Stanford | 26 | Stanford HAI, 2026 |
| Вопросы к любому заявлению | какой бенчмарк, какая задача, какая выборка | Расчётно |
| Допустимо ли сравнение между источниками | нет, без сопоставимой методологии | Расчётно |
Приложения с опорой на поиск действительно находятся ближе к оптимистичному концу диапазона, потому что они воспроизводят условия оптимистичного бенчмарка - это единственный законный способ использовать низкие цифры. Верно и обратное: чат-бот, отвечающий на открытые вопросы без поиска, следует оценивать по пессимистичному диапазону, и цитирование показателя суммаризации с опорой на источник для такого продукта - это категориальная ошибка, а не преувеличение. Контекст поиска и извлечения информации - в нашей статистике ИИ-поиска, а контекст ландшафта моделей - в нашей статистике open-source ИИ. Источник: оценка достоверности LLM в RAG на основе развивающихся рейтингов.
Итог: галлюцинации ИИ в цифрах
| Показатель | Значение | Источник |
|---|---|---|
| Самый низкий опубликованный показатель | 0,7% | Vectara |
| Диапазон лучших моделей, суммаризация с опорой на источник | около 1,8% | Vectara |
| Та же модель по FaithJudge | 7,6% | Vectara |
| Соотношение между этими показателями | примерно 11x | Расчётно |
| Диапазон среди 26 передовых моделей | 22-94% | Stanford HAI |
| Разброс между лучшей и худшей моделью | 72 пункта | Расчётно |
| Моделей, протестированных Stanford HAI | 26 | Stanford HAI |
| Измеренный Stanford вид сбоя | галлюцинации, вызванные угодливостью | Stanford HAI |
| Статей в обновлённом тестовом наборе Vectara | более 7 700 | Vectara |
| Замысел обновления | сложнее | Vectara |
| Эффект на измеренные показатели | выше | Vectara |
| Задача в суммаризации с опорой на источник | верность предоставленному источнику | Vectara |
| Задача в бенчмарках открытого воспроизведения | самостоятельное производство фактов | Stanford HAI |
| Глава отчёта Stanford HAI | Ответственный ИИ | Stanford HAI |
| Дата публикации AI Index | апрель 2026 года | Stanford HAI |
| Разброс по всем опубликованным показателям 2026 года | более двух порядков величины | Расчётно |
Методология и источники
- Показатели суммаризации с опорой на источник, сравнение по FaithJudge и обновление тестового набора в ноябре 2025 года взяты из публичного рейтинга галлюцинаций Vectara и сопроводительной документации (репозиторий рейтинга, анонс нового поколения рейтинга).
- Диапазон 22-94% среди 26 передовых моделей, формулировка про угодливость и контекст главы об ответственном ИИ взяты из AI Index 2026 года от Stanford HAI, опубликованного в апреле 2026 года (отчёт, выводы, главная страница AI Index).
- Методологический фон о том, почему дизайн рейтинга определяет измеренную достоверность, взят из опубликованных исследований о развивающихся бенчмарках RAG (arXiv).
- Замечание о данных: цифры в этом обзоре нельзя усреднять, сравнивать или представлять как единый показатель. Vectara измеряет верность предоставленному документу; Stanford HAI измеряет другой вид сбоя в других условиях. Обновление Vectara в ноябре 2025 года намеренно повысило сложность теста, поэтому показатели до и после этого изменения несопоставимы, а видимое ухудшение может отражать более сложный тест, а не более слабые модели. Показатели по конкретным моделям быстро меняются с выходом новых версий, и любой результат по названной модели старше квартала следует считать устаревшим. Измерение угодливости Stanford зависит от формулировки запроса, что является частью экспериментального дизайна, а не фиксированным свойством моделей. Vectara - коммерческий поставщик продуктов ИИ с опорой на поиск, что даёт ей интерес в бенчмарках, где такая опора показывает хорошие результаты. Строки, отмеченные как расчётные, получены арифметически или прямым выводом из опубликованных цифр.
- Последнее обновление: 2 августа 2026 года. Мы обновляем этот обзор ежеквартально по мере того, как Vectara обновляет свой рейтинг, а Stanford HAI публикует новые издания AI Index.