O mesmo modelo pode ser medido em 0,7% e em 7,6% de alucinação dependendo do benchmark que se executa, e em 26 modelos de ponta o Stanford HAI registrou uma faixa de 22% a 94%. Essa dispersão é o fato mais importante sobre as estatísticas de alucinação de IA em 2026: o desenho do benchmark determina o número de destaque muito mais do que a qualidade do modelo. A sumarização fundamentada, na qual o modelo recebe o texto de origem, produz os números favoráveis que aparecem nos materiais dos fornecedores. Os testes de recall aberto, mais próximos de como as pessoas realmente usam esses sistemas, produzem números uma ordem de grandeza piores. Os dados abaixo vêm do ranking de alucinação da Vectara e do AI Index 2026 do Stanford HAI.
Resumo Rápido
- As taxas de alucinação relatadas em 2026 vão de cerca de 0,7% a 94%, dependendo do benchmark (Vectara, Stanford HAI)
- O Gemini-2.0-Flash-001 registrou 0,7% em sumarização fundamentada (Vectara)
- O mesmo modelo pontua 7,6% no benchmark FaithJudge da Vectara (Vectara)
- Isso equivale a uma diferença de cerca de onze vezes para um único modelo (derivado)
- O Stanford HAI registrou de 22% a 94% em 26 modelos de ponta (Stanford HAI, 2026)
- Esses números medem a alucinação induzida por bajulação (Stanford HAI, 2026)
- A atualização de novembro de 2025 da Vectara usou mais de 7.700 artigos (Vectara)
- A atualização foi projetada para ser significativamente mais desafiadora (Vectara)
- As taxas medidas subiram como resultado direto do teste mais difícil (Vectara)
- As melhores linhas do ranking de sumarização fundamentada ficam perto de 1,8% (Vectara)
- As conclusões de Stanford aparecem em seu capítulo de IA Responsável (Stanford HAI, 2026)
- A sumarização fundamentada fornece o texto de origem ao modelo (Vectara)
- Os benchmarks de recall aberto exigem que o modelo produza fatos sem apoio (Stanford HAI)
1. A Amplitude É a Estatística
Quem cita uma única taxa de alucinação está descrevendo um benchmark, não o fenômeno. As taxas publicadas em 2026 vão de cerca de 0,7% no melhor extremo do ranking de sumarização fundamentada da Vectara a entre 22% e 94% nos 26 modelos de ponta testados pelo Stanford HAI. Essas não são estimativas concorrentes da mesma grandeza; são medições de tarefas diferentes, e a distância entre elas é de mais de duas ordens de magnitude.
| Métrica | Valor | Fonte |
|---|---|---|
| Menor taxa publicada, sumarização fundamentada | 0,7% | Vectara |
| Melhores linhas desse ranking | perto de 1,8% | Vectara |
| Faixa entre os 26 modelos de ponta | 22% a 94% | Stanford HAI, 2026 |
| Modelo que atingiu o valor de 0,7% | Gemini-2.0-Flash-001 | Vectara |
| Mesmo modelo no FaithJudge | 7,6% | Vectara |
| Proporção entre essas duas medições | cerca de 11x | Derivado das cifras da Vectara |
| Distância entre a menor e a maior taxa publicadas | mais de duas ordens de magnitude | Derivado |
| O que determina o número | o desenho do benchmark | Vectara, Stanford HAI |
A diferença de onze vezes para um único modelo em dois benchmarks da mesma organização é a demonstração mais clara disponível de que esses números descrevem testes, não modelos.
Isso tem uma consequência prática que costuma se perder na discussão sobre benchmarks. Se você está escolhendo um modelo para uma aplicação baseada em recuperação, na qual o sistema sempre fornece os documentos de origem, os números de sumarização fundamentada são os relevantes, e uma taxa abaixo de 2% é uma expectativa razoável. Se você está escolhendo um modelo para responder perguntas a partir do próprio conhecimento, esses mesmos números são ativamente enganosos, e a faixa de 22% a 94% está mais próxima do que você deveria planejar. A maior parte da decepção em produção com esses sistemas remonta a uma equipe que testou de um jeito e implantou de outro. O benchmark não está errado; ele estava respondendo a uma pergunta diferente daquela que a implantação coloca. Fonte: ranking de alucinação da Vectara.
2. Sumarização Fundamentada: O Teste Otimista
O benchmark que produz números abaixo de 1% está fazendo algo específico e restrito. A sumarização fundamentada entrega ao modelo um documento de origem e verifica se o resumo resultante permanece fiel a ele, o que elimina a necessidade de o modelo saber qualquer coisa. É uma medição genuína e útil de um modo de falha, e é a que os fornecedores citam.
| Métrica | Valor | Fonte |
|---|---|---|
| Tarefa medida | fidelidade de um resumo ao texto de origem fornecido | Vectara |
| Menor taxa registrada | 0,7% | Vectara |
| Faixa típica dos melhores modelos | perto de 1,8% | Vectara |
| Artigos na atualização de novembro de 2025 | mais de 7.700 | Vectara |
| Intenção de design da atualização | maior, mais robusto, mais desafiador | Vectara |
| Efeito da atualização nas taxas medidas | mais alto | Vectara |
| O que a tarefa não testa | recall factual sem apoio | Derivado |
| Por que os fornecedores a citam | é a que produz os números mais baixos | Derivado |
O detalhe da atualização importa mais do que parece à primeira vista: a alucinação medida subiu porque o teste ficou mais difícil, não porque os modelos pioraram, o que significa que as comparações ano a ano nesse ranking não são confiáveis entre versões. Fonte: Vectara sobre a nova geração de seu ranking de alucinação.
3. Recall Aberto: O Teste Pessimista
Os benchmarks que produzem números de dois dígitos e próximos de três dígitos estão testando algo muito mais próximo do uso real. O Stanford HAI registrou taxas de alucinação de 22% a 94% em 26 modelos de ponta, em um benchmark de precisão relatado em seu capítulo de IA Responsável de 2026. Quando um modelo precisa fornecer fatos a partir dos próprios parâmetros, em vez de um documento à sua frente, a taxa de falha sobe drasticamente.
| Métrica | Valor | Fonte |
|---|---|---|
| Menor taxa entre os 26 modelos | 22% | Stanford HAI, 2026 |
| Maior taxa entre os 26 modelos | 94% | Stanford HAI, 2026 |
| Número de modelos de ponta testados | 26 | Stanford HAI, 2026 |
| Diferença entre o melhor e o pior modelo | 72 pontos | Derivado das cifras de Stanford |
| Capítulo que relata o achado | IA Responsável | Stanford HAI, 2026 |
| Modo de falha medido | alucinação induzida por bajulação | Stanford HAI, 2026 |
| Data de publicação do AI Index | abril de 2026 | Stanford HAI |
| Comparação com as taxas de sumarização fundamentada | muito mais alta | Derivado |
Uma diferença de 72 pontos entre o melhor e o pior modelo de ponta no mesmo teste já é notável por si só: a escolha do modelo importa enormemente nessa tarefa, e quase nada na sumarização fundamentada, em que tudo se concentra em dígitos únicos baixos. Fonte: Relatório AI Index 2026 do Stanford HAI.
4. Bajulação É um Modo de Falha Distinto
A abordagem de Stanford vale a pena separar do erro factual comum. A alucinação induzida por bajulação significa que o modelo se adapta a uma premissa declarada pelo usuário, mesmo quando essa premissa é falsa, o que é um mecanismo diferente de um modelo simplesmente não saber algo. Isso também significa que a taxa medida depende, em parte, de como a pergunta é formulada, e não só do que o modelo sabe.
| Métrica | Valor | Fonte |
|---|---|---|
| Modo de falha | adaptar-se a uma premissa falsa do usuário | Stanford HAI, 2026 |
| Faixa de taxas entre os modelos | 22% a 94% | Stanford HAI, 2026 |
| Modelos avaliados | 26 modelos de ponta | Stanford HAI, 2026 |
| Distinção em relação ao erro factual comum | o mecanismo é diferente | Stanford HAI, 2026 |
| Dependência da formulação do prompt | alta | Derivado |
| Capítulo do relatório | IA Responsável | Stanford HAI, 2026 |
| Achado mais amplo do AI Index sobre divulgação | a divulgação de IA responsável está atrás da capacidade | Stanford HAI, 2026 |
| Implicação para a avaliação | o design do prompt faz parte da medição | Derivado |
A consequência prática é incômoda para quem implanta esses sistemas: um modelo pode ser altamente preciso quando questionado de forma neutra e altamente pouco confiável quando um usuário afirma algo errado primeiro. O contexto de implantação está em nossas estatísticas de adoção de IA empresarial. Fonte: Stanford HAI, 12 conclusões do AI Index 2026.
5. Como Interpretar a Alegação de um Fornecedor
A conclusão prática é uma lista curta de verificação. Uma alegação de alucinação abaixo de 1% é quase certamente sumarização fundamentada, em que o modelo recebeu o material de origem, e ela não diz nada sobre o recall sem apoio. A pergunta certa nunca é “qual é a taxa de alucinação”, mas sim “em qual benchmark, em qual tarefa, com que tamanho de amostra”.
| Métrica | Valor | Fonte |
|---|---|---|
| O que uma alegação abaixo de 1% costuma medir | sumarização fundamentada | Vectara |
| O que ela não mede | recall factual sem apoio | Derivado |
| Taxa do mesmo modelo em um teste interno mais difícil | 7,6% | Vectara |
| Faixa de taxas em testes de estilo recall aberto | 22% a 94% | Stanford HAI, 2026 |
| Artigos no conjunto de teste atual da Vectara | mais de 7.700 | Vectara |
| Modelos cobertos pela faixa de Stanford | 26 | Stanford HAI, 2026 |
| Perguntas a fazer sobre qualquer alegação | qual benchmark, qual tarefa, que amostra | Derivado |
| Se a comparação entre fontes é válida | não, sem metodologia equivalente | Derivado |
As implantações baseadas em recuperação realmente ficam mais perto do extremo otimista, porque replicam as condições do benchmark otimista, que é a única forma legítima de usar os números baixos. O inverso também vale: um chatbot que responde perguntas abertas sem recuperação deve ser avaliado em relação à faixa pessimista, e citar o número de sumarização fundamentada para esse produto é um erro de categoria, não um exagero. O contexto de busca e recuperação está em nossas estatísticas de busca por IA, e o contexto do panorama de modelos em nossas estatísticas de IA de código aberto. Fonte: Avaliando a fidelidade de LLMs em RAG com rankings em evolução.
Resumo: Alucinação de IA em Números
| Métrica | Valor | Fonte |
|---|---|---|
| Menor taxa publicada | 0,7% | Vectara |
| Faixa dos melhores modelos, sumarização fundamentada | perto de 1,8% | Vectara |
| Mesmo modelo no FaithJudge | 7,6% | Vectara |
| Proporção entre essas medições | cerca de 11x | Derivado |
| Faixa entre 26 modelos de ponta | 22% a 94% | Stanford HAI |
| Diferença entre o melhor e o pior modelo | 72 pontos | Derivado |
| Modelos testados pelo Stanford HAI | 26 | Stanford HAI |
| Modo de falha medido por Stanford | alucinação induzida por bajulação | Stanford HAI |
| Artigos no conjunto de teste renovado da Vectara | mais de 7.700 | Vectara |
| Intenção de design da atualização | mais desafiador | Vectara |
| Efeito nas taxas medidas | mais alto | Vectara |
| Tarefa na sumarização fundamentada | fidelidade à fonte fornecida | Vectara |
| Tarefa nos benchmarks de recall aberto | produção factual sem apoio | Stanford HAI |
| Capítulo do relatório no Stanford HAI | IA Responsável | Stanford HAI |
| Data de publicação do AI Index | abril de 2026 | Stanford HAI |
| Amplitude entre todas as taxas publicadas em 2026 | mais de duas ordens de magnitude | Derivado |
Metodologia e Fontes
- As taxas de sumarização fundamentada, a comparação com o FaithJudge e a atualização do conjunto de teste de novembro de 2025 vêm do ranking público de alucinação da Vectara e de sua documentação (repositório do ranking, anúncio da nova geração do ranking).
- A faixa de 22% a 94% em 26 modelos de ponta, a abordagem de bajulação e o contexto do capítulo de IA Responsável vêm do AI Index 2026 do Stanford HAI, publicado em abril de 2026 (relatório, conclusões, página do AI Index).
- O embasamento metodológico sobre por que o design do ranking determina a fidelidade medida vem de pesquisa publicada sobre benchmarks de RAG em evolução (arXiv).
- Aviso sobre os dados: as cifras deste levantamento não devem ser somadas, comparadas ou apresentadas como uma taxa única. A Vectara mede a fidelidade a um documento fornecido; o Stanford HAI mede um modo de falha diferente sob condições diferentes. A atualização de novembro de 2025 da Vectara aumentou deliberadamente a dificuldade do teste, então as taxas antes e depois dessa mudança não são comparáveis, e uma aparente piora pode refletir o teste mais difícil, e não modelos piores. Os números específicos de modelos mudam rapidamente conforme novas versões são lançadas, e qualquer resultado de um modelo nomeado com mais de um trimestre deve ser tratado como desatualizado. A medição de bajulação de Stanford depende da formulação do prompt, o que faz parte do desenho experimental, e não é uma propriedade fixa dos modelos. A Vectara é uma fornecedora comercial de produtos de IA baseados em recuperação, o que lhe dá interesse em benchmarks nos quais a fundamentação tem bom desempenho. As linhas marcadas como derivadas são cálculos aritméticos ou inferência direta a partir das cifras publicadas.
- Última atualização: 2 de agosto de 2026. Atualizamos este levantamento trimestralmente à medida que a Vectara renova seu ranking e o Stanford HAI publica novas edições do AI Index.