Estatísticas de Alucinação de IA (2026): 40+ Dados sobre Taxas, Benchmarks e Por Que Elas Divergem

Estatísticas de alucinação de IA 2026: taxas do ranking da Vectara, a faixa de 22 a 94% do Stanford HAI, por que o benchmark muda a resposta e como avaliar fornecedores.

O mesmo modelo pode ser medido em 0,7% e em 7,6% de alucinação dependendo do benchmark que se executa, e em 26 modelos de ponta o Stanford HAI registrou uma faixa de 22% a 94%. Essa dispersão é o fato mais importante sobre as estatísticas de alucinação de IA em 2026: o desenho do benchmark determina o número de destaque muito mais do que a qualidade do modelo. A sumarização fundamentada, na qual o modelo recebe o texto de origem, produz os números favoráveis que aparecem nos materiais dos fornecedores. Os testes de recall aberto, mais próximos de como as pessoas realmente usam esses sistemas, produzem números uma ordem de grandeza piores. Os dados abaixo vêm do ranking de alucinação da Vectara e do AI Index 2026 do Stanford HAI.

Resumo Rápido

  • As taxas de alucinação relatadas em 2026 vão de cerca de 0,7% a 94%, dependendo do benchmark (Vectara, Stanford HAI)
  • O Gemini-2.0-Flash-001 registrou 0,7% em sumarização fundamentada (Vectara)
  • O mesmo modelo pontua 7,6% no benchmark FaithJudge da Vectara (Vectara)
  • Isso equivale a uma diferença de cerca de onze vezes para um único modelo (derivado)
  • O Stanford HAI registrou de 22% a 94% em 26 modelos de ponta (Stanford HAI, 2026)
  • Esses números medem a alucinação induzida por bajulação (Stanford HAI, 2026)
  • A atualização de novembro de 2025 da Vectara usou mais de 7.700 artigos (Vectara)
  • A atualização foi projetada para ser significativamente mais desafiadora (Vectara)
  • As taxas medidas subiram como resultado direto do teste mais difícil (Vectara)
  • As melhores linhas do ranking de sumarização fundamentada ficam perto de 1,8% (Vectara)
  • As conclusões de Stanford aparecem em seu capítulo de IA Responsável (Stanford HAI, 2026)
  • A sumarização fundamentada fornece o texto de origem ao modelo (Vectara)
  • Os benchmarks de recall aberto exigem que o modelo produza fatos sem apoio (Stanford HAI)

1. A Amplitude É a Estatística

Quem cita uma única taxa de alucinação está descrevendo um benchmark, não o fenômeno. As taxas publicadas em 2026 vão de cerca de 0,7% no melhor extremo do ranking de sumarização fundamentada da Vectara a entre 22% e 94% nos 26 modelos de ponta testados pelo Stanford HAI. Essas não são estimativas concorrentes da mesma grandeza; são medições de tarefas diferentes, e a distância entre elas é de mais de duas ordens de magnitude.

MétricaValorFonte
Menor taxa publicada, sumarização fundamentada0,7%Vectara
Melhores linhas desse rankingperto de 1,8%Vectara
Faixa entre os 26 modelos de ponta22% a 94%Stanford HAI, 2026
Modelo que atingiu o valor de 0,7%Gemini-2.0-Flash-001Vectara
Mesmo modelo no FaithJudge7,6%Vectara
Proporção entre essas duas mediçõescerca de 11xDerivado das cifras da Vectara
Distância entre a menor e a maior taxa publicadasmais de duas ordens de magnitudeDerivado
O que determina o númeroo desenho do benchmarkVectara, Stanford HAI

A diferença de onze vezes para um único modelo em dois benchmarks da mesma organização é a demonstração mais clara disponível de que esses números descrevem testes, não modelos.

Isso tem uma consequência prática que costuma se perder na discussão sobre benchmarks. Se você está escolhendo um modelo para uma aplicação baseada em recuperação, na qual o sistema sempre fornece os documentos de origem, os números de sumarização fundamentada são os relevantes, e uma taxa abaixo de 2% é uma expectativa razoável. Se você está escolhendo um modelo para responder perguntas a partir do próprio conhecimento, esses mesmos números são ativamente enganosos, e a faixa de 22% a 94% está mais próxima do que você deveria planejar. A maior parte da decepção em produção com esses sistemas remonta a uma equipe que testou de um jeito e implantou de outro. O benchmark não está errado; ele estava respondendo a uma pergunta diferente daquela que a implantação coloca. Fonte: ranking de alucinação da Vectara.

2. Sumarização Fundamentada: O Teste Otimista

O benchmark que produz números abaixo de 1% está fazendo algo específico e restrito. A sumarização fundamentada entrega ao modelo um documento de origem e verifica se o resumo resultante permanece fiel a ele, o que elimina a necessidade de o modelo saber qualquer coisa. É uma medição genuína e útil de um modo de falha, e é a que os fornecedores citam.

MétricaValorFonte
Tarefa medidafidelidade de um resumo ao texto de origem fornecidoVectara
Menor taxa registrada0,7%Vectara
Faixa típica dos melhores modelosperto de 1,8%Vectara
Artigos na atualização de novembro de 2025mais de 7.700Vectara
Intenção de design da atualizaçãomaior, mais robusto, mais desafiadorVectara
Efeito da atualização nas taxas medidasmais altoVectara
O que a tarefa não testarecall factual sem apoioDerivado
Por que os fornecedores a citamé a que produz os números mais baixosDerivado

O detalhe da atualização importa mais do que parece à primeira vista: a alucinação medida subiu porque o teste ficou mais difícil, não porque os modelos pioraram, o que significa que as comparações ano a ano nesse ranking não são confiáveis entre versões. Fonte: Vectara sobre a nova geração de seu ranking de alucinação.

3. Recall Aberto: O Teste Pessimista

Os benchmarks que produzem números de dois dígitos e próximos de três dígitos estão testando algo muito mais próximo do uso real. O Stanford HAI registrou taxas de alucinação de 22% a 94% em 26 modelos de ponta, em um benchmark de precisão relatado em seu capítulo de IA Responsável de 2026. Quando um modelo precisa fornecer fatos a partir dos próprios parâmetros, em vez de um documento à sua frente, a taxa de falha sobe drasticamente.

MétricaValorFonte
Menor taxa entre os 26 modelos22%Stanford HAI, 2026
Maior taxa entre os 26 modelos94%Stanford HAI, 2026
Número de modelos de ponta testados26Stanford HAI, 2026
Diferença entre o melhor e o pior modelo72 pontosDerivado das cifras de Stanford
Capítulo que relata o achadoIA ResponsávelStanford HAI, 2026
Modo de falha medidoalucinação induzida por bajulaçãoStanford HAI, 2026
Data de publicação do AI Indexabril de 2026Stanford HAI
Comparação com as taxas de sumarização fundamentadamuito mais altaDerivado

Uma diferença de 72 pontos entre o melhor e o pior modelo de ponta no mesmo teste já é notável por si só: a escolha do modelo importa enormemente nessa tarefa, e quase nada na sumarização fundamentada, em que tudo se concentra em dígitos únicos baixos. Fonte: Relatório AI Index 2026 do Stanford HAI.

4. Bajulação É um Modo de Falha Distinto

A abordagem de Stanford vale a pena separar do erro factual comum. A alucinação induzida por bajulação significa que o modelo se adapta a uma premissa declarada pelo usuário, mesmo quando essa premissa é falsa, o que é um mecanismo diferente de um modelo simplesmente não saber algo. Isso também significa que a taxa medida depende, em parte, de como a pergunta é formulada, e não só do que o modelo sabe.

MétricaValorFonte
Modo de falhaadaptar-se a uma premissa falsa do usuárioStanford HAI, 2026
Faixa de taxas entre os modelos22% a 94%Stanford HAI, 2026
Modelos avaliados26 modelos de pontaStanford HAI, 2026
Distinção em relação ao erro factual comumo mecanismo é diferenteStanford HAI, 2026
Dependência da formulação do promptaltaDerivado
Capítulo do relatórioIA ResponsávelStanford HAI, 2026
Achado mais amplo do AI Index sobre divulgaçãoa divulgação de IA responsável está atrás da capacidadeStanford HAI, 2026
Implicação para a avaliaçãoo design do prompt faz parte da mediçãoDerivado

A consequência prática é incômoda para quem implanta esses sistemas: um modelo pode ser altamente preciso quando questionado de forma neutra e altamente pouco confiável quando um usuário afirma algo errado primeiro. O contexto de implantação está em nossas estatísticas de adoção de IA empresarial. Fonte: Stanford HAI, 12 conclusões do AI Index 2026.

5. Como Interpretar a Alegação de um Fornecedor

A conclusão prática é uma lista curta de verificação. Uma alegação de alucinação abaixo de 1% é quase certamente sumarização fundamentada, em que o modelo recebeu o material de origem, e ela não diz nada sobre o recall sem apoio. A pergunta certa nunca é “qual é a taxa de alucinação”, mas sim “em qual benchmark, em qual tarefa, com que tamanho de amostra”.

MétricaValorFonte
O que uma alegação abaixo de 1% costuma medirsumarização fundamentadaVectara
O que ela não mederecall factual sem apoioDerivado
Taxa do mesmo modelo em um teste interno mais difícil7,6%Vectara
Faixa de taxas em testes de estilo recall aberto22% a 94%Stanford HAI, 2026
Artigos no conjunto de teste atual da Vectaramais de 7.700Vectara
Modelos cobertos pela faixa de Stanford26Stanford HAI, 2026
Perguntas a fazer sobre qualquer alegaçãoqual benchmark, qual tarefa, que amostraDerivado
Se a comparação entre fontes é válidanão, sem metodologia equivalenteDerivado

As implantações baseadas em recuperação realmente ficam mais perto do extremo otimista, porque replicam as condições do benchmark otimista, que é a única forma legítima de usar os números baixos. O inverso também vale: um chatbot que responde perguntas abertas sem recuperação deve ser avaliado em relação à faixa pessimista, e citar o número de sumarização fundamentada para esse produto é um erro de categoria, não um exagero. O contexto de busca e recuperação está em nossas estatísticas de busca por IA, e o contexto do panorama de modelos em nossas estatísticas de IA de código aberto. Fonte: Avaliando a fidelidade de LLMs em RAG com rankings em evolução.

Resumo: Alucinação de IA em Números

MétricaValorFonte
Menor taxa publicada0,7%Vectara
Faixa dos melhores modelos, sumarização fundamentadaperto de 1,8%Vectara
Mesmo modelo no FaithJudge7,6%Vectara
Proporção entre essas mediçõescerca de 11xDerivado
Faixa entre 26 modelos de ponta22% a 94%Stanford HAI
Diferença entre o melhor e o pior modelo72 pontosDerivado
Modelos testados pelo Stanford HAI26Stanford HAI
Modo de falha medido por Stanfordalucinação induzida por bajulaçãoStanford HAI
Artigos no conjunto de teste renovado da Vectaramais de 7.700Vectara
Intenção de design da atualizaçãomais desafiadorVectara
Efeito nas taxas medidasmais altoVectara
Tarefa na sumarização fundamentadafidelidade à fonte fornecidaVectara
Tarefa nos benchmarks de recall abertoprodução factual sem apoioStanford HAI
Capítulo do relatório no Stanford HAIIA ResponsávelStanford HAI
Data de publicação do AI Indexabril de 2026Stanford HAI
Amplitude entre todas as taxas publicadas em 2026mais de duas ordens de magnitudeDerivado

Metodologia e Fontes

  • As taxas de sumarização fundamentada, a comparação com o FaithJudge e a atualização do conjunto de teste de novembro de 2025 vêm do ranking público de alucinação da Vectara e de sua documentação (repositório do ranking, anúncio da nova geração do ranking).
  • A faixa de 22% a 94% em 26 modelos de ponta, a abordagem de bajulação e o contexto do capítulo de IA Responsável vêm do AI Index 2026 do Stanford HAI, publicado em abril de 2026 (relatório, conclusões, página do AI Index).
  • O embasamento metodológico sobre por que o design do ranking determina a fidelidade medida vem de pesquisa publicada sobre benchmarks de RAG em evolução (arXiv).
  • Aviso sobre os dados: as cifras deste levantamento não devem ser somadas, comparadas ou apresentadas como uma taxa única. A Vectara mede a fidelidade a um documento fornecido; o Stanford HAI mede um modo de falha diferente sob condições diferentes. A atualização de novembro de 2025 da Vectara aumentou deliberadamente a dificuldade do teste, então as taxas antes e depois dessa mudança não são comparáveis, e uma aparente piora pode refletir o teste mais difícil, e não modelos piores. Os números específicos de modelos mudam rapidamente conforme novas versões são lançadas, e qualquer resultado de um modelo nomeado com mais de um trimestre deve ser tratado como desatualizado. A medição de bajulação de Stanford depende da formulação do prompt, o que faz parte do desenho experimental, e não é uma propriedade fixa dos modelos. A Vectara é uma fornecedora comercial de produtos de IA baseados em recuperação, o que lhe dá interesse em benchmarks nos quais a fundamentação tem bom desempenho. As linhas marcadas como derivadas são cálculos aritméticos ou inferência direta a partir das cifras publicadas.
  • Última atualização: 2 de agosto de 2026. Atualizamos este levantamento trimestralmente à medida que a Vectara renova seu ranking e o Stanford HAI publica novas edições do AI Index.

Experimente o VoxBooster — 3 dias grátis.

Clone de voz em tempo real, soundboard e efeitos — onde você já fala.

  • Sem cartão
  • ~30ms de latência
  • Discord · Teams · OBS
Experimentar 3 dias grátis