Le même modèle peut afficher 0,7 % ou 7,6 % d’hallucination selon le benchmark utilisé, et sur 26 modèles de pointe, Stanford HAI a enregistré une fourchette de 22 % à 94 %. Cet écart est le fait le plus important à retenir sur les statistiques d’hallucination de l’IA en 2026 : la conception du benchmark détermine le chiffre phare bien plus que la qualité du modèle. Le résumé ancré, où le modèle reçoit le texte source, produit les chiffres flatteurs qui apparaissent dans les documents des fournisseurs. Les tests de rappel libre, plus proches de la façon dont les gens utilisent réellement ces systèmes, produisent des chiffres un ordre de grandeur pires. Les données ci-dessous proviennent du classement d’hallucination de Vectara et de l’AI Index 2026 de Stanford HAI.
En Bref
- Les taux d’hallucination rapportés en 2026 vont d’environ 0,7 % à 94 % selon le benchmark (Vectara, Stanford HAI)
- Gemini-2.0-Flash-001 a enregistré 0,7 % en résumé ancré (Vectara)
- Le même modèle obtient 7,6 % sous le benchmark FaithJudge de Vectara (Vectara)
- Cela représente une différence d’environ onze fois pour un seul modèle (déduit)
- Stanford HAI a enregistré de 22 % à 94 % sur 26 modèles de pointe (Stanford HAI, 2026)
- Ces chiffres mesurent l’hallucination induite par la flagornerie (Stanford HAI, 2026)
- La refonte de novembre 2025 de Vectara a utilisé plus de 7 700 articles (Vectara)
- La refonte a été conçue pour être nettement plus exigeante (Vectara)
- Les taux mesurés ont augmenté du fait direct du test plus difficile (Vectara)
- Les meilleures lignes du classement de résumé ancré se situent près de 1,8 % (Vectara)
- Les conclusions de Stanford figurent dans son chapitre sur l’IA responsable (Stanford HAI, 2026)
- Le résumé ancré fournit le texte source au modèle (Vectara)
- Les benchmarks de rappel libre exigent que le modèle produise des faits sans aide (Stanford HAI)
1. L’Écart Est la Statistique
Quiconque cite un taux d’hallucination unique décrit un benchmark, pas le phénomène. Les taux publiés en 2026 vont d’environ 0,7 % à l’extrémité la plus favorable du classement de résumé ancré de Vectara à entre 22 % et 94 % sur les 26 modèles de pointe testés par Stanford HAI. Il ne s’agit pas d’estimations concurrentes de la même grandeur ; ce sont des mesures de tâches différentes, et l’écart entre elles dépasse deux ordres de grandeur.
| Métrique | Valeur | Source |
|---|---|---|
| Taux le plus bas publié, résumé ancré | 0,7 % | Vectara |
| Meilleures lignes de ce classement | près de 1,8 % | Vectara |
| Fourchette sur les 26 modèles de pointe | 22 % à 94 % | Stanford HAI, 2026 |
| Modèle atteignant le chiffre de 0,7 % | Gemini-2.0-Flash-001 | Vectara |
| Même modèle sous FaithJudge | 7,6 % | Vectara |
| Rapport entre ces deux mesures | environ 11x | Déduit des chiffres de Vectara |
| Écart entre le taux le plus bas et le plus haut publiés | plus de deux ordres de grandeur | Déduit |
| Ce qui détermine le chiffre | la conception du benchmark | Vectara, Stanford HAI |
L’écart d’un facteur onze pour un même modèle sur deux benchmarks de la même organisation est la démonstration la plus nette disponible que ces chiffres décrivent des tests, pas des modèles.
Cela a une conséquence pratique qui se perd souvent dans les débats sur les benchmarks. Si vous choisissez un modèle pour une application fondée sur la recherche documentaire, où le système fournit toujours les documents source, les chiffres de résumé ancré sont les pertinents, et un taux inférieur à 2 % est une attente raisonnable. Si vous choisissez un modèle pour répondre à des questions à partir de ses propres connaissances, ces mêmes chiffres sont activement trompeurs, et la fourchette de 22 % à 94 % est plus proche de ce à quoi vous devriez vous préparer. La plupart des déceptions en production avec ces systèmes remontent à une équipe qui a évalué d’une façon et déployé d’une autre. Le benchmark n’est pas fautif ; il répondait à une question différente de celle que pose le déploiement. Source : classement d’hallucination de Vectara.
2. Résumé Ancré : Le Test Optimiste
Le benchmark qui produit des chiffres inférieurs à 1 % fait quelque chose de précis et d’étroit. Le résumé ancré fournit au modèle un document source et vérifie si le résumé qui en résulte lui reste fidèle, ce qui supprime le besoin pour le modèle de savoir quoi que ce soit. C’est une mesure authentique et utile d’un mode de défaillance, et c’est celle que citent les fournisseurs.
| Métrique | Valeur | Source |
|---|---|---|
| Tâche mesurée | fidélité d’un résumé au texte source fourni | Vectara |
| Taux le plus bas enregistré | 0,7 % | Vectara |
| Fourchette habituelle des meilleurs modèles | près de 1,8 % | Vectara |
| Articles dans la refonte de novembre 2025 | plus de 7 700 | Vectara |
| Intention de conception de la refonte | plus vaste, plus robuste, plus exigeante | Vectara |
| Effet de la refonte sur les taux mesurés | plus élevé | Vectara |
| Ce que la tâche ne teste pas | rappel factuel sans aide | Déduit |
| Pourquoi les fournisseurs la citent | elle produit les chiffres les plus bas | Déduit |
Le détail de la refonte compte plus qu’il n’y paraît au premier abord : l’hallucination mesurée a augmenté parce que le test est devenu plus difficile, pas parce que les modèles ont régressé, ce qui signifie que les comparaisons d’une année sur l’autre sur ce classement ne sont pas fiables d’une version à l’autre. Source : Vectara sur la nouvelle génération de son classement d’hallucination.
3. Rappel Libre : Le Test Pessimiste
Les benchmarks qui produisent des chiffres à deux chiffres et proches de trois chiffres testent quelque chose de bien plus proche de l’usage réel. Stanford HAI a enregistré des taux d’hallucination de 22 % à 94 % sur 26 modèles de pointe, sur un benchmark de précision rapporté dans son chapitre sur l’IA responsable de 2026. Lorsqu’un modèle doit fournir des faits à partir de ses propres paramètres plutôt que d’un document sous les yeux, le taux d’échec augmente considérablement.
| Métrique | Valeur | Source |
|---|---|---|
| Taux le plus bas parmi les 26 modèles | 22 % | Stanford HAI, 2026 |
| Taux le plus élevé parmi les 26 modèles | 94 % | Stanford HAI, 2026 |
| Nombre de modèles de pointe testés | 26 | Stanford HAI, 2026 |
| Écart entre le meilleur et le pire modèle | 72 points | Déduit des chiffres de Stanford |
| Chapitre rapportant le constat | IA responsable | Stanford HAI, 2026 |
| Mode de défaillance mesuré | hallucination induite par la flagornerie | Stanford HAI, 2026 |
| Date de publication de l’AI Index | avril 2026 | Stanford HAI |
| Comparaison avec les taux de résumé ancré | bien plus élevé | Déduit |
Un écart de 72 points entre le meilleur et le pire modèle de pointe sur le même test est déjà notable en soi : le choix du modèle compte énormément sur cette tâche, et presque pas sur le résumé ancré, où tout se regroupe autour de chiffres à un seul chiffre bas. Source : Rapport AI Index 2026 de Stanford HAI.
4. La Flagornerie Est un Mode de Défaillance Distinct
L’angle de Stanford mérite d’être distingué de l’erreur factuelle ordinaire. L’hallucination induite par la flagornerie signifie que le modèle se conforme à une prémisse énoncée par l’utilisateur, même lorsque cette prémisse est fausse, un mécanisme différent d’un modèle qui, simplement, ne sait pas quelque chose. Cela signifie aussi que le taux mesuré dépend en partie de la formulation de la question, pas seulement de ce que le modèle sait.
| Métrique | Valeur | Source |
|---|---|---|
| Mode de défaillance | se conformer à une prémisse fausse de l’utilisateur | Stanford HAI, 2026 |
| Fourchette des taux entre modèles | 22 % à 94 % | Stanford HAI, 2026 |
| Modèles évalués | 26 modèles de pointe | Stanford HAI, 2026 |
| Distinction avec l’erreur factuelle ordinaire | le mécanisme diffère | Stanford HAI, 2026 |
| Dépendance à la formulation du prompt | élevée | Déduit |
| Chapitre du rapport | IA responsable | Stanford HAI, 2026 |
| Constat plus large de l’AI Index sur la divulgation | la divulgation en IA responsable est en retard sur les capacités | Stanford HAI, 2026 |
| Implication pour l’évaluation | la conception du prompt fait partie de la mesure | Déduit |
La conséquence pratique est inconfortable pour quiconque déploie ces systèmes : un modèle peut être très précis lorsqu’on l’interroge de façon neutre et très peu fiable lorsqu’un utilisateur affirme d’abord quelque chose de faux. Le contexte de déploiement se trouve dans nos statistiques sur l’adoption de l’IA en entreprise. Source : Stanford HAI, 12 enseignements de l’AI Index 2026.
5. Comment Lire l’Affirmation d’un Fournisseur
La conclusion pratique tient en une courte liste de vérification. Une affirmation d’hallucination inférieure à 1 % correspond presque certainement à du résumé ancré, où le modèle a reçu le matériel source, et elle ne dit rien sur le rappel sans aide. La bonne question n’est jamais “quel est le taux d’hallucination” mais “sur quel benchmark, sur quelle tâche, avec quel échantillon”.
| Métrique | Valeur | Source |
|---|---|---|
| Ce que mesure généralement une affirmation inférieure à 1 % | résumé ancré | Vectara |
| Ce qu’elle ne mesure pas | rappel factuel sans aide | Déduit |
| Taux du même modèle sur un test interne plus difficile | 7,6 % | Vectara |
| Fourchette des taux sur des tests de type rappel libre | 22 % à 94 % | Stanford HAI, 2026 |
| Articles dans l’ensemble de test actuel de Vectara | plus de 7 700 | Vectara |
| Modèles couverts par la fourchette de Stanford | 26 | Stanford HAI, 2026 |
| Questions à poser sur toute affirmation | quel benchmark, quelle tâche, quel échantillon | Déduit |
| Si la comparaison entre sources est valide | non, sans méthodologie équivalente | Déduit |
Les déploiements fondés sur la recherche documentaire se rapprochent effectivement de l’extrémité optimiste, car ils reproduisent les conditions du benchmark optimiste, ce qui est la seule façon légitime d’utiliser les chiffres bas. L’inverse est vrai aussi : un chatbot qui répond à des questions ouvertes sans recherche documentaire devrait être évalué par rapport à la fourchette pessimiste, et citer le chiffre de résumé ancré pour ce produit relève de l’erreur de catégorie plutôt que de l’exagération. Le contexte de la recherche et de la recherche documentaire se trouve dans nos statistiques sur la recherche par IA, et le contexte du paysage des modèles dans nos statistiques sur l’IA open source. Source : Évaluer la fidélité des LLM en RAG avec des classements évolutifs.
Résumé : l’Hallucination de l’IA en Chiffres
| Métrique | Valeur | Source |
|---|---|---|
| Taux le plus bas publié | 0,7 % | Vectara |
| Fourchette des meilleurs modèles, résumé ancré | près de 1,8 % | Vectara |
| Même modèle sous FaithJudge | 7,6 % | Vectara |
| Rapport entre ces mesures | environ 11x | Déduit |
| Fourchette sur 26 modèles de pointe | 22 % à 94 % | Stanford HAI |
| Écart entre le meilleur et le pire modèle | 72 points | Déduit |
| Modèles testés par Stanford HAI | 26 | Stanford HAI |
| Mode de défaillance mesuré par Stanford | hallucination induite par la flagornerie | Stanford HAI |
| Articles dans l’ensemble de test renouvelé de Vectara | plus de 7 700 | Vectara |
| Intention de conception de la refonte | plus exigeante | Vectara |
| Effet sur les taux mesurés | plus élevé | Vectara |
| Tâche en résumé ancré | fidélité à la source fournie | Vectara |
| Tâche dans les benchmarks de rappel libre | production factuelle sans aide | Stanford HAI |
| Chapitre du rapport chez Stanford HAI | IA responsable | Stanford HAI |
| Date de publication de l’AI Index | avril 2026 | Stanford HAI |
| Étendue sur l’ensemble des taux publiés en 2026 | plus de deux ordres de grandeur | Déduit |
Méthodologie et Sources
- Les taux de résumé ancré, la comparaison avec FaithJudge et la refonte de l’ensemble de test de novembre 2025 proviennent du classement public d’hallucination de Vectara et de sa documentation associée (dépôt du classement, annonce de la nouvelle génération du classement).
- La fourchette de 22 % à 94 % sur 26 modèles de pointe, l’angle de la flagornerie et le contexte du chapitre sur l’IA responsable proviennent de l’AI Index 2026 de Stanford HAI, publié en avril 2026 (rapport, enseignements, page d’accueil de l’AI Index).
- Le contexte méthodologique expliquant pourquoi la conception du classement détermine la fidélité mesurée provient de recherches publiées sur les classements RAG évolutifs (arXiv).
- Avertissement sur les données : les chiffres de ce panorama ne doivent pas être moyennés, comparés ou présentés comme un taux unique. Vectara mesure la fidélité à un document fourni ; Stanford HAI mesure un mode de défaillance différent dans des conditions différentes. La refonte de novembre 2025 de Vectara a délibérément augmenté la difficulté du test, si bien que les taux d’avant et d’après ce changement ne sont pas comparables, et une apparente dégradation peut refléter le test plus difficile plutôt que des modèles moins bons. Les chiffres propres à chaque modèle évoluent rapidement à mesure que de nouvelles versions sortent, et tout résultat nommé de plus d’un trimestre doit être considéré comme périmé. La mesure de la flagornerie de Stanford dépend de la formulation du prompt, ce qui relève de la conception expérimentale plutôt que d’une propriété fixe des modèles. Vectara est un fournisseur commercial de produits d’IA fondés sur la recherche documentaire, ce qui lui donne un intérêt pour des benchmarks où l’ancrage donne de bons résultats. Les lignes marquées comme déduites sont des calculs arithmétiques ou des inférences directes à partir des chiffres publiés.
- Dernière mise à jour : 2 août 2026. Nous mettons à jour ce panorama trimestriellement à mesure que Vectara renouvelle son classement et que Stanford HAI publie de nouvelles éditions de l’AI Index.