El mismo modelo puede medirse en 0,7% y en 7,6% de alucinación según el benchmark que se ejecute, y en 26 modelos de vanguardia Stanford HAI registró un rango de 22% a 94%. Esa dispersión es el dato más importante sobre las estadísticas de alucinación de la IA en 2026: el diseño del benchmark determina el número destacado mucho más que la calidad del modelo. La sumarización fundamentada, en la que el modelo recibe el texto de origen, produce las cifras favorables que aparecen en los materiales de los proveedores. Las pruebas de recall abierto, más cercanas a cómo la gente realmente usa estos sistemas, producen cifras un orden de magnitud peores. Los datos que siguen provienen del ranking de alucinación de Vectara y del AI Index 2026 de Stanford HAI.
Lo Esencial
- Las tasas de alucinación reportadas en 2026 van de aproximadamente 0,7% a 94% según el benchmark (Vectara, Stanford HAI)
- Gemini-2.0-Flash-001 registró 0,7% en sumarización fundamentada (Vectara)
- El mismo modelo obtiene 7,6% en el benchmark FaithJudge de Vectara (Vectara)
- Eso equivale a una diferencia de aproximadamente once veces para un mismo modelo (derivado)
- Stanford HAI registró de 22% a 94% en 26 modelos de vanguardia (Stanford HAI, 2026)
- Esas cifras miden la alucinación inducida por adulación (Stanford HAI, 2026)
- La actualización de noviembre de 2025 de Vectara usó más de 7.700 artículos (Vectara)
- La actualización fue diseñada para ser notablemente más exigente (Vectara)
- Las tasas medidas subieron como resultado directo de la prueba más difícil (Vectara)
- Las mejores filas del ranking de sumarización fundamentada rondan el 1,8% (Vectara)
- Los hallazgos de Stanford aparecen en su capítulo de IA Responsable (Stanford HAI, 2026)
- La sumarización fundamentada le da al modelo el texto de origen (Vectara)
- Los benchmarks de recall abierto exigen que el modelo produzca datos sin apoyo (Stanford HAI)
1. El Rango Es el Dato
Cualquiera que cite una única tasa de alucinación está describiendo un benchmark, no el fenómeno. Las tasas publicadas en 2026 van de aproximadamente 0,7% en el mejor extremo del ranking de sumarización fundamentada de Vectara a entre 22% y 94% en los 26 modelos de vanguardia que evaluó Stanford HAI. No son estimaciones que compitan por la misma magnitud; son mediciones de tareas distintas, y la brecha entre ellas supera los dos órdenes de magnitud.
| Métrica | Valor | Fuente |
|---|---|---|
| Tasa más baja publicada, sumarización fundamentada | 0,7% | Vectara |
| Mejores filas de ese ranking | cerca de 1,8% | Vectara |
| Rango entre los 26 modelos de vanguardia | 22% a 94% | Stanford HAI, 2026 |
| Modelo que logró la cifra de 0,7% | Gemini-2.0-Flash-001 | Vectara |
| Mismo modelo bajo FaithJudge | 7,6% | Vectara |
| Proporción entre esas dos mediciones | cerca de 11x | Derivado de las cifras de Vectara |
| Brecha entre la tasa más baja y la más alta publicadas | más de dos órdenes de magnitud | Derivado |
| Qué determina el número | el diseño del benchmark | Vectara, Stanford HAI |
La brecha de once veces para un mismo modelo en dos benchmarks de la misma organización es la demostración más clara disponible de que estas cifras describen pruebas, no modelos.
Esto tiene una consecuencia práctica que suele perderse en la discusión sobre benchmarks. Si está eligiendo un modelo para una aplicación basada en recuperación, en la que el sistema siempre aporta los documentos de origen, las cifras de sumarización fundamentada son las relevantes, y una tasa inferior al 2% es una expectativa razonable. Si está eligiendo un modelo para responder preguntas desde su propio conocimiento, esas mismas cifras son activamente engañosas, y la franja de 22% a 94% se acerca más a lo que debería planear. La mayor parte de la decepción en producción con estos sistemas se remonta a un equipo que evaluó de una forma y desplegó de otra. El benchmark no está equivocado; estaba respondiendo a una pregunta distinta de la que plantea el despliegue. Fuente: ranking de alucinación de Vectara.
2. Sumarización Fundamentada: La Prueba Optimista
El benchmark que produce cifras inferiores al 1% hace algo específico y acotado. La sumarización fundamentada le entrega al modelo un documento de origen y comprueba si el resumen resultante se mantiene fiel a él, lo que elimina la necesidad de que el modelo sepa nada. Es una medición genuina y útil de un modo de fallo, y es la que citan los proveedores.
| Métrica | Valor | Fuente |
|---|---|---|
| Tarea medida | fidelidad de un resumen al texto de origen proporcionado | Vectara |
| Tasa más baja registrada | 0,7% | Vectara |
| Franja típica de los mejores modelos | cerca de 1,8% | Vectara |
| Artículos en la actualización de noviembre de 2025 | más de 7.700 | Vectara |
| Intención de diseño de la actualización | mayor, más robusta, más exigente | Vectara |
| Efecto de la actualización en las tasas medidas | más alto | Vectara |
| Lo que la tarea no evalúa | recall factual sin apoyo | Derivado |
| Por qué la citan los proveedores | produce las cifras más bajas | Derivado |
El detalle de la actualización importa más de lo que parece a primera vista: la alucinación medida subió porque la prueba se hizo más difícil, no porque los modelos empeoraran, lo que significa que las comparaciones interanuales en este ranking no son fiables entre versiones. Fuente: Vectara sobre la nueva generación de su ranking de alucinación.
3. Recall Abierto: La Prueba Pesimista
Los benchmarks que producen cifras de dos dígitos y cercanas a tres dígitos evalúan algo mucho más parecido al uso real. Stanford HAI registró tasas de alucinación de 22% a 94% en 26 modelos de vanguardia, en un benchmark de precisión reportado en su capítulo de IA Responsable de 2026. Cuando un modelo debe aportar datos desde sus propios parámetros en lugar de un documento frente a él, la tasa de fallo aumenta drásticamente.
| Métrica | Valor | Fuente |
|---|---|---|
| Tasa más baja entre los 26 modelos | 22% | Stanford HAI, 2026 |
| Tasa más alta entre los 26 modelos | 94% | Stanford HAI, 2026 |
| Número de modelos de vanguardia evaluados | 26 | Stanford HAI, 2026 |
| Diferencia entre el mejor y el peor modelo | 72 puntos | Derivado de las cifras de Stanford |
| Capítulo que reporta el hallazgo | IA Responsable | Stanford HAI, 2026 |
| Modo de fallo medido | alucinación inducida por adulación | Stanford HAI, 2026 |
| Fecha de publicación del AI Index | abril de 2026 | Stanford HAI |
| Comparación con las tasas de sumarización fundamentada | mucho más alta | Derivado |
Una diferencia de 72 puntos entre el mejor y el peor modelo de vanguardia en la misma prueba ya es notable de por sí: la elección del modelo importa muchísimo en esta tarea, y casi nada en la sumarización fundamentada, donde todo se agrupa en dígitos únicos bajos. Fuente: Informe AI Index 2026 de Stanford HAI.
4. La Adulación Es un Modo de Fallo Distinto
El enfoque de Stanford vale la pena separarlo del error factual común. La alucinación inducida por adulación significa que el modelo se ajusta a una premisa planteada por el usuario, aunque esa premisa sea falsa, un mecanismo distinto al de un modelo que simplemente no sabe algo. También significa que la tasa medida depende, en parte, de cómo se formula la pregunta, no solo de lo que sabe el modelo.
| Métrica | Valor | Fuente |
|---|---|---|
| Modo de fallo | ajustarse a una premisa falsa del usuario | Stanford HAI, 2026 |
| Rango de tasas entre modelos | 22% a 94% | Stanford HAI, 2026 |
| Modelos evaluados | 26 modelos de vanguardia | Stanford HAI, 2026 |
| Diferencia con el error factual común | el mecanismo es distinto | Stanford HAI, 2026 |
| Dependencia del planteamiento del prompt | alta | Derivado |
| Capítulo del informe | IA Responsable | Stanford HAI, 2026 |
| Hallazgo más amplio del AI Index sobre divulgación | la divulgación de IA responsable va por detrás de la capacidad | Stanford HAI, 2026 |
| Implicación para la evaluación | el diseño del prompt es parte de la medición | Derivado |
La consecuencia práctica resulta incómoda para quien despliega estos sistemas: un modelo puede ser muy preciso cuando se le pregunta de forma neutral y muy poco fiable cuando un usuario afirma algo incorrecto primero. El contexto de despliegue está en nuestras estadísticas de adopción de IA empresarial. Fuente: Stanford HAI, 12 conclusiones del AI Index 2026.
5. Cómo Leer la Afirmación de un Proveedor
La conclusión práctica es una lista breve de verificación. Una afirmación de alucinación inferior al 1% casi con certeza corresponde a sumarización fundamentada, en la que el modelo recibió el material de origen, y no dice nada sobre el recall sin apoyo. La pregunta correcta nunca es “cuál es la tasa de alucinación” sino “en qué benchmark, en qué tarea, con qué tamaño de muestra”.
| Métrica | Valor | Fuente |
|---|---|---|
| Qué suele medir una afirmación inferior al 1% | sumarización fundamentada | Vectara |
| Qué no mide | recall factual sin apoyo | Derivado |
| Tasa del mismo modelo en una prueba interna más difícil | 7,6% | Vectara |
| Franja de tasas en pruebas de estilo recall abierto | 22% a 94% | Stanford HAI, 2026 |
| Artículos en el conjunto de prueba actual de Vectara | más de 7.700 | Vectara |
| Modelos cubiertos por el rango de Stanford | 26 | Stanford HAI, 2026 |
| Preguntas que hacer sobre cualquier afirmación | qué benchmark, qué tarea, qué muestra | Derivado |
| Si la comparación entre fuentes es válida | no, sin metodología equivalente | Derivado |
Los despliegues basados en recuperación sí se acercan más al extremo optimista, porque replican las condiciones del benchmark optimista, que es la única forma legítima de usar las cifras bajas. Lo contrario también es cierto: un chatbot que responde preguntas abiertas sin recuperación debería evaluarse frente a la franja pesimista, y citar la cifra de sumarización fundamentada para ese producto es un error de categoría, no una exageración. El contexto de búsqueda y recuperación está en nuestras estadísticas de búsqueda con IA, y el contexto del panorama de modelos en nuestras estadísticas de IA de código abierto. Fuente: Evaluación de la fidelidad de los LLM en RAG con rankings en evolución.
Resumen: Alucinación de la IA en Cifras
| Métrica | Valor | Fuente |
|---|---|---|
| Tasa más baja publicada | 0,7% | Vectara |
| Franja de los mejores modelos, sumarización fundamentada | cerca de 1,8% | Vectara |
| Mismo modelo bajo FaithJudge | 7,6% | Vectara |
| Proporción entre esas mediciones | cerca de 11x | Derivado |
| Rango entre 26 modelos de vanguardia | 22% a 94% | Stanford HAI |
| Diferencia entre el mejor y el peor modelo | 72 puntos | Derivado |
| Modelos evaluados por Stanford HAI | 26 | Stanford HAI |
| Modo de fallo medido por Stanford | alucinación inducida por adulación | Stanford HAI |
| Artículos en el conjunto de prueba renovado de Vectara | más de 7.700 | Vectara |
| Intención de diseño de la actualización | más exigente | Vectara |
| Efecto en las tasas medidas | más alto | Vectara |
| Tarea en la sumarización fundamentada | fidelidad a la fuente proporcionada | Vectara |
| Tarea en los benchmarks de recall abierto | producción factual sin apoyo | Stanford HAI |
| Capítulo del informe en Stanford HAI | IA Responsable | Stanford HAI |
| Fecha de publicación del AI Index | abril de 2026 | Stanford HAI |
| Amplitud entre todas las tasas publicadas en 2026 | más de dos órdenes de magnitud | Derivado |
Metodología y Fuentes
- Las tasas de sumarización fundamentada, la comparación con FaithJudge y la actualización del conjunto de prueba de noviembre de 2025 provienen del ranking público de alucinación de Vectara y su documentación complementaria (repositorio del ranking, anuncio de la nueva generación del ranking).
- El rango de 22% a 94% en 26 modelos de vanguardia, el enfoque de adulación y el contexto del capítulo de IA Responsable provienen del AI Index 2026 de Stanford HAI, publicado en abril de 2026 (informe, conclusiones, página del AI Index).
- El trasfondo metodológico sobre por qué el diseño del ranking determina la fidelidad medida proviene de investigación publicada sobre benchmarks de RAG en evolución (arXiv).
- Aviso sobre los datos: las cifras de este análisis no deben promediarse, compararse ni presentarse como una tasa única. Vectara mide la fidelidad a un documento proporcionado; Stanford HAI mide un modo de fallo distinto bajo condiciones distintas. La actualización de noviembre de 2025 de Vectara aumentó deliberadamente la dificultad de la prueba, por lo que las tasas antes y después de ese cambio no son comparables, y un aparente empeoramiento puede reflejar la prueba más difícil en lugar de modelos peores. Las cifras específicas de cada modelo cambian rápidamente a medida que se lanzan nuevas versiones, y cualquier resultado de un modelo concreto con más de un trimestre de antigüedad debe tratarse como desactualizado. La medición de adulación de Stanford depende del planteamiento del prompt, que forma parte del diseño experimental y no es una propiedad fija de los modelos. Vectara es un proveedor comercial de productos de IA basados en recuperación, lo que le da interés en benchmarks donde la fundamentación rinde bien. Las filas marcadas como derivadas son cálculos aritméticos o inferencias directas a partir de las cifras publicadas.
- Última actualización: 2 de agosto de 2026. Actualizamos este análisis trimestralmente a medida que Vectara renueva su ranking y Stanford HAI publica nuevas ediciones del AI Index.