Revisada el 2026-10-09
Una alucinación es una respuesta falsa pero plausible que un modelo de lenguaje da con aparente seguridad, como una cita, un dato o una sentencia inventados.12
No es un fallo raro ni misterioso. Según un estudio de OpenAI, nace de cómo se entrenan y se evalúan los modelos, que premian adivinar antes que admitir que no se sabe.1 Se pueden reducir mucho con buenas prácticas, pero no eliminar: lo importante se verifica siempre.2
Por qué ocurren
- Un modelo de lenguaje genera el texto más plausible, no consulta hechos. En el preentrenamiento, si no puede distinguir una afirmación falsa de una cierta, el error aparece por pura presión estadística.1
- Los datos arbitrarios son el caso típico. Si un 20 % de los cumpleaños aparece una sola vez en los datos de entrenamiento, cabe esperar que el modelo base se equivoque en al menos un 20 % de ellos.1
- La evaluación lo agrava. La mayoría de los benchmarks dan un punto por acierto y cero por error o por «no lo sé», así que abstenerse nunca compensa. Como un estudiante ante un test, el modelo aprende a adivinar: se optimiza para examinarse bien.1 Más en cómo leer los benchmarks.
- Un ejemplo del propio estudio: preguntado por el cumpleaños de uno de sus autores, con la orden de responder solo si lo sabía, DeepSeek-V3 dio tres fechas distintas en tres intentos, todas falsas.1
- Lo que pasa dentro, según Anthropic: en Claude, la respuesta por defecto ante lo desconocido es «no puedo responder», y un rasgo de «entidad conocida» la desactiva. Si reconoce un nombre pero sabe poco de él, ese rasgo se activa igual, se apaga el «no lo sé» y el modelo construye una respuesta plausible y falsa.3
Cómo reducirlas
La guía de Anthropic propone, de menos a más esfuerzo:2
- Permitir decir «no lo sé». Darle permiso expreso para reconocer la duda reduce mucho la información falsa.
- Citas literales primero. En documentos largos (más de 20.000 tokens), pedirle que extraiga frases textuales antes de analizar.
- Verificar con citas. Que cada afirmación lleve su cita; si no la encuentra, la retira.
- Limitarse al material. Ordenarle que use solo los documentos aportados y no su conocimiento general.
- Contrastar. Revisar su razonamiento, lanzar el mismo prompt varias veces (las incoherencias entre respuestas delatan invenciones) o pedirle que compruebe sus afirmaciones en una segunda pasada.
Otras dos palancas:
- Darle fuentes. Con la herramienta de búsqueda web, Claude responde con datos posteriores a su fecha de corte y cita de dónde salen.4 La misma idea, con documentos propios, en RAG y el patrón LLM Wiki.
- Fijar un umbral de confianza. OpenAI propone decirle al modelo cómo se puntúa; por ejemplo: «responde solo si tienes más de un 90 % de seguridad; un error resta 9 puntos, un acierto suma 1 y “no lo sé”, 0». Y pide cambiar así la puntuación de los benchmarks principales.1
En el trabajo jurídico
- Mata v. Avianca (Nueva York, 2023). Los abogados presentaron sentencias inexistentes, con citas falsas generadas por ChatGPT, y las sostuvieron después de que el juez las cuestionara. Multa de 5.000 dólares. El juez dejó claro que usar una herramienta de IA fiable no es impropio en sí, pero que el abogado responde de la exactitud de lo que presenta.5
- TSJ de Navarra (2026). Archivó sin multa el procedimiento contra una abogada que incluyó ocho citas de sentencias inventadas en un recurso; su rápida reacción fue determinante. La nota no dice qué herramienta las generó, pero el tribunal advirtió de que el uso fraudulento de la IA puede sancionarse por mala fe procesal, con multas de 180 a 6.000 euros según la Ley de Enjuiciamiento Civil.6
Cómo lo uso
- Esta wiki convierte en regla la técnica de verificar con citas. El
CLAUDE.mddel proyecto dice «Nada se afirma sin fuente enlazada; si no se puede verificar, se dice», y la línea editorial obliga a marcar el dato sin fuente con[cita requerida], sin presentarlo como cierto. scripts/revisar.pyavisa de las fichas sin referencias con ese mismo lema.- Ejemplo real: en la ficha de arnés de IA, el autor del vídeo dice que hay estudios que respaldan una afirmación, pero no los cita. Quedó marcada con
[cita requerida]en lugar de darla por buena. - A mi entender, es la misma lógica que el umbral de confianza de OpenAI: mejor un hueco declarado que un dato inventado.
Véase también
Referencias
Footnotes
-
Why Language Models Hallucinate. Adam Tauman Kalai, Ofir Nachum y Edwin Zhang (OpenAI) y Santosh S. Vempala (Georgia Tech), 2025-09-04; también en arXiv:2509.04664. La entrada del blog de OpenAI devolvió 403; se ha usado el artículo completo. Consultado el 2026-10-09. ↩ ↩2 ↩3 ↩4 ↩5 ↩6 ↩7
-
Reduce hallucinations. Anthropic, documentación de la API. Consultado el 2026-10-09. ↩ ↩2 ↩3
-
Tracing the thoughts of a large language model. Anthropic, 2025-03-27. Consultado el 2026-10-09. ↩
-
Web search tool. Anthropic, documentación de la API. Consultado el 2026-10-09. ↩
-
Mata v. Avianca, Inc., Opinion and Order on Sanctions. Tribunal de Distrito de EE. UU. para el Distrito Sur de Nueva York, juez P. Kevin Castel, caso 22-cv-1461, 2023-06-22 (copia en CourtListener). Consultado el 2026-10-09. ↩
-
El Tribunal Superior de Navarra advierte de que el uso fraudulento de inteligencia artificial es sancionable por mala fe procesal. Consejo General del Poder Judicial, nota de prensa del TSJ de Navarra, 2026-03-26. Consultado el 2026-10-09. ↩