¿Por qué alucinan los modelos de IA y fundamentarlos en fuentes reales lo soluciona?
Respuesta corta: No: la fundamentación no cura la alucinación. La reduce de forma sustancial y cambia el tipo de error que obtienes: de inventarse una fuente a leer mal una real. Lo que queda es verificable, que es la parte importante. La recuperación por sí sola no elimina el incentivo de un modelo a adivinar.
Construimos un motor de investigación que entrega pasajes bíblicos, morfología y entradas léxicas a una IA como resultados de herramientas. Por tanto, tenemos un interés evidente en la afirmación de que la fundamentación soluciona la alucinación. Esta publicación es la versión honesta de esa afirmación, incluido el estudio que la contradice.
¿Qué cuenta como una alucinación?
Una alucinación es una falsedad plausible expresada con la misma seguridad que un hecho: una cita inventada, un versículo que no existe, un número de Strong que nunca se asignó. No es un error de software en el sentido habitual. Los modelos rara vez escriben mal las palabras o producen disparates; producen datos erróneos, específicos y bien formados. Esa especificidad es el indicio revelador y señala de dónde procede este comportamiento.
¿Por qué lo hacen?
La respuesta más útil publicada hasta la fecha es que la alucinación es un problema de incentivos, no un misterio. Kalai, Nachum, Vempala y Zhang en OpenAI lo expusieron en Why Language Models Hallucinate, publicado en Nature en 2026: las evaluaciones de referencia frente a las que todo el sector optimiza puntúan la exactitud, lo que no otorga ningún mérito a decir «no lo sé» y da puntuación completa por un acierto fortuito al adivinar. Un modelo entrenado y seleccionado bajo ese sistema de puntuación aprende a tirarse un farol.
Su demostración en la evaluación SimpleQA es la versión más clara de esto. Un modelo respondió a casi todas las preguntas y se equivocó en más de tres cuartas partes de los casos. Otro se abstuvo en aproximadamente la mitad y cometió muchos menos errores, y aun así obtuvo una puntuación peor en exactitud, porque abstenerse no otorga nada. Si el marcador premia el adivinar, los modelos adivinan.
Esto tiene una consecuencia que la gente pasa por alto cuando recurre a la recuperación como solución. Los mismos autores señalan explícitamente que la búsqueda web y el escalado no llevarán la exactitud al 100 %, porque algunas preguntas no tienen una respuesta disponible. El incentivo a adivinar sobrevive a la incorporación de una herramienta de búsqueda.
¿Con qué frecuencia ocurre en realidad?
Con la suficiente frecuencia como para que las cifras de los titulares parezcan inverosímiles hasta que lees las definiciones. Tres evaluaciones de referencia miden tres cosas distintas, y citar una sin su definición es donde empieza la confusión.
| Evaluación | Qué mide | Conclusión principal |
|---|---|---|
| AA-Omniscience (Artificial Analysis) | De las preguntas que un modelo falló o se saltó, con qué frecuencia adivinó en lugar de abstenerse: una tasa de exceso de confianza | 6000 preguntas sobre 42 temas. En su lanzamiento en noviembre de 2025, 33 de 36 modelos tenían más probabilidades de alucinar que de responder correctamente en preguntas difíciles; solo tres obtuvieron una puntuación superior a cero en el índice |
| Vectara HHEM | Fidelidad al resumir un documento que se le entrega: lo más parecido a un indicador directo para pipelines de recuperación | Las tasas son más altas en el conjunto más nuevo de 7700 artículos (derecho, medicina, finanzas, educación, tecnología) que en el anterior, más breve. Las negativas a responder se puntúan por separado como tasa de respuesta, no se computan como fidelidad; sin esto, un modelo que lo rechace todo parecería perfecto |
| Estudio jurídico de Stanford RegLab | Si las herramientas jurídicas comerciales fundamentadas en recuperación producen citas falsas o sin fundamento | Las herramientas alucinaron en más del 17 % de las consultas, frente a las afirmaciones de los proveedores de «prácticamente cero» |
La cifra más citada de 2026 es otra cuarta medición distinta, y habitualmente se cita mal. El informe 2026 AI Index de Stanford HAI informa de tasas de alucinación de entre el 22 % y el 94 % en 26 modelos punteros, no en ninguno de los tres anteriores, sino en una evaluación que sondea si un modelo sabe distinguir el conocimiento de la creencia. El detalle subyacente es el que debería preocuparte: cuando se le plantea a un modelo una afirmación falsa como algo que cree otra persona, la gestiona bien. Cuando la misma afirmación exacta se plantea como algo que crees tú, el rendimiento se desploma. La exactitud de GPT-4o cayó del 98,2 % al 64,4 %; la de DeepSeek R1, de más del 90 % al 14,4 %.
Ese es un fallo diferente de los otros tres, y es el que golpea con más fuerza en el estudio bíblico, donde un lector casi siempre llega con una premisa. Pídele a un asistente que confirme lo que significa una palabra griega y podrías obtener una respuesta condicionada por lo que diste a entender que esperabas.
Entonces, ¿ayuda la fundamentación o no?
Ambas cosas, y la distinción es la clave de todo.
El estudio de Stanford RegLab se cita habitualmente como la refutación de la generación aumentada por recuperación (RAG), y respecto a las afirmaciones comerciales, lo es. Pero lee lo que realmente midió: las herramientas jurídicas fundamentadas en recuperación alucinaron menos que GPT-4 de propósito general ante las mismas consultas. La fundamentación funcionó. Solo que no funcionó ni de lejos tan bien como decían quienes la vendían.
Los aspectos en los que falla la recuperación son concretos y merece la pena conocerlos:
- Relevante pero insuficiente. El fragmento recuperado trata sobre el tema correcto pero no contiene la respuesta. El modelo rellena el hueco.
- Fuentes contradictorias. Dos documentos recuperados discrepan; el modelo elige uno y lo presenta como algo resuelto.
- Pérdida en medio del contexto. Los contextos extensos sepultan la frase decisiva allí donde el modelo presta menos atención.
- Efecto acumulativo. En bucles de agentes, un resultado intermedio alucinado se convierte en la entrada de la siguiente recuperación, y el error se propaga.
Qué cambia realmente la fundamentación
He aquí la formulación honesta, y es más sólida que la comercial: la fundamentación no hace que una IA acierte. Hace que se equivoque de una forma que puedes detectar.
Un modelo sin fundamentar que inventa la entrada de Thayer para una palabra griega te entrega una invención sin ningún hilo que conduzca a nada. Uno fundamentado que lee mal la entrada real te entrega una afirmación, un lema y una referencia; y treinta segundos de comprobación resuelven la duda. El primer fallo es invisible. El segundo es auditable. En cualquier ámbito donde equivocarse tenga un coste (el derecho, la medicina, un sermón en domingo), esa diferencia constituye todo el valor.
De ello se deduce que la pregunta de diseño no es «cómo hacemos para que deje de alucinar», sino «qué le entregamos al modelo y puede el lector comprobarlo?». Razón por la cual hicimos que Darash devuelva materiales originales con citas adjuntas en lugar de conclusiones. Una conclusión no se puede comprobar. Un número de Strong, un análisis morfológico y un léxico identificado sí.
Y por eso el corpus subyacente tiene que ser correcto. Cuando reconstruimos el léxico griego de Thayer a partir de la edición impresa de Harper & Brothers de 1889, transcribimos las 716 páginas del cuerpo principal a partir de las imágenes de página y cotejamos los testimonios entre sí: coincidían en el 98,91 % de los 856 793 tokens, y cada punto en disputa se dirimió frente a la imagen de la página en lugar de resolverse según la lectura que resultara más fluida. La norma fue que no podía existir ningún carácter que no estuviera en la página: un dígito ilegible de Josefo se sigue sirviendo como un signo de interrogación, porque rellenarlo habría sido una alucinación con nuestro nombre.
Publicamos ese margen de error medido del 0,19 % en lugar de afirmar que el corpus es perfecto, lo cual responde a la misma disciplina de la que trata todo este artículo: una tasa de error declarada es comprobable, mientras que una afirmación de un 100 % no lo es. El método completo está publicado, con defectos y todo.
Qué significa esto si estudias con una IA
De esto se desprenden tres conclusiones, ninguna de las cuales te obliga a comprar nada:
- Pide siempre la referencia. Un modelo que no puede indicar de dónde procede una afirmación está recitando, no leyendo. Haz que la cita sea el resultado exigido, no una cortesía. Nuestro orden de prioridad sobre a qué herramientas de estudio bíblico recurrir primero se basa en la misma regla.
- Trata la seguridad como ruido. La fluidez y la certeza no aportan ninguna información sobre la corrección. Las evaluaciones de referencia anteriores miden exactamente esto y no encuentran ninguna relación fiable entre la capacidad general de un modelo y su fiabilidad factual.
- Proporciónale las fuentes y luego compruébalas. La fundamentación traslada el trabajo de confiar a verificar. Verificar requiere esfuerzo, pero mucho menos esfuerzo que estar silenciosamente equivocado durante un año.
Preguntas frecuentes
¿Elimina RAG la alucinación?
No. El estudio de Stanford RegLab constató que las herramientas jurídicas comerciales fundamentadas en recuperación seguían alucinando en más del 17 % de las consultas, a pesar de que los proveedores describían el problema como resuelto. La recuperación reduce la alucinación; no la elimina.
¿Por qué los laboratorios no se limitan a solucionarlo?
Porque el incentivo se encuentra en la evaluación, no solo en el modelo. Mientras las evaluaciones de referencia que definen el progreso no otorguen nada por admitir la incertidumbre, los modelos se seleccionarán para adivinar con seguridad. La propuesta del artículo de OpenAI es cambiar el sistema de puntuación, no solo los modelos.
¿Alucinan menos los modelos más nuevos?
En cierta medida, y de forma desigual. La capacidad general no predice la fiabilidad factual: Artificial Analysis encontró modelos con puntuaciones altas de inteligencia general y malas tasas de alucinación, y a la inversa. Elige en función de la propiedad que necesites.
¿Una baja tasa de alucinación es siempre algo bueno?
No, y esta es la trampa de las cifras. Un modelo que rechaza la mayoría de las preguntas registra una tasa excelente al no arriesgarse jamás a dar una respuesta. Lee la tasa de abstención junto a ella o el dato no significará nada.
¿Una herramienta de investigación bíblica hace que una IA sea fiable respecto a las Escrituras?
Hace que sea verificable, que no es lo mismo. Obtienes el hebreo o el griego, el análisis morfológico y la entrada del léxico con referencias adjuntas, de modo que se puede detectar una lectura errónea. La lectura en sí sigue dependiendo de tu propio juicio.
Míralo en funcionamiento: conecta Darash a la IA que ya utilizas: una sola URL, un inicio de sesión normal, 45 días de prueba gratuita; la guía paso a paso para Claude, ChatGPT y Cursor lleva cinco minutos. O lee cómo se compara Darash con Logos, Accordance y Blue Letter Bible antes de conectar nada.
Escrito por Jørn André Halseth, fundador de Publifye AS: diez años publicando Biblias y construyendo las imprentas en las que se ejecutan, editor de 4268 ediciones de la Biblia y autor de Darash, Junifye, Lexifye y Tringine. Acerca de · Contacto
Recibe un correo cuando lancemos algo nuevo. Suscríbete al boletín