Un estudio revela que los LLM fallan hasta en el 96,7 % al escribir autobiografías, inventando y distorsionando hechos
Una nueva investigación revela que los modelos de lenguaje de gran tamaño inventan contenido en casi todos los casos al generar autobiografías, en comparación con los registros reales de la vida narrada.
Un estudio reciente titulado "Auditing the Synthetic Memoir: Measuring Scene-Level Confabulation in LLM-Generated Autobiography Against the Documented Record of the Life It Describes", publicado en arXiv en agosto de 2026, realizó el primer análisis cuantitativo de la confabulación de los modelos de lenguaje de gran tamaño o LLM (Large Language Model) al escribir la autobiografía de una persona.
La autora, Heather Renze, pidió a un LLM que redactara una autobiografía diaria durante 366 días, proporcionándole únicamente una plantilla, dos días de ejemplo y una cita para cada jornada. Después verificó minuciosamente el contenido de cada día frente a un corpus de referencia con hechos reales, mediante una escala de evaluación de cuatro niveles definida previamente.
El estudio halló una tasa de fallos de verificación del 96,7 %: 354 de los 366 días no superaron los criterios de validación y solo 12 coincidieron con los hechos. Además, 19 días —el 5,2 %— incluyeron sucesos que contradecían directamente la realidad.
El error más frecuente fue el "Grounded drift", que consiste en mezclar personas, lugares o empleadores reales con acontecimientos inventados por el modelo. El estudio concluye que usar los actuales modelos de IA para narrar historias de vida aún conlleva un alto riesgo de generar información incorrecta si no cuentan con un Grounding adecuado.
Expone una limitación crucial de la IA al procesar recuerdos y biografías, y alerta sobre sus imprecisiones y datos inventados cuando se emplea en tareas que exigen gran exactitud.