Исследование: LLM ошибаются в автобиографиях в 96,7% случаев, выдумывая и искажая факты
Новое исследование показало, что созданные большими языковыми моделями автобиографии почти всегда содержат вымышленные сведения по сравнению с реальными записями о жизни человека
В августе 2026 года на arXiv было опубликовано исследование «Auditing the Synthetic Memoir: Measuring Scene-Level Confabulation in LLM-Generated Autobiography Against the Documented Record of the Life It Describes». Авторы впервые количественно оценили склонность больших языковых моделей, или LLM (Large Language Model), к конфабуляциям при написании автобиографий.
Автор исследования Heather Renze поручила диалоговой LLM составить ежедневную автобиографию за 366 дней, предоставив лишь шаблон, примеры для двух дней и цитату дня. Затем каждая запись была тщательно сопоставлена с корпусом документально подтверждённых событий (Ground-truth corpus) по заранее установленной четырёхуровневой системе оценки.
Исследование выявило, что доля записей, не прошедших проверку достоверности (Verification-failure rate), достигла 96,7%: подтверждение не получили 354 из 366 дней. С реальностью совпали события лишь за 12 дней, а записи за 19 дней — 5,2% — прямо противоречили фактам.
Наиболее распространённой ошибкой оказался «Grounded drift»: модель включала реальных людей, места и работодателей в самостоятельно выдуманные события. Исследование заключает, что современные AI-модели по-прежнему крайне ненадёжны при создании историй жизни без надлежащей фактологической основы, или Grounding.
Исследование показывает важное ограничение AI при работе с воспоминаниями и биографиями и предупреждает о риске искажений и вымышленных данных в задачах, требующих высокой точности