Обзор предупреждает о риске Model Collapse при циклическом обучении AI на синтетических данных
Научный обзор обобщает данные о Model Collapse и способах его предотвращения — явлении, которое может возникнуть, когда новые поколения моделей неоднократно обучаются на контенте, созданном AI.
В отчёте «Reviewing Model Collapse and Countermeasures», опубликованном на arXiv в разделе cs.AI и представленном на IEEE International Conference on Advances in Artificial Intelligence and Machine Learning (AAIML) 2026, рассматриваются исследования Model Collapse — деградации модели из-за повторного обучения на синтетических данных, — а также причины, последствия и меры профилактики.
Проблема возникает в рамках Self-consuming cycle — цикла, в котором модель создаёт данные для обучения следующего поколения. Хотя Synthetic Data позволяет снизить потребность в огромных объёмах реальных данных, их многократное использование без достаточной примеси реальных данных может привести к накоплению и передаче ошибок между поколениями. Это похоже на многократное копирование копии, при котором детали оригинала постепенно исчезают.
На ранней стадии модель начинает хуже понимать редкие случаи, или Tails of distribution. Затем её ответы могут становиться однообразными, повторяющимися и менее разнообразными. Если Recursive training — последовательное обучение на данных предыдущих поколений моделей — продолжится, деградация может привести к искажённым или бессмысленным результатам, а обратить её вспять будет сложно.
Среди предлагаемых мер — сочетание реальных данных от людей с синтетическими, Data curation для отбора и проверки качества данных, а также Feedback mechanism для контроля и корректировки результатов. Цель — не допустить, чтобы созданные AI данные стали основным источником обучения без опоры на реальный мир.
Однако степень риска Model Collapse остаётся предметом споров. Некоторые исследователи считают, что эксперименты в замкнутом цикле могут преувеличивать угрозу по сравнению с реальными условиями, где системы постоянно получают новые данные от людей и не используют синтетические данные на 100%. Поэтому отчёт не утверждает, что любое применение синтетических данных приведёт к коллапсу модели. Он подчёркивает, что происхождение, доля, разнообразие и контроль качества данных будут приобретать всё большее значение по мере распространения созданного AI контента в интернете.
По мере роста доли AI-контента в интернете разработчикам тайскоязычных моделей важно не допустить, чтобы повторное обучение на низкокачественных или дублирующихся данных постепенно вытеснило локальные знания и редкие случаи.