ทันเอไอ

Global AI & tech news, in your language · every story source-checked

🌐Follow
← Back to news
LINE Facebook X
Модели и исследования AIVerified

Обзор предупреждает о риске Model Collapse при циклическом обучении AI на синтетических данных

Научный обзор обобщает данные о Model Collapse и способах его предотвращения — явлении, которое может возникнуть, когда новые поколения моделей неоднократно обучаются на контенте, созданном AI.

📅 26 авг. 2026 г., 07:49
Обзор предупреждает о риске Model Collapse при циклическом обучении AI на синтетических данных

В отчёте «Reviewing Model Collapse and Countermeasures», опубликованном на arXiv в разделе cs.AI и представленном на IEEE International Conference on Advances in Artificial Intelligence and Machine Learning (AAIML) 2026, рассматриваются исследования Model Collapse — деградации модели из-за повторного обучения на синтетических данных, — а также причины, последствия и меры профилактики.

Проблема возникает в рамках Self-consuming cycle — цикла, в котором модель создаёт данные для обучения следующего поколения. Хотя Synthetic Data позволяет снизить потребность в огромных объёмах реальных данных, их многократное использование без достаточной примеси реальных данных может привести к накоплению и передаче ошибок между поколениями. Это похоже на многократное копирование копии, при котором детали оригинала постепенно исчезают.

На ранней стадии модель начинает хуже понимать редкие случаи, или Tails of distribution. Затем её ответы могут становиться однообразными, повторяющимися и менее разнообразными. Если Recursive training — последовательное обучение на данных предыдущих поколений моделей — продолжится, деградация может привести к искажённым или бессмысленным результатам, а обратить её вспять будет сложно.

Среди предлагаемых мер — сочетание реальных данных от людей с синтетическими, Data curation для отбора и проверки качества данных, а также Feedback mechanism для контроля и корректировки результатов. Цель — не допустить, чтобы созданные AI данные стали основным источником обучения без опоры на реальный мир.

Однако степень риска Model Collapse остаётся предметом споров. Некоторые исследователи считают, что эксперименты в замкнутом цикле могут преувеличивать угрозу по сравнению с реальными условиями, где системы постоянно получают новые данные от людей и не используют синтетические данные на 100%. Поэтому отчёт не утверждает, что любое применение синтетических данных приведёт к коллапсу модели. Он подчёркивает, что происхождение, доля, разнообразие и контроль качества данных будут приобретать всё большее значение по мере распространения созданного AI контента в интернете.

Why it matters
По мере роста доли AI-контента в интернете разработчикам тайскоязычных моделей важно не допустить, чтобы повторное обучение на низкокачественных или дублирующихся данных постепенно вытеснило локальные знания и редкие случаи.
#Model Collapse#Synthetic Data#งานวิจัย AI#arXiv
Sources (rewritten & summarized from): arXiv cs.AI · bytez.com · arxiv.org · toloka.ai · ibm.com · medium.com

Comments

Loading comments…

No sign-up needed · comments are auto-filtered and moderated