ทันเอไอ

Global AI & tech news, in your language · every story source-checked

🌐Follow
← Back to news
LINE Facebook X
Modèles et recherche en AIVerified

Une revue alerte sur le risque de Model Collapse lors de l’entraînement de l’AI avec des données synthétiques

Une étude rassemble les preuves et les mesures permettant de lutter contre le Model Collapse, susceptible de survenir lorsque de nouveaux modèles apprennent de données générées par l’AI sur plusieurs générations successives.

📅 26 août 2026, 07:49
Une revue alerte sur le risque de Model Collapse lors de l’entraînement de l’AI avec des données synthétiques

Le rapport « Reviewing Model Collapse and Countermeasures », publié sur arXiv dans la catégorie cs.AI et présenté à l’IEEE International Conference on Advances in Artificial Intelligence and Machine Learning (AAIML) 2026, passe en revue les recherches consacrées au Model Collapse — la dégradation des modèles due à l’apprentissage répété sur des données synthétiques — ainsi que ses causes, ses effets et les mesures préventives.

Ce problème apparaît dans un Self-consuming cycle, où un modèle génère des données servant à entraîner la génération suivante. Si les Synthetic Data créées par l’AI réduisent le besoin d’immenses volumes de données réelles, leur réutilisation répétée sans apport suffisant de données réelles peut accumuler et transmettre les erreurs d’une génération à l’autre. Le phénomène ressemble à des photocopies successives d’une copie, qui effacent progressivement les détails de l’original.

À un stade précoce, le modèle commence à perdre sa compréhension des cas rares, ou Tails of distribution. Ses résultats peuvent ensuite devenir plus uniformes, répétitifs et moins variés. Si le Recursive training à partir des données de modèles antérieurs se poursuit, la dégradation peut s’aggraver jusqu’à produire des résultats déformés ou dénués de sens, avec un retour en arrière potentiellement difficile.

Parmi les solutions proposées figurent le mélange de données humaines réelles et de données synthétiques, la Data curation pour sélectionner et contrôler la qualité des données, ainsi que des Feedback mechanisms pour vérifier et ajuster les résultats. L’objectif est d’éviter que les données issues de l’AI ne deviennent la principale source d’apprentissage sans référence au monde réel.

Le risque de Model Collapse reste toutefois débattu. Certains chercheurs estiment que les expériences en circuit fermé peuvent exagérer le phénomène par rapport aux conditions réelles, où de nouvelles données humaines sont généralement ajoutées en continu et où les données synthétiques ne représentent pas 100 % du corpus. Le rapport ne conclut donc pas que toute utilisation de données synthétiques entraîne l’effondrement d’un modèle, mais souligne que l’origine, la proportion, la diversité et le contrôle qualité des données deviendront essentiels à mesure que les contenus générés par l’AI se répandront sur Internet.

Why it matters
À mesure que les contenus générés par l’AI se multiplient sur le Web, les développeurs de modèles en langue thaïlandaise doivent éviter de réutiliser des données médiocres ou redondantes au point de faire disparaître progressivement les connaissances locales et les cas rares.
#Model Collapse#Synthetic Data#งานวิจัย AI#arXiv
Sources (rewritten & summarized from): arXiv cs.AI · bytez.com · arxiv.org · toloka.ai · ibm.com · medium.com

Comments

Loading comments…

No sign-up needed · comments are auto-filtered and moderated