Una revisión advierte del riesgo de Model Collapse al entrenar IA con datos sintéticos
Un informe académico recopila evidencias y medidas contra el Model Collapse, que puede surgir cuando nuevas generaciones de modelos aprenden repetidamente de datos creados por IA.
El informe “Reviewing Model Collapse and Countermeasures”, publicado en arXiv dentro de la categoría cs.AI y presentado en la IEEE International Conference on Advances in Artificial Intelligence and Machine Learning (AAIML) de 2026, revisa investigaciones sobre Model Collapse —el deterioro de modelos por aprender reiteradamente de datos sintéticos—, incluidas sus causas, efectos y medidas preventivas.
El problema surge en un Self-consuming cycle, en el que un modelo genera datos para entrenar a la siguiente generación. Aunque los Synthetic Data creados por IA reducen la necesidad de enormes volúmenes de datos reales, reutilizarlos sin suficientes datos reales puede acumular y transmitir errores entre generaciones, como hacer fotocopias sucesivas de una copia hasta que los detalles del original desaparecen gradualmente.
Una señal temprana es que el modelo pierde comprensión de casos poco frecuentes, o Tails of distribution. Después, los resultados pueden volverse homogéneos, repetitivos y menos diversos. Si continúa el Recursive training con datos de modelos anteriores, el deterioro puede agravarse hasta producir resultados distorsionados o incoherentes y resultar difícil de revertir.
Las medidas propuestas incluyen combinar datos humanos reales con datos sintéticos, aplicar Data curation para seleccionar y verificar su calidad, y usar Feedback mechanism para revisar y ajustar los resultados. El objetivo es evitar que los datos generados por IA se conviertan en la principal fuente de aprendizaje sin referencias del mundo real.
Sin embargo, el riesgo de Model Collapse sigue siendo objeto de debate. Algunos investigadores consideran que los experimentos de circuito cerrado pueden exagerar el peligro frente al uso real, donde suelen incorporarse continuamente nuevos datos humanos en vez de depender al 100 % de datos sintéticos. Por tanto, el informe no afirma que todo uso de datos sintéticos provoque el colapso de un modelo, sino que su procedencia, proporción, diversidad y control de calidad cobrarán mayor importancia a medida que el contenido generado por IA se extienda por internet.
A medida que aumenta el contenido de IA en la web, quienes desarrollan modelos en tailandés deben evitar reentrenarlos con datos repetidos o de baja calidad, pues podrían perder gradualmente conocimientos locales y casos poco frecuentes.