合成データによるAI学習ループ、モデル崩壊(Model Collapse)のリスクを指摘するレビュー論文
世代を超えてAI生成データを再学習する際に生じる「Model Collapse」の証拠と対策を整理した学術レビューが公開。
arXiv(cs.AI)およびIEEE International Conference on Advances in Artificial Intelligence and Machine Learning(AAIML)2026に掲載されたレビュー論文「Reviewing Model Collapse and Countermeasures」は、AI生成データの反復学習によるモデル性能低下(Model Collapse)に関する研究、その原因、影響、予防策をまとめている。
この問題は、モデルが生成したデータを次世代の学習に再利用する「自己消費サイクル(Self-consuming cycle)」で発生する。合成データ(Synthetic Data)は膨大な実データの必要性を減らす利点がある一方、十分な実データなしに再利用を繰り返すと世代間で誤差が蓄積・伝播する。これは、コピーのコピーを重ねていくうちに元のディテールが失われていく現象に似ている。
初期症状としては、出現頻度の低いケースや分布の裾野(Tails of distribution)に対する理解が失われ、出力が均質化・単調化して多様性が低下する。さらに再帰的学習(Recursive training)が続くと劣化は深刻化し、出力が破綻・無意味化して復元が困難になる恐れがある。
論文で提示された対策には、人間による実データと合成データの混合、データキュレーション(品質選定・検証)、フィードバック機構(出力の検証・調整)の導入が含まれる。現実世界の参照基準がないまま、AI生成データを主要な学習源にしないことが狙いだ。
ただし、Model Collapseのリスクには議論もある。実運用では人間が作成した新たなデータが継続的に供給されるため、閉ループ実験ほど極端にはならないとの見解もある。本論文は合成データの利用すべてがモデル崩壊を招くとするものではなく、AI生成コンテンツがWeb上に普及する中で、データの出所、比率、多様性、品質管理がより重要になると警鐘を鳴らしている。
Web上にAI生成コンテンツが混在する中、タイ語モデルの開発者は低品質・重複データの再学習を防ぎ、地域固有の知識や希少な事例が失われないようデータ管理を徹底する必要がある。