งานทบทวนชี้วงจรฝึก AI ด้วยข้อมูลสังเคราะห์เสี่ยง Model Collapse
รายงานวิชาการรวบรวมหลักฐานและแนวทางรับมือภาวะ Model Collapse ซึ่งอาจเกิดเมื่อโมเดลรุ่นใหม่เรียนรู้จากข้อมูลที่ AI สร้างซ้ำต่อกันหลายรุ่น
รายงาน “Reviewing Model Collapse and Countermeasures” ซึ่งเผยแพร่ผ่าน arXiv ในหมวด cs.AI และงานประชุม IEEE International Conference on Advances in Artificial Intelligence and Machine Learning (AAIML) ปี 2026 ทบทวนงานวิจัยเกี่ยวกับ Model Collapse (ภาวะโมเดลเสื่อมจากการเรียนรู้ข้อมูลสังเคราะห์ซ้ำ) รวมถึงสาเหตุ ผลกระทบ และมาตรการป้องกัน
ปัญหานี้เกิดขึ้นใน Self-consuming cycle (วงจรที่โมเดลสร้างข้อมูลกลับมาฝึกโมเดลรุ่นต่อไป) แม้ Synthetic Data (ข้อมูลสังเคราะห์โดย AI) จะช่วยลดความต้องการข้อมูลจริงปริมาณมหาศาล แต่การนำข้อมูลดังกล่าวกลับมาใช้ซ้ำโดยไม่มีข้อมูลจริงที่เพียงพออาจทำให้ข้อผิดพลาดสะสมและส่งต่อระหว่างรุ่น คล้ายการถ่ายเอกสารจากสำเนาหลายทอดจนรายละเอียดต้นฉบับค่อย ๆ หายไป
อาการระยะแรกคือโมเดลเริ่มสูญเสียความเข้าใจกรณีที่พบไม่บ่อย หรือ Tails of distribution (ส่วนปลายของการกระจายข้อมูล) จากนั้นผลลัพธ์อาจเป็นเนื้อเดียวกัน ซ้ำซาก และมีความหลากหลายน้อยลง หาก Recursive training (การฝึกต่อเนื่องด้วยข้อมูลจากโมเดลรุ่นก่อน) ดำเนินต่อไป ความเสื่อมอาจรุนแรงจนโมเดลให้ผลลัพธ์ผิดเพี้ยนหรือไม่สื่อความหมาย และอาจย้อนกลับได้ยาก
แนวทางรับมือที่งานวิจัยในสาขานี้เสนอ ได้แก่ การผสมข้อมูลจริงจากมนุษย์กับข้อมูลสังเคราะห์ การทำ Data curation (คัดเลือกและตรวจคุณภาพข้อมูล) และการใช้ Feedback mechanism (กลไกป้อนกลับเพื่อตรวจและปรับผลลัพธ์) เป้าหมายคือไม่ปล่อยให้ข้อมูลจาก AI กลายเป็นแหล่งเรียนรู้หลักโดยปราศจากตัวอ้างอิงจากโลกจริง
อย่างไรก็ตาม ความเสี่ยงจาก Model Collapse ยังมีข้อถกเถียง นักวิจัยบางส่วนมองว่าการทดลองแบบวงจรปิดอาจรุนแรงกว่าสภาพใช้งานจริง เพราะระบบจริงมักเติมข้อมูลใหม่จากมนุษย์อย่างต่อเนื่อง ไม่ได้ใช้ข้อมูลสังเคราะห์เพียงอย่างเดียว 100% ดังนั้นรายงานนี้ไม่ได้หมายความว่าการใช้ข้อมูลสังเคราะห์ทุกกรณีจะทำให้โมเดลล่ม แต่ชี้ว่าที่มา สัดส่วน ความหลากหลาย และการตรวจคุณภาพข้อมูลจะมีความสำคัญมากขึ้นเมื่อเนื้อหาที่สร้างโดย AI แพร่หลายบนอินเทอร์เน็ต
เมื่อเนื้อหาจาก AI ปะปนอยู่บนเว็บมากขึ้น ผู้พัฒนาโมเดลภาษาไทยต้องระวังไม่ให้ข้อมูลคุณภาพต่ำหรือข้อมูลซ้ำถูกนำกลับไปฝึกจนความรู้เฉพาะถิ่นและกรณีที่พบไม่บ่อยค่อย ๆ หายไป