งานวิจัยชี้วิธีแก้ AI พลาดงานยาว เสนอระบบค้นหาซ้ำหาต้นตอความผิดพลาด
ทีมนักวิจัยเสนอแนวคิดใหม่มองการหาต้นตอความผิดพลาดของ AI agent ในงานระยะยาวว่าเป็นปัญหาการค้นหาข้อมูล
เมื่อวันที่ 11 กันยายน 2026 มีการเผยแพร่บทความวิจัยบน arXiv (รหัส arXiv:2609.13463) โดย Harsh Raj และคณะรวม 10 คน ซึ่งศึกษาเกี่ยวกับปัญหาการทำงานของเอเจนต์ปัญญาประดิษฐ์ (AI agent) ในงานระยะยาว (long-horizon tasks) ที่มักสร้างบันทึกการทำงาน (execution logs) ขนาดมหึมา
การวินิจฉัยความผิดพลาดจากบันทึกเหล่านี้มีความสำคัญอย่างยิ่งต่อความน่าเชื่อถือ แต่วิธีเดิมที่ใช้โมเดลภาษาขนาดใหญ่ (LLM) ตัดสินใจในรอบเดียว (one-shot LLM judgments) มักมี The ความแม่นยำต่ำ เนื่องจากข้อมูลที่เกี่ยวข้องมักกระจายตัวอยู่ห่างกัน และไม่เชื่อมโยงกับจุดที่ล้มเหลวอย่างชัดเจน ส่งผลให้การหาต้นตอความผิดพลาด (Root-Cause Attribution หรือ RCA) กลายเป็นปัญหาการค้นหาขนาดใหญ่
เพื่อแก้ปัญหานี้ คณะผู้วิจัยจึงเสนอแนว “Continual Search” หรือการให้ LLM ค้นหาหลักฐานเพิ่มเติมหลายรอบเพื่อระบุสาเหตุที่แท้จริง จากการทดสอบบนชุดเกณฑ์เดิม 4 ชุด และชุดทดสอบใหม่ที่สร้างขึ้นเองชื่อ MegaRCA-Mix จำนวน 50 กรณีที่มนุษย์กำกับข้อมูล (annotation) พบว่าคะแนนเอฟวัน (F1 score) ของโมเดล GPT-5.5 เพิ่มขึ้นจาก 0.349 เป็น 0.498
อย่างไรก็ตาม ข้อมูลนี้มาจากรายงานของผู้วิจัยเอง และยังไม่มีการตรวจสอบผลการทดลองอย่างอิสระจากสำนักข่าวหรือสถาบันอื่นภายนอก
แนวทางนี้ช่วยให้การตรวจสอบข้อผิดพลาดของระบบ AI อัตโนมัติในงานซับซ้อนมีความแม่นยำขึ้น ซึ่งสำคัญต่อการนำ AI ไปใช้งานจริงในภาคธุรกิจ