Dude ใช้เอเจนต์หลายตัวตรวจบทความวิจัยกับโค้ด มุ่งลดการแจ้งผิด
นักวิจัยเสนอระบบ AI ตรวจความไม่สอดคล้องระหว่างบทความกับโค้ด โดยรายงานผลดีขึ้นจากวิธีฐาน แต่ยังไม่มีผลยืนยันจากผู้ทดสอบอิสระ
Weijie Liu และผู้ร่วมวิจัยอีก 6 คน เผยแพร่งาน Dude บน arXiv เมื่อ 3 กันยายน 2026 เสนอระบบ Multi-Agent (เอเจนต์ AI หลายตัวทำงานร่วมกัน) เพื่อตรวจว่าโค้ดสอดคล้องกับสิ่งที่บทความวิจัยอธิบายหรือไม่ โดยหน้าเอกสารระบุว่างานได้รับการตอบรับเข้า EMNLP 2026 แล้ว [ต้นฉบับบน arXiv](https://arxiv.org/abs/2609.03416)
ทีมวิจัยชี้ว่า วิธีเดิมที่ใช้ LLM (โมเดลภาษาขนาดใหญ่) แบบเอเจนต์เดียวมีข้อจำกัดด้านปริมาณข้อมูลที่พิจารณาได้และการตรวจเพียงด้านเดียว จึงอาจพลาดความไม่สอดคล้อง แต่การเพิ่มเอเจนต์ก็มีปัญหาใหม่ เพราะคำอธิบายในบทความกับโค้ดมีระดับรายละเอียดต่างกัน ทำให้ระบบตีความเกินข้อมูลและรายงานปัญหาที่ไม่มีจริง
Dude จึงใช้การเจรจาระหว่างเอเจนต์เพื่อปรับระดับรายละเอียดให้ตรงกัน พร้อมกลไกกรองความสำคัญสองขั้น เป้าหมายคือช่วยแยกความไม่สอดคล้องจริงออกจากความต่างของวิธีอธิบาย ลดภาระที่คนต้องตามตรวจการแจ้งเตือนผิด
ผู้วิจัยรายงานว่าการทดลองกับชุดข้อมูลความไม่สอดคล้องระหว่างบทความกับโค้ดจากงานจริง ให้ค่า recall (สัดส่วนปัญหาจริงที่ตรวจพบ) และ precision (สัดส่วนการแจ้งที่ถูกต้อง) ดีขึ้นสูงสุด 22.8% และค่า F1 (คะแนนสรุปสมดุลของสองค่านี้) ดีขึ้นสูงสุด 18.7% เมื่อเทียบกับวิธีฐาน ตัวเลขดังกล่าวเป็นผลสูงสุดที่ทีมรายงาน ไม่ใช่ผลที่รับประกันกับทุกงาน [บทคัดย่อและผลที่รายงาน](https://arxiv.org/abs/2609.03416)
เว็บไซต์ของ Xiaoxi Zhang ผู้ร่วมเขียน ระบุผลงานนี้ในรายการ EMNLP 2026 เช่นกัน แต่เป็นข้อมูลจากผู้เกี่ยวข้อง จึงไม่ถือเป็นการยืนยันผลทดลองอย่างอิสระ จากแหล่งข้อมูลที่ตรวจสอบครั้งนี้ ประสิทธิภาพของ Dude ยังต้องรอการทดสอบซ้ำจากภายนอก [รายการผลงานผู้เขียน](https://0xxz.github.io/publications.html)
หากผลทำซ้ำได้ ระบบลักษณะนี้อาจช่วยนักวิจัยและนักพัฒนาไทยตรวจโค้ดก่อนนำงานวิจัยมาต่อยอด พร้อมลดเวลาตามตรวจการแจ้งเตือนผิด อย่างไรก็ตาม การตรวจความสอดคล้องยังไม่เท่ากับการรับรองว่างานวิจัยทั้งหมดถูกต้อง