ทันเอไอ

ข่าว AI & ไอที ระดับโลก แปลเป็นไทย อ่านสบายตา · ตรวจสอบแหล่งทุกข่าว

← กลับหน้าข่าว
LINE Facebook X
โมเดล & วิจัย AIยืนยันแล้ว

MERIT วัดความคุ้มค่าหน่วยความจำระยะยาวของ LLM Agent

งานวิจัยใหม่เสนอ MERIT เพื่อทดสอบว่าหน่วยความจำระยะยาวเปลี่ยนการตัดสินใจของ Agent ที่ใช้เครื่องมือได้จริงเพียงใด เมื่อคิดรวมทั้งความแม่นยำและต้นทุน

📅 10 ก.ย. 2569 01:40 น.
MERIT วัดความคุ้มค่าหน่วยความจำระยะยาวของ LLM Agent

Shweta Mishra และ Shashank Mishra เผยแพร่งานวิจัยบน arXiv รหัส 2609.05441 โดยตั้งคำถามว่า Long-term memory (หน่วยความจำระยะยาว) ช่วยให้ LLM Agent ทำงานได้ดีขึ้นจริงในสถานการณ์ใด และประโยชน์ที่ได้นั้นคุ้มกับต้นทุนหรือไม่

ผู้วิจัยมองว่า Benchmark (เกณฑ์ทดสอบมาตรฐาน) ที่นิยมใช้อย่าง LoCoMo และ LongMemEval ยังเน้นการตอบคำถามจากประวัติการสนทนา จึงอาจบอกได้ว่าโมเดลจำข้อมูลหรือไม่ แต่ยังไม่ชัดว่าข้อมูลที่จำได้จะเปลี่ยนสิ่งที่ Agent เลือกทำเมื่อจำเป็นต้องเรียกใช้เครื่องมือจริงหรือไม่

ทีมวิจัยจึงเสนอ MERIT ย่อมาจาก Memory Evaluation for Realistic Instrumented Tasks เป็นทั้งชุดทดสอบและระบบวัดผลสำหรับงาน Episodic tool-use (งานใช้เครื่องมือที่แบ่งเป็นเหตุการณ์ต่อเนื่อง) ใน 3 ขอบเขต งานแต่ละชุดต้องอาศัยข้อเท็จจริงจากเหตุการณ์ก่อนหน้า และมีระบบตรวจสอบอัตโนมัติว่าคำตอบไม่ได้รั่วอยู่ในข้อมูลของเหตุการณ์ปัจจุบัน

MERIT จัดระดับความยากต่อเนื่องไปจนถึงโจทย์ที่ Agent ต้องจำข้อเท็จจริงซึ่งถูกปรับปรุงใหม่ นอกจากนี้ยังจำลอง Memory corruption (ความเสียหายหรือข้อมูลผิดในหน่วยความจำ) และบันทึกจำนวน Token (หน่วยข้อมูลที่โมเดลประมวลผล) รวมถึงต้นทุนเป็นเงินของทุกขั้นตอนที่เกี่ยวข้องกับหน่วยความจำ

การประเมินครอบคลุมเหตุการณ์ที่ให้คะแนนแล้ว 23,440 ครั้ง มีค่าใช้จ่ายรวม 42.57 ดอลลาร์ ผลทดลองชี้ว่าหน่วยความจำระยะยาวช่วยเพิ่มประสิทธิภาพ โดยเฉพาะงานที่ต้องเรียกคืนข้อมูลที่เคยได้รับมาก่อน แต่การค้นคืนด้วย Embedding retrieval (การค้นข้อมูลด้วยความใกล้เคียงทางความหมาย) ยังผิดพลาดได้ในลักษณะที่คาดเดายาก

อีกข้อค้นพบสำคัญคือ แม้ Agent จะค้นข้อมูลที่ถูกต้องกลับมาได้ แต่เลือกนำข้อมูลนั้นไปใช้จริงเพียง 55% ขณะที่ระบบ Hybrid (ระบบผสมหลายวิธีค้นคืน) ให้ผลแย่กว่าการใช้ Fact store (แหล่งเก็บข้อเท็จจริงแบบมีโครงสร้าง) เพียงอย่างเดียว ผลลัพธ์จึงสะท้อนว่าการมีหน่วยความจำมากขึ้นไม่เพียงพอ การจัดเก็บ การค้นคืน และการตัดสินใจใช้ข้อมูลต้องทำงานสอดคล้องกันด้วย

ทำไมถึงสำคัญ
ผลวิจัยนี้ช่วยให้นักพัฒนาไทยประเมินระบบ Agent จากผลลัพธ์และค่าใช้จ่ายจริง แทนการดูเพียงว่าโมเดลตอบคำถามจากอดีตได้หรือไม่ โดยเฉพาะระบบบริการลูกค้า ผู้ช่วยทำงาน และงานอัตโนมัติที่ต้องจดจำข้อมูลข้ามเหตุการณ์
#LLM Agent#หน่วยความจำระยะยาว#MERIT#งานวิจัย AI
ที่มา (เรียบเรียง+สรุปจาก): arXiv cs.AI · arxiv.org · llm-stats.com · arxiv.org · gworky.com

ความคิดเห็น

กำลังโหลดความคิดเห็น…

ไม่ต้องสมัครสมาชิก · ระบบกรองคำหยาบอัตโนมัติ และผู้ดูแลลบความคิดเห็นได้