ทันเอไอ

ข่าว AI & ไอที ระดับโลก แปลเป็นไทย อ่านสบายตา · ตรวจสอบแหล่งทุกข่าว

🌐ติดตาม
← กลับหน้าข่าว
LINE Facebook X
โมเดล & วิจัย AIยืนยันแล้ว

นักวิจัยเสนอ "Nexus" ระบบช่วย Agentic LLM จัดการเครื่องมือจำนวนมากได้เร็วขึ้น ลดคอขวดตอนเริ่มประมวลผล

งานวิจัยใหม่บน arXiv เสนอวิธีแก้ปัญหาคอขวด Time-to-First-Token สำหรับโมเดลภาษาขนาดใหญ่ที่ต้องใช้งานเครื่องมือผ่าน Model Context Protocol

📅 25 ส.ค. 2569 06:50 น.
นักวิจัยเสนอ "Nexus" ระบบช่วย Agentic LLM จัดการเครื่องมือจำนวนมากได้เร็วขึ้น ลดคอขวดตอนเริ่มประมวลผล

ในงานวิจัยหัวข้อ "Nexus: Depth-Adaptive KV-Cache Splicing and Retrieval-Decoupled Tool Routing for Agentic LLMs on Unified Memory" ซึ่งเขียนโดย Mustafa Arslan และเผยแพร่บนแพลตฟอร์ม arXiv (หมายเลขรหัส arXiv:2608.20397) ได้หยิบยกปัญหาคอขวดที่มักเกิดขึ้นกับ Agentic Large Language Models (LLM) หรือโมเดลภาษาขนาดใหญ่ที่มีความสามารถในการตัดสินใจและเรียกใช้เครื่องมือภายนอก

ปัจจุบัน Agentic LLM ที่ใช้งาน Model Context Protocol (MCP) จำเป็นต้องทำการเข้ารหัส (re-encode) ข้อมูล Schema ของเครื่องมือ (Tool) ใหม่ทุกรอบการสนทนา ส่งผลให้ขั้นตอน Prefill ซึ่งมีความซับซ้อนแบบ Quadratic ตามความยาวของลำดับข้อมูล กลายเป็นตัวการสำคัญที่ทำให้ค่า Time-to-First-Token (TTFT) หรือเวลาในการรอคำตอบแรกพุ่งสูงขึ้นอย่างรวดเร็ว เมื่อจำนวนเครื่องมือในระบบ (Tool Registry) มีจำนวนมากขึ้นเรื่อยๆ จนบางครั้งอาจทำให้ข้อมูลล้น Context Window

เพื่อแก้ปัญหานี้ Nexus จึงเลือกใช้วิธีแยกส่วน (decouple) กระบวนการ Routing ออกจากต้นทุนการทำ Schema-prefill โดยใช้ INT8 semantic lookaside buffer (SLB) พร้อมกับ calibrated cross-encoder margin gate เพื่อทำหน้าที่เลือกเครื่องมือผ่านการค้นหา (Retrieval) ขณะที่อาร์กิวเมนต์จะถูกสร้างขึ้นผ่านลายเซ็นข้อความที่ถูกบีบอัดแทนการใช้ Key/Value (KV) cache แบบเดิม

ผลลัพธ์จากการทดลองระบุว่า เส้นทางการทำงานนี้มีความเป็นอิสระต่อความลึก (Depth-independent) โดยความแม่นยำในการทำ Routing ยังคงทรงตัวอยู่ที่ประมาณ 89% แม้ว่าจำนวนเครื่องมือในระบบจะขยายตัวเพิ่มขึ้นไปถึง 250 เครื่องมือก็ตาม

ทำไมถึงสำคัญ
งานวิจัยนี้มีความสำคัญต่อการพัฒนา AI Agent ในอนาคต ช่วยให้โมเดลสามารถเชื่อมต่อและเรียกใช้เครื่องมือจำนวนมากได้อย่างมีประสิทธิภาพโดยไม่ติดปัญหาเรื่องความล่าช้าในการประมวลผลเริ่มต้น
#Agentic LLM#Model Context Protocol#arXiv#AI Research
ที่มา (เรียบเรียง+สรุปจาก): arXiv cs.AI · arxiv.org · tensorfeed.ai · cubadigital.ai · papers.cool · xmt.pub

ความคิดเห็น

กำลังโหลดความคิดเห็น…

ไม่ต้องสมัครสมาชิก · ระบบกรองคำหยาบอัตโนมัติ และผู้ดูแลลบความคิดเห็นได้