ทันเอไอ

Global AI & tech news, in your language · every story source-checked

🌐Follow
← Back to news
LINE Facebook X
Model & Riset AIVerified

Peneliti Perkenalkan "Nexus", Sistem Pembantu Agentic LLM Kelola Banyak Tool Lebih Cepat dan Pangkas Bottleneck Awal Pemrosesan

Riset baru di arXiv tawarkan solusi bottleneck Time-to-First-Token untuk Large Language Model yang mengoperasikan tool via Model Context Protocol.

📅 25 Agu 2026, 06.50
Peneliti Perkenalkan "Nexus", Sistem Pembantu Agentic LLM Kelola Banyak Tool Lebih Cepat dan Pangkas Bottleneck Awal Pemrosesan

Dalam makalah penelitian berjudul "Nexus: Depth-Adaptive KV-Cache Splicing and Retrieval-Decoupled Tool Routing for Agentic LLMs on Unified Memory" yang ditulis oleh Mustafa Arslan dan dipublikasikan di platform arXiv (kode: arXiv:2608.20397), diangkat isu bottleneck yang kerap terjadi pada Agentic Large Language Models (LLM)—model bahasa besar berkemampuan mengambil keputusan dan memanggil tool eksternal.

Saat ini, Agentic LLM yang menggunakan Model Context Protocol (MCP) harus melakukan re-encode skema tool pada setiap putaran percakapan. Akibatnya, tahap prefill yang memiliki kompleksitas kuadratik seiring panjangnya sekuens data menjadi penyebab utama melonjaknya Time-to-First-Token (TTFT) ketika jumlah tool di tool registry terus bertambah, bahkan berisiko melampaui kapasitas context window.

Untuk mengatasi masalah ini, Nexus memisahkan (decouple) proses routing dari beban biaya schema-prefill menggunakan INT8 semantic lookaside buffer (SLB) bersama calibrated cross-encoder margin gate untuk memilih tool melalui metode retrieval, sementara argumen dihasilkan melalui signature teks terkompresi alih-alih mengandalkan Key/Value (KV) cache konvensional.

Hasil eksperimen menunjukkan bahwa alur kerja ini bersifat depth-independent, dengan akurasi routing tetap stabil di kisaran 89% meski jumlah tool di dalam sistem bertambah hingga mencapai 250 tool.

Why it matters
Riset ini krusial bagi pengembangan AI agent di masa depan, memungkinkan model terhubung dan menjalankan banyak tool secara efisien tanpa terkendala latensi pada pemrosesan awal.
#Agentic LLM#Model Context Protocol#arXiv#AI Research
Sources (rewritten & summarized from): arXiv cs.AI · arxiv.org · tensorfeed.ai · cubadigital.ai · papers.cool · xmt.pub

Comments

Loading comments…

No sign-up needed · comments are auto-filtered and moderated