研究人员提出“Nexus”系统:助力Agentic LLM高效管理海量工具,打破初始处理瓶颈
arXiv最新研究针对大模型通过Model Context Protocol调用工具时的Time-to-First-Token瓶颈提出解决方案
在题为《Nexus: Depth-Adaptive KV-Cache Splicing and Retrieval-Decoupled Tool Routing for Agentic LLMs on Unified Memory》的论文中,作者Mustafa Arslan在arXiv平台(编号:arXiv:2608.20397)上探讨了Agentic Large Language Models(LLM,具备自主决策和外部工具调用能力的大语言模型)中常见的性能瓶颈问题。
目前,基于Model Context Protocol(MCP)的Agentic LLM在每个对话轮次中都需要重新编码(re-encode)工具的Schema数据。这导致计算复杂度随序列长度呈二次方增长的Prefill阶段成为推高Time-to-First-Token(TTFT,首字生成时间)的核心诱因。随着系统工具库(Tool Registry)中的工具数量持续增加,甚至可能导致上下文窗口(Context Window)溢出。
为解决这一问题,Nexus采用了解耦(decouple)策略,将Routing流程与Schema-prefill开销分离。系统利用INT8 semantic lookaside buffer(SLB)配合calibrated cross-encoder margin gate,通过检索(Retrieval)方式来选择工具;同时,参数则通过压缩文本签名生成,而非依赖传统的Key/Value(KV)cache。
实验结果表明,该工作流程具备深度无关性(Depth-independent),即使系统中的工具数量扩展至250个,Routing准确率仍稳定保持在约89%。
该研究对未来AI Agent的发展具有重要意义,能够帮助模型高效连接并调用海量工具,避免受到初始处理延迟的制约。