Pesquisadores apresentam 'Nexus', sistema que acelera o uso de ferramentas em LLMs agênticos e reduz gargalo inicial
Novo estudo no arXiv propõe solução para o gargalo de Time-to-First-Token em grandes modelos de linguagem que utilizam ferramentas via Model Context Protocol.
No artigo "Nexus: Depth-Adaptive KV-Cache Splicing and Retrieval-Decoupled Tool Routing for Agentic LLMs on Unified Memory", de Mustafa Arslan e publicado no arXiv (código arXiv:2608.20397), aborda-se um gargalo frequente em Agentic Large Language Models (LLMs) — modelos de linguagem capazes de tomar decisões e acionar ferramentas externas.
Atualmente, LLMs agênticos que utilizam o Model Context Protocol (MCP) precisam recodificar os schemas das ferramentas a cada rodada de conversa. Como a etapa de prefill possui complexidade quadrática em relação ao comprimento da sequência, o Time-to-First-Token (TTFT) dispara rapidamente conforme o registro de ferramentas (tool registry) aumenta, correndo até o risco de exceder a context window.
Para contornar o problema, o Nexus desacopla o roteamento do custo de prefill de schema. Ele utiliza um semantic lookaside buffer (SLB) em INT8 combinado a um calibrated cross-encoder margin gate para selecionar ferramentas via recuperação (retrieval), gerando argumentos a partir de assinaturas textuais compactadas em vez do KV-cache tradicional.
Os resultados dos testes indicam que o pipeline opera de forma independente de profundidade (depth-independent), mantendo a acurácia de roteamento estável em cerca de 89%, mesmo com a expansão para até 250 ferramentas no sistema.
O estudo é essencial para a evolução dos agentes de IA, permitindo conectar e acionar dezenas de ferramentas com eficiência sem enfrentar altas latências no processamento inicial.