ทันเอไอ

Global AI & tech news, in your language · every story source-checked

🌐Follow
← Back to news
LINE Facebook X
Modelos e Pesquisa em IAVerified

Pesquisadores apresentam 'Nexus', sistema que acelera o uso de ferramentas em LLMs agênticos e reduz gargalo inicial

Novo estudo no arXiv propõe solução para o gargalo de Time-to-First-Token em grandes modelos de linguagem que utilizam ferramentas via Model Context Protocol.

📅 25 de ago. de 2026, 06:50
Pesquisadores apresentam 'Nexus', sistema que acelera o uso de ferramentas em LLMs agênticos e reduz gargalo inicial

No artigo "Nexus: Depth-Adaptive KV-Cache Splicing and Retrieval-Decoupled Tool Routing for Agentic LLMs on Unified Memory", de Mustafa Arslan e publicado no arXiv (código arXiv:2608.20397), aborda-se um gargalo frequente em Agentic Large Language Models (LLMs) — modelos de linguagem capazes de tomar decisões e acionar ferramentas externas.

Atualmente, LLMs agênticos que utilizam o Model Context Protocol (MCP) precisam recodificar os schemas das ferramentas a cada rodada de conversa. Como a etapa de prefill possui complexidade quadrática em relação ao comprimento da sequência, o Time-to-First-Token (TTFT) dispara rapidamente conforme o registro de ferramentas (tool registry) aumenta, correndo até o risco de exceder a context window.

Para contornar o problema, o Nexus desacopla o roteamento do custo de prefill de schema. Ele utiliza um semantic lookaside buffer (SLB) em INT8 combinado a um calibrated cross-encoder margin gate para selecionar ferramentas via recuperação (retrieval), gerando argumentos a partir de assinaturas textuais compactadas em vez do KV-cache tradicional.

Os resultados dos testes indicam que o pipeline opera de forma independente de profundidade (depth-independent), mantendo a acurácia de roteamento estável em cerca de 89%, mesmo com a expansão para até 250 ferramentas no sistema.

Why it matters
O estudo é essencial para a evolução dos agentes de IA, permitindo conectar e acionar dezenas de ferramentas com eficiência sem enfrentar altas latências no processamento inicial.
#Agentic LLM#Model Context Protocol#arXiv#AI Research
Sources (rewritten & summarized from): arXiv cs.AI · arxiv.org · tensorfeed.ai · cubadigital.ai · papers.cool · xmt.pub

Comments

Loading comments…

No sign-up needed · comments are auto-filtered and moderated