Investigadores presentan "Nexus", un sistema que acelera la gestión de múltiples herramientas en LLMs agénticos y reduce el cuello de botella inicial
Un nuevo estudio en arXiv propone resolver el cuello de botella de Time-to-First-Token en LLMs que ejecutan herramientas mediante Model Context Protocol.
En la investigación titulada "Nexus: Depth-Adaptive KV-Cache Splicing and Retrieval-Decoupled Tool Routing for Agentic LLMs on Unified Memory", desarrollada por Mustafa Arslan y publicada en arXiv (código arXiv:2608.20397), se aborda un cuello de botella recurrente en los Agentic Large Language Models (LLM) o modelos con capacidad para tomar decisiones y ejecutar herramientas externas.
Actualmente, los LLMs agénticos que utilizan Model Context Protocol (MCP) deben recodificar los esquemas de las herramientas en cada turno de conversación. Esto hace que la fase de Prefill, cuya complejidad es cuadrática respecto a la longitud de la secuencia, dispare el Time-to-First-Token (TTFT) a medida que crece el catálogo de herramientas (Tool Registry), llegando en ocasiones a saturar la Context Window.
Para resolverlo, Nexus desacopla el proceso de enrutamiento del coste del prefill de esquemas mediante un semantic lookaside buffer (SLB) en INT8 y un calibrated cross-encoder margin gate para seleccionar herramientas por recuperación (retrieval), generando los argumentos mediante firmas de texto comprimidas en lugar del KV cache tradicional.
Los resultados experimentales indican que este flujo es independiente de la profundidad (depth-independent), manteniendo una precisión de enrutamiento estable en torno al 89 % incluso cuando el sistema escala hasta 250 herramientas.
Esta investigación es clave para el futuro de los agentes de IA, ya que permite a los modelos integrar y ejecutar un gran volumen de herramientas de forma eficiente sin sufrir retrasos en el procesamiento inicial.