Исследователи представили Nexus — систему ускоренной работы агентных LLM с большим числом инструментов
Новое исследование на arXiv решает проблему задержки Time-to-First-Token для больших языковых моделей, использующих инструменты через Model Context Protocol
В исследовании «Nexus: Depth-Adaptive KV-Cache Splicing and Retrieval-Decoupled Tool Routing for Agentic LLMs on Unified Memory» Мустафы Арслана (Mustafa Arslan), опубликованном на arXiv (arXiv:2608.20397), рассматривается проблема узких мест в агентных больших языковых моделях (LLM), способных принимать решения и вызывать внешние инструменты.
В настоящее время агентные LLM на базе Model Context Protocol (MCP) вынуждены заново кодировать схемы инструментов на каждом шаге диалога. В результате этап префилла (Prefill) с квадратичной сложностью от длины последовательности приводит к резкому росту задержки Time-to-First-Token (TTFT) по мере увеличения реестра инструментов (Tool Registry), что также чревато переполнением контекстного окна.
Для решения этой проблемы Nexus отделяет процесс маршрутизации от затрат на префилл схем. Система использует INT8 semantic lookaside buffer (SLB) вместе с calibrated cross-encoder margin gate для выбора инструментов через поиск (Retrieval), а аргументы генерируются с помощью сжатых текстовых сигнатур вместо традиционного KV-кэша.
Результаты экспериментов показали, что данный пайплайн не зависит от глубины (depth-independent): точность маршрутизации остается стабильной на уровне около 89% даже при масштабировании до 250 инструментов в системе.
Работа имеет ключевое значение для развития ИИ-агентов, позволяя моделям эффективно подключать и вызывать сотни инструментов без задержек при обработке начального контекста.