ทันเอไอ

Global AI & tech news, in your language · every story source-checked

🌐Follow
← Back to news
LINE Facebook X
ИИ-модели и исследованияVerified

Исследователи представили Nexus — систему ускоренной работы агентных LLM с большим числом инструментов

Новое исследование на arXiv решает проблему задержки Time-to-First-Token для больших языковых моделей, использующих инструменты через Model Context Protocol

📅 25 авг. 2026 г., 06:50
Исследователи представили Nexus — систему ускоренной работы агентных LLM с большим числом инструментов

В исследовании «Nexus: Depth-Adaptive KV-Cache Splicing and Retrieval-Decoupled Tool Routing for Agentic LLMs on Unified Memory» Мустафы Арслана (Mustafa Arslan), опубликованном на arXiv (arXiv:2608.20397), рассматривается проблема узких мест в агентных больших языковых моделях (LLM), способных принимать решения и вызывать внешние инструменты.

В настоящее время агентные LLM на базе Model Context Protocol (MCP) вынуждены заново кодировать схемы инструментов на каждом шаге диалога. В результате этап префилла (Prefill) с квадратичной сложностью от длины последовательности приводит к резкому росту задержки Time-to-First-Token (TTFT) по мере увеличения реестра инструментов (Tool Registry), что также чревато переполнением контекстного окна.

Для решения этой проблемы Nexus отделяет процесс маршрутизации от затрат на префилл схем. Система использует INT8 semantic lookaside buffer (SLB) вместе с calibrated cross-encoder margin gate для выбора инструментов через поиск (Retrieval), а аргументы генерируются с помощью сжатых текстовых сигнатур вместо традиционного KV-кэша.

Результаты экспериментов показали, что данный пайплайн не зависит от глубины (depth-independent): точность маршрутизации остается стабильной на уровне около 89% даже при масштабировании до 250 инструментов в системе.

Why it matters
Работа имеет ключевое значение для развития ИИ-агентов, позволяя моделям эффективно подключать и вызывать сотни инструментов без задержек при обработке начального контекста.
#Agentic LLM#Model Context Protocol#arXiv#AI Research
Sources (rewritten & summarized from): arXiv cs.AI · arxiv.org · tensorfeed.ai · cubadigital.ai · papers.cool · xmt.pub

Comments

Loading comments…

No sign-up needed · comments are auto-filtered and moderated