ทันเอไอ

Global AI & tech news, in your language · every story source-checked

🌐Follow
← Back to news
LINE Facebook X
Modèles et recherche en IAVerified

Des chercheurs présentent « Nexus », un système qui aide les LLM agentiques à gérer plus rapidement de nombreux outils et réduit le goulet d’étranglement au démarrage

Une nouvelle étude publiée sur arXiv propose une solution au goulet d’étranglement du Time-to-First-Token pour les grands modèles de langage utilisant des outils via le Model Context Protocol

📅 25 août 2026, 06:50
Des chercheurs présentent « Nexus », un système qui aide les LLM agentiques à gérer plus rapidement de nombreux outils et réduit le goulet d’étranglement au démarrage

L’étude intitulée « Nexus: Depth-Adaptive KV-Cache Splicing and Retrieval-Decoupled Tool Routing for Agentic LLMs on Unified Memory », rédigée par Mustafa Arslan et publiée sur arXiv sous la référence arXiv:2608.20397, examine un goulet d’étranglement fréquent dans les Agentic Large Language Models (LLM), capables de prendre des décisions et d’appeler des outils externes.

Actuellement, les LLM agentiques utilisant le Model Context Protocol (MCP) doivent réencoder les schémas des outils à chaque tour de conversation. Le préremplissage, dont la complexité est quadratique par rapport à la longueur de la séquence, fait alors fortement augmenter le Time-to-First-Token (TTFT), ou délai avant la première réponse, à mesure que le Tool Registry s’agrandit. Les données peuvent même finir par dépasser la fenêtre de contexte.

Pour résoudre ce problème, Nexus découple le routage du coût de préremplissage des schémas. Il utilise un semantic lookaside buffer (SLB) en INT8 et un seuil de marge calibré pour cross-encoder afin de sélectionner les outils par recherche, tandis que les arguments sont générés à partir de signatures textuelles compressées plutôt qu’avec un cache Key/Value (KV) classique.

Les expériences montrent que ce flux de travail est indépendant de la profondeur. La précision du routage reste stable à environ 89 %, même lorsque le système atteint 250 outils.

Why it matters
Cette recherche pourrait accélérer le développement des agents IA en leur permettant de connecter et d’utiliser efficacement de nombreux outils sans subir de forte latence au démarrage du traitement.
#Agentic LLM#Model Context Protocol#arXiv#AI Research
Sources (rewritten & summarized from): arXiv cs.AI · arxiv.org · tensorfeed.ai · cubadigital.ai · papers.cool · xmt.pub

Comments

Loading comments…

No sign-up needed · comments are auto-filtered and moderated