ทันเอไอ

Global AI & tech news, in your language · every story source-checked

🌐Follow
← Back to news
LINE Facebook X
AI 모델 & 연구Verified

연구진, Agentic LLM의 대규모 툴 관리 속도 높이고 초기 처리 병목 줄이는 'Nexus' 발표

arXiv에 공개된 신규 연구, Model Context Protocol 기반 툴을 사용하는 대규모 언어 모델의 Time-to-First-Token 병목 현상 해결 방안 제시

📅 2026년 8월 25일 오전 06:50
연구진, Agentic LLM의 대규모 툴 관리 속도 높이고 초기 처리 병목 줄이는 'Nexus' 발표

Mustafa Arslan이 작성하고 arXiv에 공개된 논문 "Nexus: Depth-Adaptive KV-Cache Splicing and Retrieval-Decoupled Tool Routing for Agentic LLMs on Unified Memory"(식별 번호 arXiv:2608.20397)에서는 외부 도구를 판단 및 호출할 수 있는 에이전틱 대규모 언어 모델(Agentic LLM)에서 자주 발생하는 병목 현상을 다뤘다.

현재 Model Context Protocol(MCP)을 사용하는 Agentic LLM은 매 턴마다 툴(Tool) 스키마를 다시 인코딩(re-encode)해야 한다. 이로 인해 시퀀스 길이에 따라 2차(Quadratic) 복잡도를 갖는 Prefill 단계가 툴 레지스트리(Tool Registry) 내 툴 수가 증가함에 따라 첫 토큰 생성 시간(Time-to-First-Token, TTFT)을 급증시키고 때로는 컨텍스트 윈도우(Context Window)를 초과하게 만드는 주요 원인이 된다.

이를 해결하기 위해 Nexus는 라우팅(Routing) 과정을 스키마 프리필 비용과 분리(decouple)하는 방식을 도입했다. INT8 semantic lookaside buffer(SLB)와 calibrated cross-encoder margin gate를 활용해 검색(Retrieval)을 통해 툴을 선택하고, 인자(argument)는 기존 Key/Value(KV) 캐시 대신 압축된 텍스트 서명을 통해 생성된다.

실험 결과에 따르면 이 파이프라인은 깊이 독립적(Depth-independent)으로 작동하며, 시스템 내 툴이 최대 250개까지 확장되더라도 라우팅 정확도를 약 89% 수준으로 안정적으로 유지했다.

Why it matters
이번 연구는 차세대 AI Agent 개발에 중요한 기여를 하며, 모델이 초기 처리 지연 문제 없이 대규모 툴을 효율적으로 연결하고 호출할 수 있도록 지원한다.
#Agentic LLM#Model Context Protocol#arXiv#AI Research
Sources (rewritten & summarized from): arXiv cs.AI · arxiv.org · tensorfeed.ai · cubadigital.ai · papers.cool · xmt.pub

Comments

Loading comments…

No sign-up needed · comments are auto-filtered and moderated