Исследование: формат описания навыков напрямую влияет на их выбор AI-агентами
Кейс-стади на базе видеоплатформы Tinycloud показало, что репрезентация навыков определяет точность их поиска и маршрутизации в AI-агентах
Кевин Дела Роса (Kevin Dela Rosa) опубликовал на arXiv препринт (2608.20389) статьи «Representation Affects Retrieval: A Case Study of Skill Discovery and Routing in a Multimodal Agent Harness», посвященной обнаружению и маршрутизации навыков (Skill Discovery and Routing) в production-системах мультимодальных агентов.
Главный вызов заключается в том, как описывать навыки по мере роста их библиотеки, чтобы модель точно выбирала нужный инструмент под задачу пользователя. В небольших системах LLM может оценивать список навыков прямо в System Prompt через контекст. Однако при масштабировании библиотек приходится переходить на векторный поиск (Embedding-based Retrieval) для предварительной фильтрации релевантных инструментов.
В качестве кейс-стади использовалась мультимодальная агентная видеосистема Tinycloud. Навыки в ней разделили на два типа: Tool-skill (обертки над внешними API или отдельными системными утилитами, служащие базовым «словарем» агента) и Workflow-skill (оркестраторы из нескольких Tool-skill для сложных многоэтапных задач).
Ключевой вывод: способ репрезентации и описания данных критически влияет на способность модели находить, ранжировать и выбирать подходящие навыки под запрос — как при прямом выборе из промпта, так и через эмбеддинги при больших каталогах. При этом авторы подчеркивают, что выводы основаны на одной системе и не гарантируют одинаковых результатов для всех типов агентов.
Работа принята на воркшоп AgentSearch ’26 в рамках конференции SIGIR 2026 (Мельбурн, Австралия, 24 июля 2026 года), что подтверждает: формулировка описания навыков становится полноценной задачей Information Retrieval, а не просто вопросом промпт-инжиниринга.
Разработчикам агентов стоит обращать внимание не только на число инструментов или мощность модели: нейминг, гранулярность и описание навыков напрямую определяют точность их вызова. Это критически важно при создании агентных систем, объединяющих множество внешних API и сервисов.