Исследователи разработали систему ISEE, помогающую AI-агентам точнее понимать корпоративные базы данных
Система Interactive Semantic Enrichment от Purdue University, Adobe и UW–Madison дополняет описания полей данных специализированными знаниями, благодаря чему AI-агенты работают с базами данных точнее
По мере того как AI-агенты на базе LLM (Large Language Model — больших языковых моделей) всё активнее используются для работы с данными — их понимания, исследования и выполнения запросов, — частой проблемой становится снижение точности, особенно при работе с корпоративными базами данных. Причина не всегда в самой модели: зачастую дело в описаниях полей данных (field descriptions), которые бывают расплывчатыми или неполными. Например, поля с внутренними названиями компании, истинный смысл которых существует лишь в виде специализированных знаний (domain knowledge) сотрудников и никогда не был публично задокументирован.
Чтобы устранить этот пробел, команда исследователей из Purdue University, Adobe и University of Wisconsin—Madison во главе с Yuan Tian, Yiru Chen и Rakesh R. Menon и коллегами предложила систему ISEE (Interactive SEmantic Enrichment), опубликованную на arXiv в категориях cs.AI/cs.IR. Система работает в интерактивном режиме: получив описание поля, ISEE оценивает его качество с помощью системы скоринга, затем собирает знания от пользователя и совместно с ним дорабатывает семантику поля до полноты.
Команда отмечает, что неоднозначные описания полей напрямую влияют на последующие задачи (downstream tasks), например на entity linking — связывание данных с правильными сущностями. Это тот тип задач, в которых AI-агенты легко ошибаются, если не понимают, что каждое поле означает на самом деле.
Пользовательское исследование и качественная оценка показали, что ISEE действительно повышает точность описаний полей данных, а также снижает когнитивную нагрузку (cognitive load) на пользователей по сравнению с базовыми подходами — то есть пользователям не приходится утомительно обдумывать и документировать всё с нуля самостоятельно.
Вместе с тем это ранняя исследовательская работа, опубликованная в формате препринта на arXiv: она ещё не прошла официальное рецензирование (peer review), а подробные количественные результаты экспериментов в аннотации не раскрыты. Поэтому о практическом применении в промышленных масштабах говорить пока рано.
Тайские организации, планирующие использовать AI-агентов для управления клиентскими базами данных или бизнес-данными, сталкиваются с той же проблемой: сырые данные есть, но их смысл задокументирован не полностью, и AI отвечает с ошибками. Подход ISEE показывает, что совместное дополнение данных специализированными знаниями людьми и AI может стать важной частью пазла для реального внедрения AI в организациях.