Investigadores desarrollan el sistema ISEE para que los agentes de IA comprendan mejor las bases de datos empresariales
El sistema Interactive Semantic Enrichment, de Purdue University, Adobe y UW–Madison, enriquece las descripciones de los campos de datos con conocimiento especializado, lo que permite a los agentes de IA trabajar con bases de datos con mayor precisión
A medida que los agentes de IA impulsados por LLM (Large Language Model o modelos de lenguaje de gran tamaño) se utilizan cada vez más para trabajar con datos —ya sea para comprenderlos, explorarlos o consultarlos—, un problema frecuente es la caída de la precisión, especialmente con bases de datos de nivel empresarial. La causa no siempre está en el modelo en sí, sino en las descripciones de los campos de datos (field descriptions), que suelen ser ambiguas o incompletas. Por ejemplo, campos con nombres internos propios de la empresa cuyo verdadero significado reside en el conocimiento especializado (domain knowledge) de los empleados, pero que nunca se ha documentado de forma pública.
Para cerrar esta brecha, un equipo de investigadores de Purdue University, Adobe y la University of Wisconsin—Madison, encabezado por Yuan Tian, Yiru Chen y Rakesh R. Menon, entre otros, propone el sistema ISEE (Interactive SEmantic Enrichment), publicado en arXiv en las categorías cs.AI/cs.IR. El sistema funciona de manera interactiva: al recibir la descripción de un campo, ISEE evalúa su calidad mediante un sistema de puntuación, luego recopila conocimiento del usuario y, en colaboración con él, refina la semántica del campo hasta hacerla más completa.
El equipo de investigación señala que las descripciones ambiguas de los campos afectan directamente a las tareas posteriores (downstream tasks), como el entity linking —la vinculación de datos con las entidades correctas—, un tipo de tarea en la que los agentes de IA fallan con facilidad si no comprenden qué significa realmente cada campo.
Los estudios con usuarios y las evaluaciones cualitativas muestran que ISEE mejora efectivamente la precisión de las descripciones de los campos de datos y, además, reduce la carga cognitiva (cognitive load) de los usuarios en comparación con los métodos convencionales. Es decir, los usuarios no tienen que esforzarse en pensar y documentar todo por sí mismos desde cero.
No obstante, este trabajo aún es una investigación en etapa inicial publicada como preprint en arXiv; todavía no ha pasado por una revisión por pares (peer review) formal, y las cifras detalladas de los experimentos no se han revelado en el resumen. Su aplicación real a nivel industrial habrá que seguirla de cerca.
Las organizaciones tailandesas que buscan usar agentes de IA para gestionar bases de datos de clientes o datos empresariales suelen enfrentar el mismo problema: tienen los datos en bruto, pero les falta el significado completo, lo que hace que la IA responda de forma errónea. Enfoques como el de ISEE muestran que lograr que las personas y la IA enriquezcan conjuntamente los datos con conocimiento especializado podría ser una pieza clave para el uso real de la IA en las organizaciones.