Исследование: формат входных данных важнее размера модели и повышает точность памяти LLM на 72,6 пункта
Исследователи представили RENDER и показали, что формат входных данных сильнее влияет на точность памяти LLM, чем размер модели
При оценке систем памяти и поиска, или RAG (Retrieval-Augmented Generation), для больших языковых моделей — LLM (Large Language Model) — часто упускают из виду формат входных данных. История диалога может подаваться как записи памяти, сводки, структурированные заметки или необработанный текст. Авторы из University of Waterloo, Stanford University и независимые исследователи представили RENDER — инструмент контроля бенчмарков, который сохраняет содержание диалога, но меняет формат представления данных, видимый модели (reader-facing artifact).
В исследовании используется пятиуровневая шкала пакетов (five-level packet ladder), определяющая положение ответа во входных данных, а также фиксированные шаблоны, имитирующие реальные форматы: историю чата в стиле ChatGPT, сводки LangChain, типизированные записи MemGPT и необработанный диалог. Тестирование на 500 вопросах LongMemEval и девяти моделях показало, что оптимизированные пакеты с сопоставимым бюджетом (matched-budget resolved packets) превосходят необработанные диалоги, сокращённые по давности (recency-truncated raw dialogue), на 42,4–72,6 пункта. В шаблонах, приближённых к реальному применению, разница между лучшим и худшим результатом составила 24,6–48,8 пункта. Это подтверждает, что формат данных способен существенно изменить результат работы системы.
Исследование показывает разработчикам и пользователям AI-систем в Таиланде, что подготовка данных перед отправкой в LLM не менее важна, чем выбор крупной модели. Это позволяет снизить затраты и повысить точность RAG-систем.