研究显示,输入数据格式比模型规模更重要,LLM 记忆准确率最高提升 72 分
研究团队推出 RENDER,发现 LLM 输入数据的格式对记忆准确率的影响大于模型规模
在评估大型语言模型(LLM,Large Language Model)的记忆系统和检索系统,即 RAG(Retrieval-Augmented Generation)时,人们通常会忽略数据输入方式的细节,尽管系统可能会将对话历史转换为记忆记录、摘要、结构化记录或原始文本。近日,来自 University of Waterloo、Stanford University 及独立研究人员的团队共同提出 RENDER。这是一款基准测试控制工具(Benchmark Control),能够保持对话内容不变,仅调整呈现给模型的数据格式(Reader-facing artifact)。
该研究结合五级数据包阶梯(Five-level packet ladder),用于定位答案内容在输入数据中的位置,并采用确定性模板模拟实际工作方式,包括 ChatGPT 风格的对话列表、LangChain 摘要、MemGPT 风格的类型化记录以及原始对话文本。研究团队使用 LongMemEval 的 500 道问题和 9 个模型进行测试,结果发现,预算匹配的已解析数据包(Matched-budget resolved packets)比按时间新近度截断的原始对话(Recency-truncated raw dialogue)高出 42.4 至 72.6 分。此外,在贴近真实应用的模板中,最高分与最低分之间也相差 24.6 至 48.8 分,进一步表明数据组织格式足以显著改变系统表现。
这项研究让泰国的 AI 开发者和用户认识到,在将数据输入 LLM 前优化其格式,与选择大型模型同样重要,既能降低成本,也能提升 RAG 系统的准确率。