연구 결과, 입력 데이터 형식이 모델 크기보다 중요…LLM 메모리 정확도 최대 72점 향상
연구진이 RENDER를 공개하며 LLM 입력 데이터 형식이 모델 크기보다 메모리 정확도에 더 큰 영향을 미친다고 밝혔다.
대규모 언어 모델(LLM)의 메모리 시스템과 검색 증강 생성(RAG) 시스템을 평가할 때는 입력 데이터의 세부 형식이 흔히 간과된다. 대화 기록은 메모리 노트, 요약, 구조화된 기록 또는 원문 텍스트 등 다양한 형태로 변환될 수 있다. 최근 University of Waterloo와 Stanford University 소속 연구진 및 독립 연구자들은 대화 내용은 그대로 유지하면서 모델에 제시되는 형식(Reader-facing artifact)만 바꿔 테스트할 수 있는 벤치마크 제어 도구 RENDER를 제안했다.
연구진은 답변에 필요한 내용이 입력 데이터의 어느 위치에 들어가는지를 지정하는 Five-level packet ladder와 실제 운영 형식을 모사한 결정론적 템플릿을 결합했다. 템플릿에는 ChatGPT 스타일 대화 목록, LangChain 요약, MemGPT 스타일의 형식화된 기록, 대화 원문 등이 포함됐다. LongMemEval 질문 500개와 모델 9개를 대상으로 실험한 결과, 입력 예산을 동일하게 맞춘 Matched-budget resolved packets는 최신 대화 위주로 잘린 원문(Recency-truncated raw dialogue)보다 42.4~72.6점 높은 성능을 기록했다. 실제 사용 환경을 모사한 템플릿에서도 최고점과 최저점의 차이가 24.6~48.8점에 달해, 데이터 배치 형식만으로도 시스템 결과가 크게 달라질 수 있음을 보여줬다.
이번 연구는 태국의 AI 개발자와 사용자가 LLM에 데이터를 입력하기 전 형식을 최적화하는 일이 대형 모델 선택만큼 중요하다는 점을 이해하는 데 도움을 준다. 이를 통해 비용을 절감하고 RAG 시스템의 정확도를 높일 수 있다.