CIFQA 采用多智能体系统,减少金融计算错误
研究人员提出一种框架,由 LLM 理解问题,再将计算任务交给按固定规则运行的工具,报告称整体准确率达 90.87%
Kunjesh Parekh、Anil Kumar Tiwari 和 Divya Saxena 在 arXiv 发布了编号为 2608.26114 的 CIFQA 研究,旨在解决 Large Language Models(LLM,大语言模型)回答需多步计算的金融问题时存在的短板。这类模型生成的答案可能看似合理,实际数字却有误。
CIFQA 是 Calculation-Intensive Financial Query Answering 的缩写,是一种 Multi-agent(多智能体协作)框架。其核心理念是将“语言理解”与“数值处理”分开,避免让 LLM 独自完成题意理解、公式选择、计算和回答的全部流程。
系统内部设有多个专用智能体,分别负责理解问题、选择工作流程、提取参数、规划计算步骤和组织答案;计算及基于规则的条件判断则交给以 Python 开发的工具执行。这些工具采用 Deterministic(确定性)方式运行,即相同输入会依照相同步骤产生相同结果,从而减少对模型猜测数值的依赖。
研究人员使用与 Fixed Deposit(定期存款)相关的问题测试该系统,涉及利率、期限、数值公式及各种条件。报告结果显示,CIFQA 在计算密集型问题上的准确率为 95.54%,整体准确率为 90.87%,高于在相同测试中以通用方式使用的大型 LLM。
结果表明,在微小误差就可能改变金融答案的任务中,让模型系统化调用计算工具的架构设计,可能比单纯扩大模型规模更重要。不过,所有数据均来自研究团队针对定期存款任务报告的结果,因此尚不能断定该系统在贷款、税务、投资或各国金融法规方面也能保持同等准确率。
这种方法可能让银行服务和泰语金融助手在回答涉及复杂公式与条件的问题时更易核验,但在实际应用前,仍需针对泰国的金融产品和监管规则进行直接测试。