CIFQA usa sistema multiagente para reduzir erros em cálculos financeiros
Pesquisadores propõem framework em que LLMs compreendem perguntas, mas delegam cálculos a ferramentas determinísticas, reportando 90,87% de precisão geral.
Kunjesh Parekh, Anil Kumar Tiwari e Divya Saxena publicaram a pesquisa CIFQA no arXiv (nº 2608.26114), visando corrigir as limitações dos Large Language Models (LLMs) em consultas financeiras com cálculos em múltiplas etapas, onde os modelos costumam gerar respostas plausíveis, porém com números incorretos.
O CIFQA (Calculation-Intensive Financial Query Answering) é um framework multiagente cujo conceito central é separar a "compreensão de linguagem" do "processamento numérico", em vez de deixar que o LLM interprete o problema, escolha fórmulas, calcule e responda tudo sozinho.
O sistema conta com agentes especializados para interpretar perguntas, rotear tarefas, extrair parâmetros, planejar etapas de cálculo e redigir respostas. Já os cálculos e regras condicionais são delegados a ferramentas em Python de comportamento determinístico, reduzindo a dependência de estimativas numéricas do modelo.
Os pesquisadores testaram o sistema com consultas sobre depósitos a prazo fixo (Fixed Deposit), que envolvem taxas de juros, prazos, fórmulas e regras variadas. Os resultados reportam 95,54% de precisão em perguntas com cálculos intensivos e 90,87% no geral, superando LLMs de grande porte convencionais no mesmo benchmark.
Esses resultados indicam que, em tarefas onde pequenos desvios alteram completamente o resultado financeiro, projetar arquiteturas que acionam ferramentas de cálculo sistematicamente pode ser mais eficaz do que apenas aumentar o tamanho dos modelos. Contudo, como os dados se limitam a depósitos a prazo, ainda não se pode concluir que a mesma precisão se manterá em empréstimos, impostos, investimentos ou regulações financeiras locais.
Essa abordagem pode ajudar serviços bancários e assistentes financeiros em tailandês a resolver problemas com fórmulas e condições complexas de forma mais auditável, embora a implementação prática ainda exija testes com produtos e regras locais.