CIFQA reduziert mit einem Multi-Agenten-System Fehler bei Finanzberechnungen
Forschende stellen ein Framework vor, bei dem LLMs die Fragen verstehen, die Berechnungen jedoch regelbasierten Werkzeugen überlassen. Die angegebene Gesamtgenauigkeit beträgt 90,87 %.
Kunjesh Parekh, Anil Kumar Tiwari und Divya Saxena haben die CIFQA-Studie unter der Nummer 2608.26114 auf arXiv veröffentlicht. Sie soll eine Schwäche von Large Language Models beziehungsweise LLMs (großen Sprachmodellen) bei Finanzfragen mit mehrstufigen Berechnungen beheben: Modelle können plausibel klingende Antworten erzeugen, obwohl die Zahlen falsch sind.
CIFQA steht für Calculation-Intensive Financial Query Answering und ist ein Multi-Agent-Framework, das Aufgaben auf mehrere Agenten verteilt. Der zentrale Ansatz besteht darin, das Sprachverständnis von der Zahlenverarbeitung zu trennen, statt ein LLM die Aufgabe interpretieren, die Formel auswählen, die Berechnung ausführen und die vollständige Antwort formulieren zu lassen.
Das System nutzt spezialisierte Agenten, um Fragen zu interpretieren, den Arbeitsablauf auszuwählen, Parameter zu extrahieren, Berechnungsschritte zu planen und Antworten zu formulieren. Berechnungen und regelbasierte Bedingungen werden hingegen von Werkzeugen übernommen, die mit Python entwickelt wurden und deterministisch arbeiten, bei identischen Eingaben also stets denselben Ablauf und dasselbe Ergebnis liefern. Dadurch muss sich das System weniger auf Zahlenschätzungen des Modells verlassen.
Die Forschenden testeten das System mit Fragen zu Fixed Deposits, bei denen Zinssätze, Laufzeiten, Formeln und verschiedene Bedingungen berücksichtigt werden müssen. Den veröffentlichten Ergebnissen zufolge erreichte CIFQA bei besonders rechenintensiven Fragen eine Genauigkeit von 95,54 % und insgesamt 90,87 %. Damit übertraf es große, allgemein eingesetzte LLMs im selben Test.
Die Ergebnisse deuten darauf hin, dass bei Aufgaben, in denen schon kleine Abweichungen eine Finanzantwort verändern können, eine Architektur mit systematisch eingebundenen Berechnungswerkzeugen wichtiger sein könnte als eine bloße Vergrößerung des Modells. Sämtliche Werte stammen jedoch aus den von den Forschenden veröffentlichten Tests zu Fixed Deposits. Es lässt sich daher noch nicht unmittelbar schließen, dass CIFQA bei Krediten, Steuern, Investitionen oder den Finanzvorschriften einzelner Länder eine vergleichbare Genauigkeit erreicht.
Der Ansatz könnte Banken und thailändischsprachigen Finanzassistenten helfen, Aufgaben mit komplexen Formeln und Bedingungen nachvollziehbarer zu lösen. Vor einem Praxiseinsatz sind jedoch direkte Tests mit thailändischen Produkten und Vorschriften erforderlich.