ทันเอไอ

Global AI & tech news, in your language · every story source-checked

🌐Follow
← Back to news
LINE Facebook X
Modelle & KI-ForschungVerified

Studie: LLMs können Reviews von Krankheitsmodellen unterstützen, benötigen aber weiterhin menschliche Kontrolle

Forschende entwickelten eine Pipeline, mit der LLMs Daten aus 536 Studien zur Modellierung von Krankheitsausbreitungen extrahieren. Die höchste Genauigkeit auf Artikelebene lag bei rund 81,67 %, variierte jedoch stark je nach Komplexität der Daten.

📅 29. Aug. 2026, 01:33
Studie: LLMs können Reviews von Krankheitsmodellen unterstützen, benötigen aber weiterhin menschliche Kontrolle

Die Studie „Leveraging Large Language Models for Systematic Literature Review of Disease Spread Models“ untersucht den Einsatz von Large Language Models beziehungsweise LLMs für Systematic Literature Reviews (SLR). Diese erfordern üblicherweise viel Zeit, um wissenschaftliche Arbeiten nach einheitlichen Kriterien zu suchen, zu lesen und zu kategorisieren.

Das Forschungsteam entwickelte eine mehrstufige Pipeline, um modellbezogene Informationen aus 536 begutachteten Fachartikeln zu extrahieren. Sämtliche Arbeiten befassen sich mit Agent-based Modeling zur Untersuchung der Ausbreitung von Krankheiten. Anschließend wurden die Ergebnisse des Systems mit einer von Menschen erstellten SLR verglichen.

Auf Artikelebene erreichte GPT-4.1 eine Genauigkeit von etwa 77,95 %, GPT-5.0 rund 81,67 %. Diese Gesamtwerte bedeuten jedoch nicht, dass die Modelle bei allen Datentypen gleich gut abschnitten. Je nach Datenfeld lag die Genauigkeit zwischen 32,40 % und 100,00 %. Komplexe Felder oder solche, die subjektive Interpretation erfordern, waren weniger zuverlässig.

Die Studie zeigt zudem, dass die Übereinstimmung zwischen den Antworten mehrerer LLMs als erster Hinweis auf die Ergebnisqualität dienen kann. Weichen die Antworten stark voneinander ab, könnte dies darauf hindeuten, dass Teile davon Halluzinationen enthalten – also plausibel wirkende Angaben, die nicht mit der Quelle übereinstimmen. So ließe sich bestimmen, welche Felder besonders gründlich von Menschen geprüft werden sollten. Ein Konsens zwischen Modellen ist jedoch kein sicherer Beleg für die Richtigkeit einer Antwort.

Die Ergebnisse sprechen daher dafür, LLMs zur Entlastung bei der Datenextraktion einzusetzen, nicht als vollständigen Ersatz für Forschende – insbesondere bei Aufgaben, die Kontextverständnis oder Urteilsvermögen verlangen. Die Arbeit wurde auf arXiv in der Kategorie cs.AI veröffentlicht und soll auf der Winter Simulation Conference 2026 vorgestellt werden.

Why it matters
Schnellere Reviews großer Mengen an Krankheitsforschung könnten Forschenden und thailändischen Gesundheitsbehörden helfen, neue Erkenntnisse zeitnah zu verfolgen. Die stark schwankende Genauigkeit zeigt jedoch, dass Fachleute die Ergebnisse prüfen müssen, bevor sie als Entscheidungsgrundlage dienen.
#LLM#งานวิจัย AI#แบบจำลองการแพร่โรค#การทบทวนวรรณกรรม
Sources (rewritten & summarized from): arXiv cs.AI · insiderly.ai · arxiv.org · arxiv.org

Comments

Loading comments…

No sign-up needed · comments are auto-filtered and moderated