ทันเอไอ

Global AI & tech news, in your language · every story source-checked

🌐Follow
← Back to news
LINE Facebook X
模型与 AI 研究Verified

研究显示 LLM 可辅助审查疾病模型,但仍需人工核验

研究人员开发了一套流程,让 LLM 从 536 篇疾病传播建模论文中提取信息。文章级准确率最高约为 81.67%,但会因数据复杂度而出现显著差异。

📅 2026年8月29日 01:33
研究显示 LLM 可辅助审查疾病模型,但仍需人工核验

一项名为《Leveraging Large Language Models for Systematic Literature Review of Disease Spread Models》的研究,测试了使用 Large Language Models(LLM,大型语言模型)辅助开展 systematic literature review(SLR,系统性文献综述)。这项工作通常需要耗费大量时间,按照统一标准检索、阅读并分类学术论文。

研究团队开发了一套 pipeline(多阶段工作流程),从 536 篇经过同行评审的学术论文中提取与模型相关的信息。这些论文均采用 agent-based modeling(基于主体的建模,即模拟各个主体的行为及其互动)研究疾病传播,随后将系统结果与人工完成的 SLR 进行比较。

在文章层面,GPT-4.1 的准确率约为 77.95%,GPT-5.0 约为 81.67%。不过,这些总体数字并不意味着模型处理所有类型数据时表现相同。按数据字段分别衡量时,准确率范围从 32.40% 到 100.00%;越复杂或越需要主观判断的字段,可靠性越低。

研究还发现,多个 LLM 的回答一致程度或可作为初步判断输出质量的信号。如果各模型的答案差异较大,可能说明部分回答存在 hallucination(生成看似可信、但与原文不符的信息)。这一点可帮助确定哪些字段尤其需要交由人工核验,但模型意见一致仍不能被视为答案必然正确的证据。

因此,研究结果支持将 LLM 用作减轻数据提取工作量的辅助工具,而非完全取代研究人员,尤其是在需要理解语境或进行判断的任务中。该论文已发布于 arXiv 的 cs.AI 分类,并计划在 Winter Simulation Conference 2026 上发表。

Why it matters
更快审查大量疾病研究,或能帮助泰国研究人员和公共卫生机构及时掌握最新知识;但准确率跨度较大,说明相关结果用于决策前仍须由专家核验。
#LLM#งานวิจัย AI#แบบจำลองการแพร่โรค#การทบทวนวรรณกรรม
Sources (rewritten & summarized from): arXiv cs.AI · insiderly.ai · arxiv.org · arxiv.org

Comments

Loading comments…

No sign-up needed · comments are auto-filtered and moderated