研究指出心理健康 AI 仍存在风险,缺乏实际临床试验
一项国际研究论文分析显示,LLMs 在心理健康筛查方面潜力巨大,但仍需警惕伦理与安全方面的挑战
由 Yisong Chen 领导的研究团队在《Journal of Industrial Integration and Management》期刊上发表了一篇题为“Large Language Models in Mental Health: A Systematic Review of Applications, Innovations, and Ethical Challenges”的系统性文献综述,并发布在 arXiv 预印本库(cs.AI)上。
在本研究中,研究团队采用 PRISMA 标准研究方法,对 304 篇相关研究论文进行了筛选,最终挑选出 92 篇高质量论文,用于分析大语言模型(Large Language Models,简称 LLMs)在心理健康领域的应用。
研究结果发现,当前 LLMs 的应用范围涵盖了通过分析社交媒体文本和电子病历来早期检测抑郁症迹象及评估自杀风险,到开发对话治疗机器人(Conversational Agents)和医务人员辅助决策系统。此外,还采用了针对专科医学的 Prompt Engineering(提示词工程)以及多模态融合(Multimodal Integration,如文本、语音和传感器数据)等创新技术,以提高准确性。
然而,研究指出了重大挑战和伦理局限性,并指出大多数研究仍处于实验阶段,缺乏实际临床验证(Lack of Clinical Validation)。此外,还存在准确性和安全性方面的风险,例如幻觉(Hallucination)问题和迎合用户(Sycophancy)倾向,这可能导致诊断错误,同时还涉及患者数据隐私、模型透明度(黑箱问题)以及缺乏明确法律监管框架等议题。
这反映出尽管 AI 和 LLMs 技术在协助心理健康筛查方面扮演着越来越重要的角色,但由于安全限制,该模型尚未准备好独立用于临床,用户和医务人员仍需保持警惕。