Исследование: даже с расширенным контекстным окном ИИ при написании литературных обзоров всё ещё нуждается в участии человека
Новое исследование на arXiv показало, что использование больших языковых моделей (LLM) для написания литературных обзоров по-прежнему требует тщательной проверки человеком для соблюдения академических стандартов.
Исследование «LLMs for Academic Workflows: An Evaluation of Literature Reviews Generated with Short and Long Context Windows of LLMs» (arXiv:2608.26145) посвящено влиянию размера контекстного окна (Context Window) на качество литературных обзоров (Literature Review), создаваемых большими языковыми моделями (Large Language Model, LLM).
Авторы оценили 20 литературных обзоров, созданных ИИ на основе академических источников, включая Semantic Scholar и arXiv. Два исследователя проверяли их качество по 15 стандартным критериям.
Результаты показали, что созданные ИИ литературные обзоры всё ещё требуют проверки и контроля со стороны человека (Human Oversight), чтобы соответствовать стандартам академических публикаций. Хотя увеличение контекстного окна позволяет модели обрабатывать больше информации и лучше сохранять связность длинного текста, остаются такие проблемы, как повторы и пропуск отдельных важных аспектов.
Исследование демонстрирует нынешние ограничения ИИ в сложной академической работе. Тайским исследователям и студентам, использующим LLM для обобщения материалов или написания статей, следует соблюдать осторожность и каждый раз самостоятельно проверять точность результата.