ИИ-компании используют метод «уничтожения реальных книг» для сканирования и обучения моделей, избегая загрязнения контента
Журналисты-расследователи выяснили, что ряд ИИ-компаний разрезают реальные книги на отдельные страницы для сканирования, чтобы предотвратить деградацию ИИ из-за изучения синтетических данных.
Индустрия искусственного интеллекта сталкивается с новыми этическими вопросами после подтверждения того, что некоторые ИИ-компании используют метод, известный как деструктивное сканирование. Они срезают корешки книг и разделяют страницы для подачи в высокоскоростные сканеры, в результате чего физические экземпляры уничтожаются.
Причиной массового уничтожения книг является потребность в высококачественных обучающих данных, написанных людьми до 2022 года и еще не загрязненных контентом, созданным ИИ. Это делается для предотвращения коллапса моделей (Model Collapse) — состояния, при котором эффективность ИИ падает из-за обучения на данных, сгенерированных другими нейросетями.
Эта проблема получила широкую огласку благодаря расследованию издания *404 Media*, которое спрятало трекеры AirTag в подержанных книгах и обнаружило, что они отправляются на объект Amazon в Лас-Вегасе, где книги уничтожаются ради сканирования. Кроме того, документы по судебному иску против компании *Anthropic* раскрыли существование проекта «Project Panama», отражающего аналогичные усилия, а также юридические споры о том, подпадает ли покупка книг для уничтожения и сканирования под добросовестное использование (Fair Use).
В связи с этой ситуацией группы по защите прав потребителей и общественные организации начали действовать, подав жалобу в Федеральную торговую комиссию США (FTC) с требованием расследовать уничтожение культурных ценностей и монополизацию данных в этой индустрии.
Это отражает колоссальную потребность глобальных ИИ-компаний в сырых данных, что влияет на культурное наследие и интеллектуальную собственность, а также может стать важным прецедентом для законов об авторском праве и использовании данных в будущем.