ทันเอไอ

Global AI & tech news, in your language · every story source-checked

🌐Follow
← Back to news
LINE Facebook X
工具/开源Verified

AI公司采用“销毁实体书”方式扫描训练数据,以规避内容污染问题

调查媒体发现,多家中小型AI公司在幕后选择切断书脊、拆开实体书页进行扫描输入系统,以防止AI系统因学习虚假信息而导致模型退化。

📅 2026年8月23日 00:35
AI公司采用“销毁实体书”方式扫描训练数据,以规避内容污染问题

人工智能界正面临新一轮的道德拷问。多份报告证实,多家AI公司采用了被称为“破坏性扫描”(Destructive Scanning)的方法,通过切断书脊并拆散纸页以输入高速扫描仪,导致书籍在这一过程中被销毁。

大规模销毁书籍背后的原因,是为了获取2022年之前由人类真实撰写的高质量训练数据(Training Data),这些数据尚未被AI生成的内容污染。此举旨在防止Model Collapse(模型崩塌)问题,即AI在学习由其他AI生成的数据时性能出现退化。 *404 Media*新闻机构的一项调查进一步揭露了这一问题:他们在二手书中植入了AirTag追踪器,最终发现其流向了亚马逊位于拉斯韦加斯的场所,该处正是通过销毁书籍来进行扫描。此外,针对*Anthropic*公司的诉讼文件也披露了名为“Panama项目”(Project Panama)的计划,反映了类似的尝试,并引发了关于购买书籍并销毁以进行扫描是否属于合理使用(Fair Use)的法律争议。

鉴于此情况,消费者权益集团和公共组织已开始采取行动,向美国联邦贸易委员会(FTC)提交申请,要求介入调查该行业对文化资源的破坏及数据垄断行为。

Why it matters
反映全球AI公司对海量原始数据的巨大需求已对文化遗产和知识产权造成影响,这可能成为未来版权法和数据使用规则的重要先例。
#AI#ลิขสิทธิ์#Model Collapse#จริยธรรม AI
Sources (rewritten & summarized from): Hacker News · twit.tv · facebook.com · emeraldbook.org · facebook.com · forbes.com

Comments

Loading comments…

No sign-up needed · comments are auto-filtered and moderated