Des entreprises d'IA détruisent de vrais livres pour entraîner leurs modèles et éviter la pollution des données
Une enquête révèle que plusieurs entreprises d'IA coupent et séparent les pages de vrais livres pour les scanner, évitant ainsi la dégradation des modèles causée par l'apprentissage de fausses données.
Le secteur de l'intelligence artificielle fait face à de nouvelles questions éthiques après des rapports confirmant que plusieurs entreprises d'IA utilisent une méthode appelée « balayage destructif » (Destructive Scanning), qui consiste à couper la reliure des livres et à séparer les pages pour les alimenter dans des scanners haute vitesse, détruisant ainsi les ouvrages au cours du processus.
Cette destruction massive de livres est motivée par le besoin de données d'entraînement (Training Data) de haute qualité, authentiquement rédigées par des humains avant 2022 et non polluées par du contenu généré par l'IA. Cela permet d'éviter le phénomène de « Model Collapse », où les performances de l'IA se dégradent en apprenant à partir de données générées par d'autres IA.
Cette pratique a été mise en lumière par une enquête du média *404 Media*, qui a dissimulé des AirTags dans des livres d'occasion pour retracer leur parcours jusqu'à un site d'Amazon à Las Vegas, où les livres sont détruits pour être scannés. De plus, des documents issus d'un procès contre la société *Anthropic* ont révélé l'existence du projet « Project Panama », témoignant d'efforts similaires ainsi que de débats juridiques sur la question de savoir si l'achat de livres pour les détruire en vue de les scanner relève de l'usage loyer (Fair Use).
Face à cette situation, des groupes de défense des consommateurs et des organisations publiques ont agi en saisissant la Federal Trade Commission (FTC) américaine pour enquêter sur la destruction de ressources culturelles et le monopole des données dans cette industrie.
Cela reflète la demande insatiable de données brutes des entreprises mondiales d'IA, ce qui a un impact sur le patrimoine culturel et la propriété intellectuelle, et pourrait établir un précédent majeur pour les lois sur le droit d'auteur et l'utilisation des données à l'avenir.