Amazon achète des livres physiques, parfois rares ou épuisés, les découpe pour les numériser puis les détruit. Derrière cette pratique révélée par 404 Media se dessine un nouvel enjeu pour l’IA : trouver des textes humains encore absents du Web.
L’intelligence artificielle a besoin de toujours plus de textes. Au point qu’Amazon achète désormais des livres physiques, parfois rares, épuisés ou difficiles à trouver, pour les numériser avant de détruire les exemplaires.
Amazon détruit des livres pour nourrir son IA
L’affaire a été révélée le 17 août par 404 Media. Pour savoir qui se cachait derrière une commande d’environ 1 000 livres passée auprès d’un libraire via Biblio, le média a placé un AirTag dans l’un des ouvrages. Le traceur l’a conduit jusqu’à l’entrepôt Amazon LAS8, dans l’agglomération de Las Vegas.
Des salariés y décrivent une activité de numérisation à grande échelle : les reliures sont coupées, les pages séparées puis scannées. Le livre physique est donc sacrifié au passage.
Amazon reconnaît acheter des ouvrages par les circuits commerciaux pour « développer et améliorer » ses produits et services, mais ne précise ni quels produits sont concernés ni quels modèles utilisent ces textes. Rien ne permet donc d’affirmer que ces livres servent spécifiquement à entraîner les modèles Nova.
Même prudence avec le mot « rare ». 404 Media l’emploie, mais la liste des titres n’est pas connue. Il ne s’agit pas nécessairement d’exemplaires uniques ou de trésors bibliophiliques. En revanche, des ouvrages épuisés, spécialisés ou peu diffusés présentent un intérêt évident pour l’IA : leur contenu est moins susceptible d’être déjà disponible en ligne.
C’est probablement le vrai sujet.
Après avoir absorbé une grande partie du Web, les entreprises d’intelligence artificielle cherchent désormais des textes humains qu’elles n’ont pas encore vus. Les livres anciens offrent une matière précieuse : des textes longs, édités, structurés et, surtout, écrits avant l’explosion récente des contenus générés par IA.
Amazon n’est pas le premier à utiliser cette méthode. Dans le procès opposant des auteurs à Anthropic, l’entreprise derrière Claude, la justice américaine avait révélé une procédure très proche : achat de millions de livres, découpe des reliures, numérisation des pages puis destruction des exemplaires physiques.
En juin 2025, le juge William Alsup avait considéré que, dans les circonstances précises de cette affaire, la transformation d’un livre papier légalement acheté en copie numérique interne pouvait relever du fair use. Il avait aussi jugé l’utilisation de livres pour l’entraînement comme suffisamment transformative dans ce dossier.
Mais cela ne crée pas un droit général pour les entreprises d’IA. La décision n’a pas été consacrée par une juridiction d’appel et d’autres juges peuvent trancher différemment.
Anthropic avait d’ailleurs utilisé parallèlement des millions de livres provenant de bibliothèques pirates. Ce volet a débouché sur un accord de 1,5 milliard de dollars portant sur 482 460 œuvres, définitivement approuvé en juillet 2026 par la juge Araceli Martínez-Olguín.
La destruction des livres n’est pas techniquement indispensable. Elle permet surtout d’accélérer énormément la numérisation industrielle.
Et c’est ce qui rend l’histoire frappante : un livre peut désormais être suffisamment précieux pour être acheté afin d’en extraire son contenu, mais suffisamment inutile une fois numérisé pour être détruit.
Après le Web, l’industrie de l’IA commence donc à transformer le patrimoine imprimé en matière première.
À lire aussi sur SatMag : undefined
