Skip to content
Intelligence IAAug 18, 2026Intelligence IA
Article

Amazon numérise et détruit physiquement des livres rares et épuisés pour extraire des données textuelles uniques destinées à...

L'entraînement de grands modèles de langage. Étant donné que les corpus web publics sont en grande partie épuisés, les archives physiques propriétaires sont devenues un goulot d'étranglement critique pour la différenciation des modèles. Cette pratique intensifie les débats sur les droits de propriété intellectuelle et la durabilité à long terme des pipelines de données pour l'IA.

Redaction Data Cube AISource: VentureBeat
01

Brief source

Amazon numérise et détruit physiquement des livres rares et épuisés pour extraire des données textuelles uniques destinées à l'entraînement de grands modèles de langage. Étant donné que les corpus web publics sont en grande partie épuisés, les archives physiques propriétaires sont devenues un goulot d'étranglement critique pour la différenciation des modèles. Cette pratique intensifie les débats sur les droits de propriété intellectuelle et la durabilité à long terme des pipelines de données pour l'IA.