Amazon numérise et détruit physiquement des livres rares et épuisés pour extraire des données textuelles uniques destinées à...
L'entraînement de grands modèles de langage. Étant donné que les corpus web publics sont en grande partie épuisés, les archives physiques propriétaires sont devenues un goulot d'étranglement critique pour la différenciation des modèles. Cette pratique intensifie les débats sur les droits de propriété intellectuelle et la durabilité à long terme des pipelines de données pour l'IA.
Brief source
Amazon numérise et détruit physiquement des livres rares et épuisés pour extraire des données textuelles uniques destinées à l'entraînement de grands modèles de langage. Étant donné que les corpus web publics sont en grande partie épuisés, les archives physiques propriétaires sont devenues un goulot d'étranglement critique pour la différenciation des modèles. Cette pratique intensifie les débats sur les droits de propriété intellectuelle et la durabilité à long terme des pipelines de données pour l'IA.