Amazon está digitalizando y destruyendo físicamente libros raros y agotados para extraer datos de texto únicos destinados al…
…entrenamiento de modelos de lenguaje grandes. Dado que los corpus públicos de la web están en gran parte agotados, los archivos físicos propietarios se han convertido en un cuello de botella crítico para la diferenciación de modelos. Esta práctica intensifica los debates sobre los derechos de propiedad intelectual y la sostenibilidad a largo plazo de los pipelines de datos de IA.
Generado por IA: resúmenes redactados por IA a partir de las fuentes enlazadas. Cómo usamos la IA
Resumen fuente
Amazon está digitalizando y destruyendo físicamente libros raros y agotados para extraer datos de texto únicos destinados al entrenamiento de modelos de lenguaje grandes. Dado que los corpus públicos de la web están en gran parte agotados, los archivos físicos propietarios se han convertido en un cuello de botella crítico para la diferenciación de modelos. Esta práctica intensifica los debates sobre los derechos de propiedad intelectual y la sostenibilidad a largo plazo de los pipelines de datos de IA.