Amazon está digitalizando y destruyendo físicamente libros raros y descatalogados para extraer datos de texto únicos para entrenar...
Grandes modelos de lenguaje. Dado que los corpus web públicos están en gran medida agotados, los archivos físicos propietarios se han convertido en un cuello de botella crítico para la diferenciación de modelos. Esta práctica intensifica los debates sobre los derechos de propiedad intelectual y la sostenibilidad a largo plazo de los pipelines de datos de IA.
Resumen fuente
Amazon está digitalizando y destruyendo físicamente libros raros y descatalogados para extraer datos de texto únicos para entrenar grandes modelos de lenguaje. Dado que los corpus web públicos están en gran medida agotados, los archivos físicos propietarios se han convertido en un cuello de botella crítico para la diferenciación de modelos. Esta práctica intensifica los debates sobre los derechos de propiedad intelectual y la sostenibilidad a largo plazo de los pipelines de datos de IA.