Skip to content
AI 인텔리전스Aug 18, 2026AI 인텔리전스
기사

Amazon은 대규모 언어 모델 훈련을 위한 고유한 텍스트 데이터를 추출하기 위해 희귀하고 절판된 책을 디지털화하고 물리적으로 파괴하고 있습니다.

공개 웹 코퍼스가 대부분 고갈됨에 따라 독점적인 물리적 아카이브가 모델 차별화의 중요한 병목 지점이 되었습니다. 이러한 관행은 지적 재산권과 AI 데이터 파이프라인의 장기적 지속 가능성에 대한 논쟁을 심화시킵니다.

Data Cube AI 편집팀출처: VentureBeat
01

출처 브리프

Amazon은 대규모 언어 모델 훈련을 위한 고유한 텍스트 데이터를 추출하기 위해 희귀하고 절판된 책을 디지털화하고 물리적으로 파괴하고 있습니다. 공개 웹 코퍼스가 대부분 고갈됨에 따라 독점적인 물리적 아카이브가 모델 차별화의 중요한 병목 지점이 되었습니다. 이러한 관행은 지적 재산권과 AI 데이터 파이프라인의 장기적 지속 가능성에 대한 논쟁을 심화시킵니다.