아마존, AI 학습용으로 희귀 도서 절단·파괴 논란
아마존이 희귀 도서를 대량으로 구매해 책등을 잘라내 스캔한 뒤 AI 모델 학습 데이터로 활용하는 것으로 드러났습니다. 404 미디어가 추적 장치를 넣은 희귀 서적이 라스베이거스 아마존 시설에 도착하는 것을 확인했습니다. 인터넷에서 구할 수 없는 절판 도서는 2022년 이전 출간으로 AI 생성 텍스트가 섞이지 않아 모델 붕괴(model collapse)를 피할 수 있는 귀중한 학습 데이터로 주목받고 있습니다.
요약 게시: 2026년 8월 17일 오전 9:38 (PDT), 어맨다 실벌링
아마존, 한때 온라인 서점이었던 기업, AI 모델 학습을 위해 희귀 도서를 파괴하다
404 미디어에 따르면, 아마존은 희귀 도서를 대량으로 구매해 책등을 잘라낸 뒤 스캔하여 AI 학습에 활용하고 있다. 404 미디어는 추적 장치를 희귀 도서에 숨겼고, 이 책은 결국 라스베이거스에 있는 아마존 시설에 도착했다. 이 시설은 'VGT3'로 불리며, 발톱으로 책을 든 공룡 심볼로 자신을 나타낸다.
아마존은 404 미디어에 보낸 성명에서 "고객이 사용하는 제품과 서비스를 개선하기 위해 상업적 유통 경로를 통해 도서를 구매한다"고 밝혔다.
아마존 같은 기업들은 LLM(대규모 언어 모델) 학습을 위해 어마어마한 양의 텍스트가 필요하며, 인터넷에서 얻을 수 있는 텍스트는 이미 거의 소진된 상태다(앤스로픽의 경우 불법 복제 도서를 사용하기도 했다). 절판되었거나 인터넷에서 찾을 수 없는 희귀 도서들은 갈망하는 학습 데이터의 새로운 원천이 된다.
특히 이런 텍스트는 2022년 이전에 출간된 것이기 때문에 LLM이 생성한 글이 포함되어 있을 가능성이 전혀 없어 매우 가치 있다. LLM이 AI 생성 텍스트로 학습하면 '모델 붕괴(model collapse)' 위험이 있는데, 이는 AI 생성 텍스트를 너무 많이 흡수한 후 LLM 출력 품질이 저하되며 발생할 수 있다.