AI와 창작 공유 문화의 파괴
생성형 AI(LLM)가 저작권과 라이선스를 무시하고 온라인의 모든 콘텐츠를 학습하면서 40년에 걸쳐 형성된 오픈소스 사회적 계약이 무너지고 있다고 지적하는 글입니다. 개발자 입장에서 코드 공개가 보안 취약점 노출과 AI 봇의 저품질 PR 홍수로 이어지는 등 부담으로 변하면서, 지식 공유가 축복에서 저주가 될 수 있음을 경고합니다.
생성형 AI(LLM)가 저작권과 라이선스를 무시하고 온라인의 모든 콘텐츠를 학습하면서 40년에 걸쳐 형성된 오픈소스 사회적 계약이 무너지고 있다고 지적하는 글입니다. 개발자 입장에서 코드 공개가 보안 취약점 노출과 AI 봇의 저품질 PR 홍수로 이어지는 등 부담으로 변하면서, 지식 공유가 축복에서 저주가 될 수 있음을 경고합니다.
뉴욕타임스가 OpenAI와 마이크로소프트를 상대로 제기한 저작권 침해 소송에서, 양사 내부 문서를 인용한 법정 서류가 공개되었습니다. 마이크로소프트 응용과학 디렉터 브렌트 헥트는 AI가 콘텐츠를 긁어모으는 것을 '인류 역사상 최대의 노동 도난'이라 표현했으며, OpenAI 임원들도 퍼블리셔에게 실존적 위협이 된다고 인정한 것으로 드러났습니다. 이는 AI 학습 데이터의 '공정 사용(fair use)' 주장을 약화시킬 수 있는 중요한 증거입니다.
404 Media의 'Behind the Blog' 코너로, 이번 주 주요 기사 제작 과정의 뒷이야기를 다룹니다. 기자 에마누엘은 스포티파이에서 실제 아티스트 이름으로 유포되는 AI 생성 음악 문제를 조사하며, 그 심각성과 광범위함에 다시 한번 충격을 받았다고 전합니다. AI 콘텐츠가 디지털 음악 유통 시스템을 악용하는 사례가 매우 만연하다는 점이 이번 이슈의 핵심입니다.
뉴욕타임스 등 미국 억론사들이 OpenAI와 마이크로소프트를 상대로 수십억 달러의 손해배상을 청구한 소송에서, AI 기업 내부 문서와 증언이 공정 이용(fair use) 방어 논리를 정면으로 반박하고 있습니다. 마이크로소프트 임원은 AI 학습 데이터 수집을 '인류 역사상 최대 규모의 도난'이라 불렀고, 내부 자료는 챗봇이 원 저널리즘을 대체하며 미디어 산업에 '둠 루프'를 만들고 있음을 보여줍니다.
뉴욕타임스가 오픈AI와 마이크로소프트를 상대로 제기한 저작권 소송의 새로운 공개 자료에서, 마이크로소프트 최고 경영진이 AI 학습용 데이터 수집을 '절도'로 내부적으로 인정한 사실이 드러났습니다. 내부 문서는 AI 챗봇이 뉴스 매체에 '실존적 위협'이며 유료 콘텐츠를 무단으로 긁어갔고 저작권 표시를 의도적으로 제거했음을 시사합니다. 이는 오픈AI의 공정 이용(fair use) 방어 논리를 정면으로 반박하는 증거로, AI 저작권 소송의 향방에 큰 영향을 줄 수 있습니다.
Cloudflare가 검색 인덱싱은 허용하면서 AI 학습은 거부할 수 있는 'Disallow AI Training' 설정을 발표했습니다. Apple, Google, Microsoft가 이 설정을 존중하거나 존중하기로 약속했습니다. 내년 초까지 AI 요약에 포함될 콘텐츠 양까지 세밀하게 제어할 수 있게 하는 것이 목표입니다.
일레븐랩스(Elevenlabs)가 AI 음악 생성 모델 ElevenMusic의 v2.5를 앱과 API를 통해 공개했습니다. 47,885쌍의 블라인드 테스트에서 특히 R&B, 소울, 힙합, 록, 오케스트라 장르에서 v2.5가 더 선호되었습니다. 무료 사용자는 하루 5회 무손실 다운로드가 가능하며, 유료 Pro 요금제는 월 400회까지 제공됩니다.
Anthropic의 15억 달러 저작권 집단소송 합의금이 지급되는 가운데, 이미 권리가 반환된 도서에 대해 출판사들이 지분을 청구하거나 50%만 받을 자격임에도 100%를 요구하는 사례가 다수 보고되고 있습니다. 일부 문학 에이전트도 저작권자가 아님에도 몫을 청구해 작가들의 반발이 일고 있으며, 전문가들은 악의보다는 서류 관리 부실과 복잡한 합의 절차가 원인으로 분석하지만 문제가 광범위·구조적일 가능성을 지적합니다.
시애틀타임스와 뉴스데이가 자사 저널리즘 콘텐츠를 AI 학습에 무단 사용했다며 오픈AI와 마이크로소프트를 저작권 침해로 고소했습니다. 소송은 생성형 AI를 '제 꼬리를 물어먹는 뱀'에 비유하며 언론 산업 전체를 파괴할 수 있다고 주장했습니다. 특히 마이크로소프트와 오픈AI가 시애틀타임스의 언론 프로젝트를 후원해왔다는 점에서 주목받습니다.
Simon Willison이 Anthropic이 공개한 Claude(신모델 Fable 5.1)의 새 시스템 프롬프트 변경점을 분석했다. 핵심은 저작권 있는 가사·시·책 구절 재생성 금지와, SVG 등 코드로 그리는 저작권 캐릭터·로고 생성 금지 조항이 추가된 것이다. Sony Music과 Warner Chappell이 Anthropic을 상대로 가사 데이터베이스로 학습했다며 소송을 제기한 시점과 거의 일치해 단순한 우연이 아닐 것으로 보인다.
트럼프 행정부가 뉴욕타임스의 OpenAI·마이크로소프트 저작권 소송에서 연방법원에 의견서를 제출하며 OpenAI 측을 지지했다. 정부는 AI 학습이 '공정 이용(fair use)'에 해당하며, 반대 판결은 미국 AI 산업의 글로벌 리더십을 저해할 수 있다고 주장했다. AI 저작권 분쟁의 향방을 좌우할 중요한 전환점으로 평가된다.
뉴욕타임스가 오픈AI와 마이크로소프트를 상대로 제기한 저작권 소송에서 미국 법무부(DOJ)가 AI 기업 측을 지지하며, 저작권 보호 자료로 AI 모델을 학습시키는 것은 공정 사용(fair use)에 해당한다고 주장했습니다. DOJ는 학습용 복사와 모델 출력물 간의 법적 구분을 강조하며, 학습 자체에 대한 책임을 묻는 것은 저작권법이 보호하려는 창의성을 저해한다고 밝혔습니다. 이 사건은 AI 학습과 저작권 관련 법원 판결의 방향을 가늠할 대표적 사례로 주목받고 있습니다.
뉴욕타임스가 OpenAI를 상대로 제기한 소송에서 트럼프 행정부가 20페이지 분량의 의견서를 제출하며 OpenAI의 무단 저작물 활용 LLM 학습을 옹호했습니다. 의견서는 공정 이용(fair use) 원칙을 근거로 저작물 학습 제한이 미국 AI 산업 경쟁력을 저해한다고 주장했습니다. 이는 판결은 아니지만 AI 업계에 유리한 흐름을 강화하는 신호로 평가됩니다.
이번 주 팟캐스트에서는 아마존이 AI 훈련용으로 책을 스캔한 뒤 파쇄하는 창고에서 일했던 노동자와의 인터뷰를 다룹니다. 또한 LLM(Large Language Model, 대규모 언어 모델) 출력에서 특정 이름이 반복적으로 나타나는 현상과, ICE(미국 이민세관단속국)가 '유권자 사기' 관련 데이터를 대량 구매하려는 이유를 다룹니다.
전자프런티어재단(EFF)은 생성형 AI 소송에서 권리자들이 주장하는 '시장 희석' 이론을 받아들이면 공정 이용(fair use) 원칙과 저작권의 헌법적 목적이 훼손된다고 법원에 경고했습니다. VTR, 자동피아노, 사진기 등 과거 기술 패닉에서처럼 법원은 과장과 추측에 기반해 저작권 보호를 대폭 확대하지 말아야 한다고 주장했습니다.
소니 뮤직과 워너 뮤직 등 주요 음악 퍼블리셔들이 저작권이 있는 가사 수만 건을 불법 다운로드해 Claude를 학습시켰다며 앤스로픽과 CEO 다리오 아모디 등 경영진을 개인적으로 상대로 소송을 제기했습니다. 소송의 핵심은 저작물 '사용'이 아니라 토렌트 등을 통한 불법 '획득' 과정이며, 이는 앤스로픽이 2025년 15억 달러 합의로 이미 한 번 패배했던 취약점을 겨냥한 것입니다.
소니뮤직 퍼블리싱, 워너 채플 등 음악 퍼블리셔들이 AI 기업 앤스로픽과 창업자들을 상대로, 불법 토렌트·스크래핑으로 저작물을 대량 확보해 Claude를 학습시켰다고 주장하며 소송을 제기했다. 이번 소송은 Bartz 사건에서 저작물 사용 자체는 합법이지만 불법 복제 방식으로 취득한 것은 위법이라는 판결로 앤스로픽이 15억 달러 배상 판결을 받은 데 이은 후속 소송으로, AI 학습 데이터 확보 방식의 적법성을 둘러싼 법적 리스크가 커지고 있음을 보여준다.
DJ 음악 마켓플레이스 비트포트가 전체 또는 대부분 AI로 만들어진 음원의 판매를 금지했습니다. AI를 활용했지만 인간이 주도한 곡은 허용되되 AI 사용 표시가 붙으며, 파트너 Beatdapp의 탐지 도구로 업로드 단계에서 걸러냅니다. 사용자 조사에서 60%가 AI 음악을 세트에서 재생하지 않겠다고 답하는 등 수요 부족과 AI 업로드 급증이 이유로, 디저 등 다른 플랫폼도 유사 조치를 취하고 있습니다.
AI 학습 무단 사용에 반대하는 아티스트 플랫폼 '카라(Cara)'가 2023년부터 약 150만 명의 작가를 모았으나, 8월 한 달에만 세 차례 대규모 스크래핑을 당해 서버 비용 폭증과 작가들의 불안을 초래했습니다. 첫 스크래퍼는 1,200만 점의 작품을 12TB 아카이브로 공개했으나 이후 자신의 행동을 후회하고, 장징나(Zhang) 대표와 함께 작가를 보호하는 새 오픈소스 도구 개발에 협력하기로 했습니다. 장징나는 법적 대응을 위한 크라우드펀딩으로 이미 10만 달러 이상을 모았습니다.
미국 언론 404 미디어가 네바다주 라스베이거스의 아마존 VGT3 창고에서 수천 권의 책을 파괴적으로 스캔해 AI 학습 데이터로 사용한다는 사실을 폭로했습니다. 익명의 아마존 직원 인터뷰에 따르면, 창고에서는 책의 등을 절단하고 페이지를 스캔한 뒤 무작위로 섞어 폐기하며, 신간 서적부터 도서관 폐기 도서, 일본·독일·러시아어 책, 심지어 영국 의회 문서까지 다양한 자료가 반입되고 있었습니다.
섀도우 라이브러리 안나스 아카이브가 음악 산업(3억2천2백만 달러)과 대형 출판사(1,950만 달러)의 소송에서 합계 약 3억4천만 달러의 결석 판결과 도메인 인junction을 받았지만, 미국 법원 관할 밖 레지스트리를 사용하는 .GL, .PK, .GD 도메인으로 서비스를 지속하고 있습니다. 최근 다운타임은 법적 조치가 아닌 조율된 공격 때문이었으며, 이 사례는 미국 법원이 해외 도메인에 대한 관할권 한계에 부딪혀 사이트 차단 입법 요구가 커질 수 있음을 보여줍니다.
ChatGPT, Claude 등 AI 모델이 수억 권의 책과 문서를 저자 동의 없이 학습해 왔지만, 저작권법은 1976년 이후 개정되지 않아 법적 판단이 공정 이용(fair use) 여부를 놓고 법원마다 엇갈리고 있다. 작년 앤스로픽(Anthropic)에 15억 달러 배상을 명령한 판결도 실제로는 AI 학습 자체를 합법으로 인정하고 불법 다운로드만 처벌한 것으로, AI 기업에 유리한 선례로 해석된다.
AI 기업들이 중개업체를 통해 중고 서적을 대량 매입해 스캔한 뒤 훈련 데이터로 활용하고 물리적으로 파괴하는 것이 드러났으며, Anthropic의 '프로젝트 파나마'는 15억 달러 저작권 합의로 폭로되었습니다. 이 과정에서 인류의 지식이 사기업 서버에 영구적으로 독점되고 공공 영역에서 사라지는 심각한 문제가 발생하고 있습니다. 안나스 아카이브(Anna's Archive)는 전 세계 자원봉사자들이 이 문화유산이 사라지기 전에 책을 스캔·업로드할 것을 긴급히 촉구하고 있습니다.
여러 AI 기업들이 중개업체를 통해 중고 서적을 대량으로 매입한 뒤 스캔하고 파괴하는 것으로 드러났습니다. Anthropic의 '파나마 프로젝트'는 15억 달러 저작권 합의로 폭로되었으며, 이 과정에서 지식이 사기업 서버에 영구적으로 독점됩니다. 안나스 아카이브(Anna's Archive)는 이 문화유산이 사라지기 전에 전 세계 자원봉사자들이 책을 스캔·업로드할 것을 긴급히 촉구하고 있습니다.
404 Media의 조사에 따르면 아마존이 희귀 도서를 대량 구매해 제본을 잘라내 파괴적으로 스캔한 뒤 AI 학습 데이터로 활용하고 있습니다. 반면 비파괴 방식으로 책을 디지털화하는 인터넷 아카이브는 대기업들의 소송으로 존폐 위기에 처해 있어, 거대 기업과 공공 이익 단체에 대한 상반된 대우가 도마에 올랐습니다.
텍스트를 왜곡해 AI 스크래핑을 막으려는 '안티 AI 폰트'는 스크린 리더 등 접근성 도구 사용자를 배제하고, 이미 공개 논의 자체가 AI 기업의 우회 학습에 활용되고 있어 실효성이 없다는 비판이다. 저자는 이런 난독화 경쟁이 결국 검열과 유료화에 유리한 복사 보호 체계로 귀결될 수 있으며, 웹의 개방성 정신에 반한다고 지적한다.
미국 음악저작권 단체 The MLC에는 매칭되지 않아 아무도 찾아가지 않은 6억5천6백만 달러의 '블랙박스' 기계적 로열티가 쌓여 있습니다. 이 무료 도구는 Spotify 아티스트 링크만 입력하면 자신의 음원 중 등록·청구되지 않은 것이 무엇인지, 대략 얼마의 손실인지 확인해줍니다. 2027년 초부터 미수령 금액이 시장 점유율에 따라 기존 수령자들에게 분배되며 사실상 소멸하므로, 지금 확인하고 등록하는 것이 중요합니다.
이번 주 팟캐스트에서는 아마존이 AI 학습 데이터 확보를 위해 대량의 도서를 매입해 파괴하는 에마누엘의 주요 취재를 다룹니다. 또한 ChatGPT로 작성된 전문가 의견서, 법률 서류에 숨긴 프롬프트 인젝션 등 AI 오남용 사례와 메타의 AI 스마트글래스 특허 및 이를 이용한 괴롭힘 연구도 소개합니다.
아마존이 희귀 도서를 대량으로 구매해 책등을 잘라내 스캔한 뒤 AI 모델 학습 데이터로 활용하는 것으로 드러났습니다. 404 미디어가 추적 장치를 넣은 희귀 서적이 라스베이거스 아마존 시설에 도착하는 것을 확인했습니다. 인터넷에서 구할 수 없는 절판 도서는 2022년 이전 출간으로 AI 생성 텍스트가 섞이지 않아 모델 붕괴(model collapse)를 피할 수 있는 귀중한 학습 데이터로 주목받고 있습니다.
404 Media의 조사에 따르면 아마존은 서적을 대량으로 구매해 AI 학습 데이터로 스캔한 뒤 원본을 파기합니다. 희귀 도서 상자에 에어태그를 넣어 추적한 결과 라스베이거스 창고의 'VGT3' 팀이 책 등을 잘라 스캔하는 것이 확인됐습니다. 안스로픽(Anthropic)도 유사한 '프로젝트 파나마'를 운영해왔으며, 법원은 원본이 파기된 점을 이유로 저작권 침해가 아니라 판결했습니다.