마이크로소프트 임원, AI 스크래핑을 '인류 역사상 최대 노동 절도'로 규정
뉴욕타임스가 오픈AI와 마이크로소프트를 상대로 제기한 저작권 소송의 새로운 공개 자료에서, 마이크로소프트 최고 경영진이 AI 학습용 데이터 수집을 '절도'로 내부적으로 인정한 사실이 드러났습니다. 내부 문서는 AI 챗봇이 뉴스 매체에 '실존적 위협'이며 유료 콘텐츠를 무단으로 긁어갔고 저작권 표시를 의도적으로 제거했음을 시사합니다. 이는 오픈AI의 공정 이용(fair use) 방어 논리를 정면으로 반박하는 증거로, AI 저작권 소송의 향방에 큰 영향을 줄 수 있습니다.
3년 전 뉴욕타임스가 오픈AI와 마이크로소프트를 상대로 제기한 저작권 소송의 새로운 수정 공개 자료에 따르면, AI 데이터 수집(스크래핑)이 절도에 해당한다는 인정과 AI 제품이 언론 매체에重大한 위협이 된다는 사실이 드러났습니다. 소송 자료에 따르면 마이크로소프트의 최고위 임원은 사내에서 이 회사들의 AI 학습 방식을 '절도'라고 표현했으며, 오픈AI 경영진 역시 자사 AI 모델이 학습 데이터를 제공한 언론인과 출판사에 '실존적 위협'이 된다고 말했습니다. 공개된 자료에는 또한 이 회사들이 유료 회원제 결제벽(paywall)을 몰래 우회해 콘텐츠를 확보하고, 대량 스크래핑으로 학습 데이터셋을 구축했으며, 학습 데이터에서 저작권 고지를 의도적으로 제거한 방식이 상세히 담겨 있습니다. 다만 새로운 정보의 상당 부분은 여전히 봉인된 원본 증거 자료가 아닌 뉴욕타임스 측의 소송 요약서에서 나온 것이며, 아래 인용문들은 원래 맥락 없이 제시된 것이라는 점에 유의해야 합니다.
이번 수정 공개는 3년째 이어지고 있는 소송의 최신 국면으로, 뉴욕타임스는 처음에 이 회사들이 자사 콘텐츠로 생성형 AI 모델을 학습시키며 저작권법을 위반했다고 주장했습니다. AI 기업이 저작권 자료를 AI 학습에 합법적으로 사용할 수 있는지에 대한 명확한 답은 없지만, 법원들은 대체로 학습이 '공정 이용(fair use)'에 해당한다는 AI 기업 측 주장에 우호적인 모습을 보여왔습니다. 공정 이용은 패러디, 뉴스 보도, 비평 등 특정 경우에 허가 없이 저작물을 사용할 수 있게 하는 법 원칙입니다. 이달 초 트럼프 행정부는 오픈AI의 무허가 저작물 사용을 옹호하는 의견서를 소송에 제출하기도 했습니다.
하지만 새로 드러난 여러 인정 사항은 특히 원저작물의 시장을 대체하거나 해쳐서는 안 된다는 공정 이용 요건 측면에서 오픈AI의 방어 논리와 배치됩니다. 예를 들어 마이크로소프트 자체 데이터에 따르면, Copilot '답변 엔진'은 전통적인 빙(Bing) 검색 대비 뉴욕타임스 도메인의 클릭률을 최대 93%까지 떨어뜨린 것으로 나타났습니다. 마이크로소프트 응용과학 책임자 브렌트 헥트(Brent Hecht)가 2024년 1월에 작성한 내부 발표자료는 이러한 하락을 '우리 모델과 웹 전체의 성능을 동시에 해칠' '파멸의 고리(doom loop)'라고 묘사했습니다. 소송 자료에 인용된 마이크로소프트 문서는 “최종 제품이 필수 공급자의 경제적 기반을 위협하는 것은 매우 이례적인 일이지만, 이것이 바로 우리가 LLM 사업의 '콘텐츠 공급망'과 관련하여 만들어낸 상황이다”라고 적고 있습니다.
사티아 나델라(Satya Nadella) 마이크로소프트 CEO도 올해 초 증언에서 “유료 결제벽 뒤에 있는 모든 콘텐츠는 이를 사용하려는 누구든—근거 제공(grounding)이든 학습이든—라이선스를 받아야 한다”고 밝혔으며, '오픈AI가 결제벽 뒤의 정보를 긁어가 학습에 사용했음을 알았다면' '오픈AI에 모델을 재학습하도록 요구했을 것'이라고 말했습니다.
다른 인정 사항들은 공정 이용 판단 기준의 다른 축과 배치됩니다. ChatGPT 총괄인 닉 털리(Nick Turley)는 내부 커뮤니케이션에서 출판사들이 챗봇 같은 제품으로부터 '실존적 위협'에 직면해 있으며, 이러한 제품은 '대체로 대체적(substitutive)'이고 '더 좋아질수록 점점 더 대체적이 될 것'이라고 썼습니다. 그레그 브록만(Greg Brockman) 오픈AI 사장은 이 모델들을 '뉴스에 탁월하다'고 표현했습니다. 나델라 역시 올해 선서 하에 챗봇과의 대화가 “원 출처를 방문할 필요 없이 AI 플랫폼에서 바로 정보를 제공하는 방식으로 대체했다”는 점을 인정했습니다. 이런 표현들은 이 기술이 원저작물을 변혁하기보다 직접 경쟁할 수 있음을 보여줍니다. 마이크로소프트 문서는 생성형 AI가 '기반 모델을 학습시킨 데이터를 만든 바로 그 사람들의 고용을 크게 위협할' '실질적 위험'이 있다고 명시합니다.
복제의 규모 또한 충격적입니다. 문서에는 오픈AI의 중간 학습(mid-training) 데이터셋에만 뉴욕타임스가 출판한 저작물의 복사본이 91,692건 이상 포함되어 있다는 사실이 처음으로 드러났습니다.