LAION, 1천만 시간 분량 오픈소스 영상 데이터셋 공개
LAION이 CommonCrawl의 13억 개 URL에서 수집한 8천만 개 영상(총 1천만 시간)과 5,500만 개 클립, 3억 장 이미지를 포함한 대규모 오픈 영상 데이터셋 'Big Video Dataset(BVD)'를 연구 목적으로 공개했습니다. BVD로 학습한 모델은 InternVid 기반 모델보다 최대 2.1%p 우수한 성능을 보였으며, 2024년 함부르크 법원 판결을 근거로 비상업 연구용 저작권 콘텐츠 수집의 법적 근거를 확보한 점이 주목됩니다.
LAION이 AI 연구용 오픈 영상 데이터셋 중 가장 큰 규모 중 하나인 'Big Video Dataset(BVD)'를 공개했다. 이 데이터셋은 CommonCrawl에서 수집한 13억 개의 영상 URL에서 추출되었다. 팀은 이 중 8천만 개의 영상(총 1천만 시간 분량)을 다운로드했으며, 자동 생성된 영상·오디오 설명이 포함된 5,500만 개의 클립과 3억 장의 정지 이미지를 추출했다.
논문에 따르면, BVD로 학습된 모델은 일반적인 비디오-투-텍스트 벤치마크에서 InternVid로 학습된 유사 모델보다 최대 2.1%포인트 높은 성능을 보인다. 학습 과정에서는 영상, 오디오, 텍스트를 함께 연결하여 어떤 시각적 콘텐츠가 어떤 설명이나 소리와 매칭되는지 학습한다.
LAION은 이 데이터셋을 연구 목적으로만 공개하고 있다. 법적으로 LAION은 2024년 함부르크 지방법원의 판결을 근거로 들 수 있는데, 이 판결은 비상업적 연구를 위해 저작권 콘텐츠를 수집하는 것을 허용했다. LAION은 이용자들에게 원본 콘텐츠 제작자의 권리를 존중해 줄 것을 요청하고 있다. 데이터셋과 코드는 자유롭게 이용할 수 있다.