메뉴

#데이터 필터링

HN
Hacker News • 30일 전
IMP 7

비디오 모델을 더 빠르고 잘 학습시키는 법

이 글은 이미지·비디오 생성 모델의 성능 향상이 아키텍처 변화가 아닌 데이터 개선(필터링, 어노테이션, 합성 데이터 생성)에서 비롯된다고 분석합니다. 특히 2024년 CPU 기반 전통적인 컴퓨터비전 알고리즘(PySceneDetect 등)으로 수백억 개의 이미지·비디오를 저비용으로 필터링한 실무 경험을 소개합니다. 자체 생성 모델을 학습시키려는 실무자에게 실용적인 가이드가 될 수 있습니다.

비디오 생성 데이터 필터링 디퓨전 모델
MP
MarkTechPost • 103일 전
IMP 7

대규모 웹 데이터셋 FineWeb 실전 코드 튜토리얼

본 튜토리얼은 수 테라바이트(TB) 규모의 방대한 FineWeb 데이터셋을 전체 다운로드하지 않고도 스트리밍(Streaming) 방식으로 불러와 분석하는 실무적인 코딩 방법을 다룹니다. 데이터의 스키마와 메타데이터를 점검하고, 품질 필터링(Filtering) 및 중복 제거(Deduplication), 토큰화(Tokenization) 파이프라인 구축 과정을 단계별 코드로 구현해 봅니다. AI 모델 개발에 필수적인 대규모 학습 데이터 전처리 및 분석 기법을 심도 있게 이해할 수 있는 중요한 자료입니다.

FineWeb 데이터 전처리 스트리밍