MP
MarkTechPost • 49일 전
IMP 6
NVIDIA 코드 데이터셋 파이프라인 구축 실습
이번 튜토리얼에서는 대규모 코드 사전학습 연구를 위해 NVIDIA의 'Nemotron-Pretraining-Code-v3' 데이터셋 메타데이터를 활용하는 파이프라인을 구축합니다. 데이터를 직접 다운로드하지 않고 스트리밍(Streaming) 방식으로 불러와 언어별 분포와 저장소 구조를 분석하며, 실제 깃허브 소스 코드를 가져와 토큰(Token) 규모를 추정하는 전체 과정을 다룹니다.
데이터셋 nvidia 코드-사전학습