엔비디아 오픈소스 데이터로 코딩 AI 미세조정하기
이 글은 엔비디아의 Open-SWE-Traces 데이터셋을 활용하여 소프트웨어 개발 에이전트(Agent) 모델을 미세조정(SFT)하기 위한 고품질 학습 데이터를 구축하는 과정을 설명합니다. 허깅페이스 스트리밍을 통해 효율적으로 데이터를 처리하고, 도구 사용량과 패치 분석 등을 거쳐 성공적인 작업 기록만을 선별합니다. 이를 통해 실제 코드를 수정하고 도구를 다루는 능력이 뛰어난 코딩 AI 모델을 효과적으로 훈련시킬 수 있다는 점에서 실무적 가치가 높습니다.
[제목] 엔비디아 Open-SWE-Traces를 활용한 지도 미세조정 데이터 구축: 궤적 파싱, 패치 분석, 토큰 예산 및 도구 사용 메트릭
이 튜토리얼에서는 모델 미세조정(Supervised Fine-Tuning, SFT)을 위해 엔비디아의 Open-SWE-Traces 데이터셋을 활용하여 에이전트 소프트웨어 엔지니어링 궤적(Trajectory)을 분석합니다. 모든 데이터를 로컬 환경으로 다운로드하는 대신 허깅페이스(Hugging Face)에서 직접 데이터를 스트리밍하여 구글 코랩(Google Colab) 환경에서도 효율적으로 처리할 수 있도록 구성했습니다.
다중 턴(Multi-turn)으로 진행되는 에이전트 대화 내역을 정규화하고, 최종 코드 패치(Patch)를 파싱한 뒤 궤적 길이, 도구 사용량, 패치 크기, 프로그래밍 언어 분포 및 문제 해결 결과를 아우르는 분석용 데이터프레임(DataFrame)을 구축합니다. 이후 작업 성공 여부 라벨, 토큰 제한량, 프로그래밍 언어 필터 및 패치 존재 여부를 조건으로 활용하여 맞춤형 지도 미세조정 데이터 하위 집합을 큐레이션(Curation)하는 과정을 다룹니다.
“엔비디아 Open-SWE-Traces를 활용한 지도 미세조정 데이터 구축: 궤적 파싱, 패치 분석, 토큰 예산 및 도구 사용 메트릭”이라는 제목의 이 글은 마크테크포스트(MarkTechPost)를 통해 처음 게재되었습니다.