메뉴
BL
MarkTechPost 32일 전

엔비디아 오픈소스 데이터로 코딩 AI 미세조정하기

IMP
7/10
핵심 요약

이 글은 엔비디아의 Open-SWE-Traces 데이터셋을 활용하여 소프트웨어 개발 에이전트(Agent) 모델을 미세조정(SFT)하기 위한 고품질 학습 데이터를 구축하는 과정을 설명합니다. 허깅페이스 스트리밍을 통해 효율적으로 데이터를 처리하고, 도구 사용량과 패치 분석 등을 거쳐 성공적인 작업 기록만을 선별합니다. 이를 통해 실제 코드를 수정하고 도구를 다루는 능력이 뛰어난 코딩 AI 모델을 효과적으로 훈련시킬 수 있다는 점에서 실무적 가치가 높습니다.

번역된 본문

[제목] 엔비디아 Open-SWE-Traces를 활용한 지도 미세조정 데이터 구축: 궤적 파싱, 패치 분석, 토큰 예산 및 도구 사용 메트릭

이 튜토리얼에서는 모델 미세조정(Supervised Fine-Tuning, SFT)을 위해 엔비디아의 Open-SWE-Traces 데이터셋을 활용하여 에이전트 소프트웨어 엔지니어링 궤적(Trajectory)을 분석합니다. 모든 데이터를 로컬 환경으로 다운로드하는 대신 허깅페이스(Hugging Face)에서 직접 데이터를 스트리밍하여 구글 코랩(Google Colab) 환경에서도 효율적으로 처리할 수 있도록 구성했습니다.

다중 턴(Multi-turn)으로 진행되는 에이전트 대화 내역을 정규화하고, 최종 코드 패치(Patch)를 파싱한 뒤 궤적 길이, 도구 사용량, 패치 크기, 프로그래밍 언어 분포 및 문제 해결 결과를 아우르는 분석용 데이터프레임(DataFrame)을 구축합니다. 이후 작업 성공 여부 라벨, 토큰 제한량, 프로그래밍 언어 필터 및 패치 존재 여부를 조건으로 활용하여 맞춤형 지도 미세조정 데이터 하위 집합을 큐레이션(Curation)하는 과정을 다룹니다.

“엔비디아 Open-SWE-Traces를 활용한 지도 미세조정 데이터 구축: 궤적 파싱, 패치 분석, 토큰 예산 및 도구 사용 메트릭”이라는 제목의 이 글은 마크테크포스트(MarkTechPost)를 통해 처음 게재되었습니다.

원문 보기
원문 보기 (영어)
In this tutorial, we work with NVIDIA's Open-SWE-Traces dataset to study agentic software-engineering trajectories for fine-tuning. We stream the data directly from Hugging Face, so we can process it efficiently in Google Colab without downloading everything locally. We normalize multi-turn agent conversations, parse final code patches, and build an analysis DataFrame covering trajectory length, tool usage, patch size, language distribution, and resolution outcomes. We then curate a supervised fine-tuning subset using success labels, token limits, language filters, and patch availability. The post Building Supervised Fine-Tuning Data from NVIDIA Open-SWE-Traces: Trajectory Parsing, Patch Analysis, Token Budgets, and Tool-Use Metrics appeared first on MarkTechPost.