프라임 인텔렉트, 1조 매개변수 MoE 모델 훈련용 RL 프레임워크 공개
프라임 인텔렉트(Prime Intellect)가 에이전트 기반 강화학습 작업을 통해 1조 개 매개변수 규모의 MoE(Mixture-of-Experts) 모델을 비동기식으로 훈련할 수 있는 오픈소스 프레임워크 'prime-rl 0.6.0'을 발표했습니다. 이 프레임워크는 소프트웨어 엔지니어링(SWE) 작업을 수행하는 GLM-5 모델을 훈련하며 5분 미만의 짧은 스텝 시간을 기록하여, 대규모 모델 훈련의 효율성을 크게 높였다는 점에서 AI 실무자들에게 매우 중요합니다.
프라임 인텔렉트(Prime Intellect)가 1조 개 매개변수(Trillion-Parameter) 규모의 전문가 혼합(Mixture-of-Experts, MoE) 모델을 위한 비동기식 강화학습(RL) 오픈 프레임워크인 'prime-rl 0.6.0'을 발표했습니다. 이 시스템은 소프트웨어 엔지니어링(SWE) 작업을 수행하는 GLM-5 모델을 훈련하는 데 활용되었으며, 최대 131k의 시퀀스 길이와 256회의 롤아웃(Rollouts)을 28개의 H200 노드 클러스터에서 처리했습니다. 이 과정에서 스텝(Step)당 소요 시간을 5분 미만으로 단축하는 성과를 달성했습니다.
이 글에서는 이러한 기록적인 성과를 가능하게 한 핵심 추론 및 훈련 최적화 기술을 상세히 분석합니다. 주요 최적화 기법으로는 FP8 정밀도 추론(FP8 inference), 광역 전문가 병렬화(Wide Expert Parallelism), 프리필과 디코드의 분리(Prefill/Decode disaggregation), 라우터 재생(Router Replay), 그리고 3차원 병렬 처리(3-D parallelism: FSDP, EP, CP) 등이 적용되었습니다.
“프라임 인텔렉트, 1조 매개변수 MoE 모델 훈련을 위한 에이전트 강화학습 워크로드용 prime-rl 0.6.0 공개”라는 제목의 이 글은 마크테크포스트(MarkTechPost)를 통해 가장 먼저 게재되었습니다.