메뉴
BL
MarkTechPost 36일 전

프라임 인텔렉트, 1조 매개변수 MoE 모델 훈련용 RL 프레임워크 공개

IMP
8/10
핵심 요약

프라임 인텔렉트(Prime Intellect)가 에이전트 기반 강화학습 작업을 통해 1조 개 매개변수 규모의 MoE(Mixture-of-Experts) 모델을 비동기식으로 훈련할 수 있는 오픈소스 프레임워크 'prime-rl 0.6.0'을 발표했습니다. 이 프레임워크는 소프트웨어 엔지니어링(SWE) 작업을 수행하는 GLM-5 모델을 훈련하며 5분 미만의 짧은 스텝 시간을 기록하여, 대규모 모델 훈련의 효율성을 크게 높였다는 점에서 AI 실무자들에게 매우 중요합니다.

번역된 본문

프라임 인텔렉트(Prime Intellect)가 1조 개 매개변수(Trillion-Parameter) 규모의 전문가 혼합(Mixture-of-Experts, MoE) 모델을 위한 비동기식 강화학습(RL) 오픈 프레임워크인 'prime-rl 0.6.0'을 발표했습니다. 이 시스템은 소프트웨어 엔지니어링(SWE) 작업을 수행하는 GLM-5 모델을 훈련하는 데 활용되었으며, 최대 131k의 시퀀스 길이와 256회의 롤아웃(Rollouts)을 28개의 H200 노드 클러스터에서 처리했습니다. 이 과정에서 스텝(Step)당 소요 시간을 5분 미만으로 단축하는 성과를 달성했습니다.

이 글에서는 이러한 기록적인 성과를 가능하게 한 핵심 추론 및 훈련 최적화 기술을 상세히 분석합니다. 주요 최적화 기법으로는 FP8 정밀도 추론(FP8 inference), 광역 전문가 병렬화(Wide Expert Parallelism), 프리필과 디코드의 분리(Prefill/Decode disaggregation), 라우터 재생(Router Replay), 그리고 3차원 병렬 처리(3-D parallelism: FSDP, EP, CP) 등이 적용되었습니다.

“프라임 인텔렉트, 1조 매개변수 MoE 모델 훈련을 위한 에이전트 강화학습 워크로드용 prime-rl 0.6.0 공개”라는 제목의 이 글은 마크테크포스트(MarkTechPost)를 통해 가장 먼저 게재되었습니다.

원문 보기
원문 보기 (영어)
Prime Intellect has released prime-rl 0.6.0, an open framework for asynchronous reinforcement learning on trillion-parameter Mixture-of-Experts models. It trained GLM-5 on SWE tasks at up to 131k sequence length, with sub-5-minute step times and 256 rollouts, on 28 H200 nodes. This breakdown covers the inference and training optimizations behind those numbers — FP8 inference, Wide Expert Parallelism, prefill/decode disaggregation, router replay, and 3-D parallelism (FSDP, EP, CP). The post Prime Intellect Releases prime-rl 0.6.0 to Train Trillion-Parameter MoE Models on Agentic RL Workloads appeared first on MarkTechPost.