메뉴
BL
MarkTechPost 33일 전

딥리인포스스, 강화학습 기반 오픈소스 코딩 모델 'Ornith-1.0' 공개

IMP
8/10
핵심 요약

DeepReinforce가 Gemma 4와 Qwen 3.5를 기반으로 구축된 오픈소스 코딩 모델 패밀리인 Ornith-1.0을 발표했습니다. 이 모델은 고정된 프레임워크를 사용하는 대신 강화학습(RL) 과정에서 자체적인 스캐폴드(Scaffold)를 학습하는 것이 특징입니다. 397B 파라미터의 플래그십 모델은 SWE-Bench Verified에서 82.4점을 기록했으며, 모든 가중치가 MIT 라이선스로 공개되어 실무자들이 자유롭이 활용할 수 있다는 점에서 중요합니다.

번역된 본문

DeepReinforce는 Gemma 4와 Qwen 3.5를 기반으로 구축된 오픈소스 코딩 모델 패밀리인 Ornith-1.0을 발표했습니다. 고정된 테스트 하네스(harness)를 사용하는 대신, 이 모델은 강화학습(RL, Reinforcement Learning) 중에 자체적인 스캐폴드(scaffold)를 학습합니다. 397B(억 개) 규모의 플래그십 모델은 SWE-Bench Verified 벤치마크에서 82.4점을 기록했으며, 모든 모델 가중치는 MIT 라이선스 하에 제공됩니다. DeepReinforce의 Ornith-1.0 발표 관련 글은 MarkTechPost를 통해 가장 먼저 공개되었습니다.

원문 보기
원문 보기 (영어)
DeepReinforce released Ornith-1.0, an open-source coding model family built on Gemma 4 and Qwen 3.5. Instead of a fixed harness, the model learns its own scaffold during reinforcement learning. The 397B flagship reports 82.4 on SWE-Bench Verified, with all weights under the MIT license. The post DeepReinforce Releases Ornith-1.0: An Open-Source Coding Model Family That Learns Its Own RL Scaffolds appeared first on MarkTechPost.