DiffusionGemma 기술 보고서
Gemma 팀이 기존 자기회귀(AR) 모델을 디퓨전 방식으로 파인튜닝한 실험적 오픈 웨이트 언어 모델 'DiffusionGemma'를 공개했습니다. 이 모델은 256 토큰 블록을 병렬로 반복 정제하여 H100 GPU 한 장에서 초당 약 1,500 토큰을 생성하며, 최첨단 추측 디코딩을 적용한 AR 모델보다도 훨씬 빠릅니다. 원본 AR 모델 학습 토큰 예산의 10% 미만으로 학습되었으며, AR 생성 능력도 유지해 하이브리드 디퓨전-AR 디코딩의 가능성을 보여줍니다.