텐센트, 추론 속도 2.4배 향상 AngelSpec 오픈소스 공개
텐센트가 다양한 언어 모델 아키텍처에서 추론 디코딩 속도를 극대화하는 통합 프레임워크 'AngelSpec'를 오픈소스로 공개했습니다. 이 프레임워크는 블록 확산 드래프터인 DFly와 검증 예산을 실시간으로 조절하는 D-cut 기술을 도입하여, HY3-295B 모델 환경에서 최대 2.4배의 처리 속도 향상을 달성했습니다. AI 모델의 실제 서비스 적용 시 가장 큰 병목인 추론 속도와 비용 문제를 해결할 수 있는 핵심 기술로 평가받습니다.
텐센트(Tencent)는 6가지 아키텍처에 걸쳐 투기적 디코딩(Speculative Decoding) 드래프트 모델을 학습하기 위한 토치 네이티브(Torch-native) 오픈소스 프레임워크인 'AngelSpec'을 출시했습니다. 이 프레임워크는 하이브리드 타겟 컨디셔닝(target conditioning)과 숨겨진 보정(hidden-correction) 자기회귀 헤드를 갖춘 블록 확산 드래프터(block-diffusion drafter)인 DFly를 도입하고, 런타임에 적응형 검증 예산 책정(runtime-adaptive verification budgeting)을 위한 D-cut을 통합했습니다. 텐서 병렬화(TP=8)가 적용된 HY3-295B-A21B 모델 기준으로, DFly-8은 동시성 4에서 64 범위에 걸쳐 기존 자기회귀 디코딩(autoregressive decoding) 대비 1.98배에서 2.40배의 속도 향상을 제공합니다. 이 게시물 '텐센트, HY3 모델을 위한 MTP 및 블록 병렬 투기적 디코딩 통합 학습 프레임워크 AngelSpec 오픈소스화'는 MarkTechPost에 처음 게재되었습니다.