메뉴

#추론가속화

MP
MarkTechPost • 58일 전
IMP 8

텐센트, 추론 속도 2.4배 향상 AngelSpec 오픈소스 공개

텐센트가 다양한 언어 모델 아키텍처에서 추론 디코딩 속도를 극대화하는 통합 프레임워크 'AngelSpec'를 오픈소스로 공개했습니다. 이 프레임워크는 블록 확산 드래프터인 DFly와 검증 예산을 실시간으로 조절하는 D-cut 기술을 도입하여, HY3-295B 모델 환경에서 최대 2.4배의 처리 속도 향상을 달성했습니다. AI 모델의 실제 서비스 적용 시 가장 큰 병목인 추론 속도와 비용 문제를 해결할 수 있는 핵심 기술로 평가받습니다.

텐센트 추론가속화 오픈소스