메뉴

#추론 디코딩

HN
Hacker News • 19일 전
IMP 7

AMD GPU에서 vLLM 추론 디코딩 활용하기

AMD Instinct MI300X/MI355X GPU와 ROCm 플랫폼에서 vLLM의 추론 디코딩(Speculative Decoding) 성능을 실험한 글입니다. 초안-검증(draft-and-verify) 방식으로 원본 모델의 출력을 유지하면서 한 번의 검증으로 여러 토큰을 커밋해 처리량을 높일 수 있으며, 그 효과는 초안 생성 방식(MTP, EAGLE-3, DFlash, DSpark 등), 제안 길이, 모델 계열, 워크로드에 따라 달라졌습니다. LLM 서빙 최적화에 실용적인 참고 자료입니다.

추론 디코딩 vLLM AMD GPU