vLLM v0.28.0 릴리스
오픈소스 LLM 추론 서빙 엔진 vLLM의 v0.28.0이 공개되었습니다. 이번 버전은 270명의 기여자가 참여한 584개 커밋을 포함하며, Kimi-K3 성능 최적화, DeepSeek V4 스파스 MLA 지원, 추론 디코딩 개선, Model Runner V2 성숙화, 계층형 KV 캐시 오프로딩 등이 핵심입니다. 일부 호환성 깨는 변경(breaking changes)도 포함되어 업그레이드 시 주의가 필요합니다.
vLLM v0.28.0이 8월 26일 공개되었습니다. 이번 릴리스에는 270명의 기여자(신규 76명)의 584개 커밋이 반영되었습니다.
주요 내용:
Kimi-K3 성능 강화: 전 스택에 걸친 대규모 최적화 작업이 이루어졌습니다. 디코드 컨텍스트 병렬(DCP) 지원(#50484), 융합형 FlashKDA 디코드 및 프리필 커널(#50684, #51311, #52458), MegaMoE를 위한 SiTU 활성화 지원(#50510), 시퀀스 병렬을 위한 GEMM-RS(#52079), 결합된 올-게더로 커널 수준 1.5~3배 속도 향상(#51070), 적응형 스페큘러티브 토큰 예산으로 DSpark TTFT 약 60% 개선(#51725), 공유 전문가 셰딩 옵션으로 GPU당 약 17GiB 메모리 절약(#50912)이 포함됩니다. 또한 Kimi-K3가 V2 모델 러너로 ROCm에서도 실행됩니다(#51653).
DeepSeek V4: 스파스 MLA(sparse MLA)가 일반 디코드, MTP, DSpark 스페큘러티브 디코딩 전반에서 엔드투엔드로 작동합니다(#51538). 추가로 AMD Quark NVFP4 지원(#47972), reasoning-effort 프롬프트 및 매핑(#50580), 스파스 top-k 메타데이터 커널 최적화(#52084, #51967), 이거 CUDA 그래프 영역 축소(#51430, #52401), gfx11 및 gfx950에서 ROCm 활성화(#47017, #52212)가 포함됩니다.
스페큘러티브 디코딩 발전: 로컬 컨볼루션과 후보 셀렉터를 갖춘 DFlash2(#52816), DSpark 신뢰도 기반 검증 스케줄링(#47808), 드래프트 모델에 자동 활성화되는 비동기 스케줄링(#48341).
Model Runner V2 성숙화: E/P/D 분리 배포(disaggregation)(#38390), 가중치 오프로딩(#51413), 다층 MTP KV 캐시 지원(#50062), 인코더 CUDA 그래프(#49852), 디코더 토큰 단위 풀링(#50931) 및 Transformers 풀링 모델(#52425), 어텐션 없는(attention-free) 모델(#52374), thinking_token_budget 지원(#46727).
계층형 KV 캐시 오프로딩: 디스크 오프로딩 지원(#49644), module_path를 통한 외부(out-of-tree) 보조 계층 매니저(#51007), 부분적 보조 계층 로드 결과(#50321), 계층화 메트릭(#48798), 병렬화에 구애받지 않는 오프로드를 위한 표준 CPU 레이아웃(#48414).
Rust 프론트엔드 & gRPC: 독립형 렌더러(#50289), gRPC를 통한 멀티모달 이미지 추론(#50368), 명시적 데이터 병렬 랭크 라우팅(#51178), RL 라이프사이클 제어(#51316), protobuf 스키마를 Buf에 공개(#51276).
새로운 기본값: max_num_batched_tokens가 8192에서 16384로 상향(#51726), Mamba 모델에 프리픽스 캐싱 기본 활성화(#50991), Blackwell CUDA 그래프 캡처 기본값 1024로 상향(#49390).
호환성 깨는 변경사항(Breaking Changes): bitsandbytes 지원이 외부(out-of-tree) 플러그인으로 이전됨(#43529); Transformers가 5.15.0으로 상향(#51668); 지원 중단된 calculate_kv_scales 런타임 KV 스케일 계산 제거(#49389); override_attention_dtype 제거(#48684).
릴리스 아티팩트:
- PyPI(CUDA 13.0): pip install vllm
- PyPI(CUDA 13.0, uv): uv pip install vllm --torch-backend=auto
- ROCm: pip install vllm --extra-index-url https://wheels.vllm.ai/rocm/0.28.0/rocm722
Docker 이미지:
- CUDA 13.0(기본): docker pull vllm/vllm-openai:v0.28.0 (v0.28.0-cu130도 사용 가능)
- CUDA 12.9: docker pull vllm/vllm-openai:v0.28.0-cu129
- CUDA 13.0 + Ubuntu 24.04: docker pull vllm/vllm-openai:v0.28.0-ubuntu2404
- CUDA 12.9 + Ubuntu 24.04: docker pull vllm/vllm-openai:v0.28.0-cu129-ubuntu2404
- ROCm: docker pull vllm/vllm-openai-rocm:v0.28.0
- CPU: docker pull vllm/vllm-openai-cpu:v0.28.0
- XPU: docker pull vllm/vllm-openai-xpu:v0.28.0
기타 아티팩트는 페이지 하단의 Assets 섹션에서 사전 빌드된 형태로 제공됩니다.