DFlash, 엔비디아 블랙웰서 최대 15배 처리량 향상
UC 샌디에이고(UC San Diego)가 개발한 DFlash는 기존 자기회귀(Autoregressive) 방식을 대체하는 가벼운 블록 디퓨전 모델(Block Diffusion Model)을 활용하여 토큰 블록을 병렬로 빠르게 생성(초안 작성)합니다. 이를 통해 정보 손실 없이 처리 속도를 대폭 높이며, 엔비디아 블랙웰(NVIDIA Blackwell) 환경에서는 최대 15배의 처리량(Throughput) 향상을 기록했습니다. vLLM, SGLang 등 주요 추론 프레임워크를 지원하여 AI 모델 실 서비스 배포 시 비용과 지연 시간을 줄이는 데 매우 유용한 기술입니다.
UC 샌디에이고(UC San Diego)의 DFlash는 추측 해독(Speculative Decoding)을 위해 기존의 자기회귀(Autoregressive) 방식의 초안 작성 과정을 가벼운 블록 디퓨전 모델(Block Diffusion Model)로 대체했습니다. 이 기술은 단 한 번의 순전파(Forward Pass) 과정에서 전체 토큰 블록을 병렬로 생성하며, KV 주입(KV Injection) 방식을 통해 타겟의 숨겨진 특징(Hidden Features)을 조건부로 활용합니다.
연구 논문에 따르면 Qwen3-8B 모델에서 정보 손실(Lossless) 없이 최대 6.08배의 속도 향상을 기록했으며, 엔비디아(NVIDIA)는 고정된 상호작용(Interactivity) 환경의 블랙웰(Blackwell) 아키텍처에서 최대 15배의 처리량(Throughput) 향상을 보고했습니다. DFlash는 20개의 체크포인트(Checkpoints)를 제공하며, SGLang, vLLM, 그리고 TensorRT-LLM을 지원합니다.
이 글 'DFlash의 추측 해독 기술, 병렬 전체 토큰 블록 생성으로 엔비디아 블랙웰에서 최대 15배 높은 처리량 달성'은 MarkTechPost에 처음 게재되었습니다.