메뉴

#엔비디아 블랙웰

MP
MarkTechPost • 52일 전
IMP 7

커서, GB300 최적화 결정론적 MoE 훈련 커널 오픈소스화

AI 코딩 스타트업 커서(Cursor)가 자사 모델 훈련에 사용된 'Mixture-of-Kittens(MoK)'를 오픈소스로 공개했습니다. 이 기술은 전문가 혼합(MoE) 통신과 연산을 단일 결정론적 커널로 통합하여 기존 대비 최대 2.37배 높은 처리 속도를 자랑합니다. 단, 엔비디아의 최신 GB300 NVL72 랙 환경이 필요하여 일반 개발자가 접근하기는 어렵다는 특징이 있습니다.

커서 오픈소스 MoE
MP
MarkTechPost • 94일 전
IMP 8

DFlash, 엔비디아 블랙웰서 최대 15배 처리량 향상

UC 샌디에이고(UC San Diego)가 개발한 DFlash는 기존 자기회귀(Autoregressive) 방식을 대체하는 가벼운 블록 디퓨전 모델(Block Diffusion Model)을 활용하여 토큰 블록을 병렬로 빠르게 생성(초안 작성)합니다. 이를 통해 정보 손실 없이 처리 속도를 대폭 높이며, 엔비디아 블랙웰(NVIDIA Blackwell) 환경에서는 최대 15배의 처리량(Throughput) 향상을 기록했습니다. vLLM, SGLang 등 주요 추론 프레임워크를 지원하여 AI 모델 실 서비스 배포 시 비용과 지연 시간을 줄이는 데 매우 유용한 기술입니다.

추측 해독 엔비디아 블랙웰 vLLM