메뉴

#추론 가속화

MP
MarkTechPost 31일 전
IMP 8

딥시크, DSpark 공개... 딥시크-V4 생성 속도 최대 85% 향상

DeepSeek(딥시크)가 기존 DeepSeek-V4 모델의 텍스트 생성 속도를 사용자당 최대 85%까지 획기적으로 끌어올리는 추론 가속화 프레임워크 'DSpark'를 오픈소스로 공개했습니다. 이 기술은 가벼운 초안 생성 모듈을 결합하여 실시간 GPU 부하에 맞춰 검증할 토큰 수를 조절하는 방식으로, 모델의 성능 저하 없이(무손실) 서비스 처리량을 크게 개선할 수 있다는 점에서 AI 실무자들에게 매우 중요합니다.

추론 가속화 DeepSeek 오픈소스
LL
r/LocalLLaMA 109일 전
IMP 8

싱가포르 국립대, 병렬 디코딩 가속화하는 'DMax' 발표

싱가포르 국립대(NUS) 연구팀이 기존 디퓨전 언어 모델(dLLM)의 한계를 극복하고 병렬 처리 속도를 획기적으로 높인 'DMax' 모델을 공개했습니다. 이 모델은 디코딩 과정을 점진적 자기 정제(self-refinement) 과정으로 재정의하여, 초기 예측의 오류가 누적되는 현상을 방지하고 스스로 오류를 수정할 수 있도록 설계되었습니다. 그 결과 수학 및 코딩 벤치마크에서 기존 모델 대비 2~3배 높은 처리 속도를 기록하면서도 원본 모델의 정확도를 유지하는 성과를 입증했습니다.

디퓨전 언어 모델 병렬 디코딩 추론 가속화
LL
r/LocalLLaMA 113일 전
IMP 8

초고속 스펙큘레이터 디코딩을 위한 블록 디퓨전 기술

z-lab 연구팀이 텍스트 생성 속도를 극적으로 높이는 새로운 접근법인 'DFlash'를 공개했습니다. 이 기술은 블록 디퓨전(Block Diffusion)을 활용해 기존의 한계를 벗어난 스펙큘레이터 디코딩(Speculative Decoding)을 구현하여 대형 언어 모델의 실제 추론 처리량을 크게 향상시킵니다. 프로젝트 페이지, 깃허브(GitHub) 오픈소스 코드, 허깅페이스(Hugging Face) 모델 데이터셋이 함께 공개되어 실무자들이 즉시 테스트하고 적용해볼 수 있습니다.

스펙큘레이터 디코딩 디퓨전 모델 추론 가속화