세레브라스, 오픈AI GPT-5.6 Sol 초고속 모드 공개
세레브라스(Cerebras)와 오픈AI(OpenAI)가 초당 최대 750 토큰을 처리하는 '울트라패스트 모드(Ultrafast Mode)'를 선보였습니다. 이를 통해 GPT-5.6 Sol 모델의 품질을 유지하면서도 경쟁 모델 대비 최대 11배 빠른 추론 속도를 자랑하며, 시간이 생명인 금융, 보안, 코딩 등 실무 환경에서 AI 작업의 효율을 극대화할 수 있게 되었습니다.
세레브라스(Cerebras)와 오픈AI(OpenAI)가 초당 최대 750 토큰을 처리하는 '울트라패스트 모드(Ultrafast Mode)'를 선보였습니다. 이를 통해 GPT-5.6 Sol 모델의 품질을 유지하면서도 경쟁 모델 대비 최대 11배 빠른 추론 속도를 자랑하며, 시간이 생명인 금융, 보안, 코딩 등 실무 환경에서 AI 작업의 효율을 극대화할 수 있게 되었습니다.
DeepSeek(딥시크)가 기존 DeepSeek-V4 모델의 텍스트 생성 속도를 사용자당 최대 85%까지 획기적으로 끌어올리는 추론 가속화 프레임워크 'DSpark'를 오픈소스로 공개했습니다. 이 기술은 가벼운 초안 생성 모듈을 결합하여 실시간 GPU 부하에 맞춰 검증할 토큰 수를 조절하는 방식으로, 모델의 성능 저하 없이(무손실) 서비스 처리량을 크게 개선할 수 있다는 점에서 AI 실무자들에게 매우 중요합니다.
싱가포르 국립대(NUS) 연구팀이 기존 디퓨전 언어 모델(dLLM)의 한계를 극복하고 병렬 처리 속도를 획기적으로 높인 'DMax' 모델을 공개했습니다. 이 모델은 디코딩 과정을 점진적 자기 정제(self-refinement) 과정으로 재정의하여, 초기 예측의 오류가 누적되는 현상을 방지하고 스스로 오류를 수정할 수 있도록 설계되었습니다. 그 결과 수학 및 코딩 벤치마크에서 기존 모델 대비 2~3배 높은 처리 속도를 기록하면서도 원본 모델의 정확도를 유지하는 성과를 입증했습니다.
z-lab 연구팀이 텍스트 생성 속도를 극적으로 높이는 새로운 접근법인 'DFlash'를 공개했습니다. 이 기술은 블록 디퓨전(Block Diffusion)을 활용해 기존의 한계를 벗어난 스펙큘레이터 디코딩(Speculative Decoding)을 구현하여 대형 언어 모델의 실제 추론 처리량을 크게 향상시킵니다. 프로젝트 페이지, 깃허브(GitHub) 오픈소스 코드, 허깅페이스(Hugging Face) 모델 데이터셋이 함께 공개되어 실무자들이 즉시 테스트하고 적용해볼 수 있습니다.