메뉴
BL
MarkTechPost • 34일 전

FreeToken: 워크스테이션 GPU 하나로 753B GLM-5.2를 돌리는 엣지 네이티브 MoE 서빙 엔진

IMP
6/10
핵심 요약

FreeToken은 MoE(Mixture-of-Experts) 모델의 캐시 미스 발생 시, 실측 대역폭을 기반으로 PCIe를 통한 가중치 적재와 CPU 실행을 분배하는 엣지 네이티브 서빙 엔진입니다. 이를 통해 753B 파라미터급 GLM-5.2 같은 초대형 모델을 단일 워크스테이션 GPU에서 로컬로 실행할 수 있게 됩니다. 고성능 하드웨어 없이도 최첨단 모델을 온프레미스 환경에서 활용하려는 실무자에게 중요한 기술입니다.

번역된 본문

FreeToken은 MoE(Mixture-of-Experts) 캐시 미스를 실측 대역폭을 기준으로 PCIe 채우기(fill)와 CPU 실행 간에 분배함으로써, 최첨단 프론티어 모델을 로컬 환경에서 실행할 수 있게 해줍니다.

'Meet FreeToken: 단일 워크스테이션 GPU에서 753B GLM-5.2를 실행하는 엣지 네이티브 MoE 서빙 엔진'이라는 제목의 이 글은 MarkTechPost에 처음 게재되었습니다.

원문 보기
원문 보기 (영어)
FreeToken splits MoE cache misses between PCIe fills and CPU execution using measured bandwidths, unlocking frontier models locally The post Meet FreeToken: An Edge-Native MoE Serving Engine that Runs 753B GLM-5.2 on a Single Workstation GPU appeared first on MarkTechPost.