MP
MarkTechPost • 20일 전
IMP 6
퍼플렉시티, GPU 임베딩 스택 공개
퍼플렉시티 엔지니어링 팀이 자체 임베딩 모델 pplx-embed를 GPU 위에서 저비용으로 서빙하는 인프라를 상세히 공개했습니다. AI 검색 제품의 검색 품질은 임베딩 모델의 성능과 이를 인덱스 전체에 저렴하게 실행할 수 있는지에 달려 있다는 설명입니다.
퍼플렉시티 임베딩 GPU 서빙
퍼플렉시티 엔지니어링 팀이 자체 임베딩 모델 pplx-embed를 GPU 위에서 저비용으로 서빙하는 인프라를 상세히 공개했습니다. AI 검색 제품의 검색 품질은 임베딩 모델의 성능과 이를 인덱스 전체에 저렴하게 실행할 수 있는지에 달려 있다는 설명입니다.
FreeToken은 MoE(Mixture-of-Experts) 모델의 캐시 미스 발생 시, 실측 대역폭을 기반으로 PCIe를 통한 가중치 적재와 CPU 실행을 분배하는 엣지 네이티브 서빙 엔진입니다. 이를 통해 753B 파라미터급 GLM-5.2 같은 초대형 모델을 단일 워크스테이션 GPU에서 로컬로 실행할 수 있게 됩니다. 고성능 하드웨어 없이도 최첨단 모델을 온프레미스 환경에서 활용하려는 실무자에게 중요한 기술입니다.