KV 캐시 압축 기술 경쟁: TurboQuant vs OSCAR vs EpiCache
최근 긴 문맥(Long Context)을 처리하는 AI 모델에서 모델 가중치보다 KV 캐시가 차지하는 메모리 비중이 훨씬 커지는 병목 현상이 발생하고 있습니다. 본 글은 이러한 메모리 문제를 해결하기 위해 등장한 TurboQuant, OSCAR, EpiCache 세 가지 기술의 접근 방식을 분석하며, 이들이 서로 경쟁하기보다는 각자 다른 측면을 보완해 주는 관계라고 설명합니다.