마이크로소프트 AI, 프론티어 모델 대신 소형 전문 모델로 승부한다
마이크로소프트 AI는 만능 프론티어 모델보다 토큰 효율이 높은 저비용의 소형 전문 모델을 전략적으로 채택하고 있습니다. 복잡한 작업은 OpenAI 모델에 라우팅하고 단순 작업은 저비용 전문 모델이 처리하는 오케스트레이션(Orchestration) 시스템을 통해 막대한 GPU 비용을 절감할 수 있습니다. 이는 AI 산업의 핵심 경쟁력이 단일 모델의 성능에서 작업 라우팅과 문맥 공급을 담당하는 시스템으로 이동하고 있음을 시사합니다.
마이크로소프트 AI는 최고 성능을 좇는 대신, 범용 프론티어 모델보다 소형 전문 모델을 선호하며 토큰 효율성을 핵심 경쟁력으로 삼고 있습니다. 마이크로소프트 AI CEO 무스타파 술레이만(Mustafa Suleyman)은 업계가 최고의 성능과 비용 사이에서 균형을 잡아야 한다고 밝혔습니다. 즉, 하나의 만능 모델을 사용하는 대신, 회사는 단일 분야에 특화된 소형 모델들을 훈련시키고 있습니다.
술레이만에 따르면, 최신 사이버 보안 모델인 MAI-Cyber-1-Flash는 Anthropic의 Mythos 모델보다 12%p 높은 성능으로 CyberGym 벤치마크 1위를 차지했으며, 비용은 절반에 불과합니다. 하지만 이러한 결과를 위해서는 여러 모델을 조율하고 어려운 작업은 여전히 OpenAI의 추론(reasoning) 모델로 라우팅하는 'MDASH' 시스템이 필요합니다. 또한 마이크로소프트는 MAI-Image-2.5-Flash가 GPT-Image-2와 비교해 GPU 비용을 최대 84%까지 절감한다고 덧붙였습니다.
술레이만은 또한 특정 모델 패밀리에 대한 의존도를 낮출 수 있도록 모델을 자유롭게 교체할 수 있는(swappable) 환경을 원합니다. 다만, OpenAI를 부분적으로 대체하게 될 소형 MAI 모델들이 과연 OpenAI의 성능을 따라잡을 수 있을지는 여전히 의문으로 남습니다.
결과적으로 AI 경쟁의 무게 중심은 개별 모델에서 작업을 라우팅하고 문맥(context)을 제공하는 소프트웨어인 '하네스(Harnesses)'로 이동하고 있습니다. 오케스트레이터(Orchestrator)는 대부분의 작업을 더 저렴한 전문 모델들로 보내고, 프론티어 모델은 어려운 케이스에만 예약해 두는 방식입니다. Anthropic은 Claude Fable 5에 이러한 접근 방식을 적용했으며, Sakana 역시 이를 바탕으로 Fugu를 구축한 바 있습니다.