메타, 뮤즈 스파크 1.3 출시…경쟁사 가격 앞질러
메타가 5개월 만에 네 번째 모델인 뮤즈 스파크 1.3을 공개했습니다. 에이전트 task에서 큰 향상을 보였지만 Claude Fable 5.1 같은 최상위 모델과는 여전히 격차가 있습니다. 반면 작업당 0.55달러로 동급 성능 모델 중 가장 저렴해 가격 경쟁력이 핵심입니다.
메타가 뮤즈 스파크 1.3으로 정상에 근접, 가격에서는 경쟁사 앞서
핵심 요점 메타가 뮤즈 스파크 1.3을 출시했다. xhigh 등급은 현재 이용 가능하며, 더 강력한 max 버전은 일단 제한된 프리뷰로 운영된다. 이 모델은 에이전트(agentic) 과제에서 가장 큰 향상을 보였지만, 대부분의 벤치마크에서 여전히 Claude Fable 5.1 같은 최고 성능 모델에 뒤처진다. 작업당 0.55달러로, 현재 동급 성능 클래스에서 가장 저렴한 모델이다. 메타는 오픈 웨이트(open-weights) 버전도 출시 예정이라고 밝혔다.
메타가 5개월 만에 네 번째 모델인 뮤즈 스파크 1.3을 출시했다. 독립 테스트 결과 에이전트 과제에서 확실한 향상을 보였지만 최상위권과의 격차는 여전하다. 이 모델의 강점은 가격이다.
메타는 뮤즈 코드(Muse Code)와 메타 모델 API를 통해 뮤즈 스파크 1.3을 공개했다. 이 시리즈는 4월에 출시됐으며, 7월에 1.1, 8월에 1.2 버전이 뒤따랐다. Artificial Analysis에 따르면 xhigh 등급은 현재 이용 가능하지만, 더 많은 컴퓨팅을 사용하는 max 등급은 추가 안전 테스트 이후에 출시되며 현재는 제한된 파트너 프리뷰로 운영된다.
입력/출력 백만 토큰당 각각 1.25달러와 4.25달러로 가격이 변동 없이 유지되어, 인덱스 과제 하나에 0.55달러가 든다. 59점 이상을 받은 모델 중 더 저렴한 것은 없으며, 같은 인덱스 수준의 경쟁 모델은 0.94달러에서 1.23달러 사이이다. 단, 0.40달러였던 1.2 버전보다는 비싸졌다.
향상은 인덱스에서 가중치가 높은 영역에 집중됐다
인텔리전스 인덱스(Intelligence Index)에서 max는 62점, xhigh는 61점으로, 8월의 57점과 7월의 53점에서 상승했다. 이 도약은 인덱스의 테스트 가중치 방식에서 비롯된다. GDPval-AA v2가 20%, Terminal-Bench 2.1이 16%, τ³-Bench Banking이 14%를 차지하는데, 메타의 가장 큰 향상이 정확히 이 세 가지 테스트에서 나타났다.
시뮬레이션된 은행 시나리오에서 에이전트가 도구를 다루는 τ³-Banking에서 max는 52%를 기록했다. Artificial Analysis에 따르면 현재 1위이며, 이 모델이 보유한 유일한 단독 선두다. 현재 이용 가능한 xhigh 등급은 47%로 Claude Fable 5.1(max) 및 GLM-5.3-Flash와 동률이다. 이전 버전 1.2는 35%였다.
터미널에서 코딩 능력을 테스트하는 Terminal-Bench 2.1에서는 xhigh가 80%에서 85%로, max는 86%로 상승했지만, Claude Fable 5.1은 여전히 max 등급 91.4%, xhigh 91.0%, high 89.9%로 정상을 지키고 있다.
인덱스에서 가장 높은 가중치를 가진 GDPval-AA v2에서 메타는 220개 실제 전문 과제에서 인간 전문가 성능을 1,000으로 보정한 척도 기준 1,615에서 1,709(xhigh)와 1,754(max)로 향상됐다. Claude Fable 5.1(max)은 1,853이다. 메타는 max 변형의 우위를 컴퓨팅으로 확보했는데, xhigh보다 62% 더 많은 추론 토큰을 소모한다.
에이전트 테스트 외에는 중위권 유지
전문가 수준 과학 질문을 다루는 GPQA Diamond에서 뮤즈 스파크는 90%에서 94%로 상승했다. 최상위 그룹에 속하지만 95.3%의 Gemini 3.8 Flash(high)와 94.9%의 Grok 4.6(high)에는 못 미친다.
연구 물리학을 다루는 CritPt는 18%에서 26%로 도약했지만, 32.3%의 GPT-5.6 Sol(max)과 31.1%의 Claude Fable 5.1(xhigh)에는 크게 뒤처진다.
두 지표는 1.2 대비 오히려 하락했다. AA-LCR은 83%에서 79%로 떨어졌다. AA-Omniscience의 사실 정확도는 최대 3점 하락했는데, 모델이 확신이 없을 때 답변을 거절하는 빈도가 늘었기 때문이다.
메타와 Artificial Analysis 모두 아직 max 변형의 가격을 발표하지 않았다. 더 큰 모델과 오픈 웨이트 버전 출시도 예정되어 있다.