GPT-6 솔·루나, 가격 절반 낮추고 성능은 소폭 향상
OpenAI가 GPT-6 Sol과 Luna를 출시하며 이전 모델 대비 토큰 가격을 50% 인하했습니다. 성능은 전작과 비슷하지만 저렴한 가격으로 Anthropic의 고가 모델들과 가격 대비 성능 경쟁을 노립니다. 개발자들은 캐싱 할인 강화와 함께 복잡한 반복 작업용 Sol, 대량 단순 작업용 Luna를 저비용으로 활용할 수 있습니다.
GPT-6 Sol과 Luna로 OpenAI는 전작과 동일한 성능을 절반의 토큰 가격에 제공하며 Anthropic의 더 비싼 모델들과 경쟁하는 두 개의 저렴한 모델을 라인업에 추가했습니다.
가장 큰 변화는 GPT-5.6 Sol 및 Luna 대비 50% 가격 인하입니다. GPT-6 Sol은 이제 백만 입력 토큰당 2달러, 백만 출력 토큰당 10달러이며, Luna는 입력 0.10달러, 출력 0.50달러입니다. OpenAI는 캐싱과 추론 기술의 개선으로 가격을 낮출 수 있었으며 그 절감 효과를 사용자에게 그대로 전달한다고 밝혔습니다. 이 가격대는 저렴한 오픈 웨이트 모델과 비슷한 수준입니다. 이전에 라인업에서 가장 저렴했던 Terra는 더 이상 제공되지 않습니다.
모델 | 입력 | 출력 GPT-6 Sol (vs GPT-5.6 Sol) | $4 → $2 | $20 → $10 GPT-6 Luna (vs GPT-5.6 Luna) | $0.20 → $0.10 | $1.20 → $0.50
OpenAI에 따르면 Sol은 새 기능 구현, 코드 리뷰, 디버깅, 데이터 분석 같은 반복적인 복잡한 작업용으로 설계되었습니다. Luna는 문서 요약, 정보 추출, 간단한 질의응답처럼 대량의 명확히 정의된 작업을 저비용으로 처리하도록 만들어졌습니다.
토큰 가격 인하와 함께 OpenAI는 GPT-6의 프롬프트 캐싱을 개선해 캐시된 입력 토큰에 90% 할인을 제공합니다. 새로운 프롬프트 캐싱 대시보드와 진단 도구가 개발자의 캐시 사용 최적화를 돕고, 개발자는 캐시를 무효화하지 않고도 추론 강도와 도구 가용성을 변경할 수 있게 되었습니다.
출시 시점에 두 모델은 Plus, Pro, Business, Enterprise, Edu 구독자를 위해 ChatGPT Work와 Codex에서 이용할 수 있습니다. 무료 및 Go 사용자는 데스크톱 앱을 통해 Luna에 접근할 수 있지만, 일반 채팅에서는 처음에 두 모델 모두 제공되지 않습니다. API에서는 gpt-6-sol과 gpt-6-luna라는 이름으로 제공되며, ChatGPT에서의 접근은 점진적으로 확대되고 있습니다.
GPT-6 Sol과 Luna의 벤치마크 우위는 비용에서 나옵니다
OpenAI는 새 모델을 Anthropic의 Claude 라인업과의 가격 대비 성능 측면에서 주로 포지셔닝하고 있습니다. 컴퓨터 사용 능력을 테스트하는 OSWorld 2.0에서 OpenAI는 GPT-6가 약 80% 낮은 비용으로 Claude Opus 5와 비슷한 결과를 낸다고 밝혔으나, 이 분야에서는 여전히 Astra가 선두입니다.
47개 도구에서 비즈니스 워크플로를 테스트하는 AutomationBench에서는 최고 강도의 GPT-6 Sol이 최대 강도의 Claude Opus 5를 능가한다고 합니다. OpenAI에 따르면 Sol의 작업당 비용은 Opus의 9%에 불과합니다. 한편 Luna는 전작보다 5.4%포인트 향상되면서 비용은 58% 절감됐습니다.
코딩 분야에서 OpenAI는 두 벤치마크 결과를 제시했습니다. FrontierCode 1.1은 AI 에이전트가 실제 기존 코드베이스에 통합 가능한 코드를 작성하는지 테스트하며, 테스트 품질, 코드 스타일, 요구사항 준수 여부를 검사합니다. GPT-6 Sol은 최대 강도에서 49.3%를 기록하며 작업당 2.14달러의 비용이 들었고, 이는 최대 강도에서 50.3%를 기록하지만 작업당 12.83달러로 6배 비싼 Claude Fable 5.1과 대등한 수준입니다. Claude Opus 5는 이 테스트에서 가장 좋은 결과를 낸 중간 강도 설정에서 4.31달러로 53.4%를 기록했습니다.
OpenAI의 추론 강도 단계가 과도해지고 있습니다
실제 코드베이스에서 장기간 진행되는 까다로운 소프트웨어 엔지니어링 작업을 테스트하는 벤치마크 DeepSWE v1.1에서 OpenAI는 최대 강도의 GPT-6 Sol이 68.8%를 기록했다고 보고했습니다. 이는 'xhigh'에서 Claude Fable 5의 최고 점수인 69.9%와 1.1%포인트 차이이며, 'max'의 Fable은 작업당 21.63달러로 69.7%를 기록합니다.
물론 Sol은 이 분야에서 최전선을 노리는 것이 아닙니다. Claude Opus 5는 최대 강도에서 작업당 11.84달러로 73.7%를, OpenAI 자체의 GPT-5.6 Sol은 6.46달러로 72.7%를 기록합니다. GPT-6 Sol의 요점은 그 수준에 근접한 성능을 몇 분의 일의 가격으로 달성하는 것입니다. 'xhigh' 강도에서는 작업당 1달러로 66.6%를 기록합니다. Luna는 더 저렴합니다.