소형 모델의 시대가 왔다
gpt-5.6-luna 같은 소형 고속 모델이 놀라운 능력과 저렴한 비용(~$0.10)을 제공하면서 소비자용 AI 앱의 경제성이 finally 성립하게 되었다는 분석입니다. 저자는 '천재형' 업무보다 기업 업무의 약 95%를 차지하는 '빠르고 반응성 좋은 토큰 뿜어내기'형 업무에 소형 모델 수요가 폭발할 것으로 전망합니다.
소형 모델의 시대가 왔다 (2026년 8월 26일) 최근 몇 주간 저는 gpt-5.6-luna를 가지고 실험해왔습니다. 놀라울 정도로 유능하고, 빠르고, 똑똑합니다. 약 100 tps(초당 토큰) 속도를 정기적으로 목격하며, 제 코드베이스와 이메일, 지식 베이스를 빠르게 훑고 다닙니다. 물론 루나의 가장 큰 특징은 비용입니다. 꽤 복잡한 리서치 작업을 실행해봐도 큰 청구 금액이 나오기가 어려울 정도입니다. 수천 통의 이메일을 검색하게 해도 API 비용이 수십 센트 수준에 그칩니다. (artificialanalysis.ai 제공) GLM 5.3의 등장으로 파레토 프론티어(최적 균형선)에 새로운 선택지까지 생겼습니다. 코딩 작업을 할 때 저는 거의 항상 가장 비싸고 강력한 모델(Fable 5, 5.6 Sol)을 찾곤 했습니다. 그래서 작고 빠른 모델들이 이룬 진보를 놓치기 쉬웠습니다. 제가 대화한 몇몇 투자자들이 이런 말을 했습니다: "소비자용 AI 회사가 더 많이 나오지 않는 게 이상하다. 왜 그럴까?" 여기엔 간단한 답이 있습니다: 토큰 비용입니다. AI 이전 시대의 대형 소비자 앱 플레이북은 대략 이렇습니다... 운영 비용이 비교적 저렴한 매력적인 웹사이트 만들기 사용자 대량 유치 (보통 바이럴을 통해) 자금 조달 후 더 많은 사용자로 확장 광고 마켓플레이스 구축 이것이 대부분의 대형 소비자 기업(Google, Facebook, Snapchat 등)을 설명합니다. 그런데 제품에 AI를 추가하려면 어떻게 될까요? 이제 모든 요청마다 실제 추론 비용이 발생합니다! 갑자기 필요한 자본 규모가 극적으로 커집니다. 제가 애용하는 평가 테스트 중 하나는 저에게 맞춤화된 일일 뉴스 사이트를 만드는 것입니다: 인터넷에서 @calvinfo를 리서치하고 그 사람이 좋아할 만한 뉴스를 파악 오늘의 주요 뉴스를 개인화한 마이크로 사이트 제작 hn, reddit, twitter 등 검색 이전 세대 모델(Sonnet급)이라면 결과를 얻는 데 약 $1이 들었습니다. 소비자 앱에 월 $30을 청구하는 건 지속 불가능합니다. 물론 최적화 여지는 많지만, WSJ나 이코노미스트가 받는 요금을 청구하려면 그에 걸맞은 가치를 제공해야 합니다. 그런데 루나를 보면 결과가 꽤 괜찮은 데다 평균 비용이 약 $0.10입니다. 이제 얘기가 다릅니다! 제 생각에 이것이 더 흥미로워지는 지점은 비즈니스 세계입니다. 세그먼트(Segment) 공동 창업자인 피터와 최근 하이킹을 하며 이야기를 나눴습니다. 피터는 자신의 여러 스타트업에서 두 종류의 업무를 발견했습니다: 'IQ 180' 업무. 천재 과학자 같은 사람이 상상도 못한 미친 해결책을 내놓는 것. '토큰 분사기(token spewer)' 업무. 초고 반응성으로 수십 개 전선에서 일을 밀어붙이는 것. 피터는 여러 회사를 운영합니다. Segment 외에도 Charm Industrial을 위해 1억 달러 이상을 조달했고, 최근에는 Revoy의 시리즈 A를 마쳤습니다. 시간 관리가 엄청나게 체계적이고 효율적인 사람입니다. 그럼에도 피터는 자기 업무의 약 95%가 두 번째 유형에 속한다고 말했습니다. 전화를 걸고, 사람들을 재촉하고, 잡일을 처리하는 것이죠. 분명히 말하자면, 피터는 깊은 문제를 해결하는 IQ 180급 기술 두뇌가 없었다면 자기 회사들은 이미 물 건너갔을 것이라고 합니다. 다만 대부분의 업무가 두 번째 유형에 속한다는 것입니다. '프론티어급' 모델에 대한 수요는 계속 복리로 증가할 것이라고 봅니다. 특히 새로운 돌파구나 발견이 필요한 분야(엔지니어링, 하드 과학, 모델 훈련)에서요. 하지만 '빠르고/저렴하고/충분히 좋은' 모델에 대한 수요도 이제 막 폭발하려 한다고 생각합니다. 매일 상호작용하는 사람들을 생각해보세요: 동료, 벤더, 고객. 십중팔구 우리가 원하는 건 초고 반응성으로 일을 그냥 처리해주는 사람입니다. 오늘날 기업의 대부분의 '인간 토큰'이 이런 방식으로 소비되고 있습니다. 채용도 빠르고/저렴하고/충분히 좋은 유형에 크게 치우쳐 있죠. 빠르고/저렴하고/충분히 좋은 모델을 비즈니스 현실로 만들려면 해야 할 일이 많습니다. 새로운 하니스(실행 환경), 프롬프트 인젝션 방어, 역할 및 권한 체계 등입니다. 하지만 우리가 해결해낼 것이라 확신합니다. 여러분도 실험 중이라면...