오픈라우터 토큰 급증 차트, AI 버블 논쟁을 한 장의 그림으로 보여주다
개발자들이 AI 모델을 제품에 연결하는 플랫폼 오픈라우터(OpenRouter)의 주간 토큰 소비량이 2025년 1월 이후 25,000% 이상 급증해 0.5조에서 126.2조 토큰에 도달했습니다. 그러나 이는 실제 사용량이나 비즈니스 가치의 증가라기보다, 추론 모델의 '생각' 토큰과 비효율적인 에이전틱 AI 시스템이 토큰 통계를 부풀린 결과라는 분석입니다.
개발자들이 AI 모델을 제품에 연결하는 플랫폼 오픈라우터(OpenRouter)의 주간 토큰 소비량이 2025년 1월 이후 25,000% 이상 급증해 0.5조에서 126.2조 토큰에 도달했습니다. 그러나 이는 실제 사용량이나 비즈니스 가치의 증가라기보다, 추론 모델의 '생각' 토큰과 비효율적인 에이전틱 AI 시스템이 토큰 통계를 부풀린 결과라는 분석입니다.
OpenAI의 플래그십 모델 GPT-6 Astra가 OpenRouter 플랫폼을 통해 공개되었습니다. 고급 분석, 소프트웨어 엔지니어링, 심층 연구, 과학 작업, 문서 작성에 적합하며, 컴퓨터·브라우저를 활용한 장기 에이전트 작업에 특히 강점을 보입니다. 입력 1M 토큰당 10달러, 출력 50달러의 가격으로 제공되며 최대 100만 토큰의 컨텍스트를 지원합니다.
정체가 베일에 싸인 AI 모델 'Ox Alpha'가 OpenRouter에 무료 공개되며 인터넷에서 개발자 추측 열기가 뜨겁다. 이 모델은 코딩, 지속적인 에이전트 작업, 프로덕션 워크로드용 추론 모델로 소개됐으며, Stripe CEO도 '매우 인상적'이라 평가했다. 현재 중국 Z.ai의 GLM 모델이라는 설과 마이크로소프트의 미공개 MAI 버전이라는 설 등이 난무하고 있다.
OpenRouter 분석에 따르면 2025년 2월 6일이 인간이 AI보다 더 많은 토큰을 소비한 마지막 날이었을 수 있습니다. 이후 AI 에이전트의 토큰 사용량은 14배 증가한 반면 인간 사용량은 2.8배 증가에 그쳤습니다. 다만 약 70%가 저렴한 캐시 프롬프트에서 나오므로 실제 비용 증가는 수치만큼 크지 않습니다.
OpenRouter에 정체를 밝히지 않은 제3자 제공사가 개발한 추론형 모델 'Ox Alpha'가 공개되었습니다. 코딩, 장기 소프트웨어 엔지니어링, 에이전트 작업 및 텍스트와 시각 컨텍스트를 결합한 워크플로우에 적합하며, 100만 토큰 컨텍스트를 지원하고 무료로 제공됩니다. 프롬프트와 응답은 제공사가 보관하되 학습에는 사용하지 않는다는 점이 특징입니다.
기업 경비 관리 플랫폼 램프(Ramp)가 OpenRouter와 유사한 AI 모델 라우팅 서비스 'Router'를 미국 한정으로 출시했습니다. OpenAI, Anthropic, 딥시크 등 다양한 대규모 언어 모델을 하나의 API로 사용하고 전환할 수 있으며, 2026년 말까지 무료로 제공됩니다. 램프는 급성장하는 AI 추론 시장에 진입함과 동시에 기존 토큰 사용량 관리 제품과의 시너지를 노리고 있습니다.
결제 기업 스트라이프가 투자자 서한에서 "우리는 이미 특이점에 진입했다"고 선언하며, 이를 상장(IPO) 연기의 이유로 제시했다. 회사는 비상장 상태로 남아 인수와 투자를 주주 희석 없이 유연하게 수행하는 것이 유리하다고 주장했으며, 80억 달러 이상에 OpenRouter를 인수한다고 공식 확인했다. 특이점 선언이 상장 회피의 편리한 구실이라는 회의적 시각도 있다.
OpenAI의 플래그십 모델 GPT-5.6 Sol의 API 가격이 50% 인하되어 백만 토큰당 입력 $2.50, 출력 $15가 되었습니다. 복잡한 추론, 코딩, 에이전트 워크플로에 특히 강하며 100만 토큰 컨텍스트를 지원합니다. OpenRouter 기준 가장 빠른 제공자에서 초당 43토큰의 처리량을 보이며 최근 3일간 99.83%의 가용성을 기록했습니다.
웹 개발 플랫폼인 Netlify가 OpenRouter와의 협업을 통해 다양한 최신 AI 모델을 지원함에 따라, 동일한 프롬프트로 11개 모델을 테스트한 결과를 공유합니다. 이는 개발자들이 각 AI 모델의 성능과 크레딧 소모량을 비교하여, 자신의 예산과 목적에 맞는 최적의 모델을 선택하는 데 매우 유용한 실무적 참고 자료가 됩니다.
한 개발자가 11개의 주요 대형 언어 모델(LLM)을 2D 배틀로얄 게임에 투입해 30판의 대결을 시켜보았습니다. 그 결과, 승리와 효율성에서는 엑스AI의 Grok이 압도했으나, 협력과 소통에서는 Anthropic의 Claude가 뛰어난 성능을 보였습니다. 이 실험은 기존의 정적인 AI 벤치마크가 실제 에이전트의 행동과 성향을 예측하는 데 한계가 있음을 보여줍니다.
대중에게 생소한 중국 텐센트의 오픈소스 모델 'Hy3 preview'가 최근 OpenRouter 모델 사용량 랭킹에서 최고의 인기를 누리던 Claude와 DeepSeek를 큰 폭으로 제치며 부상했습니다. 성능 벤치마크나 사용자 평가는 상위 모델들에 미치지 못하는 수준이지만, 입력 토큰당 약 $0.066라는 극도로 저렴한 가격 책정 덕분에 비용에 민감한 유료 사용자들을 대량으로 끌어들이며 유기적인 사용량 1위를 기록하고 있습니다. 이 현상은 최근 AI 코딩 에이전트 등의 비용이 급증함에 따라, 최고 수준의 성능보다 '가성비'를 선택하는 시장의 실용적인 트렌드를 보여준다는 점에서 중요합니다.