알리바바, '궁극의 비용 효율' 노린 Qwen3.8-Flash-Next 공개
알리바바 Qwen 팀이 총 1,250억 파라미터 중 토큰당 60억만 활성화하는 멀티모달 MoE 모델 Qwen3.8-Flash-Next를 공개했습니다. 이 모델은 Qwen4의 아키텍처 프리뷰 성격으로, 학습 비용의 약 9분의 1로 기존 Qwen3.7-Plus를 능가하는 성능을 보이며 코딩·업무 작업에서 특히 강세를 보입니다. 입력 토큰 100만 개당 0.16달러의 공격적 가격 책정으로 OpenAI와 Anthropic에 대한 가격 압박을 더욱 높이고 있습니다.
알리바바, '궁극의 비용 효율' 겨냥한 Qwen3.8-Flash-Next 공개
알리바바의 Qwen 팀이 Qwen3.8-Flash-Next를 선보였다. 이는 Qwen4의 아키텍처 프리뷰 역할을 하는 멀티모달 mixture-of-experts(MoE) 모델로, 훨씬 적은 학습 비용으로 훨씬 큰 모델에 필적하는 성능을 목표로 한다.
이 모델은 총 1,250억 파라미터를 갖지만 토큰당 60억 개만 활성화한다. 또한 새로운 N-gram 임베딩 레이어에 510억 파라미터를 포함하고 있는데, 이는 Qwen4에 적용될 예정인 아키텍처 혁신 중 하나다. 이 레이어는 흔한 단어 그룹을 일종의 '구문 사전'처럼 독립 항목으로 저장하며, GPU가 아닌 일반 시스템 RAM에 상주할 수 있어 '상대적으로 낮은 추가 비용'으로 운용 가능하다.
모델은 기본적으로 262,144 토큰 컨텍스트 윈도우를 지원하며, YaRN을 사용해 100만 토큰까지 확장할 수 있다. 기술 보고서는 GitHub에, 가중치는 Hugging Face와 ModelScope에서 제공된다. 프로덕션 버전은 Qwen3.8-Flash라는 이름으로 QwenCloud를 통해 제공되며, 입력 토큰 100만 개당 0.16달러, 출력 토큰 100만 개당 0.47달러로 책정됐다. Qwen에 따르면 API는 곧 오픈될 예정이다.
학습 비용 9분의 1, 더 나은 성능
Qwen 팀에 따르면 Qwen3.8-Flash-Next는 약 9분의 1의 학습 비용으로 Qwen3.7-Plus보다 더 나은 결과를 내며, 코딩과 사무 작업에서 가장 큰 향상을 보였다. Qwen3.7-Plus는 총 3,970억 파라미터에 토큰당 170억 개가 활성화되어, Flash-Next 활성화 파라미터의 거의 3배다.
알리바바가 공개한 벤치마크에서는 DeepSeek-V4-Flash(총 2,840억 파라미터, 130억 활성화) 및 Anthropic의 Claude Opus 4.6 (Max)와 비교했다. 두 모델 모두 훨씬 크거나 비싸지만, Flash-Next는 테스트된 대부분의 작업에서 앞선다.
이 모델은 AI가 실제 소프트웨어 프로젝트에서 독립적으로 버그를 찾아 수정해야 하는 에이전틱 코딩 벤치마크에 최적화된 것으로 보인다. Flash-Next는 DeepSWE에서 58.7점, SWE-bench Pro에서 62.5점을 기록하며 DeepSeek-V4-Flash와 Claude Opus 4.6을 모두 이겼다.
사무·생산성 작업에서는 격차가 더욱 크다. Flash-Next는 CoWorkBench에서 73.9점을 기록한 반면 DeepSeek-V4-Flash는 45.1점에 그쳤다. 전문 워크플로 테스트인 JobBench에서는 Flash-Next가 55.7점으로 Qwen3.7-Plus의 27.6점의 거의 두 배를 기록했다. 과학 추론(GPQA Diamond: 91.7)과 경쟁 프로그래밍(LiveCodeBench v6: 91.9)에서는 모델 간 격차가 크지 않다.
주요 벤치마크 결과:
- DeepSWE 1.1: Flash-Next 58.7 / Qwen3.8-27B 42.2 / Qwen3.7-Plus 16.5 / DeepSeek-V4-Flash 54.4
- SWE-bench Pro: 62.5 / 61.7 / 55.8 / 56.0 / Claude Opus 4.6 53.4
- SWE-bench Multilingual: 81.0 / 73.8 / 75.8 / Claude Opus 4.6 77.5
- CoWorkBench: 73.9 / 70.7 / 65.1 / 45.1 / 68.2
- JobBench: 55.7 / 33.4 / 27.6 / 41.3 / 36.6
- GPQA Diamond: 91.7 / 89.2 / 90.3 / 90.8 / 91.3
- LiveCodeBench v6: 91.9 / 90.3 / 89.6 / 90.6 / 88.8
Claude Opus 4.6은 극도로 어려운 다학제 문제로 구성된 Humanity's Last Exam에서만 앞서는데, 이 모델 역시 2026년 2월 출시된 '이전 세대' Anthropic 모델이다. 늘 그렇듯이, 벤치마크 점수와 실제 성능은 다를 수 있다.
경쟁사에 계속되는 가격 압박
알리바바는 8월 초 Qwen3.8-Max를 현재의 플래그십 모델로 선보이며 Claude Opus 4.8, Gemini 3.1 Pro, GPT5.6 Sol과 경쟁하고 있다. Flash-Next는 플래그십보다 성능이 약간 낮지만 비용은 약 12분의 1에 불과하며, 입력·출력 토큰 모두 약 12배의 가격 차이가 난다.
가격 비교:
- Qwen3.8-Max: 입력 100만 토큰당 2.00달러 / 출력 100만 토큰당 6.00달러
- Qwen3.8-Flash-Next: 입력 100만 토큰당 0.16달러 / 출력 100만 토큰당 0.47달러
이러한 가격 정책은 OpenAI와 Anthropic에 대한 압박을 계속 높이고 있다. Qwen3.8-27B 역시 최근 인기를 끌고 있는데, 로컬에서 실행 가능하며 사실상 무료에 가까운 비용으로 강력한 성능을 제공하기 때문이다.