퀄컴, AI 특화 스냅드래곤 8 엘리트 6세대 칩 2종 공개
퀄컴이 연례 스냅드래곤 서밋에서 AI 기능 강화에 초점을 맞춘 '스냅드래곤 8 엘리트 6세대'와 '8 엘리트 익스트림 6세대' 두 플래그십 프로세서를 발표했습니다. 익스트림 모델은 300억 파라미터 MoE 모델을 기기에서 온전히 구동할 수 있으며, 새로운 센싱 허브를 통해 개인 비서·음성 에이전트 등 온디바이스 AI 경험을 크게 확장한다는 점에서 주목됩니다.
퀄컴이 연례 스냅드래곤 서밋에서 AI 기능 강화에 초점을 맞춘 '스냅드래곤 8 엘리트 6세대'와 '8 엘리트 익스트림 6세대' 두 플래그십 프로세서를 발표했습니다. 익스트림 모델은 300억 파라미터 MoE 모델을 기기에서 온전히 구동할 수 있으며, 새로운 센싱 허브를 통해 개인 비서·음성 에이전트 등 온디바이스 AI 경험을 크게 확장한다는 점에서 주목됩니다.
중국 AI 기업 스텝펀(StepFun)이 총 600B 파라미터, 토큰당 활성 27B의 희소 MoE(Mixture-of-Experts) 모델 'Step 5 프리뷰'를 공개했습니다. 100만 토큰 컨텍스트 창과 텍스트·이미지·영상 입력을 지원하며, 소프트웨어 엔지니어링과 금융 등 장기 에이전트 작업에 초점을 맞춘 점이 특징입니다. API는 입력 100만 토큰당 1달러, 출력 100만 토큰당 2.70달러에 제공되며, 2026년 10월 15일 오픈 웨이트 공개가 예정되어 있습니다.
Jina AI가 PDF, 스캔본, 표, 차트, 인보이스를 Markdown으로 변환하는 시각 문서 파서 jina-ocr-v1을 공개했습니다. 총 3.4B 파라미터의 MoE 구조로 토큰당 약 570M만 활성화되고, 내장 FastMTP 스페큘러티브 디코딩으로 손실 없이 추론 속도를 높여 저사양 GPU에서도 효율적으로 동작합니다. 가중치는 CC BY-NC 4.0 라이선스로 Hugging Face에 공개되었습니다.
이 논문은 실제 배포 환경에서 사용자가 제공하는 정보나 교정 내용을 프롬프트가 아닌 모델 가중치에 직접 학습시키는 '무한 매개변수 LLM(Infinite-Parameter LLM)' 아키텍처를 제안합니다. 작은 하이퍼네트워크(hypernetwork)가 런타임 데이터를 저순위(low-rank) 가중치 변조로 변환하고, 생성기의 잠재 코드에 대한 베이지안 신념을 온라인으로 갱신해 세션 동안 가중치를 지속적으로 재도출합니다. 이를 통해 저장 공간은 고정된 채 사실상 무한한 가중치를 활용할 수 있으며, 컨텍스트 창을 절약하고 세션 간 지속되며, 컨텍스트 내 학습보다 더 나은 일반화가 가능함을 평가 프로토콜로 검증합니다.
Cohere가 218B 파라미터의 전문가 혼합(Mixture-of-Experts) 기반 오픈 웨이트 번역 모델 'North Small Translate'를 공개했습니다. 이 모델은 토큰당 25B 파라미터를 활용하며 50개 언어를 지원하고, WMT26 평가에서 83.6점을 기록했습니다. 비상업적 용도로는 무료이며, 상업적 사용은 Cohere Model Vault 또는 RWS Language Weaver를 통해 가능합니다.
딥시크(DeepSeek) AI가 100만 토큰 컨텍스트 윈도우를 지원하는 멀티모달 MoE(전문가 혼합) 모델 'DeepSeek-V4.1-Flash'를 공개했습니다. 552B 백본 파라미터와 196B Engram 파라미터로 구성된 이 모델은 장기 실행 에이전트(Long-horizon agent) 환경에서 반복적인 프리필(prefill)과 대규모 KV 캐시가 유발하는 HBM·SSD 메모리 병목을 해결하는 데 초점을 맞췄다는 점에서 주목됩니다. FP4 KV 캐시와 크로스 레이어 어텐션 재사용 등 서비스 효율화 기술이 핵심입니다.
IFM이 0.9B부터 375B-A23B까지 여섯 개 모델로 구성된 'K2 Horizon'을 Apache 2.0 라이선스로 공개했습니다. 0.9B, 3.7B, 7B 모델은 각 크기급에서 새로운 SOTA를 달성했으며, 사전학습부터 에이전트 후행학습까지 전체 학습 과정(체크포인트, 데이터, 코드, 로그, 가중치)을 완전 개방한 것이 핵심입니다. 엣지 기기부터 기업 배포까지 전 구간을 커버하는 최초의 완전 오픈 에이전트 모델 패밀리라는 점에서 중요합니다.
Z.ai가 GLM-5 시리즈 최초의 네이티브 멀티모달 모델인 GLM-5.3-Flash를 공개했습니다. 총 320B/활성 18B 파라미터의 MoE 구조에 100만 토큰 컨텍스트 윈도우를 지원하며, MIT 라이선스로 허깅페이스에 공개되었습니다. 하이브리드 KDA 선형 어텐션과 NoPE 희소 MLA 어텐션을 통해 기존 대비 어텐션 연산량을 약 3배, KV 캐시를 4.4배 줄여 비용 효율성이 높은 것이 특징입니다.
알리바바 Qwen 팀이 오픈 웨이트 멀티모달 MoE 모델 'Qwen3.8-Flash-Next'(총 180B 파라미터, 토큰당 6B 활성)를 공개하며 Qwen4 아키텍처를 미리 선보였다. Gated DeltaNet과 희소 어텐션 하이브리드, N-gram 임베딩, Muon 옵티마이저 등 4가지 구조적 변화가 적용됐으며, Qwen3.7-Plus 대비 학습 비용 1/9을 주장한다. 단, FP8 체크포인트만 172.78 GiB로 자체 호스팅 요구 사양이 상당하다.
알리바바 Qwen 팀이 총 1,250억 파라미터 중 토큰당 60억만 활성화하는 멀티모달 MoE 모델 Qwen3.8-Flash-Next를 공개했습니다. 이 모델은 Qwen4의 아키텍처 프리뷰 성격으로, 학습 비용의 약 9분의 1로 기존 Qwen3.7-Plus를 능가하는 성능을 보이며 코딩·업무 작업에서 특히 강세를 보입니다. 입력 토큰 100만 개당 0.16달러의 공격적 가격 책정으로 OpenAI와 Anthropic에 대한 가격 압박을 더욱 높이고 있습니다.
AI 코딩 스타트업 커서(Cursor)가 자사 모델 훈련에 사용된 'Mixture-of-Kittens(MoK)'를 오픈소스로 공개했습니다. 이 기술은 전문가 혼합(MoE) 통신과 연산을 단일 결정론적 커널로 통합하여 기존 대비 최대 2.37배 높은 처리 속도를 자랑합니다. 단, 엔비디아의 최신 GB300 NVL72 랙 환경이 필요하여 일반 개발자가 접근하기는 어렵다는 특징이 있습니다.
AI 스타트업 문샷 AI(Moonshot AI)가 분산형 전문가 혼합(MoE) 학습을 위한 통신 라이브러리인 'MoonEP'를 오픈소스로 공개했습니다. 이 라이브러리는 대규모 MoE 환경에서 발생하는 전문가 병렬(Expert Parallelism) 통신을 극대화하여 대규모 AI 모델 학습 효율을 크게 높여주는 것이 핵심입니다. 최근 열린 'Kimi K3 오픈 데이' 행사에서 K3 모델 가중치와 함께 소개되며 개발자들은 누구나 자유롭게 이 기술을 활용할 수 있게 되었습니다.
글로벌 IT 업계가 주목하는 3대 오픈소스 초거대 모델(Kimi K3, DeepSeek V4 Pro, GLM-5.2)의 성능, 라이선스 정책, 그리고 실제 운영 비용을 비교 분석했습니다. AI 실무자들은 이를 통해 자체 서비스에 도입할 최적의 모델(MoE 방식)을 선정하고 인프라 비용을 예측할 수 있습니다.
M3 맥 스튜디오 얼트라 환경에서 5만 토큰 이상의 긴 대화 컨텍스트를 처리할 때 첫 토큰 생성까지 수 분이 걸리던 치명적인 지연 문제를 해결한 사례입니다. 저자는 DS4 Flash 모델에서 지연 시간이 더 짧은 Qwen 3.5 122B로 교체하고, 하이브리드 어텐션 구조로 인한 캐시 메모리 누수 등 서빙 스택의 버그 3가지를 직접 수정하여 로컬 환경에서도 실사용이 가능한 에이전트 코딩 환경을 구축했습니다. 로컬 LLM 최적화 및 Mac 하드웨어 활용에 관심 있는 개발자들에게 매우 유용한 기술적 인사이트를 제공합니다.
엔비디아가 기존 모델 대비 서버 처리량을 2배 이상 향상한 압축형 하이브리드 전문가 혼합(MoE) 대형 언어 모델을 공개했습니다. 이 모델은 하드웨어에 최적화된 구조적 압축과 지식 증류 기술을 활용하여 총 파라미터와 활성 파라미터 수를 줄이면서도 사용자별 응답 속도는 유지합니다. 결과적으로 동일한 하드웨어 환경에서 처리할 수 있는 동시 사용자 수와 전체 서버 효율성을 극대화할 수 있어, AI 인프라 운영 비용 절감 및 확장성 측면에서 매우 중요합니다.
텐센트의 Hy팀이 총 295B 크기의 매개변수 중 토큰당 21B만 사용하는 효율적인 MoE(Mixture-of-Experts) 아키텍처 기반의 'Hy3' 모델을 오픈소스로 공개했습니다. 이 모델은 256K의 긴 컨텍스트 창과 강력한 추론 능력을 갖추고 있어 코딩 및 에이전트 업무 수행에 매우 유용하며, 2026년 7월까지 OpenRouter에서 무료로 테스트할 수 있습니다.
텐센트가 총 295B(활성 21B) 파라미터의 MoE 아키텍처 기반 오픈소스 AI 모델인 Hy3를 공개했습니다. 이 모델은 자신보다 2~5배 큰 모델들과 동등한 성능을 보이며, 환각률을 5.4%로 낮춘 것이 특징입니다. 아파치 2.0 라이선스로 상업적 사용이 가능해 AI 실무자와 개발자들에게 중요한 대안이 될 것으로 보입니다.
바이두가 단 한 번의 순전파로 수십 페이지 문서를 파싱할 수 있는 30억 매개변수 MoE 구조의 오픈소스 OCR 모델을 공개했습니다. 핵심 기술인 참조 슬라이딩 윈도우 어텐션(R-SWA)이 KV 캐시를 일정하게 유지하여, 출력이 길어져도 메모리와 지연 시간이 증가하지 않는 획기적인 장점이 있습니다. 성능 면에서도 기존 DeepSeek OCR 대비 6.22포인트가 높은 93.23점을 기록하며 장문서 처리 분야의 큰 기술적 진전을 보여줍니다.
코히어(Cohere)가 개발자를 위한 첫 번째 에이전트 기반 코딩 모델인 'North Mini Code'를 오픈소스로 공개했습니다. 총 30B(300억) 파라미터 중 3B(30억)만 사용하는 MoE(Mixture-of-Experts) 구조를 채택하여, 가벼운 하드웨어로도 강력한 소프트웨어 개발 성능을 발휘합니다. 개발자들이 특정 클라우드 업체에 종속되지 않고 자체 인프라에서 유연하게 AI 코딩 에이전트를 운영할 수 있다는 점에서 의미가 큽니다.
이 논문은 VRAM이 8GB에 불과한 소비자용 노트북에서 약 350억 파라미터 규모의 대규모 MoE 모델을 로컬 환경에서 실행할 수 있는 '로터리 GPU' 기법을 제안합니다. 실험 결과, 약 6.3GB의 VRAM만 사용하면서도 초당 21.06 토큰의 디코딩 처리량을 달성하며 뛰어난 메모리 효율성을 입증했습니다. 이는 클라우드 인프라에 의존하기 어려운 하드웨어, 보안, 예산 제약이 있는 환경에서도 거대 언어 모델(LLM)을 효과적으로 활용할 수 있는 가능성을 제시한다는 점에서 매우 중요합니다.
리퀴드 AI는 일반 소비자용 하드웨어에서도 구동 가능한 온디바이스용 MoE 모델인 LFM2.5-8B-A1B를 발표했습니다. 이 모델은 총 83억 개(8.3B)의 파라미터를 보유하고 있으면서도 연산 시 15억 개(1.5B)만 활성화하여 효율적인 추론을 자랑합니다. 최대 12만 8천(128K) 토큰의 긴 컨텍스트 처리와 고급 추론, 그리고 도구 호출(Tool calling) 기능을 지원하는 것이 특징입니다.
코히어(Cohere)가 기업용 에이전트 워크플로우에 최적화된 218B 매개변수의 오픈소스 MoE 모델 'Command A+'를 공개했습니다. 이 모델은 추론, 검색 증강 생성(RAG), 다국어 및 멀티모달 문서 처리 능력을 하나로 통합했으며, 최소 H100 GPU 2대만으로도 실행 가능해 현업 AI 실무자들에게 매우 효율적인 선택지가 됩니다.
코히어(Cohere)의 공동 창업자 닉 프로스트가 첫 번째 MoE(Mixture of Experts) 아키텍처 기반 모델인 'Command A+'를 공개했습니다. 이 모델은 소규모 팀과 개발자도 쉽게 에이전트를 구축할 수 있도록 실용성과 효율성을 극대화하여, 단 1~2개의 GPU 환경에서도 매우 빠르고 반응성 높게 구동되는 것이 가장 큰 특징입니다. 기업 중심의 서비스 모델을 유지하면서도 혁신을 이끄는 오픈소스 커뮤니티의 피드백을 반영하기 위해 Apache 2.0 라이선스로 전격 공개되었다는 점이 산업계 관계자들에게 주목받고 있습니다.
Allen Institute for AI(AI2)가 1T 토큰으로 학습된 새로운 MoE(Mixture of Experts) 모델인 EMO(14B 전체 파라미터 중 1B 활성화)를 공개했습니다. 이 모델의 가장 큰 특징은 기존의 표면적 패턴이 아닌 건강, 뉴스 등 특정 도메인을 기준으로 문서 수준 라우팅(document-level routing)을 수행한다는 점입니다. 라우팅 방식의 이러한 혁신은 전문가 모델의 할당을 훨씬 더 정교하게 만들어 줍니다.
샤오미가 1.02조 개 매개변수를 장착한 오픈웨이트 혼합 전문가(MoE) 언어모델 MiMo-V2.5-Pro를 공개했습니다. 이 모델은 최대 100만 토큰을 처리하며, 내부 테스트에서 불과 4.3시간 만에 완전한 컴파일러를 자율적으로 작성했습니다. 서구권 경쟁 모델들과 비교해 40~60% 적은 토큰으로 동등한 수준의 성능을 발휘하며 뛰어난 효율성을 입증했습니다.
미스트랄(Mistral)의 소형 모델 버전명이 'Mistral-Small-4-119B-2603'로 확인되었습니다. 곧 출시될 미스트랄 미디움 모델은 128B(1,280억) 개의 매개변수를 탑재할 것으로 예상됩니다. 이 모델이 완전 연결(Dense) 구조를 채택할지, 아니면 소형 모델보다 덜 희소한 MoE(Mixture of Experts) 구조를 적용할지가 업계의 주요 관심사입니다.
알리바바가 총 350억(35B) 파라미터 규모에 실제 활성 파라미터는 30억(3B)에 불과한 희소 MoE(Sparse MoE) 기반의 초경량 모델 '큐원3.6-35B-A3B'를 오픈소스로 공개했습니다. 자신보다 활성 파라미터가 10배나 큰 모델들과 맞먹는 수준의 에이전트 코딩(Agentic Coding) 능력과 강력한 멀티모달 추론 성능을 제공하는 것이 가장 큰 특징입니다. 실무자 입장에서 적은 컴퓨팅 자원으로도 고성능을 발휘할 수 있는 획기적인 오픈소스 AI 대안으로 평가받고 있습니다.