메뉴

#qwen

TD
The Decoder • 3일 전
IMP 7

알리바바, Qwen Audio 3.1 출시… AI 오디오 가격 최대 95% 인하

알리바바의 AI팀 Qwen이 음성 인식(ASR), 음성 합성(TTS), 실시간 상호작용용 모델 5종으로 구성된 Qwen-Audio-3.1을 공개했습니다. 다국어·방언 인식 개선, 감정·환경음 감지, 텍스트 프롬프트만으로 감정과 스타일 제어, 동시 듣기·말하기 지원 등이 핵심 기능입니다. 아울러 TTS 약 70%, 실시간 약 85%, ASR 최대 95% 가격을 인하해 AI 오디오 시장에서 공격적인 경쟁에 나섰습니다.

음성인식 음성합성 알리바바
HN
Hacker News • 5일 전
IMP 5

Kev: Qwen3.5 기반의 경량 Jev 스타일 의사결정 모델 패밀리

Kev는 Qwen3.5를 기반으로 한 소형 의사결정 모델 패밀리로, Jev의 아키텍처 논문을 따르며 0.8B/4B/9B 크기로 제공됩니다. 사전 학습된 가중치를 쓰거나 직접 학습할 수 있고, TypeSafe System One과 호환되는 API로 CUDA와 Apple Silicon에서 로컬 실행이 가능합니다. 예/아니오(noul), 다중 선택(choice), 평점(score) 질문을 한 번의 요청에 입력 텍스트를 공유하면서 처리하며, 확률 기반 결과를 반환합니다.

오픈소스 로컬모델 Qwen
TD
The Decoder • 5일 전
IMP 7

알리바바 오픈 웨이트 Qwen-Image-2.1, 70억 파라미터로 폐쇄형 모델 능가 주장

알리바바 Qwen 팀은 이미지 생성·편집용 오픈 웨이트 모델 Qwen-Image-2.1을 공개했습니다. 70억 파라미터의 경량 모델임에도 자체 벤치마크에서 대부분의 폐쇄형 모델을 능가한다고 주장하며, RTX 3090급 소비자 GPU에서도 구동 가능합니다. 투명 이미지(RGBA) 생성과 최대 10장의 참조 이미지 활용이 특징이지만, 연구 라이선스로 상업적 사용은 별도 허가가 필요합니다.

알리바바 Qwen 이미지 생성
TD
The Decoder • 6일 전
IMP 7

커원3.8-옴니-플래시, 제미나이 플래시 가격 파격 undercut

알리바바의 Qwen이 AI 에이전트용 멀티모달 모델 'Qwen3.8-Omni-Flash'를 공개했습니다. 이 모델은 오디오와 비디오를 함께 처리하고 도구를 스스로 활용하며, 오디오-비디오 벤치마크에서 Gemini 3.8 Flash에 근접하는 성능을 보이면서도 API 가격은 입력 100만 토큰당 0.15달러로 제미나이 대비 5분의 1 수준입니다. 100만 토큰 컨텍스트 윈도우와 오픈소스 플러그인 생태계를 함께 제공해 멀티모달 에이전트 개발자에게 중요한 선택지가 될 전망입니다.

멀티모달 Qwen 가격경쟁
MP
MarkTechPost • 7일 전
IMP 8

PrismML, 5.9GB 삼진법 모델 'Ternary Bonsai 2 27B' 공개

PrismML이 Qwen3.8 27B를 삼진 가중치(Ternary)로 압축한 'Ternary Bonsai 2 27B'를 아파치 2.0 라이선스로 공개했습니다. FP16 대비 약 9분의 1 수준인 5.93GB 크기임에도 20개 벤치마크 평균의 98.2% 성능을 유지하며, 텍스트와 이미지 입력 및 26만 토큰 컨텍스트를 지원합니다. 소비자급 GPU에서도 대형 멀티모달 모델 실행이 가능해졌다는 점에서 주목할 만합니다.

모델 압축 삼진 가중치 오픈소스
MP
MarkTechPost • 8일 전
IMP 7

알리바바 Qwen, 에이전틱 오디오·영상 이해 특화 'Qwen3.8-Omni-Flash' 공개

알리바바의 Qwen 팀이 오디오와 영상을 이해하고 작업을 계획하며 도구를 호출할 수 있는 100만 토큰 컨텍스트의 옴니모달 모델 Qwen3.8-Omni-Flash를 공개했습니다. OmniVideoBench 벤치마크에서 약 45.7% 적은 토큰을 사용해 효율성을 크게 개선했으며, 에이전틱(Agentic) 음성·영상 이해와 도구 사용에 중점을 둔 것이 특징입니다.

다중모달 알리바바 Qwen
HN
Hacker News • 8일 전
IMP 7

본사이 2 27B, 9배 작은 용량으로 거의 무손실 압축

PrismML이 삼진법(trinary) 가중치 기반의 'Ternary Bonsai 2 27B'를 공개했습니다. Qwen3.8 27B를 기반으로 하며, 전체 원본 모델 대비 9배 이상 작은 5.9GB 크기로 벤치마크 성능의 98.2%를 유지합니다. 로컬 기기에서 코딩 에이전트, 컴퓨터 사용, 멀티모달 작업 등 실질적인 지식 노동이 가능해졌다는 점에서 주목할 만합니다.

모델 압축 로컬 LLM 오픈소스
HN
Hacker News • 12일 전
IMP 7

OpenArch – 최신 LLM 아키텍처의 PyTorch 구현 모음

OpenArch는 Sebastian Raschka의 LLM 아키텍처 갤러리에 수록된 모델들을 원 논문과 config.json 파일 기반으로 순수 PyTorch로 직접 구현한 오픈소스 저장소입니다. GPT-2부터 DeepSeek R1, Kimi K2, GLM 4.5 등 15개 이상 모델을 아키텍처별 하나의 읽기 쉬운 파일로 제공하며, 어텐션 방식(MHA/GQA/MLA), 정규화, 위치 인코딩, MoE 라우팅 등 구조적 차이를 나란히 비교할 수 있게 합니다. 속도나 배포 최적화보다 학습과 명확성을 목표로 하는 리소스로, 기여자도 모집 중입니다.

pytorch llm-아키텍처 오픈소스
HN
Hacker News • 16일 전
IMP 7

Qwen 3.8, GPT-5.5 Pro 추론 프리필 결과 추종

오픈 모델에 GPT-5.5 Pro의 추론 초반 1%를 프리필로 삽입하는 실험에서 Qwen3.8 A95B는 정답 유사도가 18.18%p나 상승했습니다. 반면 DeepSeek V4 Flash는 오히려 소폭 하락하고 Kimi K3는 4.54%p만 증가해, Qwen이 GPT-5.5 Pro(또는 유사 GPT 모델)로부터 학습했을 가능성을 시사합니다.

추론 프리필 모델 증류 Qwen
HN
Hacker News • 18일 전
IMP 5

동일한 Three.js 과제에 10가지 모델·하네스 조합 테스트

한 개발자가 동일한 Three.js SF 격납고 제작 프롬프트를 10가지 모델과 코딩 하네스 조합으로 실행해 성능을 비교했습니다. 처리 시간, 토큰 사용량, 캐싱 비율, 도구 호출 오류, 브라우저 실행 여부 등 세부 지표를 공개했습니다. 특히 Qwen 3.8 27B와 OpenCode 조합은 8분 만에 적은 토큰으로 완성했고, SOL 5.6 등 일부 조합은 결과물이 제대로 동작하지 않았습니다.

모델 벤치마크 코딩 에이전트 Three.js
TD
The Decoder • 19일 전
IMP 7

알리바바 Qwen-Drive 1.0, 주행·설명 하나의 AI로…단, 설명과 조작이 안 맞을 수도

알리바바가 자율주행용 멀티모달 모델 Qwen-Drive 1.0을 공개했다. Qwen3.5-4B를 기반으로 3D 공간 지각 모듈과 경로 계획 전문가(Planning Expert) 모듈을 추가해, 하나의 모델로 주행 시스템과 콕핏 어시스턴트를 모두 수행한다. 시뮬레이션에서 차선 이탈률을 24%에서 12%로 줄였으나, 모델의 설명이 실제 주행 결정과 항상 일치하지는 않는 한계가 있다.

자율주행 멀티모달 알리바바
HN
Hacker News • 22일 전
IMP 7

Qwen 3.8 27B, Cerebras에서 초당 1500토큰으로 제공

Cerebras의 공개 API 엔드포인트에서 Qwen 3.8 27B 모델을 초당 약 1500토큰의 속도로 사용할 수 있게 되었습니다. 무료 체험 및 종량제 요금제에서 이용 가능하며, 컨텍스트는 무료 64k/유료 128k입니다. Cerebras는 가지치기(Pruning) 없이 원본 모델을 제공하며, 저장 시에만 선택적 양자화를 사용해 품질을 보존한다고 강조했습니다.

Cerebras Qwen 추론 속도
MP
MarkTechPost • 23일 전
IMP 6

Qwen, ripgrep·BM25·벡터 검색 통합 로컬 우선 검색 도구 zg 오픈소스화

Qwen 개발팀이 Apache 2.0 라이선스로 로컬 우선(local-first) 검색 레이어인 zg(zvec-grep)를 오픈소스로 공개했습니다. zg는 ripgrep, BM25, 벡터 검색을 하나의 인터페이스 뒤에 통합해 에이전트가 자연어 설명만으로 정확한 코드 라인 범위까지 도달할 수 있게 해줍니다. 의도적으로 최소화한 MCP 인터페이스, 온디바이스 임베딩 카탈로그, 그리고 로컬 콘텐츠와 원격 모델 사이의 인증 게이트가 핵심 특징입니다.

검색 오픈소스 Qwen
MP
MarkTechPost • 30일 전
IMP 8

알리바바 Qwen3.8-Flash-Next 공개, Qwen4 아키텍처 예고

알리바바 Qwen 팀이 오픈 웨이트 멀티모달 MoE 모델 'Qwen3.8-Flash-Next'(총 180B 파라미터, 토큰당 6B 활성)를 공개하며 Qwen4 아키텍처를 미리 선보였다. Gated DeltaNet과 희소 어텐션 하이브리드, N-gram 임베딩, Muon 옵티마이저 등 4가지 구조적 변화가 적용됐으며, Qwen3.7-Plus 대비 학습 비용 1/9을 주장한다. 단, FP8 체크포인트만 172.78 GiB로 자체 호스팅 요구 사양이 상당하다.

Qwen 알리바바 MoE
TD
The Decoder • 30일 전
IMP 8

알리바바, '궁극의 비용 효율' 노린 Qwen3.8-Flash-Next 공개

알리바바 Qwen 팀이 총 1,250억 파라미터 중 토큰당 60억만 활성화하는 멀티모달 MoE 모델 Qwen3.8-Flash-Next를 공개했습니다. 이 모델은 Qwen4의 아키텍처 프리뷰 성격으로, 학습 비용의 약 9분의 1로 기존 Qwen3.7-Plus를 능가하는 성능을 보이며 코딩·업무 작업에서 특히 강세를 보입니다. 입력 토큰 100만 개당 0.16달러의 공격적 가격 책정으로 OpenAI와 Anthropic에 대한 가격 압박을 더욱 높이고 있습니다.

알리바바 Qwen MoE
HN
Hacker News • 31일 전
IMP 6

쇼 HN: 라즈베리파이와 Qwen으로 만든 오프라인 차량용 AI

라즈베리파이 5(16GB, 약 300유로)에 Qwen3.6-35B 모델을 로컬로 구동해 차를 채팅룸 에이전트처럼 만드는 오픈소스 프로젝트입니다. 클라우드 없이 차량용 음성 비서, 745페이지 차량 매뉴얼 기반 RAG 질의응답, 자가진단, 블랙박스 영상 전송 등을 완전 오프라인으로 수행하며, 연결이 끊겨도 큐에 저장했다가 나중에 전송하는 견고한 설계가 돋보입니다.

라즈베리파이 온디바이스 AI Qwen
MP
MarkTechPost • 54일 전
IMP 8

알리바바, 2.4조 매개변수 Qwen3.8-Max 공개

알리바바의 Qwen 팀이 2.4조 개의 매개변수를 가진 MoE(Mixture of Experts) 모델인 Qwen3.8-Max를 정식 출시했습니다. 이 모델은 텍스트, 이미지, 비디오 입력을 지원하며 최대 100만 토큰의 컨텍스트를 처리할 수 있고, 다음 주에 오픈 웨이트(Open Weights) 공개를 예고하여 AI 업계의 높은 관심을 끌고 있습니다.

알리바바 Qwen MoE 모델
HN
Hacker News • 64일 전
IMP 7

헤츠너, LLM 추론 API 실험 공개

저렴한 서버 호스팅으로 유명한 헤츠너(Hetzner)가 자체 인프라 기반의 LLM 추론 API 실험을 시작했습니다. 오픈AI 호환 API 형태로 제공되며, 현재는 Qwen 35B 모델 하나만 지원하지만 토큰당 224개의 매우 빠른 처리 속도를 보여줍니다. 아직 상용화 단계는 아니지만, 클라우드 사업자가 저비용 고효율 GPU 인프라를 무기로 LLM 서비스 시장에 진출하려는 시도라는 점에서 주목할 만합니다.

헤츠너 LLM 추론 오픈AI API
MP
MarkTechPost • 68일 전
IMP 8

알리바바, 2.4조 매개변수 Qwen3.8-Max 프리뷰 공개

알리바바의 Qwen 팀이 2.4조 개의 매개변수를 가진 멀티모달 MoE 모델인 Qwen3.8-Max-Preview를 공개했습니다. 해당 모델은 토큰(Token) 플랫폼 등에서 정가의 10% 가격으로 테스트가 가능하지만, 벤치마크 점수나 라이선스 등 핵심 스펙은 아직 공개되지 않아 기술적 검증이 필요한 상태입니다.

알리바바 Qwen AI모델
TD
The Decoder • 69일 전
IMP 8

알리바바 Qwen 3.8 공개, "Fable 5 다음으로 뛰어나"

알리바바가 2.4조 개 매개변수를 갖춘 최신 오픈 웨이트(open-weight) 모델인 Qwen 3.8을 공개했습니다. 이 모델은 특히 코딩 및 복잡한 데이터 분석 작업에서 기존 모델을 크게 앞지르며, 급부상하는 경쟁사 Moonshot AI의 Kimi K3 모델을 견제하는 전략적 목적을 띠고 있습니다. 아직 오픈 웨이트는 공개되지 않았으나 곧 풀릴 예정입니다.

알리바바 Qwen 오픈소스
HN
Hacker News • 76일 전
IMP 7

맥 스튜디오에서 대규모 AI 모델 구동을 위한 3가지 버그 수정

M3 맥 스튜디오 얼트라 환경에서 5만 토큰 이상의 긴 대화 컨텍스트를 처리할 때 첫 토큰 생성까지 수 분이 걸리던 치명적인 지연 문제를 해결한 사례입니다. 저자는 DS4 Flash 모델에서 지연 시간이 더 짧은 Qwen 3.5 122B로 교체하고, 하이브리드 어텐션 구조로 인한 캐시 메모리 누수 등 서빙 스택의 버그 3가지를 직접 수정하여 로컬 환경에서도 실사용이 가능한 에이전트 코딩 환경을 구축했습니다. 로컬 LLM 최적화 및 Mac 하드웨어 활용에 관심 있는 개발자들에게 매우 유용한 기술적 인사이트를 제공합니다.

로컬 LLM 맥 스튜디오 추론 최적화
MP
MarkTechPost • 83일 전
IMP 8

전 알리바바 Qwen 리더가 밝히는 하이브리드 추론의 한계와 에이전트의 미래

알리바바 '큐원(Qwen)'의 전 기술 책임자인 임준양(Junyang Lin)은 최근 강연과 에세이를 통해 Qwen3의 하이브리드 추론 모델이 가진 한계를 분석하고, AI의 방향성이 단순 추론에서 '에이전트적 사고(Agentic Thinking)'로 전환되어야 함을 강조했습니다. 특히 에이전트 강화학습(RL) 인프라를 구축하는 것이 기술적으로 훨씬 까다로우며, 보상 해킹(Reward hacking)과 같은 문제를 어떻게 해결해야 하는지가 현업 실무자들에게 중요한 과제로 남았습니다.

Qwen 에이전트 하이브리드 추론
MP
MarkTechPost • 116일 전
IMP 7

알리바바 Qwen3.7-Plus 공개

알리바바의 Qwen 팀이 자체 AI 플랫폼인 바이리안(Bailian)에 새로운 멀티모달 에이전트 모델인 Qwen3.7-Plus를 출시했습니다. 이 모델은 이미지와 비디오를 이해하는 시각 능력뿐만 아니라, 자가 프로그래밍 및 도구 호출(Tool Invocation) 기능을 탑재하여 독립적인 작업 수행 능력을 갖췄습니다. 이를 통해 복잡한 작업을 자율적으로 처리할 수 있는 고도화된 AI 에이전트 시장의 경쟁력이 한층 더 강화되었습니다.

알리바바 Qwen 멀티모달
LL
r/LocalLLaMA • 123일 전
IMP 5

Qwen3.5 35B 비검열 모델 다양한 포맷 출시

알리바바의 오픈소스 모델 Qwen3.5 35B A3B를 기반으로 한 비검열(UnCensored) 커스텀 모델과 Native MTP(다음 토큰 예측)가 완벽히 보존된 버전이 공개되었습니다. 이 모델은 Safetensors, GGUF, NVFP4, GPTQ-Int4 등 다양한 형식과 양자화 포맷을 지원하여 로컬 환경에서의 활용성을 극대화한 것이 특징입니다.

오픈소스 모델 로컬 AI 양자화
LL
r/LocalLLaMA • 124일 전
IMP 6

V100 환경에서 Qwen3.6 27B 초당 1,000토큰 생성 달성

NVIDIA V100 GPU 환경에서 Qwen3.6 27B 모델을 구동하여 최대 초당 1,000토큰(tps)의 생성 속도를 달성하는 실험 결과가 공유되었습니다. 다중 사용자 동시 처리(배치 128) 시에는 엄청난 속도를 보여주며, 단일 사용자 기준으로는 MTP(다중 토큰 예측) 없이도 초당 80토큰의 생성 속도와 초당 3,000토큰의 처리 속도를 기록했습니다. 이는 구형 GPU인 V100으로도 대규모 모델을 상당히 쾌적하게 구동할 수 있음을 보여주는 의미 있는 벤치마크입니다.

오픈소스 모델 벤치마크 GPU 인퍼런스
LL
r/LocalLLaMA • 128일 전
IMP 7

큐원(Qwen), 270억 매개변수(27B) 모델 추가 공개 유력

오픈소스 AI 모델 분야에서 두각을 나타내고 있는 알리바바의 큐원(Qwen)이 270억(27B) 매개변수 규모의 새로운 모델을 출시할 가능성이 높습니다. 이는 기존 라인업의 빈자리를 채울 중요한 릴리즈로, AI 실무자들에게 오픈소스 기반의 강력한 중형급 모델 선택지를 제공할 것으로 보입니다. 정확한 출시 일정 및 로드맵은 현재 내부 조율 중인 것으로 전해집니다.

qwen llm 오픈소스
LL
r/LocalLLaMA • 128일 전
IMP 3

커뮤니티가 Qwen 3.7 모델 발표를 학수고대하는 현실

오픈소스 AI 커뮤니티 사용자가 중국의 Qwen(치안)이 발표할 3.7 버전 모델을 기다리며 게시한 유머러스한 게시글입니다. 해당 유저는 27B(27B) 및 122B(122B) 파라미터 모델의 공개를 간절히 희망하고 있습니다. 이는 화제의 Qwen 새 모델에 대한 글로벌 개발자들의 높은 기대감과 관심을 잘 보여줍니다.

Qwen 오픈소스 모델 대규모 언어 모델(LLM)
LL
r/LocalLLaMA • 135일 전
IMP 7

Qwen 모델에 다중 토큰 예측 적용 및 속도 40% 향상

LLaMA.cpp 환경에서 Qwen 모델을 대상으로 다중 토큰 예측(MTP) 기술과 양자화 기법인 TurboQuant를 성공적으로 통합했습니다. 이를 통해 로컬 환경(MacBook Pro)에서 텍스트 생성 속도를 약 40% 향상시키고 높은 수용율(90%)을 달성하며 추론 성능을 크게 개선했습니다. 이 성과는 고성능 오픈소스 모델을 일반 로컬 하드웨어에서도 빠르고 효율적으로 구동할 수 있음을 입증합니다.

로컬-AI LLaMA.cpp 양자화
LL
r/LocalLLaMA • 146일 전
IMP 7

Qwen3.6-27B vs Coder-Next 모델 비교 결과

RTX PRO 6000 GPU 2대로 약 20시간 동안 Qwen3.6-27B와 Coder-Next 모델을 심층 비교한 결과, 두 모델은 전반적인 벤치마크에서 통계적으로 비등한 성능을 보였습니다. 흥미롭게도 Qwen3.6-27B는 '사고(Thinking)' 기능을 비활성화했을 때 오히려 결과물의 일관성이 95.8%로 가장 높게 나타났으며, Coder-Next는 제한된 비즈니스 문서 작성 등 특정 작업에서 60~100배 낮은 비용으로 완벽한 성공률을 기록해 각기 다른 강점을 입증했습니다.

오픈소스 모델 벤치마크 Qwen
MP
MarkTechPost • 148일 전
IMP 8

큐원팀, LLM 내부 구조 해독하는 '큐원-스코프(SAE)' 오픈소스 공개

알리바바 클라우드의 Qwen 팀이 대규모 언어 모델(LLM)의 내부 작동 방식을 해석하고 제어할 수 있는 오픈소스 희소 오토인코더(SAE) 모음인 'Qwen-Scope'를 공개했습니다. 이 도구는 모델의 내부 상태를 인간이 이해할 수 있는 언어나 스타일 같은 개념으로 분해하여, 가중치 수정 없이 실시간으로 모델의 출력을 제어하는 디버깅 및 개발 도구로 활용될 수 있습니다. 이를 통해 개발자들은 값비싼 컴퓨팅 자원을 소모하지 않고도 모델의 오작동을 진단하고 원하는 방향으로 쉽게 평가 및 수정할 수 있게 되었습니다.

대규모 언어 모델 오픈소스 희소 오토인코더