GGUF·GPTQ·AWQ·EXL2·EXL3, LLM 모델 형식 총정리
LLM 추론에 쓰이는 GGUF, GPTQ, AWQ, EXL2, EXL3 포맷은 같은 문제를 서로 다른 방식으로 해결합니다. 이 가이드는 파일 컨테이너와 양자화(quantization) 기법을 구분하고, 가중치당 비트 수, 캘리브레이션, 하드웨어 적합성을 설명합니다. 맥, 소비자용 GPU, 프로덕션 서빙 환경별로 어떤 포맷을 선택해야 하는지 안내합니다.
LLM 추론에 쓰이는 GGUF, GPTQ, AWQ, EXL2, EXL3 포맷은 같은 문제를 서로 다른 방식으로 해결합니다. 이 가이드는 파일 컨테이너와 양자화(quantization) 기법을 구분하고, 가중치당 비트 수, 캘리브레이션, 하드웨어 적합성을 설명합니다. 맥, 소비자용 GPU, 프로덕션 서빙 환경별로 어떤 포맷을 선택해야 하는지 안내합니다.
눈축스(Nunchux) AI가 영상 확산 트랜스포머(DiT)를 가속화하는 학습 없이 사용 가능한 저비트 어텐션 커널 'VC-Attention'을 공개했습니다. 이 기술은 밸류(value) 양자화 오류와 느린 소프트맥스 단계라는 두 가지 문제를 동시에 해결합니다. 별도 재학습 없이 기존 모델에 적용할 수 있다는 점에서 영상 생성 추론 속도 최적화에 실용적인 의미가 큽니다.
삼진법(Ternary) LLM은 가중치를 {-1, 0, +1} 세 값으로 저장해 이론상 약 1.585비트/가중치가 필요하지만, 실제 모델의 최대 51.5%가 0이라는 점에 착안해 인텔 연구진이 BITCOS라는 분포 적응형 저장 포맷을 제안했습니다. BITCOS는 존재 비트맵과 부호 벡터를 결합해 최소 1.485비트/가중치까지 압축하며, 29개 모델 중 26개에서 기존 5-트리트 패킹보다 작고 CPU/GPU 추론 처리량을 최대 1.27배 향상시킵니다.
Cerebras의 공개 API 엔드포인트에서 Qwen 3.8 27B 모델을 초당 약 1500토큰의 속도로 사용할 수 있게 되었습니다. 무료 체험 및 종량제 요금제에서 이용 가능하며, 컨텍스트는 무료 64k/유료 128k입니다. Cerebras는 가지치기(Pruning) 없이 원본 모델을 제공하며, 저장 시에만 선택적 양자화를 사용해 품질을 보존한다고 강조했습니다.
Liquid AI가 엣지 디바이스에서 파운데이션 모델을 벤치마킹하는 오픈소스 플랫폼 'Pipette'를 공개했습니다. 모델 카드의 서버급 풀 정밀도 수치가 실제 스마트폰에서의 성능을 예측하지 못하는 문제를 해결하기 위해, 모델·양자화·런타임·하드웨어를 통합적으로 측정합니다. Artificial Analysis가 독립적으로 방법론 검증을 담당해 신뢰성을 높였습니다.
로컬에서 실행하는 LLM이 원래 성능보다 떨어져 보이는 이유는 하드웨어·소프트웨어 구현 차이가 토큰 확률 분포를 왜곡하기 때문이라는 기술 분석 글입니다. 저자는 동일한 가중치라도 GPU 세대별 명령어 집합과 양자화, 샘플러 설정이 출력 품질에 큰 영향을 준다고 설명하며, KLD(KL Divergence)로 이 편차를 측정하는 방법을 소개합니다. 로컬 LLM 운영자에게 벤치마크와 샘플러 설정의 중요성을 일깨워주는 실용적인 글입니다.
Shoehorn은 사용자의 하드웨어 메모리 예산에 맞춰 허깅페이스(Hugging Face) 인기 모델들을 양자화(quantize)하여 로컬에서 실행할 수 있게 해주는 오픈소스 도구입니다. 브라우저에서 내 장비에 맞는 모델을 스캔해 품질 순으로 보여주고, llama.cpp를 백엔드로 사용해 원 클릭으로 채팅까지 가능합니다. 맥(macOS), 리눅스, 윈도우를 지원하며 Homebrew나 바이너리 다운로드로 설치할 수 있습니다.
본문은 진지한 로컬 추론 작업을 위한 실질적인 최소 요건인 24GB 단일 GPU 환경에서 실행할 수 있는 6가지 주요 오픈웨이트 모델을 비교 분석합니다. Qwen, Gemma, Mistral, DeepSeek 등 각 모델의 VRAM 요구량, 라이선스, 그리고 최적의 활용 사례를 소개하여 실무자의 모델 선택을 돕습니다.
PrismML이 기존 Qwen3.6-27B 모델의 구조를 유지하면서도 가중치를 1.71비트 및 1비트로 경량화한 'Bonsai 27B'를 공개했습니다. 이를 통해 270억 개 매개변수(Parameters)를 가진 대규모 언어 모델을 노트북이나 스마트폰 같은 일상적인 기기에서 실행할 수 있게 되었습니다. Apache 2.0 라이선스로 공개되어 누구나 자유롭게 활용할 수 있다는 것이 특징입니다.
PrismML이 1비트(1-bit) 및 3진법(ternary) 양자화 기술을 적용한 초경량 AI 모델 '분사이 27B(Bonsai 27B)'를 공개했습니다. 이 모델은 스마트폰이나 일반 노트북 환경에서도 270억 개 매개변수(27B) 수준의 고성능 추론, 코딩, 시각 및 에이전트 기능을 온디바이스로 실행할 수 있게 해주는 패러다임 전환적 의미를 지닙니다. 지능 손실은 최소화(기존 대비 90~95% 성능 유지)하면서도 메모리는 혁신적으로 절감하여, 강력한 오픈소스 AI의 모바일 활용을 본격화할 것으로 기대됩니다.
최신 GPU 기반 머신러닝의 한계를 넘어 FPGA에서 나노초 단위의 초저지연 추론과 온라인 학습을 구현한 연구입니다. 콜모고로프-아놀드 네트워크(KAN) 구조와 FPGA의 룩업 테이블(LUT)을 결합하여 하드웨어 효율성을 극대화했습니다. FPGA 2026 및 ICML 2026 학회에서 최우수 논문으로 선정되는 등 하드웨어 가속 및 에지 AI 분야에서 중요한 진전을 보여줍니다.
로봇 공학 종사자들이 설립한 General Instinct가 엣지 하드웨어에서도 최신 프론티어급 대규모 모델을 구동할 수 있는 기술을 오픈소스로 공개했습니다. 이들은 약 245GB에 달하는 Qwen3.5-122B MoE 모델을 48GB로 압축하여, 8GB VRAM만으로도 로봇 및 엣지 기기에서 구동할 수 있는 혁신적인 성과를 보여주며 로컬 AI의 한계를 크게 뛰어넘었습니다.
구글 딥마인드가 모바일 및 노트북 등 일상적인 엣지 디바이스에서의 구동 효율을 극대화하기 위해 '양자화 인식 훈련(QAT)'이 적용된 Gemma 4 모델을 공개했습니다. 일반적인 양자화 방식(PTQ)보다 모델의 품질 저하를 최소화하며, 특히 모바일 전용 양자화 스키마를 통해 소형 모델(E2B)의 메모리 사용량을 1GB 미만으로 획기적으로 줄였습니다. 이를 통해 소비자용 GPU 및 모바일 환경에서도 로컬 기반의 고성능 AI 모델을 원활하게 실행할 수 있게 되었습니다.
알리바바의 오픈소스 모델 Qwen3.5 35B A3B를 기반으로 한 비검열(UnCensored) 커스텀 모델과 Native MTP(다음 토큰 예측)가 완벽히 보존된 버전이 공개되었습니다. 이 모델은 Safetensors, GGUF, NVFP4, GPTQ-Int4 등 다양한 형식과 양자화 포맷을 지원하여 로컬 환경에서의 활용성을 극대화한 것이 특징입니다.
해커뉴스에 공유된 이 프로젝트는 AI 기업들이 모델 출시 후 은밀하게 가하는 성능 저하(너프)나 양자화로 인한 품질 변화를 시각적으로 추적합니다. LMSYS Arena의 ELO 데이터를 기반으로 각 사의 대표 모델 성능 변화 추이를 한눈에 파악할 수 있게 구성했습니다. 개발자와 실무자들에게 API 기준의 객관적인 모델 성능 평가 데이터를 제공해 실사용 시 참고할 수 있는 중요한 지표가 됩니다.
LLaMA.cpp 환경에서 Qwen 모델을 대상으로 다중 토큰 예측(MTP) 기술과 양자화 기법인 TurboQuant를 성공적으로 통합했습니다. 이를 통해 로컬 환경(MacBook Pro)에서 텍스트 생성 속도를 약 40% 향상시키고 높은 수용율(90%)을 달성하며 추론 성능을 크게 개선했습니다. 이 성과는 고성능 오픈소스 모델을 일반 로컬 하드웨어에서도 빠르고 효율적으로 구동할 수 있음을 입증합니다.
큐웬(Qwen) 3.6 모델의 35B-a3b(MoE 구조)에서 27B(Dense 구조)로 전환해 코딩 및 디버깅 능력이 크게 향상된 로컬 AI 개발자의 사용기입니다. VRAM 한계로 압축률이 높은 IQ3 모델을 사용했음에도 불구하고 기존 모델보다 복잡한 버그를 더 잘 찾아냈으며, 전체적인 처리 속도도 안정적이었습니다.
Gemma 4와 Qwen 3.6 모델의 메모리 절약 기법인 KV 캐시 양자화(q8_0, q4_0) 결과를 비교한 벤치마크입니다. Gemma 모델은 흔히 '무손실'로 알려진 q8_0 양자화에서도 품질 저하가 크게 발생하며, 특히 MoE 모델에서 민감도가 극심합니다. 반면 Qwen 모델은 q8_0은 물론 q4_0 수준에서도 뛰어난 안정성을 보여주어, 로컬 환경 등에서 메모리 최적화를 고려할 때 모델 선택의 중요한 기준이 됩니다.
AI 모델 경량화 및 파인튜닝을 돕는 Unsloth가 'Dynamic GGUF + Quants'의 새로운 2.0 버전을 발표했습니다. 이번 업데이트는 업계 최고 수준(SOTA)의 양자화 성능과 향상된 정확도를 제공하는 것이 특징입니다. 총 88개의 모델 파일이 추가되었으며, 로컬 환경에서 대규모 언어 모델을 효율적으로 구동하려는 실무자들에게 매우 유용한 업데이트입니다.
Unsloth이 Gemma 4 26B-A4B 및 Qwen3.6 모델의 GGUF 양자화(Quantization) 버전별 성능을 비교하는 벤치마크를 발표했습니다. KL Divergence 지표를 통해 원본 모델의 정확도를 얼마나 잘 보존하는지 분석한 결과, Unsloth의 GGUF 포맷이 22개 중 21개 크기에서 최고 성능을 기록하며 압도적인 우위를 점했습니다. 또한 기존 Q6_K 및 MLX 4-bit 양자화 방식의 정확도를 개선하고, 16GB VRAM 환경에 맞춘 새로운 UD-IQ4_NL_XL 포맷을 추가로 제공합니다.
AI 최적화 기업 Unsloth가 최근 공개한 Qwen3.6-35B-A3B GGUF 모델의 성능 벤치마크 결과를 발표했습니다. 이와 함께 최적의 성능과 용량 효율을 보여준 자사 양자화(Quantization) 모델의 우수성을 강조했습니다. 또한 커뮤니티 내에서 제기된 빈번한 모델 업데이트에 대한 오해를 해명하고, MiniMax 2.7 모델에서 발생한 연산 오류(NaN) 및 기타 이슈의 원인이 자체적인 실수가 아닌 외부 요인 때문이었음을 구체적인 데이터로 증명했습니다.
새로 출시된 Bonsai-8B 모델은 1비트 및 1.58비트(삼진법) 양자화 버전 모두 구글의 Gemma-4-E2B 모델보다 지능 및 정답률이 현저히 낮은 것으로 나타났습니다. 특히 1.58비트 모델은 파일 크기마저 Gemma보다 33% 더 큰 치명적인 단점을 보여주며, 실무적인 활용 가치가 거의 없음을 시사합니다.
Mac 전용 MiniMax m2.7 양자화 모델 두 종이 공개되었습니다. 63GB 버전은 MMLU 88%, 89GB 버전은 95%를 기록하며 성능을 입증했습니다. 속도 역시 M5 Max 기준 초당 약 50토큰, 프롬프트 처리 400으로 최상위 클로드 모델(Sonnet 4.5)에 근접하는 로컬 구동 성능을 보여줍니다.
oobabooga 사용자가 Hugging Face 주요 업로더들의 Gemma 4 31B GGUF 양자화 모델 52종의 품질을 KL 발산 지표로 비교 분석했습니다. 그 결과 파레토 최적화 기준 unsloth의 UD- 시리즈가 동일 용량 대비 가장 뛰어난 성능을 보여주었으며, 코딩 및 과학 분야보다 긴 문맥이나 비라틴어 텍스트 처리 시 품질 저하가 크게 나타났습니다. 이는 로컬 환경에서 LLM을 구동하는 사용자들에게 자신의 메모리 용량에 맞는 최적의 양자화 모델을 선택하는 중요한 가이드를 제공합니다.