인코더 없는 통합 멀티모달, 젬마 4 12B 공개
구글 딥마인드가 16GB VRAM 환경의 노트북에서도 원활히 구동되는 오픈소스 미드 사이즈 모델 'Gemma 4 12B'를 출시했습니다. 이 모델은 별도의 비전 및 오디오 인코더 없이 시각·청각 데이터를 직접 처리하는 통합 아키텍처를 채택하여 지연 시간을 최소화했습니다. 120억 파라미터의 가벼운 크기에도 불구하고 260억 파라미터 MoE 모델에 근접한 추론 성능을 제공하며, 에이전트 워크플로우 구축에 최적화된 것이 특징입니다.
Gemma 4 12B 발표: 통합된 인코더 프리 멀티모달 모델 2026년 6월 3일
공유하기: x.com, Facebook, LinkedIn, Mail, 링크 복사
Gemma 4 12B는 모바일 및 엣지 기기 최적화의 효율성과 고급 추론 능력을 결합하여, 고성능의 멀티모달 인공지능을 사용자의 노트북으로 직접 가져오기 위해 설계되었습니다.
Olivier Lacombe, Google DeepMind 제품 관리 이사 Gus Martins, Google DeepMind 제품 관리자
공유하기: x.com, Facebook, LinkedIn, Mail, 링크 복사
오디오 요소를 지원하지 않는 브라우저입니다. 기사 읽어주기: 이 콘텐츠는 Google AI에 의해 생성되었습니다. 생성형 AI는 실험 단계입니다. [[duration]] 분 음성 속도: 0.75X, 1X, 1.5X, 2X
오늘 저희는 에이전트형(Agentic) 멀티모달 인공지능을 노트북으로 직접 가져오기 위해 설계된 최신 모델, Gemma 4 12B를 소개합니다. 엣지 친화적인 E4B 모델과 더 고급화된 26B MoE(Mixture of Experts) 모델 사이의 간극을 메우는 Gemma 4 12B는 줄어든 메모리 사용량 안에 강력한 기능을 패키징했습니다. 또한 네이티브 오디오 입력을 지원하는 저희의 첫 번째 중간 크기(Mid-sized) 모델이기도 합니다.
개발자 커뮤니티 덕분에 Gemma 4 모델의 다운로드 수는 현재 1억 5천만 회를 돌파했습니다. 여러분은 신체 보조용 웨어러블 로봇 팔부터 기업급 AI 보안까지 모든 것을 구축했습니다. 이 최신 추가 모델로 여러분이 무엇을 만들어낼지 저희는 매우 기대하고 있습니다.
다음은 Gemma 4 12B만의 특별한 점에 대한 개요입니다:
- 새로운 통합 아키텍처: 별도의 멀티모달 인코더가 없습니다. 비전(이미지) 및 오디오 입력이 LLM(대형 언어 모델) 백본(Backbone)으로 직접 흘러들어갑니다.
- 고급 추론 능력: 저희의 26B 모델에 근접한 벤치마크 성능을 발휘하여, 강력한 다단계 추론 및 에이전트 워크플로우를 가능하게 합니다.
- 노트북 준비 완료: 단 16GB의 VRAM 또는 통합 메모리만으로도 로컬에서 실행할 수 있을 만큼 작습니다.
- 개방성 및 접근성: Apache 2.0 라이선스로 배포되며, 개발자 생태계 전반을 지원합니다.
- 드래프트 준비 완료: Gemma 4 12B는 지연 시간을 줄이기 위해 MTP(Multi-Token Prediction) 드래프터를 기본적으로 탑재하고 있습니다.
이러한 기능들은 고급 멀티모달 기능을 속도나 추론 능력의 희생 없이 일상적인 하드웨어로 가져옵니다. 이제 Gemma 4 12B가 이를 어떻게 달성하는지 자세히 살펴보겠습니다.
최고 수준의 에이전트를 로컬에서 실행하세요
Gemma 4 12B는 표준 벤치마크에서 저희의 더 큰 26B MoE 모델에 근접한 성능을 제공하지만, 전체 메모리 사용량은 절반 이하입니다. 16GB RAM을 갖춘 소비자용 노트북에서 로컬로 실행할 수 있을 만큼 작으며, 기기 자체에서 강력한 멀티모달 및 에이전트 경험을 가능하게 합니다.
독보적으로 효율적인 통합 아키텍처 경험
Gemma 4 12B가 두각을 나타내는 이유는 시각적, 청각적 입력을 처리하는 간소화된 방식에 있습니다. 기존의 멀티모달 모델은 일반적으로 이미지와 오디오를 언어 모델로 전달하기 전에 변환하기 위해 별도의 인코더에 의존합니다. 이러한 분리된 인코더들은 지연 시간을 추가하고 메모리 사용량을 증가시키기 때문에, 저희는 오디오와 비전 입력을 직접 통합하기 위해 인코더 프리(Encoder-free) 아키텍처로 Gemma 4 12B를 학습시켰습니다.
Gemma 4 12B가 멀티모달 입력을 네이티브로 처리하는 방식은 다음과 같습니다:
- 비전(Vision): 저희는 Gemma 4의 비전 인코더를 단일 행렬 곱셈, 위치 임베딩(Positional Embedding) 및 정규화(Normalization)로 구성된 경량 임베딩 모듈로 교체했습니다. 이를 통해 LLM 백본이 시각적 처리를 담당할 수 있습니다.
- 오디오(Audio): 오디오 처리를 더욱 간소화했습니다. 오디오 인코더를 완전히 제거하고, 원시 오디오 신호를 텍스트 토큰과 동일한 차원 공간으로 투사(Projecting)했습니다.
자세한 기술적 분석을 원하는 개발자들은 저희의 Gemma 4 12B 개발자 가이드(Developer Guide)를 확인해 보시기 바랍니다.
오늘 바로 시작하세요
- 직접 사용해 보기: LM Studio, Ollama, Google AI Edge Gallery App, Google AI Edge Eloquent 앱 및 LiteRT-LM CLI에서 몇 번의 클릭만으로 실험해 볼 수 있습니다.
- 가중치 다운로드: Hugging Face 및 Kaggle에서 사전 학습된(Pre-trained) 체크포인트와 명령어 미세조정(Instruction-tuned) 체크포인트를 직접 다운로드하세요.
- 통합 및 학습: 개발자 문서와 빠른 시작 노트북(Quick start notebook)을 검토하세요.
- 선호하는 개발 도구 사용: Hugging Face Transformers, llama.cpp, MLX, SGLang 및 vLLM을 사용하여 로컬 추론 파이프라인을 구현하거나, Unsloth를 사용하여 효율적으로 미세조정(Fine-tuning)을 수행하세요.
에이전트의 잠재력을 끌어내세요...