로컬 기기용 초경량 이미지 생성 모델
PrismML이 노트북과 스마트폰 같은 로컬 기기에서 고품질 이미지 생성을 가능하게 하는 40억 파라미터(4B) 모델 'Bonsai Image 4B'를 공개했습니다. 이 모델은 가중치를 1비트(1-bit) 또는 삼진법(Ternary) 형태로 압축하여, 기존 풀 정밀도(FP16) 모델 대비 메모리 사용량을 약 6~8배 획기적으로 줄였습니다. 특히 이 파라미터 클래스의 이미지 모델 중 최초로 아이폰에서 직접 구동될 수 있어, 온디바이스 AI 생성 기술의 새로운 지평을 열었다는 데 큰 의미가 있습니다.
LAUNCH 1001011100 001011 11010 모든 게시물로 돌아가기
1비트 및 삼진법(Ternary) Bonsai Image 4B 소개: 로컬 기기를 위한 이미지 생성 2026년 5월 26일 • PrismML
오늘 우리는 노트북부터 스마트폰에 이르기까지 로컬 하드웨어에서 고품질 디퓨전 추론을 실행하도록 설계된 초소형 이미지 생성 모델 패밀리인 Bonsai Image 4B를 출시합니다.
Bonsai Image 4B는 두 가지 변형으로 제공됩니다:
1비트(1-bit) Bonsai Image 4B는 FP16 그룹별 스케일링 팩터가 적용된 이진법 {−1, +1} 트랜스포머 가중치를 사용하여 가중치당 1.125비트의 유효 비트를 가집니다. 이는 최대 압축을 목표로 하며, 메모리 압력, 대역폭 및 배포 공간이 주요 제약 조건일 때 적합한 선택입니다.
삼진법(Ternary) Bonsai Image 4B는 FP16 그룹별 스케일링 팩터가 적용된 {−1, 0, +1} 트랜스포머 가중치를 사용하여 가중치당 1.71비트의 유효 비트를 가집니다. 추가된 제로(0) 상태는 모델에 더 많은 표현의 유연성을 제공하여 매우 콤팩트함을 유지하면서도 시각적 품질과 프롬프트 충실도를 향상시킵니다.
그 결과 이미지 생성을 위한 새로운 배포 체제가 마련되었습니다. 이전에는 이 클래스의 모델이 접근할 수 없었던 기기에서도 우수한 결과물, 개방형 가중치(Open weights)를 통한 실용적인 로컬 추론이 가능해졌습니다. 우리가 아는 한, Bonsai Image 4B는 해당 파라미터 클래스에서 아이폰에서 직접 실행되는 최초의 이미지 모델입니다.
로컬 생성을 위해 설계 로컬 이미지 생성은 모델이 기기의 메모리 예산 내에 들어가야 한다는 엄격한 제약 조건에서 시작됩니다. 4B(40억 파라미터) 클래스 이미지 모델의 경우, 디퓨전 트랜스포머가 모델에서 가장 큰 부분을 차지하며 생성 중에 반복적으로 실행되는 부분입니다. 각 노이즈 제거(denoising) 단계마다 트랜스포머가 다시 호출되므로, 트랜스포머 크기는 메모리 압력, 대역폭 수요 및 로컬 추론 속도에 직접적인 영향을 미칩니다.
Bonsai Image 4B는 FLUX.2 Klein 4B를 기반으로 구축되었습니다. 아키텍처는 그대로 유지하면서 트랜스포머 가중치가 표현되는 방식만 변경했습니다. 가중치를 이진 및 삼진 형식으로 변환함으로써 Bonsai는 로컬 배포에 있어 가장 중요한 이미지 파이프라인의 크기를 줄였습니다.
| 모델 | 디퓨전 트랜스포머 크기 | FP16 대비 감소 비율 |
|---|---|---|
| FLUX.2 Klein 4B | 7.75 GB | 1.0x |
| 1비트 Bonsai Image 4B | 0.93 GB | 8.3x |
| 삼진법 Bonsai Image 4B | 1.21 GB | 6.4x |
표 1: 모델별 디퓨전 트랜스포머 공간 크기
이진 레이어는 전체 정밀도 트랜스포머 가중치에 비해 약 14배의 크기 감소를 제공합니다. 프로젝션 레이어라고 불리는 정밀도에 민감한 소규모 지원 텐서(약 5%)는 FP16으로 유지되므로, 최종 1비트 Bonsai Image 4B 트랜스포머의 크기는 0.93 GB로 전체 정밀도의 FLUX.2 Klein 4B(7.75 GB) 대비 8.3배 감소했습니다.
삼진법 변형도 동일한 구조를 따릅니다. 삼진 레이어는 약 10배의 크기 감소를 제공하며, 최종 삼진법 Bonsai Image 4B 트랜스포머의 크기는 1.21 GB로 전체 정밀도 트랜스포머 대비 6.4배 감소했습니다. 1비트 모델보다 약간 크지만, 추가된 제로(0) 상태 덕분에 시각적 품질과 프롬프트 충실도가 향상됩니다.
압축된 텍스트 인코더와 FP16 VAE를 포함할 경우, Apple Silicon 기기에서의 배포 페이로드는 1비트 Bonsai Image 4B의 경우 3.42 GB, 삼진법 Bonsai Image 4B의 경우 3.88 GB입니다. 비교를 위해, 전체 정밀도 FLUX.2 Klein 4B는 15.97 GB의 배포 페이로드를 필요로 합니다.
런타임 시 프롬프트 인코딩이 완료된 후에는 텍스트 인코더가 오프로드되므로 평균 메모리 사용량은 전체 페이로드보다 적습니다. 512x512 이미지를 생성할 때 평균 활성 메모리는 이진 및 삼진 모델의 경우 각각 1.5 GB 및 1.96 GB로, 기존 FLUX.2 Klein 4B의 11.74 GB와 비교해 각각 7.8배, 6.0배 감소했습니다.
1024x1024 이미지의 경우, 평균 활성 메모리는 이진 및 삼진 모델에서 각각 1.95 GB 및 2.38 GB로, 기존 FLUX.2 Klein 4B의 14.39 GB와 비교해 각각 7.4배, 6.0배 감소했습니다.
이러한 메모리 공간의 감소는 모델이 실행될 수 있는 환경을 완전히 바꿔놓았습니다. 당사의 배포 스택은 Apple 실리콘이 탑재된 아이폰, 아이패드, 맥과 CUDA GPU를 지원하며, Apple 하드웨어에서는 MLX 저비트 경로를, CUDA에서는 Gemlite 저비트 GEMM 커널을 사용합니다.
아이폰 17 프로 맥스(iPhone 17 Pro Max)에서는 전체 정밀도 FLUX.2 Klein 4B 파이프라인이 기기의 메모리 예산에 맞지 않지만, 두 가지 Bonsai 변형 모두 원활하게 구동됩니다.