메뉴

#양자화(Quantization)

HN
Hacker News • 46일 전
IMP 8

온디바이스 AI 'Needle2': 14MB 초소형 모델 공개

스마트폰, 웨어러블, 로봇 등 200달러 미만의 저사양 기기에서 초고속으로 구동되는 14MB 크기의 온디바이스 에이전트 AI 모델이 공개되었습니다. 모델 자체를 극도로 가볍게 설계하여 기기 제어와 데이터 추출에 특화되었으며, 클라우드 연결 없이도 완벽한 프라이버시와 즉각적인 응답을 제공하는 것이 핵심입니다.

온디바이스 AI 소형 언어 모델(SLM) 양자화(Quantization)
LL
r/LocalLLaMA • 151일 전
IMP 7

Qwen 3.6 27B 양자화별 평가: BF16 vs Q4_K_M

오픈소스 모델인 Qwen 3.6 27B의 세 가지 포맷(BF16, Q4_K_M, Q8_0)에 대한 벤치마크 결과가 공유되었습니다. 로컬 환경에서는 BF16과 비교해 성능은 근소하게 저하되면서도 메모리와 용량을 절반 이상 아낄 수 있는 'Q4_K_M' 포맷이 가장 효율적인 선택지로 평가되었습니다. 최고의 성능을 원한다면 여전히 BF16이 최고이며, 코드 생성 작업이 많지 않은 일반적인 로컬 배포에는 Q4_K_M을 추천하고 있습니다.

오픈소스 모델 양자화(Quantization) 벤치마크