메뉴

#경량화

TC
TechCrunch AI • 8일 전
IMP 7

PrismML, 초소형 LLM으로 AI 사용 방식 바꾸려 한다

칼텍(Caltech) 연구진이 창업한 PrismML은 'Bonsai 2 27B'를 공개하며 알리바바 Qwen3.8 27B를 5.9GB로 압축, 원본 대비 98%의 벤치마크 성능을 유지하는 추론 모델을 PC와 스마트폰에서 구동 가능하게 만들었다. 3진(ternary) 가중치 기법으로 모델 크기를 9~10배 줄인 이 기술은 온디바이스 AI의 무료·프라이빗 실행을 가능하게 할 수 있어 업계 판도를 바꿀 잠재력이 있다.

압축 기술 온디바이스 AI 경량화
HN
Hacker News • 57일 전
IMP 7

1975년산 8비트 6502 프로세서에서 구동하는 자회귀 언어모델

현대의 머신러닝 기술을 1975년형 8비트 6502 프로세서(RAM 32KB)에 탑재하여 자회귀 언어모델을 구동시킨 흥미로운 프로젝트입니다. 가중치 양자화에 CPU 연산에 유리한 BitNet 구조를 적용하고, 코드를 극한으로 최적화하여 구형 하드웨어에서도 AI 모델의 텍스트 생성이 가능함을 증명했습니다. 제한된 하드웨어 환경에서 모델을 경량화하고 최적화하는 실용적인 접근법을 보여줍니다.

언어모델 경량화 비트넷
TD
The Decoder • 149일 전
IMP 8

텐센트 오프라인 AI 번역 모델 공개

텐센트가 구글 번역보다 뛰어난 성능을 발휘하면서도 스마트폰에서 완벽하게 오프라인으로 구동되는 초소형 AI 번역 모델을 오픈소스로 공개했습니다. 극단적인 압축 기술(1.25비트 양자화)을 통해 3.3GB 크기의 모델을 440MB로 줄이면서도 성능 저하 없이 상용 서비스나 더 큰 모델들과 맞먹는 번역 품질을 달성했습니다.

번역 텐센트 오픈소스
LL
r/LocalLLaMA • 156일 전
IMP 6

언슬로스, 동적 GGUF 및 양자화 2.0 버전 공개

AI 모델 경량화 및 파인튜닝을 돕는 Unsloth가 'Dynamic GGUF + Quants'의 새로운 2.0 버전을 발표했습니다. 이번 업데이트는 업계 최고 수준(SOTA)의 양자화 성능과 향상된 정확도를 제공하는 것이 특징입니다. 총 88개의 모델 파일이 추가되었으며, 로컬 환경에서 대규모 언어 모델을 효율적으로 구동하려는 실무자들에게 매우 유용한 업데이트입니다.

언슬로스 양자화 경량화