메뉴

#임베딩최적화

HN
Hacker News 3일 전
IMP 8

8달러 마이크로컨트롤러에서 구동하는 28.9M LLM

구글 Gemma 모델에서 도입된 '층별 임베딩(PLE)' 기법을 활용해, 파라미터 대부분을 느린 플래시 메모리에 저장하고 연산에 필요한 최소한의 데이터만 빠른 메모리로 불러와 초소형 칩에서 구동하는 기술입니다. 이를 통해 외부 서버 연결 없이 $8짜리 ESP32-S3 칩 내장 메모리만으로 28.9M(약 2900만 개) 파라미터의 언어모델을 구동하는 놀라운 성과를 보여줍니다. 엣지 디바이스의 극단적인 메모리 제약을 극복한 하드웨어 최적화 및 경량화 연구로서 엣지 AI(Edge AI) 분야에 중요한 의미를 갖습니다.

엣지AI 모델경량화 마이크로컨트롤러