메뉴

#엣지AI

HN
Hacker News 3일 전
IMP 8

8달러 마이크로컨트롤러에서 구동하는 28.9M LLM

구글 Gemma 모델에서 도입된 '층별 임베딩(PLE)' 기법을 활용해, 파라미터 대부분을 느린 플래시 메모리에 저장하고 연산에 필요한 최소한의 데이터만 빠른 메모리로 불러와 초소형 칩에서 구동하는 기술입니다. 이를 통해 외부 서버 연결 없이 $8짜리 ESP32-S3 칩 내장 메모리만으로 28.9M(약 2900만 개) 파라미터의 언어모델을 구동하는 놀라운 성과를 보여줍니다. 엣지 디바이스의 극단적인 메모리 제약을 극복한 하드웨어 최적화 및 경량화 연구로서 엣지 AI(Edge AI) 분야에 중요한 의미를 갖습니다.

엣지AI 모델경량화 마이크로컨트롤러
MP
MarkTechPost 8일 전
IMP 8

엔비디아, 기기 내 추론·제어 가능 40억 매개변수 '코스모스 3 엣지' 공개

엔비디아가 로봇과 비전 AI가 주변 환경을 이해하고 실시간으로 추론하여 기기 자체에서 동작을 생성할 수 있는 40억 매개변수(4B)의 오픈 월드 모델 '코스모스 3 엣지(Cosmos 3 Edge)'를 출시했습니다. 이번 릴리스는 로봇 공학과 자율 시스템 분야에서 네트워크 지연 없이 즉각적인 반응과 로컬 제어가 가능해진다는 점에서 매우 중요합니다.

엔비디아 로보틱스 엣지AI
HN
Hacker News 77일 전
IMP 8

제미나이 도구 호출 기능, 2천6백만 파라미터 초소형 모델로 증류

Cactus Compute 팀이 구글의 제미나이(Gemini) 모델의 툴 콜링(Tool Calling) 기능을 단 2천6백만(26M) 파라미터를 가진 'Simple Attention Network' 모델(Needle)로 경량화하여 깃허브에 공개했습니다. 이 모델은 파인튜닝 없이도 FunctionGemma-270m, Qwen-0.6B 등 기존 경쟁 모델들을 단일 툴 콜 성능에서 뛰어넘으며, 가벼운 웨이트 덕분에 로컬 PC 및 스마트워치, 안경 등 소비자 기기에서 초당 수천 토큰을 처리할 수 있는 실용성을 갖췄습니다.

소형언어모델(SLM) 오픈소스 모델경량화