HN
Hacker News • 23일 전
IMP 8
WebLLM: 브라우저 내 고성능 LLM 추론 엔진
WebLLM은 서버 없이 웹 브라우저 안에서 WebGPU 하드웨어 가속을 통해 대규모 언어 모델(LLM) 추론을 직접 실행할 수 있는 오픈소스 엔진입니다. OpenAI API와 완전 호환되어 스트리밍, JSON 모드 등을 로컬에서 사용할 수 있으며, Llama 3, Phi 3, Gemma, Mistral, Qwen2 등 다양한 모델을 지원합니다. 프라이버시 보호와 GPU 가속을 동시에 누릴 수 있어 브라우저 기반 AI 어시스턴트 개발에 중요한 프로젝트입니다.
웹브라우저 온디바이스AI WebGPU