메뉴

#LLM추론

HN
Hacker News • 23일 전
IMP 8

WebLLM: 브라우저 내 고성능 LLM 추론 엔진

WebLLM은 서버 없이 웹 브라우저 안에서 WebGPU 하드웨어 가속을 통해 대규모 언어 모델(LLM) 추론을 직접 실행할 수 있는 오픈소스 엔진입니다. OpenAI API와 완전 호환되어 스트리밍, JSON 모드 등을 로컬에서 사용할 수 있으며, Llama 3, Phi 3, Gemma, Mistral, Qwen2 등 다양한 모델을 지원합니다. 프라이버시 보호와 GPU 가속을 동시에 누릴 수 있어 브라우저 기반 AI 어시스턴트 개발에 중요한 프로젝트입니다.

웹브라우저 온디바이스AI WebGPU
TD
The Decoder • 94일 전
IMP 9

오픈AI, LLM 추론용 자체 칩 '할라피뇨' 최초 공개

오픈AI가 브로드컴과 협력하여 대규모 언어 모델(LLM) 추론에 최적화된 자체 반도체 '할라피뇨(Jalapeño)'를 발표했습니다. 소프트웨어를 넘어 칩부터 제품까지 전체 스택을 직접 통제하여 AI 모델 구동 비용을 절감하고 성능과 안정성을 극대화하려는 오픈AI의 첫 본격적인 하드웨어 도약입니다. 2026년 후반 대규모 배포가 예정되어 있으며, 마이크로소프트가 초기 물량의 40%를 구매할 것으로 전해집니다.

오픈AI 맞춤형반도체 브로드컴