메뉴

#로컬 추론

HN
Hacker News • 4일 전
IMP 7

프론티어 AI를 내 하드웨어에서 직접 실행하기

한 대학 AI 연구실 리더가 '연구의 미래는 GPU를 가장 많이 보유한 곳의 것이 아니라 오히려 자원이 제한적인 학계의 것'이라고 주장하며, 연구의 단위가 개별 논문에서 '생태계'로 변화했다고 말합니다. 이에 따라 자신의 연구실이 프론티어 수준의 자율 연구, 로컬 실행 모델, 도메인별 강화학습 환경 구축 방법 등을 오픈소스로 공개하는 '오픈소스 위크'를 진행한다고 발표했습니다. GPU 몇 대나 맥북만으로도 누구나 최고 수준의 AI 도구를 무료로 쓸 수 있게 만들겠다는 것이 핵심 메시지입니다.

오픈소스 자율 연구 학계 AI
HN
Hacker News • 17일 전
IMP 7

데저트 앤트 랩스, 온디바이스에서 구동되는 초고속 로컬 AI 모델 공개

유럽의 AI 연구소 데저트 앤트 랩스(Desert Ant Labs)가 오디오·비전·텍스트용 소형 전문 모델 18종을 공개했습니다. 모든 모델은 기기에서 직접 실행되어 밀리초 단위로 응답하고 운영 비용이 없으며, 월 10만 대의 활성 기기까지 무료로 제공됩니다. 클라우드 API 비용과 프라이버시 문제를 해결하는 온디바이스 AI 접근법으로, 기존 클라우드 모델 대비 최대 10배 빠르고 에너지 소모도 크게 적습니다.

온디바이스 AI 소형 모델 로컬 추론
HN
Hacker News • 17일 전
IMP 7

OUI-1: 세계 최초의 생성형 UI 모델

OUI-1은 DiffusionGemma를 파인튜닝한 오픈 웨이트 모델로, openui-lang으로 UI를 생성하며 소비자용 GPU(RTX 5090, FP8)에서 실행 가능합니다. 베이스 모델의 Generative UI 벤치마크 13.0%에서 LoRA 파인튜닝만으로 28.8%까지 향상시켰으나, 스키마 오류와 와이어링 오류가 시소처럼 반대로 움직이는 트레이드오프에 직면했습니다. 에이전트 기반 인터페이스의 미래를 향해 로컬 하드웨어에서 1초 미만으로 신뢰할 수 있는 UI를 생성하는 것이 목표입니다.

생성형 UI DiffusionGemma 오픈 웨이트
LL
r/LocalLLaMA • 155일 전
IMP 9

단일 RTX 3090으로 85 TPS·12만5천 컨텍스트 구현

알리바바의 Qwen3.6-27B 모델이 출시된 지 하루 만에, 단일 소비자용 그래픽 카드(RTX 3090 24GB)에서 데이터센터급 추론 속도(85 TPS)와 12만 5천 토큰의 컨텍스트, 그리고 비전(Vision) 기능을 구현한 오픈소스 스택이 등장했습니다. 이는 기존 API 의존 없이도 GPT급 속도와 개인정보 보호, 무료 추론 비용을 모두 누릴 수 있게 되었음을 의미합니다. 저자는 vLLM의 버그 패치 4개와 최적화를 통해 이론적으로 불가능해 보이던 하드웨어 한계를 극복한 구체적 과정을 공유합니다.

로컬 추론 오픈소스 LLM vLLM
HN
Hacker News • 164일 전
IMP 9

구글 제마 4, 아이폰에서 오프라인 완벽 구동

구글의 오픈소스 AI 모델인 'Gemma 4'가 아이폰 내 GPU를 활용해 네트워크 연결 없이도 완벽하게 오프라인 구동됩니다. 단순한 텍스트 처리를 넘어 이미지 인식, 음성 대화, 확장 가능한 스킬(Skills) 프레임워크를 지원하며, 특히 엔터프라이즈 환경에서 데이터 프라이버시가 필수적인 의료 및 산업 현장에 실질적인 솔루션을 제공한다는 점에서 매우 중요합니다.

온디바이스 AI 구글 제마 로컬 추론
HN
Hacker News • 165일 전
IMP 8

AMD, 온디바이스 로컬 구동 AI 에이전트 프레임워크 공개

AMD가 자체 하드웨어(NPU, GPU)에 최적화된 오픈소스 AI 에이전트 프레임워크 'GAIA'를 공개했습니다. 이 프레임워크는 파이썬과 C++를 모두 지원하며, 클라우드나 외부 API 키 없이도 데이터를 기기 내에 머물게 하여 완벽한 프라이버시를 보장합니다. 개발자는 단 두 번의 명령어만으로 오프라인 문서 질의응답, 음성 인식 및 생성, 코드 작성, 사용자 에이전트 구축 등을 로컬 환경에서 구현할 수 있습니다.

온디바이스 AI AMD AI 에이전트
LL
r/LocalLLaMA • 167일 전
IMP 8

미니맥스(m2.7) 맥 전용 모델, 63GB는 88% 89GB는 95%

Mac 전용 MiniMax m2.7 양자화 모델 두 종이 공개되었습니다. 63GB 버전은 MMLU 88%, 89GB 버전은 95%를 기록하며 성능을 입증했습니다. 속도 역시 M5 Max 기준 초당 약 50토큰, 프롬프트 처리 400으로 최상위 클로드 모델(Sonnet 4.5)에 근접하는 로컬 구동 성능을 보여줍니다.

MiniMax 양자화 로컬 추론