메뉴

#로컬 AI

HN
Hacker News 5일 전
IMP 7

스크린파이프(YC S26): 화면 기록으로 AI 에이전트 강화하기

사용자의 PC 화면과 오디오를 로컬에 24시간 기록하여 AI 에이전트에게 '검색 가능한 기억'을 제공하는 오픈소스 도구입니다. 이를 통해 반복 작업을 자동화하고 업무 프로세스(SOP)를 쉽게 문서화할 수 있습니다. AI가 사용자의 업무 맥락을 완벽하게 이해하고 진정한 자율성을 가질 수 있도록 돕는 핵심 솔루션입니다.

AI 에이전트 로컬 AI RAG
HN
Hacker News 6일 전
IMP 8

프레임워크 데스크탑, 192GB 메모리 탑재 새 옵션 공개

모듈형 PC로 유명한 프레임워크가 AMD 라이젠 AI Max+ PRO 495 프로세서와 192GB의 통합 메모리를 탑재한 고성능 미니 PC인 '프레임워크 데스크탑'의 새로운 구성을 발표했습니다. 4.5L의 초소형 폼팩터에도 불구하고 131 TOPS의 AI 연산 능력과 273GB/s의 메모리 대역폭을 제공하여, 무거운 로컬 AI 모델 구동이나 고사양 게임에 최적화된 것이 특징입니다. 방대한 메모리와 뛰어난 연산 성능을 갖춰 실무자와 개발자들을 위한 강력한 데스크탑 컴퓨팅 환경을 제공할 것으로 기대됩니다.

하드웨어 로컬 AI 프레임워크
MP
MarkTechPost 9일 전
IMP 6

개발자, 오픈소스 모델 미세조정으로 657MB 초소형 로컬 추론 모델 출시

한 커뮤니티 개발자가 OpenBMB의 'MiniCPM5-1B' 모델을 클로드(Claude)의 추론 과정 데이터로 미세조정(fine-tuning)하여 완전히 로컬에서 구동되는 657MB 크기의 초소형 추론 모델을 구축했습니다. 이 모델은 128K의 긴 문맥 처리와 추론 과정 시각화를 지원하여, 제한된 환경에서도 고성능 AI 모델을 오프라인으로 활용할 수 있다는 점에서 의미가 있습니다.

로컬 AI 미세조정 초소형 모델
MP
MarkTechPost 14일 전
IMP 8

노트북·스마트폰 구동 프리즘ML '분사이 27B' 공개

PrismML이 기존 Qwen3.6-27B 모델의 구조를 유지하면서도 가중치를 1.71비트 및 1비트로 경량화한 'Bonsai 27B'를 공개했습니다. 이를 통해 270억 개 매개변수(Parameters)를 가진 대규모 언어 모델을 노트북이나 스마트폰 같은 일상적인 기기에서 실행할 수 있게 되었습니다. Apache 2.0 라이선스로 공개되어 누구나 자유롭게 활용할 수 있다는 것이 특징입니다.

경량화 모델 양자화 오픈소스
TC
TechCrunch AI 15일 전
IMP 6

배우자 살인을 도와줄 AI가 필요할까?

최근 거대 기술 기업들이 주도하는 AI 정책 및 안전 규제(AI Alignment)에 반대하며, 철저히 사용자의 이익에만 부합하는 개인화 로컬 AI를 지지하는 조지 홋츠(Comma AI 창립자)의 논란적인 발언을 다룬 기사입니다. 그는 AI의 무제한적인 자유를 강조하며 범죄 악용 가능성을 긍정했지만, 기자는 다수의 이익과 사회적 책임을 고려한 집단적 AI 통제의 필요성을 강조하고 있습니다.

AI 정렬 로컬 AI 조지 홋츠
TC
TechCrunch AI 20일 전
IMP 8

오픈소스 AI 도구 '올라마(Ollama)', 6500만 달러 유치

오픈소스 AI 개발 도구인 올라마(Ollama)가 시리즈 B 투자로 6500만 달러를 유치하며, 월 890만 명 이상의 개발자를 확보하는 성과를 거두었습니다. 이 도구는 도커(Docker) 개발진이 주도하여 복잡한 오픈소스 AI 모델을 개인 PC에서도 쉽고 빠르게 실행할 수 있게 만들어 줍니다. 최근 에이전트 기반 작업과 코딩에 유용한 오픈 가중치 모델이 각광받으면서, 기업들이 비용 효율적인 올라마의 솔루션으로 빠르게 전환하고 있어 그 파급력이 매우 중요합니다.

오픈소스 올라마 로컬 AI
HN
Hacker News 21일 전
IMP 7

로컬 기반 AI 사무 보조, Rowboat

Rowboat는 Claude Desktop의 오픈소스 대안으로, 사용자의 업무 데이터를 로컬 기기의 거대한 지식 그래프(Markdown 형식)로 구축하여 작업하는 AI 동료입니다. 내장된 이메일 클라이언트, 브라우저, 코드 모드 등을 통해 AI와 협업하며 백그라운드 에이전트를 활용한 자동화까지 지원합니다. 모든 데이터가 로컬에 저장되어 프라이버시가 보장되며, Ollama를 통한 로컬 모델부터 다양한 외부 API 모델까지 자유롭게 연동할 수 있다는 것이 큰 장점입니다.

로컬 AI 지식 그래프 오픈소스
HN
Hacker News 22일 전
IMP 7

AMD 라이젠 AI 할로, 4천 달러대 AI 개발 미니 PC 공개

AMD가 젠5 기반 라이젠 AI Max+ 395 프로세서를 탑재한 초소형 미니 PC 'AI 할로'를 3,999달러에 출시했습니다. 128GB 통합 메모리와 2TB SSD를 갖춰 로컬 환경에서 대규모 AI 모델을 구동하고 개발하는 데 최적화된 것이 특징입니다. 이는 개발자와 연구자들에게 강력하고 휴대성 뛰어난 데스크톱 AI 워크스테이션을 제공한다는 점에서 의미가 있습니다.

하드웨어 AMD 로컬 AI
MP
MarkTechPost 26일 전
IMP 7

로컬 우선 오픈소스 AI 브라우저 에이전트, 웹브레인(WebBrain) 소개

웹브레인(WebBrain)은 크롬(Chrome)과 파이어폭스(Firefox)에서 웹페이지를 읽고 데이터를 추출하는 등 복잡한 작업을 자동화해주는 오픈소스 AI 브라우저 에이전트입니다. llama.cpp나 Ollama 같은 로컬 모델을 지원하여 민감한 데이터의 외부 유출 없이 안전하게 작업을 수행할 수 있으며, 클라우드 API 연결도 유연하게 지원한다는 것이 가장 큰 특징입니다.

AI 에이전트 웹 자동화 로컬 AI
HN
Hacker News 26일 전
IMP 8

클로드 영상 처리 도구 'claude-real-video' 공개

대부분의 LLM이 영상을 직접 보지 못하고 텍스트나 고정된 프레임만 읽는 한계를 극복하는 오픈소스 도구입니다. 이 도구는 로컬 환경에서 영상의 씬 전환을 감지해 의미 있는 프레임과 오디오 텍스트만 추출하므로, 어떤 LLM이든 영상을 완벽하게 이해할 수 있게 해줍니다. 클라우드 업로드 없이 로컬에서 처리되어 비용과 보안 측면에서 매우 유용합니다.

오픈소스 LLM 도구 비디오 AI
GB
Google AI Blog 27일 전
IMP 9

2026년 6월 구글 최신 AI 업데이트 총정리

2026년 6월, 구글은 로컬 환경에서 구동되는 오픈 모델 Gemma 4 12B와 새로운 안드로이드 17, 그리고 PC 및 모바일에서 작동하는 Gemini 3.5 Flash 등 다양한 AI 업데이트를 발표했습니다. 특히 개발자와 일반 사용자를 위한 멀티태스킹, 자동화, 그리고 향상된 보안 기능들이 대거 추가되었습니다. 이번 업데이트는 일상과 업무 환경 전반에 걸쳐 AI가 직관적인 파트너로 자연스럽게 통합되는 것을 목표로 합니다.

구글 AI 안드로이드 17 젬미니 3.5
HN
Hacker News 35일 전
IMP 7

완전히 브라우저에서 실행되는 AI 에이전트 'peerd'

peerd는 Chrome/Firefox 확장 프로그램 형태로, 클라우드나 백엔드 서버 없이 사용자의 브라우저 내부에서 직접 실행되는 최초의 네이티브 AI 에이전트 하네스입니다. 기존 탭과 세션을 그대로 활용해 웹 페이지를 제어하고, WebAssembly 기반 샌드박스에서 가상 머신을 구동하는 등 강력한 컴퓨팅 환경을 제공합니다. 모든 작업은 브라우저의 기존 보안 모델(V8, WebCrypto 등)을 활용하여 API 키와 데이터를 안전하게 보호하면서 에이전트를 로컬에서 실행할 수 있다는 점에서 매우 중요합니다.

오픈소스 AI 에이전트 브라우저 확장프로그램
HN
Hacker News 44일 전
IMP 8

클라우드 LLM 골드러시의 종말

애플이 WWDC에서 발표한 로컬 기반 AI 전략은 클라우드 LLM(대형 언어 모델)에 대한 맹목적인 의존이 끝나가고 있음을 시사합니다. LLM은 본질적으로 확률적 시스템이므로 정확성이 필수적인 자동화 인프라보다는 소프트웨어 개발, 학습, 번역 등 인간의 작업을 증폭시키는 도구로 활용하는 것이 실용적입니다. AI의 실질적인 가치는 단순히 AGI를 향한 기술적 경쟁이나 월간 구독 모델이 아니라, 온디바이스에서 작동하는 실용적이고 즉각적인 워크플로우 최적화에 있습니다.

로컬 AI LLM 온디바이스 AI
HN
Hacker News 46일 전
IMP 7

macOS에서 로컬 코딩 에이전트 구축하기

인터넷 연결 문제에 대비하고자 macOS 환경에서 완전히 로컬로 구동되는 코딩 에이전트 환경을 구축한 후기를 공유합니다. Apple Silicon(M1 Max) 환경에서 llama.cpp와 Gemma 4 모델, 그리고 다중 토큰 예측(MTP) 기술을 활용해 실사용 가능한 수준의 높은 추론 속도를 달성했습니다. 특히 Apple 전용 프레임워크인 MLX보다 llama.cpp와 MTP 조합이 더 빠른 속도를 보여준다는 흥미로운 벤치마크 결과를 포함하고 있습니다.

로컬 AI 코딩 에이전트 Gemma 4
TD
The Decoder 55일 전
IMP 8

구글 제미나 4 12B, 16GB 램으로 노트북에서 구동

구글 딥마인드가 일반 노트북 환경에서도 원활하게 작동하는 멀티모달 오픈소스 AI 모델인 Gemma 4 12B를 공개했습니다. 이 모델은 텍스트, 이미지, 오디오를 별도의 인코더 없이 네이티브로 처리하며, 16GB RAM 환경에서도 26B(파라미터)급 모델과 맞먹는 성능을 발휘합니다. 음성 인식 및 코드 생성은 물론 수 분 길이의 비디오 분석까지 가능하여 로컬 환경에서의 AI 활용 가능성을 크게 확장했다는 점에서 실무자들에게 중요한 의미를 갖습니다.

구글 딥마인드 멀티모달 AI 오픈소스 모델
MP
MarkTechPost 55일 전
IMP 8

구글, 16GB 노트북 구동 가능한 오디오 내장형 멀티모달 모델 공개

구글 딥마인드가 인코더 없이도 기본 오디오(Audio) 처리가 가능한 새로운 멀티모달 AI 모델인 Gemma 4 12B를 공개했습니다. 이 모델은 16GB RAM을 탑재한 일반적인 노트북 환경에서도 원활하게 구동되는 가벼운 크기를 자랑합니다. 이는 개발자와 일반 사용자들이 로컬 환경에서 고성능 멀티모달 AI를 더욱 쉽게 활용할 수 있게 되었음을 의미합니다.

구글 딥마인드 Gemma 4 멀티모달 AI
HN
Hacker News 55일 전
IMP 9

인코더 없는 통합 멀티모달, 젬마 4 12B 공개

구글 딥마인드가 16GB VRAM 환경의 노트북에서도 원활히 구동되는 오픈소스 미드 사이즈 모델 'Gemma 4 12B'를 출시했습니다. 이 모델은 별도의 비전 및 오디오 인코더 없이 시각·청각 데이터를 직접 처리하는 통합 아키텍처를 채택하여 지연 시간을 최소화했습니다. 120억 파라미터의 가벼운 크기에도 불구하고 260억 파라미터 MoE 모델에 근접한 추론 성능을 제공하며, 에이전트 워크플로우 구축에 최적화된 것이 특징입니다.

오픈소스 멀티모달 로컬 AI
WR
Wired AI 56일 전
IMP 9

엔비디아 RTX Spark, PC 시장 판도를 바꿀 돌파구

엔비디아가 자체 Arm 기반 CPU(N1)와 RTX 그래픽, 최대 128GB 통합 메모리를 결합한 '슈퍼칩' 기반의 새로운 윈도우 기기인 RTX Spark를 발표했습니다. 이는 기존 미흡했던 윈도우 기반의 'AI PC' 한계를 극복하고, 로컬 환경에서 강력한 대형 언어 모델을 구동할 맥북 프로의 강력한 대안으로 주목받고 있습니다. 데이터센터에 이어 로컬 PC 시장까지 엔비디아의 AI 생태계(CUDA)가 확장된다는 점에서 AI 하드웨어 시장에 큰 변화를 예고합니다.

엔비디아 AI PC RTX Spark
MP
MarkTechPost 57일 전
IMP 7

메모리 OS: 에이전트용 6계층 오픈소스 메모리 스택

이 오픈소스 프로젝트는 헤르메스 에이전트(Hermes Agent) 기반으로 6개 계층의 메모리 스택을 구현하여, AI가 로컬 환경에서 영구적(Permanent)으로 데이터를 기억할 수 있게 합니다. 게이트 검색(Gated Retrieval)과 위키(Wiki) 시스템을 통해 에이전트의 장기 기억 및 문맥 유지 능력을 획기적으로 향상시켰습니다. 개발자들은 이를 통해 상태 기반의 지능형 에이전트를 보다 쉽게 구축할 수 있게 되었습니다.

오픈소스 AI 에이전트 메모리 스택
TD
The Decoder 58일 전
IMP 9

엔비디아 RTX 스파크, 윈도우 로컬 AI 시대 열다

엔비디아가 최대 128GB 통합 메모리와 1페타플롭 FP4 AI 연산 능력을 갖춘 'RTX 스파크' 칩을 발표하며 윈도우 기기에서 대규모 AI 에이전트를 로컬로 실행할 수 있는 기반을 마련했습니다. 이는 애플 실리콘과 퀄컴 스냅드래곤에 대응하는 그레이스 블랙웰 아키텍처 기반의 ARM 윈도우 전용 칩으로, 에이전트 보안 및 격리를 위한 '오픈쉘 런타임(OpenShell Runtime)' 등 소프트웨어 스택도 함께 제공됩니다. ASUS, Dell, HP, Lenovo, Microsoft 등 주요 OEM업체의 관련 기기는 2026년 가을에 출시될 예정입니다.

엔비디아 RTX 스파크 AI 에이전트
HN
Hacker News 58일 전
IMP 6

오토노미스(Autonomy) – 셀프 호스팅 AI 워크스페이스

로컬 환경에서 완벽하게 동작하는 프라이버시 보호형 AI 워크스페이스입니다. 사용자가 직접 하드웨어와 데이터를 통제하며, 챗, 에이전트, 딥 리서치, 문서 편집 등 다양한 기능을 제공합니다. 기존 ChatGPT나 Claude의 UI 경험을 자체 호스팅 버전으로 재현하면서도, 개인정보 보호와 데이터 주권을 강조한 점이 특징입니다.

셀프 호스팅 로컬 AI 프라이버시
LL
r/LocalLLaMA 62일 전
IMP 5

역대급 근성으로 조립한 로컬 AI 서버

여러 개의 중고 서버 부품과 엔비디아 테슬라 V100 GPU 3장을 조합해 총 96GB의 VRAM을 갖춘 로컬 AI 서버 구축기입니다. 노트북용 램 어댑터 사용, 벽면 직결 팬 등 파격적인 수동 조립(일명 짬처리) 과정을 거쳤습니다. 대용량 로컬 AI 추론 환경을 최소 비용으로 구축하려는 실무자 및 하드웨어 마니아들에게 흥미로운 사례입니다.

로컬 AI 하드웨어 VRAM
HN
Hacker News 64일 전
IMP 8

외주 개발자와 로컬 AI가 프론티어 모델보다 저렴해지는 시점

최근 오픈AI, 구글, 앤스로픽 등 미국의 주요 AI 기업들이 폭발적인 토큰 소비 증가에 힘입어 API 가격을 대폭 인상하고 있습니다. 이에 따라 저비용 국가의 인간 엔지니어를 고용하고 DeepSeek과 같은 오픈소스 로컬 AI를 결합하는 방식이 프론티어 폐쇄형 모델을 사용하는 것보다 경제성이 높아질 것이라는 분석이 제기되었습니다. 이러한 구도는 결과적으로 최신 고성능 모델들의 가격 상한선을 설정하는 핵심적인 역할을 하게 될 것입니다.

가격 정책 오픈소스 모델 API 비용
LL
r/LocalLLaMA 64일 전
IMP 5

Qwen3.5 35B 비검열 모델 다양한 포맷 출시

알리바바의 오픈소스 모델 Qwen3.5 35B A3B를 기반으로 한 비검열(UnCensored) 커스텀 모델과 Native MTP(다음 토큰 예측)가 완벽히 보존된 버전이 공개되었습니다. 이 모델은 Safetensors, GGUF, NVFP4, GPTQ-Int4 등 다양한 형식과 양자화 포맷을 지원하여 로컬 환경에서의 활용성을 극대화한 것이 특징입니다.

오픈소스 모델 로컬 AI 양자화
LL
r/LocalLLaMA 64일 전
IMP 7

변호사의 로컬 AI 법률 문서 작성기: V100 클러스터 구축기

한 변호사가 V100 12개와 RTX 3090 등 총 16개의 GPU를 활용해 법률 문서 초안을 자동 작성하는 로컬 AI 시스템을 완성했습니다. 실험 결과 V100 환경에서는 일반적인 Dense 모델보다 MoE(Mixture of Experts) 모델이 압도적인 처리 속도를 보여주어 시스템 전체를 MoE 중심으로 재구성했습니다. 여러 로컬 모델이 각자의 역할을 나누어 수행하는 오케스트레이터 구조를 통해 고수준의 법률 문서를 빠르고 정확하게 생성해 내는 것이 이 프로젝트의 핵심입니다.

로컬 AI 법률 AI 자동화 오픈소스 LLM
LL
r/LocalLLaMA 65일 전
IMP 6

V100 환경에서 Qwen3.6 27B 초당 1,000토큰 생성 달성

NVIDIA V100 GPU 환경에서 Qwen3.6 27B 모델을 구동하여 최대 초당 1,000토큰(tps)의 생성 속도를 달성하는 실험 결과가 공유되었습니다. 다중 사용자 동시 처리(배치 128) 시에는 엄청난 속도를 보여주며, 단일 사용자 기준으로는 MTP(다중 토큰 예측) 없이도 초당 80토큰의 생성 속도와 초당 3,000토큰의 처리 속도를 기록했습니다. 이는 구형 GPU인 V100으로도 대규모 모델을 상당히 쾌적하게 구동할 수 있음을 보여주는 의미 있는 벤치마크입니다.

오픈소스 모델 벤치마크 GPU 인퍼런스
LL
r/LocalLLaMA 72일 전
IMP 7

4B 소형 모델로 벤치마크 87% 달성한 코딩 에이전트 제작기

GPT나 Claude 같은 대형 모델이 아닌, 로컬에서 구동되는 4B(40억) 파라미터 소형 모델에 최적화된 새로운 코딩 에이전트 'SmallCode'가 등장했습니다. 반복적인 코드 개선 루프, 복합 도구(Compound tools) 사용, 토큰 예산 관리 등의 소프트웨어적 기법을 활용해 모델 크기의 한계를 극복하고 높은 작업 성공률을 달성한 것이 핵심입니다. 실무 개발자들은 오프라인 환경이나 보안이 중요한 환경에서 가벼운 오픈소스 도구를 통해 효율적으로 AI 코딩 보조를 받을 수 있다는 점에 주목할 만합니다.

로컬 AI 코딩 에이전트 오픈소스
LL
r/LocalLLaMA 72일 전
IMP 8

M5 vs DGX Spark vs 스트릭스 할로 vs RTX 6000 벤치마크

새로운 애플 M5 맥북 프로, 엔비디아 DGX Spark, AMD 스트릭스 할로(Strix Halo), RTX 6000 등 다양한 하드웨어를 대상으로 로컬 AI 성능 및 발열 비교 테스트 결과가 공유되었습니다. M5는 동급 대비 압도적인 메모리 대역폭을 바탕으로 DGX Spark를 가성비 측면에서 완전히 압도했으며, 맥북은 예상과 달리 장시간 고부하 테스트에서도 80도대의 준수한 발열을 유지했습니다. 단, AI 연산 시 팬 소음은 일반적인 게이밍 노트북처럼 커진다는 점과 각 하드웨어의 원시 성능 데이터가 공개되었다는 점이 실무자들에게 유용한 인사이트를 제공합니다.

하드웨어 벤치마크 애플 실리콘 로컬 AI
LL
r/LocalLLaMA 73일 전
IMP 8

코세어 AI 워크스테이션 300: 128GB 통합 메모리 탑재

코세어가 128GB 통합 메모리를 장착한 AI 전용 데스크톱 PC를 약 277만 원에 출시했습니다. 최상위 AMD 라이젠 AI MAX+ 395 칩셋을 탑재하여 대규모 언어 모델(LLM) 구동을 위한 96GB VRAM을 지원하며, 이는 로컬 AI 환경에서 메모리 병목 현상을 해결하는 중요한 옵션입니다.

코세어 AMD 라이젠 AI 워크스테이션
LL
r/LocalLLaMA 77일 전
IMP 7

순정 게임보이 컬러에서 트랜스포머 AI 로컬 실행 성공

스마트폰, PC, Wi-Fi, 클라우드 연결 없이 순정 게임보이 컬러(GBC) 기기 내에서만 트랜스포머 언어 모델을 실행하는 데 성공한 프로젝트입니다. 부동소수점 연산 대신 고정소수점(INT8) 방식으로 변환된 가중치를 활용하며, KV 캐시는 카트리지 SRAM에 저장하여 작은 RAM 용량을 극복했습니다. 속도가 극도로 느리고 수학적 양자화로 인해 출력은 알아보기 힘들지만, 외부 서버 없이 엣지 디바이스에서 AI 모델을 순수 구동해냈다는 점에서 기술적 의의가 큽니다.

엣지 AI 게임보이 로컬 AI