이제 로컬 모델도 쓸 만해졌다
최근 공개된 오픈소스 AI 모델들을 개인 PC에서 직접 구동하는 환경이 비약적으로 발전하여, 코딩 등의 실무 작업에서 유의미한 결과를 내고 있습니다. 저자는 최신 Gemma 4 모델을 활용해 클라우드 API 모델의 75% 수준의 성능과 속도를 보여주는 에이전틱 코딩(agentic coding)을 로컬로 성공적으로 수행하고 있다고 강조합니다. 이는 고성능 AI를 로컬 환경에서 자율적으로 활용할 수 있는 새로운 이정표를 제시한다는 점에서 매우 중요합니다.
이제 로컬 모델도 쓸 만해졌다 (2026년 6월 15일)
로컬 모델이 처음 나왔을 때부터 계속 사용해 왔는데, 드디어 놀라울 정도로 쓸 만해졌습니다. 저는 64GB RAM과 1TB 저장 공간이 있는 2022년형 M2 Mac을 사용하고 있습니다. 다양한 시스템 환경(raw llama.cpp with Open WebUI, llama-cpp-python, Ollama, llamafiles, LM Studio 등)에서 Mistral 7B, Gemma 3, OpenAI OSS-20B, Qwen 3 MOE, 그리고 Qwen 2.5 Coder 같은 다양한 Qwen 변형 모델들을 사용해 왔습니다.
그렇다면 지금 로컬 모델의 수준은 어느 정도일까요? 초창기 모델들은 속도가 느리고 사용하기 어려웠으며, 대부분의 프로그래밍 작업에서 그다지 정확하지 않았습니다. 로컬 모델이 크게 뒤처져 있다는 평가는 적어도 GPT-OSS가 출시되기 전까지는 대체로 사실이었습니다. 제가 '모델이 충분히 좋은가?'를 판단하는 구체적이고 과학적인 기준은 없지만, 'API 기반 모델과 교차 검사해야 하는가?'라는 개인적인 직관을 기준으로 삼았을 때, GPT-OSS는 제가 그 교차 검사를 훨씬 덜 하게 만든 최초의 모델이었습니다.
결과적으로 저는 최신 정보가 필요 없는 개발 관련 질문에 대해 빠르고 맞춤화된 Google처럼 로컬 모델을 주로 사용했습니다. 하지만 최근 Google의 Gemma 4 제품군이 출시되면서 드디어 로컬 환경에서 에이전틱 코딩(agentic coding)을 수행할 수 있게 되었습니다. 이 작업 루프는 최신 API 모델 대비 약 75% 수준의 정확도와 속도를 보여주는데, 이는 정말 놀라운 일입니다. 지금까지 저는 LM Studio에 구현된 gemma-4-26b-a4b를 기본 로컬 모델로 사용하고 있습니다.
지금까지 로컬 환경을 사용하여 다음과 같은 작업들을 수행했습니다: 주피터 노트북 형태의 Python 스크립트를 5~6개의 모듈로 구성된 저장소(repo)로 리팩토링하고, 제네릭을 위한 올바른 타입 힌트(type hints)를 사용하도록 해당 모듈을 린트(lint)했습니다(최신 API 모델들은 이제 이 작업을 자동으로 처리하지만 항상 그런 것은 아닙니다). 또한, 블로그 포스트를 교정하고, 단위 테스트를 작성하고, 추천 시스템을 위한 투타워 모델(two-tower model)을 구축하는 저장소를 부트스트래핑(초기 설정)하여 빈 화면에서 에이전트가 어떻게 작동하는지 확인해 보았습니다. 에이전트가 생성한 코드는 꽤 기본적이었지만, 작년에는 가능할 것이라고 생각지도 못했던 수준이었습니다. 참고로 모든 에이전트 워크플로우는 실행 권한이 제한된 Docker 컨테이너에서 실행되기 때문에 환경이 통제됩니다.
저는 또한 Arxiv 논문에서 트렌딩 주제를 보여주는 앱을 개발하고 있습니다. 호기심에 Pi에게 과거 LM Studio 세션 로그를 분석하여 제가 LM Studio로 무엇을 했는지 파악해 보라고 했습니다.
놀랍지 않게도 제가 Rijksearch를 개발하고 있었기 때문에 대부분 관련 작업들이었습니다. 이 작업들 중 획기적인 것은 없습니다 (다시 말하지만, 개인화된 구글/문서 조회가 많습니다). 이런 작업들을 수행하면 GPU와 RAM이 풀가동되며 K-V 캐시가 64GB RAM까지 증가합니다. 하지만 저에게 있어 더 큰 의미는, 이렇게 단순한 작업조차 불과 6개월 전만 해도 로컬 모델에게는 불가능한 일이었다는 점입니다.
gemma-4-12b-qat가 방금 출시되었지만, 이미 그 크기 대비 성능에 깊은 인상을 받았습니다. 이 모델 아키텍처 자체는 매우 흥미로우며, "성능과 가격에 제약이 있다면 우리는 어떤 아키텍처적 트레이드오프를 해야 하는가?"와 같은 흥미로운 질문을 던집니다. 이는 지금까지의 맹목적인 토큰 경쟁에서는 정말 제기되지 않았던 질문입니다.
오늘날 로컬에서 에이전트 모델 구동하기
하지만 제 말만 맹신하지 마시고 직접 사용해 보세요! 로컬 에이전트 흐름을 실행해 보려면 로컬 모델 추론 엔진, 에이전트 하네스(harness), 그리고 로컬 모델 아티팩트가 필요합니다. 추론 엔진을 통해 다운로드한 모델 아티팩트를 제공하고, 에이전트 하네스가 해당 로컬 추론 엔드포인트를 가리키도록 설정해야 합니다.
제 현재 로컬 설정에서는 에이전트 하네스로 Pi를 사용하고 추론 서버로 LM Studio를 사용하고 있습니다. 비록 llama.cpp를 직접 사용하는 것이 더 빠를 수 있지만 말입니다(이는 향후 실험 방향이 될 수 있습니다). Pi와 LM Studio를 사용하여 에이전틱 코딩을 설정하는 것은 해당 가이드를 따라가기 매우 쉬웠지만, 설정을 약간 수정하기도 했습니다.
모델: 게시물에서는 Gemma 26B A4B를 추천하지만, gemma-4-12b-qat가 더 최신 모델이며...