최신 고성능 AI 모델을 로컬에서 구동하는 법
OpenAI나 Anthropic 같은 빅테크에 의존하지 않고, 로컬 환경에서 최고 수준(SOTA)의 AI 모델을 구동하기 위한 하드웨어 구성 및 세팅 가이드입니다. 약 2,000달러로 시작하는 중소형 구성부터 약 4만 달러의 다중 GPU 워크스테이션까지, 가격대별 권장 부품과 Docker 기반 실행 환경을 제공합니다. 특히 PCIe 스위치를 활용해 GPU 간 통신 병목을 해결한 점이 기술적으로 주목할 만합니다.
jamesob의 로컬에서 SOTA LLM 구동 가이드 참고: 이 README의 표를 제외한 어떤 내용도 AI가 작성하지 않았습니다.
주머니에 2,000달러가 넘쳐나는데 로컬에서 구동되는 최고 수준의 기계 지능을 원하시나요? 그렇다면 4만 달러는 어떤가요? Dario와 Altman(각각 Anthropic, OpenAI의 CEO) 때문에 속이 쓰리신다면(그래야 정상입니다), 계속 읽어보세요. 이 새로운 형태의 컴퓨팅을 로컬에서 어떻게 실행하는지 알아볼 테니까요.
이 리포지토리에서는 제가 로컬에서 SOTA 모델을 구동하기 위해 사용하는 하드웨어, 구매 이유, 잘 알려지지 않은 설정의 비결, 로컬에서 음성 인식(STT)을 구동하는 방법, 그리고 제가 유용하다고 생각하는 모델을 Docker 컨테이너 내에서 실행할 수 있는 즉시 실행 가능한 설정 등을 확인할 수 있습니다.
목차 섹션 TL;DR 얼마나 쓸 의향이 있으신가요? 2,000달러로 Qwen과 훌륭한 STT를 얻을 수 있습니다(꽤 괜찮죠!). 4만 달러라면 거의 Opus(Claude 3) 수준의 모델을 구동할 수 있습니다. 기본 시스템: 이전 세대 EPYC + 이베이에서 구한 DDR4로 5,600달러 GPU: RTX PRO 6000 4개, 384GB VRAM. 돈이 들어간 곳입니다. c-payne 스위치 하위 BOM: 독립적인 PCIe 스위칭을 통해 GPU가 피어 투 피어(P2P)로 통신 GPU 인클로저: 하루 종일 목공을 한 이야기 스위치 정상 작동시키기: BIOS 버스 분할(Bifurcation), 링크 속도, ASPM 커널 / GRUB 매개변수: iommu=off 또는 NCCL이 멈춤 현상, ACS 비활성화 P2P 트래픽을 스위치 패브릭 내부에 유지하기 GPU 전력 제한: 110V 회로에서 46,000달러짜리 실리콘 구동하기 결과: Gen4 라인 속도 27.5/50.4 GB/s, 1마이크로초 미만의 지연 시간 runners/: 즉시 실행 가능한 서빙 설정: GLM-5.2-594B - vLLM docker-compose, DCP4+MTP5, 240k 컨텍스트에서 약 80 t/s runners/stt: whisper-large-v3를 활용한 즉시 실행 가능한 음성 인식 설정 tools/ measure-gpu-speed.sh: P2P 대역폭/지연 시간 벤치마크 리소스: rtx6kpro 리포지토리, c-payne
나의 설정 저는 운이 좋게도(혹은 바보 같이도) 프로용 RTX 6000 4개를 더 저렴했을 때 구매했습니다. 요즘 RAM 가격이 너무 비싸지면서, 이 GPU를 호스팅하기 위해 이베이에서 부품을 구해 이전 세대 DDR4 시스템을 구축하기로 했습니다. 이를 통해 기본 시스템 비용은 합리적으로 유지하면서도 많은 VRAM을 확보할 수 있었습니다.
제가 한 또 다른 다소 특이한 작업은 PCIe 4.0 스위치(c-payne.com 제품)를 사용한 것입니다. 이를 통해 텐서 병렬 처리의 allreduce 단계에서 모든 데이터를 PCI 루트 컴플렉스를 통해 보낼 필요 없이, GPU들이 서로 '직접' 유선 속도로 통신할 수 있게 해줍니다. 이 방식의 가장 큰 장점은 카드 간 지연 시간이 줄어든다는 것입니다. 결과적으로 저는 (핵심인) VRAM에 돈을 쓰고, 2026년 7월 현재 기준 비용이 매우 비싼 PCIe 5.0 / DDR5 기반 시스템에 돈을 쓰지 않게 되었습니다. 제가 구매한 부품 목록(BOM)은 아래에 자세히 나와 있습니다.
얼마나 쓸 의향이 있으신가요? 약 2,000달러 (~$2k) RTX 3090 두 개를 사용해 총 48GB의 VRAM을 구축하는 것이 훌륭한 선택입니다. 그러면 훌륭한 모델인 Qwen3.6-27B를 실행할 수 있습니다. 또한 매우 유용하다고 생각드는 whisper-large-v3를 사용해 최고 수준의 로컬 음성 인식(STT)을 구동할 수 있습니다. 모델 구동 후에는 제가 만든 크로스 플랫폼 STT 하네스(실행 도구)로 접근하면 됩니다. 저는 로컬 STT가 놀라울 정도로 유용하다고 느꼈고, 클라우드 호스팅 서비스와 달리 안심하고 사용할 수 있었습니다. 11GB 정도의 엔비디아 VRAM만 있다면 바로 실행할 수 있는 설정은 ./runners/stt 폴더에 있습니다.
약 4만 달러 (~$40k) 이 가격대에서는 모델의 지능이 한 단계 더 높아집니다. Claude Opus와 거의 비슷한 수준입니다. RTX 6000 Pro 4개를 구매하여 총 384GB의 VRAM을 구축하게 됩니다. RTX6kPRO 4개를 위한 현재 최고의 모델 GLM-5.2-Int8Mix-NVFP4-REAP-594B 날짜 / 최고의 모델 / 나의 설정 2026-07 / GLM-5.2-Int8Mix-NVFP4-REAP-594B / 러너 설정
다른 접근 방식 참고: 이것은 제 추천이지만, 여러분의 돈을 쓸 수 있는 다른 완벽히 타당한 방법들도 있습니다. 예를 들어, RTX 6000 Pro 4개를 구매하는 대신 예산의 대부분을 연결된 4개의 DGX Spark 클러스터(총 512GB VRAM)를 구축하는 데 할애할 수도 있습니다. 그리고 이를 느리지만 거대한 두뇌로 사용하여 Qwen3.7-27b가 단순 작업을 빠르게 처리하도록 유도하는 방식도 있습니다.
하드웨어 제가 RTX 6000 Pro 머신을 위해 최종적으로 구매한 하드웨어입니다.
기본 시스템 거의 전적으로 이베이에서 부품을 따로 구매한 지난 세대 보급형 EPYC 시스템입니다. 부품 / 사양 / 가격 마더보드 / ASRock Rack ROMED8-2T (SP3, 7× PCIe 4.0 x16, 듀얼 10GbE) / 715달러 CPU / AMD EPYC Milan 7313P (16코어 3.0GHz) / 504달러 RAM / 8× 16GB Crucial CT16G4RFD4213 DDR4 ECC RDIMM (총 128GB, 이베이) / 642달러 CPU 쿨러 / Dynatron T17