메뉴

#GPU

MP
MarkTechPost • 8일 전
IMP 7

마이크로소프트, GPU AI 워크로드용 TauGrid 오픈소스 공개

마이크로소프트 AKS 엔지니어링 팀이 TauGrid를 오픈소스로 공개했습니다. tau CLI, Kueue 큐잉, KubeRay 오케스트레이션, GPU 노드 상태 모니터링 및 관측성(Observability) 기능을 하나의 Helm 설치로 통합한 스택입니다. MIT 라이선스로 배포되며 GPU 노드가 있는 Kubernetes 1.30 이상 클러스터에서 kubectl과 Helm 3.0 이상만 있으면 바로 사용할 수 있습니다.

쿠버네티스 마이크로소프트 GPU
HN
Hacker News • 9일 전
IMP 6

AMD 매트릭스 코어의 정밀한 수치 모델링 연구

최근 GPU의 행렬 곱셈 유닛(매트릭스 코어)이 IEEE 754 부동소수점 표준을 따르지 않고 제조사·아키텍처마다 동작이 달라 결과 재현이 불가능한 문제를 다룬 연구입니다. 연구진은 AMD의 CDNA 1/2/3 아키텍처(MI100, MI210/250, MI300A/300X)에 대해 정교한 테스트 벡터를 설계해 수치적 동작을 규명하고, MATLAB 기반 소프트웨어 모델을 개발해 1,000만 개 무작위 테스트에서 비트 수준 정확도를 검증했습니다. 이 모델로 AMD 매트릭스 코어와 NVIDIA 텐서 코어 간 애플리케이션 수준 정확도 차이를 정량화하는 시연도 수행했습니다.

하드웨어 아키텍처 GPU 부동소수점
HN
Hacker News • 13일 전
IMP 6

엔비디아는 AI의 중앙은행이다

해커뉴스에 올라온 글로, 엔비디아를 AI 산업의 '중앙은행'에 비유하며 GPU 공급이 AI 경제의 통화 발행처럼 작동한다고 주장합니다. 엔비디아가 컴퓨트 자원의 배분과 가격을 사실상 통제함으로써 AI 생태계 전체의 성장 속도와 방향을 좌우한다는 관점이 핵심입니다. 본문은 아카이브 링크만 포함되어 있어 상세 내용은 링크를 통해 확인해야 합니다.

엔비디아 GPU AI 산업
TC
TechCrunch AI • 15일 전
IMP 8

젠슨 황, 엔비디아 내년 70% 성장 예상한 이유

엔비디아 젠슨 황 CEO는 골드만삭스 컨퍼런스에서 내년 매출이 전년 대비 70% 증가해 약 6,800억 달러에 이를 것이라고 재확인했다. 그는 엔비디아가 모든 AI 모델과 데이터센터 프로젝트에 깊숙이 관여해 '미래를 볼 수 있다'며, 순환 거래 논란에 대해서는 투자금 대비 수익이 크고 실제 계약이 뒷받침된다고 반박했다.

엔비디아 젠슨 황 AI 반도체
MP
MarkTechPost • 17일 전
IMP 8

NVIDIA, CUDA 러스트 발표—컴파일 시점 안전 GPU 커널 지원

NVIDIA가 Rust를 GPU 커널 작성의 일급 언어로 만들기 위한 'CUDA Rust'를 발표했습니다. 오픈소스 프로젝트 두 개가 각각의 CUDA 프로그래밍 모델을 지원하는데, cuda-oxide는 SIMT 커널을 Rust MIR에서 Pliron과 LLVM을 거쳐 PTX로 컴파일하고, cutile-rs는 안정 버전 Rust 1.89 이상에서 CUDA Tile IR을 통해 Tile 커널을 JIT 컴파일합니다. 컴파일 시점에 안전성을 보장하는 GPU 커널 개발이 가능해진다는 점에서 개발자 생태계에 중요한 변화입니다.

NVIDIA CUDA Rust
TC
TechCrunch AI • 27일 전
IMP 7

엔비디아의 AI 우위, GPU를 넘어서다

엔비디아의 경쟁 우위가 GPU 자체를 넘어 데이터 오케스트레이션과 시스템 전반으로 확장되고 있습니다. 기가와트급 AI 인프라에서 베라 루빈(Vera Rubin) 아키텍처처럼 GPU 주변의 CPU·스토리지·네트워킹을 효율화하는 전문 하드웨어가 새로운 경쟁 무대가 되고 있으며, 이는 데이터 이동 최소화에 집중한 OpenAI의 할라페뇨 칩과 같은 접근과 같은 맥락입니다.

엔비디아 GPU 데이터센터
TC
TechCrunch AI • 30일 전
IMP 9

아마존, 엔비디아 GPU 주문 3배 확대...200만 개 추가 도입

아마존은 '폭증하는 수요'를 이유로 엔비디아 GPU 200만 개를 추가로 AWS 데이터센터에 도입하기로 했으며, 이는 5개월 전 합의분(100만 개 이상)의 두 배에 달하는 규모로 양사의 파트너십이 크게 확대된 것입니다. 거래 금액은 공개되지 않았으나 GPU 단가를 고려하면 수백억 달러 규모로 추정되며, 자체 AI 칩(Trainium 등)을 키우고 있는 아마존조차 엔비디아 의존을 늘린다는 점에서 의미가 큽니다.

엔비디아 아마존AWS AI칩
HN
Hacker News • 34일 전
IMP 7

AI 칩 아키텍처의 혁명

헤네시와 패터슨이 2018년 튜링 강연에서 예측한 '컴퓨터 아키텍처의 캄브리아 폭발'이 실제로 현실화되어 현재 GPU, TPU, LPU, NPU, 웨이퍼 스케일 엔진 등 수십 종의 AI 전용 칩 아키텍처가 개발 경쟁 중입니다. 이 글은 AI 연산의 핵심인 행렬 곱셈과 메모리 월(memory wall) 문제를 중심으로 각 아키텍처의 철학, 구조, 확장 방식, 소프트웨어 스택을 비교 분석합니다. 실제 배포에서는 NVIDIA GPU가 압도적 선두를 달리고 있으며, Google TPU, AWS Trainium, Cerebras, Groq LPU 등이 뒤를 잇고 있습니다.

AI 칩 하드웨어 GPU
TC
TechCrunch AI • 37일 전
IMP 7

실리콘밸리 스타트업, AI 컴퓨트 가격 매기고 월가 헤지 시장 연다

실리콘데이터(Silicon Data)는 GPU 렌탈 가격의 기준 가격(레퍼런스)이 되고 월가 선물 계약의 정산 지수가 되는 것을 목표로 하며, 3,000만 달러 시리즈 A 투자를 유치했습니다. 연간 수천억 달러가 데이터센터와 GPU에 투입되면서 컴퓨트 비용이 AI 사업 최대 비용 항목이 됐지만, 이를 헤지할 표준적 방법이 없었던 것이 이번 뉴스의 핵심입니다. 회사는 규제 승인 대기 중인 10월 5일 CME에서 컴퓨트 선물 거래를 출시할 계획이며, 칩 가치 하락·데이터센터 정체 뉴스와 달리 실제 데이터는 AI 빌드아웃이 건실하다는 다른 이야기를 들려줍니다.

AI 컴퓨트 GPU 데이터센터
HN
Hacker News • 43일 전
IMP 6

우리 집에 AI가 있다: 1화. 고철 더미

소프트웨어 개발자가 클라우드 AI 서비스에 의존하지 않고, 자체 구축한 로컬 AI 코딩 에이전트 환경을 구성하는 과정을 다룬 글입니다. 저자는 e-폐기물로 취급받는 중고 서버용 GPU와 구형 부품들을 활용해 비용을 최소화하면서도 강력한 홈 AI 데이터센터를 조립하는 방법을 공개합니다. 이는 막대한 비용이 드는 AI 하드웨어의 장벽을 넘어, 개발자가 로컬 환경에서 AI 기술력을 확보하려는 실용적이고 흥미로운 시도로 평가할 수 있습니다.

로컬-AI 코딩-에이전트 하드웨어
TC
TechCrunch AI • 43일 전
IMP 9

엔비디아의 5천억 달러 AI 투자, 노후 GPU를 살리는 모험

엔비디아가 주요 금융사들과 협력하여 최대 5천억 달러 규모의 AI 데이터센터 구축 자금을 조달합니다. 이 계획의 핵심은 엔비디아가 자사 칩을 담보로 활용할 때 그 가치를 직접 보장하여 노후 GPU의 중고 거래 생태계를 구축하는 것입니다. 이는 자금 조달의 순환 구도에 대한 우려를 불식시키고 AI 인프라를 장기 투자 자산으로 자리매김하려는 엔비디아의 전략적이고 위험한 도약입니다.

엔비디아 AI 데이터센터 GPU
WR
Wired AI • 58일 전
IMP 7

링크드인, 올해 AI 데이터센터 추가 확장 보류

링크드인은 최근 6개월간 기존 GPU의 효율성을 두 배로 끌어올린 성과를 바탕으로, 올해 데이터센터 및 GPU 투자를 동결하기로 결정했습니다. 이는 막대한 자본을 쏟아부으며 AI 인프라 확장에 경쟁하는 다른 빅테크 기업들과 대비되는 신중한 접근법으로, AI 투자가 단순한 실험 단계를 넘어 비용 효율을 따지는 '생산 관리' 단계로 진입했음을 시사합니다.

링크드인 데이터센터 GPU
HN
Hacker News • 64일 전
IMP 9

AMD 인스팅트 MI455X: 태양을 겨냥하다

AMD가 AI 스택 최상위 모델인 인스팅트 MI355X를 대체할 새로운 MI455X를 공개했습니다. 이 GPU는 CDNA5 아키텍처를 기반으로 랙(Rack) 단위의 확장을 지원하며, UALink 기반의 새로운 네트워크 아키텍처를 통해 단일 시스템 내에서 72개의 GPU까지 확장할 수 있습니다. 컴퓨팅 성능과 메모리 대역폭, 용량을 대폭 강화하여 대규모 AI 인프라 구축을 위한 핵심 경쟁력을 확보했다는 점에서 중요합니다.

AI하드웨어 AMD 데이터센터
MP
MarkTechPost • 66일 전
IMP 8

주요 LLM 파인튜닝 프레임워크 4종 비교 분석

현재 오픈소스 LLM 파인튜닝 생태계는 Unsloth, Axolotl, TRL, LLaMA-Factory 등 4대 프레임워크가 주도하고 있습니다. 이들은 PyTorch와 허깅페이스(Hugging Face)라는 동일한 기반 기술을 활용하지만, 최적화 속도, VRAM 효율성, 다중 GPU(Multi-GPU) 지원 등 각자 다른 엔지니어링 목표와 전략에 집중하며 차별화를 이루고 있습니다.

파인튜닝 LLM 오픈소스
MP
MarkTechPost • 68일 전
IMP 7

단일 24GB GPU로 구동하는 최고의 로컬 LLM 비교

본문은 진지한 로컬 추론 작업을 위한 실질적인 최소 요건인 24GB 단일 GPU 환경에서 실행할 수 있는 6가지 주요 오픈웨이트 모델을 비교 분석합니다. Qwen, Gemma, Mistral, DeepSeek 등 각 모델의 VRAM 요구량, 라이선스, 그리고 최적의 활용 사례를 소개하여 실무자의 모델 선택을 돕습니다.

로컬LLM 오픈소스 VRAM
HN
Hacker News • 75일 전
IMP 8

Flash-MSA: 희소 어텐션으로 백만 토큰 학습 가속화

최첨단 AI 모델들이 추론 속도를 높이기 위해 사용하는 미니맥스 희소 어텐션(MSA)을 효율적으로 학습할 수 있는 세계 최초의 오픈소스 커널이 공개되었습니다. 이 기술은 Hopper 및 Blackwell GPU 환경에서 블록 단위의 희소 패턴을 적용하여 메모리 부담을 줄이고 백만 개 이상의 긴 맥락을 처리하는 학습 속도를 획기적으로 단축해 줍니다. 최신 AI 모델들의 핵심 기술을 최적화하여 대규모 언어 모델(LLM) 학습의 병목 현상을 해결한다는 점에서 실무 개발자들에게 매우 중요합니다.

최적화 학습 가속화 오픈소스
TD
The Decoder • 87일 전
IMP 8

오픈AI, 게스트 ChatGPT 응답 비용 절반 이상 감소

오픈AI는 최적화 기술을 통해 계정이 없는 게스트 사용자의 인퍼런스 비용을 절반 이상으로 줄이는 데 성공했습니다. 이에 따라 해당 사용자에게 서비스를 제공하는 데 필요한 엔비디아 GPU 수가 단 수백 개로 급감했으며, 확보된 리소스는 향후 서비스 확장이나 더 나은 모델 개발에 투입될 전망입니다. 데이터센터 구축이 더딘 상황에서 이러한 효율 개선은 AI 모델의 인퍼런스 비용(Inference cost) 절감이라는 실무적으로 매우 중요한 의미를 갖습니다.

오픈AI 인퍼런스 비용 GPU
MP
MarkTechPost • 109일 전
IMP 7

샤오미 MiMo, 상용 GPU로 1천억 매개변수 모델 1000토큰/초 돌파

샤오미 MiMo 팀과 TileRT가 1천억 매개변수(1-Trillion-Parameter) 모델의 새로운 서빙 모드인 MiMo-V2.5-Pro-UltraSpeed를 공개했습니다. 이 모드는 단일 8-GPU 상용 노드만으로 초당 1,000개 이상의 토큰을 디코딩하는 놀라운 속도를 달성했습니다.

샤오미 대형 언어 모델 모델 서빙
TD
The Decoder • 137일 전
IMP 8

엔비디아, 2026년 AI 파트너사에 400억 달러 투자

엔비디아가 2025년 한 해 동안 AI 기업들에 400억 달러 이상을 투자하며 업계 최대 규모의 후원자로 자리매김했습니다. 가장 큰 비중은 OpenAI에 투자한 300억 달러이며, 최근에는 데이터센터 운영사인 IREN과 광섬유 전문기업 코닝(Corning)에도 대규모 투자 권리를 확보했습니다. 젠슨 황 CEO는 특정 기업을 지목하기보다 모든 파운데이션 모델 기업을 지원하겠다고 밝혔으나, 일각에서는 엔비디아 자사 GPU 매출을 견인하기 위한 순환 투자라는 지적도 나오고 있습니다.

엔비디아 AI 투자 오픈AI
HN
Hacker News • 170일 전
IMP 9

단일 GPU로 1000억 파라미터 LLM 훈련

단일 GPU 환경에서 1000억 개 이상의 파라미터를 가진 대규모 언어 모델(LLM)을 최고 정밀도로 훈련할 수 있는 'MegaTrain' 시스템이 소개되었습니다. 이 시스템은 GPU 대신 CPU 메모리를 적극 활용하고 파이프라인 및 상태 없는 레이어 템플릿 기법을 통해 하드웨어 한계를 극복하여, 140억 파라미터 모델 훈련 시 기존 DeepSpeed ZeRO-3 대비 1.84배 높은 처리량을 달성했습니다.

LLM훈련 메모리최적화 GPU