메뉴

#GPU

HN
Hacker News 5일 전
IMP 9

AMD 인스팅트 MI455X: 태양을 겨냥하다

AMD가 AI 스택 최상위 모델인 인스팅트 MI355X를 대체할 새로운 MI455X를 공개했습니다. 이 GPU는 CDNA5 아키텍처를 기반으로 랙(Rack) 단위의 확장을 지원하며, UALink 기반의 새로운 네트워크 아키텍처를 통해 단일 시스템 내에서 72개의 GPU까지 확장할 수 있습니다. 컴퓨팅 성능과 메모리 대역폭, 용량을 대폭 강화하여 대규모 AI 인프라 구축을 위한 핵심 경쟁력을 확보했다는 점에서 중요합니다.

AI하드웨어 AMD 데이터센터
MP
MarkTechPost 7일 전
IMP 8

주요 LLM 파인튜닝 프레임워크 4종 비교 분석

현재 오픈소스 LLM 파인튜닝 생태계는 Unsloth, Axolotl, TRL, LLaMA-Factory 등 4대 프레임워크가 주도하고 있습니다. 이들은 PyTorch와 허깅페이스(Hugging Face)라는 동일한 기반 기술을 활용하지만, 최적화 속도, VRAM 효율성, 다중 GPU(Multi-GPU) 지원 등 각자 다른 엔지니어링 목표와 전략에 집중하며 차별화를 이루고 있습니다.

파인튜닝 LLM 오픈소스
MP
MarkTechPost 9일 전
IMP 7

단일 24GB GPU로 구동하는 최고의 로컬 LLM 비교

본문은 진지한 로컬 추론 작업을 위한 실질적인 최소 요건인 24GB 단일 GPU 환경에서 실행할 수 있는 6가지 주요 오픈웨이트 모델을 비교 분석합니다. Qwen, Gemma, Mistral, DeepSeek 등 각 모델의 VRAM 요구량, 라이선스, 그리고 최적의 활용 사례를 소개하여 실무자의 모델 선택을 돕습니다.

로컬LLM 오픈소스 VRAM
HN
Hacker News 16일 전
IMP 8

Flash-MSA: 희소 어텐션으로 백만 토큰 학습 가속화

최첨단 AI 모델들이 추론 속도를 높이기 위해 사용하는 미니맥스 희소 어텐션(MSA)을 효율적으로 학습할 수 있는 세계 최초의 오픈소스 커널이 공개되었습니다. 이 기술은 Hopper 및 Blackwell GPU 환경에서 블록 단위의 희소 패턴을 적용하여 메모리 부담을 줄이고 백만 개 이상의 긴 맥락을 처리하는 학습 속도를 획기적으로 단축해 줍니다. 최신 AI 모델들의 핵심 기술을 최적화하여 대규모 언어 모델(LLM) 학습의 병목 현상을 해결한다는 점에서 실무 개발자들에게 매우 중요합니다.

최적화 학습 가속화 오픈소스
TD
The Decoder 28일 전
IMP 8

오픈AI, 게스트 ChatGPT 응답 비용 절반 이상 감소

오픈AI는 최적화 기술을 통해 계정이 없는 게스트 사용자의 인퍼런스 비용을 절반 이상으로 줄이는 데 성공했습니다. 이에 따라 해당 사용자에게 서비스를 제공하는 데 필요한 엔비디아 GPU 수가 단 수백 개로 급감했으며, 확보된 리소스는 향후 서비스 확장이나 더 나은 모델 개발에 투입될 전망입니다. 데이터센터 구축이 더딘 상황에서 이러한 효율 개선은 AI 모델의 인퍼런스 비용(Inference cost) 절감이라는 실무적으로 매우 중요한 의미를 갖습니다.

오픈AI 인퍼런스 비용 GPU
MP
MarkTechPost 50일 전
IMP 7

샤오미 MiMo, 상용 GPU로 1천억 매개변수 모델 1000토큰/초 돌파

샤오미 MiMo 팀과 TileRT가 1천억 매개변수(1-Trillion-Parameter) 모델의 새로운 서빙 모드인 MiMo-V2.5-Pro-UltraSpeed를 공개했습니다. 이 모드는 단일 8-GPU 상용 노드만으로 초당 1,000개 이상의 토큰을 디코딩하는 놀라운 속도를 달성했습니다.

샤오미 대형 언어 모델 모델 서빙
TD
The Decoder 78일 전
IMP 8

엔비디아, 2026년 AI 파트너사에 400억 달러 투자

엔비디아가 2025년 한 해 동안 AI 기업들에 400억 달러 이상을 투자하며 업계 최대 규모의 후원자로 자리매김했습니다. 가장 큰 비중은 OpenAI에 투자한 300억 달러이며, 최근에는 데이터센터 운영사인 IREN과 광섬유 전문기업 코닝(Corning)에도 대규모 투자 권리를 확보했습니다. 젠슨 황 CEO는 특정 기업을 지목하기보다 모든 파운데이션 모델 기업을 지원하겠다고 밝혔으나, 일각에서는 엔비디아 자사 GPU 매출을 견인하기 위한 순환 투자라는 지적도 나오고 있습니다.

엔비디아 AI 투자 오픈AI
HN
Hacker News 111일 전
IMP 9

단일 GPU로 1000억 파라미터 LLM 훈련

단일 GPU 환경에서 1000억 개 이상의 파라미터를 가진 대규모 언어 모델(LLM)을 최고 정밀도로 훈련할 수 있는 'MegaTrain' 시스템이 소개되었습니다. 이 시스템은 GPU 대신 CPU 메모리를 적극 활용하고 파이프라인 및 상태 없는 레이어 템플릿 기법을 통해 하드웨어 한계를 극복하여, 140억 파라미터 모델 훈련 시 기존 DeepSpeed ZeRO-3 대비 1.84배 높은 처리량을 달성했습니다.

LLM훈련 메모리최적화 GPU