메뉴

#GPU 최적화

HN
Hacker News • 1일 전
IMP 6

에이전트 기반 CUDA 커널 최적화 도구 공개

해커뉴스에 LangGraph 기반 '에이전트형 CUDA 커널 옵티마이저'가 공개되었습니다. 워크로드 설명만 입력하면 GPU 구현을 자동 생성하고, 컴파일·정확성 검증·벤치마크·개선을 반복하며 가장 빠른 검증 커널을 선별합니다. NVIDIA 문서 조회와 Nsight Compute 프로파일링 카운터 확인도 지원해 GPU 커널 최적화 업무의 자동화 가능성을 보여준다는 점에서 주목할 만합니다.

에이전트 CUDA GPU 최적화
MP
MarkTechPost • 10일 전
IMP 7

NVIDIA cuDNN 그래프 API 내부: 퓨전, 오토튜닝, 플랜 재활용

NVIDIA의 cuDNN Frontend Graph API를 활용해 커스텀 커널 퓨전(kernel fusion), 오토튜닝 엔진 구성, FP8 스타일 에필로그(epilogue), 스케일드 닷-프로덕트 어텐션(SDPA), 동적 셰이프, CUDA 그래프 캡처를 구현하는 실용적 튜토리얼입니다. 딥러닝 프레임워크 추상화 아래 단계에서 연산을 직접 최적화하려는 개발자에게 유용하며, 결과를 PyTorch와 대조 검증하는 방법도 다룹니다.

NVIDIA cuDNN GPU 최적화
MP
MarkTechPost • 103일 전
IMP 7

GPU 기반 최고속 K-평균: 플래시-K평균(Flash-KMeans) 공개

오픈소스 GPU 라이브러리인 플래시-K평균(Flash-KMeans)은 수학적 근사 없이 정확한 K-평균(K-means) 알고리즘을 수행하면서도 기존 라이브러리 대비 최대 200배 이상 높은 처리 속도를 자랑합니다. 이는 트라이톤(Triton) GPU 커널을 활용해 입출력(IO) 병목 현상과 연산 충돌을 최소화하여 데이터 센터 및 실무 환경의 클러스터링 연산 비용을 획기적으로 낮춰줍니다.

K-평균(k-means) GPU 최적화 오픈소스
HN
Hacker News • 116일 전
IMP 8

스탠퍼드 CS336: 밑바닥부터 시작하는 언어 모델링

스탠퍼드 대학교에서 2026년 봄 학기에 개설되는 'CS336: 밑바닥부터 시작하는 언어 모델링' 강의 소개글입니다. 이 수업은 기존의 뼈대 코드를 활용하는 것과 달리, 학생들이 직접 데이터 수집부터 Transformer 모델 구현, GPU 분산 학습 및 최적화까지 대규모 언어 모델(LLM) 전체를 구축하는 실무적인 과정을 강조합니다. AI 연구원 및 엔지니어에게 필수적인 심화 구현 능력과 시스템 최적화 기술을 배우는 데 매우 중요한 코스입니다.

스탠퍼드 대학교 대규모 언어 모델 트랜스포머 모델
HN
Hacker News • 127일 전
IMP 8

CODA: 트랜스포머 블록을 GEMM 에필로그 프로그램으로 재작성

AI 모델 학습 시 흔히 발생하는 메모리 병목 현상을 해결하기 위해, 개별적으로 처리되던 연산들을 하나의 GPU 커널(GEMM Epilogue)로 통합하여 성능을 극대화하는 새로운 추상화 기법인 CODA를 제안합니다. 이 방식은 데이터 이동을 최소화하면서도 프레임워크 수준의 생산성과 하드웨어 수준의 극적인 효율성을 동시에 달성할 수 있도록 돕습니다.

머신러닝 GPU 최적화 커널 개발
HN
Hacker News • 142일 전
IMP 8

Unsloth와 엔비디아, 소비자용 GPU에서 LLM 학습 25% 속도 향상 달성

Unsloth와 NVIDIA는 소비자용 GPU에서 LLM 파인튜닝 시 발생하는 숨겨진 병목 현상을 해결하여 학습 속도를 약 25% 향상시켰습니다. 반복적인 메타데이터 구축을 캐싱하고, 그래디언트 체크포인팅 시 버퍼를 2개 사용해 연산을 겹치게 하며, MoE 라우팅을 최적화하는 세 가지 핵심 기술을 도입했습니다. 이는 개발자들이 기존 하드웨어의 한계를 뛰어넘어 최대치의 성능을 끌어낼 수 있게 해준다는 점에서 실무적으로 매우 중요합니다.

LLM 파인튜닝 GPU 최적화 Unsloth