HN
Hacker News • 41일 전
x86 아키텍처 AI 연산 가속(ACE) 사양
IMP 8/10
핵심 요약
인텔과 AMD 등이 사용하는 x86 아키텍처를 위해 머신러닝(ML) 작업의 핵심인 행렬 곱셈과 저정밀도 데이터 포맷을 가속하는 확장 명령어 'ACE(AI Compute Extensions)' 사양이 공개되었습니다. 이는 기존 AVX 명령어와 긴밀하게 통합되어 타일(Tile) 기반의 고밀도 연산을 가능하게 하여 AI 모델 학습 및 추론 성능을 크게 높일 수 있는 중요한 기술적 기반입니다.
번역된 본문
이 문서는 연산 작업을 가속화하기 위한 x86 확장 기능을 정의하며, 초기에는 머신러닝(ML) 워크로드에 중요한 행렬 곱셈(matrix multiplication) 커널 및 축소 정밀도 데이터 포맷에 중점을 둡니다. ACE 확장 기능은 새로운 기능으로 AVX와 스칼라 코드(scalar code)를 보강하는 행렬 곱셈 프리미티브(primitives)를 정의하며, 다음을 추가합니다. 타일(tile) 및 블록 스케일 레지스터를 포함한 ACE 레지스터 상태(register state) AVX 레지스터 입력을 소비하고 타일 레지스터 상태에서 작동하는 데이터 처리 연산 ACE 레지스터 상태와 AVX 레지스터 간에 데이터를 이동시키는 데이터 이동 연산 시스템 관리를 위한 상태 및 연산 ACE는 AVX 벡터와 ACE 타일 레지스터 간의 긴밀한 통합을 제공하여, 고연산 밀도 타일 처리 작업과 AVX의 포괄적인 데이터 처리 기능을 결합합니다. 행렬 가속화 외에도 AVX10 프레임워크 하에서 여러 전용 포맷 변환 연산이 제공됩니다.
원문 보기 (영어)
This document defines x86 extensions for accelerating computation tasks, initially focusing on matrix multiplication kernels and reduced precision data formats important to ML workloads. The ACE extensions define matrix multiplication primitives that augment AVX and scalar code with new capabilities, adding: ACE register state, including tile and block scale registers Data processing operations that consume AVX register input and operate on tile register state Data move operations to move data between ACE register state and AVX registers State and operations for system management ACE provides tight integration between AVX vectors and ACE tile registers, combining high compute density tile processing operations with the comprehensive data processing features of AVX. In addition to matrix acceleration, a number of dedicated format convert operations are provided under the AVX10 framework.