BL
MarkTechPost • 58일 전
Parallax: 소프트맥스 유지 및 학습된 공분산 보정 브랜치를 추가한 파라미터화 국소 선형 어텐션
IMP 7/10
핵심 요약
새로운 어텐션 기법인 Parallax는 기존 국소 선형 어텐션(LLA)의 쿼리별 풀이법(query solver)을 학습된 프로젝터(projector)로 대체하여 연산 밀도를 두 배로 높였습니다. 이를 통해 0.6B 및 1.7B 크기의 언어 모델에서 펄플렉시티(perplexity) 성능이 향상되었습니다. 이 연구는 효율적인 어텐션 메커니즘의 성능을 개선하여 대규모 언어 모델의 추론 및 학습 효율성을 높인다는 점에서 중요합니다.
번역된 본문
Parallax는 기존 국소 선형 어텐션(LLA)의 쿼리별 풀이법을 학습된 프로젝터(projector)로 대체하여 연산 밀도(Arithmetic Intensity)를 두 배로 높이고, 0.6B 및 1.7B 파라미터 모델에서 펄플렉시티(perplexity) 성능을 개선합니다.
"Parallax: 소프트맥스 유지 및 학습된 공분산 보정 브랜치를 추가한 파라미터화 국소 선형 어텐션"이라는 제목의 이 글은 MarkTechPost에 처음 게재되었습니다.
원문 보기 (영어)
Parallax replaces LLA's per-query solver with a learned projector, doubling arithmetic intensity and improving perplexity at 0.6B and 1.7B.
The post Parallax: A Parameterized Local Linear Attention That Keeps Softmax and Adds a Learned Covariance Correction Branch appeared first on MarkTechPost.