트랜스포머, 시각적으로 이해하기
트랜스포머(Transformer)는 2017년 논문 'Attention is All You Need'로 소개된 신경망 구조로, GPT·Llama·Gemini 등 주요 생성형 AI 모델의 기반이 되는 핵심 기술입니다. 이 글은 토크나이징, 임베딩, 셀프 어텐션, MLP 등 트랜스포머의 핵심 구성요소를 GPT-2(small) 모델 예시로 시각적으로 설명합니다.
트랜스포머(Transformer)는 2017년 논문 'Attention is All You Need'로 소개된 신경망 구조로, GPT·Llama·Gemini 등 주요 생성형 AI 모델의 기반이 되는 핵심 기술입니다. 이 글은 토크나이징, 임베딩, 셀프 어텐션, MLP 등 트랜스포머의 핵심 구성요소를 GPT-2(small) 모델 예시로 시각적으로 설명합니다.
바이두 연구진이 인간의 망각 원리를 차용한 새로운 어텐션 메커니즘(R-SWA)을 적용하여, 한 번의 추론으로도 수십 페이지의 문서를 처리할 수 있는 '무제한 OCR(Unlimited OCR)' 모델을 개발했습니다. 기존 모델들의 가장 큰 병목이었던 KV 캐시 메모리 문제를 해결하여, 처리 속도와 메모리 사용량을 일정하게 유지하면서도 문서 인식 정확도 벤치마크에서 최고 수준의 성능을 기록했습니다.
새로운 어텐션 기법인 Parallax는 기존 국소 선형 어텐션(LLA)의 쿼리별 풀이법(query solver)을 학습된 프로젝터(projector)로 대체하여 연산 밀도를 두 배로 높였습니다. 이를 통해 0.6B 및 1.7B 크기의 언어 모델에서 펄플렉시티(perplexity) 성능이 향상되었습니다. 이 연구는 효율적인 어텐션 메커니즘의 성능을 개선하여 대규모 언어 모델의 추론 및 학습 효율성을 높인다는 점에서 중요합니다.
전통적인 트랜스포머가 컨텍스트 길이가 길어질수록 겪는 KV 캐시의 메모리 문제를 해결하기 위해, 정보를 네트워크 가중치(그래프 전파)에 직접 저장하는 새로운 포스트 트랜스포머 아키텍처인 BDH의 개념과 작동 방식을 정리한 글입니다. 저자는 기존 모델들이 단기 기억에 의존하는 '전진성 건망증'을 겪고 있으며, 이를 해결하기 위해 어텐션을 선형화하는 동시에 키/쿼리 공간을 매우 높은 차원(희소 및 비음수 패턴)으로 확장해야 한다고 강조합니다.