차세대 LLM을 향한 스타트업들의 도전
현재 대형 언어 모델(LLM)의 핵심 기술인 트랜스포머(Transformer)가 데이터 처리량이 늘어남에 따라 연산 비용과 전력 소모를 급증시키는 병목 현상을 겪고 있습니다. 이에 따라 스파스 어텐션(Sparse Attention) 등 트랜스포머의 근본적 한계를 극복하고 모델을 더 빠르고 효율적으로 만들려는 신생 기업들의 새로운 시도가 주목받고 있습니다.
경영 요약: MIT 테크놀로지 리뷰의 '다음은 무엇일까(What's Next)' 시리즈는 여러 산업, 트렌드, 기술을 조명하여 미래를 가장 먼저 살펴봅니다. 나머지 기사들은 여기에서 읽어보실 수 있습니다.
2017년 여름, 구글의 AI 연구원들은 새로운 유형의 신경망인 트랜스포머(Transformer)를 설명하는 'Attention Is All You Need(어텐션이 전부다)'라는 제목의 논문을 발표했습니다. 이 기술은 특히 텍스트와 같은 긴 데이터 시퀀스를 처리하는 데 매우 탁월하다는 것이 증명되었습니다. 9년이 지난 지금, 트랜스포머는 시장에 출시된 모든 주요 대형 언어 모델(LLM) 내부의 핵심 엔진이 되었습니다.
AI 스타트업 서브쿼드래틱(Subquadratic)의 공동 창립자이자 CEO인 저스틴 단젤(Justin Dangel)은 "전체 AI 산업은 트랜스포머를 기반으로 구축되었다"며, "이는 컴퓨터 과학 역사상 가장 중요한 혁신 중 하나이며 세상을 변화시켰다"고 말했습니다.
하지만 트랜스포머도 이제 노후화의 조짐을 보이기 시작했습니다. 소위 추론 모델(reasoning model)이라 불리는 모델의 발전이나 방대한 양의 입력을 한 번에 처리하는 최근 LLM의 기능 향상은 트랜스포머라는 핵심 기술의 자연스러운 확장이 아니라, 그 근본적인 결함을 덮기 위한 우회 방안일 뿐입니다. 이제 점점 더 많은 과학자와 엔지니어들이 '다음으로 올 기술'이 무엇일지 묻고 있습니다. LLM이 사라지는 것은 아니지만, 그것이 구축되는 방식은 판이하게 바뀔 수 있습니다. (MIT 테크놀로지 리뷰는 올해 'AI에서 중요한 10가지' 목록에서 이 차세대 모델들을 'LLM+'이라고 명명했습니다.)
바로 이 지점에서 기술의 한계를 넓히고자 하는 수많은 스타트업의 물결이 등장합니다. 의심할 여지 없이 일부는 실패하겠지만, 이들은 현재 시장을 선도하는 기업들보다 잃을 것이 훨씬 적고, 모든 것을 걸고 승부할 수 있는 위치에 있습니다.
수적 우위의 힘 하지만 먼저, 문제를 살펴보겠습니다. 트랜스포머의 핵심 강점은 '밀집 어텐션(Dense Attention)'이라는 메커니즘에 있습니다. 이는 텍스트 블록의 의미를 일련의 숫자로 인코딩합니다. 이 과정에는 해당 텍스트의 모든 단어(또는 토큰이라고 알려진 단어의 일부)를 곱셈 형태를 통해 다른 모든 단어와 비교하는 작업이 포함됩니다.
밀집 어텐션은 놀라운 정확도로 텍스트의 의미를 포착할 수 있습니다. 하지만 텍스트의 길이가 길어질수록 이를 처리하는 데 필요한 계산 횟수가 기하급수적으로 빠르게 증가합니다. 10,000단어 길이의 문서는 트랜스포머가 5천만 번의 곱셈 연산을 수행하도록 요구할 수 있습니다. 이것이 바로 LLM이 막대한 전력을 소모하는 주된 이유입니다.
비용 역시 천문학적입니다. 그레그 브록먼(Greg Brockman) OpenAI 사장에 따르면, OpenAI는 올해 컴퓨팅에 500억 달러를 지출할 예정입니다. 또한 국제에너지기구(IEA)는 데이터센터가 소비하는 총 전력량이 2030년까지 두 배로 증가할 것으로 예측했습니다.
게다가 트랜스포머는 최신 모델들이 설계된 목적을 수행하는 데 어려움을 겪고 있습니다. 텍스트를 단어 단위로 처리하는 방식 때문에, 트랜스포머는 한 번에 많은 정보를 추적하는 데 취약합니다. (다시 말해, 이른바 '맥락 창(Context Window)'이 너무 커질 수 없습니다.) 그럼에도 불구하고 LLM이 더 어려운 작업을 수행하려면 방대한 데이터, 즉 전체 문서 라이브러리, 방대한 코드베이스, 또는 에이전트(Agent)의 경우 다른 LLM의 출력 결과까지 한 번에 수용할 수 있어야 합니다.
추론 모델의 경우에도, 스스로 메모를 작성(소위 '사고의 연결(Chain of Thought)'이라 불리는 메모장)한 뒤 이를 다시 읽는 방식으로 작동하므로, 처리해야 할 데이터의 양이 또 다시 증가합니다. LLM이 더 커지고 성능이 향상될수록 트랜스포머는 병목 현상을 겪게 되며, 과거 이 기술의 핵심 강점은 이제 한계로 작용하고 있습니다.
다음은 트랜스포머 문제를 해결하기 위한 4가지 새로운 아이디어입니다. 이러한 혁신은 LLM을 영원히 바꿔놓을 수 있으며, 더 빠르고 훨씬 효율적이며 (어쩌면) 더 똑똑하게 만들 수 있습니다.
01: 어텐션(Attention)의 재고찰 LLM을 더 빠르고 저렴하게 만드는 확실한 방법 중 하나는 이 문제에 정면으로 부딪혀 어텐션의 작동 방식을 변경하는 것입니다. 모든 단어의 쌍을 연산하는 '밀집 어텐션' 대신, 텍스트의 일부 단어 쌍에만 연산을 수행하는 '희소 어텐션(Sparse Attention)'으로 대체하면 LLM이 수행해야 할 연산량을 획기적으로 줄일 수 있습니다.
수년에 걸쳐 연구원들은 다양한 희소 어텐션 메커니즘을 고안해 왔습니다. 하지만 문제는 (원문 누락으로 인해 내용이 생략되었습니다.)