전 OpenAI 연구원 “단순 확장 한계…100조 원은 훈련 데이터로 간다”
전 OpenAI 연구원 앤드류 호는 단순히 대형 언어 모델(LLM)의 규모를 키우는 것만으로는 진정한 범용 성능을 낼 수 없다고 판단하여, 고품질 학습 데이터 제작 스타트업을 설립했습니다. 이는 경제적 가치가 높은 실무 작업들을 현재 AI가 제대로 수행하지 못하며, 향후 1,000억 달러(약 134조 원) 이상이 의미 있는 데이터 수집에 투자될 것이라는 전망에 기인합니다. 케임브리지대학교 및 구글 딥마인드 연구진 또한 최신 AI 모델들이 범용성보다는 특정 분야에 특화되고 있으며, 창의적 문제 해결에 한계에 직면했다는 분석으로 이를 뒷받침하고 있습니다.
전(前) OpenAI 연구원, 단순한 스케일업만으로는 부족하다며 1,000억 달러가 학습 데이터로 유입될 것이라 전망하다 Matthias Bastian이 작성함 (게재일: 2026년 7월 30일)
핵심 요약:
- 전 OpenAI 직원은 단순히 대형 언어 모델의 규모를 확장하는 것만으로는 진정한 일반화(범용화) 능력을 달성할 수 없다는 회의적인 시각을 바탕으로, 고품질 학습 데이터 제작에 전념하는 스타트업을 설립했습니다.
- 이 회사는 생물정보학(Bioinformatics) 및 일상적인 실험실 작업을 위한 특수 데이터셋을 구축하고 있습니다. 기존의 데이터 소스만으로는 AI 시스템이 안정적으로 수행해야 하는 경제적으로 가치 있는 기술들을 제대로 담아내지 못한다는 주장입니다.
- 케임브리지 대학교와 구글 딥마인드의 연구진 역시 이러한 관점을 지지합니다. 이들은 현재의 AI 시스템이 다용도성보다는 특정 분야 전문화로 흐르고 있으며, 창의적인 문제 해결 영역에서는 한계에 부딪히고 있다고 분석합니다.
본문: 앤드루 호(Andrew Ho)는 대형 언어 모델(LLM)이 일반화 성능이 크게 떨어진다는 확신을 가지고 불과 8개월 만에 OpenAI를 떠났습니다. 그는 프로그래밍처럼 자금이 넉넉히 지원되는 분야조차도 AI의 성능이 들쭉날쭉하다고 지적합니다. 호에 따르면, 그 근본적인 원인은 학습 데이터의 부족입니다. 경제적으로 중요한 의미를 갖는 대부분의 기술들은 기존 데이터셋 내에는 거의 포함되어 있지 않습니다.
호는 “대부분의 업무는 매우 상황에 의존적이며, 점수를 매길 수 있는 환경으로 쉽게 인코딩되지 않습니다. 우리가 좋다고 믿는 인간의 '모범 사례(golden path)'를 관찰할 수 있다고 하더라도, 다른 가상의 대안 경로가 좋은 결과를 낳는지 나쁜 결과를 낳는지 이해하는 것은 여전히 어려운 일”이라고 설명했습니다.
그는 단순한 스케일업(모델 크기 확장)만으로는 이 문제를 해결할 수 없다고 주장하며, 앞으로 몇 년 동안 AI 연구소들이 의도적이고 타겟팅된 데이터 수집에 1,000억 달러(약 134조 원) 이상을 지출해야 할 것으로 예상합니다. 또한 호는 OpenAI나 앤스로픽(Anthropic) 같은 최첨단 AI 연구소들의 초고가 기업 가치에 대해서도 회의적인 입장입니다. 그는 이들이 크원(Qwen)이나 키미(Kimi) 같은 저렴한 경쟁사들을 앞서기 위해 끊임없이 늘어나는 자금을 새로운 모델에 쏟아부어야만 하는 만성적인 적자 상태에 있다고 지적했습니다.
그가 기획한 첫 번째 제품(데이터셋)은 두 가지 분야를 겨냥하고 있습니다. 하나는 생물정보학 내 복잡한 과학 분석을 위한 데이터셋으로, 그가 OpenAI에서 근무할 때 연구했던 주제이기도 합니다. 참고로 GPT-5.6 Sol과 같은 최신 모델조차도 이 분야에서는 약 30%의 성공률만을 보여줍니다. 다른 하나는 일상적인 실험실 작업을 위한 데이터셋입니다. 예를 들어 연구원들이 실험 사진을 찍어 AI 모델에 전달해 평가를 받는 경우가 이에 해당합니다. 향후에는 화학, 재료 과학, 헬스케어 및 더 폭넓은 지식 작업 분야로 데이터 구축을 확장할 계획입니다.
최신 모델들은 특정 분야에서는 더 날카로워지지만, 다른 분야에서는 둔해지고 있다. 케임브리지 대학교의 연구원인 아담 헌트(Adam Hunt) 역시 호의 회의론에 동의합니다. 헌트는 자신이 대형 언어 모델에 대해 가졌던 낙관적인 시각이 점차 비관적으로 바뀌어 가는 과정을 설명합니다. 그의 주장에 따르면, 최신 모델들은 다용도로 발전하는 것이 아니라 오히려 더 전문적으로 세분화되고 있습니다. 프로그래밍 및 복잡한 수학 능력은 계속해서 향상되는 반면, 언어의 품질이나 단순한 논리를 요구하는 분야는 정체되거나 심지어 악화되고 있습니다. 이는 AI의 불균일한 성능을 관찰한 호의 지적과도 일치합니다.
헌트는 그 이유로, 프로그래밍과 같은 분야에서는 명확한 보상 신호와 완전한 학습 데이터가 존재하기 때문에 강화 학습이 잘 작동하지만, 다른 분야에서는 그런 데이터를 얻을 수 없기 때문이라고 분석합니다. 초기 대형 언어 모델들의 발전과 방대한 텍스트 말뭉치(Corpus) 학습을 통해 도출된 명백한 추론 및 일반화 능력은 부작용(역설적인 결과물)에 불과했습니다. 즉, 이는 진정한 의미의 일반적인 이해 능력을 보여주는 징표가 아니었습니다.
일반화(범용화) 문제는 여전히 미해결 과제로 남아있다. 이 논쟁은 항상 동일한 질문으로 귀결됩니다. 과연 언어 모델이 결과를 자동으로 검증할 수 없는 분야에서 특정 영역에서, 단순히 학습 데이터를 재생하고 재조합하는 수준을 넘어선 능력을 개발할 수 있을까요? 과학자들 사이에서도 이 질문에 대한 답은 엇갈리고 있습니다.
헌트 자신 역시 이에 대한 확신을 40% 정도에 불과하다고 말하며, 기술이 발전하여 특수 목적의 AI 모델들을 결합해 더 보편적인 지능과 유사한 형태를 만들어낸다면 자신의 주장이 틀렸음이 증명될 수 있음을 인정합니다.
최근 'LLMs can't jump(LLM은 도약할 수 없다)'라는 제목으로 발표된 입장문에서도 이러한 맥락이 이어집니다.