AI 평가 스타트업이 실패하는 이유 (2025)
AI 평가(eval) 전문 스타트업들이 실패하는 핵심적인 이유는 우수 인재의 유출, 제한된 고객층, 그리고 모델 개발사로부터 가해지는 최적화 압력 때문입니다. 평가 인력은 더 큰 경제적 보상과 영향력을 얻을 수 있는 포스트트레이닝(post-training) 등 다른 분야로 빠져나가며, 타겟 고객층이 모호하여 비즈니스 모델을 유지하기 어렵습니다. 결국 독립적인 평가 스타트업은 생존하기 힘들다는 분석입니다.
AI 평가 스타트업이 실패하는 이유 (2025년 5월 8일)
왜 독립적인 AI 평가(eval) 스타트업은 이렇게 적을까요? 에이전트, 음성, 또는 음성 에이전트와 같은 새로운 AI 트렌드가 나타날 때마다, 개발자들은 수많은 선택지에 직면합니다. 그 중 일부는 최고의 모델을 식별하고 그 지식을 다른 개발자들에게 판매하는 것, 즉 '평가(eval)'를 파는 것이 비즈니스 기회라고 확신합니다. 저는 우리가 이를 생성형 AI라고 부르기 이전부터, 생성형 AI의 모든 물결 속에서 이런 현상을 보아왔습니다. 안전성 평가(safety evals)라는 틈새 시장을 제외하고는 성공한 곳을 보지 못했습니다.
저는 독립적인 평가 스타트업이 왜 도산하는지에 대해 몇 가지 이론을 가지고 있습니다. 첫째, 훌륭한 평가를 설계하고 실행할 수 있는 사람들은 모델 개발 스택의 다른 부분에서 더 많은 돈을 벌고 더 큰 영향력을 행사할 수 있기 때문에 인재가 유출됩니다. 둘째, 평가 스타트업은 고객을 찾기가 매우 어렵습니다. 왜냐하면 고객은 API를 사용해 구축하려는 기술적 역량이 있는 개발자이면서도, 동시에 자체적인 평가를 실행할 만큼 기술력이 뛰어나지는 않은 사람들이어야 하기 때문입니다. 셋째, 평가 스타트업은 일반적인 모델 개선 과정이나 모델 개발사들로부터 가해지는 압력으로 인해 그들이 만든 평가 도구가 무용지물이 되어버리는 엄청난 최적화 압력에 직면합니다.
평가 인재는 다른 곳에서 더 잘 쓰입니다 훌륭한 평가 인재는 스택의 다른 부분으로 이동합니다. 훌륭한 평가를 위해 필요한 기술이 포스트트레이닝(post-training) 및 애플리케이션 개발에도 유용하기 때문입니다. 이 분야들은 더 많은 가치를 창출하고(즉, 더 많은 돈을 벌고), 모델 개발에 더 직접적인 영향을 미칩니다(즉, 더 명예롭고 흥미롭습니다).
예를 들어, 좋은 평가를 구축하려면 인간 피드백 파이프라인을 운영하거나 합성 데이터(synthetic data)를 통해 고품질 데이터를 수집해야 합니다. 고품질 데이터 수집은 포스트트레이닝의 주요 병목 현상입니다. 데이터 포인트당 가치가 같다고 가정할 때, 평가에 사용되는 데이터의 양은 포스트트레이닝을 위해 수집되는 데이터의 양보다 항상 자릿수가 적습니다. 따라서 엄밀히 말해, 평가용 데이터를 수집하여 얻는 가치는 포스트트레이닝용 데이터를 수집하여 얻는 가치에 비해 한계가 있습니다. 게다가, 좋은 포스트트레이닝의 재정적 수익은 잠재적으로 수억에서 수십억 달러에 달할 수 있지만, 평가의 재정적 수익은 귀하의 가장 큰 평가 계약 규모로 제한되며, 이는 그것과는 비교할 수도 없을 정도로 적습니다. 기회비용의 개념을 우연히 이해하고 있는 똑똑한 젊은 연구원들에게는 이러한 역학이 명백하게 다가옵니다. 이를 보여주는 예시로, 에이전트 평가 업무를 하던 에포크 AI(Epoch AI)의 세 명의 연구원이 직장을 그만두고 대신 에이전트를 위한 포스트트레이닝 도구를 구축하는 스타트업을 설립한 사례가 있습니다.
평가 고객이 부족합니다 평가 스타트업이 인재를 유지한다 하더라도 여전히 고객을 찾기는 어렵습니다. 왜냐하면 '모델 API를 기반으로 구축함'과 '모델을 평가할 능력이 없음'이라는 두 개의 원이 교차하는 벤 다이어그램의 영역은 무시해도 될 정도로 작기 때문입니다.
시장 조사 기업인 가트너(Gartner)가 공급업체들을 비교하는 차트를 보면, X축은 환상적이고 Y축은 허구적입니다. 즉, 차트는 차트가 인쇄되어 전달되는 기업 임원들과 기술적 수준이 비슷한 유아들이 해석할 수 있도록 만들어졌습니다. 제가 과장하고 있다고 생각하면 구글에 'Gartner Magic Quadrant AI'를 검색한 다음, 차트 범죄 부서에 신고해 보시길 권합니다. 이와 같은 늪이 AI 평가 스타트업을 빠뜨린 곳입니다.
포스트트레이닝 모델을 다루는 모든 고객은 확실히 그들 스스로 평가를 구축하고 있습니다. 도구 사용 없이, Best of N으로 계산된 AIME 2024에서 10% 개선의 의미와 영향을 이해하는 개발자는 그저 직접 평가를 실행하는 것과 멀지 않은 사람입니다. 만약 그들이 GPT 4o와 GPT 4.1의 차이를 이해하지 못한다면, 그들은 기능이나 분석이 아닌 '솔루션'을 원하는 고객일 것입니다(당연히 ELO 방식에 대한 설명도 원하지 않을 것입니다). 가트너는 클라우드 제공업체와 대규모 계약을 맺는 임원들을 위해 수준을 낮출 수는 있지만, 평가 스타트업은 항상 개발자들에게 판매하려는 경향이 있습니다. 따라서 AI 서비스에 대한 수요가 증가하더라도 평가 스타트업을 위한 시장은 그리 크지 않을 것이라고 저는 회의적으로 생각합니다.