AI 성능 비용, 역대 어떤 기술보다 빠르게 하락
연구기관 Epoch AI는 특정 벤치마크 점수에 도달하는 비용이 분기당 평균 47%, 연간 약 13배씩 떨어지고 있다고 분석했습니다. 그러나 MIT 연구진은 하드웨어 저렴화와 경쟁 요인을 제거하면 순수 알고리즘 효율 개선은 연간 약 3배에 그친다고 지적합니다. 이는 가격 하락이 전부 실질적 기술 진보를 반영하는 것은 아니며, 모델 선택 시 벤치마크 점수만으로 판단할 수 없음을 시사합니다.
AI 성능 비용, 역대 어떤 기술보다 빠르게 하락
특정 AI 벤치마크에서 고정된 성능 수준에 도달하는 가격이 2023년 이후 급격히 하락했다. AI 트렌드를 추적하는 연구기관 Epoch AI에 따르면 비용은 분기당 평균 약 47%, 즉 연간 약 13배씩 감소하고 있다. 이 그룹은 그 어느 변혁적 기술도 이렇게 빠르게 가격이 떨어진 적은 없다고 밝혔다. 다만 이 수치는 순수한 알고리즘·아키텍처 발전이나 실제 생산성 비용이 아니라 고정된 벤치마크 점수에 대한 시장 가격을 반영한 것이다.
MIT 연구진은 비교 가능한 데이터에서 연간 5~10배의 비용 하락을 확인했다. 이들이 더 저렴해진 하드웨어와 경쟁에 따른 가격 압박을 제거하면 실제 알고리즘 효율 개선은 연간 약 3배에 그친다고 추정한다. 반면 작업당 최고 성능을 발휘하는 실행은 오히려 비싸질 수 있는데, 최신 추론 모델은 작업당 훨씬 많은 컴퓨팅을 소모하기 때문이다. 두 연구는 서로 다른 질문을 던지고 있다. 작년의 최고 성능을 따라잡는 것은 극적으로 저렴해졌다. 하지만 현재 최고 모델을 실행하는 것은 쿼리당 더 비쌀 때가 많다.
o3 수준의 정확도가 이제는 새 발의 피
Epoch는 OpenAI의 o3를 예로 든다. 2025년 초 o3는 박사 과정 수준의 과학 시험인 GPQA Diamond에서 75%를 기록했으며 질문당 약 30센트의 비용이 들었다. 18개월 후 GPT-5.6 계열 모델은 0.04센트로 같은 점수를 달성했다. Epoch는 이것이 원래 가격의 1/725라고 말한다. 자동차 가격이 이 속도로 떨어졌다면 5만 유로짜리 차가 70유로 미만이 될 것이다. OpenAI는 며칠 전 더 저렴한 GPT-6 Sol과 Luna 모델을 출시했으므로 격차는 더 벌어졌을 것이다.
Epoch는 수학, 과학, 논리 퍼즐을 아우르는 5개 벤치마크에 분석을 기반을 두고 있다. 표본이 좁기 때문에 이 기관은 자신들의 결과를 '가용한 최선의 데이터에 기반한 합리적이지만 대략적인 측정'이라고 부른다.
알고리즘 개선은 하락의 일부만 설명
한스 군들라크(Hans Gundlach)와 MIT 동료들은 비교 플랫폼 인공 분석(Artificial Analysis)의 2024년 4월부터 2025년 11월까지 가격 데이터를 사용하며, 기존 연구보다 테스트당 훨씬 많은 모델을 평가했다. 이들의 수치가 Epoch보다 낮은 이유 중 하나는 최신 추론 모델이 어려운 문제에 추가 테스트 시간 컴퓨팅을 투입해 토큰당 가격이 계속 하락하는데도 정답당 비용을 끌어올릴 수 있기 때문이다. 토큰은 공급자가 과금하는 텍스트 단위로, 이것만 비교하면 전체 그림을 놓치게 된다.
MIT가 가격 하락의 요인을 분해했을 때 저렴해진 하드웨어가 일부를, 경쟁이 그보다 더 많은 부분을 차지했다. 연구진은 오픈 모델을 별도로 분석해 경쟁 요인을 통제했고, 남는 것이 순수 알고리즘 효율 개선으로 연간 약 3배로 산출됐다. Epoch의 13배 수치가 더 높은 것은 하드웨어와 경쟁 효과를 제거하지 않았기 때문이다.
더 높은 벤치마크 점수가 항상 더 나은 효율을 뜻하진 않는다
MIT는 일부 성능 향상이 단순히 더 많은 컴퓨팅을 소비한 결과라는 점도 발견했다. 새 모델이 GPQA Diamond에서 이전 모델을 능가하면 겉으로는 발전처럼 보이지만, 저자들은 개선의 상당 부분이 질문당 더 많은 처리 능력을 사용한 데서 나온다고 추정한다. 점수는 높지만 실행 비용도 더 크다. 코딩과 수학 벤치마크에서도 같은 패턴이 소규모로 나타난다.
모든 벤치마크 진보가 효율 진보인 것은 아니다. 새 모델은 더 나은 학습, 더 나은 데이터, 더 나은 아키텍처, 더 많은 테스트 시간 컴퓨팅이 뭉쳐 있는데, 단일 점수는 이 모든 것을 섞어버린다. '벤치맥싱(benchmaxxing)' 문제도 있다. AI 기업들이 잘 알려진 테스트에 최적화해 실제 성과 없이 점수를 부풀릴 수 있는 것이다. Epoch는 비밀리에 유지된 게임을 기반으로 한 '미스터리 게임 퍼즐'이라는 테스트를 포함해 이에 대비한다. 이 테스트에서 비용 하락이 가장 더뎌, 벤치맥싱 가설과 부합하지만 태스크 형식이나 데이터 노이즈를 반영하는 것일 수도 있다.
가격만으로 어떤 모델을 선택할지 알 수는 없다