LLM 지능 대비 비용 그래프의 오해와 진짜 비교
OpenTeams 엔지니어가 ArtificialAnalysis의 '지능 vs 비용' 그래프가 로그 스케일 사용, 공식 API 가격만 반영, 로컬 모델의 데이터센터 가격 표기 등으로 실제 비용 차이를 왜곡한다고 지적합니다. 저자는 선형 스케일과 실제 최저 임대 가격, 로컬 실행 전기요금을 반영한 자체 그래프를 공유하며, 단순 작업에 비싼 모델을 쓰는 것은 낭비임을 강조합니다.
2026년 9월 1일, LLM: 지능 대비 비용 — 구이도 임페리알레(OpenTeams 스탭 소프트웨어 엔지니어, Dask 메인테이너)
ArtificialAnalysis는 다양한 LLM 모델의 지능을 벤치마크하는 웹사이트입니다. 이들은 각 모델에 대해 실행한 엄선된 벤치마크 결과의 평균으로 '지능 지수(Intelligence Index)'라는 대표 지표를 발표하며, 모델이 전반적으로 얼마나 똑똑한지 대략적으로 가늠할 수 있는 괜찮은 척도입니다.
AA는 유용한 정보, 즉 벤치마크를 실행하는 데 든 비용도 기록합니다. 벤치마크는 모든 모델에서 동일하므로, 각 모델을 사용자가 실행할 때 상대적으로 얼마나 비용이 드는지 좋은 지표가 됩니다. 이들의 대표 그래프 중 하나는 '지능 대비 비용' 플롯으로, 파레토 프론티어, 즉 각 지능 점수를 달성할 수 있는 가장 저렴한 모델을 보여줍니다. 이 프론티어가 중요한 이유는, 훨씬 멍청하고 저렴한 모델으로 처리 가능한 단순 작업에 초지능적이고 초고가인 모델을 사용하는 것은 그저 돈 낭비이기 때문입니다.
시간이 지나며 몇 가지 이유로 이 그래프가 점점 거슬리게 되었습니다.
AA 그래프가 오해를 부리는 이유
첫 번째 문제는 비용 축에 로그 스케일을 사용한다는 것입니다. 태스크당 $0.015인 모델과 $0.032인 모델의 차이를, 같은 그래프에 있는 $3.69짜리 모델(거의 250배 비쌈)과 구분해서 보여주려면 로그 스케일이 유일한 방법입니다. 하지만 그 결과, 독자들은 저렴한 모델과 고가 모델 사이의 어마어마한 가격 차이를 실감하지 못하고, 저렴한 모델들 사이의 가격 차이가 얼마나 사소한지도 깨닫지 못하게 됩니다.
두 번째로 신경 쓰이는 점은 모델 개발사의 공식 API 가격을 사용한다는 것입니다. 대부분의 경우 괜찮지만, 오픈 웨이트(공개 가중치) 모델의 경우 서드파티 API 제공자에게 동일한 모델을 임대하는 가격보다 훨씬 비쌀 수 있습니다. OpenRouter를 이용하면 즉시 제공자를 전환해 항상 최저가를 받기 쉽습니다.
세 번째이자 마지막 문제는 로컬 모델, 즉 소비자용 하드웨어에 들어갈 수 있는 모델이 데이터센터 가격으로 그래프에 표시된다는 점입니다. 이는 구매하는 지능 대비 항상 매우 비싸고, 결코 실제 사용자가 실제로 사고 싶어 할 만한 것이 아닙니다.
직접 그래프를 만들었습니다
모든 지능 지수 점수는 ArtificialAnalysis 출처입니다. 명시되지 않는 한 모든 지점은 최대 사고(thinking) 노력으로 벤치마크되었습니다. 아래 명시된 경우를 제외하고 비용 점수 역시 ArtificialAnalysis 출처입니다.
첫 번째 그래프는 2026년 9월 1일 기준 가장 지능적인(그리고 비싼) 모델들의 시장입니다. 지능 축을 읽는 좋은 경험칙: 1점 차이는 대부분 눈치채기 어렵고, 5점 차이는 상당히 큽니다. 짚어둘 점은, 첫 그래프에서 최하위인 지능 점수 50이 대략 2026년 2월 당시 세계에서 가장 똑똑했던 모델(Opus 4.6)이 낼 수 있는 수준이라는 것입니다.
왼쪽 아래 초록색 영역은 모델이 극도로 저렴해지는 곳입니다. 이 부분을 확대하고 지능 범위를 더 낮춰, 오늘날 스마트폰에서 실행 가능한 수준까지 내려가 봅시다.
일부 모델에는 ⚡ 기호가 붙어 있습니다. 이는 모델이 너무 작아 데이터센터에서 서빙하는 것이 무의미하기 때문에, 로컬에서 실행하는 전기요금으로 비용을 계산했다는 뜻입니다(계산 방식은 아래 참조). 로컬 모델끼리 비교할 때는 각 모델이 작업을 완료하는 데 걸리는 시간에 대한 척도도 제공합니다.
마지막으로, 성능/비용의 수익 체감(diminishing returns)을 더 잘 시각화하기 위해 두 그래프를 합쳐 봅시다. 모든 그래프에 공통인 영역은 초록색으로 강조했습니다.
AA 그래프와 내 그래프의 모든 차이점
- x축 스케일을 로그에서 선형으로 변경 — 사람의 돈은 로그 스케일이 아니기 때문
- Kimi K3, Qwen3.8 Max, DeepSeek V4 Flash 0731, GLM-5.3, GLM-5.3 (이하 원문 누락)