쿼사르 438B: 유럽 최고 성능 AI 모델 등장
멀티버스 컴퓨팅이 기업용 에이전트와 코딩을 위한 438B 규모 추론 모델 '쿼사르 438B'를 공개했습니다. Artificial Analysis 지능 지수에서 43점을 기록하며 유럽 모델 중 최고 성능을 달성했고, 500토큰 응답에 15.3초 만에 완료하는 프론티어급 속도도 갖췄습니다. CompactifAI API를 통해 인프라 구축 없이 테스트할 수 있습니다.
쿼사르 438B(Quasar 438B)는 기업 규모의 에이전트와 코딩을 위해 설계된 우리의 대표 추론 모델입니다. 이는 멀티버스 컴퓨팅(Multiverse Computing)이 출시한 첫 대형 모델로, 영어와 스페인어로 작동하며, Artificial Analysis 지능 지수에서 43점을 기록해 해당 분야 유럽 모델 중 최고 성적을 달성했습니다. 지능 지수 v4.1.1은 GDPval-AA v2, τ³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience, AA-LCR 등 9개 평가를 종합한 것입니다. 쿼사르의 43점은 미스트랄 미디움 3.5(Mistral Medium 3.5)의 30점, 엔비디아 네모트론 3 울트라(NVIDIA Nemotron 3 Ultra)의 38점, 잉클링(Inkling)의 42점을 앞서며, 클로드 오퍼스 5(Claude Opus 5)가 63점으로 선두를 달리는 분야입니다. 쿼사르는 지능적일 뿐만 아니라 빠릅니다. 추론 시간을 포함해 500토큰을 15.3초 만에 반환합니다. 비교 대상 중 단 3개 모델만이 더 빠르며, 그중 지수에서 더 높은 점수를 받은 모델은 제미나이 3.7 플래시(Gemini 3.7 Flash) 하나뿐입니다. 쿼사르보다 점수가 높은 모델 중 25초 이내에 답변하는 모델은 2개뿐이며, 나머지는 38~156초가 걸립니다. 멀티버스 컴퓨팅은 AI를 더 효율적이고 배포 가능하게 만드는 데 입지를 쌓아왔습니다. 쿼사르는 그 성과를 400B 이상 파라미터급으로 확장한 것으로, 계획 수립, 도구 사용, 코드 실행, 대형 컨텍스트가 필요한 다단계 작업을 위한 추론 모델이면서도 해당 급 모델이 보통 수반하는 지연 시간이 없습니다. 이 모델은 CompactifAI API를 통해 제공되어, 인프라를 구축하지 않고도 팀이 테스트할 수 있습니다. 최고 점수를 기록한 유럽 모델. 그림 1. 9개 평가를 종합한 Artificial Analysis 지능 지수 v4.1.1. 높을수록 좋습니다. 쿼사르는 종합 지수에서 43점을 받았습니다. 이는 미스트랄 미디움 3.5보다 13점, 1120억 개 더 많은 파라미터를 갖춘 네모트론 3 울트라보다 5점 앞선 성적입니다. 프론티어급 속도. 그림 2. 종단 간 응답 시간: 추론 시간 포함 500토큰 출력까지의 초. 낮을수록 좋습니다. 쿼사르는 500토큰 응답을 15.3초에 완료합니다. 비교 대상 중 더 빠른 3개 모델은 지수 24점의 네모트론 3.5 라이트닝(9.4초), 37점의 제미나이 3.5 플래시-라이트(10.8초), 56점의 제미나이 3.7 플래시(11.5초)이며, 마지막 모델만이 속도와 성능 모두 앞섭니다. 반대로 보면 격차가 더 큽니다. 쿼사르는 43점에 15.3초, 미스트랄 미디움 3.5는 30점에 18.8초, 네모트론 3 울트라는 36점에 25.7초, 잉클링은 42점에 48.3초로 쿼사르 438B보다 두 배 이상 걸립니다. 미스트랄 미디움 3.5와의 비교는 두 축 모두에서 일방적입니다: 쿼사르가 점수(43 대 30)와 응답 속도(15.3초 대 18.8초) 모두 앞섭니다. 롱컨텍스트 추론. 그림 3. AA-LCR 점수. 높을수록 좋습니다. 쿼사르는 긴 문서에 분산된 정보를 추출·연결·추론하는 능력을 평가하는 AA-LCR에서 75.0점을 받았습니다. 이는 Grok 4.6(하이)(high)의 75.0점과 동률이며, 클로드 오퍼스 5의 75.7점, Qwen3.8 2.4T A95B의 75.3점과 1점 이내 차이입니다. 네모트론 3 울트라보다 4.0점, 미스트랄 미디움 3.5보다 9.7점 앞섭니다. 롱컨텍스트 처리는 기업 리서치, 문서 분석, 에이전트 워크플로의 기반이며, 쿼사르가 프론티어 그룹에 가장 근접한 분야입니다. 에이전트 코딩 및 터미널 작업. 그림 4. Terminal-Bench v2.1 점수. 높을수록 좋습니다. 쿼사르는 실제 터미널 환경에서 에이전트를 평가하는 Terminal-Bench v2.1에서 69.3점을 받았습니다. 미스트랄 미디움 3.5보다 18.7점, 네모트론 3 울트라보다 15.4점 앞서며, 클로드 오퍼스 5가 89.1점으로 이끄는 프론티어 그룹에는 뒤집니다. 이는 쿼사르에게 가장 개선 여지가 큰 평가로, 다음 작업의 목표가 되는 분야입니다. 한눈에 보는 4가지 결과. 표 1. Artificial Analysis가 제공한 4개 차트에서 본 쿼사르 438B. 출처: Artificial Analysis. 기업 규모 에이전트와 코딩을 위해 설계. 쿼사르는 소프트웨어 개발 에이전트, 기술 코파일럿, 리서치 시스템, 워크플로 자동화를 운영하는 조직을 위해 설계되었습니다. Terminal-Bench와 롱컨텍스트 결과는 컨텍스트를 유지하고, 작업을 조율하며, 다단계 작업을 수행해야 하는 에이전트를 뒷받침합니다.