메뉴

#AI벤치마크

TD
The Decoder • 50일 전
IMP 7

알리바바 큐웬3.8 맥스, 클로드와 동급...하지만 비용·환각 문제는 여전

알리바바의 최신 모델인 Qwen3.8 Max가 지능 지수에서 Claude Opus 4.8과 맞먹는 수준으로 성능이 크게 향상되었습니다. 하지만 과도한 토큰 처리량 증가로 인해 오히려 작업당 비용은 크게 상승했으며, 모르는 질문을 억지로 추측하면서 환각(Hallucination) 현상도 급증한 한계를 보입니다.

알리바바 큐웬 인공지능모델
TD
The Decoder • 155일 전
IMP 9

오픈AI, GPT-5.5 공개... API 가격 2배 '새로운 지능'

오픈AI가 복잡한 작업을 자율적으로 수행하는 에이전트 기반 모델 'GPT-5.5'를 공개했습니다. 이 모델은 코딩, 웹 검색, 데이터 분석 등에 강점을 보이며 주요 벤치마크에서 경쟁 모델들을 큰 폭으로 앞섰습니다. 다만, 이에 상응하는 성능 향상을 제공하지만 API 호출 비용은 기존 대비 2배로 인상되었습니다.

오픈AI GPT-5.5 에이전트AI