앤스로픽, '클로드 소네트 5' 공개... 비싼 오퍼스 모델과의 격차를 줄이다
앤스로픽이 자율적 에이전트 능력을 대폭 강화한 '클로드 소네트 5'를 출시했습니다. 이 모델은 이전 모델을 전 분야에서 압도할 뿐만 아니라, 실제 지식 작업(Task)에서는 기존 최상위 모델인 오퍼스 4.8을 근소하게 뛰어넘는 성능을 보여줍니다. 사이버 보안 위험을 낮추면서도 100만 토큰의 컨텍스트 윈도우를 지원하며, 8월 말까지는 할인된 도입가로 제공됩니다.
앤스로픽, 비싼 오퍼스 모델과의 격차를 줄인 '클로드 소네트 5' 공개
앤스로픽은 클로드 소네트 5(Claude Sonnet 5)를 출시했습니다. 벤치마크 결과에 따르면 이 모델은 더 큰 규모의 오퍼스 4.8(Opus 4.8)에 근접했으며, 일부 분야에서는 이를 능가하기도 했습니다. 현재 도입 할인가로 모델을 사용할 수 있습니다.
앤스로픽은 이 모델을 '지금까지 가장 에이전트(Agent)화된 소네트'라고 부릅니다. 이 모델은 스스로 계획을 세우고, 브라우저나 터미널 같은 도구를 잡아(활용해) 작업을 수행할 수 있습니다. 불과 몇 달 전만 해도 더 크고 비싼 모델만이 소화할 수 있었던 수준으로 독립적으로 작동하며, 소네트 5는 이러한 격차를 줄이는 것을 목표로 합니다.
소네트 4.6 대비 확실한 도약을 보여주는 벤치마크
앤스로픽이 공개한 벤치마크에 따르면, 소네트 5는 모든 테스트 카테고리에서 이전 버전인 소네트 4.6을 뛰어넘었으며, 더 비싼 오퍼스 4.8의 성능에 근접했습니다. 에이전트 코딩(Agentic coding)을 측정하는 SWE-bench Pro에서 소네트 5는 63.2%를 기록하며 소네트 4.6(58.1%)을 앞섰습니다. 오퍼스 4.8은 69.2%를 기록했습니다. Terminal-Bench 2.1에서는 소네트 5가 80.4%를 기록한 반면, 소네트 4.6은 67.0%에 그쳤습니다. 다학제간 추론(Humanity's Last Exam)에서는 도구 사용 시 57.4%에 도달하며 57.9%를 기록한 오퍼스 4.8과 거의 비슷한 수준을 보여주었습니다. 컴퓨터 사용(OSWorld-Verified) 분야에서는 소네트 5가 81.2%를 기록해 이전 모델(78.5%)을 능가했습니다.
특히 실제 지식 작업(Real-world knowledge tasks)에서 AI를 테스트하는 GDPval-AA v2 벤치마크에서는 소네트 5가 1,618점을 기록하며 1,615점을 받은 더 큰 규모의 오퍼스 4.8을 실제로 이겼습니다. 앤스로픽은 얼리 액세스 파트너들의 피드백 역시 같은 결과를 보여주었다고 밝혔습니다. 소네트 5는 검색 작업을 처리하는 방식 등에서 이전 버전들보다 훨씬 더 능동적으로 에이전트처럼 행동합니다.
이번에는 사이버 보안이 우려사항이 아니다
최근 앤스로픽은 출시하지 못하는 모델들로 뉴스거리가 되었습니다. 미국 정부는 사이버 보안 우려를 이유로 앤스로픽의 가장 성능이 좋은 두 모델인 Mythos 5와 Fable 5의 출시를 막고 있습니다. 이러한 상황은 소네트 5 출시에도 영향을 미쳤고, 앤스로픽은 유사한 우려가 생기는 것을 방지하고자 명확히 선제 대응했습니다.
앤스로픽에 따르면 이 모델은 사이버 보안 작업으로 훈련되지 않았으며, 소프트웨어 취약점 공격 코드 작성과 같은 위험한 능력을 테스트할 때 오퍼스 4.8과 Mythos 5보다 훨씬 낮은 점수를 받습니다. 다만 이러한 작업에서 이전 모델보다는 약간 높은 점수를 기록했기 때문에, 앤스로픽은 기본적으로 사이버 보안 장치를 활성화했습니다. 이는 위험한 사이버 사용을 실시간으로 표시하고 차단하며, 클로드 오퍼스 4.7 및 4.8에 이미 적용된 보호 장치와 동등한 수준입니다. 사용자들이 불만을 제기했던 Fable 5의 제한적인 가드레일과 비교하면 다소 완화된 수준입니다. 앤스로픽은 소네트 5의 전반적인 사이버 보안 위험이 낮다고 평가하고 있습니다.
안전성 측면에서 앤스로픽에 따르면, 이 모델은 소네트 4.6에 비해 악의적인 요청을 거부하고 프롬프트 삽입 공격(Prompt Injection)을 방어하는 능력이 향상되었습니다. 또한 환각(Hallucination) 현상과 사용자가 하는 말이라면 무조건 동조하는 아첨(Sycophantic) 행동도 줄어들었습니다. 앤스로픽의 전체 안전성 평가는 '클로드 소네트 5 시스템 카드(System Card)'에 자세히 나와 있습니다.
2026년 8월까지 적용되는 도입 할인가
클로드 소네트 5는 현재 모든 요금제에서 사용 가능합니다. 이 모델은 무료(Free) 및 프로(Pro) 사용자의 새로운 기본 모델이며, 맥스(Max), 팀(Team), 엔터프라이즈(Enterprise) 구독자도 접근할 수 있습니다. 개발자들은 클로드 코드(Claude Code)와 클로드 플랫폼(Claude Platform)에 이 모델을 연동할 수 있습니다. API 측면에서는 'claude-sonnet-5'라는 이름으로 제공됩니다. 훈련 데이터 기준일은 2026년 1월이며, 100만 토큰의 컨텍스트 윈도우(Context Window)를 지원합니다.
2026년 8월 31일까지 앤스로픽은 백만 입력 토큰당 2달러, 백만 출력 토큰당 10달러의 요금을 부과합니다.