안스로픽, 클로드 페이블 5.1 출시…코딩·연구 성능 향상에 최대 45% 저렴
안스로픽이 클로드 페이블 5.1과 미토스 5.1을 출시했습니다. 에이전틱 코딩 및 연구 벤치마크에서 큰 성능 향상을 보이며, 캐시 읽기 비용을 4분의 1로 낮춰 일반 작업 약 25%, 복잡한 에이전틱 워크플로우에서는 최대 45% 비용을 절감했습니다. 또한 워터마크 내장과 사이버보안 등 특수 접근 프로그램 확대도 주요 변화입니다.
안스로픽이 클로드 페이블 5.1과 미토스 5.1이라는 최강의 AI 모델을 출시했습니다. 에이전틱 코딩과 텍스트 품질이 향상된 것과 함께, 비용도 최대 45% 절감했습니다.
이전 세대와 마찬가지로 두 5.1 모델은 동일한 기반 모델을 공유하지만 안전 가드레일에서 차이가 있습니다. 페이블 5.1은 일반적으로 이용 가능하며, 미토스 5.1은 사이버보안과 생명과학 분야의 특별 접근 프로그램으로 제한됩니다. 또한 최초로 워터마크를 내장한 클로드 모델이기도 합니다. 안스로픽은 비공개 프리뷰로 탐지 API를 출시해 규제기관, 언론, 팩트체커, 연구기관이 텍스트에 워터마크가 포함되어 있는지 검증할 수 있게 했습니다. 회사는 점진적으로 접근을 확대할 계획이며, 관심 있는 기관은 별도로 신청할 수 있습니다.
페이블 5.1은 일반적인 워크로드에서 페이블 5보다 약 25% 저렴하며, 많은 도구 호출이 포함된 긴 자율 실행 같은 고도의 에이전틱 작업에서는 절감 폭이 약 45%까지 늘어납니다. 이는 캐시 읽기 비용을 백만 토큰당 1달러에서 0.25달러로 대폭 인하했기 때문입니다. 나머지 API 가격은 변경 없이 백만 입력 토큰당 10달러, 백만 출력 토큰당 50달러입니다. 참고로 오퍼스 5는 백만 입력 토큰당 5달러, 출력 토큰당 25달러로 절반 가격입니다.
높은 비용은 페이블 5에 대한 가장 큰 불만이었으며, 기업 고객들 사이에서 채택률이 낮은 원인으로 추정됩니다. 오퍼스 5가 7월 말 출시되면서 더 낮은 가격으로 대부분의 벤치마크에서 페이블 5와 맞먹거나 능가하면서 가격 압박은 계속 커져 왔습니다.
기존 클로드 모델처럼 새 버전에도 연산량을 조절하는 노력 수준(effort level) 시스템이 있습니다. 낮거나 중간 노력 수준에서는 페이블 5.1이 더 낮은 비용으로 페이블 5와 동등한 결과를 낼 것으로 기대됩니다.
코딩·연구 벤치마크에서 큰 도약
페이블 5.1은 에이전틱 벤치마크에서 큰 향상을 보였습니다. Terminal-Bench-Science 0.1에서는 52.6%를 기록해 페이블 5의 24.7%를 두 배 이상 뛰어넘었고, 22.4%의 GPT-5.6 Sol도 크게 앞섰습니다. 에이전틱 코딩 벤치마크인 Terminal-Bench 4.0에서는 페이블 5.1이 55.8%, 미토스 5.1이 60.9%를 기록해 페이블 5의 42.0%와 GPT-5.6 Sol의 37.3%를 웃돌았습니다. 이러한 성과가 실제 사용 환경에서도 같은 규모로 이어질지는 앞으로 몇 주간 지켜봐야 알 수 있습니다.
주요 벤치마크 결과:
- 에이전틱 과학 연구 Terminal-Bench-Science 0.1: 페이블 5.1 52.6%, 페이블 5 24.7%, 오퍼스 5 29.0%, GPT-5.6 Sol 22.4%
- 에이전틱 코딩 Terminal-Bench 4.0: 페이블 5.1 55.6%/미토스 5.1 60.9%, 페이블 5 42.0%, 오퍼스 5 52.3%, GPT-5.6 Sol 37.3%
- 지식 작업 GDPval-AA v2: 페이블 5.1 1853점, 페이블 5 1723점, 오퍼스 5 1824점, GPT-5.6 Sol 1711점
- 컴퓨터 사용 OSWorld 2.0(부분): 페이블 5.1 77.9%, 페이블 5 72.9%, 오퍼스 5 75.4%
- 컴퓨터 사용 OSWorld 2.0(엄격): 페이블 5.1 41.7%, 페이블 5 36.1%, 오퍼스 5 39.6%
- 다학제 추론 Humanity's Last Exam(도구 없음): 페이블 5.1 60.9%, 페이블 5 57.8%, 오퍼스 5 56.6%
- 다학제 추론 Humanity's Last Exam(도구 사용): 페이블 5.1 65.0%, 페이블 5 63.8%, 오퍼스 5 63.6%
- 비즈니스 워크플로우 AutomationBench: 페이블 5.1 31.4%, 페이블 5 17.1%, 오퍼스 5 26.9%, GPT-5.6 Sol 19.6%
- 에이전틱 코딩 CursorBench 3.2.0: 페이블 5.1 73.4%, 페이블 5 70.5%, 오퍼스 5 70.0%, GPT-5.6 Sol 67.2%
안스로픽 연구원 펠릭스 리제베르크(Felix Rieseberg)에 따르면 페이블 5.1은 글쓰기 스타일도 개선되었습니다. 이전 모델들은 채팅에서 글머리 기호와 굵은 글씨에 지나치게 의존했는데, 페이블 5.1은 이를 줄이고 스타일 지시를 더 충실히 따르며 전반적으로 더 자연스럽게 들립니다.
페이블 5.1, 사이버보안 작업 개방
사이버보안, 생물학, 의학 질문에 대한 안전 필터가 이전 버전보다 덜 공격적입니다. 5.0 모델에서는 필터가 너무 민감해서 잘 알려진(원문 여기서 잘림)