터미널벤치-사이언스: 과학 연구 워크플로에서 AI 에이전트 평가
스탠퍼드 대학 연구진이 주도하고 Terminal-Bench 팀이 개발한 'Terminal-Bench-Science'는 실제 과학자들의 연구 워크플로를 기반으로 AI 에이전트의 과학적 역량을 평가하는 벤치마크입니다. 첫 버전(0.1)은 생명·물리·지구·수학·공학 분야의 70개 과제를 포함하며, 가장 성능이 좋았던 Claude Opus 5의 해결률은 30%에 그쳤습니다. 이 벤치마크는 모델 개발사가 아닌 과학자들이 기준을 설정하고, 최신 AI 발전에 맞춰 지속적으로 진화하는 것이 특징입니다.
Terminal-Bench-Science 0.1
Terminal-Bench-Science는 연구자들의 실제 연구 워크플로를 바탕으로 AI 에이전트를 평가합니다. 모델 개발사나 데이터 공급업체가 아닌 과학자들이 AI의 과학적 역량 기준을 설정합니다.
Terminal-Bench-Science는 스탠퍼드 대학교 연구진이 주도하고 Terminal-Bench를 개발한 팀이 전 세계 다양한 과학 분야 및 연구기관의 도메인 전문가들과 협력하여 구축한 벤치마크입니다. 과학 연구에서 추출한 다양하고 도전적인, 전문가가 직접 큐레이션한 워크플로를 통해 AI 에이전트의 역량을 측정합니다. Terminal-Bench-Science는 최첨단 AI와 함께 진화하는 지속적인 벤치마크로, 과학적 필요와 AI 개발 사이의 피드백 루프를 만듭니다. 첫 릴리스에는 생명과학, 물리과학, 지구과학, 수학, 공학 분야의 70개 과제가 포함되어 있습니다. 평가된 모델 중 가장 강력했던 Claude Opus 5는 Terminal-Bench-Science 0.1에서 30%의 해결률을 기록했습니다.
개요
Terminal-Bench가 소프트웨어 엔지니어링 분야의 AI 에이전트 발전을 이끌어왔다면, Terminal-Bench-Science는 같은 야망을 과학 분야로 가져옵니다. 우리의 목표는 에이전트가 유용한 연구 조수가 될 수 있는 과학적 역량을 갖추도록 개발을 촉진하는 것입니다. 이러한 에이전트는 기술적으로 어렵고 시간이 많이 소요되는 워크플로를 수행함으로써, 과학자들이 인간의 판단이 가장 중요한 부분—연구 질문 정의, 가설 수립, 결과 해석 및 검증, 연구 결과 소통—에 더 많은 시간을 집중할 수 있게 해줍니다. 이런 역할에서 AI 에이전트는 연구자가 달성할 수 있는 성과를 확장하고 과학적 발견을 가속화하는 데 도움이 될 수 있습니다.
이를 위해서는 실제 과학 실천을 반영하고, 역량에 대한 검증 가능한 증거를 제공하며, 최첨단 AI와 함께 발전하는 벤치마크가 필요합니다.
실제 과학 워크플로에서 추출한 벤치마크가 필요합니다. 과학적 역량은 현직 과학자들이 직접 제공하는 실제 연구 실천으로 평가되어야 하며, 교과서 질문이나 표준화된 연습 문제가 아니어야 합니다. Terminal-Bench-Science는 여러 분야의 과학자들에게 직접적인 발언권과 공통 플랫폼을 제공하여, 자신들이 관심을 두는 문제에 대해 AI 발전의 기준을 설정할 수 있게 합니다. 과학에서의 요건은 매우 높으며, 벤치마크는 외부 이해관계가 아닌 과학 공동체의 우선순위를 반영해야 합니다.
과학적 역량에 대한 검증 가능한 증거가 필요합니다. 신뢰할 수 있는 평가 없이는 에이전트의 역량이 향상되고 있는지, 한계가 어디에 남아 있는지 알 수 없습니다. Terminal-Bench-Science는 현실적인 환경에서 에이전트를 평가하고, 분석, 시뮬레이션, 증명, 코드, 데이터 산출물 등 구체적인 결과물을 재현 가능한 과제별 테스트로 채점합니다.
최첨단과 보조를 맞추는 벤치마크가 필요합니다. 과학 벤치마크는 종종 진보를 이끄는 메커니즘이 아니라 발표용 논문처럼 취급됩니다. 한 번 출시된 후 모델이 발전하고 알려진 한계가 지속됨에도 방치됩니다. Terminal-Bench-Science는 최첨단 AI와 함께 진화하는 지속적인 벤치마크입니다. 정기적인 릴리스를 통해 과학자들은 새로운 워크플로를 기여하고, 기존 과제를 개선하며, 과학적 필요와 AI 개발 간의 피드백 루프를 만들 수 있습니다.
과제
Terminal-Bench-Science 0.1은 생명과학, 물리과학, 지구과학, 수학, 공학에 걸쳐 70개 과제를 포함합니다. 과제는 과학 데이터 분석, 통계적 추론, 시뮬레이션, 최적화, 정리 증명, 영상 복원, 신호 처리, 역문제, 센서 보정, 모델 피팅, 분류, 과학 머신러닝 등을 다룹니다. 과제는 GitHub의 공개 프로세스를 통해 연구자들이 기여하며, Discord의 #tb-science 채널에서 논의와 피드백이 이루어집니다. 기여는 제안으로 시작되며, 리뷰어가 각 아이디어를 논의하고 피드백을 남기고, 벤치마크에서 측정할 가치가 있는 과학적으로 근거 있는 워크플로로 판단되는 것을 승인합니다. 승인된 제안은 풀 리퀘스트로 구현되며, 리뷰어는 각 과제가 (원문 여기서 끊김)