마이크로소프트, 텍스트 설명으로 AI 행동 테스트 생성 도구 공개
마이크로소프트가 자연어로 작성된 목표와 정책을 기반으로 AI 시스템의 동작을 평가하고 회귀 테스트(Regression Test)를 자동 생성하는 오픈소스 프레임워크 'ASSERT'를 공개했습니다. 이 도구는 개발자가 특정 제품이나 서비스에 맞춰진 AI 모델이 의도한 대로 안전하게 작동하는지 지속적으로 검증할 수 있게 도와주며, 평가 과정의 간소화와 신뢰성 향상에 기여할 것으로 보입니다.
AI 연구원과 연구소들은 안전성 및 규정 준수부터 아부(sycophancy) 및 정렬(alignment)에 이르기까지 모든 측면에서 AI 모델을 평가하는 데 비약적인 발전을 이루었습니다. 하지만 기업과 개발자들은 새롭고 구체적인 요구 사항에 직면한 것으로 보입니다. 바로 자신들의 특정 제품이나 서비스에 맞게 AI 시스템이 의도한 대로 작동하는지 확인하는 것입니다. 이러한 테스트 과정을 더 간단하게 만들기 위해, 마이크로소프트는 화요일에 ASSERT(Adaptive Spec-driven Scoring for Evaluation and Regression Testing)의 베일을 벗었습니다.
마이크로소프트에 따르면, 이 오픈소스 프레임워크는 AI를 활용해 목표, 정책 또는 의도된 동작에 대한 고수준의 자연어 설명을 철저하고 점수가 매겨진 테스트로 변환하여 애플리케이션 특화 AI 동작 평가를 쉽게 만들어줍니다. ASSERT는 AI 모델의 예상 동작 및 정책에 대한 일상적인 언어 설명을 받아들이고, 이를 수용 가능한 동작과 수용할 수 없는 동작의 구조화된 세트로 변환한 뒤, 문제 시나리오와 테스트 케이스를 생성하여 대상 시스템에 대해 실행하고 그 결과를 점수화합니다. 또한 개발자가 오류가 발생한 위치를 검사할 수 있도록 중간 동작 및 도구 호출(tool call)을 포함하여 AI 시스템이 거치는 경로를 기록할 수도 있습니다. 개발자는 평가 범위를 추가로 사용자 정의하기 위해 시스템 컨텍스트, 도구 및 제약 조건을 제공할 수도 있습니다.
예를 들어, 개발자가 문서 연구 AI 에이전트가 회사 외부의 사람에게 이메일을 보내지 않도록 지정하고, 기밀 정보를 C-레벨 임원으로 제한하며, 이전 맥락을 고려하여 간결한 요약을 제공하도록 지정할 수 있습니다. ASSERT는 이러한 규칙을 사용하여 시스템이 지속적으로 해당 규칙을 따르는지 확인하는 테스트 케이스를 생성합니다. 마이크로소프트에 따르면, 이 프레임워크는 AI 모델이 애플리케이션이나 제품의 맥락, 정책 및 도구에 의해 형성된 방식으로 동작해야 할 때, 더 광범위하고 일반적인 평가가 채울 수 없는 공백을 메웁니다.
마이크로소프트의 책임 있는 AI(Responsible AI) 최고 제품 책임자(CPO)인 사라 버드(Sarah Bird)는 "우리가 배운 것 중 하나는 평가가 좋은 결정을 내리는 데 절대적으로 중요하다는 것입니다. AI 시스템의 동작을 이해하지 못하면 조직의 기준을 충족하는지 알기가 정말 어렵기 때문입니다. 우리가 발견한 것은, 정말로 신뢰할 수 있는 시스템을 원한다면 애플리케이션에 특화된 훨씬 더 많은 차원을 평가해야 한다는 것입니다."라고 말했습니다. 버드는 ASSERT를 시스템 구축 시, 배포 후, 그리고 지속적인 모니터링을 위해 시스템을 평가하는 데 사용할 수 있다고 덧붙였습니다.
이번 릴리스는 AI 산업 전반에 걸쳐 점진적이지만 폭넓은 변화가 일어나고 있는 가운데 나왔습니다. 모델이 더욱 강력해짐에 따라 연구원들은 반복 가능한 테스트와 회귀 검사에 초점을 맞추고 있으며, 스탠퍼드의 HELM, MLCommons의 AILuminate, METR과 같은 평가 기관들은 모델이 다양한 조건에서 어떻게 동작하는지 측정하기 위한 벤치마크를 출시하고 있습니다.