베이스텐, 허깅페이스·굿파이어와 오픈 가중치 AI 안전성 파트너십 출범
AI 인퍼런스 기업 Baseten이 연구 조직 Base Labs와 함께 허깅페이스(Hugging Face), Goodfire AI와 손잡고 오픈 가중치 모델을 위한 안전성 평가·모니터링 인프라 표준을 구축합니다. '어블리터레이션(abliteration)' 기법으로 안전장치가 제거된 모델이 허깅페이스에만 6,000개 이상 올라와 있는 상황에서, 사후 조치가 아닌 모델 학습·배포 단계에 내장되는 투명한 안전 표준을 만든다는 것이 핵심입니다.
Baseten은 수요일, 올해 초 설립한 연구 조직인 Base Labs와 함께 새로운 안전 인프라 표준을 발표했다. 허깅페이스(Hugging Face) 및 Goodfire AI와 파트너십을 맺고 오픈 가중치(open-weight) 모델을 위한 안전성 평가 및 모니터링 인프라를 구축하는 것이다.
이 발표는 오픈 가중치 모델의 안전성을 둘러싼 논쟁 한가운데 나왔다. 최근 '어블리터레이션(abliteration)'이라는 기법이 부상하면서 오픈 가중치 모델의 안전장치가 제거되어 위험해질 수 있기 때문이다. 문제의 규모는 상당하다. 오픈소스 AI 모델을 호스팅하는 허깅페이스에는 현재 어블리터레이션된 모델이 6,000개 이상 등록되어 있다.
Baseten이 올해 초 만든 연구 그룹인 Base Labs는 오픈 모델의 학습 및 모니터링 방법론을 개발하고 공개할 예정이다. 회사는 향후 작업을 사후에 덧붙이는 방식이 아니라 모델이 학습되고 배포되는 방식 자체에 내장되는, 투명한 오픈 모델 '표준'으로 규정하고 있다.
회사는 X(트위터)에서 "우리는 개방성이 AI 안전성에 이점이라고 믿는다. 개방성은 모델의 행동에 대한 더 많은 가시성을 제공하며, 무엇보다 폐쇄형 소스보다 안전 연구를 실행 가능하고 투명한 통제 수단으로 전환할 더 나은 방법을 제공한다"고 밝혔다.
이 파트너십이 기술적으로 어떻게 작동할지는 공개되지 않았지만, Goodfire는 Baseten 게시물에 대한 답글에서 목표를 이렇게 정리했다. "안전성은 오픈 모델에 내장되어야 하며, 이를 서비스하는 주체가 제공해야 한다." 모델이 결정을 내리는 방식을 설명하기 위해 AI의 '블랙박스'를 여는 것을 전문으로 하는 Goodfire가 '내장' 부분의 가장 유력한 담당자로 보인다.
AI 인퍼런스 제공업체인 Baseten은 6월에 15억 달러 규모의 시리즈 F 투자를 유치하며 기업가치가 130억 달러로 급등했다. 파트너인 Goodfire AI도 마찬가지로 자금이 충분하다. 올해 초 B Capital이 주도한 1억 5,000만 달러 규모의 시리즈 B 투자를 유치하며 모델 해석가능성(interpretability) 플랫폼을 발전시켜 왔다.
앞으로 Baseten은 더 넓은 개발자 생태계에 프레임워크 기여를 위한 공개적인 참여 요청을 이어갈 계획이다. 회사는 "우리는 함께, 모두에게 안전하고 접근 가능한 오픈 모델의 생태계를 만들어가고 있다"고 덧붙였다.