브리스톨 연구진, 의약품 검증 방식을 의료 AI에 적용해야
영국 브리스톨 대학 연구진은 의료 AI 시스템의 신뢰성을 의약품 허가 절차처럼 체계적으로 검증하는 '러닝 앙상블(Learning Ensemble)' 프레임워크를 제안했다. 이는 시스템의 운영 한계와 학습 데이터, 환자 집단별 신뢰성, 실제 임상 적합성 등 세 가지 영역을 점검하는 것으로, 초기 실험에서는 좋았던 AI가 실제 진료 현장에서 실패하는 문제를 막기 위함이다.
브리스톨 연구진, 의학은 이미 블랙박스를 다루는 방법을 알고 있으며 AI가 그로부터 배울 수 있다고 주장
Manuel Uth / 2026년 9월 21일 / THE DECODER
핵심 요점
영국 브리스톨 대학 연구진은 의료 AI 시스템의 신뢰성을 의약품 검증 방식을 본떠 체계적으로 테스트할 것을 제안했다. '러닝 앙상블(Learning Ensemble)'이라 불리는 이 접근법은 세 가지 영역을 점검한다: 시스템의 운영 한계와 학습 데이터, 모든 환자 집단에서의 신뢰성, 그리고 일상적인 임상 사용에 대한 실제 적합성이다. 이 과정은 시스템이 실제 현장에서 무관한 이미지 패턴으로 인해 실패하거나 환자 위험도를 잘못 판단하는 것을 막기 위한 것이다.
본문
브리스톨 대학 연구진은 개발자가 의료용 AI 시스템의 신뢰성을 체계적으로 테스트할 수 있는 프레임워크를 제안했다. 이들은 의학이 신약을 시장에 내놓기 위해 사용하는 기준을 모델로 삼았다.
의료 AI 시스템은 초기 테스트에서 좋은 성능을 보이지만 실제 진료 현장에 투입되면 실패하는 경우가 많다. 실제 진단과 무관한 학습 데이터의 특징에 매달리기 때문이다.
의학은 몸 안에서의 정확한 작용 메커니즘이 완전히 이해되지 않은 약물과 비슷한 불확실성에 직면해 있다. 그럼에도 의학은 그러한 화합물을 신뢰성 있게 사용하는 방법을 발전시켜 왔다. 모든 약물에는 용량, 투여 시기, 대상 환자군 등 그 약물이 작동하는 조건을 명시한 구조화된 정보 패키지가 따른다. 그 패키지가야말로 화학 물질을 신뢰할 수 있는 치료법으로 만들어 준다.
이에서 착안해 브리스톨 연구진은 의료 AI 개발자를 위한 유사한 패키지를 제안한다.
세 부분으로 구성된 툴킷
제안된 '러닝 앙상블'은 시스템이 환자에게 사용되기 전에 개발자가 문서화하고 점검해야 할 세 가지 영역을 다룬다.
첫째는 시스템의 한계에 관한 것으로, 어떤 의사나 병원을 대상으로 하는지, 어떤 하드웨어에서 작동하는지, 어떤 환자 데이터로 학습되었는지를 포함한다. 2021년의 한 연구는 이것이 왜 중요한지 보여준다. 한 AI 시스템이 X선 이미지에서 코로나19 감염을 탐지해야 했지만, 폐의 질병 징후를 식별하는 대신 진단과 우연히 상관관계가 있었던 이미지의 부수적인 세부 사항에 의존했다. 그 시스템은 다른 병원에 배치되자마자 실패했다.
둘째는 환자 집단 전반에 걸친 신뢰성이다. 평균 적중률만으로는 부족하다. 시스템이 전반적으로는 좋아 보이면서 특정 집단에 대해서는 빠르게 잘못 판단할 수 있기 때문이다. 또 다른 2021년 연구에 따르면 X선 이미지를 판독하는 AI 시스템이 의료 혜택을 덜 받는 인구 집단에서 질병을 탐지할 확률이 훨씬 낮았다. 그런 시스템을 배치하면 이미 더 나쁜 의료 서비스를 받는 환자들에게 정확히 피해를 줄 것이었다.
셋째 영역은 연구진의 관점에서 가장 중요한 것으로, 시스템이 의도된 임상 목적에 적합한지 여부의 문제다. 기술적으로 작동하는 시스템도 진료 현장에서는 쓸모없을 수 있다. 예를 들어 한 AI 시스템은 폐렴에 걸린 천식 환자를 낮은 사망 위험군으로 분류했다. 학습 데이터에서 이들이 실제로 더 자주 생존하긴 했지만, 그것은 응급실이 이들을 특히 공격적으로 치료했기 때문이었다. 새로운 환자의 위험도를 평가하는 분류(triage) 목적으로는 그 결과가 무가치했다.
저자들은 자신의 연구를 출발점으로 본다. 실제로 신뢰할 수 있는 의료 AI 시스템을 구축하는 것은 전문성, 외부 검토, 지속적인 조정이 필요한 힘든 시행착오의 과정으로 남아 있다. 이들의 프레임워크는 개발자에게 문제를 더 일찍 발견할 수 있는 공통의 언어와 구조를 제공하는 것을 목표로 한다.
광고 없는 AI 뉴스 – 사람이 엄선합니다
THE DECODER를 구독하면 광고 없는 읽기, 주간 AI 뉴스레터, 연 6회 발행되는 독점 'AI 레이더' 프런티어 보고서, 전체 아카이브 접근, 댓글 섹션 이용이 가능합니다.
출처: Ratti & Zuchowski / Learning Ensembles | DeGrave et al. / COVID X-ray images | Seyyed-Kalantari / AI diagnosis bias