최신 연구: 의료 AI, 의사 진단 능가
최신 의학 저널 '네이처(Nature)'에 발표된 두 편의 연구에 따르면, 독일의 MIRA와 구글의 AMIE 같은 특화된 의료 AI 시스템이 의사와 동등하거나 그 이상의 진단 및 치료 계획 능력을 보여주었습니다. 특히 이 시스템들은 단순 챗봇을 넘어 환자 정보 수집부터 처방, 입원 결정까지 전 과정을 자율적으로 수행하며 높은 정확도와 안전성을 입증했습니다. 이는 실제 임상 환경에서 AI가 핵심적인 역할을 할 수 있음을 보여주는 중요한 이정표입니다.
원문 제목: 최신 네이처(Nature) 논문에서 의사에 필적하는 성능을 보인 AI 시스템, 하지만 기술의 수명이 짧을 수 있다는 결과도 나와
작성자: 막시밀리안 슈라이너 (Maximilian Schreiner), 2026년 6월 18일
최근 네이처(Nature)에 발표된 두 편의 새로운 연구에 따르면, 특수하게 설계된 AI 시스템이 시뮬레이션된 환자 사례에서 질병을 진단하고 치료 결정을 내리는 데 있어 의사와 동등하거나 때로는 더 나은 성능을 보여주었습니다. 다만, 두 시스템 모두 이미 구식이 된 기반 모델(Base Model)로 작동된다는 사실이 밝혀져 기술 발전의 속도를 시사합니다.
의료 분야에 특화하여 구축된 AI 프로그램들이 실제 임상적 가치에 근접하고 있습니다. 이는 네이처에 동시에 발표된 두 편의 논문의 핵심 결론입니다. 독일에서 개발된 'MIRA' 시스템은 췌장암 및 폐렴과 같은 질환을 진단하는 데 있어 의사들을 능가했습니다. 구글의 'AMIE' 시스템은 더 정확한 치료 및 검사 계획을 도출했습니다.
시뮬레이션 병원 안에서 의사처럼 행동하는 MIRA
MIRA는 'Medical Intelligence for Reasoning and Action(추론 및 행동을 위한 의료 지능)'의 약자입니다. 이 시스템은 TU 드레스덴(TUD Dresden)과 하이델베르크 대학교를 비롯한 여러 기관의 협력으로 개발되었습니다. 일반적인 챗봇 도구와 달리, 이 시스템은 폐쇄된 가상 전자건강기록(EHR) 내부에서 자율적인 에이전트(Agent)로 작동합니다.
연구에 따르면, MIRA는 11가지 도구에 걸쳐 85,000개 이상의 옵션 중에서 선택할 수 있습니다. 이 시스템은 환자의 병력을 청취하고, 검사실 검사, 미생물 검사 및 영상 검사를 지시하며, 결과를 해석하고, 감별 진단을 생성한 다음 처방, 수술 계획, 입원 등의 치료 계획을 작성합니다.
연구팀은 공개된 MIMIC-IV 데이터셋에서 가져온 500개 이상의 실제 응급실 사례를 바탕으로 MIRA를 테스트했습니다. 두 번째 AI 에이전트가 환자 역할을 하여 실제 의료 기록의 정보만을 공유했습니다. 8가지 질병 카테고리에 걸쳐 MIRA는 데이터셋에 문서화된 진단을 기준으로 88.9%의 정확도로 올바른 진단을 내렸습니다.
직접적인 비교를 위해 양측은 동일한 조건에서 311개 사례의 하위 집합을 해결했습니다. MIRA는 87.8%의 점수를 기록했습니다. 반면 경험이 풍부한 전문의 4명으로 구성된 팀은 78.1%를 달성했고, 전공의와 전문의가 혼합된 팀은 71.1%를 기록했습니다. MIRA는 충수염(98.6%)과 췌장염(92.3%)에서 가장 뛰어난 성과를 보였습니다. AI와 의사 모두 폐렴(72.4%) 및 요로감염(77.6%)에서는 다소 어려움을 겪었습니다.
연구자들은 또한 권장 사항의 안전성을 확인했습니다. 권장 사항이 MIRA에서 나왔는지 인간에게서 나왔는지 모르는 맹검 전문의 검토자들은 위험한 약물 상호작용, 신장 기능이 손상된 환자에 대한 잘못된 용량 투여, 위험한 진통제 처방 등을 발견하지 못했습니다. MIRA는 환자가 현재 복용 중인 약물을 파악하는 데 거의 완벽했습니다. 또한 환자의 입원 필요 여부를 정확히 판단하여, 입원이 필요한 단 한 건의 사례도 놓치지 않았습니다. 테스트 환자가 독일어나 프랑스어만 사용하거나 극도로 불안해하는 상황에서도 성능은 꾸준히 유지되었습니다. 소스 코드는 GitHub에서 확인할 수 있습니다.
두 개의 에이전트와 임상 가이드라인을 결합한 구글의 AMIE
구글의 AMIE는 환자를 여러 차례 방문하여 관리하는 접근 방식을 취합니다. 이 시스템은 두 부분으로 구성됩니다. 대화형 에이전트는 환자와의 빠르고 친근한 대화를 처리합니다. 백그라운드에서 작동하는 두 번째 에이전트는 사례를 의료 가이드라인과 교차 검토하며 더 신중하게 사고합니다.
엄격하게 통제된 연구에서 구글은 여러 차례 방문을 거치는 100개의 사례에서 AMIE와 21명의 일차 진료 의사를 비교했습니다. 평가 기준은 영국의 NICE 가이드라인과 BMJ Best Practice 가이드라인이었습니다. 배우들이 텍스트 채팅을 통해 환자를 연기했습니다.
연구에 따르면 AMIE는 치료 결정에서 의사와 동등한 수준을 보였으며, 계획의 정확성 및 가이드라인 준수 측면에서는 의사를 능가했습니다. 첫 번째 진료 시, AMIE의 전반적인 계획은 95%의 사례에서 적절하다고 평가되었습니다. 의사의 경우 이 수치는 72%였습니다. 전문의 검토자와 환자 배우 모두 인간 의사보다 AMIE를 더 자주 선호했습니다. 약물 지식을 테스트하기 위해 팀은 두 개의 국가 약전을 기반으로 하고 면허를 보유한 약사가 검증한 'RxQA'라는 전용 벤치마크를 구축했습니다.