구글 딥마인드 AI 공동과학자, 실험 계획부터 논문 작성까지 수행
구글 딥마인드가 멀티에이전트 시스템 'Co-Scientist'를 가설 생성기를 넘어 실험을 계획하고 실험실 장비를 직접 제어하며 과학 논문까지 작성하는 통합 연구 파트너로 확장했습니다. 재료과학, 생물학, 컴퓨터과학 세 분야에서 실험적으로 검증된 결과를 제시했지만, 벤치마크 점수와 실제 인간 평가 간 괴리 등 한계도 확인되었습니다.
구글 딥마인드의 AI Co-Scientist, 이제 실험을 계획하고 실험실 장비를 작동하며 과학 논문까지 작성한다
구글 딥마인드는 멀티에이전트 시스템 'Co-Scientist'를 가설 생성기에서 실험실과 통합된 연구 파트너로 확장했다고 발표했다. 구글에 따르면 이 시스템은 세 개의 학문 분야에서 실험적으로 검증된 결과를 제출했다.
최신 Gemini 모델을 기반으로 구축된 Co-Scientist는 이제 단순히 가설을 생성하는 대신 실험을 계획하고, 코드를 작성하며, 실험실 장비를 제어한다. 기술적으로 새로운 점은 폐쇄 루프(closed-loop) 연구 워크플로우다. 시스템은 연구 질문에서 가설을 도출하고, 실험 계획과 프로그램 또는 기계 판독 가능한 실험 프로토콜을 작성하며, 결과를 분석하고 과학 논문 원고를 생성한다. 검증 모듈은 텍스트 내 수치 주장을 생성된 코드의 실행 로그와 대조해 조작된 결과를 줄인다.
구글은 2025년 2월 Co-Scientist를 처음 선보였으며, 당시에는 Gemini 2.0 기반이었고 팩트체크와 문헌 검토에 결함이 있었다. 확장된 시스템은 자율성을 높여가며 세 분야에서 검증되었다. 재료과학에서는 인간이 실행할 합성 레시피를 설계했고, 생물학에서는 전문가 피드백을 받아 예측 파이프라인을 구축했으며, 컴퓨터과학에서는 완전히 독자적으로 작업했다.
Co-Scientist, 합성·예측·설계를 수행하다
재료 합성을 위해 연구진은 Co-Scientist를 반자동 고온 furnace와 연결했다. 시스템은 주로 위험한 식각(etching) 공정으로만 생산되던 수요가 많은 2차원 물질에 대해 더 안전한 합성 경로를 찾았고, 해당 실험실 장비에 맞춘 완전한 성장 레시피를 생성했다. 인간의 다듬기를 거친 25차례의 시도 끝에 팀은 목표 물질과 유사한 특성을 지닌 층상 구조를 만들어냈지만, 원자 구조의 확정적 확인은 아직 남아 있다. 두 번째 실험에서는 세 개의 반도체 박막을 첫 시도에서 합성했다. Co-Scientist는 Gemini 3 Deep Think를 사용해 장비를 직접 제어하며 레시피 개발 시간을 며칠에서 몇 분으로 단축했다. 다만 시료와 전구체 물질은 여전히 인간이 수동으로 장전해야 했고, 고속 모드는 정교하게 최적화된 레시피보다 더 작고 균일성이 떨어지는 결정을 만들어냈다. 제1저자 사무엘 슈미트갈(Samuel Schmidgall)은 이 레시피가 다른 실험실로 이전 가능한지는 열린 문제라고 밝혔다.
생물학에서 Co-Scientist는 유전자 조작 대장균(E. coli) 집락이 서로 다른 화학 물질 농도에서 어떤 패턴을 형성하는지 예측하는 이미지 분석 파이프라인을 자율적으로 구축했다. Gemini 3 Pro Image로 생성된 예측은 네 가지 형태 특징 중 세 가지에서 미공개 실험 결과와 일치했다. 연구진은 이 시스템이 알려진 조건 사이에서만 추론할 수 있으며 완전히 새로운 시스템에서의 동작은 예측할 수 없다고 인정했다. 만약 가능하다면 훨씬 더 주목할 만한 일일 것이다.
컴퓨터과학 실험은 초기 설정 외에는 인간의 개입 없이 진행되었다. Co-Scientist는 들어오는 질의를 분류하고 수십 개의 응답 후보를 병렬로 생성한 뒤 이를 다듬는 의료 AI 아키텍처 'Agent_H'를 설계했다. 과도하게 긴 응답을 보정한 후 Agent_H는 GPT-5와 Claude Opus 5를 포함한 6개 프런티어 모델을 건강 벤치마크에서 능가했다. 그러나 벤치마크 결과는 인간 평가에서는 유지되지 않았다. 세 명의 board 인증 의사가 아홉 개 범주에서 응답을 평가한 결과, Agent_H는 기준 모델인 Gemini 3.1 Pro에 비해 단 하나의 범주, 즉 잠재적으로 유해한 응답의 위험이 낮다는 점에서만 통계적으로 유의한 우위를 보였다. 자동 벤치마크 평가자들의 판단도 의사들의 평가와 약한 상관관계만 보였다. 연구진은 높은 벤치마크 점수가 시스템이 임상적 관점에서 실제로 더 나은 답변을 제공한다는 의미는 아니라고 말하며, 이러한 벤치마크가 정확히 무엇을 측정하는지에 대한 의문을 제기했다.
신뢰성 모듈로 환각률을 4%까지 낮추다
LLM 기반 자율 연구 시스템의 핵심 문제는 (후략)