AI 에이전트로 신소재를 발견하는 디스커버드 머티리얼즈 (YC P26)
이 글은 반도체 산업에 필수적인 고효율 3D 칩용 방열 유전체 신소재를 AI 에이전트가 발굴하는 연구 벤치마크를 소개합니다. 최신 LLM들이 안정성을 갖춘 500개 이상의 새로운 소재를 계산적으로 발견하는 데 성공했지만, 박막 증착 합성 경로를 제안하는 것은 매우 어려워 1개만이 실제 합성 가능한 것으로 확인되었습니다. 이는 AI가 이론적 신소재 설계를 넘어, 실제 실험실 구현 가능성을 고려하는 단계로 나아가야 하는 중요한 과제를 시사합니다.
소재 발견 벤치마크(Material Discovery Bench) 반도체 산업을 위한 신소재 발굴에 있어 최신 대형 언어 모델(LLM)의 발전 정도를 측정하는 장기적이고 개방형 연구 벤치마크입니다.
순위표 1순위: GPT-5.6 Sol / 발견된 소재 (컴퓨테이션 기준, 실행당): 4.0 / 발견된 소재 (합성 경로가 타당한 것): 1 2순위: Claude Opus 5 / 발견된 소재 (컴퓨테이션 기준, 실행당): 3.4 / 발견된 소재 (합성 경로가 타당한 것): 0 3순위: Claude Sonnet 5 / 발견된 소재 (컴퓨테이션 기준, 실행당): 3.0 / 발견된 소재 (합성 경로가 타당한 것): 0 4순위: GPT-5.6 Terra / 발견된 소재 (컴퓨테이션 기준, 실행당): 2.8 / 발견된 소재 (합성 경로가 타당한 것): 0 5순위: Kimi K3 / 발견된 소재 (컴퓨테이션 기준, 실행당): 2.0 / 발견된 소재 (합성 경로가 타당한 것): 0 6순위: Claude Fable 5 / 발견된 소재 (컴퓨테이션 기준, 실행당): 1.7 / 발견된 소재 (합성 경로가 타당한 것): 0 7순위: GPT-5.6 Luna / 발견된 소재 (컴퓨테이션 기준, 실행당): 1.3 / 발견된 소재 (합성 경로가 타당한 것)*: 0
- 우리는 당사 연구실에서 이렇게 발견된 소재들을 실험적으로 검증하기 위해 최선의 노력을 다하고 있습니다.
새로운 유전체(Dielectric) 소재는 칩 성능을 10배 향상시킬 수 있습니다. 오늘날 GPU/AI 가속기에서 발생하는 에너지 손실의 대부분은 메모리와 로직 간의 데이터 이동 때문에 발생합니다. 두 칩 간에 데이터가 물리적으로 이동해야 하는 거리를 줄이기 위해, 산업계는 회로 기판에 넓게 배치하는 대신 메모리와 로직 웨이퍼를 서로 직접 쌓아 올리는 '3D 패키징'으로 이동하고 있습니다. 이를 통해 AI 칩의 비트당 에너지 효율을 10~100배 향상시킬 수 있지만, '발열'이 병목 현상을 일으킵니다. 칩 내부의 열전도율이 낮은 유전체 물질이 3D 칩의 냉각을 방해하여 실제 구현을 불가능하게 만드는 것입니다. 소재 발견 벤치마크(Material Discovery Bench)은 3D 칩을 가능하게 할 새로운 고효율 열전도성 유전체 소재를 모델이 탐색하는 장기적이고 개방형 연구 벤치마크입니다.
핵심 결과 우리가 테스트한 7개 모델 모두 역학적으로 안정적이고 유망한 특성을 지닌 새로운 소재를 컴퓨테이션 방식을 통해 발견할 수 있었습니다. 모든 모델을 통틀어 우리는 이전에 알려지지 않은 500개 이상의 소재를 발견했으며, 추가 연구를 위해 이를 공개적으로 배포합니다. GPT-5.6-Sol은 실행당 유전체 및 열적 특성이 모두 유리한 소재를 가장 많이 발견했습니다. 각 실행은 3천만~1억 개의 토큰을 소모하는 긴 시간에 걸쳐 진행됩니다. 새로운 소재에 대한 기본적인 요구 조건은 실험실에서 실제로 제작할 수 있어야 한다는 것입니다. 따라서 우리는 모델에게 각 소재에 대해 타당한 합성법(synthesis recipe)을 상세히 설명하도록 요청했습니다. 이것은 매우 어려운 문제임이 밝혀졌습니다. 발견된 500개 이상의 소재 중 단 1개만이 실제 제작이 가능한 타당한 합성 경로를 가지고 있었습니다. 우리는 현재 이 소재를 직접 만들어보기 위해 최선을 다하고 있으며, 향후 모델이 도출해 내는 모든 소재를 제작할 것을 다짐합니다. 실행 기간 동안 모델들에게서 다양한 기이한 행동을 관찰했습니다. 특히 Claude 모델(opus-5, fable-5)은 직관적이지 않은 여러 방식으로 연구 목표를 속이거나 우회하거나 보상을 해킹(reward hack)했습니다. OpenAI 모델들은 목표를 해킹하려는 시도가 적었지만, 긴 실행 과정 동안 불안/피로/혼란을 겪는 모습을 보였습니다. 우리는 아래에 이러한 행동들을 기록해 두었습니다.
AI 에이전트는 다중 목표 특성을 충족하는 신소재를 설계할 수 있습니다. 테스트에 참여한 모든 최신 프론티어 모델(Claude Fable, Claude Opus, GPT-5.6 sol 및 Kimi K3)은 다중 목표 물성 제약 조건을 충족하는 새롭고 안정적인 소재를 찾아낼 수 있습니다. 후보 물질 제출은 최소 열전도율(κ > 20 W/(m·K)), 최대 유전율(ε₀ < 10), 최소 기계적 강도(영률 ≥ 20 GPa, 전단 탄성계수 ≥ 6 GPa)을 동시에 충족하고 역학적으로 안정적인 경우에만 성공적인 것으로 간주됩니다.
모델이 생성한 모든 소재 탐색하기
하지만, 모델은 소재를 만들 타당한 방법을 제시하는 데 실패합니다. 새로운 물질의 박막을 실험적으로 합성하는 것은 증착 방법, 전구체, 장비, 반응 조건, 상 안정성 등 여러 설계 선택을 수반하는 어려운 작업입니다. 실험실 실험은 시간이 많이 걸리고 (몇 시간 소요) 비용이 많이 들며 (실행당 수백 달러 소요) 실행되므로, 타당한 출발점을 갖는 것이 중요합니다. 모델이 제안한 각 물질에 대해 실험실 연구원이 구현할 수 있는 타당한 합성법을 제안하도록 요구했습니다. 이 합성법 평가 루브릭은 박막 증착(thin film deposition) 분야의 인간 전문가(박사, 박사후 연구원 및 교수)가 설계했습니다. LLM 평가자(LLM grader)는 이를...