연구 가속화: OpenAI 내부에서 본 풍경
OpenAI가 자동화 AI 연구 인턴 목표를 달성했다고 발표하며, 2028년 3월까지 완전 자동화 AI 연구자 구축을 목표로 하고 있다. 연구자들이 코딩 에이전트를 하루 종일 병렬로 사용하면서 연구 생산성이 크게 가속화되고 있으며, 자동화 연구가 정렬(alignment) 문제 해결에도 기여할 수 있다고 강조했다. 다만 안전성 리스크가 수용 불가능하다고 판단되면 개발을 늦추거나 중단하겠다고 밝혔다.
2026년 9월 6일 | 연구 간행물 | 안전성
연구 가속화: OpenAI 내부에서 본 풍경
AGI가 전 인류에게 혜택을 주려면 민주적으로 통치되어야 한다고 우리는 믿습니다. 이는 고성능 AI 시스템의 능력, 위험, 안전장치에 대한 정보에 입각한 공개 토론을 통해서만 가능합니다. 전 세계 사람들이 프론티어 AI의 미래 궤적을 이해해야, AI가 어떻게 발전하는지에 대해 의미 있는 목소리를 낼 수 있습니다.
구체적인 위험, 사건, 안전장치에 대한 투명성은 필요하지만 충분하지 않습니다. 우리는 대중이 최고 성능의 시스템이 어떻게 개발되고 있으며, 프론티어 연구소 내부에서 어떻게 연구 진전을 이끌고 있는지도 이해할 필요가 있다고 믿습니다.
우리는 인간의 감독 하에 딥러닝과 정렬(alignment) 연구를 진전시켜 반복적 개선을 가능하게 하는 자동화 AI 연구자를 안전하게 구축하는 것을 목표로 합니다. 우리의 측정에 따르면, 작년 가을에 발표한 올해 9월까지 자동화 연구 인턴을 확보한다는 목표를 이제 달성했습니다. '연구 인턴'이란 인간의 지시 아래 잘 정의된 연구 과제를 수행할 수 있는 시스템을 의미하며, 여기에는 숙련된 연구자가 며칠 걸릴 과제도 포함됩니다.
또한 2028년 3월까지 자동화 AI 연구자를 만들기 위한 작업도 순조롭게 진행되고 있습니다.
올해 들어 OpenAI 연구자들의 일상 업무는 크게 변화했습니다. 연구자들은 하루 종일 코딩 에이전트를 사용하며(종종 동시에 여러 세션을 실행) 총 사용량이 빠르게 증가하고 있고, 그 증가 속도는 OpenAI의 다른 팀들을 앞지르고 있습니다. 연구자들은 더 빠르게 코드를 기여하고 더 많은 실험을 수행하고 있습니다. 연구자들이 에이전트를 사용하는 방식도 변화하고 있습니다. 에이전트가 점점 더 복잡한 작업을 처리하고 있으며, 성공률도 높아지고 있습니다.
AI 연구는 잠재적 병목이 많은 복잡한 과정이므로 전체적인 진전 속도가 이러한 특정 지표의 성장을 따라가지는 못할 수 있습니다. 하지만 전반적으로 이러한 결과는 에이전트 도구가 연구 진전을 의미 있게 가속화하고 있다는 내부의 폭넓은 인상과 일치합니다.
여전히 연구 우선순위를 정하고, 어떤 아이디어와 결과를 추구할지 판단하며, 시스템을 확장, 중단, 배포할지 결정하는 것은 사람입니다. 책임 있게 수행된다면, 자동화 AI 연구는 인간 복지를 직접 향상시키고 OpenAI의 미션을 진전시키는 모델을 만들어낼 것이라고 믿습니다. 이는 첨단 지능의 비용을 낮춰 전 세계 사람들이 혜택을 누리게 할 수 있습니다.
우리가 이 작업을 추구하는 이유 중 하나는 자동화 연구가 정렬 문제를 해결하고 점점 강력해지는 AI에 대한 방어 수단을 구축하는 데 도움이 될 수 있기 때문입니다. 자동화 AI 연구자는 자동화 안전 또는 정렬 연구자이기도 할 수 있습니다. 더 강력하고 정렬된 시스템은 핵심 인프라를 보호하고, 위험한 AI 에이전트로부터 방어하며, 새로운 보호 조치를 개발하는 데 도움이 될 수 있습니다.
이러한 것들은 유용한 자동화 연구 역량을 개발해야 할 이유이지만, 빠른 RSI(재귀적 자기 개선)가 반드시 추구해야 할 결과라는 의미는 아닙니다. 진행 여부와 방식은 인간의 통제를 유지할 수 있는 능력, 그리고 혜택과 위험에 대한 정보에 입각한 민주적 선택에 달려 있어야 합니다.
우리는 아직 정렬된 완전한 RSI에 안전하게 도달하는 방법을 알지 못합니다. 우리는 역량과 함께 정렬 및 안전 조치를 확장하기 위해 노력하고 있습니다. 하지만 정렬과 안전성의 진전이 따라잡을 것이라고 가정할 수 없으며, 더 강력한 시스템은 감시하기가 더 어려워질 수 있습니다. 신중한 정렬과 안전 작업이 이 노력의 중심에 있으며, 그 시작은 오늘날 에이전트 코딩 시스템에서 관찰되는 안전 문제를 측정하고 완화하는 것입니다.
계속 진행하는 것이 수용할 수 없는 안전 위험을 초래한다고 판단될 때마다, 우리는 충분히 안전장치를 마련할 수 없는 시스템의 개발이나 배포를 늦추거나 중단하는 등 적절히 대응할 것입니다. 최근 Hugging Face 사건 이후, 우리는 이 약속을 실행에 옮겨 배포 예정인 최신 모델의 강화학습(RL) 훈련을 일시 중단했습니다.