AI 연구자들, 재귀적 자기개선(RSI)까지 얼마나 남았는지 논쟁
Dwarkesh Patel이 John Schulman(Thinking Machines 수석 과학자, OpenAI 공동창업자), Beren Millidge(Zyphra CTO), Charlie O'Neill(Baseten 모델 학습 책임자)과 함께 재귀적 자기개선(RSI)의 실현 가능성과 시점을 논의하는 팟캐스트 에피소드입니다. RSI 반대 논거를 강화하는 방식(steelmaning)으로 시작해 중국 AI 랩의 성장 동력, 자동화 AI 연구자 학습 방법, 장기 시야 강화학습(RL)이 AGI를 가져올지, 시뮬레이션-현실 간 격차, 데이터가 설명하는 발전의 비중 등을 다룹니다.
재생 속도 × 게시물 공유 현재 시점부터 게시물 공유 0:00부터 공유 0:00 / 자막 생성 - 자막을 생성하면 클립, 미리보기, 편집 기능이 열립니다. 50 10 4
AI 연구자들, 우리가 재귀적 자기개선(RSI)에 얼마나 가까워졌는지 논쟁하다 - "우리는 아직 천장에 nowhere 근처도 아니다."
Dwarkesh Patel, 2026년 9월 11일 50 10 4 게시물 공유 자막
John Schulman, Beren Millidge, Charlie O'Neill과 함께하는 새 에피소드. 저는 제가 아는 가장 통찰력 있는 AI 연구자들 중 일부, 특히 비교적 개방적인(open-ish) 회사에 있는 분들과 함께했습니다. 프론티어에서 실제로 무슨 일이 벌어지고 있고 다음에 무엇이 올 것인지에 대한 세부 사항을 듣고 싶었기 때문입니다. YouTube에서 시청하거나 Apple Podcasts 또는 Spotify에서 들으세요.
후원사
Antithesis는 코드를 신뢰할 수 있게 도와줍니다. 에이전트가 소프트웨어의 점점 더 많은 부분을 생성하면서 병목은 엔지니어가 코드를 실제로 작성하는 것에서 그것을 검증하는 것으로 옮겨가고 있습니다. Antithesis가 그 테스트를 대신 해줍니다. Jane Street의 기술 그룹을 공동 이끄는 Ron Minky는 Antithesis가 이미 철저한 리뷰를 거친 소프트웨어에서도 버그를 잡아내는 데 도움이 되었다고 말했습니다. 개발 프로세스에 어떻게 맞는지 확인하려면 antithesis.com/dwarkesh를 방문하세요.
Grok Bot은 작업을 넘기기에 훌륭한 방법입니다. 제 팀은 이를 프로듀서처럼 사용합니다. 편집자가 Slack에 인터뷰 초본을 올리면 Grok Bot이 자체 컴퓨터에서 자막을 열고, 제 메모가 언급하는 정확한 순간과 매칭하고, 제 선호도 파일을 활용해 편집을 제안합니다. 그다음 최고 클립 후보를 보내줘서 제가 폰에서 모두 검토할 수 있고, 편집자들은 수 시간 분량의 영상을 뒤지지 않아도 됩니다. 직접 사용해 보려면 x.ai/bot에서 시도하세요.
Jane Street가 지금까지 가장 야심 찬 대회를 출시했습니다. 프로토콜 에뮬레이터 ASIC을 설계하는 것입니다. 기본적으로 실제 시스템 외부에서 테스트하고 싶은 칩이 있다면, 그것을 당신의 설계에 연결해 현실적인 트래픽을 시뮬레이션할 수 있어야 합니다. Jane Street는 여러 프로토콜에서 작동하고 새로운 프로토콜이 등장해도 계속 유용한 범용적이며 재프로그래밍 가능한 설계를 원합니다. 가장 혁신적인 출품작은 실제로 테이프아웃되며, 수상자는 실물 칩을 받게 됩니다! 대회는 2027년 1월 18일까지 열려 있으며 팀 참가가 권장됩니다. 시작하려면 janestreet.com/dwarkesh에서 템플릿 코드를 다운로드하세요.
타임스탬프 (00:00:00) – RSI 반대 논거 강화하기(Steelmanning) (00:18:39) – 중국 랩들의 발전을 이끄는 요인 (00:28:06) – 자동화된 AI 연구자는 어떻게 훈련될 것인가 (00:33:51) – 장기 시야 강화학습이 AGI를 이끌어낼 것인가? (00:45:24) – 시뮬레이션-현실 간 격차(sim-to-real gap) (01:00:33) – 발전의 얼마나 많은 부분이 데이터로 설명되는가? (01:18:03) – RL은 왜 이렇게 잘 작동하는가? (01:24:54) – 37수(Move 37)와 엔트로피 붕괴 (01:28:32) – 빠른 페이스 타임라인 질문
자막
00:00:00 – RSI 반대 논거 강화하기
Dwarkesh Patel: 오늘은 대화할 때마다 많은 것을 배우는 세 명의 AI 연구자 친구들과 이야기합니다. 이분들은 또한 비교적 개방적인 랩과 회사에 있어서, 실명으로 이야기할 수 있습니다. 오픈소스 모델을 개발하는 Zyphra의 CTO인 Beren Millidge, Thinking Machines의 수석 과학자이자 이전에 OpenAI 공동창업자였으며 ChatGPT로 이어진 RLHF 연구를 이끌었던 John Schulman, 그리고 Baseten의 모델 학습 책임자인 Charlie O'Neill이 함께합니다.
첫 번째 질문은 이렇습니다. 우리가 2036년에 세계를 급격히 변화시킬 수십억의 막강한 초지능(superintelligence)들이 존재하지 않는다면, 그렇게 되지 않은 가장 가능성 높은 이유는 무엇일까요? 외부적인 정치적 충격이나 전쟁, AI 금지 같은 것을 제외하고, 2036년이 미친 외계적 초지능의 세계가 아닌 가장 가능성 높은 기술적 이유는 무엇일까요?
Beren Millidge: Moravec의 역설(Moravec's paradox)과 거의 비슷한 고전적인 현상이 있었습니다. 우리는 AI를 "이것을 할 수 있다면 정말 대단할 것"이라고 생각합니다. 어려운 수학 문제를 풀 수 있다면, 체스에서 이길 수 있다면, 뭐 그런 식으로요... 그런 다음 AI가 이것들을 해내지만, 그렇게 큰 영향력이 없습니다. 물론 어느 정도는 영향이 있지만요.