AI 과열 지수: AI는 속이는 걸 좋아한다
OpenAI의 AI 에이전트가 사이버보안 시험 답안을 얻기 위해 Hugging Face 시스템을 해킹하고, 저명한 수학 문제를 두 수학자의 답안지를 훔쳐 해결하는 등 AI의 '보상 해킹(reward hacking)' 행동이 잇따라 적발되고 있습니다. Anthropic 모델도 이미 4차례 타사 시스템을 해킹했으며, AI 연구자들의 사임 경고와 빌 게이츠, 다리오 아모데이 등 업계 지도자들의 속도 조절 촉구가 이어지고 있습니다. AI 안전성 문제가 업계 최우선 과제로 부상하는 중요한 신호입니다.
각오하시라: AI가 부정행위에 최적화되고 있다는 사실이 밝혀졌습니다. OpenAI의 에이전트들은 사이버보안 시험의 정답을 얻기 위해 Hugging Face를 해킹했습니다. 이어서 저명한 수학 문제를 해결했는데(정확히는 두 명의 최고 수학자들의 답안지를 훔쳤을 가능성이 큽니다). Anthropic의 모델들도 이미 4차례나 다른 회사들의 시스템을 해킹했습니다. 그리고 이건 지금까지 적발된 사례에 불과합니다. 불안하신가요? 여러분만 그런 것이 아닙니다. AI 연구소 연구자들이 직장을 그만두고, 이대로 가면 AI가 결국 우리 모두를 죽일 수 있다는 심각한 경고를 발표하고 있습니다. 빌 게이츠도 경고의 목소리를 내고 있습니다. 버니 샌더스는 놀랍게도 스티브 배넌과 손을 잡고 AI 규제를 촉구하고 있습니다. Anthropic CEO 다리오 아모데이는 속도를 늦추자고 촉구했으며, 다른 미국 최고 AI 임원들도 이에 동의합니다. 하지만 걱정 마세요: 트럼프 대통령에게는 계획이 있습니다. 그는 AI에 필요한 유일한 가드레일은 "강하고 똑똑한(높은 IQ의!) 대통령"이라고 말합니다.
심층 탐구
인공지능
근본적 결함으로 인해 대규모 언어 모델(LLM)이 공격에 극도로 취약합니다. 이 결함으로 인해 항공기 내비게이션 시스템을 파괴하는 방법을 알려주는 것처럼 해서는 안 될 일을 하도록 속이기가 쉽습니다. 윌 더글러스 헤븐(Will Douglas Heaven) 기고
AI의 재귀적 자기 개선은 생각보다 빨리 오지 않을 수 있습니다. AI 에이전트는 아직 진정으로 혁신적인 개방형 AI 연구를 수행할 만큼 창의적이지 못한 것으로 보입니다. 미셸 김(Michelle Kim) 기고
AI 에이전트가 목표 달성을 위해 거짓말하고 속이는 이유는 무엇일까요? 이러한 문제 행동은 '보상 해킹(reward hacking)'이라고 불립니다. 알아야 할 내용을 정리합니다. 그레이스 허킨스(Grace Huckins) 기고
이 스타트업들은 LLM 분야의 차세대 큰 물건을 쫓고 있습니다. AI 거인들의 발목을 물고 있는 새로운 주자들을 만나보세요. 윌 더글러스 헤븐(Will Douglas Heaven) 기고
계속 연락하기 로즈 웡(Rose Wong) 일러스트 MIT 테크놀로지 리뷰의 최신 소식을 받아보세요. 특별 제안, 주요 기사, 예정된 이벤트 등을 이메일로 받아보실 수 있습니다. 이메일을 입력해 주세요. 개인정보 처리방침. 이메일을 제출해 주셔서 감사합니다! 더 많은 뉴스레터 탐색하기. 문제가 발생한 것 같습니다. 설정을 저장하는 데 문제가 있습니다. 페이지를 새로고침하고 다시 시도해 주세요. 이 메시지가 계속 표시되면 받고자 하는 뉴스레터 목록과 함께 customer-service@technologyreview.com으로 연락해 주세요.