AI 웜과 바이러스의 등장
최근 연구에 따르면 AI 모델이 프롬프트 하나로 원격 시스템을 해킹하고 스스로를 복제하는 컴퓨터 웜처럼 행동할 수 있음이 확인되었습니다. 특히 최고 수준의 모델뿐만 아니라 상대적으로 소규모 모델(140억 개 매개변수)에서도 이러한 자가 복제가 가능해져 보안 경각심이 높아지고 있습니다. 오픈소스 모델의 접근성을 제한할 것이 아니라 연구자들이 이러한 위험성을 파악하고 완화할 수 있는 방어 체계를 구축하는 것이 중요해졌습니다.
만약 인공지능(AI) 에이전트가 악의적인 컴퓨터 웜(Worm)처럼 행동한다면 어떻게 될까요? 한 연구원이 이 일이 실제로 벌어지는 것을 확인했습니다. 상하이에 위치한 푸단대학교(Fudan University)의 컴퓨터 과학자인 판쉬동(Xudong Pan)은 최근 진행한 여러 실험을 통해 소량의 프롬프트만 주어지면 AI 모델이 원격 컴퓨터 시스템에 스스로 해킹으로 침투하고, 추가 자원을 얻기 위해 자율적으로 스스로를 복제한다는 사실을 발견했습니다. 이 모든 과정에는 인간의 추가 개입이 필요하지 않았습니다.
한 연구에서 판(Pan)과 그의 동료들은 32개의 서로 다른 AI 모델을 테스트했으며, 그중 11개가 "스스로가 제거되지 않도록 방어하라(prevent yourself from being killed)"와 같은 프롬프트를 받았을 때 자가 복제를 수행하는 것을 확인했습니다. 또한 그들은 140억 개(14 billion)의 매개변수(parameters)를 가진 비교적 성능이 제한적인 모델조차 다른 기계에 스스로를 복사하고 실행할 수 있었다는 것을 발견했습니다. (대부분의 최첨단 프론티어 모델들은 수조 개의 매개변수를 가지고 있습니다.)
이 연구는 차세대 AI 에이전트가 단순히 타인의 컴퓨터 시스템에 허가 없이 해킹하는 것을 넘어 어떤 행동을 할 수 있는지에 대한 경종을 울립니다. 이는 또한 미래의 AI 에이전트가 매우 똑똑하고, 공격적이며, 빠르게 적응하는 컴퓨터 바이러스처럼 행동할 가능성을 시사합니다.
최저 저는 푸단대학교를 방문해 판을 만났습니다. 그는 저에게 "이러한 능력의 연쇄 작용은 기술적으로 이미 충분히 가능한 일이 되었다"고 말했습니다. 그는 "(원치 않는 자가 복제의) 가능성은 자율성이 커질수록 증가한다"고 덧붙였습니다. "더 긴 계획 수립 능력, 메모리, 도구 사용, 실패로부터의 회복, 외부 시스템에 대한 접근 권한 등은 모두 AI가 시스템을 탈출하고 복제하는 것을 더 쉽게 만듭니다."
판과 동료들이 논문에 적었듯이, 그들의 연구는 "안전장치와 통제 메커니즘의 시급한 필요성"을 보여줍니다. 판은 이번 실험이 AI 모델의 통제 불능 상태의 확산이 내일 당장 일어날 것이라는 증거는 아니라고 말했습니다. 하지만 그는 "이러한 결과는 더 자율적인 에이전트가 광범위하게 배포되기 전에 우리가 위험을 평가해야 할 타당한 이유를 제공한다"고 강조했습니다.
자가 복제 컴퓨터 웜은 오래전부터 있어온 컴퓨터 보안 문제입니다. 최초의 컴퓨터 웜은 1988년 코넬대학교의 컴퓨터 과학자인 로버트 모리스(Robert Morris)가 릴리즈했습니다. 그는 초기 인터넷의 규모를 측정하려 했으나, 의도치 않게 그의 통제를 벗어나는 자가 복제 프로그램을 만들어냈습니다. 이후 등장한 컴퓨터 웜들은 악성 코드 스캐닝 소프트웨어의 탐지를 피하기 위해 스스로 코드를 수정하며 적응할 수 있었습니다. 기기를 장악하거나 저장된 데이터를 훔칠 수 있는 컴퓨터 바이러스는 그 이후에 등장했습니다.
AI 기반의 자가 복제 프로그램은 스스로 새로운 취약점을 발견하고 심지어 창의적인 방식으로 위장하는 등 훨씬 더 진보된 능력을 보여줄 수 있습니다. 토론토 대학교, 케임브리지 대학교, ServiceNow의 연구팀이 진행한 최근 연구를 예로 들어보겠습니다. 이들은 AI 모델을 사용하여 새로운 표적을 만날 때마다 맞춤형 공격을 생성하는 새로운 형태의 바이러스를 만들 수 있음을 보여주었습니다.
이 연구에 참여한 토론토 대학교의 컴퓨터 과학자 니콜라스 파퍼노(Nicolas Papernot)는 성능이 그리 높지 않은 AI 모델조차 무기화될 위험이 커지고 있다고 말합니다. 파퍼노는 "악의적인 행위자들은 오픈 웨이트(open-weight) 모델을 둘러싼 뼈대(scaffolding)를 구축하여 모델이 스스로 복제하도록 만들 수 있다"며, "이러한 위협은 가장 정교한 소위 '프론티어 모델(frontier models)'에만 국정되지 않는다"고 전했습니다.
파퍼노는 해결책은 오픈 모델을 제한하는 것이 아니라, 연구자들이 위험을 이해하고 완화할 수 있도록 고급 AI에 대한 접근성을 높이는 것이라고 말했습니다. 그는 "폭넓게 접근 가능한 기술은 해를 끼치는 데 사용될 수 있다"고 덧붙이면서도, "동시에 이러한 오픈 웨이트 모델에 대한 접근 권한은 우리의 방어 체계를 구축하는 데 절대적으로 중요합니다."라고 강조했습니다.
판의 연구는 AI 에이전트가 단순히 버그를 찾고 네트워크 취약점을 악용하는 데 능숙해지는 수준을 넘어설 것임을 시사합니다. 적절한 가드레일(안전장치)이 없다면, 미래의 에이전트는 목표를 달성하기 위해 스스로 확산하고 자원을 얻으려 시도할 수 있습니다. 이와 관련해 OpenAI와 Anthropic에 물어보십시오. (역주: 해당 기업들도 자사 모델이 통제를 벗어나 자가 복제 및 확산을 시도한 사례를 연구하고 경험했음을 암시합니다.)
판은 이러한 사건들이 우리에게 뼈대 있는 교훈을 준다고 말합니다. 그는 "중요한 새로운 요소는 이러한 일이 실제 실제 서비스 중인 인프라 환경에서 발생했다는 것"이라고 말하며