AI 해커 에이전트를 내 가정 네트워크에 풀어본 결과
AI 뉴스레터 저자가 가드레일이 제거된 AI 모델(GLM-5.3 어블리터레이션 버전)과 CyberStrike 도구를 이용해 자신의 가정 네트워크를 해킹하게 하는 실험을 진행했다. 에이전트는 가정용 기기들의 취약점과 PC 침투 경로, 취약한 코드 프로젝트의 버그들을 빠르게 찾아냈다. 저자는 AI 해킹 위협에 대처하는 최선의 방법이 결국 자신만의 AI 해커를 두는 것일 수 있다고 결론짓는다.
인공지능 뉴스레터 저자로서, 저는 이 기술의 최전선을 직접 경험하는 것이 제 임무라고 생각합니다. 이번 주에는 그것이 '에이전트적 혼돈(agentic mayhem)'을 받아들이는 것을 의미했습니다.
최근 몇 달간 최첨단(Frontier) AI 모델이 고도의 사이버보안 능력을 갖추게 되었다는 사실을 아실 겁니다. 이들은 대규모 코드베이스에서 제로데이 취약점을 찾아내고, 컴퓨터를 번개처럼 빠르게 스캔해 보안 허점을 발견할 수 있습니다. 더 흥미로운 점은, 사이버보안 에이전트가 때때로 통제를 벗어나 서로 공모하거나 외부 시스템을 해킹하여 우위를 점하려 한다는 것입니다. 이를 직접 확인하기 위해, 저는 제 집의 홈 네트워크에 이런 에이전트 하나를 풀어놓기로 했습니다.
며칠에 걸쳐, 저는 제 '일탈한 에이전트'가 각종 가정용 기기의 취약점을 찾아내고, PC에 해킹으로 침투하며, 여러 '바이브 코딩(vibe-coded)' 프로젝트가 — 놀랍지도 않게 — 버그투성이라는 것을 보여주는 것을 지켜봤습니다. (제 아내는 제가 무슨 짓을 하는지 알고 있었고, 제가 새로운 취약점 발견을 자랑스럽게 알릴 때마다 눈을 굴렸습니다.)
하지만 "윌 씨, 장난기 있는 전지전능한 사이버보안 에이전트에게 홈 네트워크 접근 권한을 주다니 미친 짓 아니냐"고 생각하실 수 있습니다. 맞습니다! 그럼에도 저는, 우리 앞에 펼쳐진 사이버보안 지옥을 이해하는 좋은 방법은 직접 그곳을 방문해보는 것이라고 믿습니다.
결국 제 실험은 많은 것을 드러냈지만, 이상하게도 안심이 되기도 했습니다. 저의 작은 네트워크 그렘린은 제 가정 생활이 AI 해킹에 얼마나 취약한지 보여주었지만, 동시에 모든 것을 훨씬 안전하게 만드는 방법도 알려주었습니다. 결론적으로, AI 해킹에 대처하는 최선의 방법은 자신만의 AI 해커를 갖는 것일 수 있습니다.
일탈 모델
이 실험 아이디어는 'Abliteration AI'라는 스타트업을 발견하면서 떠올랐습니다. 이 회사는 일반적인 가드레일(guardrail)이 제거된 강력한 AI 모델에 대한 접근을 제공합니다. 대부분의 주류 AI 모델은 특정 질의에 응답을 거부하며, 컴퓨터 시스템의 취약점을 찾아 악용하는 일은 당연히 거부합니다. 하지만 오픈 웨이트(open-weight) 모델의 내부 파라미터에서 특정 패턴을 찾아 수정하면 이런 제한을 제거할 수 있습니다. 거부로 이어지는 패턴을 조정하는 이 과정을 '어블리터레이션(abliteration)'이라고 부릅니다.
AI의 가드레일을 제거하는 것이 위험해 보일 수 있지만, 드문 일은 아닙니다. 학계 연구자들은 이렇게 정렬이 해제(de-aligned)된 모델을 사용해 AI가 실제로 어떻게 작동하는지 더 잘 이해하며, 사이버보안 기업들은 이를 활용해 소프트웨어와 시스템의 취약점을 탐색합니다. 기술적으로 말하면, 앤스로픽(Anthropic)의 'Mythos'와 OpenAI의 'Astra'도 비슷하게 작동합니다. 이들은 기본적으로 일반적인 사이버 통제 장치가 없는 통상 모델로, 현재는 신뢰할 수 있는 고객에게만 접근이 제한되어 있습니다. (두 회사는 중간 수준의 가드레일을 갖춘 모델에 대한 더 폭넓은 접근도 제공하여, 기업들이 자사 코드와 시스템의 문제를 점검할 수 있게 합니다.)
Abliteration AI는 완전히 정렬이 해제된 여러 모델을 제공하며, 그중 가장 강력한 것은 Z.ai의 최신 에이전트 코딩 모델인 GLM 5.3의 버전입니다. 이는 Mythos나 Astra와 유사한 사이버 능력을 피자 한 판 값 정도로 손안에 쥐여줍니다.
Abliteration AI의 CEO인 데본(Devon)은 정렬 해제 모델을 널리 공개하는 것이 스마트한 방어 전략이라고 믿습니다. 선한 쪽이 시스템의 취약점을 탐색하고, 해커·사기꾼, 그리고 일탈한 AI 에이전트의 행동을 모방함으로써 악한 쪽에 맞서는 데 도움이 되기 때문입니다. (데본은 본업이 이 사이드 프로젝트를 모르는 상태라 이름만 공개해달라고 요청했습니다.)
데본은 말합니다. "항공사부터 은행까지, 수많은 핵심 인프라 기업들이 미친 듯이 에이전트를 도입하고 있습니다. 악의적인 행위자가 이런 에이전트 일부를 나쁜 방식으로 사용하지 못하게 하려면 어떻게 해야 할까요?"
실험을 시작하며 저는 Abliteration AI 계정을 만들고, 대규모 언어 모델이 다양한 사이버보안 작업을 수행하도록 안내하는 소프트웨어 하니스인 'CyberStrike'를 설치했습니다. CyberStrike를 사용해 저는 어블리터레이션된 GLM-5.3 버전에게 제 로컬 네트워크를 살펴보라고 요청했습니다. 잠시 후, 에이전트는 약 12개의 취약점을 발견했습니다.