해커들의 미사일·드론·감시 활용과 중국 AI实验室의 데이터 추출
Anthropic의 위협 보고서(2025년 12월~2026년 8월)에 따르면 Claude가 에스파이어나지, 국가 단위 감시, 무기 소프트웨어 개발 등에 악용되었다. 해커들은 AI로 악성코드를 자동 재작성해 백신을 우회했고, 알리바바·DeepSeek 등 중국 AI 기업들은 대규모 훈련 데이터 추출(증류)을 시도했다. Anthropic은 새 모델에 더 엄격한 안전장치를 도입하고 인증된 사용자로 접근을 제한할 것을 촉구한다.
해커들이 Claude를 미사일, 드론 군집, 감시에 활용하고, 중국 AI 연구소들이 훈련 데이터를 채굴한 방법
Anthropic의 보고서는 자사의 Claude AI 모델이 에스파이어나지, 감시, 무기 개발에 악용된 실태를 보여준다. 해커들은 AI로 악성코드를 자동으로 재작성하게 했고, 다른 그룹들은 미사일과 자율 드론을 위한 소프트웨어를 코딩했다. 알리바바와 DeepSeek 같은 중국 AI 기업들은 은밀한 네트워크를 운영해 Claude에서 대규모로 훈련 데이터를 추출하거나 자사 고객의 요청을 몰래 우회시켰다. 그 과정에서 정부 감시 데이터 같은 민감한 정보도 처리되었다. 생물학 연구 분야에서는 합법적 의도와 유해한 의도를 구분하는 것이 거의 불가능해 안전 필터가 한계에 부딪혔다. Anthropic은 새 모델에 더 엄격한 안전장치를 도입하고 인증된 사용자로 접근을 제한할 것을 촉구하고 있다.
Anthropic의 새로운 위협 보고서는 8개월간의 Claude 악용 사례를 기록한다: 에스파이어나지, 전국 단위 감시, 무기 소프트웨어, 그리고 중국 AI 연구소들의 증류(distillation)까지. 이 보고서는 2025년 12월부터 2026년 8월까지를 다루며 악용을 사이버 작전, 여론 조작, 감시, 사기, 생물학적 악용, 재래식 무기, 무단 모델 증류의 일곱 가지 범주로 분류한다. 가장 많이 표적이 된 모델은 Haiku, Sonnet, Opus였으며, 최신 Fable과 Mythos 모델은 단 한 건의 증류 사례에서만 등장했다. Anthropic은 일반적인 악용이 아닌 새로운 유형의 악용을 기록한다고 밝혔다.
사이버 챕터의 핵심 발견은 정교한 공격이 더 이상 정교한 공격자를 필요로 하지 않으며, 정교함이 더 이상 공격 주체 규명의 신뢰할 만한 신호가 아니라는 점이다. 사용된 기법 자체는 익숙한 것들이다: 도난된 자격 증명, 패치되지 않은 기기, SQL 인젝션, 피싱. 변화한 것은 경제성이다. 정찰, 침투, 도구 제작이 이제 기계 속도로 병렬 실행되는 모델에 맡겨지기 때문이다.
Anthropic에 따르면 자동화는 공격자의 비용 구조를 낮춰 이전에는 수지가 맞지 않던 표적도 공격할 가치가 있게 만든다.
백신에 잡히면 스스로 재생성하는 악성코드 Anthropic은 GTG-20006으로 추적하는 러시아어권 에스파이어나지 행위자가 피드백 루프를 사용했다고 기록했다. AI 에이전트들이 사용 중인 악성코드가 일반 보안 제품에 탐지되는지 지속적으로 확인했고, 백신 도구가 이를 잡아내면 에이전트가 다시 감지를 피할 때까지 악성 코드를 스스로 재작성하고 재컴파일했다.
Anthropic은 이것이 방어자에게 부담을 되돌린다고 말한다. 공격자가 새 탐지 시그니처가 배포되는 속도보다 빠르게 변형을 반복한다면, 새 시그니처를 작성하는 것은 더 이상 공격자를 늦추지 못하기 때문이다. 20개 이상의 조직이 표적이 되었으며, 정부 부처, 정보기관, 대사관, 방위산업체가 포함되었고 우크라이나와 유럽에 집중되어 있었다. 드론 공급망이 반복적으로 언급되었으며, 이 행위자는 드론 비전 시스템용 독점 SDK 전체를 포함해 다양한 자료를 훔쳤다. 접근은 때때로 제3자를 통해 이루어졌는데, 침해된 호텔 게스트 와이파이 제공업체의 게스트 기기에 악성코드가 심어지는 방식이었으며, Microsoft는 2026년 7월 이 방식을 CaptiveCrunch라고 명명했다.
ShinyHunters 단체(GTG-50014)에 속한 것으로 Anthropic이 규정한 클러스터는 산업 규모의 자격 증명 채굴에 집중했다. 한 해커는 안드로이드 앱 180만 개를 다운로드해 디컴파일하고 하드코딩된 시크릿 키를 검색했다. Anthropic은 이 접근 방식을 '바이브 해킹(vibe hacking)'이라고 설명한다. 인간이 대략적인 목표를 설정하면 모델이 환경을 평가하고 작업이 완료될 때까지 반복하는 방식이다. 이 해커 중 한 명은 두 회사를 협박한 것에 더해 HackerOne 현상금까지 수령했다고 말했다.
중국 연구소들이 자사 고객의 요청을 Claude로 우회시켜 증류와 관련해 Anthropic은 첫 보고서 이후 중국 연구소 7곳의 추가 공격을 확인했다.