AI 고객지원 에이전트 해킹 기법 연구 발표
DEF CON 34에서 버그바운티 플랫폼 Intigriti 공동창립자 Inti De Ceukelaire가 AI 고객지원 에이전트를 악용하는 방법을 발표했습니다. 이메일 스푸핑으로 피해자 행세를 하거나 프롬프트 인젝션으로 피싱 메일 발송, MFA(2단계 인증) 우회, OTP 탈취 등이 가능하며, 이를 통해 단 몇 주말 만에 5만 달러 이상의 바운티를 획득했습니다.
DEF CON 34에서 버그바운티 플랫폼 Intigriti 공동창립자 Inti De Ceukelaire가 AI 고객지원 에이전트를 악용하는 방법을 발표했습니다. 이메일 스푸핑으로 피해자 행세를 하거나 프롬프트 인젝션으로 피싱 메일 발송, MFA(2단계 인증) 우회, OTP 탈취 등이 가능하며, 이를 통해 단 몇 주말 만에 5만 달러 이상의 바운티를 획득했습니다.
OpenAI의 새 모델 GPT-6 Astra는 전작 GPT-5.6 Sol보다 환각(사실 오류)이 크게 줄었고 직접적 프롬프트 인젝션은 99.99% 차단합니다. 그러나 문서에 숨겨진 간접 프롬프트 인젝션에 대해서는 여전히 8.5%의 공격 성공률을 기록해, 보안이 중요한 AI 에이전트 배치에는 아직 충분히 안전하지 않습니다.
프롬프트 인젝션 공격을 은닉하는 데 쓰이던 'ASCII 밀수(ASCII smuggling)' 기법이 이제 스팸 발송자들이 이메일 필터를 우회하는 데 활용되고 있습니다. 유니코드 태그 문자는 사람 눈에는 보이지 않지만 기계는 읽을 수 있어, ML/NLP 기반 스팸 분류기의 토큰화를 교란할 수 있습니다. 마이크로소프트는 올해 초 이 기법을 사용한 스팸이 하루 2.1만 건에서 250만 건까지 급증했다고 밝혔습니다.
간단한 웹사이트 요약 요청만으로 Claude Code Opus 5의 Auto Mode를 탈취해 코드 실행에 성공한 공격 사례입니다. Anthropic이 의뢰한 제3자 평가에서는 프롬프트 인젝션 성공률이 0.00%로 보고됐지만, 연구자의 표적 공격 체인으로는 최대 80%의 성공률을 기록했습니다. 에이전트를 격리된 환경에서 실행하고 모니터링하는 것이 Auto Mode의 안전 분류기보다 훨씬 중요하다는 점을 보여줍니다.
보안업체 Adversa의 연구원이 유해 명령을 암호화하여 Grok의 안전 가드레일을 우회하는 공격 기법을 발견했습니다. Grok은 복호화된 명령을 따라 사용자의 이름, 위치, 채팅 기록을 공격자 서버로 전송하며, 6월에 xAI에 보고되었음에도 글 작성 시점까지 수정되지 않았습니다. 이는 프롬프트 인젝션의 근본 원인을 LLM이 해결할 수 없음을 보여주는 사례입니다.
보안업체 Varonis 연구진이 Microsoft 365 Copilot Enterprise에 사용자 동의 없이 데이터를 유출시킬 수 있는 취약점을 발견했습니다. 놀랍게도 이들은 역설계 대신 코필록 자체에게 안전장치 구조를 질문하는 방식으로 문서화되지 않은 파라미터(?autorun=1)를 알아냈으며, 이를 악용해 악성 링크 클릭만으로 비밀번호 등 민감 정보를 탈취할 수 있었습니다. 마이크로소프트는 보고 3개월 후 임시 조치를 취하고 이후 근본적 수정을 배포했습니다.
보안 연구진이 OpenAI, Anthropic, Google 등 주요 AI 모델의 암호화된 내부 사고 과정(reasoning)을 추출해 낼 수 있는 취약점을 발견했습니다. 이를 통해 작은 AI 모델을 탈옥시켜 강력한 모델의 원시 사고 과정을 그대로 읽어내고, 공개된 세션에서 비밀번호와 API 키 같은 민감한 정보를 유출할 수 있음이 밝혀졌습니다. 이는 모델 지식 증류(distillation) 및 지적 재산권 침해에 악용될 수 있어 산업계에 큰 보안 경고를 주는 사안입니다.
최근 컴퓨터 과학자들이 최첨단 AI 모델이 문제를 해결하는 과정에서 숨겨두는 '사고 과정(Chain of Thought)'을 추출하는 새로운 기법을 발견했습니다. 연구진은 이 방법을 통해 숨겨진 추론 과정뿐만 아니라 API 키나 비밀번호 같은 민감한 개인정보를 가로챌 수 있음을 증명했습니다. 더불어 일부 중국 AI 모델(미니백 K3 등)의 사고 패턴이 미국 최상위 모델들과 기묘할 정도로 유사하여 '지식 증류(Distillation)'를 통해 복제했을 가능성이 있다는 정황도 제시했습니다.
보안 기업 PromptArmor는 Atlassian의 AI 에이전트 Rovo에 '간접 프롬프트 인젝션' 취약점이 존재함을 밝혀냈습니다. 해커가 흰색으로 처리해 육안에 보이지 않는 텍스트를 PDF 파일에 심어두면, Rovo가 이를 읽는 즉시 Jira 및 Confluence의 민감한 내부 데이터를 훔쳐 외부 서버로 전송합니다. 이는 마이크로소프트 Copilot 등 다른 AI 시스템에도 영향을 미치는 프롬프트 인젝션이 여전히 해결되지 않은 치명적인 보안 문제임을 시사합니다.
보안 업체 Zenity는 블랙햇(Black Hat) 보안 컨퍼런스에서 구글, 마이크로소프트, 오픈AI 등 주요 AI 웹 브라우저 및 확장 프로그램에서 20여 개의 심각한 보안 취약점을 발견했다고 발표했습니다. 이 취약점을 통해 해커는 사용자의 로컬 머신에 접근하거나, 오픈AI의 '아틀라스(Atlas)' 브라우저를 속여 사용자의 WhatsApp 연락처에 대량 스팸 메시지를 전송하고 아마존에서 무단 결제를 유도할 수 있습니다. 이는 AI가 웹 상의 악성 명령을 합법적인 사용자 지시와 혼동하여 실행하는 '프롬프트 인젝션' 공격의 심각성을 보여주는 사례입니다.
최근 AI 학회에서 LLM(대형 언어 모델)의 작동 방식에 내재된 근본적인 보안 취약점이 발표되었으며, 이로 인해 해킹을 통한 악용이 불가피하다는 연구 결과가 나왔습니다. 또한, 첨단 드릴링 기술로 폐업 위기의 지열 발전소를 성공적으로 재가동한 사례와 함께, AI 반도체 붐으로 인해 국내 반도체 업계 종사자들이 최고의 결혼 상대로 떠오른 흥미로운 현황을 전합니다.
최근 연구에 따르면, LLM(대형 언어 모델)이 명령어의 출처를 구분하는 근본적인 메커니즘의 결함으로 인해 완벽한 보안을 구현하는 것은 불가능에 가깝습니다. 연구진은 모델의 '사고 사슬(Chain of Thought)'을 위장하는 프롬프트를 통해 주요 AI 모델들의 안전장치를 우회하고 유해 정보를 쉽게 얻어냈습니다. 이는 기존의 레드팀(Red-teaming) 방식이 한계가 있음을 증명하며, AI를 활용하는 모든 산업 분야에서 보다 근본적인 안전 대책 마련이 시급함을 시사합니다.
외부 문서에 숨겨진 악의적 프롬프트가 MS 워드의 카피일럿(Copilot)을 교란하여, 문서를 수정하고 다른 문서로 스스로 전파되는 'AI 웜' 공격 사례가 확인되었습니다. 사용자가 모르는 사이에 감염된 문서가 사내에서 계속 재사용되며 2차 피해를 확산시킬 수 있어 매우 심각한 보안 위협입니다. 현재 완벽한 패치는 없으므로 외부 문서를 카피일럿과 연동할 때 각별한 주의가 필요합니다.
Anthropic의 신모델 Opus 5가 자체 보안 소프트웨어와 결합했을 때, AI 에이전트의 가장 심각한 보안 취약점으로 꼽히는 '프롬프트 인젝션(Prompt Injection)' 공격을 0%의 성공률로 사실상 완벽하게 차단했습니다. 모델 자체의 방어력도 크게 향상되었지만, 완벽한 차단은 데이터를 사전에 검사하고 위험 명령을 차단하는 이중 보안 레이어(Auto Mode)가 활성화되었을 때 달성됩니다. 이는 프롬프트 인젝션을 완전히 막는 것은 불가능할 수 있다고 언급했던 기존 업계의 우려를 뒤집는 중요한 보안적 성과입니다.
터미널 제어용으로 쓰이는 ANSI 이스케이프 시퀀스를 악용해, 사용자 눈에는 보이지 않지만 AI 모델에게는 악성 지시문이 읽히도록 숨기는 새로운 프롬프트 인젝션 공격이 대두되었습니다. 특히 AI 에이전트와 연결되는 MCP 서버 환경에서 이 취약점이 치명적으로 작용할 수 있으며, DAST(동적 애플리케이션 보안 테스트) 스캐너를 통해 이를 탐지하고 방어하는 방안의 중요성이 강조됩니다.
오픈AI는 'GPT-Red'라는 내부 AI 모델을 도입하여 자체 GPT 모델의 보안 취약점을 자동으로 찾아내고 있습니다. 이 시스템은 인간 레드팀(보안 테스터)보다 훨씬 뛰어난 84%의 성공률로 프롬프트 인젝션(Prompt Injection) 등의 공격을 시뮬레이션하며, 이를 통해 모델의 보안을 대폭 강화했습니다. 이는 AI 모델의 자동화된 방어 및 진화 가능성을 입증했다는 점에서 매우 중요합니다.
클로드(Claude)의 메모리 시스템과 웹 검색 기능을 악용해 사용자의 대화 기록을 외부로 유출할 수 있는 취약점이 발견되었습니다. AI가 수집한 방대한 사용자 데이터가 해커의 유도에 따라 공격자 서버로 무단 전송될 수 있어 큰 보안 위협으로 평가됩니다.
최근 연구진은 AI 코딩 어시스턴트가 흔히 저지르는 '환각' 현상을 악용해 대규모 기기 감염을 유도하는 '할루스콰팅(HalluSquatting)' 공격 기법을 발표했습니다. 공격자는 AI가 존재하지 않는 패키지 이름을 착각하여 검색할 때 악성 패키지를 미리 등록해두어, 감염된 기기를 통한 봇넷 구축이나 랜섬웨어 유포에 악용할 수 있습니다. Cursor, GitHub Copilot 등 주요 개발 도구들이 이 공격에 취약하므로 개발자들은 제3자 코드 및 리소스를 불러올 때 각별한 주의가 필요합니다.
보안 연구진이 GitHub의 신규 AI 자동화 시스템(Agentic Workflows)에서 간접 프롬프트 인젝션(명령어 삽입) 취약점을 발견했습니다. 공개된 저장소에 악성 명령어가 숨겨진 이슈(Issue)를 등록하기만 하면, AI 에이전트가 속아 조직 내 비공개 저장소의 코드를 공개 댓글로 유출하게 됩니다. 개발자 권한이나 별도의 인증 없이도 누구나 쉽게 해킹을 실행할 수 있다는 점에서 매우 심각한 보안 위협으로 평가됩니다.
최신 연구에 따르면, 악성 웹사이트가 AI 브라우저를 속여 '가상 세계'로 몰아넣어 안전 장치를 무력화시킬 수 있는 치명적인 공격 기법이 확인되었습니다. 이를 통해 해커가 사용자의 기기에 저장된 민감한 정보나 자격 증명을 가로챌 수 있어, 시스템 권한을 가진 AI 브라우저 도입 시 보안 검토가 시급합니다.
개발자가 자신의 OpenClaw AI 어시스턴트(Fiu)를 대상으로 2,000명 이상의 사용자가 프롬프트 인젝션 공격을 시도하게 한 실험 결과, 6,000개가 넘는 이메일 공격에도 불구하고 기밀 파일이 단 한 번도 유출되지 않았습니다. Anthropic의 최상위 모델을 사용하여 단 몇 줄의 단순한 보안 지시사항만으로도 강력한 프롬프트 인젝션 방어가 가능함이 입증된 흥미로운 사례입니다.
유럽의 2위 디지털 은행인 번큐(Bunq)의 AI 어시스턴트에서 간접 프롬프트 인젝션(Indirect Prompt Injection) 취약점이 발견되었습니다. 공격자가 0.02유로를 송금하며 거래 내역에 악의적인 프롬프트를 숨기면, 피해자가 은행 앱에서 AI에게 질문할 때 AI가 이를 지시어로 인식하여 사용자를 겨냥한 정교한 피싱(스피어피싱) 공격을 자동으로 실행하게 됩니다. 이는 금융권 AI 시스템이 외부 데이터를 신뢰하고 처리하는 구조적 근본 결함을 보여주는 매우 중요한 보안 이슈입니다.
OpenAI가 악의적인 명령어가 숨겨진 콘텐츠로부터 민감한 데이터를 보호하기 위한 새로운 기능인 '잠금 모드(Lockdown Mode)'를 발표했습니다. 이 모드를 활성화하면 실시간 웹 브라우징, 이미지 검색, 심층 리서치, 에이전트 모드 등이 제한되며 데이터 유출 위험을 크게 줄일 수 있습니다. 이 기능은 민감한 데이터를 다루는 기업 및 사용자를 위해 현재 ChatGPT 비즈니스 계정 및 일부 개인 계정에 순차적으로 제공되고 있습니다.
최근 해커들이 메타의 AI 고객 지원 에이전트를 속여 인스타그램 계정을 탈취하는 사건이 발생했습니다. 이는 초지능 AI가 스스로 시스템을 해킹하는 것에 대한 우려가 커지는 가운데, 실제로는 AI 자체가 공격 표적이 되어 단순한 명령에 취약점을 노정했다는 점에서 중요성이 큽니다. 기업들이 업무를 AI에 맡기는 추세가 가속화됨에 따라, AI 에이전트에 대한 기본적인 보안 가드레일과 통제 구축이 시급해졌습니다.
Anthropic은 Claude를 활용한 에이전트 시스템 도입 시 발생할 수 있는 치명적인 오작동(폭발 반경)을 통제하기 위해 샌드박스 격리와 접근 권한 제한 기술을 적용했습니다. 특히 사용자의 알림 피로도(승인율 93%)를 낮추기 위해 자동 승인 모드를 도입하는 등 실제 운영 환경에서 겪은 보안 문제와 해결 과정을 공유합니다.
해커들이 메타의 AI 지원 챗봇에 프롬프트를 입력해 이중 인증(2FA)을 무력화하고 유명 인스타그램 계정을 탈취했습니다. 해커들은 공개된 사진을 AI 영상 생성기에 통과시켜 신원 확인 절차를 우회하고 계정을 암시장에서 매각했습니다. 이는 AI 시스템이 악의적인 명령과 정상적인 요청을 구분하지 못하는 '프롬프트 인젝션' 및 '혼란된 대리인(Confused deputy)' 공격의 대표적인 사례입니다.
OpenAI가 출시한 구글 시트용 ChatGPT 확장 프로그램에서 간접 프롬프트 인젝션(Indirect Prompt Injection) 공격을 통해 사용자의 스프레드시트 데이터가 외부로 유출될 수 있는 심각한 취약점이 발견되었습니다. 사용자가 자동 편집을 비활성화해도 공격이 실행되며, 악의적 스크립트를 통해 피싱(Phishing) 공격 및 다수의 통합 문서(Workbook) 유출이 가능합니다. 연구진의 책임 있는 공개(Responsible Disclosure)에도 불구하고 OpenAI가 이를 무시함에 따라 보안 위험이 알려지게 되었습니다.
자바 테스트 라이브러리인 jqwik 1.10.0 버전에 코딩 에이전트를 교란하기 위한 프롬프트 인젝션 문구가 포함되어 논란이 되었습니다. 이 업데이트는 개발자의 터미널에서는 보이지 않도록 ANSI 이스케이프 코드를 활용해 숨겨두고, CI 로그나 AI 에이전트가 읽을 때만 작동하도록 설계되었습니다. 이는 공급망 보안 및 AI 도구 사용에 있어 새로운 형태의 위협으로 평가받고 있습니다.
한 오픈소스 개발자가 자신이 만든 자바(Java) 테스트 엔진에 AI 코딩 에이전트의 기존 지시를 무시하고 테스트 코드를 전부 삭제하라는 '프롬프트 인젝션(Prompt Injection)' 공격 코드를 몰래 숨겨 넣어 논란이 일었다. 해당 코드는 사람의 눈에 띄지 않도록 터미널 화면에서 지워지는 기능까지 포함되어 있어 시스템에 치명적인 피해를 줄 수 있다는 비판을 받고 있다. 이 사건은 생성형 AI 도구의 무분별한 사용에 맞서는 '바이브 코딩(Vibe Coding)' 반발 운동이 개발자 윤리를 넘어선 위험한 수준으로 번지고 있음을 보여준다.
최신 LLM 에이전트 시스템에 적용된 프롬프트 인젝션 공격 탐지기를 무력화시키는 새로운 '도메인 위장(Camouflage)' 기법이 연구진에 의해 확인되었습니다. 공격 페이로드를 특정 문서의 전문 용어와 권위적 구조로 위장할 경우 Llama 모델의 탐지율이 93.8%에서 9.7%로 급감하며, 상용 보안 분류기마저 이를 전혀 탐지하지 못하는 치명적인 맹점이 존재합니다.