메뉴

#보안 연구

HN
Hacker News 55일 전
IMP 8

LLM 해킹 역량 평가: 1,500달러 실험기

보안 연구원이 취약점을 가진 가짜 앱을 제작하고, 주요 LLM들이 이를 해킹할 수 있는지 실험했습니다. 그 결과 GPT 5.5가 70%의 성공률로 가장 뛰어난 해킹 능력을 입증했으며, Deepseek V4 Pro와 Claude 모델들도 부분적으로 성공했습니다. 이 실험은 LLM이 실제 앱의 Firebase 등 인프라 구성 오류를 파악하고 자동으로 익스플로잇을 수행하는 '공격형 AI 에이전트'로서의 잠재력을 보여줍니다.

보안 연구 LLM 펜테스팅 GPT-5.5