AI로 13년 된 취약점 발견…크롬 보안 강화
구글 크롬 보안 팀은 대규모 언어 모델(LLM)을 활용한 자동화된 취약점 발견, 분류 및 패치 인프라를 구축하여 크롬의 보안을 획기적으로 강화했습니다. 이 AI 에이전트 시스템은 무려 13년 동안 코드베이스에 숨어있던 샌드박스 탈출 취약점까지 찾아내는 등 과거 인간 전문가의 한계를 넘어서는 성과를 보여주며 소프트웨어 보안의 패러다임을 전환하고 있습니다.
업데이트를 거듭할수록 더욱 강력해지는 크롬: AI 시대에 크롬과 웹을 더 안전하게 만드는 방법 (2026년 7월 30일)
크롬 보안팀 (Chrome Security Team)
우리는 소프트웨어 보안 산업의 거대한 패러다임 전환기 속에서 살고 있습니다. 대규모 언어 모델(LLM)은 자동화된 취약점 발견에 있어 전례 없는 가능성을 열어주고 있으며, 이는 인간 보안 전문 지식의 한계를 훌쩍 뛰어넘어 공격자보다 한발 앞서나가기 위한 새로운 접근 방식을 요구합니다. 이는 곧 AI 모델을 대규모로 배포하여 수백 개의 보안 버그를 그 어느 때보다 빠르게 찾고 수정함으로써, 더 큰 시스템 복원력과 포괄적인 위협 remediation(해결)을 달성하려는 목표를 의미합니다. 구체적인 방법은 다음과 같습니다.
버그의 삶 (The Life of A Bug) 일부 소프트웨어 버그는 보안상의 심각한 영향을 미칩니다. 단순한 기능적 버그가 짜증 나는 UI 멈춤을 유발할 수 있다면, 보안 버그(또는 취약점)는 익스플로잇(공격 코드)을 구축하는 데 사용될 수 있습니다. 익스플로잇을 통해 공격자는 피해자 컴퓨터에서 개인 데이터를 읽거나 사용자 모르게 기기를 제어하는 등 악의적인 행동을 수행할 수 있습니다. 일단 보안 버그가 코드베이스에 들어오면, 그 수명 주기는 다음과 같이 진행됩니다.
- 버그가 발견됨
- 버그가 분류(triage)됨
- 버그가 수정됨
- 수정된 새로운 크롬 업데이트가 릴리스됨
- 크롬이 재시작되고 업데이트가 적용됨
저희의 목표는 이 모든 단계가 가능한 한 빠르게 진행되는 것입니다.
취약점 발견 크롬 보안 팀은 수년간 LLM을 활용해 왔습니다. 2023년에는 보안 퍼징(fuzzing) 커버리지와 성능을 높이기 위해 LLM을 활용하는 방법을 개발했습니다. 2024년에는 프로젝트 제로(Project Zero)와 협력하여 LLM에 취약점 연구를 위한 특수 도구를 제공하는 'Naptime'을 선보였습니다. 그리고 2025년에는 딥마인드(DeepMind) 및 프로젝트 제로와 협력하여 V8 자바스크립트 엔진과 그래픽 스택에서 성공적으로 버그를 찾아낸 AI 취약점 발견 에이전트인 '빅 슬립(Big Sleep)'을 개발했습니다.
2026년 초, 우리는 제미나이(Gemini)를 활용하여 더 넓은 크롬 코드베이스 전반에서 취약점을 찾고 오탐지율(false positives)은 낮추는 효율적인 에이전트 하네스(agent harness)를 구축했습니다. 이 과정에서 발견된 버그 중 하나는 침해된 렌더러가 브라우저를 속여 로컬 파일을 읽도록 허용하는 샌드박스 탈출(sandbox escape) 버그였으며, 이 버그는 무려 13년 넘게 저희 코드베이스에 조용히 숨어 있었습니다! 저희 중 많은 이들에게 이 사건은 AI 기반 취약점 탐지의 엄청난 잠재력을 확인시켜 주는 결정적인 계기였습니다.
이를 바탕으로 우리는 취약점 발견 에이전트 하네스를 다음과 같이 개선했습니다.
- 오픈 웨이트(open-weights) 및 독점 모델의 각각의 강점을 모두 활용할 수 있도록 모델 상호 운용성(interoperability) 지원 추가.
- LLM의 추론 능력을 학습 데이터를 넘어 확장하기 위해, 이전에 식별된 모든 CVE 및 크롬의 전체 Git 기록을 포함하는 크롬 지식 베이스 구축.
- 모델이 신뢰 경계를 더 잘 이해하고 위협 모델에 대한 정확한 시야를 갖도록 개발자들에게 SECURITY.md 파일 추가 권장.
- 이러한 SECURITY.md 파일을 분석하기 위해 별도의 컨텍스트를 가진 '비평가(critic)' 에이전트 추가.
- 모델의 비결정성(non-determinism)과 시간이 지남에 따른 모델 개선을 고려하여 코드베이스에서 취약점 발견 모델을 여러 번 반복 실행하는 기능 도입.
이러한 모든 과정은 안전성을 염두에 두고 구축되었으며, AI가 예기치 않게 작동할 위험을 완화하기 위한 가드레일(guardrails)을 마련했습니다. 저희 AI는 인터넷에 접속할 수 없는 잠긴 컴퓨터에서 엄격하게 정지된 상태(at rest)의 소스 코드만 분석합니다. 또한 이러한 내부 스캔을 위해 요청을 시작한 애플리케이션과 대상을 기반으로 엄격한 허용 목록(allowlist)을 사용하여 모든 네트워크 요청을 차단하는 전용 환경을 활용하며, 의심스러운 모델 활동을 차단합니다. 더 나아가, 저희는 모델을 제한 없는 모드로 실행한 적이 없으며, 하위 에이전트(subagents)가 로컬 시스템을 수정하거나 지정된 소스 코드 디렉토리 외부의 파일에 접근하는 것을 엄격히 제한합니다.
AI 기반 취약점 탐지는 기존 보안 테스트 인프라를 보완합니다. 예를 들어, 퍼징(fuzzing)은 여전히 특정 유형의 버그를 찾는 데 매우 효과적입니다.