구글, 제미나이 3.5 플래시에 컴퓨터 제어 기능 직접 탑재
구글이 '제미나이 3.5 플래시(Gemini 3.5 Flash)' 모델에 사용자의 화면을 인식하고 직접 조작할 수 있는 '컴퓨터 사용(Computer Use)' 기능을 통합했습니다. 개발자는 이제 브라우저, 모바일, 데스크톱 환경을 아우르는 사무 자동화 및 소프트웨어 테스트 에이전트를 구축할 수 있습니다. 이 모델은 OSWorld 벤치마크에서 경쟁 모델들을 압도하는 우수한 성능을 기록했으며, 프롬프트 인젝션 공격 방지를 위한 강력한 보안 장치도 함께 제공됩니다.
구글, 제미나이 3.5 플래시에 컴퓨터 제어 기능 직접 탑재해 모델이 화면을 보고 조작하도록 구현 작성자: 마티아스 바스티안 (Matthias Bastian) | 2026년 6월 25일
구글이 '컴퓨터 사용(Computer Use)' 기능을 제미나이 3.5 플래시(Gemini 3.5 Flash) 모델에 직접 통합했습니다. 이제 이 모델은 컴퓨터, 브라우저, 모바일 기기의 화면을 스스로 보고 이해하며 상호작용할 수 있습니다. 이전에는 이 기능이 별도의 제미나이 2.5(Gemini 2.5) 모델로만 제공되었습니다.
함수 호출(Function calls), 검색(Search), 지도(Maps)와 같은 기존 도구들과 결합하여, 개발자들은 이제 소프트웨어 테스트나 사무 자동화와 같은 작업을 위해 브라우저, 모바일, 데스크톱 환경 전반에 걸쳐 작동하는 에이전트를 구축할 수 있습니다.
OSWorld 벤치마크에서 제미나이 3.5 플래시는 78.4점을 기록하며 제미나이 3 플래시(65.1점)와 GPT-5.4 미니(72.1점)를 능가했습니다. GPT-5.5는 78.7점으로 근소한 앞서고 있으며, 앤스로픽(Anthropic)의 오퍼스(Opus) 4.8이 83.4점으로 1위를 차지하고 있습니다. 소넷(Sonnet) 4.6 역시 78.4점을 기록했으며, 제미나이 3.1 프로(Gemini 3.1 Pro)는 76.2점을 받았습니다.
프롬프트 인젝션(Prompt injection) 공격을 방지하기 위해 구글은 적대적 훈련(adversarial training)과 두 가지 선택적 기업용 보안 조치를 활용합니다. 하나는 민감하거나 되돌릴 수 없는 작업에 대해 사용자 확인을 요구하는 것이며, 다른 하나는 간접적인 프롬프트 인젝션이 감지될 때 작업을 자동으로 중지하는 것입니다. 또한 구글은 샌드박싱(sandboxing), 인간의 감독, 엄격한 액세스 제어를 권장하며, 자세한 내용은 모범 사례 문서에서 확인할 수 있습니다.
이 기능은 제미나이 API(Gemini API)와 제미나이 엔터프라이즈 에이전트 플랫폼(Gemini Enterprise Agent Platform)을 통해 이용할 수 있습니다. 브라우저베이스(Browserbase) 데모 및 깃허브(GitHub) 참조 구현체도 함께 제공됩니다.
[광고 및 구독 유도 배너] 과장 없는 AI 뉴스 - 전문가가 직접 엄선한 콘텐츠. THE DECODER를 구독하면 광고 없는 읽기, 주간 AI 뉴스레터, 연 6회 독점 제공되는 'AI 레이더(AI Radar)' 프론티어 리포트, 전체 아카이브 액세스, 댓글 섹션 이용권이 제공됩니다. 지금 구독하세요.
출처: 구글