구글 딥마인드, 탁상형 로봇부터 휴머노이드까지 구동할 '제미나이 로보틱스 2' 공개
구글 딥마인드가 이미지 인식, 언어 처리, 행동 제어를 결합한 최첨단 시각-언어-행동(VLA) 모델인 '제미나이 로보틱스 2'를 공개했습니다. 이 모델은 전신 움직임 제어 및 정밀 작업 수행은 물론 다수 로봇 간 협업까지 가능하여 차세대 적응형 로봇을 위한 핵심 지능층 역할을 수행합니다. 또한, 물리적 세계를 이해하고 이에 따른 행동을 결정하는 '구현된 추론(embodied reasoning)' 모델인 '제미나이 로보틱스 ER 2'도 함께 선보였습니다.
구글 딥마인드가 탁상용 로봇 팔부터 휴머노이드 로봇까지 모든 형태의 로봇을 구동하는 제미나이 로보틱스 2(Gemini Robotics 2)를 공개했습니다. 마티아스 바스티안(Matthias Bastian)이 작성한 2026년 7월 31일자 기사입니다.
구글 딥마인드는 자사 역대 최고 수준의 시각-언어-행동(VLA) 모델이라고 밝힌 '제미나이 로보틱스 2'를 발표했습니다. VLA 모델은 이미지 인식, 언어 처리, 행동 제어 기술을 결합하여 로봇이 물리적 환경에서 원활하게 작동할 수 있도록 돕습니다. 딥마인드에 따르면, 이 모델은 탁상용 로봇 팔부터 전신 휴머노이드 로봇에 이르기까지 다양한 시스템을 제어할 수 있습니다.
소속 회사는 제미나이 로보틱스 2를 차세대 적응형 로봇을 위한 '지능층(intelligence layer)'으로 묘사했습니다. 딥마인드의 설명에 따르면 이 모델은 전신 움직임 관리, 정밀한 운동 작업 수행, 다수 로봇의 협력 조정이 가능합니다. 개발자는 대기자 명단(Waitlist)을 통해 조기 액세스를 신청할 수 있습니다.
구글 딥마인드는 '구현된 추론(embodied reasoning)'을 위해 설계된 모델인 '제미나이 로보틱스 ER 2(Gemini Robotics ER 2)'도 함께 소개했습니다. 이 용어는 물리적 세계를 이해하고 해당 정보를 바탕으로 취할 행동을 결정하는 능력을 의미합니다. ER 2는 로봇을 위한 상위 수준의 제어 시스템 역할을 하며, 4월에 출시된 제미나이 로보틱스 ER 1.6을 대체합니다. 이 새로운 모델은 구글 AI 스튜디오(Google AI Studio)에서 이용할 수 있습니다.