리워드 AI, 원격조작 없이 인간 시연 데이터만으로 학습한 로봇 정책 'OM-1' 공개
Reward AI가 7축(7-DoF) 웨어러블 글러브로 수집한 인간 시연 데이터만으로 학습된 범용 로봇 조작 정책 OM-1(Omnibody Model 1)을 공개했습니다. 이 정책은 산업용 로봇팔과 휴머노이드에서 인간 속도로 작동하며, 30분 미만의 데이터로 새 작업을 학습할 수 있습니다. 아직 가중치, 코드, API는 공개되지 않았습니다.
Reward AI가 7축(7-DoF) 웨어러블 글러브로 수집한 인간 시연 데이터만으로 학습된 범용 로봇 조작 정책 OM-1(Omnibody Model 1)을 공개했습니다. 이 정책은 산업용 로봇팔과 휴머노이드에서 인간 속도로 작동하며, 30분 미만의 데이터로 새 작업을 학습할 수 있습니다. 아직 가중치, 코드, API는 공개되지 않았습니다.
이 기사는 휴머노이드 로봇의 역사와 현황, 그리고 가정용 AI 로봇 시대의 도래를 다룬 IEEE Spectrum의 심층 특집입니다. Roomba부터 Asimo, Atlas, Figure, Neo 등 최신 휴머노이드까지 소개하며, 로봇 개발의 하드웨어적 난제(센서, 배터리, 액추에이터)와 생성형 AI가 로봇 학습에 가져온 혁신을 설명합니다. 결국 영화 속 로봇과 달리, AI 기반의 새로운 범용 로봇이 언젠가 우리 가정에 들어올 것이라고 전망합니다.
Axis Robotics는 웹 브라우저에서 로봇 시연 데이터를 수집하고 고비용 연산은 백엔드 GPU로 처리하는 'AXIS'를 발표했습니다. 이를 통해 207개 과제와 50,129개의 검증된 Franka 궤적(trajectory)을 확보했으며, 지속 사전학습으로 π0.5가 LIBERO-Plus에서 83.9에서 88.8로 향상된 반면, 동량 대조군 RoboCasa365는 57.5에 그쳤습니다.
OpenAI의 GPT-6 Astra를 로봇 팔(YAM 암)에 적용해 Claude Fable 5/5.1과 동일한 두 가지 조작 과제로 비교한 벤치마크 결과다. 블록을 그릇에 넣는 과제에서 Astra는 20회 중 19회 성공(95%)하며 Fable 5.1(8회)을 크게 앞섰고, 회당 비용도 약 절반($0.94 vs $2.12), 소요 시간도 2.5분으로 훨씬 빨랐다. 반면 퍼즐 조각 끼우기 과제에서는 두 모델 모두 20회 중 2회에 그치며 마지막 삽입 단계에서 같은 지점에 막히는 한계를 보였다.
안스로픽이 소프트웨어의 MCP(Model Context Protocol)에 이어 물리 하드웨어용 통합 인터페이스인 '모델 하드웨어 표준(MHS)'을 발표했습니다. AI 에이전트가 현미경, 로봇 팔 등 실험실·공장 장비를 표준화된 드라이버로 제어할 수 있게 하여 기기 통합 시간을 몇 주에서 몇 시간 수준으로 단축합니다. 다만 물리적 인과관계 이해에 한계가 있어 인간의 감독은 여전히 필수입니다.
허깅페이스의 보르도 로보틱스 팀(Pollen Robotics)이 키 25cm의 소형 이족보행 로봇 '마이크로덕(Microduck)' 예약 판매를 시작했습니다. 모든 움직임이 MuJoCo 시뮬레이터에서 강화학습으로 학습된 신경망 정책(policy)으로 구동되며, ONNX로 내보내져 실기기에서 동작합니다. 399달러의 가격에 15개 모터, 카메라, 라이다(LiDAR), IMU 2개와 Apache-2.0 라이선스 학습 스택까지 포함되어 있어, 누구나 책상 위에서 sim-to-real 전 과정을 경험할 수 있다는 점이 큰 의미입니다.
Generalist AI가 단 한 번의 시연만으로 새로운 물리적 작업을 수행하는 로봇 파운데이션 모델(Foundation Model) GEN-1.5를 공개했습니다. 3~12초의 감각운동(sensorimotor) 데이터를 30초 컨텍스트 창에 입력하면 그레이디언트 업데이트나 파인튜닝 없이 로봇이 해당 작업을 즉시 수행합니다. 10가지 다양한 매니퓰레이션 작업에서 원샷 인컨텍스트 프롬프팅 방식으로 평균 59%의 성공률을 기록했습니다.
로봇 스타트업 Generalist AI가 단 한 번의 시연 영상만으로 로봇이 새 작업을 수행하게 하는 AI 모델 GEN-1.5를 공개했습니다. 3~12초 시연을 '물리적 프롬프트'로 컨텍스트 윈도우에 입력하면 별도 학습 없이 작업을 수행하며, 5분 데이터로 10번만 미세조정하면 성공률이 59%에서 83%로 상승합니다. 다만 모든 결과는 회사 자체 발표로 아직 독립적으로 검증되지 않았습니다.
구글은 2026년 7월, 대규모 에이전트(Agent) 구축을 위한 3종의 새로운 Gemini 모델과 로봇의 실세계 작업 수행 능력을 강화하는 'Gemini Robotics ER 2'를 공개했습니다. 또한 영상 및 음악 제작 크리에이티브 도구를 확장하고, 일상적인 웹 업무를 자동화하며 산불 감지 위성 및 기능공 지원 파트너십을 통해 AI의 실용적인 활용 범위를 넓혔습니다.
미국의 국가 안보 우려로 인한 중국산 로봇 수입 금지 조치 속에서, 로봇 스타트업 아티 로보틱스(Ati Robotics)가 주목받고 있습니다. 이 회사는 인도 방갈로르에서 자체 하드웨어를 연구개발하고, 현지 전기차 산업의 부품供应链을 활용하여 중국산 부품 의존도를 극단적으로 낮췄습니다. 이를 통해 가격과 성능을 유지하면서도 공급망 리스크를 회피하는 독자적인 전략을 구축한 사례로 평가받습니다.
구글 딥마인드가 이미지 인식, 언어 처리, 행동 제어를 결합한 최첨단 시각-언어-행동(VLA) 모델인 '제미나이 로보틱스 2'를 공개했습니다. 이 모델은 전신 움직임 제어 및 정밀 작업 수행은 물론 다수 로봇 간 협업까지 가능하여 차세대 적응형 로봇을 위한 핵심 지능층 역할을 수행합니다. 또한, 물리적 세계를 이해하고 이에 따른 행동을 결정하는 '구현된 추론(embodied reasoning)' 모델인 '제미나이 로보틱스 ER 2'도 함께 선보였습니다.
구글 딥마인드가 차세대 로봇을 위한 지능 레이어인 '제미나이 로보틱스 2(Gemini Robotics 2)'를 공개했습니다. 이번 릴리스에는 휴머노이드 전신 제어 모델, embodiment 기반의 추론 및 작업 orchestration 모델, 새로운 로봇 하드웨어에 빠르게 적응하는 온디바이스 VLA 모델 등 총 3가지가 포함되어 업계의 주목을 받습니다. 현재 ER 2 모델만 대중에 공개된 상태입니다.
구글 딥마인드가 전신 움직임과 섬세한 작업을 제어할 수 있는 새로운 로봇 AI 모델 '제미나이 로보틱스 2'를 공개했습니다. 이 모델은 시각 언어 모델(VLM)과 시각 언어 행동(VLA) 모델을 결합하여 주변 환경을 이해하고 스스로 복잡한 작업을 수행할 수 있게 해줍니다. 디지털 영역을 넘어 물리적 세계에 AI를 적용하려는 구글의 의도를 보여주는 중요한 이정표입니다.
로봇 스타트업 Shift는 프라이빗 셰프의 무료 방문 요리 서비스를 제공하는 대신, 1인칭 시점(PoV)의 요리 과정을 촬영하여 로봇 AI 학습 데이터로 활용하고 있습니다. 이는 단순한 홍보가 아니라, 인간의 섬세한 손동작을 데이터화하여 휴머노이드 로봇의 실생활 작업 수행 능력을 향상시키기 위한 '에고센트릭 데이터(Egocentric Data)' 수집의 일환입니다. 기술 발전에 따라 이러한 형태의 데이터 수집 및 거래가 새로운 긱 경제(Gig Economy) 모델로 주목받고 있습니다.
주어진 작업(동작)에 맞춰 로봇의 물리적 구조(embodiment)와 제어기를 자동으로 최적화 설계하는 '트랜스포머 트랜스포머(Transformer Transformer)' 모델이 소개되었습니다. 이 모델은 로봇의 모든 관절과 모터를 통합된 토큰(RoboTokens)으로 표현하여 단일 네트워크에서 로봇 생성, 평가, 제어를 모두 수행할 수 있게 만들어, 로봇 공학 및 코디자인 연구의 패러다임을 전환하는 중요한 연구입니다.
런던 개트윅 공항이 영국 공항 중 최초로 Stanley Robotics와 협력해 자율주행 로봇 주차 시스템을 도입했습니다. 승객은 프라이빗 공간에 차량을 내려놓고 키를 직접 보관한 채 여행을 떠날 수 있으며, 로봇이 차량을 안전한 보관소로 이동시켜 공간 활용도를 극대화합니다. 이 혁신은 승객의 편의성을 높이는 동시에 추가 인프라 건설 없이도 공항의 주차 수용 능력을 효율적으로 확장할 수 있다는 점에서 중요합니다.
독일 AI 기업 블랙 포레스트 랩스(Black Forest Labs)가 이미지, 비디오, 오디오를 동시에 학습하는 멀티모달 기반 모델 'Flux 3'를 공개했습니다. 이 모델은 최장 20초의 네이티브 오디오가 포함된 영상을 생성하며, 경쟁 모델들을 압도하는 성능을 보여줍니다. 또한 아우디(Audi) 등에 적용되는 로봇 공학용 비디오 액션 모델까지 선보이며 실제 산업 활용도를 높였다는 점에서 중요합니다.
최근 AI 업계에 앤스로픽(Anthropic)이 물리적 세계를 이해하는 로봇 스타트업 피지컬 인텔리전스(Physical Intelligence)를 인수한다는 소문이 퍼지며 큰 화제가 되었습니다. 피지컬 인텔리전스는 로봇 뇌 모델로 유명하며 오픈AI(OpenAI) 등이 투자한 핵심 기업인 만큼, 양사의 실제 인수 협상 사실이 알려지며 AI 모델이 초지능으로 발전하기 위해 로봇 및 하드웨어 역량이 필수적이라는 업계의 방향성을 시사합니다.
로봇 스타트업 그릿(Gritt)이 3천4백만 달러의 자금 조달과 함께 공개되어, AI 기반 로봇 시스템을 통해 태양광 패널 설치 작업의 효율성을 크게 높이고자 합니다. 이 시스템은 기존 하드웨어를 활용해 작업자의 부상을 줄이고 설치 속도를 몇 배 이상 향상시키며, 향후 다른 건설 작업으로 확장할 계획입니다. 이는 노동력 부족 문제를 해결하고 기후 변화 대응 인프라 구축을 가속화하는 중요한 혁신으로 평가됩니다.
Pantograph 연구팀은 인터넷 규모의 비디오 데이터를 사전 학습하여 목표를 달성하는 범용 로봇 AI 모델을 개발했습니다. 이 방법론은 보상 함수나 행동 데이터가 없는 영상에서 '사후 재라벨링(hindsight relabeling)' 기법을 활용해 목표 지향적 행동을 학습하는 것이 핵심입니다. 연구팀은 이를 통해 40억 매개변수(4B) 규모의 모델 'Pan'을 구축하여 마인크래프트 환경에서 전투, 탐험, 건축과 같은 복잡한 장기 목표를 능동적으로 수행할 수 있음을 증명했습니다.
양 르쿤(AI 석학)은 현재의 LLM(대형 언어 모델)이 물리적 현실을 이해하지 못해 진정한 지능이나 로봇 제어에 한계가 있다고 지적했습니다. 그는 훨씬 적은 자본으로 10억 달러를 유치하며 물리적 세계를 추상화하고 이해하는 새로운 AI 아키텍처(JEPA)를 개발하는 스타트업을 설립했습니다. 이는 LLM 확장만으로는 초지능(AGI)에 도달할 수 없다는 업계의 반성과 차세대 AI 패러다임으로의 전환을 시사합니다.
로봇 손 제조 스타트업 프로셉션(Proception)은 테슬라와의 영업비밀 침해 소송을 원만히 합의하여 마무리했습니다. 동시에 로봇 공학에서 가장 어려운 난제 중 하나인 '로봇 손' 문제를 해결하기 위해 독자적인 훈련 데이터(training data) 수집 방식을 도입하며 1,100만 달러(약 110억 원)의 시드 투자를 유치했습니다.
스위스 스타트업 플렉시온(Flexion)은 시뮬레이션과 강화학습을 활용해 휴머노이드 로봇이 사무실 잡무를 자율적으로 수행하도록 훈련하는 AI 소프트웨어를 개발했습니다. 이는 기존 원격 조종 방식의 한계를 넘어, 로봇 하드웨어 자체보다 이를 지능화하는 기초 AI 모델이 핵심 경쟁력임을 보여줍니다.
중국 하드웨어의 수도 선전의 스타트업 IO-AI Tech는 작업자가 VR 헤드셋과 모션 트래킹 기어를 착용하고 휴머노이드 로봇을 원격 조종하며 노동을 수행하는 원격 조작(Teleoperation) 기술을 선보이고 있습니다. 이 과정에서 수집되는 데이터는 휴머노이드 로봇이 완전히 자율적으로 작업할 수 있도록 돕는 AI 훈련에 활용됩니다. 이러한 접근 방식은 자율주행차의 발전 과정과 유사하게, 점진적인 AI 자동화를 이끌며 제조 및 유통 업계의 노동력을 혁신적으로 대체할 중요한 기반 기술로 평가받고 있습니다.
엔비디아, 카네기멜론, UC 버클리 연구진은 AI 코딩 에이전트가 로봇을 스스로 훈련시키는 'ENPIRE' 프레임워크를 개발했습니다. 8개의 로봇이 협력해 핀 조립, 케이블타이 절단 등 까다로운 실제 작업에서 최대 99%의 성공률을 달성했습니다. 이는 로봇 학습 과정에서 인간의 개입을 획기적으로 줄여 학습 시간과 비용을 크게 단축할 수 있는 중요한 기술 패러다임 전환을 보여줍니다.
오픈AI가 2020년 폐지했던 로봇 공학 부서를 약 5년 만에 전면 부활시켰습니다. 단기적으로는 전문가의 인프라 구축을 돕는 로봇을 개발하고, 장기적으로는 사용자가 필요한 모든 작업을 수행하는 '개인 전용 범용 로봇'을 목표로 하고 있습니다. 이는 물리적 세계의 데이터를 확보하고 AGI(범용 인공지능) 달성을 앞당기기 위한 '구현형 AI(Embodied AI)' 모델 전략으로 풀이됩니다.
1980년대 후반 취미 개발자 그룹이 모터 대신 공압식 '공기 근육(Air-Muscles)' 액추에이터를 적용해 무릎과 발목이 없는 형태의 이족보행 로봇 '섀도우 워커(Shadow Walker)'를 제작했습니다. 당시 이 독창적인 DIY 프로젝트에 참여했던 창작자들은 훗날 로봇 산업을 선도하는 선구적인 로봇 공학 회사를 설립하는 데 성공했습니다.
제네시스 AI가 물리, 렌더링, 컴파일, 툴링 등 4가지 핵심 요소로 구성된 시뮬레이션 플랫폼인 '제네시스 월드 1.0'을 발표했습니다. 이 플랫폼은 시뮬레이션과 실제 로봇 구동 환경 간의 높은 상관관계(피어슨 상관계수 0.8996)를 입증하여 현실 세계를 매우 정밀하게 모사합니다. 더불어 로봇 정책(Policy) 평가 시간을 200시간 이상에서 0.5시간 미만으로 극적으로 단축시켜 로봇 학습 및 테스트의 효율성을 획기적으로 높였다는 점에서 실무자들에게 매우 중요한 의미를 갖습니다.
AI 훈련 스타트업 Shift는 청소 도구 대신 작동하는 '매직 햇'을 쓰는 방식으로 가정 내 청소를 무료로 제공합니다. 이 과정에서 촬영된 청소 데이터는 민감한 정보가 모두 익명화된 뒤 로봇 학습에 활용됩니다. 이는 인간의 작업 데이터를 수집해 로봇을 훈련하려는 시장의 성장을 보여줍니다.
해커뉴스에 자율주행 및 로봇 공학 연구를 위한 '오픈소스 AI 레이싱 하네스'가 소개되었습니다. 소속사인 Elodin은 지구 중력장 모델인 EGM2008의 초고속 구현체를 새롭게 추가하여 성능을 개선하였습니다. 또한 200만 달러(약 27억 원) 규모의 프리시드 투자 유치를 성공적으로 마치고 첫 정규 직원(비행 소프트웨어 엔지니어)을 영입하며 본격적인 기술 고도화에 나섰습니다.