로비언트, 60억 매개변수 오픈소스 로봇 기초 모델 'LingBot-VLA 2.0' 공개
앤트 그룹의 로봇 자회사 로비언트(Robbyant)가 다양한 형태의 로봇을 통합 제어할 수 있는 60억 매개변수 규모의 시각-언어-행동(VLA) 모델 'LingBot-VLA 2.0'을 오픈소스로 공개했습니다. 이 모델은 서로 다른 로봇의 신체 구조를 하나의 55차원 동작 공간으로 통합하여 로봇 팔, 손, 이동 베이스 등을 유연하게 제어하며, 최신 벤치마크에서 기존 최고 성능 모델들을 능가하는 결과를 보였습니다.
이 게시글은 MarkTechPost에 처음 게재되었습니다.
앤트 그룹(Ant Group)의 로비언트(Robbyant)는 다양한 하드웨어 구조를 가진 로봇을 조작하기 위한 아파치-2.0(Apache-2.0) 라이선스의 시각-언어-행동(Vision-Language-Action, VLA) 모델인 'LingBot-VLA 2.0'을 공개했습니다. 이 60억 매개변수(6B) 체크포인트는 20가지 로봇 구성에서 수집된 50,000시간의 로봇 궤적 데이터와 10,000시간의 1인칭 인간 영상 데이터 등 약 60,000시간의 방대한 데이터로 사전 학습되었습니다.
이 모델은 로봇 팔, 민첩한 손, 허리, 머리 및 이동 베이스를 포괄하는 모든 하드웨어 구조(embodiment)를 단일화된 55차원의 정규 동작 공간(canonical action space)으로 매핑하여 처리합니다. 또한, 로드 밸런싱 손실(load-balancing loss)을 추가하지 않고도 모델의 처리 용량을 확장할 수 있는 토큰 수준의 보조 손실 제외 믹스처 전문가(Mixture-of-Experts) 동작 전문가 기술을 적용했습니다. 여기에 LingBot-Depth 및 DINO-Video로부터의 이중 쿼리 증류(Dual-query distillation) 기법을 통해 기하학적 및 시간적 감독을 추가하여, 미래를 예측하는 제어 능력을 강화했습니다.
실제로 GM-100 범용 로봇 벤치마크 테스트에서 이 모델은 평가된 두 플랫폼 모두에서 기존의 π0.5 모델과 1세대인 LingBot-VLA-1.0보다 더 뛰어난 성능을 기록했습니다.