메뉴
BL
MarkTechPost 42일 전

큐웰 로봇 스위트: 3종 실감형 AI 모델 완벽 분석

IMP
8/10
핵심 요약

알리바바 큐웰(Qwen) 팀이 로봇 제어, 비디오 세계 모델링, 내비게이션을 위한 세 가지 새로운 실감형 AI(Embodied AI) 모델을 선보였습니다. 큐웰3.5 및 큐웰3-VL을 기반으로 구축된 이 모델들은 로봇이 주변 환경을 이해하고 정교하게 물리적 행동을 수행할 수 있도록 지원합니다. 각 모델의 아키텍처와 데이터 파이프라인, 그리고 벤치마크 결과까지 실무자 관점에서 상세히 분석했습니다.

번역된 본문

큐웰(Qwen) 팀의 새로운 세 가지 실감형 AI(Embodied AI) 모델인 큐웰 로봇 스위트(Qwen-RobotSuite)를 심층적으로 분석해 봅니다. 먼저, 큐웰3.5-4B를 기반으로 구축된 비전-언어-행동(VLA, Vision-Language-Action) 조작 모델인 로봇매니플(RobotManip)을 살펴봅니다. 이어서 60층 규모의 MMDiT를 적용하여 언어 조건부로 작동하는 비디오 세계 모델인 로봇월드(RobotWorld)를 분석합니다. 마지막으로, 큐웰3-VL(Qwen3-VL)을 기반으로 2B, 4B, 8B 세 가지 규모로 출시된 내비게이션 모델인 로봇내비(RobotNav)를 다룹니다. 이 글에서는 각 모델의 아키텍처와 데이터 파이프라인, 그리고 벤치마크 결과까지 꼼꼼하게 살펴봅니다. 큐웰 로봇 스위트: 비전-언어-행동(VLA) 조작, 비디오 세계 모델링 및 내비게이션을 위한 3가지 실감형 AI 모델이라는 제목의 이 포스트는 마크테크포스트(MarkTechPost)를 통해 처음 공개되었습니다.

원문 보기
원문 보기 (영어)
We break down Qwen-RobotSuite, the Qwen team's three new embodied AI models. We cover RobotManip, a Vision-Language-Action model built on Qwen3.5-4B for manipulation. We cover RobotWorld, a language-conditioned video world model with a 60-layer MMDiT. We cover RobotNav, a navigation model built on Qwen3-VL across 2B, 4B, and 8B sizes. We walk through the architecture, data pipelines, and benchmark results for each. The post Meet Qwen-RobotSuite: Three Embodied AI Models for VLA Manipulation, Video World Modeling, and Navigation appeared first on MarkTechPost.