FLUX 3 x mimic: 차세대 비디오-행동 모델의 등장
Black Forest Labs의 새로운 멀티모달 파운데이션 모델인 FLUX 3가 로봇 제어 및 영상 생성을 하나로 통합하는 '비디오-행동 모델'로 진화했습니다. 이 모델은 영상 생성 과정에서 습득한 물리적 세계의 이해를 바탕으로 로봇의 행동(Action)을 예측하며, mimic 로보틱스와의 협업을 통해 아우디(Audi) 실무 환경에 배포되었습니다. 단일 모델로 영상과 로봇 제어를 모두 처리함으로써 피지컬 AI(Physical AI)가 자연스럽게 확장되는 중요한 기술적 이정표입니다.
블로그 연구 모델로 돌아가서 FLUX 3 x mimic: 차세대 비디오-행동 모델 우리의 새로운 멀티모달 파운데이션 모델인 FLUX 3의 초기 버전이 현재 로봇에서 실행되고 있습니다. 우리는 mimic robotics에 FLUX.3에 대한 조기 액세스 권한을 제공했습니다. 로봇 학습 및 배포에 있어 그들의 강점과 모델의 세계 지식, 그리고 BFL의 파운데이션 모델 전문성이 결합하여 탄생한 것이 바로 차세대 비디오-행동 모델인 FLUX-mimic입니다. FLUX FLUX 1과 FLUX 2는 이미지를 생성했습니다. FLUX 3는 멀티모달리티로 확장되어 시청각 콘텐츠를 공동으로 생성하며, 동시에 FLUX-mimic의 기반을 제공합니다. mimic와의 협력을 통해 개발된 이 비디오-행동 모델은 아우디(Audi)에서 테스트 및 배포된 로봇을 구동합니다. 언뜻 보기에, 설득력 있는 시각적 콘텐츠를 제작하는 것과 로봇을 제어하는 것은 공통점이 거의 없어 보입니다. 하나는 픽셀을 생성해야 하고, 다른 하나는 물리적 세계가 만지고 조작할 때 어떻게 반응하는지 이해해야 합니다. 만약 하나의 모델이 두 가지를 모두 수행한다면, 그것은 결코 단순한 콘텐츠 생성 모델이 아닙니다. 그것은 세계가 어떻게 작동하는지에 대한 모델이며, 콘텐츠 생성은 그 모델로 할 수 있는 일 중 하나일 뿐입니다. 이것이 바로 FLUX 3입니다. 비디오가 가장 어려운 부분입니다 FLUX 3는 단일 모델로서, 처음부터 이미지, 비디오 및 오디오를 통합하여 학습했습니다. 이 학습의 가장 까다로운 부분(전체 컴퓨팅 비용의 95% 이상을 차지)은 비디오 예측입니다. 현실적인 비디오를 생성하려면 모델은 접촉, 움직임, 무게, 인과관계를 배울 수밖에 없습니다. 이 중 하나라도 틀리면 비디오가 어색하게 보입니다. 세계를 정확하게 렌더링하는 법을 배운다는 것은 세계가 어떻게 작동하는지 배운다는 것을 의미합니다. 상대적으로 오디오는 쉬운 모달리티입니다. 비디오보다 저차원이고 훨씬 세밀하지 않아서, 오디오가 포함된 720p 비디오의 토큰 중 0.5% 미만을 차지합니다. 모델이 비디오 이해를 학습하는 힘든 과정을 일단 마치고 나면, 비디오와 오디오 간의 인과 관계를 학습하여 입술 움직임에 동기화된 음성과 이를 유발하는 물리적 사건에 동기화된 오디오 효과를 예측하게 됩니다. 행동(Action)도 동일한 구조를 따릅니다. 로봇 상태의 저차원 표현은 시각적 관찰과 밀접하게 결합되어 있습니다. 행동, 오디오, 비디오 프레임은 모두 단일 기반 물리적 현실에 대한 부분적 표현입니다. 모델이 비디오와 오디오 이면의 물리적 과정을 학습한 후, 행동 예측은 전혀 새로운 출발이 아닙니다. 그것은 모델이 이미 학습한 현실에 대한 또 하나의 시점일 뿐입니다. 단일 백본(Backbone) 이러한 접근 방식이 옳다면, FLUX 3에게 행동 예측을 가르치는 것이 영구적인 비용을 초래해서는 안 됩니다. 모델이 완전한 성능으로 돌아오기 전에 행동 공간의 구조를 학습하고 내부적인 세계 표현을 이에 맞추기 위해 짧은 혼란 기간이 있을 것으로 예상했습니다. 그리고 그것은 우리가 관찰한 바와 정확히 일치합니다. 대규모 학습 과정에서 우리는 학습 과정에 행동 예측을 추가하고 비디오 생성 품질에 미치는 영향을 관찰했습니다. 모델이 새로운 행동 모달리티를 통합하기 시작하면서 초기에는 텍스트-비디오 및 이미지-비디오에 대한 인간 평가 점수가 최대 10% 하락했습니다. 하지만 3,500 스텝 이후, 모델은 이제 행동까지 예측하면서도 이전의 비디오 생성 작업에 대한 원래의 완전한 품질을 되찾았습니다. 각 계열은 행동 예측이 추가되기 이전의 고유한 품질을 기준으로 정규화되었습니다. 수치가 높을수록 좋습니다. 모델은 입력 및 출력에 행동을 통합해야 했지만, 그렇게 한다고 해서 모델의 용량이 영구적으로 소모되지는 않았습니다. 그저 이 새로운 모달리티가 기존의 세계 모델과 어떻게 관련되는지를 학습해야 했을 뿐입니다. 이것이 파악되고 나자 기존 기능에 대한 성능 저하 페널티는 사라졌습니다. 비디오 생성과 행동 예측은 별도의 파운데이션을 필요로 하지 않습니다. 동일한 백본이 둘 다를 처리합니다. 이 점은 피지컬 AI(Physical AI)가 방향의 전환이 아닌, Black Forest Labs의 로드맵에서 자연스러운 확장이 되게 만듭니다. 콘텐츠 생성은 우리의 멀티모달 FLUX 3 백본이 이미지, 비디오 및 오디오로 수행하는 일입니다. 피지컬 AI는 이 백본이 행동(Action)으로 수행하는 일입니다. 시각적 지능(VIsual intelligence)을 핵심으로 하는 하나의 파운데이션 모델이 모든 것을 가능하게 합니다.