블랙 포레스트 랩스, 네이티브 오디오 영상 생성 최초 공개
독일 AI 기업 블랙 포레스트 랩스(Black Forest Labs)가 이미지, 비디오, 오디오를 동시에 학습하는 멀티모달 기반 모델 'Flux 3'를 공개했습니다. 이 모델은 최장 20초의 네이티브 오디오가 포함된 영상을 생성하며, 경쟁 모델들을 압도하는 성능을 보여줍니다. 또한 아우디(Audi) 등에 적용되는 로봇 공학용 비디오 액션 모델까지 선보이며 실제 산업 활용도를 높였다는 점에서 중요합니다.
독일의 AI 기업 블랙 포레스트 랩스(Black Forest Labs, BFL)가 이미지, 비디오, 오디오를 함께 학습하는 멀티모달 기반 모델인 Flux 3를 발표했습니다. BFL의 초기 테스트에서 이 모델은 비디오 생성 분야에서 여러 경쟁사를 제쳤습니다. BFL는 Flux 3를 "실제 세계의 시각적 지능"을 향한 발걸음이라고 설명하며, 이는 물리적, 디지털 환경 전반에 걸쳐 "인지하고, 예측하며, 행동하는" 모델을 의미합니다. 이러한 움직임은 이른바 세계 모델(World Model)을 구축하려는 업계 전반의 노력 일환입니다.
BFL는 단일 모달리티(양식)만으로는 현실을 온전히 담아낼 수 없다고 주장합니다. 이미지는 공간적 구조를 보여주고, 비디오는 시간에 따른 변화를 기록하며, 오디오는 기계적 사건과 그로 인해 발생하는 소리 간의 연관성을 드러냅니다. 세 가지를 모두 함께 학습하면 서로의 빈 공간을 채워줄 수 있어, 개별적으로 학습할 때보다 모델에 훨씬 더 많은 정보를 제공할 수 있습니다.
Flux 3는 최장 20초의 네이티브 오디오 영상 생성을 지원합니다. Flux 3는 이번에 처음으로 최장 20초 길이의 네이티브 오디오가 포함된 비디오를 생성할 수 있게 되었습니다. 텍스트-비디오(text-to-video), 이미지-비디오(image-to-video), 비디오-비디오(video-to-video), 키프레임 기반 전환, 다국어 대화, 그리고 긴 다중 컷 시퀀스를 위한 에이전트 기반 영상 연결 기능을 지원합니다. BFL는 이 모델이 인간의 얼굴 표정 묘사와 물리적 사건에 맞는 소리를 매칭하는 데 특히 뛰어나다고 밝혔습니다.
초기 평가에서 BFL는 720p 해상도의 10초 클립을 기준으로 Flux 3가 비교 결과의 93%에서 Luma Ray 3.2보다, 77%에서 Runway Gen-4.5보다, 69%에서 Grok Imagine Video보다 선호되었다고 보고했습니다. 강력한 경쟁 모델과의 격차는 좁혀집니다. Flux 3는 60%의 비율로 Kling v3 Pro보다 선호되었으며, Happy Horse v1(59%), Happy Horse 1.1(57%)을 앞섰고, Seedance 2.0 및 Gemini Omni Flash와는 각각 52%의 비율로 우위를 보였습니다. BFL는 이 결과가 예비적이며 아직 독립적인 테스트 결과는 없다고 밝혔습니다. 이미 헐리우드 수준에 도달한 Seedance나 Gemini Omni Flash와 같은 최고 수준의 시스템과 경쟁할 수 있다는 것은 Flux 3가 최상위권 비디오 모델에 속함을 의미합니다.
또한 BFL는 Flux 3가 이미지 생성 품질, 특히 복잡한 프롬프트와 여러 언어의 정확한 텍스트 렌더링 부문에서도 개선될 것으로 기대하고 있습니다. 회사는 향후 몇 주 내로 Flux 3 Image를 얼리 액세스(Early Access)로 출시할 계획입니다. BFL는 이 모델이 세계에 대한 이해를 바탕으로 행동을 예측할 수도 있다고 덧붙였습니다. 회사는 미믹 로보틱스(Mimic Robotics)와 협력하여 비디오 액션 모델인 Flux-mimic을 개발했으며, 현재 아우디(Audi)의 생산 작업에 테스트되고 있습니다.
Flux 3는 하나의 모델이 콘텐츠를 생성하고 동시에 이해하도록 가르치는 BFL의 접근 방식인 Self-Flow에 기반합니다. 멀티모달 트랜스포머는 전용 구성 요소를 사용해 이미지, 비디오, 오디오를 공유 내부 표현으로 변환한 다음 이를 다시 출력물로 바꿉니다. 행동을 위한 구성 요소는 로봇 공학 애플리케이션의 기반을 제공합니다. BFL는 이러한 통합 학습 과정이 기존 표준이었던 플로우 매칭(Flow-matching) 방식보다 생성 품질과 물리적 세계에 대한 모델의 이해도 측면에서 더 나은 결과를 가져다준다고 밝혔습니다.
BFL는 모든 기능을 단계적으로 공개할 계획이며, 피드백 및 안전 테스트를 위한 얼리 액세스 단계를 거칩니다. Flux 3 Video는 이미 이용 가능하며, Flux 3 Image는 앞으로 몇 주 내에 출시될 예정입니다. 행동 예측(Action prediction) 기능은 초기에는 선별된 파트너십을 통해서만 제공될 것입니다.