Skip to content

FLUX 3, 이미지·비디오·오디오·로봇 동작을 하나의 모델로 통합

Black Forest Labs가 7월 23일 FLUX 3를 공개했다. 버전 번호가 암시하는 것보다 훨씬 큰 도약이다. 프라이부르크에 기반을 둔 이 연구소는 Photoshop, Canva, Picsart에서 이미지를 생성하는 FLUX 모델로 이름을 알렸다. 우리와 더 가까운 사례로는 Cinevva에서 Flux 제공자를 선택한 모든 사용자가 이 모델을 이용할 수 있다. FLUX 3는 이 회사가 처음 선보이는 비디오 모델이지만, 별도의 비디오 모델로 출시된 것은 아니다. 이미지, 비디오, 오디오를 하나의 가중치 세트로 동시에 학습한 다음, 동일한 백본을 확장해 로봇 동작까지 예측한다. 하나의 모델에서 네 가지 유형의 결과물이 나오는 셈이다.

FLUX 3 Video의 생성 결과를 처음으로 살펴보기

네 제품을 이어 붙인 것이 아닌 하나의 백본

이 모델의 핵심은 BFL이 Self-Flow라고 부르는 연구 아이디어다. 이미지 생성, 비디오 생성, 오디오 생성을 별개의 문제로 학습하는 대신, 세상이 작동하는 방식을 하나의 표현으로 학습한다. 이미지는 특정 순간의 공간을 잘라낸 장면이다. 비디오는 여기에 시간과 움직임을 더한다. 오디오는 충돌과 그로 인해 발생하는 소리 사이의 인과관계를 담는다. 이 모든 것을 함께 학습하면 각각의 제약 조건이 서로를 강화하므로 소리는 움직임과 일치해야 하고, 움직임은 물리 법칙을 따라야 한다. 이번 발표에서 놀라운 점은 비디오 품질을 망치지 않으면서 동일한 백본에서 동작 예측 능력까지 나왔다는 것이다. 덕분에 FLUX 3는 같은 가중치로 로봇 팔을 제어하고 뮤직비디오도 생성할 수 있다.

FLUX 3 Video의 구체적인 기능

FLUX 3 Video는 한 번의 패스로 최대 20초 길이의 클립을 만들며, 영상과 함께 네이티브 오디오도 생성한다. 대사, 음향 효과, 주변 소음이 모두 포함된다. 이 길이는 OpenAI의 현재는 종료된 Sora와 같으며, 재생 시간 면에서 현재 나온 대부분의 모델을 앞선다. 텍스트-투-비디오, 이미지-투-비디오, 비디오-투-비디오, 키프레임 전환, 다국어 대화는 물론, 클립을 에이전트 방식으로 연결해 여러 쇼트로 구성된 시퀀스를 만드는 기능도 지원한다. BFL이 자체적으로 실시한 10초 길이 720p 클립 초기 테스트에서 평가자들은 비교 사례의 93%에서 Luma Ray 3.2보다 FLUX 3를 선호했고, Runway Gen-4.5와 비교해서는 77%에서 FLUX 3를 선택했다. 가장 강력한 경쟁 모델과 비교하면 격차는 동전 던지기 수준으로 줄어든다. ByteDance의 Seedance 2.0Google의 Gemini Omni Flash 모두를 상대로 52%를 기록했다. 이는 연구소가 자체적으로 공개한 예비 수치이므로 확정적인 평가가 아니라 하나의 주장으로 받아들여야 한다.

문제는 접근성이다. FLUX 3 Video는 API와 비공개 가중치를 통해 제한된 얼리 액세스로 제공되며, 신청 후 승인을 받아야 한다. FLUX 3 Action은 파트너에게만 제공되며, 로보틱스 스타트업 mimic을 통해 실제 Audi 생산 라인에서 이미 테스트 중이다. 대부분의 디자이너가 실제로 원하는 제품군인 FLUX 3 Image는 몇 주 안에 출시된다. 로컬 추론 사용자들이 관심을 두는 오픈 웨이트 FLUX 3 Dev 백본은 2026년 후반에나 나올 예정이다.

이미지 연구소의 멀티모달 전환이 우리에게 중요한 이유

Cinevva가 이미 BFL의 기술을 사용하고 있기 때문에 우리는 이들의 행보를 주의 깊게 지켜본다. 세계 최대 규모의 크리에이티브 도구에 이미지 모델을 공급하는 두 연구소 중 하나가 통합 비디오·오디오·동작 모델을 미래로 선택했다면, 이는 단순히 새로운 장난감이 등장했다는 의미가 아니라 전체 제작 기술 스택이 어디로 향하고 있는지를 보여주는 신호다. "이미지 생성", "클립 생성", "직접 행동할 수 있는 세계 시뮬레이션" 사이의 경계가 하나의 모델 안에서 사라지고 있다. 이는 우리가 반대 방향에서 접근한 MIRA 월드 모델을 다루며 짚었던 것과 같은 융합이다.

크리에이터가 실용적인 관점에서 받아들여야 할 메시지는 변함없다. 더 뛰어나고 긴 영상을 만들며 오디오를 네이티브로 생성하는 비디오 모델은 Seedance, Kling, Gemini가 그랬듯 초안 제작 비용을 다시 낮춘다. 하지만 항상 어려웠던 부분은 해결하지 못한다. 무엇을 만들 가치가 있는지 판단하고, 생성된 클립을 사람들이 실제로 보고 싶어 하거나 플레이하고 싶어 하는 결과물로 다듬어 나가는 일이다. 우리가 계속 구축하고 있는 것도 바로 이 반복 과정이다. 프롬프트 작성부터 공유, 리믹스, 오픈 웹 게시까지 모두 포함한다. FLUX 3는 원재료를 더 저렴하고 더 좋게 만들어 준다. 그 재료를 사람들이 관심을 가질 만한 게임이나 이야기로 바꾸는 일은 여전히 크리에이터의 몫이다.

참고 자료