FLUX 3 görüntü, video, ses ve robot eylemlerini tek bir modelde birleştiriyor
Black Forest Labs, FLUX 3'ü 23 Temmuz'da yayımladı ve bu, sürüm numarasının düşündürdüğünden daha büyük bir sıçrama. Freiburg merkezli laboratuvar, Photoshop, Canva, Picsart ve bize daha yakın bir örnek olarak Flux sağlayıcısını seçen herkes için Cinevva içinde görseller üreten FLUX modelleriyle adını duyurdu. FLUX 3, şirketin ilk kez video sunması anlamına geliyor ve bunu ayrı bir video modeliyle yapmıyor. Tek bir ağırlık kümesini aynı anda görüntüler, videolar ve sesler üzerinde eğitiyor, ardından aynı omurgayı robot eylemlerini tahmin edecek şekilde genişletiyor. Tek model, dört tür çıktı.
FLUX 3 Video'nun ürettiklerine ilk bakış
Birbirine yapıştırılmış dört ürün değil, tek omurga
Bu yaklaşım, BFL'nin Self-Flow adını verdiği bir araştırma fikrine dayanıyor: görüntü, video ve ses üretimini ayrı sorunlar olarak öğrenmek yerine dünyanın nasıl işlediğini temsil eden tek bir yapı öğrenmek. Görüntü, belirli bir andaki uzamın bir kesitidir. Video buna zaman ve hareket ekler. Ses ise bir çarpma ile onun çıkardığı ses arasındaki nedensel bağı taşır. Hepsini birlikte eğittiğinizde kısıtlamalar birbirini güçlendirir; böylece ses hareketle eşleşmek, hareket de fizik kurallarına uymak zorunda kalır. Lansmandaki şaşırtıcı nokta, eylem tahmininin video kalitesini bozmadan aynı omurgadan ortaya çıkması. FLUX 3'ün aynı ağırlıklarla hem bir robot kolunu çalıştırabilmesinin hem de bir müzik videosu üretebilmesinin nedeni bu.
Somut olarak video
FLUX 3 Video, tek geçişte 20 saniyeye kadar uzunlukta klipler üretiyor; görüntüyle birlikte doğal ses de oluşturuluyor ve buna diyaloglar, ses efektleri ve ortam gürültüsü dahil. Bu süre, OpenAI'ın artık kapatılmış olan Sora'sıyla aynı ve mevcut alandaki çoğu modeli geride bırakıyor. Metinden videoya, görüntüden videoya, videodan videoya üretimi, ana kare geçişlerini, çok dilli diyalogları ve kliplerin aracılı biçimde birbirine bağlanarak çok planlı sekanslar oluşturmasını destekliyor. BFL'nin 10 saniyelik 720p kliplerle yaptığı ilk testlerde değerlendiriciler, karşılaştırmaların %93'ünde onu Luma Ray 3.2'ye, %77'sinde ise Runway Gen-4.5'e tercih etti. En güçlü rakiplere karşı fark yazı tura düzeyine iniyor: hem ByteDance'in Seedance 2.0'ına hem de Google'ın Gemini Omni Flash'ına karşı %52. Bunlar laboratuvarın kendi ön sonuçları; bu nedenle onları kesin bir hüküm değil, bir iddia olarak değerlendirin.
Asıl sorun erişim. FLUX 3 Video, API ve özel ağırlıklar üzerinden sınırlı erken erişimde; başvurmanız ve onay almanız gerekiyor. FLUX 3 Action yalnızca iş ortaklarına açık ve robotik girişimi mimic aracılığıyla gerçek bir Audi üretim hattında test ediliyor. Çoğu tasarımcının asıl istediği sürüm olan FLUX 3 Image ise önümüzdeki haftalarda geliyor. Yerel çıkarım topluluğunun ilgilendiği parça olan açık ağırlıklı FLUX 3 Dev omurgasının 2026'nın ilerleyen dönemlerine kadar çıkması beklenmiyor.
Bir görüntü laboratuvarının çok modlu hâle gelmesi bizim için neden önemli?
BFL'yi yakından izliyoruz çünkü Cinevva zaten onların çalışmalarını kullanıyor. Görüntü modelleri dünyanın en büyük yaratıcı araçlarında yer alan iki laboratuvardan birinin geleceğini birleşik bir video-ses-eylem modelinde görmesi, yalnızca yeni bir oyuncak değil, tüm üretim altyapısının nereye yöneldiğine dair bir işaret. “Bir görsel üret”, “bir klip üret” ve “içinde eylemde bulunabileceğin bir dünyayı simüle et” arasındaki sınırlar tek bir model içinde eriyor. Bu, diğer yönden yaklaşan MIRA dünya modelinde de dikkat çektiğimiz aynı yakınsama.
İçerik üreticileri için pratik çıkarım değişmiyor. Daha iyi, daha uzun ve doğal ses destekli bir video modeli; daha önce Seedance, Kling ve Gemini'nin yaptığı gibi ilk taslağın maliyetini yeniden düşürüyor. Ancak her zaman zor olan kısma dokunmuyor: neyin üretmeye değer olduğunu bilmek ve ardından oluşturulan klibi insanların gerçekten izlemek veya oynamak isteyeceği bir şeye dönüştürene kadar yinelemek. İstemden paylaşmaya, yeniden düzenlemeye ve açık web'de yayımlamaya kadar geliştirmeyi sürdürdüğümüz döngü bu. FLUX 3 ham maddeyi daha ucuz ve daha iyi hâle getiriyor. Bu malzemeyi insanların önemseyeceği bir oyuna veya hikâyeye dönüştürmek hâlâ emek gerektiriyor.
Kaynaklar
- Black Forest Labs: FLUX 3, Gerçek Dünya Modelleri
- VentureBeat: Black Forest Labs, FLUX 3'ü kullanıma sundu
- Decrypt: FLUX 3, durağan görselleri bırakıp video ve robot ellerine yöneliyor
- The Decoder: Flux 3, doğal sesle 20 saniyeye kadar uzunlukta videolar üretiyor
- Black Forest Labs basın bülteni (GlobeNewswire)