ByteDance'in Seedance 2.5 modeli yapay zekâ videosunu kontrol edilebilir hâle getiriyor: 30 sn yerel 4K, 50 referans, yerinde düzenleme
ByteDance, Seedance 2.5'i 23 Haziran'da Pekin'deki Volcano Engine FORCE konferansında tanıttı. Teknik özellikler açısından büyük bir sıçrama söz konusu: 10 bit renk ve senkronize sesle yerel 4K çözünürlükte, tek geçişte üretilen 30 saniyelik kesintisiz tek klip. Ancak asıl önemli özellik çözünürlük ya da uzunluk değil. Artık üretilen içeriği yönetebiliyor olmanız. Seedance 2.5, üretim başına 50'ye kadar çok modlu referans kabul ediyor, tamamlanmış bir klibi yeniden üretmek yerine yerinde düzenlemenize olanak tanıyor ve nihai işlemeye geçmeden önce sahneyi 3D olarak taslak hâline getiriyor.
Seedance 2.5'in neleri değiştirdiğine uygulamalı bir bakış
Kısaca rakamlar
Seedance 2.0'dan bu yana yaşanan sıçrama gerçek. Tek klipler birkaç saniyeden kesintisiz 30 saniyeye çıkıyor. Çıktı, 1080p sınırından yükseltilmiş çözünürlük değil, 10 bit renkli yerel 4K'ya geçiyor. Ses, sonradan eklenmek yerine videoyla aynı gizil geçişte birlikte üretiliyor; dolayısıyla gerçekten senkronize oluyor. Referans bütçesi ise görüntüleri, klipleri, sesleri ve stilleri bir araya getiren yaklaşık bir düzine girdiden 50 çok modlu referansa çıkıyor. ByteDance, tüm bunlara ek olarak istemlere uyumun yaklaşık %20 iyileştiğini bildiriyor.
Bunlar yetenek kazanımları. Etkileyiciler ve bir yıl önce her biri başlı başına haber olurdu. Artık değil.
Kontrol yeni ileri sınır
Yapay zekâ video yarışı iki yıl boyunca yetenekler üzerineydi. Kimin modeli 4K üretiyor, kimin modeli sesi senkronize ediyor, kimin modeli karakteri çekimler arasında tutarlı koruyor? Bu yarış büyük ölçüde sonuçlandı. Kling 3.0, Mart ayında sesli 4K desteğiyle çıktı, LTX 2.3 bunu açık kaynaklı olarak yaptı ve öncü modeller artık birbirine o kadar yakın ki aralarındaki farklar uçurum değil, tartışma konusu. Ardından tartışma maliyete kaydı; damıtılmış modeller videonun saniye başına fiyatını 10 kat düşürdü.
Seedance 2.5 bir sonraki eksene işaret ediyor: kontrol. Üç özellik bunu ortaya koyuyor. İlki, hedefli düzenleme. 30 saniyelik bir çekimde karakterin saç rengi yanlışsa klibin tamamını yeniden üretip beğendiğiniz performansı, ifadeyi ve ışığı kaybetmek yerine yalnızca o bölgeyi düzeltiyorsunuz. İkincisi, 50 referans. Bu sayı; bir karakterin yüzünü, setin görünümünü, bir aksesuarı ve hareket stilini aynı anda sabitlemek için yeterli. Böylece çekimler arasında rastlantısal sonuçlar yerine tutarlılık elde edebiliyorsunuz. Üçüncüsü ise tek bir tam işleme bütçesi harcamadan önce sahne düzenini, kamera kadrajını ve hareketi taslaklaştırmanıza olanak tanıyan 3D beyaz model ön görselleştirme adımı.
Bunlar bir araya geldiğinde yalnızca istem verebildiğiniz değil, yönetebildiğiniz bir model ortaya çıkıyor. “Güzel bir şey üretebilir mi?” sorusundan “ikinci denemede tam olarak istediğiniz sonucu alabilir misiniz?” sorusuna geçiş, bu araçları demo makinelerinden üretim araçlarına dönüştüren değişimdir.
Ürün geliştirenler için anlamı
Bir ürün içinde video üretiyorsanız bu sürümden çıkarılacak üç sonuç var.
Yeniden üretim maliyeti, her üretken video özelliğinin görünmeyen yüküydü. Tek bir yanlış ayrıntıyı düzeltmenin tek yolu klibin tamamını yeniden üretmek ve diğer her şeyin yine doğru çıkmasını ummak olduğunda kullanıcılar hem kredilerini hem de sabırlarını aynı ölçüde tüketiyordu. Yerinde düzenleme bu soruna doğrudan müdahale ediyor. Değişiklik yapmak için ödeme yaptığınız birim, klibin tamamından tek bir bölgeye küçülüyor.
Tutarlılığı kullanıma sunmanın yolu referanslardan geçiyor. On çekim boyunca aynı görünen bir karakter, görünümünü koruyan bir set, aynı aksesuar olarak kalan bir nesne. Elli referans yuvası bunları gerçekten sabitlemek için yeterli; kullanılabilir bir varlık üretim hattını geçici bir yenilikten ayıran şey de tutarlılıktır.
İşlemeden önce ön görselleştirme, maliyet tartışmasının öğrettiği dersin başka bir yönden uygulanmasıdır. Pahalı bir 4K geçişine başlamadan önce sahneyi düşük maliyetli 3D ile taslaklaştırmak, pahalı bilgi işlem gücünü şans denemelerine değil, kadrajını önceden belirlediğiniz çekimlere harcamanız anlamına gelir.
Cinevva olarak yatırım yapmayı sürdürdüğümüz yaklaşım bu. Platformdaki üretim araçları ancak içerik üreticileri tek bir şeyi düzeltmek için onlarca kez yeniden üretim yapmak zorunda kalmadan, amaçladıkları sonucu hızlı ve düşük maliyetle elde edebiliyorsa ticari açıdan işe yarar. Yetenekler hızla metalaştı. Maliyet düşüyor. Bir sonraki kullanışlı ürün dalgasını belirleyecek alan ise kontrol, yani tam olarak istenen sonucu bilinçli biçimde elde edebilmek olacak.
Seedance 2.5 şu anda küresel kurumsal beta aşamasında; daha geniş kapsamlı herkese açık sürümün temmuz başında yayımlanması hedefleniyor. ABD'de kullanıma sunulmasına ilişkin henüz bir takvim yok.
Kaynaklar
- The Next Web: ByteDance, 50 referans girdisi kabul eden 30 saniyelik yerel 4K yapay zekâ video modeli Seedance 2.5'i tanıttı
- Digital Applied: ByteDance'in 30 saniyelik yapay zekâ video modeli Seedance 2.5
- MindStudio: Seedance 2.5, 30 saniyelik video, 4K ve 50 çok modlu referansın açıklaması
- Kie.ai: Seedance 2.5 sürümü, ByteDance'in kullanıma sunduğu yenilikler