Skip to content

Avataar'ın Varya'sı yapay zekâ videosunu 10 kat ucuzlatıyor ve asıl hikâye de bu

Avataar.ai, bugün Yeni Delhi'de Hindistan Elektronik ve Bilgi Teknolojileri Bakanlığı Müsteşarı'nın da katıldığı bir etkinlikte Varya'yı tanıttı. Şirketin Alibaba'nın Wan 2.2'si ve Google'ın Veo 3'üyle aynı kalite sınıfına koyduğu, 14 milyar parametreli bir yapay zekâ video modeli. Ancak önemli olan kalite karşılaştırması değil, fiyat. Varya, saniyesi yaklaşık ₹0,48'e video üretiyor; şirket bunun önde gelen küresel modellerden on kata kadar daha ucuz olduğunu söylüyor. Bunu, çıktı kalitesini tam adımlı modellere yakın tutarken üretimi alışıldık 50 difüzyon adımından dörde indiren damıtılmış bir mimariyle yapıyor.

Hindistan'ın damıtılmış video modeli Varya, klipleri elli yerine dört adımda üretiyor

Model bu noktaya, ulusal yapay zekâ hesaplama kaynaklarına sübvansiyonlu erişim sağlayan Hindistan'ın IndiaAI Mission programının desteğiyle geldi. Bilinçli olarak Hindistan bağlamları için eğitildiğinden bölgesel çeşitliliği, festivalleri, yemekleri, kıyafetleri ve gündelik ortamları çoğunlukla Batılı verilerle eğitilen modellere göre daha iyi yansıtıyor. varya.avataar.ai adresinde canlı bir demo bulunuyor. Avataar ayrıca geliştiricilerin modeli kendi sistemlerinde barındırabilmesi veya ince ayar yapabilmesi için Varya'yı eğitim verileriyle birlikte Hindistan'ın AIKosh portalında açık ağırlıklı bir model olarak yayımlayacağını söylüyor. Mimariyi ve damıtma yöntemini ele alan teknik bir rapor da yakında yayımlanacak.

Elli yerine dört adım

Buradaki teknik hamle meselenin özü. Difüzyon modelleri gürültüyle başlayıp görüntüyü birçok adımda iyileştirerek üretim yapar ve her adım ağın tamamından bir geçiş gerektirir. Elli adım, elli geçiş demektir. Damıtma, daha küçük ve hızlı bir öğrenci modeli, yavaş ve çok adımlı öğretmen modelin ürettiği sonucu yalnızca birkaç adımda yeniden oluşturmaya yönelik eğitir. Elli yerine dört adım, kare başına on kattan fazla daha az hesaplama anlamına geliyor ve video üretim maliyetinin neredeyse tamamını kare başına hesaplama belirliyor.

Gerçek süreler bunu somutlaştırıyor. Avataar, Varya'nın bir NVIDIA H200 üzerinde 5 saniyelik 720p bir klibi yaklaşık 45 saniyede ürettiğini söylüyor. Aynı iş için Wan 2.2'nin süresini ise yaklaşık 1.230 saniye olarak ölçüyor. Bu, marjinal bir iyileştirme değil; arada bir büyüklük mertebesi var. Kalabalık bir kullanıcı kitlesine sunabileceğiniz bir modelle yalnızca demo amacıyla çalıştırmaya bütçenizin yettiği bir model arasındaki fark da bu.

Hızlı görüntü üretimini son iki yılda uygulanabilir hâle getiren yöntem de buydu. Bunun gerçek bir saniye başı fiyatla, üretim ölçeğinde videoya ulaştığını görmek, dikkat edilmesi gereken asıl sinyal.

Maliyet neden 2026'nın video hikâyesi?

Yapay zekâ videosu etrafındaki tartışmalar iki yıl boyunca kabiliyet üzerineydi. Hangi model 4K üretiyor? Hangisi sesi senkronize ediyor? Hangisi karakteri çekimler boyunca tutarlı koruyor? Bu yarış büyük ölçüde sonuçlandı. Kling 3.0, Mart ayında sesli 4K desteğiyle çıktı, LTX 2.3 ise bunu açık kaynaklı olarak yaptı. Sınırdaki modellerin hepsi birbirine o kadar yakın ki aralarındaki farklılıklar artık uçurum değil, tartışma konusu.

Çözülemeyen şey ise ekonomiydi. OpenAI kapatmadan önce Sora'nın toplamda iki milyon dolar gelir elde etmesine karşılık günde yaklaşık bir milyon dolar harcadığını yazmıştık. Sorun hiçbir zaman kabiliyet değildi. Sorun, modeli sunmanın maliyetiydi. Güzel sonuçlar veren ama karşılanamayacak kadar pahalı bir model ürün değil, demodur.

Dolayısıyla 2026'daki ilginç sınır, yeni bir şey yapan model değil. Aynı şeyi maliyetin onda biriyle yapan model. Varya bunun bir örneği. Tüm alandaki daha geniş çaplı yönelim —damıtma, daha az adım ve belirli bağlamlara göre ayarlanmış daha küçük modeller— yapay zekâ videosunu zarar eden bir vitrinden küçük bir ekibin gerçekten ürün geliştirebileceği bir temele dönüştüren şey.

Geliştiriciler için anlamı

Tek seferlik değil, ürünün bir parçası olarak video üreten herhangi bir şey geliştiriyorsanız saniye başı maliyet, birim ekonominizdir. Herkese sunabileceğiniz bir özellikle kullanımını kısıtlamanız veya ek ücret istemeniz gereken bir özellik arasındaki farkı bu belirler. Maliyetin 10 kat düşmesi ürününüzü 10 kat daha iyi yapmaz. Daha önce zarar ettiren bir ürün kategorisinin tamamını bir anda uygulanabilir hâle getirir.

Bu nedenle eğrinin gösterişli ucundan çok ucuz ucunu izliyoruz. Cinevva'da platformdaki üretim araçları, ancak üretim maliyeti içerik üreticilerinin özgürce deneme yapabileceği kadar düşük olduğunda ve biz her tıklamada para kaybetmediğimizde iş modeli olarak çalışabilir. Sora'dan çıkarılan ders, yanlış maliyetle harika sonuç üretmenin şirketin sonunu getirdiğiydi. Varya'dan çıkarılan ders ise maliyetin nihayet hızla düşmeye başladığı ve ucuz ama iyi modeller üzerine ürün geliştiren ekiplerin pahalı ve göz kamaştırıcı modellerin peşinden gidenlerden daha uzun ömürlü olacağı.

Bölgesel boyut da önemli. Hindistan bağlamları için eğitilmiş ve Hindistan bütçelerine göre fiyatlandırılmış bir model, bu araçların bir sonraki dalgasının yalnızca ABD'deki aynı birkaç laboratuvardan gelmeyeceğini ve yalnızca ABD'deki bütçelere göre fiyatlandırılmayacağını hatırlatıyor. Daha ucuz, daha yerel ve daha özelleşmiş olmak; daha büyük ve daha genel olmaktan farklı bir rekabet ekseni. Yerleşik şirketler de bu eksende savunma geliştirmekte yavaş kalıyor.

Kaynaklar