Varya dari Avataar membuat video AI 10x lebih murah, dan itulah kisah sebenarnya
Avataar.ai memperkenalkan Varya dalam sebuah acara di New Delhi hari ini, yang turut dihadiri Sekretaris Kementerian Elektronika dan Teknologi Informasi India. Ini adalah model video AI dengan 14 miliar parameter yang menurut perusahaan berada dalam kelas kualitas yang sama dengan Wan 2.2 dari Alibaba dan Veo 3 dari Google, tetapi angka yang penting bukanlah tolok ukur kualitas. Yang penting adalah harganya. Varya menghasilkan video dengan biaya sekitar ₹0,48 per detik, yang menurut perusahaan hingga sepuluh kali lebih murah daripada model global terkemuka. Hal itu dicapai dengan menjalankan arsitektur terdistilasi yang memangkas proses pembuatan dari 50 langkah difusi yang biasanya diperlukan menjadi empat, sembari mempertahankan kualitas keluaran yang mendekati model dengan langkah penuh.
Varya, model video terdistilasi dari India, menghasilkan klip dalam empat langkah, bukan lima puluh
Model ini terwujud dengan bantuan IndiaAI Mission milik India, yang menyediakan akses bersubsidi ke komputasi AI nasional. Model ini sengaja dilatih untuk konteks India, sehingga mampu merepresentasikan keragaman regional, festival, makanan, pakaian, dan lingkungan sehari-hari dengan lebih baik dibandingkan model yang sebagian besar dilatih menggunakan data Barat. Demo langsung tersedia di varya.avataar.ai, dan Avataar mengatakan akan merilis Varya sebagai model berbobot terbuka, beserta data pelatihannya, di portal AIKosh milik India agar developer dapat meng-host sendiri atau menyempurnakannya. Laporan teknis mengenai arsitektur dan metode distilasinya juga akan segera diterbitkan.
Empat langkah, bukan lima puluh
Terobosan teknis inilah inti utamanya. Model difusi menghasilkan konten dengan memulai dari derau lalu menyempurnakannya melalui banyak langkah, dan setiap langkah merupakan satu proses penuh melalui jaringan. Lima puluh langkah berarti lima puluh proses. Distilasi melatih model murid yang lebih kecil dan lebih cepat untuk mereproduksi hasil model guru yang lambat dan membutuhkan banyak langkah, tetapi hanya dalam beberapa langkah. Empat langkah alih-alih lima puluh berarti kebutuhan komputasi per frame berkurang lebih dari sepuluh kali lipat, dan komputasi per frame merupakan sumber hampir seluruh biaya pembuatan video.
Angka waktu aktual membuat perbedaannya lebih konkret. Di NVIDIA H200, Avataar mengatakan Varya dapat menghasilkan klip 720p berdurasi 5 detik dalam waktu sekitar 45 detik. Menurut pengukurannya, Wan 2.2 membutuhkan sekitar 1.230 detik untuk pekerjaan yang sama. Ini bukan kemenangan kecil di pinggiran, melainkan perbedaan tingkat yang sangat besar, sekaligus pembeda antara model yang bisa disajikan kepada banyak pengguna dan model yang hanya mampu Anda jalankan untuk sebuah demo.
Ini adalah trik yang sama yang membuat pembuatan gambar secara cepat menjadi praktis selama dua tahun terakhir. Melihatnya diterapkan pada video dalam skala produksi, dengan harga nyata per detik, merupakan sinyal yang patut diperhatikan.
Mengapa biaya menjadi kisah utama video pada 2026
Selama dua tahun, percakapan tentang video AI berfokus pada kemampuan. Model siapa yang bisa menghasilkan 4K. Model siapa yang bisa menyinkronkan audio. Model siapa yang mampu mempertahankan konsistensi karakter di antara pengambilan gambar. Perlombaan itu sebagian besar sudah selesai. Kling 3.0 merilis 4K dengan audio pada Maret, LTX 2.3 melakukannya secara sumber terbuka, dan semua model terdepan sudah cukup berdekatan sehingga perbedaannya menjadi bahan perdebatan, bukan kesenjangan.
Hal yang belum terselesaikan adalah aspek ekonominya. Kami menulis tentang bagaimana Sora menghabiskan sekitar satu juta dolar per hari, sementara pendapatan seumur hidupnya hanya dua juta dolar sebelum OpenAI menutupnya. Kemampuan tidak pernah menjadi masalah. Biaya penyediaannya yang menjadi masalah. Model yang indah tetapi tidak terjangkau hanyalah demo, bukan produk.
Jadi, garis depan yang menarik pada 2026 bukanlah model yang melakukan sesuatu yang baru. Melainkan model yang melakukan hal yang sama dengan sepersepuluh biaya. Varya adalah salah satu titik data. Pergerakan yang lebih luas di seluruh bidang ini—distilasi, langkah yang lebih sedikit, dan model lebih kecil yang disesuaikan untuk konteks tertentu—adalah hal yang mengubah video AI dari etalase yang merugi menjadi sesuatu yang benar-benar dapat dikembangkan oleh tim kecil.
Artinya bagi para kreator
Jika Anda membangun sesuatu yang menghasilkan video sebagai bagian dari produk, bukan sekadar penggunaan satu kali, biaya per detik adalah keekonomian unit Anda. Itulah perbedaan antara fitur yang dapat Anda tawarkan kepada semua orang dan fitur yang harus Anda batasi atau kenakan biaya premium. Penurunan biaya 10x tidak membuat produk Anda 10x lebih baik. Namun, itu membuat seluruh kategori produk yang sebelumnya merugi mendadak menjadi layak.
Inilah sebabnya kami terus lebih memperhatikan sisi murah dari kurva tersebut daripada sisi yang mencolok. Di Cinevva, alat pembuatan konten dalam platform hanya dapat berfungsi sebagai bisnis jika biaya satu kali pembuatan cukup rendah sehingga kreator dapat bereksperimen dengan bebas tanpa membuat kami kehilangan uang pada setiap klik. Pelajaran dari Sora adalah bahwa keluaran hebat dengan biaya yang salah dapat mengakhiri sebuah perusahaan. Pelajaran dari Varya adalah bahwa biaya akhirnya mulai bergerak turun dengan cepat, dan tim yang membangun menggunakan model murah sekaligus bagus akan bertahan lebih lama daripada tim yang mengejar model mahal sekaligus spektakuler.
Aspek regionalnya juga penting. Model yang dilatih untuk konteks India dan diberi harga sesuai anggaran India menjadi pengingat bahwa gelombang alat berikutnya tidak semuanya akan berasal dari segelintir laboratorium AS yang sama, dan tidak semuanya akan diberi harga sesuai daya beli AS. Lebih murah, lebih lokal, dan lebih spesifik merupakan sumbu persaingan yang berbeda dari lebih besar dan lebih umum, serta menjadi area yang lambat dipertahankan oleh para pemain lama.
Referensi
- TechCrunch: Lebih murah, lebih cepat, dan peka budaya, AI video Avataar dibangun untuk skala India
- Outlook Business: Avataar meluncurkan Varya, model AI video terdistilasi pertama India di bawah IndiaAI Mission
- Republic World: Model AI baru buatan India ini ingin membuat pembuatan video jauh lebih terjangkau
- WaveSpeed: Berita pembuatan video AI 2026, model dan pembaruan terbaru
- MagicHour: Pelacak perilisan model video AI 2026