Referans Görsel Destekli En İyi Yapay Zekâ Video Modelleri (2026)
Son güncelleme: Eylül 2026.
10 saniyelik bir klip üretmek artık kolay. Her önemli model bunu yapabiliyor. Asıl soru şu: bir karakterin birinci dakikada da sekizinci dakikada da aynı göründüğü 5 veya 10 dakikalık tutarlı bir video üretebiliyor musunuz? Sahne yüzlerce kare boyunca bir arada durabiliyor mu?
Asıl zor problem bu. Ve işler hızla değişiyor. Bu rehber, ya doğrudan uzun video üreten ya da referans görseller aracılığıyla tutarlı karakterlere sahip uzun format içerik oluşturmak için gereken iş akışlarını destekleyen bulduğumuz her modeli kapsıyor. Bunları üç seviyeye ayırdık: doğrudan dakikalar süren video üreten modeller, devam ettirme (continuation) yoluyla uzattığınız güçlü referans görsel desteğine sahip modeller ve kendiniz çalıştırabileceğiniz açık kaynak seçenekler.
Seviye 1: Yerel Uzun Format Üretim (Dakikalar+)
Bu modeller saniyelerle değil dakikalarla ölçülen video üretir. Uzun diziler boyunca zamansal tutarlılık için sıfırdan tasarlanmışlardır.
LongCat Video
Meituan, 2025'in sonlarında LongCat Video'yu piyasaya sürdü. 13,6 milyar parametreli bir difüzyon transformer'ı ve 15 dakikaya kadar tutarlı video üretebilen ilk model.
Model, metinden videoya, görselden videoya ve video devamı özelliklerini birleşik bir işlem hattında destekliyor. I2V modunda, girdi görseli videonun gerçek ilk karesi haline geliyor. Herhangi bir sahneye yerleştirebileceğiniz gevşek bir karakter referansı değil bu. Model, üretim boyunca orijinal görsele referans vermeye devam etmek için "Cross-Chunk Latent Stitching" (Bloklar Arası Gizil Dikiş) kullanarak bu başlangıç karesinden itibaren ileriye doğru animasyon oluşturuyor, böylece renk kaymasını önlüyor ve uzun diziler boyunca görsel tutarlılığı koruyor. Güncellenmiş 2026 versiyonu, 5+ dakikalık konuşan kafa videoları için dudak senkronizasyonlu ses güdümlü avatar üretimi ekliyor.
Perde arkasında LongCat, devasa dizi uzunluklarını yönetmek için Blok Seyrek Dikkat (Block Sparse Attention) ile kabadan inceye doğru bir üretim yaklaşımı kullanıyor. RLHF ayarlaması hareket kalitesini iyileştiriyor. VBench 2.0 kıyaslamasında, Google Veo 3 ve Shengshu'nun Vidu Q1'inin ardından genel sıralamada üçüncü sırada yer alıyor.
Erişilebilirlik: MIT lisansı altında açık kaynak. fal.ai API üzerinden üretilen saniye başına $0,04 fiyatla mevcut (720p'de 15 dakikalık bir video için $36). Ayrıca LongCat'in kendi platformu üzerinden kredi tabanlı fiyatlandırmayla da mevcut.
| Özellik | Değer |
|---|---|
| Maksimum süre | ~15 dakika |
| Çözünürlük | 30fps'de 720p |
| Parametreler | 13,6B |
| Referans görseller | Yalnızca ilk kare (I2V modu, karakter referansı değil) |
| Lisans | MIT |
| API maliyeti | ~$0,04/saniye (fal.ai) |
Seaweed APT2
ByteDance'in Seaweed APT2'si farklı bir yaklaşım benimsiyor. Baştan tam bir video üretmek yerine, tek bir H100 üzerinde kare başına yalnızca 0,16 saniye gecikmeyle 24fps'de kareleri otoregresif olarak üretiyor. Sonuç, tutarlılığını koruyan zamansal tutarlılığa sahip 5 dakikaya kadar kararlı video.
Teknik hile, önceden eğitilmiş çift yönlü bir video difüzyon modelini tek yönlü otoregresif bir üreticiye dönüştüren Otoregresif Çekişmeli Sonradan Eğitim (Autoregressive Adversarial Post-Training, AAPT). Kare başına tek bir ağ ileri değerlendirmesi. Gerçek zamanlı üretimi mümkün kılan şey bu.
Bu modeli ham uzunluğun ötesinde ilginç kılan şey etkileşimliliktir. Video oluşturulurken kamerayı kontrol edebilir, poz tespiti aracılığıyla karakterleri canlandırabilir ve sahneleri manipüle edebilirsiniz. Bunu "bir video üret" yerine "bir videoyu gerçek zamanlı olarak yönlendir" olarak düşünün.
Erişilebilirlik: Yalnızca araştırma aşamasında. Henüz herkese açık değil. 7B temel model (Seaweed-7B) yayımlanmış bir makaleye sahip ancak APT2 ağırlıkları henüz yayınlanmadı.
| Özellik | Değer |
|---|---|
| Maksimum süre | ~5 dakika |
| Çözünürlük | 736x416 (tek GPU), 720p'ye kadar (8 GPU) |
| Parametreler | 8B |
| Referans görseller | I2V ve etkileşimli poz kontrolü aracılığıyla |
| Lisans | Yayınlanmadı |
| Durum | Araştırma önizlemesi |
Helios
Helios, Wan 2.1 üzerine inşa edilmiş olarak Pekin Üniversitesi'nden geliyor. Tek bir H100 üzerinde 19,5 FPS hızında dakika ölçeğinde video üreten 14B parametreli bir model. Kilit yenilik, uzun video kaymasını (drifting) nasıl ele aldığı. Self-forcing veya keyframe sampling gibi geleneksel kayma önleme tekniklerini kullanmak yerine, Helios eğitim sırasında kaymayı simüle ediyor, böylece model bunu düzeltmeyi öğreniyor.
Metinden videoya, görselden videoya ve videodan videoya görevlerini yerel olarak destekliyor. I2V modu üretimi başlatmak için referans görselleri kabul ediyor.
Erişilebilirlik: Apache 2.0 altında tamamen açık kaynak. Mart 2026'da yayınlandı. Kod ve ağırlıklar GitHub'da (PKU-YuanGroup/Helios). Diffusers, SGLang ve vLLM-Omni ile entegre. HuggingFace Spaces'te Gradio demosu.
| Özellik | Değer |
|---|---|
| Maksimum süre | Dakika ölçeğinde (sabit üst sınır yok) |
| Çözünürlük | 720p |
| Parametreler | 14B |
| Referans görseller | Evet (I2V modu) |
| Lisans | Apache 2.0 |
| Donanım | Gerçek zamanlı için tek H100 |
SkyReels V2 / V3
Skywork'ün SkyReels serisi sınırsız uzunlukta videoyu hedefliyor. V2, sabit bir süre sınırı olmadan video üreten bir Otoregresif Difüzyon-Zorlama (AutoRegressive Diffusion-Forcing) mimarisi kullanıyor. Ocak 2026'da yayınlanan V3, referans görselden videoya, videodan videoya uzatma ve ses güdümlü avatar üretimini tek bir modelde birleştiriyor.
V3, 1 ila 4 referans görsel kabul ediyor ve üretilen video boyunca özne kimliğini koruyor. Videodan videoya modu, kusursuz tek çekim devamına ve sinematografik geçişlerle çoklu çekim değişimine olanak tanıyor.
Skywork, 25 Şubat 2026'da SkyReels V4'ü duyurdu; bu, 1080p/32fps'ye kadar video ve sesi birlikte üreten ve koşullandırma girdisi olarak metin, görseller, video klipleri, maskeler ve sesi kabul eden çift akışlı bir model. Temmuz yazımızdaki bir düzeltme: V4 açık kaynak haline getirilmedi. Eylül 2026 itibarıyla SkyworkAI GitHub organizasyonu V1'den V3'e kadar ve Matrix-Game için depolara sahip, V4 ağırlıkları veya herkese açık bir API bulunmuyor, dolayısıyla V3, Skywork'ün açık referanstan videoya tavanı olmaya devam ediyor.
Erişilebilirlik: Tamamen açık kaynak. 1,3B'den 14B'ye kadar parametreli modeller. 540p ve 720p'de mevcut. Kod ve ağırlıklar GitHub ve HuggingFace'te.
| Özellik | Değer |
|---|---|
| Maksimum süre | Sınırsız (otoregresif) |
| Çözünürlük | 540p, 720p |
| Parametreler | 1,3B, 5B, 14B |
| Referans görseller | 1-4 görsel (V3) |
| Lisans | Açık kaynak |
| Donanım | Minimum RTX 4090, önerilen 4-8x A100 |
Seviye 2: Güçlü Referans + Uzatmaya Sahip Kısa Klipler
Bu modeller 8-60 saniyelik klipler üretir ancak güçlü referans görsel desteği ve video uzatma özellikleri sunar. Uzun format içerik için, modelin devam ettirme veya uzatma uç noktalarını kullanarak klipleri birbirine zincirlersiniz. Karakter tutarlılığı, üretimler boyunca kalıcı olan referans görsellerden gelir.
Bu, günümüzde çoğu içerik üreticisinin bir dakikadan uzun içerikler için kullandığı pratik iş akışıdır. Klip başına kalite genellikle yerel uzun format modellerinden daha yüksektir.
Kling 3.0 Omni (Kuaishou)
Kling, herhangi bir video modeli arasında en eksiksiz referans görsel sistemine sahip. Referans girdilerini her biri farklı bir amaca hizmet eden üç farklı kategoriye ayırıyor:
Referans Görseller (image_urls): Stil ve görünüm rehberliği için 4'e kadar görsel. Bunları isteminizde @Image1, @Image2 vb. şeklinde etiketlersiniz. Bunlar, ilk kare olmadan genel görünümü, sahne stilini ve ortamı etkiler.
Elementler (elements): Özel karakter/nesne girdileri. Her element, bir frontal_image_url (net cepheden fotoğraf) artı isteğe bağlı reference_image_urls (ek açılar) alır. Bunlara isteminizde @Element1, @Element2 şeklinde referans verirsiniz. Model, karakterin kimliğini çıkarır ve tanımladığınız herhangi bir sahneye yerleştirir. Bu, macera-film tarzı içerikler için kilit özelliktir: bir karakter fotoğrafı yükleyin, ardından onun bir ormanda yürüdüğünü, bir ejderhayla savaştığını, ne isterseniz onu tanımlayın.
Başlangıç/Bitiş Kareleri (start_image_url, end_image_url): Belirli görselleri ilk veya son kare olarak sabitleyin. Bunlar stil rehberleri değil, gerçek karelerdir.
Üç kategorinin toplamı, 7'ye kadar referans girdisidir (bir referans video da kullanıldığında 4'e düşer). "@Element1 and @Element2 are having dinner at this table on @Image1" gibi tek bir istem, karakterleri sahne referanslarıyla birleştirebilir.
Uzun format içerik için Kling iki yol sunuyor. Çoklu çekim modu, her biri kendi istemi ve süresiyle (her biri 3-15sn) tek bir çağrıda 6'ya kadar sahne üretiyor. Karakter elementleri tüm çekimlerde otomatik olarak kalıcılığını koruyor. Uzatma API'si, tamamlanmış bir videonun kaldığı yerden devam ederek, zincirlenmiş uzatmalar aracılığıyla yaklaşık 3 dakikaya ulaşıyor. V2V düzenleme modu, mevcut videoyu (3-10 saniye) alıp element referansları ve bir metin istemi kullanarak dönüştürüyor, kaynaktaki kamera hareketini ve karakter konumlandırmasını korurken referanslarınıza dayalı olarak karakterleri ve ortamları yeniden stilize ediyor. Bu, Kling'i düşük kaliteli 3D render'lar da dahil olmak üzere mevcut görüntüleri iyileştirmek için özellikle kullanışlı hale getiriyor.
Kling 3.0 Omni, metinden videoya, görselden videoya, referanstan videoya ve video düzenlemeyi yerel ses üretimi ve dudak senkronizasyonuyla tek bir modelde birleştiriyor. Haziran 2026'da Kuaishou, 720p ve 1080p'de ses ile birlikte gelen daha hızlı ve daha ucuz bir varyant olan Kling 3.0 Turbo'yu ekledi ve Omni'nin düzenleme işlem hattını 4K video kabul edecek ve çıktı verecek şekilde yükseltti. Eylül 2026 itibarıyla henüz Kling 3.5 veya 4.0 piyasaya sürülmedi, dolayısıyla 3.0 Omni hâlâ güncel video modeli.
Erişilebilirlik: Kuaishou, fal.ai ve Replicate aracılığıyla ticari API, çözünürlük ve varyanta göre değişen saniye başına fiyatlandırmayla. klingai.com adresinde web arayüzü.
| Özellik | Değer |
|---|---|
| Yerel klip uzunluğu | 3-15 saniye |
| Uzatılmış uzunluk | ~3 dakika (zincirlenmiş uzatmalar aracılığıyla) |
| Çözünürlük | 720p, 1080p (Omni düzenlemede 4K) |
| Referans görseller | 4'e kadar (@Image stil referansları) |
| Elementler | 4'e kadar (cepheden + açılı @Element karakter referansları) |
| Toplam referanslar | 7'ye kadar birleşik (videolu referansta 4) |
| Çoklu çekim | Evet (senaryo panosunda 6'ya kadar çekim) |
| Ses | Yerel senkronize ses + dudak senkronizasyonu |
| Video düzenleme | Evet (mevcut videonun metin güdümlü düzenlemesi) |
| API | Kuaishou, fal.ai, Replicate |
Birden fazla referans görselle Kling görselden videoya
Bu, Kling hakkında en çok sorulan soru, bu yüzden Kling'in kendi VIDEO 3.0 Omni rehberinden alınan, mevcut modelde çoklu görsel referansın nasıl çalıştığının kısa versiyonu burada. Standart görselden videoya, tek bir resim alır ve onu ilk kare olarak canlandırır. Çoklu görsel referans farklı bir moddur: birkaç görsel yüklersiniz, bunları istemde etiketlersiniz ve model bunlardan yeni bir çekim oluşturur. İstek içinde bir referans video olmadan 7'ye kadar görsel ve element ekleyebilirsiniz, referans videoyla bu 4'e düşer. Tek bir karakter elementi, farklı açılardan 4'e kadar fotoğraftan veya 3 ila 8 saniyelik tek karakterli bir video klibinden oluşturulabilir ve karakterin çekimler boyunca aynı sesi korumasını sağlamak için ona 5 ila 30 saniyelik bir ses kaydı bağlayabilirsiniz. İstemde bunlara bir stil veya sahne referansı için @Image1, kilitlenmiş bir karakter veya nesne için @Element1 (veya elemente verdiğiniz isim) olarak referans verirsiniz, böylece "@Grace walks through @Image1 at dusk" gibi bir istem, sağladığınız bir sahneye tutarlı bir karakter yerleştirir. Çıktı, yerel sesle 720p veya 1080p'de 15 saniyeye kadar çalışır ve aynı element kütüphanesi, bir karakteri altı çekimlik bir dizi boyunca nasıl koruyacağınızın yolu olan Kling'in çoklu çekim senaryo panosuna taşınır. Video yerine yalnızca tutarlı sabit görsellere ihtiyacınız varsa, Kling IMAGE 3.0 görsel rehberine göre 10'a kadar referans görsel kabul eder ve yaygın bir iş akışı, karakteri önce orada kilitleyip ardından bu sabit görselleri element olarak beslemektir.
Grok Imagine (xAI)
Görselleri isteminizde <IMAGE_1>, <IMAGE_2> gibi etiketlersiniz. "<IMAGE_1>'deki model, pistte <IMAGE_2>'deki gömleği giyerek yürüyor" gibi bir istem, bir kişi referansını bir kıyafet referansıyla birleştirir. Model; sanal deneme, ürün yerleştirme ve sahneler arasında karakter tutarlılığı olan hikaye anlatımını destekler.
Bir kısıtlama var: aynı istekte referans görselleri görselden videoya moduyla birleştiremezsiniz. Ya ilk kare modu ya da referans modu; ikisi birden olmaz.
Grok Imagine'in ayrıca mevcut bir videonun sonuna yeni görüntü ekleyen bir video uzatma uç noktası var. duration parametresi yalnızca yeni bölümü kontrol eder. Daha uzun içerik oluşturmak için uzatmaları zincirleyebilirsiniz.
xAI, Grok Imagine 1.5'i 3 Haziran 2026'da bir API önizlemesi olarak yayınladı, ardından 16 Haziran'da grok-imagine-video-1.5 olarak genel kullanıma sundu; bir Fast varyantı da tüketici uygulamalarına aktarıldı. Bu, tek bir durağan görseli kamera hareketleri, atmosfer, fizik ve aynı çıkarım geçişinde doğal olarak üretilen senkronize sesle sinematik harekete dönüştüren bir görselden videoya modelidir. Tutarlı sahneleri zincirlemek için çoklu çekim sıralamasını destekler, yaklaşık 25 saniyede 6 saniyelik 720p bir klip üretir ve piyasaya çıktığında Artificial Analysis görselden videoya arenasında üçüncü sıradaydı. Eylül 2026 itibarıyla xAI'nin modeller sayfası, Grok Imagine Video 1.5'i saniye başına $0,08'den, orijinal Grok Imagine Video'yu ise saniye başına $0,05'ten listeliyor. xAI'nin daha yeni Grok Imagine Image 2.0 modeli (sürüm notlarında listelenmiştir) hâlâ bir durağan görsel modelidir; animasyona başlamadan önce bir karakteri sabitlemek için kullanışlıdır, ancak yeni bir video modeli değildir.
Kullanılabilirlik: xAI API (Ocak 2026'da başlatıldı), fal.ai ve Replicate. Python SDK, JavaScript/AI SDK ve REST API. Sesli 720p için saniyede $0,05. Ayrıca X Premium abonelerine de sunulmaktadır.
| Özellik | Değer |
|---|---|
| Doğal klip uzunluğu | 1-15 saniye |
| Uzatılmış uzunluk | Uzatma API'siyle zincirlenebilir |
| Çözünürlük | 480p, 720p |
| Referans görseller | 1-7 (gerçek referans, ilk kare değil) |
| İstem etiketleri | <IMAGE_1>, <IMAGE_2> vb. |
| Ses | Evet (720p) |
| Video düzenleme | Evet (metinle yönlendirilen) |
| API | xAI API, fal.ai, Replicate |
| API maliyeti | $0,05/saniye (Video), $0,08/saniye (Video 1.5) |
Seedance 2.0 (ByteDance)
ByteDance'in Seedance 2.0'ı, herhangi bir modelin kabul ettiği en fazla sayıda referans girdiye sahiptir: aynı anda en fazla 9 görsel, 3 video ve 3 ses dosyası olmak üzere toplam 12 dosya. Model, 8'den fazla dilde fonem düzeyinde dudak senkronizasyonuyla doğal ses-video üretimini destekler.
Tek tek görseller en fazla 30 MB olabilir. Referans videolar 2-15 saniye arasında olmalıdır. Model, referansları karakter görünümü, sahne stilizasyonu ve hareket rehberliği için kullanır.
Bir sonraki büyük sıçrama artık gerçekleşti. ByteDance, Seedance 2.5'i 23 Haziran 2026'da Volcano Engine FORCE konferansında duyurdu ve 31 Temmuz 2026'da yayınladı. Seed ekibinin duyurusuna göre, çoklu tur uzatmalarla tek bir doğal klipte 30 saniyeye kadar üretim yapabiliyor, tek geçişte referans olarak 30 görsel, 10 video klibi ve 10 ses klibine kadar kabul ediyor (12'den 50'ye çıkarıldı) ve bir anı yeniden üretmeden değiştirebilmenizi sağlayan zaman damgası düzeyinde düzenleme ekliyor. Önce Jimeng ve Doubao'ya ulaştı, ardından BytePlus ModelArk kurumsal API'sine geçti ve üçüncü taraflar hızla benimsedi: Runway'in API'si, Runway değişiklik günlüğüne göre 7 Ağustos 2026'da Seedance 2.5'i 4 ile 30 saniye arasındaki sürelerle ve 30'a kadar referans görselle ekledi. Bu kılavuzdaki anlatı iş akışı için, 50 referanslı 30 saniyelik tek bir çekim, aşağıda anlatılan klip birleştirme işinin çoğunu ortadan kaldırıyor.
Kullanılabilirlik: ByteDance resmi API'si (Volcengine üzerinden, Şubat 2026'da başlatıldı) ve üçüncü taraf API sağlayıcıları. API üzerinden 480p-720p çıktı, platform üzerinden 2K sinema çözünürlüğüne kadar.
| Özellik | Değer |
|---|---|
| Doğal klip uzunluğu | 4-15 saniye |
| Çözünürlük | 2K'ya kadar (sinema) |
| Referans görseller | 9 görsel + 3 video + 3 ses'e kadar (toplam 12) |
| Seedance 2.5 klip uzunluğu | Uzatmalarla doğal olarak 30 saniyeye kadar |
| Seedance 2.5 referansları | 30 görsel + 10 video + 10 ses'e kadar (toplam 50) |
| Ses | Dudak senkronizasyonlu doğal ses (8'den fazla dil) |
| API | ByteDance/Volcengine, BytePlus ModelArk (2.5), Runway API (2.5), üçüncü taraf sağlayıcılar |
Runway Gen-4.5
Runway Gen-4.5, o dönemde Veo 3 ve Sora 2 Pro'nun önünde, 1.247 ELO ile Artificial Analysis Metinden Videoya sıralamasının zirvesinde piyasaya sürüldü. Eylül 2026'ya gelindiğinde arena yeniden karışmıştı (Gemini Omni Flash ve Alibaba'nın Wan 3.0'ı zirveyi paylaşıyor, Gen-4.5 ise ilk on dışında kalıyor), ancak Gen-4.5 sinematik kalite ve kontrol edilebilir aksiyon açısından güçlü bir model olmaya devam ediyor ve Runway henüz bir Gen-5 çıkarmadı. Model, metinden videoya için 2-10 saniyelik klipler üretir ve çoklu çekim sıralaması aracılığıyla bir dakikaya kadar karakter tutarlılığına sahip uzun biçimli videoyu destekler.
Görselden videoya özelliği 2026 başında eklendi ve tüm en-boy oranları için referans görselleri destekliyor. Runway'in 2026'daki diğer hamleleri yeni bir temel model yerine düzenleme ve yönlendirme üzerineydi: Aleph 2.0 (2 Haziran 2026), zaman damgalarına sabitlenmiş en fazla 5 anahtar kare görselinin eşlik ettiği bir metin isteminden 2 ila 30 saniyelik mevcut bir videoyu düzenliyor, Gen-3 Alpha Turbo ve orijinal Gen-4 Aleph 30 Temmuz 2026'da API'den kaldırıldı ve API artık Gemini Omni Flash ve Seedance 2.5 dahil üçüncü taraf modellere de hizmet veriyor; tüm bunlar Runway değişiklik günlüğüne göredir. Model, difüzyon mimarisi içinde nöral radyans alanlarını ve Gauss saçılımını (Gaussian splatting) entegre ederek, yalnızca piksel düzeyinde tahmin yerine 3D geometrik anlayış kazandırıyor. Bu, daha iyi nesne kalıcılığı ve fiziksel olarak makul hareket anlamına gelir.
Kullanılabilirlik: Ticari API ve web arayüzü. Node ve Python için SDK'lar. Ayrıca Replicate üzerinden de kullanılabilir.
| Özellik | Değer |
|---|---|
| Doğal klip uzunluğu | 2-10 saniye |
| Uzun biçim modu | ~1 dakikaya kadar |
| Çözünürlük | 1080p'ye kadar |
| Referans görseller | Üretim başına 0-1 |
| Ses | Doğal ses üretimi |
| Çoklu çekim | Evet |
| API | Evet (Runway, Replicate) |
Google Veo 3.1
Google'ın Veo 3.1'i doğal olarak 4, 6 veya 8 saniyelik klipler üretir. "Extend Video" (Videoyu Uzat) özelliği (şu anda önizlemede) klipleri zincirleyerek yaklaşık 1-2,5 dakikaya ulaşır, ancak daha uzun dizilerde tutarlılık kayabilir.
"Ingredients to Video" (Videoya Malzeme) özelliği girdi olarak en fazla 3 referans görsel kabul eder. Canlandırılacak karakterler, arka planlar ve materyal dokuları sağlayabilirsiniz. Referans görselleri kullandığınızda, model görsel referanslarınıza daha yakın kalır ve daha az rastgele değişiklik yapar. Bir kısıtlama var: referans görsel modu yalnızca 8 saniyelik süre seçeneğiyle çalışır.
Ocak 2026 itibarıyla Veo 3.1, referans tabanlı üretim için dikey video (9:16) ve Vertex AI'de 4K yükseltme (upscaling) ekledi. Google, ardından 31 Mart 2026'da en ucuz video modeli olarak Veo 3.1 Lite'ı çıkardı, Veo 2.0 ve 3.0'ı 30 Haziran 2026'da emekliye ayırdı ve Gemini API değişiklik günlüğüne göre Eylül 2026 itibarıyla bir Veo 4 duyurmadı. Yeni video çalışmaları aşağıdaki Gemini Omni Flash'a yönlendiriliyor.
Kullanılabilirlik: Google Vertex AI API, Gemini API ve Google Flow. Google Cloud hesabı gerektirir.
| Özellik | Değer |
|---|---|
| Doğal klip uzunluğu | 4, 6 veya 8 saniye |
| Uzatılmış uzunluk | ~1-2,5 dakika |
| Çözünürlük | 4K'ya kadar (yükseltmeyle) |
| Referans görseller | 3'e kadar ("Ingredients to Video") |
| Ses | Senkronize diyalog ve müzik |
| API | Vertex AI, Gemini API |
Google Gemini Omni Flash
Google, Gemini Omni ailesini Mayıs 2026'da I/O'da duyurdu ve ilk modeli olarak Gemini Omni Flash'ı çıkardı. Kısa sürede Artificial Analysis arenasında, Veo 3.1'in önünde zirveye oturdu. Buradaki fikir konuşma tabanlı videodur: metinden, görsellerden veya videodan 10 saniyelik bir klip üretirsiniz, ardından birbiri üzerine inşa edilen takip talimatları aracılığıyla düzenlersiniz. Sıfırdan yeniden üretmeden aydınlatmayı değiştirin, bir kıyafeti değiştirin, kamerayı ayarlayın.
Referans desteği açısından Omni Flash, stil, hareket ve efekt referansı olarak görseller ve kısa video klipleri kabul eder; ses referansları da planlanmaktadır. Karakter tutarlılığı konuşma tabanlı düzenlemeler boyunca korunur, ancak Google'ın kendi belgeleri sahne değişiklikleri ve kamera panlarında bunun kayabileceğini not düşüyor, bu yüzden karakter ağırlıklı çıktıyı yayınlamadan önce inceleyin.
Kullanılabilirlik: API (gemini-omni-flash-preview) 30 Haziran 2026'da Google AI Studio ve Gemini API üzerinden, çıktının saniyesi başına yaklaşık $0,10 fiyatla kamuya açık önizlemede sunuldu ve gemini-omni-1.1-flash, Gemini API değişiklik günlüğüne göre video uzatma, ara kare ekleme (interpolation) ve çözünürlük kontrolleriyle birlikte 27 Ağustos 2026'da genel kullanıma sunuldu. Her klip bir SynthID filigranı taşır. Tüketici erişimi Gemini uygulaması, Google Flow ve YouTube Shorts üzerinden sağlanıyor ve Runway'in API'si de buna yönlendirme yapıyor.
| Özellik | Değer |
|---|---|
| Doğal klip uzunluğu | 10 saniye (daha uzun süreler planlanıyor) |
| Çözünürlük | 720p |
| Referans girdileri | Görseller + kısa video klipleri (ses planlanıyor) |
| Düzenleme | Konuşma tabanlı, yinelemeli |
| Ses | Doğal |
| API | Gemini API (gemini-omni-1.1-flash olarak GA), ~$0,10/saniye |
OpenAI Sora 2 / Sora 2 Pro
Kullanımdan kaldırılıyor (2026): OpenAI, Sora'yı kademeli olarak durduruyor. Tüketici Sora uygulaması 26 Nisan 2026'da kapandı ve Sora 2 API'si, OpenAI'nin kullanımdan kaldırma sayfasına göre, herhangi bir halef ürün duyurulmadan 24 Eylül 2026'da sona eriyor. Aşağıdaki yetenekler hâlâ dikkat çekicidir, ancak Sora üzerine yeni bir iş akışı kurmayın. Bunun yerine Kling, Grok Imagine veya açık bir model kullanın.
Sora 2 Pro, 20 saniyeye kadar klipler üretir. Characters API, Kling veya Grok'tan farklı bir yaklaşım kullanır: statik görseller yüklemek yerine, API'yi bir video klibine (1-3 saniyelik zaman damgası aralığıyla) yönlendirerek bir character_id oluşturursunuz. Sora, yüz yapısı, vücut oranları, kıyafet stili ve diğer ayırt edici özellikleri çıkarmak için video karelerini analiz eder. Bu character_id süresiz olarak kalıcıdır ve sınırsız sayıda gelecekteki üretimde yeniden kullanılabilir.
Üretim başına en fazla 2 yüklenmiş karaktere referans verebilirsiniz. Mart 2026 itibarıyla karakter referansları yalnızca insanlar için değil, nesneler ve hayvanlar için de çalışıyor. Video uzatma, devam için bağlam olarak tam ilk klibi kullanır.
Karakter sistemi, karakter oluşturmak için video girdisi gerektirir (statik görseller değil). Yalnızca fotoğraflarınız varsa, önce kısa bir video üretmeniz, ardından o videodan karakteri çıkarmanız gerekir.
Kullanılabilirlik: Üretim iş akışları için Batch API desteğine sahip OpenAI API.
| Özellik | Değer |
|---|---|
| Doğal klip uzunluğu | 20 saniyeye kadar |
| Çözünürlük | 1920x1080'e kadar |
| Karakter referansları | Üretim başına 2'ye kadar (kalıcı character_id) |
| Karakter girdisi | Video klibi (1-3 sn zaman damgası aralığı), statik görseller değil |
| Ses | Senkronize |
| Uzatma | Evet (bağlam olarak tam klip) |
| API | OpenAI API + Batch API |
MiniMax Hailuo 02
Hailuo 02, piyasaya çıktığında Artificial Analysis kıyaslamasında dünya genelinde 2. sırada yer aldı ve Veo 3'ü geride bıraktı. Doğal 1080p'de, alanındaki en iyi fizik simülasyonlarından bazılarıyla 10 saniyelik klipler üretir. Model, jimnastik ve akrobasi gibi aşırı hareketleri parçalanmadan işleyebilir.
Yüz tanıma ve vücut takibi yoluyla güçlü karakter tutarlılığıyla görselden videoya üretimini destekler. Gürültü Farkında Hesaplama Yeniden Dağıtımı (Noise-aware Compute Redistribution) mimarisi, hesaplamayı sahne karmaşıklığına göre dinamik olarak tahsis eder.
MiniMax, o zamandan beri Hailuo 02'yi geride bırakarak fiziksel hareket, stilizasyon ve karakter mikro-ifadelerini iyileştiren Hailuo 2.3 ailesine (Standard, Pro, Fast, Fast Pro) geçti. 6 saniyede 1080p veya 10 saniyede 768p çıktı üretir ve MiniMax platformu ile fal.ai üzerinden kullanılabilir.
Kullanılabilirlik: Ticari API. MiniMax platformu, fal.ai ve Replicate üzerinden kullanılabilir. Video başına $0,28.
| Özellik | Değer |
|---|---|
| Doğal klip uzunluğu | 10 saniyeye kadar |
| Çözünürlük | Doğal 1080p |
| Referans görseller | Evet (I2V modu) |
| Ses | Doğal değil |
| Fizik | Sınıfının en iyisi simülasyon |
| API | MiniMax, fal.ai, Replicate |
MiniMax H3 (Hailuo 3.0)
MiniMax, Hailuo 2.x serisinin yerine 31 Temmuz 2026'da MiniMax H3'ü geçirdi ve bu, Hailuo'nun bu kılavuzdaki yerini değiştiriyor. Hailuo 02 bir ilk kare modeliyken, H3 tam modlu (omni-modal) bir modeldir: tek bir transformer, metni, görselleri, videoyu ve sesi birlikte okur ve MiniMax'in duyurusuna göre 2K'ya kadar doğal stereo sesle 4 ila 15 saniyelik bir klip döndürür. Referans modu (Ref2VA), 12 dosyayla sınırlı olmak üzere en fazla 9 referans görsel, 3 referans video klibi ve 3 ses klibi kabul eder; bu da onu Kling ve Seedance 2.0 ile aynı gerçek referans sınıfına yerleştirir ve bir ilk-ve-son-kare modu (FL2VA) klasik anahtar kare iş akışını kapsar. Artificial Analysis metinden videoya arenasında H3 ve H3 Max girdileri, Eylül 2026 itibarıyla Omni Flash ve Wan 3.0'ın hemen arkasında yer alıyor. Kendi kendine barındırma yapanlar için daha büyük haber, MiniMax'in Ağustos 2026'da 33B taban ağırlıklarını Hugging Face üzerinde, hem FL2VA hem de Ref2VA kontrol noktalarıyla yayınlamış olması. Lisans MiniMax H3 Topluluk Lisansı, ve model kartı ABD, AB, İngiltere ve Güney Kore'deki kullanıcılardan kullanmadan önce bir başvuru formu doldurmalarını istiyor; yani bu, Apache tarzı tam açıklıktan ziyade bölgesel yıldız işaretli bir açıklık.
Erişilebilirlik: MiniMax API ve platformu, fal.ai ve diğer barındırıcılar, ayrıca indirilebilir ağırlıklar.
| Özellik | Değer |
|---|---|
| Doğal klip uzunluğu | 4-15 saniye |
| Çözünürlük | 2K'ya kadar (768p varsayılan kısa kenar) |
| Referans görselleri | 9 görsele + 3 videoya + 3 sese kadar (toplam 12, Ref2VA) |
| Anahtar kareler | İlk ve/veya son kare (FL2VA) |
| Ses | Doğal stereo, 32 kHz |
| Açık ağırlıklar | Evet, 33B, MiniMax H3 Topluluk Lisansı (ABD/AB/İngiltere/KR için başvuru gerekli) |
| API | MiniMax, fal.ai |
Luma Ray3.2
Luma'nın Ray2 modelinin yerini Ray3 ailesi aldı. Ray3 (Eylül 2025) kimlik kilitlemesi için Karakter Referansı ve video-video Değiştirme modunu ekledi, Ray3.2 (9 Haziran 2026) ise klip başına 16 anahtar kareye kadar kare düzeyinde kontrol, bir Yeniden Kadrajlama özelliği ve 20 saniyeye kadar klipler ekledi; ayrıca Ray3 serisi için ilk kamuya açık API'yi getirdi. Çıktı doğal olarak 1080p, Hi-Fi yükseltme ile 4K'ya kadar mevcut. Görselden videoya, referans görsellerini başlangıç veya bitiş anahtar karesi olarak kabul ediyor.
Erişilebilirlik: Luma API ve web arayüzü.
| Özellik | Değer |
|---|---|
| Doğal klip uzunluğu | 20 saniyeye kadar (Ray3.2) |
| Referans türü | Başlangıç/bitiş anahtar kareleri + Karakter Referansı (kimlik) |
| Çözünürlük | Doğal 1080p, yükseltme ile 4K |
| Referans görselleri | Evet (anahtar kareler + karakter referansı) |
| API | Luma API |
Pika 2.5
Pika, Pikaframes ile anahtar kare tabanlı bir yaklaşım benimsiyor. 2-5 anahtar kare (önemli anlardaki referans görselleri) yükleyin, model bunlar arasında akıcı geçişler oluşturur. Toplam süre 20-25 saniyeye ulaşıyor.
Pikascenes, 10'a kadar referans görseli kabul edip bunları tek bir videoda birleştiriyor. Model, her referansın rolünü (karakter, arka plan, aksesuar) otomatik olarak belirlemek için görüntü tanıma kullanıyor.
Erişilebilirlik: Pika web platformu ve API. Ücretsizden Pro'ya kadar abonelik planları.
| Özellik | Değer |
|---|---|
| Doğal klip uzunluğu | 5-10 saniye |
| Pikaframes uzunluğu | 20-25 saniye |
| Çözünürlük | 1080p'ye kadar |
| Referans görselleri | 10'a kadar (Pikascenes), 2-5 anahtar kare (Pikaframes) |
| API | Evet |
Vidu Q3 (ShengShu)
Vidu, bu rehberin önceki sürümlerinde yer almayan bir bölümü hak ediyor, çünkü Q3 serisi mevcut en güçlü konu-referans sistemlerinden biri haline geldi. ShengShu, 2026'nın başlarında yerel ses ve 16 saniyeye kadar klip destekleyen Vidu Q3'ü yayınladı ve 13 Nisan 2026'da, lansman duyurusuna göre Q3 Referanstan Videoya özelliğini ekledi. Referans modu konuları, ortamları, kostümleri, aksesuarları ve görsel stilleri tek bir istekte birleştiriyor. Vidu API belgelerine göre reference2video uç noktası 7'ye kadar referans görseli kabul ediyor; bunları istemde @1, @2 şeklinde etiketliyorsunuz ("@1 ve @2 birlikte yemek pişiriyor"), süreler viduq3 üzerinde 3 ila 16 saniye arasında değişiyor, çözünürlük 1080p'ye kadar çıkıyor ve ses üretimi bir bayrak olarak açılabiliyor. Ayrıca tek bir klip içinde akıllı kamera geçişleri yapabiliyor, ki bu diyalog sahneleri için alışılmadık ve kullanışlı bir özellik. ShengShu, Q3'ün SuperCLUE'nun ilk Referanstan Videoya lider tablosunda zirveye çıktığını söylüyor; Vidu, bu rehberi ilk yazdığımızda da VBench 2.0'da Veo'yu zorlayan model olmuştu.
Erişilebilirlik: Vidu web uygulaması ve API (viduq3, viduq3-turbo), ayrıca Alibaba Cloud Model Studio ve üçüncü taraf barındırıcılar.
| Özellik | Değer |
|---|---|
| Doğal klip uzunluğu | 3-16 saniye |
| Çözünürlük | 1080p'ye kadar |
| Referans görselleri | 7'ye kadar (@1, @2 etiketleri) |
| Referans türleri | Konular, ortamlar, aksesuarlar, kostümler, stiller |
| Ses | Doğal (ses efektleri, diyalog, müzik) |
| API | Vidu API, Alibaba Cloud Model Studio |
3. Kademe: Kendi Kendine Barındırılan İş Akışları için Açık Kaynak Modeller
Bu modeller daha kısa klipler üretir ama tamamen açık. Bunları kendi donanımınızda çalıştırabilir, ince ayar yapabilir ve API bağımlılığı olmadan özel uzatma iş akışları oluşturabilirsiniz.
Wan 2.1 (Alibaba)
Wan 2.1, diğer birçok modelin (Helios dahil) üzerine inşa edildiği temel model. Wan-VAE mimarisi, zamansal bilgiyi korurken herhangi bir uzunlukta 1080p videoyu kodluyor ve çözüyor. Model, 480p ve 720p'de I2V varyantlarıyla birlikte, iki referans görsel arasında video üreten bir Baştan-Sona-Kareden-Videoya modeliyle geliyor.
Wan-Edit, belirli yapıları veya karakter pozlarını korurken referans görselleri kullanarak stil ve içerik aktarımı yapılmasına olanak tanıyor. Wan 2.2 (Temmuz 2025), tek bir RTX 4090'da çalışan 5B varyantına sahip, Apache 2.0 altında kalan Uzman Karışımı (Mixture-of-Experts) modeliyle daha yeni açık yayın. Kendi kendine barındıranlar için önemli bir uyarı: Wan, 2.5 sürümünde kapalı hale geldi. Daha yeni Wan 2.5, 2.6, 2.7 ve şimdi Wan 3.0 senkronize ses ve daha yüksek çözünürlük ekledi ama kamuya açık ağırlıkları olmayan yalnızca API üzerinden erişilen modeller, dolayısıyla 2.2 hâlâ açık tavan olarak duruyor. Wan 3.0, Ağustos 2026'da Alibaba Cloud Model Studio'da yayına girdi ve model sayfasına göre metin, görsel, video ve ses referanslarından 480p, 720p veya 1080p'de tek çekimde 30 saniyeye kadar üretim yapabiliyor; ayrıca Eylül 2026 itibarıyla Artificial Analysis metinden videoya arenasında Gemini Omni Flash ile birlikte zirveyi paylaşıyor. Bu barındırılan bir ürün, indirilebilir bir şey değil. Wan 2.7 veya 3.0 ağırlıklarının indirilebilir olduğunu iddia eden SEO sayfalarını yok sayın. Resmi GitHub kuruluşu ve Hugging Face hesabı 2.2'de kalıyor (en yeni yüklemeler Wan2.2-Animate güncellemeleri).
| Özellik | Değer |
|---|---|
| Parametreler | 1.3B, 5B, 14B (2.1); 5B + 14B MoE (2.2) |
| I2V modları | I2V-480P, I2V-720P, FLF2V-720P |
| Açık tavan | Wan 2.2 (2.5 ile 3.0 arası yalnızca API) |
| Lisans | Apache 2.0 |
| Donanım | 8GB+ VRAM (daha küçük varyantlar) |
| Platformlar | Diffusers, ComfyUI |
HunyuanVideo (Tencent)
Tencent'in 13B parametreli modeli, 2025'in büyük bölümünde açık kaynak video üretiminde lider konumdaydı. HunyuanVideo-I2V, referans görsel bilgisini dahil etmek için önceden eğitilmiş bir MLLM ile token değiştirme tekniği kullanıyor. Kasım 2025'te yayınlanan HunyuanVideo-1.5, verimliliği artırdı. HunyuanCustom, çoklu modaliteyle özelleştirilmiş video üretimine olanak tanıyor.
| Özellik | Değer |
|---|---|
| Parametreler | 13B |
| I2V | Evet (token değiştirme tekniği) |
| Lisans | Açık kaynak |
| Donanım | 60GB+ VRAM (720p) |
| Varyantlar | Temel, I2V, 1.5, Avatar, Custom |
LTX-2 (Lightricks)
Lightricks, LTX-2'yi Ocak 2026'da tam ağırlıklar, çıkarım kodu ve eğitim koduyla açık kaynak olarak yayınladı. Bu, videoyu ve senkronize sesi tek geçişte birlikte üreten DiT tabanlı bir model; doğal 4K'da ve 50 fps'ye kadar, 20 saniyeye kadar kliplerle. Görselden videoya ve çoklu anahtar kare koşullandırması yerleşik olarak geliyor, böylece Pikaframes'te olduğu gibi klip boyunca belirli noktalara referans sabit kareler sabitleyebilirsiniz.
Lisans, boyutunuza bağlı olarak ya bir sorun ya da değil. LTX-2, araştırma için ve yıllık 10 milyon $'ın altındaki gelirlerde ticari kullanım için ücretsiz. Bunun üzerinde ticari lisans gerekiyor, dolayısıyla katı anlamda açık kaynaktan çok açık ağırlık sayılır. LTX-2.3, daha iyi ses ve istem uyumu sunan 22B parametreli bir güncellemeydi; Eylül 2026 itibarıyla güncel kontrol noktası olan LTX-2.5 ise 22B boyutu koruyup birkaç bağlantılı çekim boyunca tek bir karakter ve görünümü tutan doğal çok-çekimli üretimi, düz VAE yeniden yapılandırması yerine bir difüzyon video kod çözücüsünü ve uzun istemler için bir Gemma 4 12B metin kodlayıcısını ekliyor; hâlâ aynı 10 milyon $ gelir sınırına sahip LTX-2.x Topluluk Lisansı altında. Ağırlıklar Hugging Face'te damıtılmış varyantlarla, LoRA adaptörleriyle ve ComfyUI ile Diffusers entegrasyonlarıyla birlikte bulunuyor; barındırılan API'ler ise LTX platformu, fal.ai ve Replicate üzerinde çalışıyor.
| Özellik | Değer |
|---|---|
| Parametreler | 22B (LTX-2.3 ve LTX-2.5) |
| Maks. klip | ~20 saniye |
| Çözünürlük | 50 fps'ye kadar doğal 4K |
| Ses | Doğal senkronize |
| I2V | Evet (görsel + çoklu anahtar kare koşullandırma) |
| Lisans | LTX-2 Topluluk Lisansı (10M ARR altında ücretsiz) |
| Donanım | Tüketici GPU'ları için damıtılmış ve FP8 varyantlar |
CogVideoX (Tsinghua/Zhipu AI)
CogVideoX, dizi uzunluğunu azaltan ve titremeyi önleyen 3B nedensel bir VAE kullanıyor. Uyarlanabilir LayerNorm dönüştürücüsü, metin-video hizalamasını iyileştiriyor. 2B (Apache 2.0) ve 5B (araştırma lisansı) varyantlarında, yerleşik Diffusers entegrasyonuyla mevcut.
Klipler 720x480'de 6-10 saniye. Kısa, ama kalite/hesaplama oranı iyi ve 12GB'lık bir GPU'da çalışıyor.
| Özellik | Değer |
|---|---|
| Parametreler | 2B, 5B |
| I2V | Evet (CogVideoXImageToVideoPipeline) |
| Çözünürlük | 8 fps'de 720x480 |
| Lisans | Apache 2.0 (2B), Araştırma (5B) |
| Donanım | 12GB VRAM |
İlk Kare mi, Gerçek Referans mı: Temel Ayrım
Her "referans görsel" desteği aynı değildir. Doğru modeli seçmek için bu farkı anlamak çok önemli.
İlk kare modelleri (LongCat, Helios, Hailuo, Luma Ray2, HunyuanVideo) görselinizi harfiyen açılış karesi olarak ele alır. Model, o kesin görselden ileriye doğru canlandırma yapar. Bir karakter portresi yükleyip onu farklı bir sahnede tarif edemezsiniz. Görsel, sahnenin kendisidir.
Gerçek referans modelleri (Kling, Grok Imagine, Seedance, Vidu Q3, MiniMax H3, SkyReels V3) görselinizden kimliği çıkarır ve o karakteri/nesneyi tarif ettiğiniz herhangi bir sahneye yerleştirir. Bir kişinin fotoğrafını yükleyin, sonra "o kişi gün batımında bir ormanda yürüyor" diye istem verin. Karakter, kimliğini korurken tamamen yeni bir ortamda görünür. Macera filmi gibi çok sahneli anlatı içerikleri için ihtiyacınız olan budur.
Karakter Kimliği modelleri (Sora 2 Pro) kimliği statik görseller yerine video kliplerinden çıkarır. Kalıcı bir karakter kimliğini bir kez oluşturur ve sınırsız gelecek üretimde yeniden kullanırsınız.
Stil/malzeme modelleri (Veo 3.1) referans görselleri belirli karakter kimliklerini çıkarmak yerine görsel stili, dokuları ve genel görünümü etkilemek için kullanır. Bir proje boyunca görsel tutarlılığı korumak için iyi, tekil karakter kontrolü için daha az kesin.
10 Dakikalık Videolar için Gerçek İş Akışı
2026 ortasında işlerin nerede durduğuna dair dürüst bir değerlendirme: hiçbir model tek seferde güvenilir bir şekilde 10 dakikalık tutarlı, yüksek kaliteli video üretmiyor. LongCat Video, 15 dakika iddiasıyla en yakın noktaya ulaşıyor, ama bu uzunluklarda kalite ve tutarlılık önemli ölçüde değişkenlik gösteriyor. Helios ve SkyReels V2 sırasıyla "dakika ölçeğinde" ve "sonsuz uzunlukta" video üretiyor, ama çıktılar dikkatli istemlendirme ve genellikle birden fazla deneme gerektiriyor.
5-15 dakikalık video üreten çoğu içerik üreticisi için gerçekten işe yarayan iş akışı, birden fazla yaklaşımı birleştiriyor:
Konuşan kafa / avatar içerik için: LongCat Video'nun 2026 sesle yönlendirilen modu veya SkyReels V3'ün avatar üretimi, tutarlı bir konuşan karakterin 5+ dakikalık videosunu üretebilir. Bu, "bir düğmeye bas, uzun video al" fikrine en yakın şey.
Çok sahneli anlatı içeriği için (macera filmi tarzı): Gerçek karakter referans görselleriyle Kling 3.0, Grok Imagine veya Seedance 2.0 kullanın. Her biri 10-15 saniyelik tekil çekimler üretin. Karakter kimliğini korumak için her üretimde aynı @Element veya <IMAGE> referanslarını kullanın. Çekimleri çoklu-çekim modu (Kling çağrı başına 6 çekimi destekler) veya uzatma API'siyle birbirine bağlayın. Kling, bu iş akışı için en çok sınanmış model. Grok Imagine'in "referans modu" ile "ilk kare modu" arasındaki net ayrımı, onu güçlü bir alternatif yapıyor. Seedance 2.5 artık en fazla referans girdisini (50 dosya) kabul ediyor ve 30 saniyelik çekimler üretiyor, ki bu ekleme sayısını kabaca yarıya indiriyor; Vidu Q3 (@ etiketleriyle 7 referans) ve MiniMax H3 (12 dosya) ise güvenilir yeni seçenekler.
Birçok klip boyunca karakter tutarlılığı için: Sora 2 Pro'nun kalıcı character_id sistemi, çok uzun projeler için en temiz yaklaşım. Karakteri kısa bir videodan bir kez çıkarın, sonra o kimliğe referans veren düzinelerce klip üretin. Karakter kimliği, her seferinde bir görselden yeniden yorumlanmak yerine kalıcı bir gömme (embedding) olarak saklandığı için zamanla bozulmaz.
Stil aktarımlı içerik için: fal.ai üzerindeki Lucy Restyle, 30 dakikaya kadar mevcut videoyu hareketi korurken yapay zeka stil dönüşümleri uygulayarak işler. Kaynak görüntünüz varsa bu, üretim uzunluğu sorununu tamamen atlar. Kaynak videonun saniyesi başına 0,01 $.
Açık kaynak boru hatları için: Wan 2.2 veya Helios üzerine bir video devam etme döngüsü kurun, ya da topluluk lisansı bölgeniz için uygunsa MiniMax H3'ün Ref2VA kontrol noktası üzerine kurun; çünkü bu, 9 görsellik referans moduna sahip ilk açık model. Bir klip üretin, sonraki klip için son kareyi başlangıç karesi olarak kullanın, tekrarlayın. ComfyUI iş akışları bunu otomatikleştiriyor. Tutarlılık birçok yinelemede bozulur ama bu ücretsiz ve kontrol edilebilir.
Temel zorluk hâlâ geçerli: gerçek referans görsel desteği olsa bile, karakter kayması düzinelerce klip boyunca birikir. Yüz özellikleri, saç, kıyafet ve ten rengi yavaşça değişir. Çözümler (yüksek kaliteli referans fotoğrafları, tutarlı istemlendirme, çekim toplu işleme) gereklidir. Ama Kling ve Grok Imagine gibi karakter kimliğini sahne kompozisyonundan ayıran modeller bunu, yalnızca ilk kare kullanan modellere kıyasla çarpıcı biçimde kolaylaştırıyor.
3D İskele Yaklaşımı: Düşük Çöz, Yüksek Dönüştür
Çoğu uzun biçimli üretim sorununu tamamen atlayan, giderek ivme kazanan bir iş akışı var. Bir yapay zeka modelinden sıfırdan 10 dakikalık video üretmesini istemek yerine, doğru kamera çalışması, karakter blokajı ve zamanlamayla düşük doğruluklu bir 3D ara sahne render edip bunu referans görselleri ve bir geliştirme istemiyle görselden videoya modelinden geçiriyorsunuz. 3D motoru yapıyı hallediyor. Yapay zeka ise estetiği. Bu yöntem işe yarar, çünkü V2V dönüşümü tam üretime kıyasla çok daha dar kapsamlı bir problemdir. Model, kamera hareketini, karakter yerleşimini veya sahne kompozisyonunu icat etmek zorunda değildir. Sadece mevcut görüntüleri, görsel referanslarınızı takip ederek fotogerçekçi hale getirmesi gerekir. Bu çok daha yönetilebilir bir işlemdir ve 3D motorunuzun render edebildiği her uzunluğa ölçeklenir.
Bu Neden İşe Yarıyor?
3D motorunuz, yapay zeka video modellerinin hâlâ zorlandığı her şeyi size verir: kesin kamera kontrolü, kare üzerinde tam karakter yerleşimi, doğru fizik etkileşimleri ve dakikalar süren görüntü boyunca tutarlı zamanlama. Dolly zoom'lar, takip çekimleri, karakterlerin belirli anlarda kareye girip çıkması; bunların hepsi bir 3D motorda önemsizken, metin tabanlı üretimde güvenilmezdir. V2V modelinin tek işi, önceden tanımladığınız geometriyi ve hareketi koruyarak materyalleri, aydınlatmayı ve dokuları fotogerçekçi çıktıya dönüştürmektir.
Karakter tutarlılığı da kolaylaşır. 50 ayrı yapay zeka üretimi boyunca kimlik kaymasıyla mücadele etmek yerine, modele her karede aynı 3D karakteri gösteriyorsunuz. Referans görseller, modele nihai çıktıda o karakterin nasıl görünmesi gerektiğini söyler. Bu, her seferinde sıfırdan tutarlı bir karakter üretmekten çok daha basit bir problemdir.
Ve uzunluk artık bir kısıtlama değil. Lucy Restyle tek bir çağrıda 30 dakikayı işleyebilir. ComfyUI'daki Wan 2.1, herhangi bir uzunluğu parçalar halinde işleyebilir. Görüntüler zaten var olduğu için "10 dakikayı nasıl üretirim" problemiyle hiç uğraşmıyorsunuz.
RealMaster (Meta / Tel Aviv Üniversitesi)
RealMaster, özellikle bu iş akışı için oluşturulmuş bir araştırma sistemidir. Mart 2026'da Meta Reality Labs ve Tel Aviv Üniversitesi tarafından yayımlanan bu sistem, render edilmiş 3D görüntüyü, kaynakla tam geometrik hizalamayı koruyarak fotogerçekçi görüntüye dönüştürür.
Yöntem, yapıyı ve hareketi korumak için 3D render'dan kenar haritaları (edge map) çıkarır, ardından her şeyin geri kalanını fotogerçekçi çıktıya dönüştürmek için bir video difüzyon modeli (VACE/Wan mimarisi üzerine kurulu) uygular. Hafif bir IC-LoRA adaptörü, işlem hattını, çapa kareye ihtiyaç duymayan ve dizinin ortasında beliren nesneleri işleyebilen tek bir çıkarım geçişine damıtır.
GTA-V ve CARLA simülatör dizilerinde test edilen RealMaster, genel amaçlı video düzenleme temel çizgilerini önemli ölçüde geride bırakır. Ayrıca gerçekçilik dönüşümünün üzerine metin istemi aracılığıyla ("Yağmur yağdır", "Kar yağdır") hava efektleri katmanlayabilir. Model, yeniden eğitim gerektirmeden simülatörler arasında genelleme yapar. GTA-V verisiyle eğitilen ağırlıklar, ek ayar yapılmadan CARLA çıktısında da çalışır.
Erişilebilirlik: Yalnızca araştırma. Henüz herkese açık ağırlık veya API yok.
| Özellik | Değer |
|---|---|
| Girdi | Render edilmiş 3D video (herhangi bir motor) |
| Çıktı | Geometriyi ve hareketi koruyan fotogerçekçi video |
| Mimari | VACE/Wan video difüzyon omurgası üzerinde IC-LoRA |
| Koşullandırma | Kaynak render'dan kenar haritaları |
| Test edildiği ortamlar | GTA-V, CARLA simülatörü |
| Lisans | Yayımlanmadı (yalnızca araştırma makalesi) |
Bugün Kullanılabilir Üretim V2V Araçları
Element Referanslı Kling 3.0 V2V, en eksiksiz üretim seçeneğidir. fal.ai üzerindeki Edit Video ve Reference V2V uç noktaları, 3-10 saniyelik kaynak video kliplerini, element referanslarıyla (@Element1, @Element2; cepheden ve çok açılı fotoğraflarla) ve bir iyileştirme istemiyle birlikte kabul eder. Model, kaynaktaki hareket yörüngelerini ve kamera desenlerini analiz eder, ardından belirttiğiniz karakter görünümleri ve görsel stille görüntüyü, özgün sahneleme ve kamera çalışmasını koruyarak yeniden üretir. En fazla 7 referans girdisi. 1080p çıktı. Karakter tutarlılığını korumak için sahnenizi 10-15 saniyelik parçalar halinde, tüm parçalarda aynı element referanslarını kullanarak işleyin.
Lucy Restyle 2, saniye başına $0.01 ile tek bir API çağrısında 30 dakikaya kadar kaynak videoyu işleyebilir. Bir metin istemi ve stil rehberliği için isteğe bağlı bir referans görsel kabul eder. Kling'deki gibi karakter başına element referansı yoktur, ancak tam boy bir 3D render'ın genel sinematik stil aktarımı için en basit ve en ucuz yoldur. Tam render'ınızı ve hedef görünümü tanımlayan bir istem verin. Binlerce kare boyunca zamansal tutarlılıkla 720p çıktı.
ComfyUI'da Wan 2.1 VACE, açık kaynak rotasıdır. 14B VACE modeli referans tabanlı V2V yapar: bir kaynak video ile bir stil referans görseli girin, yapıyı ve hareketi koruyan yeniden stillendirilmiş bir sürüm çıktı alın. Kenar haritası koşullandırması yapısal doğruluğu artırır. Tutarlı stil referanslarıyla herhangi bir uzunluğu parçalar halinde işleyen bir işleme döngüsü kurabilirsiniz. Ücretsizdir, kendi donanımınızda yerel olarak çalışır.
Grok Imagine V2V, referans modunda kaynak video ile birlikte 1-7 referans görseli kabul eder. 720p'de saniye başına $0.05. Referans modu ile ilk kare modu arasındaki açık ayrım, referanslarınızın kaynak videonun yapısını geçersiz kılmadan karakter görünümüne rehberlik etmesini sağlar.
3D Render'ınızın İhtiyaçları
Render kalite tabanı önemlidir. Çıplak bir tel kafes (wireframe), V2V modeline yeterli malzeme sağlamaz. Ancak üretim kalitesinde materyallere veya aydınlatmaya da ihtiyacınız yok.
Doğru orantılar ve geometri. Referans görsellerin doğru şekilde eşleşebilmesi için karakter modellerinin kabaca doğru vücut oranlarına ve yüz yapısına ihtiyacı vardır. Doğru oranlara sahip temel bir insansı geometri yeterlidir. Çubuk adam bir figür, tanınabilir bir karakter üretmez.
Temel aydınlatma yönü. Sahnenin genel aydınlatmasını belirleyen tek bir yönlü ışık, modelin amaçlanan atmosferi anlamasına yardımcı olur. Yapay zeka detayları geliştirecek ve ekleyecektir, ancak sahnenin parlak gündüz mü yoksa karanlık bir iç mekan mı olduğunu bilmesi gerekir.
Akıcı kamera hareketi. Sabit, kararlı kamera hareketleri iyi çevrilir. Düzensiz veya aşırı hızlı hareket V2V modellerini şaşırtabilir. Sanal kameranızın gerçek bir kamera gibi davranmasını sağlayın.
Tel kafes yerine düz gölgeleme. Basit düz gölgeli veya düşük poligonlu geometri, tel kafeslere veya dokusuz modellere göre daha iyi sonuçlar verir. Yüzeylerdeki temel düz renkler bile modelin materyal sınırlarını anlamasına yardımcı olur.
Maliyet ve Ölçek
10 dakikalık bir sahneyi farklı araçlarla işlemek:
| Araç | Maksimum Girdi Uzunluğu | 10 dk için Maliyet | Çözünürlük | Referans Görseller |
|---|---|---|---|---|
| Kling O3 V2V | 10 sn'lik klipler | ~$50-67 | 1080p | 7'ye kadar (element + stil) |
| Lucy Restyle 2 | 30 dakika | $6 | 720p | 1 (yalnızca stil) |
| Grok Imagine V2V | 10 sn'lik klipler | ~$30 | 720p | 1-7 |
| Wan 2.1 VACE | Herhangi bir uzunluk (parçalı) | Ücretsiz (yerel GPU) | 720p | Parça başına 1 |
Bu rakamlar, karşılaştırmayı ilk kez 2026 ortasında yaptığımız sıradaki satıcı liste fiyatlarına dayanan tahminlerimizdir ve satıcılar sıklıkla fiyat değiştirir; bu yüzden bunları kesin bir teklif değil, göreceli bir sıralama olarak değerlendirin. Tam boy işleme için en ucuz seçenek Lucy Restyle'dır. Element referanslarıyla karaktere özel iyileştirme için en hassas seçenek Kling'dir. Donanımınız varsa Wan 2.1 ücretsizdir (720p'de 14B model için yaklaşık 60GB VRAM, veya daha düşük kalitede 1.3B varyantı için 8GB gerekir).
Karşılaştırma Tablosu
| Model | Maksimum Doğal Süre | Genişletilmiş Süre | Referans Türü | Maks. Referans | Çözünürlük | API Mevcut mu | Açık Kaynak |
|---|---|---|---|---|---|---|---|
| LongCat Video | ~15 dk | Yok | Yalnızca ilk kare | 1 | 720p/30fps | Evet (fal.ai) | Evet (MIT) |
| Seaweed APT2 | ~5 dk | Yok | I2V + poz | 1 | 720p | Hayır | Hayır |
| Helios | Dakika ölçeğinde | Yok | İlk kare (I2V) | 1 | 720p | HF Spaces | Evet (Apache 2.0) |
| SkyReels V3 | Sınırsız | Yok | Gerçek referans | 1-4 | 720p | Hayır | Evet |
| Kling 3.0 | 15sn | ~3 dk | Element + stil referansları | 7 | 1080p | Evet | Hayır |
| Grok Imagine | 15sn | Zincirlenebilir | Gerçek referans | 7 | 720p | Evet | Hayır |
| Seedance 2.0 | 15sn | Yok | Çok modlu referanslar | 12 | 2K | Evet | Hayır |
| Seedance 2.5 | 30sn | Çok turlu genişletme | Çok modlu referanslar | 50 | 2K | Evet (BytePlus, Runway) | Hayır |
| Vidu Q3 | 16sn | Yok | Gerçek referans | 7 | 1080p | Evet | Hayır |
| MiniMax H3 | 15sn | Yok | Çok modlu referanslar | 12 | 2K | Evet | Evet (topluluk lisansı) |
| Runway Gen-4.5 | 10sn | ~1 dk | I2V (0-1) | 1 | 1080p | Evet | Hayır |
| Veo 3.1 | 8sn | ~2.5 dk | Ingredients (stil) | 3 | 4K | Evet | Hayır |
| Gemini Omni Flash | 10sn | Sohbet tabanlı düzenlemeler + genişletme (1.1) | Çok modlu referanslar | Görsel + video | 720p | Evet (GA) | Hayır |
| Sora 2 Pro ⚠️ kullanımdan kaldırılıyor | 20sn | Zincirlenebilir | Karakter Kimliği (video) | 2 | 1080p | API Eylül 2026'da kapatılıyor | Hayır |
| Hailuo 02 | 10sn | Yok | I2V (ilk kare) | 1 | 1080p | Evet | Hayır |
| Luma Ray3.2 | 20sn | Yok | Anahtar kareler + karakter referansı | 16 anahtar kare | 1080p (4K yükseltme) | Evet | Hayır |
| Pika 2.5 | 10sn | 25sn | Pikascenes | 10 | 1080p | Evet | Hayır |
| Wan 2.1 / 2.2 | Kısa klipler | Devam ile | I2V / FLF2V | 1-2 | 720p | fal.ai üzerinden | Evet (Apache 2.0) |
| Wan 3.0 | 30sn | Yok | Çok modlu referanslar | Görsel, video, ses | 1080p | Evet (Alibaba Cloud) | Hayır |
| HunyuanVideo | Kısa klipler | Devam ile | I2V (ilk kare) | 1 | 720p | fal.ai üzerinden | Evet |
| LTX-2.3 | 20sn | Devam ile | I2V + anahtar kareler | Çoklu anahtar kare | 4K | Evet (LTX, fal.ai) | Ağırlıklar (ARR sınırlı) |
| CogVideoX | 6-10sn | Devam ile | I2V (ilk kare) | 1 | 720x480 | fal.ai üzerinden | Evet |
Önümüzdeki Gelişmeler
2026 boyunca izlenen gidişat açık. LongCat Video, açık bir modelde dakika ölçeğinde tutarlı üretimin mümkün olduğunu kanıtladı. Helios bunun gerçek zamanlı olabileceğini gösterdi. Seaweed APT2, etkileşimli uzun form üretimi ortaya koydu. Ve gerçek referans modelleri (Kling, Grok, Seedance), karakter kimliğinin keyfi sahneler boyunca kalıcı olabildiğini kanıtladı.
Bir sonraki adım, bu yetenekleri birleştirmek: gerçek karakter referansı desteğine sahip doğal uzun form üretim. Şu anda ikisinden birini seçiyorsunuz. Bir model, referans görsellerden karakterleri onlarca sahne değişikliği boyunca korurken 5 dakikalık video üretebildiğinde, zincirlenmiş klip iş akışı geçerliliğini yitirecek. Seedance 2.5 (doğal 30 saniyelik klipler, 50'ye kadar referans dosya, 31 Temmuz 2026'da yayımlandı) ve Wan 3.0 (çok modlu referanslardan 30 saniyelik tek çekimler, Ağustos 2026), bu yöndeki ilk gerçek adımlardır.
Eylül 2026 başı itibarıyla, Artificial Analysis metinden videoya arenası (sesle birlikte), Google'ın Gemini Omni Flash ve Alibaba'nın yalnızca API üzerinden erişilebilen Wan 3.0 modelini zirvede eşit puanla gösteriyor (~1.239 Elo); MiniMax H3 Max ve H3 birkaç puan geride, ardından Seedance 2.0, Wan 2.7, HappyHorse modelleri, Sand.ai'nin MAGI-2 önizlemesi ve Kling 3.0 Pro ilk on'u tamamlıyor. Liderlik tablosu sık sık değişiyor, bu yüzden herhangi bir tekil sıralamayı sabit bir düzen değil, anlık bir görüntü olarak değerlendirin.
3D iskele yaklaşımı paralel bir gidişat sunuyor. V2V modelleri yapısal korumada ve fotogerçekçilikte geliştikçe, düşük sadakatli 3D render'ları tam üretim için iyileştirmek giderek daha uygulanabilir hale geliyor. Meta'nın RealMaster'ı, oyun motoru çıktısında zaten araştırma kalitesinde sim-gerçek dönüşümü başarıyor. Bu yetenek, referans görsel desteğiyle üretim API'lerine ulaştığında, temel 3D becerilerine sahip herkes, kamera, sahneleme ve karakter yerleşimi üzerinde tam kontrolle, herhangi bir sürede fotogerçekçi uzun form video üretebilecek.
Şimdilik pratik cevap, kullanım durumunuza bağlı:
Çoklu karakter referansı için en iyi: Kling 3.0 (ayrı element + stil sistemiyle 7'ye kadar referans), Seedance 2.5 (30 saniyelik tek çekimde 50'ye kadar çok modlu girdi) veya Vidu Q3 (klip içi kamera geçişli 7 etiketli referans).
Referanstan videoya en iyi API: Grok Imagine (temiz API, açık referans modu, orijinal model için saniye başına $0.05), Vidu Q3 (@ etiketleri, 7 referans) veya fal.ai üzerinden Kling.
Birçok klip boyunca kalıcı karakterler için en iyi: Kling 3.0'ın element referansları veya SkyReels V3'ün referans-ve-genişletme özelliği. (Sora 2 Pro'nun karakter kimliği sistemi en temiz yaklaşımdı, ancak 2026'da kullanımdan kaldırılıyor, bu yüzden üzerine yeni çalışma başlatmayın.)
En iyi açık kaynak: SkyReels V3 (1-4 gerçek referans görsel, sınırsız uzunluk), MiniMax H3 (görsel, video ve sesle birlikte 9 referans görsel, bölgesel başvuru gerektiren topluluk lisansı) veya Helios (gerçek zamanlı, Apache 2.0).
Ham süre için en iyi: LongCat Video (~15 dk, ancak yalnızca ilk kare).
3D render iyileştirmesi için en iyi: Kling 3.0 V2V (karakter başına element referansları, 1080p) veya Lucy Restyle 2 (30 dk girdi, saniye başına $0.01).
Sık Sorulan Sorular
Uzun videolar için en iyi yapay zeka video modeli hangisidir?
Ham süre için LongCat Video, doğal olarak yaklaşık 15 dakika üretir, ancak yalnızca ilk kare desteği vardır. Tutarlı karakterlere sahip uzun video için 2026'daki pratik cevap, referans-ve-genişletme iş akışıdır: güçlü referans desteğine sahip bir modelle (Kling 3.0, Runway Gen-4.5 veya açık kaynaklı SkyReels V3) klipler üretin, ardından bunları zincirleyin. Hem uzun süre çalışan hem de karakter kimliğini mükemmel şekilde koruyan tek bir model yok, bu yüzden çoğu üretim çalışması ikisini birleştirir.
Hangi yapay zeka video modelleri referans görselleri destekliyor?
Kling 3.0 Omni, Runway Gen-4.5, Seedance 2.0 ve 2.5, Vidu Q3, MiniMax H3, Google Veo 3.1 ve Gemini Omni Flash, ticari seçenekler arasında referans görselleri destekler. Açık kaynak tarafında, SkyReels V2/V3, Wan 2.1 ve 2.2, LTX-2.5 ve açık MiniMax H3 ağırlıkları, kendiniz çalıştırabileceğiniz referans girdilerini kabul eder. Destek kalitesi çok değişkenlik gösterir, bu yüzden yukarıdaki rehber onları katmanlara ayırıyor.
Yapay zeka, uzun bir video boyunca tutarlı bir karakter üretebilir mi?
Evet, ama tek seferde değil. Güvenilir yaklaşım, bir veya birden fazla referans görselle bir karakteri sabitlemek, kısa klipler üretmek ve aynı referansları geri besleyerek onları genişletmek veya birleştirmektir. Gerçek referans desteği (modelin yeni üretimler boyunca kimliği koruması), yalnızca açılış karesini tohumlayan ilk kare koşullandırmasından çok daha önemlidir.
İlk kare desteği ile gerçek referans görsel desteği arasındaki fark nedir?
İlk kare koşullandırması (first-frame conditioning), görselinizi klibin gerçek açılış karesi olarak kullanır, ardından video ilerledikçe bu görselden uzaklaşır. Gerçek referans desteği ise görseli, modelin üretim boyunca sadık kaldığı bir kimlik çıpası olarak ele alır, böylece bir karakter veya stil hem tüm klip boyunca hem de ayrı klipler arasında tutarlı kalır. Yukarıdaki bölümde hangi modellerin neyi yaptığı detaylandırılıyor.
Kling AI görselden videoya özelliği birden fazla referans görseliyle nasıl çalışır?
Kling'in çoklu görsel referansı, düz görselden videoya modundan ayrı bir moddur. Tek bir resmi ilk kare olarak canlandırmak yerine, en fazla 7 görsel ve öğe yüklersiniz (bir referans video da eklerseniz 4 tane), bunları promptta @Image1 veya @Element1 şeklinde etiketlersiniz ve çekimi tarif edersiniz. Öğeler (elements), en fazla 4 açılı fotoğraftan veya kısa bir video klipten oluşturulan, isteğe bağlı olarak bağlı bir sese sahip, kilitli karakterler veya nesnelerdir ve Kling'in çoklu çekim hikaye tahtası boyunca kalıcıdır. Tam kurallar, doğrudan Kuaishou'nun kendi rehberinden alınarak yukarıdaki Kling bölümünde yer alıyor.
Peki ya Wan 2.2? Wan 2.5 veya Wan 3.0 açık kaynak mı?
Wan 2.2 (Temmuz 2025), indirebileceğiniz en yeni Wan'dır; tek bir RTX 4090'da çalışan 5B varyantı ve 14B metinden videoya ile görselden videoya modelleri içeren, Apache 2.0 lisanslı bir Mixture-of-Experts sürümüdür. Wan 2.5, 2.6, 2.7 ve Wan 3.0 (Ağustos 2026, 1080p'ye kadar 30 saniyelik tek çekimler), ortak blogların iddialarına rağmen kamuya açık ağırlıkları olmadan yalnızca Alibaba Cloud üzerinden API olarak sunulur. Açık ağırlıklarda referans görsel iş akışı istiyorsanız, Wan 2.2'nin görselden videoya ve ilk-son-kare modellerini kullanın veya SkyReels V3 ve MiniMax H3'e bakın.
Görselden videoya ile referanstan videoya arasındaki fark nedir?
Görselden videoya, verdiğiniz resmi canlandırır; yani görseliniz açılış karesi olur ve model oradan devam eder. Referanstan videoya ise görsellerinizi kimlik ve stil çıpası olarak kullanır ve promptunuzdan yeni bir çekim üretir; böylece stüdyoda fotoğraflanmış bir karakter bir ormanda yürürken görünebilir. Görselden videoya, tamamlanmış bir durağan görseli canlandırmak için doğrudur. Referanstan videoya, tutarlı bir karaktere sahip çok sahneli hikayeler için doğrudur. Kling, Vidu Q3, Seedance, Grok Imagine ve MiniMax H3 her iki modu da sunar; Vidu ve Grok bunları API'lerinde açıkça etiketler.
Hangi yapay zeka video modelleri klipler arasında aynı öznenin tutarlılığını korur (özne referansı)?
Eylül 2026 itibarıyla, çok sayıda klip boyunca özne veya karakter referansı için en güçlü seçenekler: Kling 3.0 Omni (çok açılı fotoğraflar ve ses içeren öğe kütüphanesi), Seedance 2.5 (50'ye kadar referans ve 30 saniyelik çekimler), Vidu Q3 (7 etiketli özne) ve MiniMax H3 (video ve ses ile birlikte 9 referans görseli). Luma Ray3, bir Karakter Referansı (Character Reference) özelliği ekliyor ve Sora 2 Pro'nun karakter kimlikleri en temiz sistemdi, ancak Sora'nın API'si 24 Eylül 2026'da kapanıyor. Açık ağırlıklarda, gerçek özne referansına sahip olanlar SkyReels V3 ve MiniMax H3'tür.
İlgili
- Öncü Açık Kaynak Üretken Yapay Zeka Modelleri: video, görsel, 3D, ses ve daha fazlası için açık kaynak üretken yapay zekaya pratik rehber
- Oyunlar için Yapay Zeka Varlık Üreticileri: bir promptan sanat, model ve ses
- Oyunlar için En İyi Yapay Zeka Müzik Üreticileri: oyununuzu üretilen müzikle skorlamak
- Video Üretici: Kling 3.0 Pro destekli video üretim aracımız
Render kuyruğunu atlayın, canlı olarak içinden geçin.