Skip to content

Oyunlar için En İyi Açık Kaynak Üretken Yapay Zekâ Modelleri (2026)

Son güncelleme: Temmuz 2026.

Üretken yapay zekâyla ilgili durum şu: En iyi modeller yıllarca API anahtarlarının ve öngörülemeyen fiyatlandırmaların ardında kaldı. İş akışınızı bir aracın etrafında kurar, ona alışır, ardından bir sabah fiyatlandırmanın değiştiğini bildiren bir e-postayla uyanırdınız. Daha da kötüsü, şirket tamamen başka bir alana yönelirdi.

Bu durum 2024'ün sonlarında değişti. Tencent, Alibaba ve DeepSeek gerçekten indirebileceğiniz modeller yayımlamaya başladı. Kapalı alternatiflerle rekabet eden modeller. Böylece içerik üreticileri bir başkasının iş modeline bağlı olmayan seçeneklere kavuştu.

Video, 3D varlıklar, müzik ve sesleri tamamen kontrolünüzdeki modellerle üretebilseydiniz nasıl olurdu? Artık bulunduğumuz nokta tam olarak bu. Bu rehberde gerçekten var olan seçenekleri, nelerin işe yaradığını ve bugün kullanmaya başlayabileceğiniz araçları ele alıyoruz.

Video Üretimi

Video üretimi yıllarca Runway veya Pika demekti: kapalı platformlar, abonelik ücretleri ve üretilen içerikle neler yapabileceğinize dair kısıtlamalar. Peki ya şimdi? Benzer kalitedeki modelleri kendi donanımınızda çalıştırabilirsiniz.

HunyuanVideo ile metinden video üretimi; önde gelen açık kaynak video modelinden 720p çıktı

ModelKuruluşParametreÖzelliklerDonanımMaliyet
HunyuanVideoTencent13B720p, metin+görsel80GB~$0.20
HunyuanVideo-1.5Tencent8.3B480p-1080p, metin+görsel14GB~$0.05
Mochi 1Genmo10B480p@30fps12GB+~$0.10
LTX-VideoLightricks768x512, gerçek zamanlı12GB~$0.02
LTX-2Lightricks19B4K, senkronize sesÜst düzey~$0.30
Wan 2.1Alibaba1.3-14B480p-720p8GB+~$0.03
Wan 2.2Alibaba27B MoE (14B etkin)720p, MoE8GB+~$0.03
CogVideoX1.5-5BTsinghua5B1360x768@16fps, 10 saniyeye kadar12GB~$0.04
SkyReels-V3Skywork14-19BSes güdümlü, referanstan videoya, V2VÜst düzey~$0.10
Step-Video-T2VStepFun30BEn büyük açık T2V, 204 kareÜst düzey~$0.15
Open-Sora 2.0HPC-AI11BFlux entegrasyonuÜst düzey~$0.20

Ağırlıklar: HunyuanVideo ↗ · Mochi 1 ↗ · Wan 2.1 ↗ · Open-Sora ↗

Örnekleri görün: HunyuanVideo galerisi ↗ · Mochi örnekleri ↗ · CogVideoX örnekleri ↗

Bunun içerik üreticileri için anlamı

HunyuanVideo, profesyonel değerlendirmelerde Runway Gen-3'ü geride bırakıyor ve tamamen açık. Peki dezavantajı? Ciddi bir donanıma ihtiyacınız var. 80GB VRAM'li bir A100 veya H100 gerekiyor. Çoğumuz için bu, ihtiyaç duyduğumuzda buluttan GPU kiralamak anlamına geliyor.

HunyuanVideo-1.5, donanım hesabını değiştirdi. Tencent bunu Kasım 2025'te, 14GB'lık tüketici sınıfı bir GPU'da çalışan 8.3B parametreli açık bir model olarak yayımladı. Model, 480p/720p çözünürlükte metinden videoya ve görselden videoya üretimin yanı sıra isteğe bağlı 1080p yükseltme sunuyor. Yeni Seçici ve Kayan Döşeme Dikkati (SSTA) mekanizması, modele orijinal HunyuanVideo'nun yaklaşık iki katı çıkarım hızı kazandırıyor. HunyuanVideo kalitesini istiyor ancak 80GB'lık bir kartı makul bulamıyorsanız evde gerçekten çalıştırabileceğiniz sürüm bu.

Mochi 1, gerçekten çalıştırabileceğiniz seçenek. RTX 3060 seviyesindeki 12GB'lık bir GPU modeli rahatlıkla kaldırıyor. Çıktılar belirgin bir sanatsal niteliğe sahip ve gerçekten yaratıcı. HunyuanVideo'nun görsel aslına uygunluk düzeyine tam olarak ulaşmasa da tüm süreç size ait.

LTX-2, oyunlar açısından işlerin ilginçleştiği nokta. Videoyla senkronize ses üreten ilk açık model. Sesin kendiliğinden sahneyle eşleştiği ara sahneler düşünün. Yapım sonrası senkronizasyona gerek yok. Lightricks, Ocak 2026'da tüm ağırlıkları, çıkarım ve eğitim kodunu açık kaynak olarak yayımladı. Model, 50fps'ye kadar yerel 4K çıktı ve 20 saniyeye kadar senkronize ses sunuyor. Lisansla ilgili bir uyarı: LTX-2'nin açık ağırlıkları akademik kullanım için ücretsiz ancak ticari kullanım yalnızca yıllık geliri 10 milyon doların altındaki şirketlere ücretsiz. Bu nedenle üzerine bir iş kurmadan önce bu eşiği kontrol edin.

SkyReels-V3 (Skywork, Ocak 2026), dikkate değer yeni açık model serisi. 14B ve 19B sürümleriyle ses güdümlü video, referanstan videoya ve videodan videoya üretim yapabilen birleşik çok modlu bir model. Bu nedenle bir karakterin veya referans görselin sahneyi yönlendirmesi gerektiğinde güçlü bir seçenek. Step-Video-T2V (StepFun), 30B ile en büyük açık metinden videoya modeli ve sade bir MIT lisansıyla sunuluyor. Küçük bir GPU'ya sığdırmaktan çok izin verici lisanslamaya önem veriyorsanız dikkate değer.

Wan 2.1, bir oyun dizüstü bilgisayarında çalışıyor. Daha küçük sürümler için 8GB'lık bir GPU yeterli. Video üretimiyle prototip oluşturmak isteyip gerekli donanım maliyetini makul bulmadıysanız başlangıç yolunuz bu.

Wan 2.2 (Alibaba, Temmuz 2025), Uzmanlar Karışımı mimarisiyle geliştirilen ilk açık kaynak video modeli: Toplam 27B parametresi bulunuyor ancak her adımda yalnızca 14B parametre etkin. Metinden videoya (T2V-A14B), görselden videoya (I2V-A14B) ve tüketici sınıfı GPU'larda çalışan hibrit bir 5B sürümüyle sunuluyor. Tüm sürümler ticari kullanım için Apache 2.0 lisansına sahip.

Bilinmesi gereken bir nokta var: Wan 2.2 hâlâ son açık Wan sürümü. Daha yeni Wan 2.5 (Eylül 2025), 2.6 (Aralık 2025) ve 2.7 (Nisan 2026) sürümleri senkronize ses, 1080p ve daha hassas kare kontrolü ekledi ancak herkese açık ağırlıkları bulunmuyor ve yalnızca API üzerinden kullanılabiliyor. Kendi sunucunuzda çalıştırmak sizin için önemliyse ulaşabileceğiniz en üst nokta 2.2. 4K ve senkronize sese ihtiyaç duyduğunuzda tercih edilecek açık model ise LTX-2.

Mantıklı iş akışı şöyle: Yerel prototipleme için Mochi 1 veya Wan 2.1. Nihai kalite gerektiğinde bulut GPU'larında HunyuanVideo-1.5 veya LTX-2.

Görüntü Üretimi

Açık kaynak bu alanda zaten kazandı. Bugün indirebileceğiniz modeller Midjourney ile gerçekten rekabet ediyor. Yalnızca "neredeyse onun kadar iyi" değil, gerçekten rekabetçi.

FLUX.1 üretim örnekleriFLUX.1 örnekleri; Apache 2.0 lisanslı bir modelden fotogerçekçi kalite

ModelKuruluşYayımlanmaParametreTemel ÖzellikLisansGörsel başına maliyet
FLUX.1 [schnell]Black Forest LabsAğu 202412B4 adımda hızlı üretimApache 2.0~$0.001
FLUX.1 [dev]Black Forest LabsAğu 202412BPro'ya yakın kaliteTicari olmayan~$0.002
SD 3.5 LargeStability AIEki 20248BMetin işleme, çeşitli tarzlarStability lisansı~$0.002
SD 3.5 Large TurboStability AIEki 20248B4 adımlı, hızlıStability lisansı~$0.001
HiDream-I1HiDream.aiNis 202517BYüksek kalite, Full/Dev/Fast sürümleriMIT~$0.002
CogView4Tsinghua / ZhipuMar 20256BYerel Çince metin, 2048px'e kadarApache 2.0~$0.002
Qwen-ImageAlibabaAğu 202520BSınıfının en iyi metin işleme ve düzenleme özellikleriApache 2.0~$0.002
FLUX.2Black Forest LabsKas 202532BMetin+düzenleme, 4MP, çoklu referansdev: Ticari olmayan / klein 4B: Apache 2.0~$0.003
Ideogram 4.0IdeogramHaz 20269.3BTasarım çalışmaları, metin işleme, JSON düzen kontrolüTicari olmayan~$0.002

Doğrudan deneyin: FLUX.1 schnell demosu ↗ · SD 3.5 Large demosu ↗ · GitHub (FLUX) ↗

Örnekleri görün: FLUX galerisi ↗ · FLUX LoRA galerisi ↗ · Replicate örnekleri ↗

Oyun varlıkları oluşturmak için

FLUX.1 [schnell], bilmeniz gereken model. Apache 2.0 lisansı sayesinde lisans sorunlarıyla uğraşmadan ticari oyunlar yayımlayabilirsiniz. Yalnızca 4 adımda üretim yaptığı için hızlı yineleme olanağı sağlar. İstediğinizi tarif edin, sonucu görün, ayarlayın ve tekrarlayın.

SD 3.5 Large sonunda metinleri düzgün şekilde işleyebiliyor. Önceki sürümler eklemeye çalıştığınız her türlü metni bozuyordu. Bu özellik; kullanıcı arayüzü taslakları, oyun içi tabelalar, başlık ekranları ve görsellerinizde okunabilir sözcüklere ihtiyaç duyduğunuz her yer için önemli.

FLUX.2 (Black Forest Labs, Kasım 2025), daha büyük halef model: Metinden görüntü üretimini ve görüntü düzenlemeyi tek bir kontrol noktasında gerçekleştiren 32B parametreli bir model. 4 megapiksele kadar güçlü çoklu referans karakter/tarz tutarlılığı ve güvenilir metin işleme sunuyor. Açık ağırlıklı FLUX.2 [dev], ticari olmayan bir lisans kullanıyor. Ancak boyut küçültmeli FLUX.2 [klein] (Ocak 2026), 4B sürümünü Apache 2.0 kapsamında sunuyor, bir saniyeden kısa sürede üretim yapıyor ve yaklaşık 8GB VRAM ile çalışıyor. Böylece oyun görsellerini yayımlamak için ticari açıdan güvenli bir seçenek hâlâ mevcut. Özellikle 4B klein sürümünü indirin; daha büyük klein 9B, ticari olmayan FLUX lisansı kapsamında kalıyor. Nicemlenmiş işlem hatları [dev] sürümünü 18-24GB'lık GPU'larda çalışabilir hâle getiriyor.

Bilinmeye değer iki açık seçenek daha var. Chroma1-HD (8.9B, Apache 2.0), tamamen açık bir FLUX.1-schnell türevi. Dolayısıyla [dev] lisansına bağlı kalmadan FLUX ailesinin kalitesine ulaşmanın ticari açıdan güvenli yolu. OmniGen2 (Apache 2.0), metinden görüntü üretimi ile talimat tabanlı düzenlemeyi tek yerde birleştiren birleşik bir model. Bu nedenle sıfırdan üretmek yerine mevcut bir varlık üzerinde yineleme yaparken ("kılıcın mavi parlamasını sağla") en hızlı yol.

Qwen-Image (Alibaba, Ağustos 2025), görselinizde tabela, kullanıcı arayüzü, poster veya eşya etiketi gibi okunabilir metinler gerektiğinde tercih edilecek açık model. Sınıfının en iyi metin işleme yeteneklerine ve güçlü bir talimat tabanlı düzenleme sürümüne sahip 20B parametreli bir Apache 2.0 modeli. Dolayısıyla ticari açıdan güvenli ve çoğu görüntü modelinin hâlâ zorlandığı konuda alışılmadık derecede başarılı. Aralık 2025 güncellemesi olan Qwen-Image-2512, insan gerçekçiliğini ve metin yerleşimini iyileştirirken Apache 2.0 lisansını korudu. Bu nedenle modeli kendi sisteminizde çalıştıracaksanız bu kontrol noktasını indirin. Daha yeni Qwen-Image-2.0 (Şubat 2026) yalnızca API üzerinden kullanılabiliyor.

Ideogram 4.0 (Haziran 2026), Ideogram'ın ilk açık ağırlıklı modeli: Tasarım çalışmaları için geliştirilmiş, güçlü çok dilli metin işleme özelliklerine ve yapılandırılmış JSON istemleri aracılığıyla açık yerleşim ve renk kontrolüne sahip 9.3B parametreli bir difüzyon dönüştürücüsü. Üzerine bir sistem kurmadan önce göz önünde bulundurmanız gereken bir nokta var: Çıkarım kodu Apache 2.0 olsa da ağırlıklar ticari olmayan bir lisans kapsamında. Dolayısıyla ticari lisansı satın almadığınız sürece bu yalnızca araştırma ve prototipleme aracıdır.

Stable Diffusion etrafındaki ekosistem hâlâ rakipsiz. Hassas kompozisyon için ControlNet. Düzeltmeler için inpainting. Özel tarzlar için LoRA ince ayarı. FLUX arayı kapatıyor ancak bugün kapsamlı özelleştirmeye ihtiyacınız varsa SD'nin olgun araç ekosistemi size daha fazla olanak sunuyor.

Ben olsam şöyle değerlendirirdim: Dokular ve sprite'lar için ikisi de işe yarar. Belirli tarz gereksinimleri olan konsept çizimleri için LoRA'larla birlikte SD 3.5. Ticari bir ürünü yayımlarken en yüksek kalite için FLUX schnell.

3D Üretimi

Oyununuzda üç saniye görünen bir nesneyi modellemek için sekiz saat harcadıysanız bu bölüm sizin için. 3D üretimi bir süre önce "ilginç araştırma" aşamasından gerçek bir üretim aracına dönüştü ve 2026 itibarıyla açık modeller gerçekten iyi. Bir eskizden dokulu bir modele bir dakikadan kısa sürede geçebilirsiniz.

TRELLIS 3D üretim örnekleriTRELLIS, tek bir görüntüden PBR malzemelere sahip dokulu 3D modeller üretir

ModelKuruluşYayımlanmaTemel ÖzellikÇıktıModel başına maliyet
TRELLIS.2-4BMicrosoftAra 20254B parametre, yerel PBR, 1536³'e kadarNormallere sahip dokulu model~$0.03
Hunyuan3D 2.1TencentHaz 2025Üretime hazır PBR, tüm ağırlıklar + eğitim koduYüksek kaliteli dokulu model~$0.05
SAM 3DMetaKas 2025Tek görüntüden 3D'ye (nesneler + insan vücudu)Tek fotoğraftan model~$0.02
Stable Fast 3DStability AIAğu 2024Tek görüntü → yaklaşık 0,5 saniyede modelHızlı dokulu model~$0.001
TripoSGVAST-AIMar 20251.5B doğrultulmuş akışla şekil üretimiYüksek kaliteli model~$0.01
TripoSRStability / Tripo2024Tek görüntüden hızlı yeniden oluşturmaModel (dokusuz)~$0.001
UniRigTsinghua / Tripo2025Otomatik rig: iskelet + kaplama ağırlıklarıRig'lenmiş, canlandırılabilir model~$0.01
Doğrudan deneyin: TRELLIS.2 demosu ↗ · Hunyuan3D demosu ↗ · InstantMesh demosu ↗

Örnekleri görün: TRELLIS.2 proje sayfası ↗ · 3D AI Studio galerisi ↗

Gerçekten işe yarayan bir iş akışı

Şu anda içerik üreticileri için işe yarayan yaklaşım, modelleri birbirine bağlamak. Üretilmiş veya fotoğraflanmış olması fark etmeksizin bir görüntüyle başlayın. Birden fazla görünüm elde etmek için görüntüyü Stable Zero123 veya Wonder3D'den geçirin. Mesh oluşturmak için bu görünümleri InstantMesh veya TripoSR'a verin. Ardından düzgün materyaller için TRELLIS.2 veya Hunyuan3D kullanın.

Microsoft'un TRELLIS.2 modeli, üretime hazır varlıklarda yeni lider. Diğer modelleri zorlayan geometrilerin üstesinden geliyor: ince yüzeyler, delikler ve karmaşık topoloji. 4B parametreli sürüm, materyal gibi davranan basit verteks renkleri yerine gerçek PBR dokularına sahip mesh'ler üretiyor.

Stable Fast 3D tamamen hıza odaklanıyor. Görüntüden mesh'e yaklaşık yarım saniyede geçiyor. Mesh'in temizlenmesi ve dokulanması gerekiyor ama prototipleme için? Saatlerinizi harcamadan önce bir fikrin işe yarayıp yaramadığını anlamak için? Rakipsiz. Tek bir görüntüden daha temiz geometri istediğinizde bir üst seçenek TripoSG.

Hunyuan3D 2.1, Tencent'in kullanabileceğiniz açık modeli: eksiksiz ağırlıklar ve eğitim koduyla birlikte üretim kalitesinde PBR dokulama sunuyor. Adlandırmaya dikkat edin, çünkü insanların kafasını karıştırabiliyor. Hunyuan3D 2.5, 3.0 ve 3.1 mevcut olsa da herkese açık ağırlıkları bulunmayan, yalnızca API üzerinden kullanılabilen modeller; dolayısıyla kendi sunucunuzda çalıştırabileceğiniz temel üreticinin en güncel sürümü hâlâ 2.1. Tencent, 2.1 üzerine kurulu iki kullanışlı uzantıyı da açtı: Hunyuan3D-Omni çoklu koşul denetimi (nokta bulutu, voksel, iskelet, sınırlayıcı kutu) eklerken Hunyuan3D-Part bir mesh'i düzenlenebilir parçalara ayırıyor. Lisansı ayrıca AB, Birleşik Krallık ve Güney Kore'yi kapsamıyor; bu nedenle oyununuzu bu bölgelerde yayımlamadan önce koşulları kontrol edin.

SAM 3D (Meta, Kasım 2025) en yeni başlangıç yöntemi: tek bir fotoğraf, nesneler ve insan bedenleri için ayrı modeller kullanılarak 3B mesh'e dönüşüyor. Meta'nın segmentasyon çalışmalarıyla birlikte, bir görüntüdeki nesneyi ayırabilir ve yalnızca o nesneyi yeniden oluşturabilirsiniz.

UniRig (Tsinghua ve Tripo, MIT), mesh elde ettikten hemen sonra herkesin karşılaştığı eksiği kapatıyor: rigleme. Girdi mesh'i için otomatik olarak geçerli bir iskelet ve skinning ağırlıkları oluşturuyor; böylece üretilmiş bir karakter, statik bir dekor olarak kalmak yerine gerçekten canlandırılabiliyor. Bunu NVIDIA'nın SOMA-X otomatik animasyon çalışmasıyla birleştirdiğinizde tamamen üretilmiş ve tamamen riglenmiş bir karakter, araştırma demosu olmaktan çıkıyor.

Bağımsız içerik üreticileri için gerçekçi beklenti şu: FLUX ile konsept çizimi üretin, geometri için InstantMesh'ten geçirin, ardından Blender'da dokulayın veya otomatik PBR için TRELLIS kullanın. Varlık başına 4-8 saat yerine 30-60 dakika harcarsınız. Sıfır zaman değil ama gerçek bir fark.

Ses ve Müzik

Ses üretimi henüz görüntü ve videoya yetişmedi. Yine de özellikle prototipleme ve ses efektleri konusunda çalışma biçiminizi değiştirecek kadar seçenek var.

Yapay zekâyla üretilmiş müzik örneği. İstediğiniz ruh hâlini tarif edin, ona uygun müzik elde edin

ModelKuruluşYayımlanmaNe Yapıyor?LisansMaliyet/30 sn
ACE-Step 1.5StepFun/ACE StudioOca 2026Yaklaşık 4 dakikalık müziği hızlı üretme, 19 dil, ses klonlamaMIT~$0.02
Stable Audio 3.0Stability AIMay 2026Yaklaşık 6 dakikaya kadar şarkılar; açık Small, Small-SFX ve Medium modelleriStability Community~$0.02
YuEMAPOca 2025Şarkı sözlerinden vokalli ve eşlikli tam şarkılarApache 2.0~$0.05
MusicGenMeta2023Metinden müzik üretimi, denetlenebilirkod MIT / ağırlıklar CC-BY-NC~$0.01
DiffRhythm 2ASLP-labŞub 2026Hızlı tam şarkı üretimiApache 2.0~$0.02
Magenta RealTimeGoogleHaz 2025Gerçek zamanlı, komutlarla yönlendirilebilen müzikkod Apache / ağırlıklar CC-BY~$0.02

Doğrudan deneyin: MusicGen demosu ↗ · AudioCraft deneme alanı ↗

Örnekleri görün: MusicGen örnekleri ↗ · AudioGen örnekleri ↗

Oyununuzda gerçekten kullanabilecekleriniz

Meta'nın MusicGen modeli, oyun seslerini prototiplemek için hâlâ pratik bir seçenek. İstediğiniz ruh hâlini tarif edin, ona uygun müzik elde edin; üstelik 12 GB'lık bir GPU'da sorunsuz çalışır. Lisansla ilgili bir noktaya dikkat: MusicGen kodu MIT lisanslı olsa da model ağırlıkları CC-BY-NC (ticari olmayan kullanım) kapsamındadır. Bu yüzden prototip oluşturmak için kullanın, yayımlayacağınız içeriklerde ise ACE-Step veya Stable Audio gibi ticari lisanslı bir modele geçin.

Stable Audio'nun açık ses efekti modeli (Small-SFX) ayak sesleri, kapı gıcırtıları, ortam rüzgârı ve mekanik seslerin üstesinden geliyor, yerel olarak çalışıyor ve Stability'nin topluluk lisansıyla sunuluyor. Dolayısıyla ticari olarak gerçekten kullanabileceğiniz seslere ihtiyacınız olduğunda başvurabileceğiniz açık SFX seçeneği bu. Diğer açık SFX modellerinin ek koşulları olduğu için bunu tercih etmelisiniz: Meta'nın AudioGen modeli CC-BY-NC, TangoFlux ise Stability'nin ticari olmayan topluluk lisansı altında. Bu nedenle yayımlanacak bir oyunda ikisi de yalnızca prototip amaçlı kullanılabilir.

Magenta RealTime (Google) en iyi anlamda diğerlerinden ayrılıyor: gerçek zamanlı ve komutlarla sürekli yönlendirilebilen müzik için geliştirilmiş tek açık ağırlıklı model. Bitmiş bir parça oluşturmak yerine, çalarken yönlendirebileceğiniz canlı müzik üretiyor. Bu da oyuncunun yaptıklarına göre değişen uyarlanabilir bir oyun müziğinin tam olarak ihtiyaç duyduğu yapı. Kod Apache 2.0, ağırlıklar ise CC-BY lisanslı; ikisi de ticari kullanıma uygun.

YuE gerçekten heyecan verici. Vokalli tam şarkılar üreten ilk açık model. Tema şarkıları. Gerçek şarkı sözleriyle söylenen arka plan müzikleri. Kalite değişkenlik gösteriyor ama indirip kendi başınıza çalıştırabileceğiniz diğer tüm seçeneklerden kilometrelerce ileride.

ACE-Step, şu anda bilmeniz gereken açık müzik modeli ve hızla gelişti: 1.5 serisi (Ocak 2026, daha büyük 5B XL varyantıyla birlikte) Mayıs 2025'te yayımlanan ilk sürümün yerini aldı ve artık MIT lisanslı. Birkaç dakikalık müziği hızla üretiyor, 19 dili destekliyor; ses klonlama, remiksleme ve şarkı sözü düzenleme özellikleri sunuyor. Oyun prototipleme açısından YuE ve MusicGen'in açık bıraktığı boşluğun büyük kısmını kapatıyor.

Stable Audio 3.0 (Mayıs 2026), ses tarafındaki daha büyük güncelleme. Yaklaşık altı dakikaya kadar şarkılar üretebiliyor ve Stability dört varyanttan üçü için açık ağırlıklar yayımladı: Small ve özel ses efekti modeli Small-SFX cihaz üzerinde çalışırken Medium, daha iyi müzikal yapı ve tam parça uzunluğu sunuyor. Yalnızca Large modeli API'ye özel kaldı. Small-SFX artık özellikle oyun ses efektleri için en güçlü açık seçenek. Tüm model ailesi lisanslı verilerle eğitildiğinden hukuki zemini, eğitim verileriyle ilgili sonuçlanmamış davaları bulunan müzik üreticilerinden daha sağlam.

Dürüst değerlendirme şu: açık modellerle kapalı modeller (Suno, Udio) arasındaki fark azalıyor ancak tam vokalli şarkılarda hâlâ belirgin; üstelik bu kapalı araçlar da eğitim verileriyle ilgili sonuçlanmamış davalarla karşı karşıya. Ses efektlerinde açık modeller (özellikle Stable Audio'nun SFX modeli) gerçekten rekabetçi. Yayımlamak istediğiniz şarkılarda yoğun biçimde yineleme yapmayı veya son prodüksiyon için bir müzisyenle çalışıp bu araçları geri kalan her şeyde kullanmayı bekleyin.

Konuşma ve Seslendirme

Ses üretimi artık “oyunlar için yeterince iyi” düzeyini çoktan aştı ve bu durum küçük ekiplerin yapabileceklerini değiştiriyor.

Doğal konuşma, doğru tempo ve duygu içeren, yapay zekâyla üretilmiş oyun anlatımı

ModelKuruluşYayımlanmaTemel ÖzellikLisansMaliyet/dk
Qwen3-TTSAlibabaOca 20263 sn'lik ses klonlama, ses tasarımı, 10 dilApache 2.0~$0.002
ChatterboxResemble AI2025Duygu denetimi, yaklaşık 5 sn'den klonlama, 23 dilMIT~$0.003
CSMSesame AIMar 2025Diyalog akışı, doğal duraksamalarApache 2.0~$0.005
Fish Speech 1.5Fish Audio202410-30 sn'den sıfır örnekli klonlamakod Apache / ağırlıklar CC-BY-NC-SA~$0.002
OpenVoice V2MyShell/MITNis 2024Duygu/aksan denetimiMIT~$0.003
XTTS-v2Coqui (topluluk)202417 dil, ses klonlamaCPML (ticari olmayan kullanım)~$0.005

Örnekleri dinleyin: Fish Audio sesleri ↗ · OpenVoice demosu ↗

NPC'lerin insanlar gibi konuşmasını sağlamak

Sesame'in CSM (Conversational Speech Model) modeli özellikle diyalog için geliştirildi. Doğal duraksamalar üretiyor. Tonlamayı değiştiriyor. Gerçek konuşma ritmini yakalıyor. Çoğu TTS, metin okuyan biri gibi ses çıkarır ve bunu anında fark edersiniz. CSM ise konuşan biri gibi duyulur. Bu fark, düşündüğünüzden daha önemli.

Qwen3-TTS (Alibaba, Ocak 2026), ticari projelerde tercih edebileceğiniz model. Tüm model ailesi Apache 2.0 lisanslı; yaklaşık 3 saniyelik referans sesten klonlama yapıyor, 10 dil konuşuyor ve açıklama tabanlı ses tasarımını destekliyor. Böylece referans kayıtları aramak yerine bir NPC'nin sesini düz metinle tanımlayabilirsiniz. 0.6B ve 1.7B modelleri mütevazı donanımlarda çalışıyor.

Chatterbox (Resemble AI), etkileyici sesler için tercih edilebilecek seçenek ve MIT lisanslı olduğu için oyununuzda kullanabilirsiniz. Yaklaşık 5 saniyelik kayıttan ses klonluyor, 200 ms'nin altında gecikmeyle çalışıyor, 23 dili destekliyor ve duygu abartma denetimine sahip ilk açık model. Böylece bir NPC donuk konuşmak yerine gerçekten öfkeli veya korkmuş gibi ses çıkarabiliyor. Apache 2.0 lisanslı iki seçenek daha belirli ihtiyaçları karşılıyor: Orpheus (Canopy), NPC'nin kısa repliklerine kolayca uyarlanabilen <laugh> ve <sigh> gibi satır içi duygu etiketlerini kabul ediyor ve düşük seviye donanımlar için 150M'lik bir varyant sunuyor; Dia (Nari Labs) ise öksürme ve kahkaha gibi sözsüz sesleri de tek geçişte üreten, çok konuşmacılı diyaloglar için tasarlanmış bir model.

Fish Speech ve OpenVoice ses klonlamayı üstleniyor. Bir seslendirme sanatçısının sesini 10-30 saniye kaydedin, ardından o sesle sınırsız diyalog üretin. Bunun ne anlama geldiğini düşünün: önemli replikler için seslendirme sanatçılarıyla çalışabilir, ardından performanslarını yüzlerce varyasyonu ve ortam diyaloğunu kapsayacak şekilde genişletebilirsiniz. Fish Speech için bir lisans notu: kod açık olsa da 1.5 ağırlıkları CC-BY-NC-SA lisanslıdır; dolayısıyla bu bir prototipleme aracıdır. Yayımlanacak oyunlarda bunun yerine OpenVoice (MIT) veya Qwen3-TTS (Apache 2.0) kullanın.

NVIDIA ACE (tamamen açık değil ama bilinmeye değer) artık cihaz üzerinde NPC çalıştırmak için Qwen3-8B'yi destekliyor. Yerel LLM + yerel TTS + dudak senkronizasyonu; hepsi tüketici GPU'larında çalışıyor. Bulut çağrısı gerektirmeyen gerçek zamanlı NPC konuşmaları için kullanılabilecek teknoloji yığını bu.

Bağımsız içerik üreticileri için mantıklı yaklaşım şu: ana karakterler ve en önemli replikler için seslendirme sanatçılarıyla çalışın. Ortam diyaloglarının, varyasyonların ve aksi hâlde sessiz kalacak veya aşırı pahalıya mal olacak tüm yan repliklerin kapsamını genişletmek için Qwen3-TTS ya da OpenVoice kullanın.

Dünya Modelleri ve Oyun Simülasyonu

İşlerin gerçekten tuhaf ve gerçekten heyecan verici hâle geldiği yer burası. Bu modeller statik varlıklar üretmiyor. Oyun hissi veren deneyimler üretiyorlar.

🎮 Oasis'i Oynayın: Yapay Zekâyla Üretilmiş Minecraft
Oyun motoru olmadan, yalnızca yapay zekâ tahminiyle gerçek zamanlı dünya üretimi
ModelKuruluşYayımlanmaNe Yapıyor?DurumMaliyet/kare
DIAMONDAraştırma2024Difüzyon dünya modeli, Atari simülasyonuAçık ağırlıklar~$0.001
OasisDecart/EtchedEki 2024Gerçek zamanlı Minecraft üretimi500M ağırlıkları açık~$0.002
MineWorldMicrosoftNis 2025Gerçek zamanlı Minecraft, açık Oasis alternatifiMIT~$0.002
Hunyuan-GameCraftTencentAğu 2025Etkileşimli oyun videosu, klavye/fare denetimiTencent Community~$0.005
GameGen-XAraştırma2024Açık dünya video üretimiAçık kod + veri kümesi~$0.005
NVIDIA CosmosNVIDIAEki 2025Fiziksel yapay zekâ simülasyonu (Predict2.5)NVIDIA Open Model License~$0.01
Matrix-Game 3.0SkyworkMar 2026Gerçek zamanlı 720p etkileşimli dünyalar, uzun vadeli bellekAçık ağırlıklar~$0.005
Genie 2DeepMindAra 2024Görüntülerden etkileşimli 3B dünyalarYayımlanmadıYok
Genie 3DeepMindAğu 2025Gerçek zamanlı 720p dünyalar, komutla oluşturulabilen olaylarKapalı (Project Genie)Yok

Araştırmayı inceleyin: DIAMOND proje sayfası ↗ · Cosmos blogu ↗Deneyin: Oasis canlı demosu ↗ · Genie 2 örnekleri ↗

Bunu neden önemsemelisiniz?

DIAMOND, oyun yapay zekâsına bakışınızı değiştiren bir şeyi kanıtladı. Bir ajanı tamamen üretilmiş bir dünyanın içinde eğitebilirsiniz. Eğitim için gerçek bir oyun motoruna gerek yok. Yapay zekâ, bir difüzyon modelinin hayal gücü içinde oynuyor ve ardından öğrendiklerini gerçek oyuna aktarıyor. Bunun sonuçları oldukça önemli.

Oasis, Minecraft benzeri bir dünyayı gerçek zamanlı çalıştırıyor. Kare kare. Oyun motoru, dokular veya önceden hazırlanmış varlıklar yok. Yalnızca sırada ne olacağını tahmin eden bir transformer var. Bu bir kavram kanıtı, ancak bunun nereye varabileceğini düşünün. 500 milyon parametreli sürüm şimdiden açık.

GameGen-X, açık dünya oyun videoları için en büyük veri kümesini yayımladı. Kendi modellerinizi eğitmek veya mevcut modelleri oyun benzeri içerikler üretecek şekilde ince ayarlamak istiyorsanız başlangıç noktanız burası.

NVIDIA Cosmos, robotik ve otonom araçlar için geliştirildi ancak dünya temel modelleri oyunlarda da işe yarıyor. Fizik kurallarını, nesne sürekliliğini ve mekânsal ilişkileri anlıyorlar. Güncel açık seri, Ekim 2025'te ticari kullanıma ve türev çalışmalara izin veren NVIDIA Open Model License kapsamında yayımlanan Cosmos-Predict2.5.

Hunyuan-GameCraft (Tencent, Ağustos 2025), doğrudan oyunlara yönelik en açık dünya modeli. 100'den fazla AAA oyundan alınan bir milyondan fazla kayıtla eğitildi ve klavye ile fare girdilerini ortak bir kontrol alanında birleştiriyor; böylece yalnızca izlediğiniz değil, gerçekten yönettiğiniz etkileşimli oyun videoları üretiyor. Hunyuan3D ile aynı Tencent Community License'ı ve dolayısıyla aynı AB, Birleşik Krallık ve Güney Kore istisnalarını taşıyor; bu bölgelerde yayımlamadan önce koşulları kontrol edin. MineWorld (Microsoft, MIT), Oasis'in tamamen serbest lisanslı karşılığı: indirebileceğiniz ve oyun motoru olmadan çalıştırabileceğiniz gerçek zamanlı bir Minecraft dünya modeli.

Genie 3 (DeepMind, Ağustos 2025'te duyuruldu), kayda değer bir sıçrama: gerçek zamanlı etkileşim sunan, birkaç dakika boyunca tutarlılığını koruyan ve 24 fps'de gezilebilir 720p dünyalar üreten ilk dünya modeli. Ayrıca hava durumunu değiştiren veya komutla nesneler ekleyen “istemle yönlendirilebilir dünya olayları” sunuyor. Ocak 2026'da ABD'deki Google AI Ultra abonelerine Project Genie adıyla açıldı. Model ağırlıkları hâlâ kapalı olsa da oynanabilir, üretilmiş dünyaların nereye doğru gittiğini gösteriyor.

Matrix-Game 3.0 (Skywork, Mart 2026), Genie'ye verilen açık yanıt. Gerçek zamanlı olarak 40 fps'de 720p görüntü akışı sağlayan ve dakikalar süren sekanslar boyunca sahneleri tutarlı tutan, bellek destekli etkileşimli bir dünya modeli. Damıtılmış 5B sürümü gerçek zamanlı çıkarım yaparken daha büyük 2x14B MoE sürümü kaliteyi yükseltiyor; model ağırlıkları Apache 2.0 kapsamında Hugging Face'te bulunuyor. DeepMind'ı beklemek yerine bugün oynanabilir, üretilmiş dünyaları denemek istiyorsanız gerçekten indirebileceğiniz seçenek bu.

Günümüzün pratik oyun geliştirme süreçleri açısından bunlar hâlâ araştırma araçları. Ancak yapay zekâ destekli içerikler, prosedürel üretim üzerinde çalışıyorsanız veya yalnızca tüm bunların nereye gittiğini düşünüyorsanız öncü alan burası.

Büyük Dil Modelleri

LLM'ler diyaloglara, görev üretimine ve oyun mantığına güç veriyor. Açık seçenekler artık gerçekten GPT-4 ile rekabet ediyor. İki yıl önce durum böyle değildi.

ModelKuruluşYayımlanmaBoyutEn Uygun KullanımLisansMaliyet/1K token
DeepSeek-V3DeepSeekAra 2024671B MoE (37B etkin)Akıl yürütme, genel kullanımSerbest~$0.02
DeepSeek-R1DeepSeekOca 2025V3 tabanlıDüşünce zinciriSerbest~$0.03
DeepSeek-V3.2DeepSeekAra 2025Seyrek dikkat (DSA)Akıl yürütme + araç kullanımıMIT~$0.02
DeepSeek-V4DeepSeekNis 20261.6T MoE (49B etkin)Öncü akıl yürütme, 1M bağlamMIT~$0.02
GLM-5Zhipu / Z.aiŞub 2026744B MoE (40B etkin)Kodlama, ajan tabanlı çalışma, araç kullanımıMIT~$0.02
GPT-OSSOpenAIAğu 2025120B / 20B MoEAkıl yürütme, araç kullanımı, cihaz üzerinde çalışmaApache 2.0~$0.01
Kimi K2Moonshot20251T MoE (32B etkin)Ajan tabanlı çalışma, kodlamaDeğiştirilmiş MIT~$0.02
Kimi K3MoonshotTem 20262.8T MoE (~50B etkin)Öncü ajan tabanlı çalışma, kodlama, 1M bağlam, görsel anlamaAçık ağırlıklar (27 Tem)~$0.03
Gemma 3Google20251B-27BCihaz üzerinde çalışma, 140 dil, görsel anlamaGemma~$0.01
Qwen3Alibaba2025235B MoE (22B etkin)Çok dillilik, kodApache 2.0~$0.01
Qwen3-CoderAlibaba2025480B MoE (35B etkin)Ajan tabanlı kodlama, 256K bağlamApache 2.0~$0.02
Llama 4Meta2025ÇeşitliAjanlar, 10M'a kadar bağlamLlama Community~$0.01
Qwen3-VLAlibaba20252B-235BGörsel anlama + dilApache 2.0~$0.02
InternVL3Shanghai AI Lab20251B-78BGörsel anlama, OCR, kullanıcı arayüzü temellendirmeMIT~$0.02

Başlayın: HuggingFace'te Qwen3-8B ↗ · HuggingFace'te DeepSeek-V3 ↗ · HuggingFace'te GLM-5 ↗

Oyun geliştirmek için

Qwen3, çoğu oyun kullanımı için pratik seçim. Apache 2.0 lisansı sayesinde entegrasyonunuz size ait. Yerelleştirmeyi düşünüyorsanız önemli olan güçlü çok dilli desteğe sahip. Yapılandırılmış talimatları takip etmede başarılı. 7B ve 14B çeşitleri tüketici sınıfı GPU'larda yerel olarak çalışıyor.

DeepSeek-V3, çoğu karşılaştırmalı testte GPT-4 ile aynı seviyede veya ondan daha iyi. Mimarisi akıllıca: toplam 671B parametresi olmasına rağmen token başına yalnızca 37B parametre etkinleşiyor. Ciddi donanıma, yani çoklu GPU'ya ihtiyacınız var ancak API bağımlılığı olmadan öncü düzeyde kalite sunuyor.

DeepSeek-V3.2 (Aralık 2025), akıl yürütme ile araç kullanımını tek bir modelde birleştiriyor ve uzun bağlamlı çıkarımı daha ucuz hâle getirmek için DeepSeek Sparse Attention'ı (DSA) sunuyor. Ayrıca en üst düzey akıl yürütme karşılaştırmalı testlerini hedefleyen, yüksek hesaplama kapasiteli bir Speciale çeşidi bulunuyor. Oyun mantığı ve diyalog için V3'e kıyasla daha güçlü ve daha yetenekli bir ajan olarak doğrudan kullanılabilir.

DeepSeek-V4 (Nisan 2026), açık modellerin sınırını bir kez daha ileri taşıdı. V4-Pro; token başına yalnızca 49B etkin parametreye, 1 milyon tokenlık bağlam penceresine ve seçilebilir akıl yürütme modlarına sahip 1.6T parametreli bir MoE ve bunların tümünü MIT kapsamında sunuyor. V4-Flash çeşidi (toplam 284B, etkin 13B), tam bir GPU kümesi gerektirmeyen bir pakette 1M bağlamı koruyor. Bugün karmaşık görev mantığı veya uzun oyun durumu bağlamı için açık bir model seçiyorsanız ulaşabileceğiniz en üst seviye bu.

GLM-5 (Zhipu AI, Şubat 2026), kodlama ve ajan tabanlı çalışmalar için yenilmesi gereken açık model; GLM-5.2 güncellemesi de araç kullanımı ve uzun vadeli planlama puanlarını kapalı öncü modellere yaklaştırdı. Token başına 40B etkin parametreye, 200K tokenlık bağlama ve MIT lisansına sahip 744B parametreli bir MoE. Z.ai, halka açık ilk temel model şirketi ve barındırılan API'sini oldukça rekabetçi biçimde fiyatlandırıyor (bir milyon giriş tokenı için yaklaşık $1.40); ancak kendi sunucunuzda barındırmayı tercih ederseniz model ağırlıkları Hugging Face'te. Oyununuz görev betikleri, araç çağıran ajanlar veya kod odaklı sistemler için bir LLM'e dayanıyorsa GLM-5, tamamen kontrol edebileceğiniz güçlü bir OpenAI alternatifi.

GPT-OSS (OpenAI, Ağustos 2025), OpenAI'ın ilk açık ağırlıklı modeli ve bu rehberin temasına tam olarak uyuyor. gpt-oss-120b modeli tek bir 80GB GPU'da yaklaşık o4-mini düzeyinde akıl yürütüp araç çağırabiliyor; gpt-oss-20b ise 16GB'lık bir tüketici kartında çalışıyor. Her ikisi de Apache 2.0 kapsamında. NPC mantığı veya araç kullanan ajanlar için kendi sunucunuzda barındırabileceğiniz Batılı bir laboratuvar modeli istiyorsanız seçeneğiniz bu.

Kimi K2 (Moonshot), GLM-5 ve DeepSeek'in yanında yer alan diğer açık ve ağır sıklet ajan modeli. 32B etkin parametreye sahip, 1 trilyon parametreli bir MoE; kodlama ve araç kullanımı için yoğun biçimde ayarlanmış. Değiştirilmiş MIT lisansı yalnızca aylık 100 milyon kullanıcıyı aşan kullanımlara kısıtlamalar eklediğinden bağımsız geliştiriciler için fiilen MIT gibi. Bir ajanın çok sayıda adımı kapsayan planlar yapması gerektiğinde bunu tercih edin.

Kimi K3 (Moonshot, Temmuz 2026), şimdiye kadar duyurulmuş en büyük açık ağırlıklı model ve kendisinden önceki tüm açık modellerden daha fazla kapalı öncü modellere yaklaşıyor. Token başına yalnızca yaklaşık 50B etkin parametreye (896 uzmandan 16'sı), 1M tokenlık bağlama ve yerleşik görsel anlama özelliğine sahip 2.8 trilyon parametreli bir MoE. Kimi Delta Attention ve Attention Residuals adlı iki yeni dikkat tasarımı üzerine kurulu. Moonshot'ın verilerine göre kodlama ve ajan karşılaştırmalı testlerinde Claude Opus 4.8 ile GPT-5.5'i geride bırakıyor ve yalnızca en üst düzey özel modellere yetişemiyor. Ancak ölçek önemli bir engel: ağırlıklar 27 Temmuz 2026'da MXFP4 biçiminde yaklaşık 1.4TB olarak yayımlanacak; dolayısıyla kendi sunucunuzda barındırmak çok düğümlü bir GPU kümesi gerektiriyor ve çoğu ekip modele bir milyon giriş tokenı başına $3, bir milyon çıkış tokenı başına $15 fiyatlandırılan API üzerinden erişecek. Kendi başınıza gerçekten çalıştırabileceğiniz ajanlar için K2, Moonshot'ın pratik seçeneği olmaya devam ediyor; ancak K3, en üst düzeyde “açık” kavramının ne anlama gelebileceğini yeniden tanımlıyor.

Gemma 3 (Google), oyuncunun donanımında çalıştırmanız veya geniş çapta yerelleştirme yapmanız gerektiğinde en uygun seçenek. 1B, 4B, 12B ve 27B boyutlarında sunulduğundan 8GB'lık bir karttan başlayarak ölçeklenebiliyor, 140 dili destekliyor ve işlev çağrıları yapabiliyor. 4B ve üzeri çeşitleri görselleri de görebildiği için küçük bir görsel model olarak da kullanılabiliyor. Gemma lisansı ticari kullanıma izin veriyor.

Qwen3-Coder (Alibaba), çoğu kullanımda eski DeepSeek-Coder serisinin yerini alan özel bir açık kodlama modeli. 35B etkin parametreye, yerel olarak 256K bağlama (1M'a genişletilebilir) ve Apache 2.0 lisansına sahip 480B parametreli bir MoE; ajan tabanlı kodlama karşılaştırmalı testlerinde Claude-Sonnet sınıfında. Oyununuz kod üretiyor veya çalıştırıyorsa açık modellerde ulaşılabilecek en üst seviye bu. Avrupa'nın Mistral ailesi de (kodlama için Devstral, cihaz üzerinde çalışma için Mistral Small 3.x; ikisi de Apache 2.0) kendi sunucunuzda barındırabileceğiniz sağlam bir alternatif.

Qwen3-VL, Apache 2.0 kapsamında 2B'den 235B'ye kadar yoğun ve MoE boyutlarıyla görsel anlama ekliyor. Ekran görüntülerini analiz etmesi, oyuncuların çizdiği içerikleri anlaması veya kamera girdisini işlemesi gereken oyunlar için kullanışlı. 8B çeşidi tek bir GPU'da çalışıyor. InternVL3 (Shanghai AI Lab, MIT), diğer güçlü açık görsel-dil seçeneği; özellikle OCR ve kullanıcı arayüzü temellendirmede başarılı olması, araçlarınızın oyun arayüzlerini okuması gerektiğinde önem taşıyor. Mistral'ın Pixtral 12B modeli (Apache 2.0) ise ticari kullanıma uygun, daha hafif bir seçenek.

Bulut çağrıları olmadan gerçek zamanlı yanıt veren, cihaz üzerinde çalışan NPC'ler için şu anda en pratik yol NVIDIA ACE üzerinden Qwen3-8B. Oyununuzla birlikte oyuncunun donanımında çalışıyor.

Yardımcı Modeller

Bunlar doğrudan içerik üretmez ancak iş akışlarınızın çalışmasını sağlar.

SAM 2 segmentasyonuSAM 2, görüntü ve videolardaki herhangi bir nesneyi segmentlere ayırır. Bir kez tıklayın, kusursuz bir maske elde edin

ModelKuruluşYayımlanmaİşlevi
SAM 2MetaAğu 2024Görüntü ve videolardaki her şeyi segmentlere ayırır
Depth ProAppleEki 2024Tek görüntüden metrik derinlik çıkarır
gsplatNerfstudio2024+Gaussian splatting, CUDA hızlandırmalı

SAM 2, videodaki nesneleri gerçek zamanlı olarak segmentlere ayırıyor. Bir şeye tıklayın ve kusursuz bir maske elde edin. Rotoskopi, birleştirme veya görüntülerden oyun varlığı olarak kullanılacak nesneleri çıkarma için kullanışlı. SAM 2'yi deneyin ↗

Apple'ın Depth Pro modeli, tek görüntülerden bir saniyeden kısa sürede metrik derinlik haritaları üretiyor. Bu, pek çok olanağın önünü açıyor: 2D çizimleri paralaks efektleriyle 2.5D'ye dönüştürmek, 3D yeniden yapılandırma için derinlik verileri üretmek ve düz görüntülerden normal haritaları oluşturmak. HuggingFace'te Depth Pro ↗

gsplat, Gaussian splatting'in hızlı uygulaması. İster fotogrametri ister ortam taramaları yoluyla oyunlar için gerçek ortamları kaydediyorsanız bunu pratik hâle getiren kütüphane bu.

Ben Aslında Hangilerini Kullanırdım?

Bugün bir oyun projesine başlıyorsanız mantıklı olan araç yığını şöyle:

Dokular ve sprite'lar: FLUX.1 [schnell], Apache 2.0, hızlı yineleme, yayımlanabilir kalite

Konsept çizimleri: Stil kontrolü için LoRA'larla SD 3.5 Large

3D varlıklar: Dokulu mesh'ler için Hunyuan3D 2.1 veya TRELLIS.2, bir fotoğraftan başlıyorsanız SAM 3D, ardından temizlik için Blender

Otomatik rigleme: Mixamo'ya bağlı kalmak yerine üretilmiş mesh'lere iskelet ve skin eklemek için UniRig veya NVIDIA SOMA-X (ikisi de açık)

Ses efektleri: Stable Audio'nun açık Small-SFX modeli; yerel olarak çalışır ve ticari kullanım lisansına sahiptir

Müzik: Prototipler için ACE-Step, ardından nihai prodüksiyon için bir besteci

Seslendirme: Ses klonlama ve ortam diyalogları için Qwen3-TTS (Apache 2.0), bir repliğin gerçek duygu gerektirdiği durumlarda Chatterbox (MIT), önemli replikler için seslendirme sanatçıları

NPC diyalogları: Yerel olarak Qwen3-8B veya karmaşık akıl yürütme ve araç kullanımı için kendi sunucunuzda barındırılabilir bir bulut LLM'i (GLM-5 ya da DeepSeek-V4)

Video (ara sahneler): Yerel olarak Mochi 1, nihai kalite gerektiğinde bulutta HunyuanVideo

Tüm bunlarla ilgili önemli nokta şu: Yaygın hata, her şey için yapay zekâ kullanmaya çalışmak. Bunlar ikame değil, araçtır. Yineleme, varyasyonlar ve geçici varlıklar gibi sıkıcı kısımları hızlandırırlar; böylece zamanınızı gerçekten önemli olan yaratıcı kararlara ayırabilirsiniz. Oyununuzu size özgü kılan kısımlara.

Donanım Gerçeklik Kontrolü

Bunları çalıştırmak için gerçekte neye ihtiyacınız olduğu konusunda dürüst olalım:

8GB VRAM (RTX 3060, 4060): SD 1.5/SDXL, Wan 2.1 small, AudioGen, Fish Speech, küçük LLM'ler (7B kuantize). Bu, oyuncu dizüstü bilgisayarı sınıfında ve başlamak için yeterli. 12 GB VRAM (RTX 3080, 4070): SD 3.5, FLUX schnell, Mochi 1, MusicGen, TripoSR, kuantize Qwen 14B. İşlerin rahatlamaya başladığı seviye burasıdır. Kullanışlı modellerin çoğu burada çalışır.

24 GB VRAM (RTX 3090, 4090): Çoğu model tam hassasiyette çalışır; InstantMesh ve daha büyük LLM'ler kullanılabilir. Bu iş akışını ciddi biçimde kullanacaksanız en ideal seviye budur.

48-80 GB VRAM (A100, H100): HunyuanVideo, LTX-2, DeepSeek-V3 ve üretim ölçeğinde içerik oluşturma. Bunlar kurumsal donanımlardır. Satın almak yerine kiralarsınız.

RunPod, Lambda Labs veya Modal üzerindeki bulut sunucularında A100'lerin maliyeti saatte 2-4 dolardır. Ara sıra kullanım için bu, donanım satın almaktan daha ucuzdur. Son kaliteye ihtiyaç duyduğunuzda sunucuyu başlatın, işiniz bittiğinde kapatın.

Bu kılavuzdaki maliyet tahminleri hakkında: Oluşturma başına maliyetler, bulut GPU'larında kendi barındırdığınız çıkarım işleminin saatte yaklaşık 2-3 dolar (A100) veya yaklaşık 0,40 dolar (RTX 4090) tuttuğu varsayımına dayanır. Gerçek maliyetler donanıma, optimizasyona ve toplu işlem boyutlarına göre değişir. Bunlar planlama için yaklaşık değerlerdir; dolayısıyla sizin sonuçlarınız farklı olabilir.

2026'da Neler Yeni?

Yakın zamanda yayımlananlar: LTX-2 ve LTX-2.3, yerel 4K desteğiyle açık ve senkronize ses-video üretimini getirdi. Microsoft'un TRELLIS.2'si (Aralık 2025), görüntüden 3D'ye dönüşümde lider açık model oldu; Meta'nın SAM 3D'si (Kasım 2025) ise tek fotoğraftan 3D yeniden oluşturmayı pratik hâle getirdi. Görüntü oluşturmada FLUX.2, FLUX.1'in yerini aldı ve NVIDIA'nın SOMA-X'i açık otomatik rigleme ve yeniden hedefleme özellikleri sundu. 2026'nın ilk yarısında da bu tempo sürdü: Qwen3-TTS (Ocak), ses klonlamaya Apache 2.0 lisanslı sağlam bir yuva sağladı; Zhipu'nun GLM-5'i (Şubat), MIT lisansıyla 744B parametreli açık bir kodlama ve otonom ajan modeli sundu; Skywork'ün Matrix-Game 3.0'ı (Mart), açık ağırlıklarla gerçek zamanlı ve etkileşimli bir dünya modeli yayımladı; DeepSeek-V4 (Nisan), MIT lisansı altında açık LLM'leri 1 milyon tokenlık bağlam penceresine taşıdı; Stable Audio 3.0 (Mayıs), lisanslı verilerle eğitilmiş üç açık ses modeli sundu ve Ideogram ilk açık ağırlıklı görüntü modelini yayımladı (Haziran). Ardından Temmuz ayında Moonshot, otonom ajan kıyaslamalarında Claude Opus 4.8 ve GPT-5.5'i geride bırakan, ağırlıkları 27 Temmuz'da yayımlanacak 2,8 trilyon parametreli açık ağırlıklı Kimi K3 modelini duyurdu.

İzlenmesi gereken eğilim: Önde gelen laboratuvarlar, önceki sürümleri açık olsa bile en yeni modellerini giderek daha fazla yalnızca API üzerinden sunuyor. Wan, 2.5 sürümünde kapalı hâle geldi ve 2.7'ye kadar kapalı kaldı; Qwen-Image 2.0'da, Hunyuan3D ise 2.5'te kapandı. Açık ekosistem hâlâ canlı ve hızla ilerliyor, ancak “en yeni sürüm açıktır” varsayımı artık güvenli değil. Bu nedenle bir model etrafında işlem hattı oluşturmadan önce ağırlıkların erişilebilirliğini kontrol edin.

Gidişat açık: Kapalı modellerde bulunan her yetenek, 6-12 ay sonra açık modellerde de ortaya çıkıyor. Asıl soru, açık modellerin yeterince iyi olup olmayacağı değil. Çoğu kullanım için zaten yeterince iyiler. Asıl soru, ne kadar hızlı varsayılan seçenek hâline gelecekleri.

Bunun içerik üreticileri için anlamı şu: Eskiden kurumsal bütçeler veya aylık abonelikler gerektiren araçlar artık doğrudan çalıştırabileceğiniz şeylere dönüşüyor. Kendi donanımınızda. Başka kimseden izin almadan.

Değişim bu. İnşa etmeye çalıştığımız gelecek de bu.


Sık Sorulan Sorular

Oyun varlıkları oluşturmak için en iyi açık kaynaklı yapay zekâ modeli hangisidir?

Varlık türüne göre değişir. 3D modeller için Hunyuan3D, 2026'daki en güçlü açık seçenektir. 2D çizimler ve dokularda kalite açısından FLUX öndedir. Ses efektleri ve müzikte ise açık ses modelleri hızla arayı kapattı. Oyunlar birçok farklı varlık türüne ihtiyaç duyduğu için tek bir “en iyi” model yoktur; bu nedenle içerik üreticilerinin çoğu tek bir modele güvenmek yerine birkaç modeli zincir hâlinde kullanır.

Açık kaynaklı yapay zekâ modelleri kapalı API'lerin yerini alacak kadar iyi mi?

2026'da oyun varlığı üretme işlerinin çoğu için evet. Açık modeller artık görüntü, 3D ve ses üretiminde kapalı API'lerle aynı seviyeye ulaştı. Ayrıca bunları çağrı başına ücret veya beklenmedik fiyat değişiklikleri olmadan kendi donanımınızda çalıştırabilirsiniz. Kapalı modeller, uzun video üretimi gibi birkaç ileri düzey görevde hâlâ önde olsa da aradaki fark genellikle 6 ila 12 ay içinde kapanıyor.

Bu üretken yapay zekâ modellerini kendi GPU'mda çalıştırabilir miyim?

Birçoğunu çalıştırabilirsiniz. Görüntü ve ses modelleri, RTX 4090 gibi tek bir tüketici GPU'sunda rahatça çalışır. Daha büyük video ve 3D modelleri daha fazla VRAM gerektirir ve çoğunlukla A100 sınıfı bir bulut GPU'suna ihtiyaç duyar. Yukarıdaki donanım bölümünde her modelin gereksinimleri listelenmiştir; böylece karar vermeden önce planlama yapabilirsiniz.

Yapay zekâ ile oluşturulan varlıkları ticari bir oyunda kullanmak yasal mı?

Kendi çalıştırdığınız açık kaynaklı modeller için genellikle evet, ancak bu durum modelin lisansına ve eğitim verileriyle ilgili varsayımlarınıza bağlıdır. Her zaman ilgili modelin lisansını kontrol edin ve platformunuzun gerektirdiği durumlarda yapay zekâ ile oluşturulmuş içerikleri açıklayın. Bu konuyu nasıl ele aldığımızı öğrenmek için Yapay zekâ ile oluşturulan içerik politikamıza bakın.


Ek Okumalar

Hemen deneyinBu modellerin yalnızca varlık değil, oyun da oluşturduğunu görün

Üretim modellerinin çıktıları oynanabilir olduğunda çok daha eğlencelidir.

Ücretsiz oluştur →Ücretsiz, tarayıcınızda çalışır, kurulum yok.