Skip to content

Model AI Generatif Sumber Terbuka Terbaik untuk Game (2026)

Terakhir diperbarui: Juli 2026.

Begini kenyataannya tentang AI generatif. Selama bertahun-tahun, model terbaik tersembunyi di balik kunci API dan harga yang tidak terduga. Anda membangun alur kerja dengan suatu alat, mulai terbiasa, lalu suatu pagi menerima email yang mengatakan bahwa harganya berubah. Atau lebih buruk lagi, perusahaannya mengubah arah sepenuhnya.

Hal itu berubah pada akhir 2024. Tencent, Alibaba, dan DeepSeek mulai merilis model yang benar-benar bisa Anda unduh. Model yang mampu menandingi alternatif tertutup. Dan tiba-tiba, kreator memiliki pilihan yang tidak bergantung pada model bisnis pihak lain.

Bagaimana jika Anda bisa menghasilkan video, aset 3D, musik, dan suara, semuanya dengan model yang Anda kendalikan? Itulah posisi kita sekarang. Panduan ini membahas apa yang benar-benar tersedia, apa yang berfungsi, dan apa yang bisa mulai Anda gunakan hari ini.

Pembuatan Video

Selama bertahun-tahun, pembuatan video identik dengan Runway atau Pika: platform tertutup, biaya langganan, dan batasan atas apa yang bisa Anda lakukan dengan hasilnya. Sekarang? Anda bisa menjalankan model sebanding di perangkat keras sendiri.

Pembuatan teks-ke-video HunyuanVideo, keluaran 720p dari model video sumber terbuka terdepan

ModelOrganisasiParameterSpesifikasiPerangkat kerasBiaya
HunyuanVideoTencent13B720p, teks+gambar80GB~$0.20
HunyuanVideo-1.5Tencent8.3B480p-1080p, teks+gambar14GB~$0.05
Mochi 1Genmo10B480p@30fps12GB+~$0.10
LTX-VideoLightricks768x512, waktu nyata12GB~$0.02
LTX-2Lightricks19B4K, audio tersinkronisasiKelas atas~$0.30
Wan 2.1Alibaba1.3-14B480p-720p8GB+~$0.03
Wan 2.2Alibaba27B MoE (14B aktif)720p, MoE8GB+~$0.03
CogVideoX1.5-5BTsinghua5B1360x768@16fps, hingga 10 dtk12GB~$0.04
SkyReels-V3Skywork14-19BDigerakkan audio, referensi-ke-video, V2VKelas atas~$0.10
Step-Video-T2VStepFun30BT2V terbuka terbesar, 204 bingkaiKelas atas~$0.15
Open-Sora 2.0HPC-AI11BIntegrasi FluxKelas atas~$0.20

Bobot: HunyuanVideo ↗ · Mochi 1 ↗ · Wan 2.1 ↗ · Open-Sora ↗

Lihat contoh: Galeri HunyuanVideo ↗ · Contoh Mochi ↗ · Contoh CogVideoX ↗

Artinya bagi kreator

HunyuanVideo mengungguli Runway Gen-3 dalam evaluasi profesional, dan sepenuhnya terbuka. Kekurangannya? Anda membutuhkan perangkat keras yang serius. A100 atau H100 dengan VRAM 80GB. Bagi kebanyakan dari kita, itu berarti menyewa GPU cloud saat dibutuhkan.

HunyuanVideo-1.5 mengubah perhitungan kebutuhan perangkat keras. Tencent merilisnya pada November 2025 sebagai model terbuka dengan 8,3 miliar parameter yang dapat berjalan pada GPU konsumen 14GB, dilengkapi teks-ke-video dan gambar-ke-video pada 480p/720p serta peningkatan resolusi opsional ke 1080p. Mekanisme Selective and Sliding Tile Attention (SSTA) baru membuat kecepatan inferensinya sekitar dua kali lipat dibandingkan HunyuanVideo asli. Jika Anda menginginkan kualitas HunyuanVideo tetapi tidak bisa membenarkan pembelian kartu 80GB, inilah versi yang benar-benar dapat Anda jalankan di rumah.

Mochi 1 adalah model yang benar-benar bisa Anda jalankan. GPU 12GB, setara kelas RTX 3060, dapat menanganinya dengan baik. Hasilnya benar-benar kreatif, dengan kualitas artistik yang khas. Ketepatannya belum menyamai HunyuanVideo, tetapi Anda mengendalikan prosesnya.

LTX-2 mulai menjadi sangat menarik untuk game. Ini adalah model terbuka pertama yang menghasilkan audio tersinkronisasi bersama video. Bayangkan adegan sinematik dengan suara yang langsung... cocok. Tanpa sinkronisasi pascaproduksi. Lightricks membuka bobot lengkap, kode inferensi, dan kode pelatihannya pada Januari 2026, dengan keluaran 4K native hingga 50fps dan audio tersinkronisasi hingga 20 detik. Ada satu catatan lisensi: bobot terbuka LTX-2 gratis untuk penggunaan akademis dan hanya gratis untuk penggunaan komersial oleh perusahaan dengan pendapatan tahunan di bawah $10 juta, jadi periksa ambang tersebut sebelum membangun bisnis di atasnya.

SkyReels-V3 (Skywork, Januari 2026) adalah lini terbuka baru yang patut diperhatikan. Ini merupakan model multimodal terpadu yang mampu membuat video berbasis audio, referensi-ke-video, dan video-ke-video dalam varian 14B dan 19B, sehingga sangat kuat ketika Anda membutuhkan karakter atau gambar referensi untuk mengarahkan pengambilan gambar. Step-Video-T2V (StepFun) adalah model teks-ke-video terbuka terbesar dengan 30B parameter dan dirilis di bawah lisensi MIT yang sederhana, layak diketahui jika lisensi permisif lebih penting bagi Anda daripada kemampuan menjalankannya pada GPU kecil.

Wan 2.1 dapat berjalan pada laptop gaming. GPU 8GB cukup untuk varian yang lebih kecil. Jika Anda ingin membuat prototipe dengan pembuatan video tetapi tidak bisa membenarkan kebutuhan perangkat kerasnya, inilah jalan masuk Anda.

Wan 2.2 (Alibaba, Juli 2025) adalah model video sumber terbuka pertama yang dibangun dengan desain Mixture-of-Experts: total 27B parameter dengan hanya 14B yang aktif pada setiap langkah. Model ini tersedia sebagai teks-ke-video (T2V-A14B), gambar-ke-video (I2V-A14B), dan varian hibrida 5B yang dapat berjalan pada GPU konsumen, semuanya di bawah Apache 2.0 untuk penggunaan komersial.

Ada satu hal yang perlu diketahui: Wan 2.2 masih menjadi versi Wan terbuka terakhir. Wan 2.5 (September 2025), 2.6 (Desember 2025), dan 2.7 (April 2026) yang lebih baru menambahkan audio tersinkronisasi, 1080p, dan kontrol bingkai yang lebih presisi, tetapi hanya tersedia melalui API tanpa bobot publik. Jika hosting mandiri penting bagi Anda, 2.2 adalah batas tertingginya. LTX-2 adalah model terbuka yang sebaiknya dipilih ketika Anda membutuhkan 4K dan audio tersinkronisasi.

Alur kerja yang masuk akal: Mochi 1 atau Wan 2.1 untuk membuat prototipe secara lokal. HunyuanVideo-1.5 atau LTX-2 pada GPU cloud ketika Anda membutuhkan kualitas akhir.

Pembuatan Gambar

Di bidang inilah sumber terbuka sudah menang. Model yang bisa Anda unduh hari ini benar-benar mampu bersaing dengan Midjourney. Bukan “hampir sama bagusnya”, tetapi benar-benar kompetitif.

Contoh hasil FLUX.1Contoh FLUX.1, kualitas fotorealistis dari model berlisensi Apache 2.0

ModelOrganisasiDirilisParameterFitur UtamaLisensiBiaya/gambar
FLUX.1 [schnell]Black Forest LabsAgu 202412BPembuatan 4 langkah, cepatApache 2.0~$0.001
FLUX.1 [dev]Black Forest LabsAgu 202412BKualitas mendekati ProNonkomersial~$0.002
SD 3.5 LargeStability AIOkt 20248BRendering teks, beragam gayaLisensi Stability~$0.002
SD 3.5 Large TurboStability AIOkt 20248B4 langkah, cepatLisensi Stability~$0.001
HiDream-I1HiDream.aiApr 202517BKualitas tinggi, varian Full/Dev/FastMIT~$0.002
CogView4Tsinghua / ZhipuMar 20256BTeks Mandarin native, hingga 2048pxApache 2.0~$0.002
Qwen-ImageAlibabaAgu 202520BRendering dan penyuntingan teks terbaik di kelasnyaApache 2.0~$0.002
FLUX.2Black Forest LabsNov 202532BTeks+penyuntingan, 4MP, multireferensidev: Nonkomersial / klein 4B: Apache 2.0~$0.003
Ideogram 4.0IdeogramJun 20269.3BPekerjaan desain, rendering teks, kontrol tata letak JSONNonkomersial~$0.002

Coba langsung: Demo FLUX.1 schnell ↗ · Demo SD 3.5 Large ↗ · GitHub (FLUX) ↗

Lihat contoh: Galeri FLUX ↗ · Galeri FLUX LoRA ↗ · Contoh Replicate ↗

Untuk membuat aset game

FLUX.1 [schnell] adalah model yang perlu Anda kenal. Lisensi Apache 2.0 berarti Anda bisa merilis game komersial tanpa mencemaskan masalah lisensi. Model ini menghasilkan gambar hanya dalam 4 langkah, sehingga Anda dapat melakukan iterasi dengan cepat. Jelaskan yang Anda inginkan, lihat hasilnya, sesuaikan, lalu ulangi.

SD 3.5 Large akhirnya mampu menangani rendering teks dengan benar. Versi sebelumnya merusak teks apa pun yang Anda coba sertakan. Hal ini penting untuk mockup UI, papan tanda dalam game, layar judul, dan di mana pun Anda membutuhkan kata-kata yang terbaca dalam gambar.

FLUX.2 (Black Forest Labs, November 2025) adalah penerus yang lebih besar: model 32B yang menangani teks-ke-gambar dan penyuntingan gambar dalam satu checkpoint, dengan konsistensi karakter/gaya multireferensi yang kuat serta rendering teks yang andal hingga 4 megapiksel. FLUX.2 [dev] berbobot terbuka menggunakan lisensi nonkomersial, tetapi FLUX.2 [klein] hasil distilasi ukuran (Januari 2026) merilis versi 4B di bawah Apache 2.0, menghasilkan gambar dalam waktu kurang dari satu detik, dan berjalan dengan sekitar 8GB VRAM. Jadi, tetap ada opsi yang aman secara komersial untuk merilis karya seni game. Gunakan klein 4B secara khusus: klein 9B yang lebih besar tetap berada di bawah lisensi FLUX nonkomersial. Pipeline terkuantisasi memungkinkan [dev] berjalan pada GPU 18-24GB.

Ada dua opsi terbuka lain yang patut diketahui. Chroma1-HD (8.9B, Apache 2.0) adalah turunan FLUX.1-schnell yang sepenuhnya terbuka, sehingga menjadi cara yang aman secara komersial untuk memperoleh kualitas keluarga FLUX tanpa lisensi [dev]. OmniGen2 (Apache 2.0) adalah model terpadu yang menangani teks-ke-gambar sekaligus penyuntingan berbasis instruksi, sehingga menjadi jalur tercepat saat Anda mengiterasi aset yang sudah ada (“buat pedangnya bersinar biru”), alih-alih membuatnya dari awal.

Qwen-Image (Alibaba, Agustus 2025) adalah model terbuka yang sebaiknya dipilih ketika karya seni Anda membutuhkan teks yang dapat dibaca, seperti papan tanda, UI, poster, atau label item. Ini adalah model 20B berlisensi Apache 2.0 dengan rendering teks terbaik di kelasnya dan varian penyuntingan berbasis instruksi yang kuat. Karena itu, model ini aman untuk penggunaan komersial dan sangat bagus dalam menangani hal yang masih sering gagal dilakukan sebagian besar model gambar. Pembaruan Desember 2025, Qwen-Image-2512, meningkatkan realisme manusia dan tata letak teks serta tetap menggunakan lisensi Apache 2.0, jadi gunakan checkpoint tersebut jika Anda melakukan hosting mandiri. Qwen-Image-2.0 yang lebih baru (Februari 2026) hanya tersedia melalui API.

Ideogram 4.0 (Juni 2026) adalah rilis berbobot terbuka pertama dari Ideogram: diffusion transformer 9.3B yang dibuat untuk pekerjaan desain, dengan rendering teks multibahasa yang kuat serta kontrol eksplisit atas tata letak dan warna melalui prompt JSON terstruktur. Ada satu hal yang perlu diperhatikan sebelum Anda membangun sesuatu dengannya: kode inferensinya menggunakan Apache 2.0, tetapi bobotnya berada di bawah lisensi nonkomersial. Jadi, ini merupakan alat untuk riset dan pembuatan prototipe kecuali Anda membeli lisensi komersial.

Ekosistem di sekitar Stable Diffusion masih belum tertandingi. ControlNet untuk komposisi presisi. Inpainting untuk perbaikan. Fine-tuning LoRA untuk gaya khusus. FLUX mulai mengejar, tetapi jika Anda membutuhkan kustomisasi mendalam saat ini, kematangan perangkat SD memberi Anda lebih banyak pilihan.

Begini cara saya memandangnya: untuk tekstur dan sprite, keduanya bisa digunakan. Untuk concept art dengan persyaratan gaya tertentu, gunakan SD 3.5 dengan LoRA. Untuk kualitas murni dalam rilis komersial, gunakan FLUX schnell.

Pembuatan 3D

Jika Anda pernah menghabiskan delapan jam untuk memodelkan properti yang hanya muncul selama tiga detik dalam game, bagian ini ditujukan untuk Anda. Pembuatan 3D telah beralih dari “riset menarik” menjadi alat produksi nyata sejak beberapa waktu lalu, dan pada 2026 model terbukanya benar-benar bagus. Anda dapat mengubah sketsa menjadi mesh bertekstur dalam waktu kurang dari satu menit.

Contoh pembuatan 3D TRELLISTRELLIS menghasilkan mesh 3D bertekstur dengan material PBR dari satu gambar

ModelOrganisasiDirilisFitur UtamaKeluaranBiaya/mesh
TRELLIS.2-4BMicrosoftDes 20254B parameter, PBR native, hingga 1536³Mesh bertekstur dengan normal~$0.03
Hunyuan3D 2.1TencentJun 2025PBR siap produksi, bobot lengkap + kode pelatihanMesh bertekstur berketepatan tinggi~$0.05
SAM 3DMetaNov 2025Satu gambar ke 3D (objek + tubuh manusia)Mesh dari satu foto~$0.02
Stable Fast 3DStability AIAgu 2024Satu gambar → mesh dalam ~0,5 dtkMesh bertekstur cepat~$0.001
TripoSGVAST-AIMar 2025Pembuatan bentuk rectified-flow 1.5BMesh berkualitas tinggi~$0.01
TripoSRStability / Tripo2024Rekonstruksi cepat dari satu gambarMesh (tanpa tekstur)~$0.001
UniRigTsinghua / Tripo2025Rig otomatis: kerangka + bobot skinningMesh dengan rig yang dapat dianimasikan~$0.01
Coba langsung: demo TRELLIS.2 ↗ · demo Hunyuan3D ↗ · demo InstantMesh ↗

Lihat contoh: halaman proyek TRELLIS.2 ↗ · galeri 3D AI Studio ↗

Alur kerja yang benar-benar efektif

Pendekatan yang saat ini cocok bagi para kreator adalah merangkai beberapa model. Mulailah dengan sebuah gambar, baik hasil generasi maupun foto, tidak masalah. Proses gambar tersebut dengan Stable Zero123 atau Wonder3D untuk mendapatkan beberapa sudut pandang. Masukkan hasilnya ke InstantMesh atau TripoSR untuk membuat mesh. Kemudian gunakan TRELLIS.2 atau Hunyuan3D untuk menghasilkan material yang layak.

TRELLIS.2 dari Microsoft adalah pemimpin baru untuk aset siap produksi. Model ini mampu menangani geometri yang membuat model lain gagal: permukaan tipis, lubang, dan topologi kompleks. Versi dengan 4 miliar parameter menghasilkan mesh dengan tekstur PBR sungguhan, bukan sekadar warna verteks yang menyamar sebagai material.

Stable Fast 3D mengutamakan kecepatan. Hanya perlu sekitar setengah detik untuk mengubah gambar menjadi mesh. Mesh-nya masih perlu dirapikan dan diberi tekstur, tetapi untuk membuat prototipe? Untuk mengetahui apakah sebuah ide layak sebelum Anda menghabiskan waktu berjam-jam? Tidak tertandingi. TripoSG adalah peningkatan berikutnya saat Anda menginginkan geometri yang lebih bersih dari satu gambar.

Hunyuan3D 2.1 adalah model terbuka Tencent yang patut digunakan: model ini menyediakan bobot lengkap dan kode pelatihan, beserta pembuatan tekstur PBR kelas produksi. Perhatikan penamaannya karena sering membingungkan orang. Hunyuan3D 2.5, 3.0, dan 3.1 memang ada, tetapi semuanya hanya tersedia melalui API tanpa bobot publik. Jadi, untuk hosting mandiri, generator dasarnya masih berhenti di versi 2.1. Tencent juga membuka dua ekstensi berguna yang dibangun di atas 2.1: Hunyuan3D-Omni menambahkan kendali multikondisi (point cloud, voxel, kerangka, bounding box), sedangkan Hunyuan3D-Part menguraikan mesh menjadi bagian-bagian yang dapat diedit. Lisensinya juga mengecualikan Uni Eropa, Britania Raya, dan Korea Selatan, jadi periksa ketentuannya sebelum merilis karya Anda di wilayah tersebut.

SAM 3D (Meta, November 2025) adalah pendekatan terbaru: satu foto diubah menjadi mesh 3D, dengan model terpisah untuk objek dan tubuh manusia. Jika digabungkan dengan teknologi segmentasi Meta, Anda dapat mengisolasi suatu objek dalam gambar dan merekonstruksi objek itu saja.

UniRig (Tsinghua dan Tripo, MIT) menutup celah yang langsung dihadapi semua orang setelah mendapatkan mesh: rigging. Model ini secara otomatis membuat kerangka yang valid dan bobot skinning untuk mesh masukan, sehingga karakter hasil generasi benar-benar dapat dianimasikan alih-alih hanya menjadi properti statis. Padukan dengan teknologi animasi otomatis SOMA-X dari NVIDIA, dan karakter yang sepenuhnya dihasilkan serta di-rig tidak lagi sekadar demo riset.

Berikut ekspektasi realistis bagi kreator indie: buat concept art dengan FLUX, proses menggunakan InstantMesh untuk memperoleh geometri, lalu buat teksturnya di Blender atau gunakan TRELLIS untuk PBR otomatis. Anda akan menghabiskan sekitar 30–60 menit per aset, bukan 4–8 jam. Bukan tanpa waktu sama sekali, tetapi perbedaannya nyata.

Audio dan Musik

Generasi audio belum menyamai perkembangan gambar dan video. Namun, teknologinya sudah cukup untuk mengubah cara Anda bekerja, terutama saat membuat prototipe dan efek suara.

Contoh musik hasil generasi AI. Jelaskan suasana yang Anda inginkan, lalu dapatkan musik yang sesuai

ModelOrganisasiDirilisFungsinyaLisensiBiaya/30 dtk
ACE-Step 1.5StepFun/ACE StudioJan 2026Musik hingga ~4 menit dengan cepat, 19 bahasa, kloning suaraMIT~$0.02
Stable Audio 3.0Stability AIMei 2026Lagu hingga ~6 menit; model terbuka Small, Small-SFX, dan MediumStability Community~$0.02
YuEMAPJan 2025Lagu lengkap dari lirik, vokal + iringanApache 2.0~$0.05
MusicGenMeta2023Teks-ke-musik, dapat dikendalikankode MIT / bobot CC-BY-NC~$0.01
DiffRhythm 2ASLP-labFeb 2026Generasi lagu lengkap dengan cepatApache 2.0~$0.02
Magenta RealTimeGoogleJun 2025Musik real-time yang dapat diarahkan dengan promptkode Apache / bobot CC-BY~$0.02

Coba langsung: demo MusicGen ↗ · arena eksperimen AudioCraft ↗

Lihat contoh: contoh MusicGen ↗ · contoh AudioGen ↗

Yang benar-benar dapat Anda gunakan dalam rilisan

MusicGen dari Meta masih menjadi pilihan praktis untuk membuat prototipe audio gim. Jelaskan suasana yang Anda inginkan, dapatkan musik yang sesuai, dan model ini berjalan lancar pada GPU 12 GB. Ada satu hal penting terkait lisensi: kode MusicGen berlisensi MIT, tetapi bobot modelnya berlisensi CC-BY-NC (nonkomersial). Jadi, gunakan untuk membuat prototipe, lalu beralihlah ke model berlisensi komersial seperti ACE-Step atau Stable Audio untuk karya yang akan Anda rilis.

Model efek suara terbuka Stable Audio (Small-SFX) mampu menangani suara langkah kaki, derit pintu, angin latar, dan suara mekanis. Model ini berjalan secara lokal dan dirilis dengan lisensi komunitas Stability, sehingga menjadi pilihan SFX terbuka saat Anda membutuhkan suara yang benar-benar dapat digunakan secara komersial. Model ini layak dipilih karena model SFX terbuka lainnya memiliki batasan: AudioGen dari Meta berlisensi CC-BY-NC dan TangoFlux menggunakan lisensi komunitas nonkomersial Stability, sehingga keduanya hanya cocok untuk prototipe gim yang nantinya akan dirilis.

Magenta RealTime (Google) tampil unik dalam arti terbaik: ini adalah satu-satunya model berbobot terbuka yang dirancang untuk musik real-time dan dapat terus diarahkan dengan prompt. Alih-alih merender trek final, model ini menghasilkan musik secara langsung dan memungkinkan Anda mengarahkannya selagi diputar. Bentuknya sangat sesuai untuk soundtrack gim adaptif yang berubah mengikuti tindakan pemain. Kodenya berlisensi Apache 2.0 dan bobotnya CC-BY; keduanya dapat digunakan secara komersial.

YuE benar-benar menarik. Ini adalah model terbuka pertama yang menghasilkan lagu lengkap dengan vokal. Lagu tema. Musik latar dengan nyanyian sungguhan. Kualitasnya bervariasi, tetapi jauh melampaui apa pun yang dapat Anda unduh dan jalankan sendiri.

ACE-Step adalah model musik terbuka yang kini perlu Anda ketahui, dan perkembangannya sangat cepat: lini 1.5 (Januari 2026, dengan varian XL 5B yang lebih besar) menggantikan rilis awal Mei 2025 dan kini berlisensi MIT. Model ini dapat menghasilkan musik berdurasi beberapa menit dengan cepat, mendukung 19 bahasa, serta mampu menangani kloning suara, remix, dan penyuntingan lirik. Untuk pembuatan prototipe gim, model ini menutup banyak kekurangan yang masih ditinggalkan YuE dan MusicGen.

Stable Audio 3.0 (Mei 2026) merupakan pembaruan yang lebih besar untuk suara. Model ini dapat menghasilkan lagu berdurasi hingga sekitar enam menit, dan Stability merilis bobot terbuka untuk tiga dari empat variannya: Small dan model efek suara khusus Small-SFX dapat dijalankan langsung di perangkat, sedangkan Medium menawarkan struktur musik yang lebih baik dan durasi trek penuh. Hanya model Large yang tetap tersedia melalui API saja. Small-SFX kini menjadi opsi terbuka terkuat khusus untuk SFX gim. Seluruh keluarga model ini dilatih menggunakan data berlisensi, sehingga landasan hukumnya lebih jelas dibandingkan generator musik yang masih menghadapi sengketa hukum.

Pendapat jujurnya: kesenjangan antara model terbuka dan tertutup (Suno, Udio) memang menyempit, tetapi masih nyata untuk lagu vokal lengkap. Berbagai alat tertutup tersebut juga masih menghadapi sengketa terkait data pelatihan. Untuk efek suara, model terbuka—khususnya model SFX Stable Audio—benar-benar kompetitif. Untuk lagu yang ingin Anda rilis, bersiaplah melakukan banyak iterasi, atau libatkan musisi untuk produksi final dan gunakan alat-alat ini untuk semua kebutuhan lainnya.

Ucapan dan Suara

Generasi suara kini sudah jauh melampaui taraf "cukup bagus untuk gim", dan hal itu mengubah apa yang dapat diwujudkan oleh tim kecil.

Narasi gim hasil generasi AI dengan ucapan alami, tempo yang tepat, dan emosi

ModelOrganisasiDirilisFitur UtamaLisensiBiaya/menit
Qwen3-TTSAlibabaJan 2026Kloning suara dari 3 dtk, desain suara, 10 bahasaApache 2.0~$0.002
ChatterboxResemble AI2025Kendali emosi, kloning dari ~5 dtk, 23 bahasaMIT~$0.003
CSMSesame AIMar 2025Alur percakapan, jeda alamiApache 2.0~$0.005
Fish Speech 1.5Fish Audio2024Kloning zero-shot dari 10–30 dtkkode Apache / bobot CC-BY-NC-SA~$0.002
OpenVoice V2MyShell/MITApr 2024Kendali emosi/aksenMIT~$0.003
XTTS-v2Coqui (komunitas)202417 bahasa, kloning suaraCPML (nonkomersial)~$0.005

Dengarkan contoh: suara Fish Audio ↗ · demo OpenVoice ↗

Membuat NPC terdengar seperti manusia

CSM (Conversational Speech Model) dari Sesame dibuat khusus untuk dialog. Model ini menghasilkan jeda alami. Perubahan intonasi. Irama percakapan yang sesungguhnya. Sebagian besar TTS terdengar seperti seseorang sedang membaca naskah, dan Anda dapat langsung menyadarinya. CSM terdengar seperti seseorang yang benar-benar berbicara. Perbedaan itu lebih penting daripada yang mungkin Anda kira.

Qwen3-TTS (Alibaba, Januari 2026) adalah pilihan utama untuk proyek komersial. Seluruh keluarga model ini berlisensi Apache 2.0, mampu mengkloning suara dari audio referensi berdurasi sekitar 3 detik, mendukung 10 bahasa, serta memungkinkan desain suara berbasis deskripsi. Dengan demikian, Anda dapat menentukan suara NPC menggunakan teks biasa tanpa harus mencari rekaman referensi. Model 0.6B dan 1.7B dapat dijalankan pada perangkat keras yang relatif sederhana.

Chatterbox (Resemble AI) adalah pilihan untuk suara ekspresif, dan lisensi MIT-nya memungkinkan Anda menggunakannya dalam rilisan. Model ini dapat mengkloning suara dari audio berdurasi sekitar 5 detik, berjalan dengan latensi di bawah 200 md, mencakup 23 bahasa, dan menjadi model terbuka pertama yang menawarkan kendali penguatan emosi. Dengan begitu, NPC benar-benar dapat terdengar marah atau ketakutan alih-alih datar. Dua opsi lain berlisensi Apache 2.0 mengisi kebutuhan khusus: Orpheus (Canopy) menerima tag emosi inline seperti <laugh> dan <sigh> yang mudah dipetakan ke seruan singkat NPC, serta menyediakan varian 150M untuk perangkat keras kelas bawah; sementara Dia (Nari Labs) dirancang untuk dialog dengan banyak pembicara dan dapat menyertakan suara nonverbal seperti batuk dan tawa dalam satu proses.

Fish Speech dan OpenVoice menangani kloning suara. Rekam suara pengisi suara selama 10–30 detik, lalu hasilkan dialog tanpa batas dengan suara tersebut. Bayangkan artinya: Anda dapat menyewa pengisi suara untuk dialog utama, lalu memperluas penampilannya hingga mencakup ratusan variasi dan dialog latar. Satu catatan lisensi untuk Fish Speech: kodenya terbuka, tetapi bobot versi 1.5 berlisensi CC-BY-NC-SA, sehingga hanya cocok sebagai alat pembuatan prototipe. Untuk gim yang akan dirilis, gunakan OpenVoice (MIT) atau Qwen3-TTS (Apache 2.0).

NVIDIA ACE (tidak sepenuhnya terbuka, tetapi patut diketahui) kini mendukung Qwen3-8B untuk menjalankan NPC langsung di perangkat. LLM lokal + TTS lokal + sinkronisasi bibir, semuanya berjalan pada GPU konsumen. Inilah rangkaian teknologi untuk percakapan NPC real-time yang tidak memerlukan panggilan ke cloud.

Pendekatan yang masuk akal bagi kreator indie: pekerjakan pengisi suara untuk karakter utama dan dialog yang paling penting. Gunakan Qwen3-TTS atau OpenVoice untuk memperluas cakupan dialog latar, variasi, dan seluruh dialog insidental yang jika tidak akan dibiarkan tanpa suara atau terlalu mahal untuk diproduksi.

Model Dunia dan Simulasi Gim

Di sinilah segalanya menjadi benar-benar aneh sekaligus sangat menarik. Model-model ini tidak menghasilkan aset statis. Model ini menghasilkan pengalaman yang terasa seperti gim.

🎮 Mainkan Oasis: Minecraft Hasil Generasi AI
Generasi dunia real-time tanpa game engine, hanya prediksi AI
ModelOrganisasiDirilisFungsinyaStatusBiaya/frame
DIAMONDRiset2024Model dunia berbasis difusi, simulasi AtariBobot terbuka~$0.001
OasisDecart/EtchedOkt 2024Generasi Minecraft real-timeBobot 500M terbuka~$0.002
MineWorldMicrosoftApr 2025Minecraft real-time, alternatif terbuka untuk OasisMIT~$0.002
Hunyuan-GameCraftTencentAgu 2025Video gim interaktif, kendali keyboard/mouseTencent Community~$0.005
GameGen-XRiset2024Generasi video dunia terbukaKode + dataset terbuka~$0.005
NVIDIA CosmosNVIDIAOkt 2025Simulasi AI fisik (Predict2.5)NVIDIA Open Model License~$0.01
Matrix-Game 3.0SkyworkMar 2026Dunia interaktif 720p real-time, memori jangka panjangBobot terbuka~$0.005
Genie 2DeepMindDes 20243D interaktif dari gambarTidak dirilisN/A
Genie 3DeepMindAgu 2025Dunia 720p real-time, peristiwa dapat dipicu dengan promptTertutup (Project Genie)N/A

Lihat risetnya: halaman proyek DIAMOND ↗ · blog Cosmos ↗Coba: Demo langsung Oasis ↗ · Contoh Genie 2 ↗

Mengapa ini penting bagi Anda

DIAMOND membuktikan sesuatu yang mengubah cara kita memandang AI untuk game. Anda dapat melatih agen sepenuhnya di dalam dunia yang dihasilkan. Tidak diperlukan mesin game sungguhan untuk pelatihan. AI bermain di dalam imajinasi model difusi, lalu mentransfer hasilnya ke game sungguhan. Implikasinya sangat besar.

Oasis menjalankan dunia mirip Minecraft secara real-time. Bingkai demi bingkai. Tanpa mesin game, tekstur, atau aset siap pakai. Hanya transformer yang memprediksi apa yang terjadi berikutnya. Ini masih berupa bukti konsep, tetapi bayangkan ke mana arahnya. Versi dengan 500 juta parameter sudah tersedia secara terbuka.

GameGen-X merilis set data terbesar untuk video game dunia terbuka. Jika ingin melatih model sendiri atau menyempurnakan model yang sudah ada agar menghasilkan konten seperti game, inilah titik awal Anda.

NVIDIA Cosmos dibuat untuk robotika dan kendaraan otonom, tetapi model fondasi dunianya juga bisa digunakan untuk game. Model ini memahami fisika, kekekalan objek, dan hubungan spasial. Lini terbuka saat ini adalah Cosmos-Predict2.5, yang dirilis pada Oktober 2025 dengan NVIDIA Open Model License serta mengizinkan penggunaan komersial dan karya turunan.

Hunyuan-GameCraft (Tencent, Agustus 2025) adalah model dunia terbuka yang bentuknya paling langsung menyerupai game. Model ini dilatih menggunakan lebih dari satu juta rekaman dari 100+ game AAA dan menyatukan input papan ketik serta tetikus ke dalam ruang kontrol bersama, sehingga menghasilkan video game interaktif yang benar-benar dapat Anda kendalikan, bukan sekadar ditonton. Model ini menggunakan Tencent Community License yang sama seperti Hunyuan3D, dengan pengecualian yang sama untuk Uni Eropa, Inggris Raya, dan Korea Selatan, jadi periksa persyaratannya sebelum merilis produk di wilayah tersebut. MineWorld (Microsoft, MIT) adalah padanan Oasis yang sepenuhnya permisif: model dunia Minecraft real-time yang dapat Anda unduh dan jalankan tanpa mesin game.

Genie 3 (DeepMind, diumumkan Agustus 2025) adalah lompatan yang patut diperhatikan: model dunia pertama dengan interaksi real-time, yang menghasilkan dunia 720p dan dapat dijelajahi pada 24 fps serta tetap konsisten selama beberapa menit, ditambah 'peristiwa dunia yang dapat dipicu dengan prompt' untuk mengubah cuaca atau menambahkan objek sesuai perintah. Model ini dibuka untuk publik sebagai Project Genie pada Januari 2026 bagi pelanggan Google AI Ultra di AS. Bobotnya masih tertutup, tetapi model ini menunjukkan arah perkembangan dunia hasil generatif yang dapat dimainkan.

Matrix-Game 3.0 (Skywork, Maret 2026) adalah jawaban terbuka terhadap Genie. Ini merupakan model dunia interaktif dengan dukungan memori yang menayangkan 720p pada 40 fps secara real-time dan mempertahankan konsistensi adegan sepanjang rangkaian berdurasi satu menit. Versi terdistilasi 5B menangani inferensi real-time, versi MoE 2x14B yang lebih besar meningkatkan kualitas, dan bobotnya tersedia di Hugging Face dengan lisensi Apache 2.0. Jika ingin bereksperimen dengan dunia hasil generatif yang dapat dimainkan sekarang juga alih-alih menunggu DeepMind, model inilah yang benar-benar bisa Anda unduh.

Untuk pengembangan game praktis saat ini, semua ini masih merupakan alat riset. Namun, jika Anda mengerjakan konten berbasis AI, generasi prosedural, atau sekadar memikirkan ke mana arah seluruh teknologi ini, inilah garis terdepannya.

Model Bahasa Besar

LLM mendukung dialog, pembuatan misi, dan logika game. Opsi terbuka sekarang benar-benar mampu bersaing dengan GPT-4. Dua tahun lalu, hal ini belum terjadi.

ModelOrganisasiDirilisUkuranPaling Cocok UntukLisensiBiaya/1K token
DeepSeek-V3DeepSeekDes 2024MoE 671B (37B aktif)Penalaran, penggunaan umumPermisif~$0.02
DeepSeek-R1DeepSeekJan 2025Berdasarkan V3Alur penalaranPermisif~$0.03
DeepSeek-V3.2DeepSeekDes 2025Atensi renggang (DSA)Penalaran + penggunaan alatMIT~$0.02
DeepSeek-V4DeepSeekApr 2026MoE 1.6T (49B aktif)Penalaran terdepan, konteks 1MMIT~$0.02
GLM-5Zhipu / Z.aiFeb 2026MoE 744B (40B aktif)Pemrograman, agen, penggunaan alatMIT~$0.02
GPT-OSSOpenAIAgu 2025MoE 120B / 20BPenalaran, penggunaan alat, di perangkatApache 2.0~$0.01
Kimi K2Moonshot2025MoE 1T (32B aktif)Agen, pemrogramanMIT Termodifikasi~$0.02
Kimi K3MoonshotJul 2026MoE 2.8T (~50B aktif)Agen terdepan, pemrograman, konteks 1M, visiBobot terbuka (27 Jul)~$0.03
Gemma 3Google20251B-27BDi perangkat, 140 bahasa, visiGemma~$0.01
Qwen3Alibaba2025MoE 235B (22B aktif)Multibahasa, kodeApache 2.0~$0.01
Qwen3-CoderAlibaba2025MoE 480B (35B aktif)Pemrograman berbasis agen, konteks 256KApache 2.0~$0.02
Llama 4Meta2025BeragamAgen, konteks hingga 10MLlama Community~$0.01
Qwen3-VLAlibaba20252B-235BVisi + bahasaApache 2.0~$0.02
InternVL3Shanghai AI Lab20251B-78BVisi, OCR, pemetaan UIMIT~$0.02

Mulai di sini: Qwen3-8B di HuggingFace ↗ · DeepSeek-V3 di HuggingFace ↗ · GLM-5 di HuggingFace ↗

Untuk membuat game

Qwen3 adalah pilihan praktis bagi sebagian besar penggunaan dalam game. Lisensi Apache 2.0 berarti integrasinya menjadi milik Anda. Dukungan multibahasanya kuat, sesuatu yang penting jika Anda mempertimbangkan lokalisasi. Model ini juga andal dalam mengikuti instruksi terstruktur. Varian 7B dan 14B dapat dijalankan secara lokal di GPU konsumen.

DeepSeek-V3 menyamai atau mengungguli GPT-4 dalam sebagian besar tolok ukur. Arsitekturnya cerdas: hanya 37B parameter yang aktif untuk setiap token meskipun totalnya 671B. Anda membutuhkan perangkat keras kelas berat (multi-GPU), tetapi kualitasnya berada di tingkat terdepan tanpa ketergantungan pada API.

DeepSeek-V3.2 (Desember 2025) menyatukan penalaran dan penggunaan alat dalam satu model serta memperkenalkan DeepSeek Sparse Attention (DSA) agar inferensi konteks panjang lebih murah, dengan varian Speciale berkomputasi tinggi yang ditujukan untuk tolok ukur penalaran teratas. Untuk logika dan dialog game, model ini merupakan pengganti langsung V3 yang lebih kuat dan lebih mampu beroperasi sebagai agen.

DeepSeek-V4 (April 2026) kembali memajukan batas terdepan model terbuka. V4-Pro adalah MoE dengan 1,6 triliun parameter, tetapi hanya 49B yang aktif per token, jendela konteks satu juta token, dan mode penalaran yang dapat dipilih, semuanya di bawah lisensi MIT. Varian V4-Flash (total 284B, 13B aktif) mempertahankan konteks 1M dalam paket yang tidak memerlukan klaster GPU penuh. Jika saat ini Anda memilih model terbuka untuk logika misi kompleks atau konteks status game yang panjang, inilah batas tertingginya.

GLM-5 (Zhipu AI, Februari 2026) adalah model terbuka yang harus dikalahkan untuk pemrograman dan pekerjaan berbasis agen, sementara pembaruan GLM-5.2 mendorong skor penggunaan alat dan perencanaan jangka panjangnya mendekati model tertutup terdepan. Ini adalah MoE dengan 744B parameter dan 40B aktif per token, konteks 200K token, serta lisensi MIT. Z.ai adalah perusahaan model fondasi pertama yang sahamnya diperdagangkan secara publik dan menawarkan API terkelola dengan harga agresif (sekitar $1,40 per satu juta token input), tetapi bobotnya tersedia di Hugging Face jika Anda lebih suka mengelolanya sendiri. Jika game Anda mengandalkan LLM untuk penulisan skrip misi, agen pemanggil alat, atau sistem berbasis kode, GLM-5 adalah alternatif OpenAI yang kuat dan sepenuhnya dapat Anda kendalikan.

GPT-OSS (OpenAI, Agustus 2025) adalah rilis berbobot terbuka pertama dari OpenAI dan sangat sesuai dengan tema panduan ini. Model gpt-oss-120b mampu bernalar dan memanggil alat pada tingkat yang kurang lebih setara dengan o4-mini menggunakan satu GPU 80 GB, sedangkan gpt-oss-20b dapat berjalan di kartu konsumen 16 GB; keduanya menggunakan Apache 2.0. Jika Anda menginginkan model dari laboratorium Barat yang dapat dikelola sendiri untuk logika NPC atau agen pengguna alat, inilah pilihannya.

Kimi K2 (Moonshot) adalah model kelas berat berbasis agen terbuka lainnya, bersama GLM-5 dan DeepSeek. Ini merupakan MoE dengan satu triliun parameter dan 32B aktif, yang dioptimalkan secara intensif untuk pemrograman dan penggunaan alat. Lisensi MIT Termodifikasinya hanya menambahkan pembatasan di atas 100 juta pengguna bulanan, sehingga bagi pengembang indie lisensi ini pada praktiknya setara dengan MIT. Gunakan model ini ketika agen harus menyusun rencana dalam banyak langkah.

Kimi K3 (Moonshot, Juli 2026) adalah model berbobot terbuka terbesar yang pernah diumumkan dan lebih mendekati batas terdepan model tertutup dibandingkan model terbuka mana pun sebelumnya. Ini merupakan MoE dengan 2,8 triliun parameter, tetapi hanya sekitar 50B yang aktif per token (16 dari 896 pakar), konteks 1M token, serta kemampuan visi bawaan, yang dibangun di atas dua rancangan atensi baru bernama Kimi Delta Attention dan Attention Residuals. Berdasarkan angka Moonshot, model ini mengungguli Claude Opus 4.8 dan GPT-5.5 pada tolok ukur pemrograman dan agen, serta hanya tertinggal dari model proprieter terbaik. Kendalanya adalah skala: bobotnya tersedia pada 27 Juli 2026 dengan ukuran sekitar 1,4 TB dalam MXFP4, sehingga pengelolaan mandiri memerlukan klaster GPU multi-simpul, dan sebagian besar tim akan mengaksesnya melalui API dengan biaya $3 per satu juta token input dan $15 per satu juta token output. Untuk agen yang benar-benar dapat Anda jalankan sendiri, K2 tetap menjadi pilihan Moonshot yang praktis, tetapi K3 mendefinisikan ulang makna "terbuka" di kelas tertinggi.

Gemma 3 (Google) paling cocok ketika model harus berjalan di perangkat pemain atau ketika Anda membutuhkan lokalisasi yang luas. Model ini tersedia dalam ukuran 1B, 4B, 12B, dan 27B, sehingga dapat digunakan mulai dari kartu 8 GB ke atas, mendukung 140 bahasa, mampu melakukan pemanggilan fungsi, dan varian 4B ke atas juga dapat memahami gambar sehingga sekaligus berfungsi sebagai model visi kecil. Lisensi Gemma mengizinkan penggunaan komersial.

Qwen3-Coder (Alibaba) adalah model pemrograman terbuka khusus yang menggantikan lini DeepSeek-Coder lama untuk sebagian besar penggunaan. Ini adalah MoE 480B dengan 35B aktif, konteks bawaan 256K (dapat diperpanjang hingga 1M), lisensi Apache 2.0, dan berada di kelas Claude-Sonnet dalam tolok ukur pemrograman berbasis agen. Jika game Anda menghasilkan atau menjalankan kode, inilah batas tertinggi model terbuka. Keluarga Mistral dari Eropa (Devstral untuk pemrograman, Mistral Small 3.x untuk penggunaan di perangkat, keduanya Apache 2.0) adalah alternatif yang solid dan dapat dikelola sendiri.

Qwen3-VL menambahkan pemahaman visi, dengan ukuran dense dan MoE mulai dari 2B hingga 235B di bawah Apache 2.0. Berguna untuk game yang perlu menganalisis tangkapan layar, memahami konten buatan pemain dengan gambar tangan, atau memproses input kamera. Varian 8B dapat berjalan pada satu GPU. InternVL3 (Shanghai AI Lab, MIT) adalah opsi visi-bahasa terbuka kuat lainnya, terutama andal dalam OCR dan pemetaan UI, yang penting jika alat Anda perlu membaca antarmuka game; Pixtral 12B dari Mistral (Apache 2.0) merupakan pilihan lebih ringan yang aman untuk penggunaan komersial.

Untuk NPC di perangkat, yaitu karakter yang merespons secara real-time tanpa panggilan cloud, Qwen3-8B melalui NVIDIA ACE adalah jalur paling praktis saat ini. Model ini berjalan bersama game Anda di perangkat keras pemain.

Model Utilitas

Model-model ini tidak menghasilkan konten secara langsung, tetapi membuat alur kerja Anda berfungsi.

Segmentasi SAM 2SAM 2 menyegmentasikan objek apa pun dalam gambar dan video. Klik sekali untuk mendapatkan mask yang sempurna

ModelOrganisasiDirilisFungsinya
SAM 2MetaAgu 2024Menyegmentasikan apa pun dalam gambar dan video
Depth ProAppleOkt 2024Kedalaman metrik dari satu gambar
gsplatNerfstudio2024+Gaussian splatting dengan akselerasi CUDA

SAM 2 menyegmentasikan objek dalam video secara real-time. Klik sesuatu untuk mendapatkan mask yang sempurna. Berguna untuk rotoscoping, compositing, atau mengekstrak objek dari rekaman agar dapat digunakan sebagai aset game. Coba SAM 2 ↗

Depth Pro dari Apple menghasilkan peta kedalaman metrik dari satu gambar dalam waktu kurang dari satu detik. Ini membuka banyak kemungkinan: mengubah ilustrasi 2D menjadi 2.5D dengan efek paralaks, menghasilkan data kedalaman untuk rekonstruksi 3D, dan membuat normal map dari gambar datar. Depth Pro di HuggingFace ↗

gsplat adalah implementasi Gaussian splatting yang cepat. Jika Anda menangkap lingkungan nyata untuk game, baik melalui fotogrametri maupun pemindaian lingkungan, pustaka inilah yang membuatnya praktis.

Yang Benar-Benar Akan Saya Gunakan

Jika Anda memulai proyek game sekarang, berikut susunan alat yang masuk akal:

Tekstur dan sprite: FLUX.1 [schnell], Apache 2.0, iterasi cepat, kualitas yang layak dirilis

Ilustrasi konsep: SD 3.5 Large dengan LoRA untuk mengendalikan gaya

Aset 3D: Hunyuan3D 2.1 atau TRELLIS.2 untuk mesh bertekstur, SAM 3D jika titik awalnya adalah foto, lalu Blender untuk merapikannya

Rigging otomatis: UniRig atau NVIDIA SOMA-X untuk membuat kerangka dan skin pada mesh hasil generatif (keduanya terbuka), alih-alih mengandalkan Mixamo

Efek suara: Model terbuka Small-SFX dari Stable Audio, berjalan secara lokal, berlisensi komersial

Musik: ACE-Step untuk prototipe, lalu libatkan komposer untuk produksi akhir

Suara: Qwen3-TTS untuk kloning dan dialog latar (Apache 2.0), Chatterbox (MIT) ketika suatu dialog membutuhkan emosi yang nyata, dan pengisi suara untuk dialog yang benar-benar penting

Dialog NPC: Qwen3-8B secara lokal, atau LLM cloud yang dapat dikelola sendiri (GLM-5 atau DeepSeek-V4) untuk penalaran kompleks dan penggunaan alat

Video (cutscene): Mochi 1 secara lokal, HunyuanVideo di cloud ketika Anda membutuhkan kualitas akhir

Inti dari semua ini adalah bahwa kesalahan umum yang sering terjadi ialah mencoba menggunakan AI untuk segalanya. Semua ini adalah alat, bukan pengganti. Alat-alat ini memangkas bagian yang membosankan, seperti iterasi, variasi, dan aset sementara, sehingga Anda dapat mencurahkan waktu untuk keputusan kreatif yang benar-benar penting. Bagian-bagian yang membuat game Anda menjadi milik Anda sendiri.

Pemeriksaan Realitas Perangkat Keras

Mari kita bicara jujur tentang apa yang benar-benar Anda butuhkan untuk menjalankan semua ini:

VRAM 8 GB (RTX 3060, 4060): SD 1.5/SDXL, Wan 2.1 kecil, AudioGen, Fish Speech, LLM kecil (7B terkuantisasi). Ini adalah kelas laptop gaming dan sudah cukup untuk memulai. VRAM 12GB (RTX 3080, 4070): SD 3.5, FLUX schnell, Mochi 1, MusicGen, TripoSR, Qwen 14B terkuantisasi. Pada kapasitas ini, semuanya mulai terasa nyaman. Sebagian besar model yang berguna dapat dijalankan di sini.

VRAM 24GB (RTX 3090, 4090): Sebagian besar model pada presisi penuh, InstantMesh, dan LLM yang lebih besar. Jika Anda serius dengan alur kerja ini, kapasitas ini adalah pilihan ideal.

VRAM 48-80GB (A100, H100): HunyuanVideo, LTX-2, DeepSeek-V3, dan pembuatan konten berskala produksi. Ini perangkat keras kelas perusahaan. Anda tidak akan membelinya, melainkan menyewanya.

Instans cloud di RunPod, Lambda Labs, atau Modal berbiaya $2-4/jam untuk A100. Untuk penggunaan sesekali, itu lebih murah daripada membeli perangkat keras. Jalankan instans saat Anda membutuhkan kualitas akhir, lalu matikan setelah selesai.

Tentang perkiraan biaya dalam panduan ini: Biaya per pembuatan mengasumsikan inferensi yang dihosting sendiri pada GPU cloud dengan tarif sekitar $2-3/jam (A100) atau sekitar $0,40/jam (RTX 4090). Biaya sebenarnya bervariasi berdasarkan perangkat keras, optimasi, dan ukuran batch. Angka-angka ini merupakan perkiraan kasar untuk perencanaan, jadi hasil Anda mungkin berbeda.

Yang Baru pada 2026

Baru-baru ini dirilis: LTX-2 dan LTX-2.3 menghadirkan pembuatan audio dan video tersinkronisasi secara terbuka dengan dukungan 4K native. TRELLIS.2 dari Microsoft (Desember 2025) menjadi model terbuka terdepan untuk img-to-3D, sementara SAM 3D dari Meta (November 2025) membuat rekonstruksi 3D dari satu foto menjadi praktis. FLUX.2 menggantikan FLUX.1 untuk pembuatan gambar, dan SOMA-X dari NVIDIA menghadirkan auto-rigging serta retargeting terbuka. Paruh pertama 2026 mempertahankan laju tersebut: Qwen3-TTS (Januari) menyediakan ekosistem Apache 2.0 yang layak untuk kloning suara, GLM-5 dari Zhipu (Februari) merilis model coding dan agentik terbuka berukuran 744B dengan lisensi MIT, Matrix-Game 3.0 dari Skywork (Maret) menyediakan model dunia interaktif waktu nyata dengan bobot terbuka, DeepSeek-V4 (April) mendorong LLM terbuka hingga konteks 1 juta token dengan lisensi MIT, Stable Audio 3.0 (Mei) merilis tiga model audio terbuka yang dilatih menggunakan data berlisensi, dan Ideogram merilis model gambar berbobot terbuka pertamanya (Juni). Kemudian pada Juli, Moonshot mengumumkan Kimi K3, model berbobot terbuka dengan 2,8 triliun parameter yang mengungguli Claude Opus 4.8 dan GPT-5.5 dalam tolok ukur agentik, dengan bobot model dirilis pada 27 Juli.

Tren yang perlu diperhatikan: laboratorium-laboratorium terkemuka semakin sering membatasi model terbaru mereka hanya melalui API, meskipun versi sebelumnya bersifat terbuka. Wan menjadi tertutup mulai versi 2.5 dan tetap tertutup hingga 2.7, Qwen-Image menjadi tertutup mulai versi 2.0, dan Hunyuan3D mulai versi 2.5. Ekosistem terbuka tetap berkembang pesat dan dinamis, tetapi anggapan bahwa "versi terbaru pasti terbuka" tidak lagi aman. Jadi, periksa ketersediaan bobot sebelum membangun pipeline yang bergantung pada suatu model.

Arahnya jelas: setiap kemampuan yang tersedia dalam model tertutup akan muncul dalam model terbuka 6-12 bulan kemudian. Pertanyaannya bukan apakah model terbuka akan cukup bagus. Untuk sebagian besar penggunaan, model-model tersebut sudah cukup bagus. Pertanyaannya adalah seberapa cepat model terbuka menjadi pilihan utama.

Dan inilah artinya bagi para kreator: alat yang dahulu memerlukan anggaran perusahaan atau langganan bulanan kini menjadi sesuatu yang dapat Anda... jalankan begitu saja. Di perangkat keras Anda sendiri. Tanpa memerlukan izin siapa pun.

Itulah perubahannya. Itulah tujuan yang sedang kita bangun bersama.


Pertanyaan Umum

Apa model AI sumber terbuka terbaik untuk membuat aset game?

Tergantung pada jenis asetnya. Untuk model 3D, Hunyuan3D adalah opsi terbuka terkuat pada 2026. Untuk karya seni 2D dan tekstur, FLUX memimpin dalam hal kualitas. Untuk efek suara dan musik, model audio terbuka telah mengejar ketertinggalannya dengan cepat. Tidak ada satu model "terbaik" karena game membutuhkan banyak jenis aset. Karena itu, sebagian besar kreator merangkai beberapa model alih-alih hanya mengandalkan satu model.

Apakah model AI sumber terbuka cukup bagus untuk menggantikan API tertutup?

Untuk sebagian besar pekerjaan aset game pada 2026, ya. Model terbuka kini menandingi API tertutup dalam pembuatan gambar, 3D, dan audio. Anda juga dapat menjalankannya di perangkat keras sendiri tanpa biaya per panggilan atau perubahan harga yang mengejutkan. Model tertutup masih unggul dalam beberapa tugas frontier seperti video berdurasi panjang, tetapi kesenjangan tersebut biasanya tertutup dalam waktu 6 hingga 12 bulan.

Bisakah saya menjalankan model AI generatif ini di GPU sendiri?

Banyak di antaranya bisa. Model gambar dan audio dapat berjalan dengan nyaman pada satu GPU konsumen seperti RTX 4090. Model video dan 3D yang lebih besar membutuhkan lebih banyak VRAM dan sering kali memerlukan GPU cloud kelas A100. Bagian perangkat keras di atas mencantumkan kebutuhan setiap model agar Anda dapat membuat rencana sebelum memutuskan untuk menggunakannya.

Secara umum, ya, untuk model sumber terbuka yang Anda jalankan sendiri. Namun, hal ini bergantung pada lisensi model dan asumsi Anda tentang data pelatihannya. Selalu periksa lisensi model tertentu dan ungkapkan penggunaan konten buatan AI jika platform Anda mewajibkannya. Lihat kebijakan konten buatan AI kami untuk mengetahui cara kami menanganinya.


Bacaan Lanjutan

Coba sekarangLihat model-model ini membuat game, bukan sekadar aset

Model generatif lebih menyenangkan saat hasilnya dapat dimainkan.

Buat gratis →Gratis, jalan di browser, tanpa instal apa pun.