Skip to content

Melhores modelos generativos de IA de código aberto para jogos (2026)

Última atualização: julho de 2026.

A questão da IA generativa é a seguinte. Durante anos, os melhores modelos ficaram atrás de chaves de API e preços imprevisíveis. Você criava seu fluxo de trabalho em torno de uma ferramenta, se acostumava com ela e então acordava com um e-mail dizendo que os preços haviam mudado. Ou, pior ainda, que a empresa havia mudado completamente de rumo.

Isso mudou no fim de 2024. Tencent, Alibaba e DeepSeek começaram a lançar modelos que você realmente pode baixar. Modelos que rivalizam com as alternativas fechadas. E, de repente, criadores passaram a ter opções que não dependem do modelo de negócios de terceiros.

E se você pudesse gerar vídeos, assets 3D, músicas e vozes usando apenas modelos sob seu controle? É nesse ponto que estamos agora. Este guia mostra o que é real, o que funciona e o que você pode começar a usar hoje.

Geração de vídeo

Durante anos, geração de vídeo significava Runway ou Pika: plataformas fechadas, assinaturas e limites sobre o que você podia fazer com o resultado. Agora? Você pode executar modelos comparáveis em seu próprio hardware.

Geração de texto para vídeo com o HunyuanVideo, com saída em 720p pelo principal modelo de vídeo de código aberto

ModeloOrganizaçãoParâmetrosEspecificaçõesHardwareCusto
HunyuanVideoTencent13B720p, texto+imagem80GB~$0.20
HunyuanVideo-1.5Tencent8.3B480p-1080p, texto+imagem14GB~$0.05
Mochi 1Genmo10B480p@30fps12GB+~$0.10
LTX-VideoLightricks768x512, tempo real12GB~$0.02
LTX-2Lightricks19B4K, áudio sincronizadoAlto desempenho~$0.30
Wan 2.1Alibaba1.3-14B480p-720p8GB+~$0.03
Wan 2.2Alibaba27B MoE (14B ativos)720p, MoE8GB+~$0.03
CogVideoX1.5-5BTsinghua5B1360x768@16fps, até 10s12GB~$0.04
SkyReels-V3Skywork14-19BGuiado por áudio, referência para vídeo, V2VAlto desempenho~$0.10
Step-Video-T2VStepFun30BMaior T2V aberto, 204 quadrosAlto desempenho~$0.15
Open-Sora 2.0HPC-AI11BIntegração com FluxAlto desempenho~$0.20

Pesos: HunyuanVideo ↗ · Mochi 1 ↗ · Wan 2.1 ↗ · Open-Sora ↗

Veja amostras: Galeria do HunyuanVideo ↗ · Exemplos do Mochi ↗ · Amostras do CogVideoX ↗

O que isso significa para criadores

O HunyuanVideo supera o Runway Gen-3 em avaliações profissionais e é totalmente aberto. O porém? Você precisa de um hardware potente. Uma A100 ou H100 com 80GB de VRAM. Para a maioria de nós, isso significa alugar GPUs na nuvem quando necessário.

O HunyuanVideo-1.5 mudou a equação de hardware. A Tencent o lançou em novembro de 2025 como um modelo aberto de 8,3 bilhões de parâmetros que roda em uma GPU doméstica com 14GB, oferecendo geração de texto para vídeo e imagem para vídeo em 480p/720p, além de upscaling opcional para 1080p. Um novo mecanismo de atenção seletiva e em blocos deslizantes, o Selective and Sliding Tile Attention (SSTA), proporciona uma velocidade de inferência aproximadamente duas vezes maior que a do HunyuanVideo original. Se você queria a qualidade do HunyuanVideo, mas não conseguia justificar uma placa de 80GB, esta é a versão que realmente pode rodar em casa.

O Mochi 1 é o que você realmente consegue executar. Uma GPU de 12GB — território da RTX 3060 — dá conta dele tranquilamente. O resultado é genuinamente criativo, com uma qualidade artística marcante. Não chega à fidelidade do HunyuanVideo, mas o processo é todo seu.

É com o LTX-2 que as coisas ficam interessantes para jogos. Ele é o primeiro modelo aberto a gerar áudio sincronizado com o vídeo. Imagine cutscenes em que o som simplesmente... combina. Sem sincronização na pós-produção. A Lightricks disponibilizou os pesos completos, a inferência e o código de treinamento como código aberto em janeiro de 2026, com saída nativa em 4K a até 50fps e áudio sincronizado em vídeos de até 20 segundos. Uma ressalva sobre a licença: os pesos abertos do LTX-2 são gratuitos para uso acadêmico e, no uso comercial, apenas para empresas com receita anual inferior a US$ 10 milhões. Portanto, verifique esse limite antes de construir um negócio com base nele.

O SkyReels-V3 (Skywork, janeiro de 2026) é a nova linha aberta de destaque. Trata-se de um modelo multimodal unificado que oferece vídeo guiado por áudio, referência para vídeo e vídeo para vídeo em variantes de 14B e 19B. Por isso, é uma opção robusta quando você precisa que um personagem ou uma imagem de referência conduza a cena. O Step-Video-T2V (StepFun) é o maior modelo aberto de texto para vídeo, com 30B, e é distribuído sob uma licença MIT simples. Vale a pena conhecê-lo se uma licença permissiva for mais importante para você do que rodar em uma GPU pequena.

O Wan 2.1 roda em um notebook gamer. Uma GPU de 8GB funciona com as variantes menores. Se você sempre quis criar protótipos com geração de vídeo, mas não conseguia justificar o hardware, este é o seu ponto de entrada.

O Wan 2.2 (Alibaba, julho de 2025) é o primeiro modelo de vídeo de código aberto criado com uma arquitetura de mistura de especialistas: 27B de parâmetros totais, dos quais apenas 14B ficam ativos em cada etapa. Ele é disponibilizado nas versões texto para vídeo (T2V-A14B), imagem para vídeo (I2V-A14B) e em uma variante híbrida de 5B que roda em GPUs domésticas, todas sob a licença Apache 2.0 para uso comercial.

Uma ressalva importante: o Wan 2.2 ainda é a última versão aberta do Wan. Os modelos mais recentes, Wan 2.5 (setembro de 2025), 2.6 (dezembro de 2025) e 2.7 (abril de 2026), acrescentaram áudio sincronizado, 1080p e controle mais preciso dos quadros, mas estão disponíveis apenas por API, sem pesos públicos. Se a hospedagem própria é importante para você, a versão 2.2 é o limite. O LTX-2 é o modelo aberto indicado quando você precisa de 4K e áudio sincronizado.

O fluxo de trabalho que faz sentido é: Mochi 1 ou Wan 2.1 para criar protótipos localmente; HunyuanVideo-1.5 ou LTX-2 em GPUs na nuvem quando você precisar da qualidade final.

Geração de imagens

É aqui que o código aberto já venceu. Os modelos que você pode baixar hoje realmente competem com o Midjourney. Não são "quase tão bons": são verdadeiramente competitivos.

Amostras de geração do FLUX.1Amostras do FLUX.1, com qualidade fotorrealista gerada por um modelo licenciado sob Apache 2.0

ModeloOrganizaçãoLançamentoParâmetrosPrincipal recursoLicençaCusto/imagem
FLUX.1 [schnell]Black Forest Labsago. de 202412BGeração em 4 etapas, rápidaApache 2.0~$0.001
FLUX.1 [dev]Black Forest Labsago. de 202412BQualidade próxima da versão ProNão comercial~$0.002
SD 3.5 LargeStability AIout. de 20248BRenderização de texto, estilos variadosLicença da Stability~$0.002
SD 3.5 Large TurboStability AIout. de 20248B4 etapas, rápidoLicença da Stability~$0.001
HiDream-I1HiDream.aiabr. de 202517BAlta qualidade, variantes Full/Dev/FastMIT~$0.002
CogView4Tsinghua / Zhipumar. de 20256BTexto nativo em chinês, até 2048pxApache 2.0~$0.002
Qwen-ImageAlibabaago. de 202520BRenderização e edição de texto líderes da categoriaApache 2.0~$0.002
FLUX.2Black Forest Labsnov. de 202532BTexto+edição, 4MP, múltiplas referênciasdev: Não comercial / klein 4B: Apache 2.0~$0.003
Ideogram 4.0Ideogramjun. de 20269.3BDesign, renderização de texto, controle de layout por JSONNão comercial~$0.002

Experimente-os diretamente: Demonstração do FLUX.1 schnell ↗ · Demonstração do SD 3.5 Large ↗ · GitHub (FLUX) ↗

Veja amostras: Galeria do FLUX ↗ · Galeria de LoRAs do FLUX ↗ · Exemplos no Replicate ↗

Para criar assets de jogos

O FLUX.1 [schnell] é o modelo que você precisa conhecer. Sua licença Apache 2.0 significa que você pode lançar jogos comerciais sem se preocupar com complicações de licenciamento. Ele gera imagens em apenas 4 etapas, permitindo iterar rapidamente. Descreva o que deseja, veja o resultado, ajuste e repita.

O SD 3.5 Large finalmente renderiza texto de forma adequada. As versões anteriores distorciam qualquer texto que você tentasse incluir. Isso é importante para mockups de interface, placas dentro do jogo, telas de título e qualquer outro lugar em que você precise de palavras legíveis nas imagens.

O FLUX.2 (Black Forest Labs, novembro de 2025) é o sucessor maior: um modelo de 32B que realiza geração de texto para imagem e edição de imagens em um único checkpoint, com alta consistência de personagens e estilos entre múltiplas referências, além de renderização confiável de texto em resoluções de até 4 megapixels. O FLUX.2 [dev] de pesos abertos usa uma licença não comercial, mas o FLUX.2 [klein] com tamanho reduzido por destilação (janeiro de 2026) disponibiliza sua versão de 4B sob Apache 2.0, gera imagens em menos de um segundo e roda com cerca de 8GB de VRAM. Portanto, ainda existe uma opção segura para uso comercial ao lançar arte de jogos. Baixe especificamente o klein 4B: o klein 9B maior continua sob a licença não comercial do FLUX. Pipelines quantizados permitem rodar a versão [dev] em GPUs com 18-24GB.

Há mais duas opções abertas que vale a pena conhecer. O Chroma1-HD (8.9B, Apache 2.0) é um derivado totalmente aberto do FLUX.1-schnell, sendo uma maneira segura para uso comercial de obter a qualidade da família FLUX sem a licença da versão [dev]. O OmniGen2 (Apache 2.0) é um modelo unificado que reúne texto para imagem e edição baseada em instruções. Isso o torna o caminho mais rápido quando você está iterando sobre um asset existente ("faça a espada brilhar em azul"), em vez de gerar algo do zero.

O Qwen-Image (Alibaba, agosto de 2025) é o modelo aberto indicado quando sua arte precisa de texto legível, como placas, interfaces, pôsteres ou rótulos de itens. É um modelo de 20B sob Apache 2.0, com renderização de texto líder da categoria e uma poderosa variante de edição baseada em instruções. Portanto, é seguro para uso comercial e excepcionalmente bom justamente naquilo em que a maioria dos modelos de imagem ainda falha. A atualização de dezembro de 2025, Qwen-Image-2512, aprimorou o realismo humano e o layout de texto, mantendo a licença Apache 2.0. Portanto, use esse checkpoint caso pretenda hospedar o modelo por conta própria. O Qwen-Image-2.0 mais recente (fevereiro de 2026) está disponível apenas por API.

O Ideogram 4.0 (junho de 2026) é o primeiro lançamento com pesos abertos da Ideogram: um transformer de difusão de 9.3B criado para trabalhos de design, com excelente renderização de texto multilíngue e controle explícito de layout e cores por meio de prompts estruturados em JSON. Há um porém antes de você começar a usá-lo: o código de inferência está sob Apache 2.0, mas os pesos usam uma licença não comercial. Portanto, ele é uma ferramenta de pesquisa e prototipagem, a menos que você compre a licença comercial.

O ecossistema em torno do Stable Diffusion continua imbatível. ControlNet para composição precisa. Inpainting para correções. Ajuste fino com LoRA para estilos personalizados. O FLUX está diminuindo a distância, mas, se você precisa de personalização profunda hoje, a maturidade das ferramentas do SD oferece mais recursos.

Eu pensaria da seguinte forma: para texturas e sprites, qualquer um dos dois funciona. Para concept art com requisitos específicos de estilo, SD 3.5 com LoRAs. Para obter a melhor qualidade em um lançamento comercial, FLUX schnell.

Geração 3D

Se você já passou oito horas modelando um objeto que aparece no seu jogo por três segundos, esta seção é para você. A geração 3D deixou de ser uma "pesquisa interessante" para se tornar uma verdadeira ferramenta de produção há algum tempo e, em 2026, os modelos abertos estão realmente bons. Você pode transformar um esboço em uma malha texturizada em menos de um minuto.

Amostras de geração 3D do TRELLISO TRELLIS gera malhas 3D texturizadas com materiais PBR a partir de imagens individuais

ModeloOrganizaçãoLançamentoPrincipal recursoSaídaCusto/malha
TRELLIS.2-4BMicrosoftdez. de 20254B de parâmetros, PBR nativo, até 1536³Malha texturizada com mapas de normais~$0.03
Hunyuan3D 2.1Tencentjun. de 2025PBR para produção, pesos completos + código de treinamentoMalha texturizada de alta fidelidade~$0.05
SAM 3DMetanov. de 2025Imagem única para 3D (objetos + corpo humano)Malha a partir de uma foto~$0.02
Stable Fast 3DStability AIago. de 2024Imagem única → malha em ~0.5sMalha texturizada rápida~$0.001
TripoSGVAST-AImar. de 2025Geração de formas por fluxo retificado de 1.5BMalha de alta qualidade~$0.01
TripoSRStability / Tripo2024Reconstrução rápida a partir de uma única imagemMalha (sem textura)~$0.001
UniRigTsinghua / Tripo2025Rig automático: esqueleto + pesos de skinningMalha com rig pronta para animação~$0.01
Experimente diretamente: demo do TRELLIS.2 ↗ · demo do Hunyuan3D ↗ · demo do InstantMesh ↗

Veja exemplos: página do projeto TRELLIS.2 ↗ · galeria do 3D AI Studio ↗

Um fluxo de trabalho que realmente funciona

A abordagem que está dando certo para criadores no momento encadeia vários modelos. Comece com uma imagem, gerada ou fotografada, tanto faz. Passe-a pelo Stable Zero123 ou Wonder3D para obter várias vistas. Envie essas vistas ao InstantMesh ou TripoSR para gerar a malha. Depois, use o TRELLIS.2 ou Hunyuan3D para criar materiais adequados.

O TRELLIS.2, da Microsoft, é o novo líder para assets prontos para produção. Ele lida com a geometria que derruba outros modelos: superfícies finas, buracos e topologia complexa. A versão com 4 bilhões de parâmetros produz malhas com texturas PBR de verdade, não apenas cores de vértices fingindo ser materiais.

O Stable Fast 3D prioriza a velocidade. Leva cerca de meio segundo para transformar uma imagem em malha. A malha precisa de limpeza e texturização, mas para prototipagem? Para descobrir se uma ideia funciona antes de investir horas? Imbatível. O TripoSG é o próximo passo quando você quer uma geometria mais limpa a partir de uma única imagem.

O Hunyuan3D 2.1 é o modelo aberto da Tencent a ser usado: ele disponibiliza os pesos completos e o código de treinamento, com texturização PBR em nível de produção. Preste atenção aos nomes, porque eles confundem muita gente. Hunyuan3D 2.5, 3.0 e 3.1 existem, mas são disponibilizados apenas por API, sem pesos públicos; portanto, para hospedagem própria, o gerador básico ainda está limitado à versão 2.1. A Tencent abriu duas extensões úteis baseadas na 2.1: o Hunyuan3D-Omni adiciona controle por múltiplas condições (nuvem de pontos, voxel, esqueleto e caixa delimitadora), enquanto o Hunyuan3D-Part decompõe uma malha em partes editáveis. A licença também exclui a UE, o Reino Unido e a Coreia do Sul, então confira os termos antes de lançar seu projeto nessas regiões.

O SAM 3D (Meta, novembro de 2025) é a opção mais recente: uma única foto se transforma em uma malha 3D, com modelos separados para objetos e corpos humanos. Combinado ao trabalho da Meta em segmentação, ele permite isolar um objeto em uma imagem e reconstruir apenas esse objeto.

O UniRig (Tsinghua e Tripo, MIT) resolve o problema que todo mundo encontra logo depois de obter uma malha: o rigging. Ele gera automaticamente um esqueleto válido e pesos de skinning para uma malha de entrada, permitindo que um personagem gerado seja realmente animado em vez de permanecer como um elemento estático. Combine-o ao trabalho de animação automática do SOMA-X, da NVIDIA, e um personagem totalmente gerado e com rig completo deixa de ser apenas uma demonstração de pesquisa.

Esta é a expectativa realista para criadores independentes: gere arte conceitual com o FLUX, passe-a pelo InstantMesh para obter a geometria e depois crie as texturas no Blender ou use o TRELLIS para automatizar o PBR. Isso leva de 30 a 60 minutos por asset, em vez de 4 a 8 horas. Não é instantâneo, mas faz uma diferença real.

Áudio e música

A geração de áudio ainda não alcançou o mesmo nível das imagens e dos vídeos. Mesmo assim, já há recursos suficientes para mudar sua forma de trabalhar, principalmente na prototipagem e na criação de efeitos sonoros.

Exemplo de música gerada por IA. Descreva o clima que você quer e receba uma música correspondente

ModeloOrganizaçãoLançamentoO que fazLicençaCusto/30s
ACE-Step 1.5StepFun/ACE Studiojan. de 2026Gera rapidamente cerca de 4 min de música, 19 idiomas, clonagem de vozMIT~$0.02
Stable Audio 3.0Stability AImai. de 2026Músicas de até cerca de 6 min; modelos abertos Small, Small-SFX e MediumStability Community~$0.02
YuEMAPjan. de 2025Músicas completas a partir de letras, vocais + acompanhamentoApache 2.0~$0.05
MusicGenMeta2023Texto para música, controlávelcódigo MIT / pesos CC-BY-NC~$0.01
DiffRhythm 2ASLP-labfev. de 2026Geração rápida de músicas completasApache 2.0~$0.02
Magenta RealTimeGooglejun. de 2025Música em tempo real controlável por promptscódigo Apache / pesos CC-BY~$0.02

Experimente diretamente: demo do MusicGen ↗ · playground do AudioCraft ↗

Veja exemplos: exemplos do MusicGen ↗ · exemplos do AudioGen ↗

O que você realmente pode usar em um lançamento

O MusicGen, da Meta, ainda é uma opção prática para prototipar o áudio de jogos. Descreva o clima desejado, receba uma música correspondente e execute tudo sem problemas em uma GPU de 12 GB. Há um detalhe importante na licença: o código do MusicGen é MIT, mas os pesos do modelo são CC-BY-NC (uso não comercial). Portanto, use-o para prototipar e migre para um modelo com licença comercial, como ACE-Step ou Stable Audio, em qualquer projeto que você for lançar.

O modelo aberto de efeitos sonoros do Stable Audio (Small-SFX) lida com passos, rangidos de portas, vento ambiente e sons mecânicos, é executado localmente e está disponível sob a licença comunitária da Stability. Por isso, é a opção aberta de SFX para quando você precisa de sons que realmente possam ser usados comercialmente. Ele é a melhor escolha porque os outros modelos abertos de SFX vêm com restrições: o AudioGen, da Meta, usa CC-BY-NC, e o TangoFlux está sob a licença comunitária não comercial da Stability. Assim, ambos servem apenas para protótipos de um jogo que será lançado.

O Magenta RealTime (Google) é a exceção, no melhor sentido possível: é o único modelo com pesos abertos criado para gerar música em tempo real e permitir controle contínuo por prompts. Em vez de renderizar uma faixa pronta, ele gera música ao vivo, que você pode direcionar enquanto toca. Esse é exatamente o formato de uma trilha sonora adaptativa que muda de acordo com as ações do jogador. O código é Apache 2.0 e os pesos são CC-BY; ambos permitem uso comercial.

O YuE é realmente empolgante. É o primeiro modelo aberto capaz de gerar músicas completas com vocais. Músicas-tema. Música de fundo com canto de verdade. A qualidade varia, mas ele está muito à frente de qualquer outra opção que você possa baixar e executar por conta própria.

O ACE-Step é o modelo aberto de música que vale a pena conhecer agora, e ele evoluiu rapidamente: a linha 1.5 (janeiro de 2026, com uma variante XL maior de 5 bilhões de parâmetros) substitui o lançamento original de maio de 2025 e agora usa a licença MIT. Ele gera vários minutos de música rapidamente, oferece suporte a 19 idiomas e lida com clonagem de voz, remixes e edição de letras. Para prototipagem de jogos, ele preenche grande parte das lacunas deixadas pelo YuE e pelo MusicGen.

O Stable Audio 3.0 (maio de 2026) é a maior atualização para áudio. Ele pode gerar músicas com até cerca de seis minutos, e a Stability disponibilizou pesos abertos para três das quatro variantes: Small e o modelo dedicado a efeitos sonoros Small-SFX são executados no dispositivo, enquanto Medium oferece melhor estrutura musical e faixas com duração completa. Apenas o modelo Large continuou restrito à API. O Small-SFX agora é a opção aberta mais forte especificamente para efeitos sonoros de jogos. Toda a família foi treinada com dados licenciados, então sua base jurídica é mais segura do que a dos geradores de música envolvidos em processos judiciais ainda não resolvidos.

Esta é a avaliação honesta: a diferença entre os modelos abertos e os fechados (Suno, Udio) está diminuindo, mas ainda é perceptível para músicas completas com vocais. Além disso, essas ferramentas fechadas também enfrentam processos judiciais ainda não resolvidos relacionados aos dados de treinamento. Para efeitos sonoros, os modelos abertos — especialmente o modelo SFX do Stable Audio — são realmente competitivos. Para músicas que você pretende lançar, prepare-se para muitas iterações ou contrate um músico para a produção final e use essas ferramentas em todo o restante.

Fala e voz

A geração de voz já ultrapassou há muito tempo o nível de “boa o suficiente para jogos”, e isso muda o que pequenas equipes podem fazer.

Narração de jogo gerada por IA, com fala natural, ritmo adequado e emoção

ModeloOrganizaçãoLançamentoRecurso principalLicençaCusto/min
Qwen3-TTSAlibabajan. de 2026Clonagem de voz em 3s, design de voz, 10 idiomasApache 2.0~$0.002
ChatterboxResemble AI2025Controle de emoção, clonagem a partir de cerca de 5s, 23 idiomasMIT~$0.003
CSMSesame AImar. de 2025Fluxo de conversa, pausas naturaisApache 2.0~$0.005
Fish Speech 1.5Fish Audio2024Clonagem zero-shot a partir de 10 a 30scódigo Apache / pesos CC-BY-NC-SA~$0.002
OpenVoice V2MyShell/MITabr. de 2024Controle de emoção/sotaqueMIT~$0.003
XTTS-v2Coqui (comunidade)202417 idiomas, clonagem de vozCPML (uso não comercial)~$0.005

Ouça exemplos: vozes do Fish Audio ↗ · demo do OpenVoice ↗

Fazendo NPCs soarem como pessoas

O CSM (Conversational Speech Model), da Sesame, foi criado especificamente para diálogos. Ele produz pausas naturais. Mudanças de entonação. O ritmo de uma conversa de verdade. A maioria dos sistemas TTS soa como alguém lendo um roteiro, e isso fica evidente na hora. O CSM soa como alguém conversando. Essa diferença importa mais do que você imagina.

O Qwen3-TTS (Alibaba, janeiro de 2026) é a melhor opção para projetos comerciais. Toda a família usa a licença Apache 2.0, clona uma voz a partir de cerca de 3 segundos de áudio de referência, fala 10 idiomas e oferece design de voz baseado em descrições. Assim, você pode especificar a voz de um NPC em texto simples, em vez de procurar gravações de referência. Os modelos de 0,6 bilhão e 1,7 bilhão de parâmetros são executados em hardware modesto.

O Chatterbox (Resemble AI) é a escolha para vozes expressivas e usa a licença MIT, então você pode incluí-lo em um lançamento. Ele clona uma voz a partir de cerca de 5 segundos, funciona com latência inferior a 200 ms, abrange 23 idiomas e é o primeiro modelo aberto com controle de exagero emocional. Assim, um NPC pode realmente soar irritado ou assustado, em vez de monótono. Outras duas opções Apache 2.0 atendem a necessidades específicas: o Orpheus (Canopy) aceita tags de emoção embutidas, como <laugh> e <sigh>, que se encaixam perfeitamente em falas curtas de NPCs, e oferece uma variante de 150 milhões de parâmetros para hardware de baixo desempenho; já o Dia (Nari Labs) foi criado para diálogos com vários interlocutores e inclui sons não verbais, como tosses e risadas, em uma única passagem.

O Fish Speech e o OpenVoice fazem clonagem de voz. Grave de 10 a 30 segundos da voz de um ator e depois gere uma quantidade ilimitada de diálogos com essa voz. Pense no que isso significa: você pode contratar profissionais de voz para as falas principais e depois ampliar suas interpretações para cobrir centenas de variações e diálogos ambientes. Uma observação sobre a licença do Fish Speech: o código é aberto, mas os pesos da versão 1.5 usam CC-BY-NC-SA, então ele é uma ferramenta de prototipagem. Para jogos lançados, use o OpenVoice (MIT) ou o Qwen3-TTS (Apache 2.0).

O NVIDIA ACE (não é totalmente aberto, mas vale a pena conhecer) agora oferece suporte ao Qwen3-8B para implantação de NPCs no dispositivo. LLM local + TTS local + sincronização labial, tudo executado em GPUs de consumo. Essa é a stack para conversas em tempo real com NPCs sem depender de chamadas à nuvem.

A abordagem que faz sentido para criadores independentes é contratar profissionais de voz para os personagens principais e para as falas mais importantes. Use o Qwen3-TTS ou o OpenVoice para ampliar a cobertura com diálogos ambientes, variações e todas as falas incidentais que, de outra forma, ficariam em silêncio ou custariam caro demais.

Modelos de mundo e simulação de jogos

É aqui que tudo fica realmente estranho e empolgante. Esses modelos não geram assets estáticos. Eles geram experiências que parecem jogos.

🎮 Jogue Oasis: Minecraft gerado por IA
Geração de mundos em tempo real, sem engine de jogo, apenas previsão por IA
ModeloOrganizaçãoLançamentoO que fazStatusCusto/frame
DIAMONDPesquisa2024Modelo de mundo por difusão, simulação de AtariPesos abertos~$0.001
OasisDecart/Etchedout. de 2024Geração de Minecraft em tempo realPesos do modelo de 500 milhões de parâmetros abertos~$0.002
MineWorldMicrosoftabr. de 2025Minecraft em tempo real, alternativa aberta ao OasisMIT~$0.002
Hunyuan-GameCraftTencentago. de 2025Vídeo interativo de jogo, controle por teclado/mouseTencent Community~$0.005
GameGen-XPesquisa2024Geração de vídeos de mundo abertoCódigo + conjunto de dados abertos~$0.005
NVIDIA CosmosNVIDIAout. de 2025Simulação de IA física (Predict2.5)NVIDIA Open Model License~$0.01
Matrix-Game 3.0Skyworkmar. de 2026Mundos interativos em 720p e tempo real, memória de longo prazoPesos abertos~$0.005
Genie 2DeepMinddez. de 20243D interativo a partir de imagensNão lançadoN/D
Genie 3DeepMindago. de 2025Mundos em 720p e tempo real, eventos controláveis por promptsFechado (Project Genie)N/D

Veja a pesquisa: página do projeto DIAMOND ↗ · blog do Cosmos ↗Experimente: Demonstração ao vivo do Oasis ↗ · Exemplos do Genie 2 ↗

Por que isso é importante para você

O DIAMOND provou algo que muda a forma como pensamos sobre IA para jogos. É possível treinar um agente inteiramente dentro de um mundo gerado. Nenhum motor de jogo real é necessário para o treinamento. A IA joga na imaginação de um modelo de difusão e depois transfere o aprendizado para o jogo real. As implicações disso são significativas.

O Oasis executa um mundo semelhante ao Minecraft em tempo real. Quadro a quadro. Sem motor de jogo, sem texturas, sem assets pré-construídos. Apenas um transformer prevendo o que vem a seguir. É uma prova de conceito, mas imagine até onde isso pode chegar. A versão com 500 milhões de parâmetros já é aberta.

O GameGen-X lançou o maior conjunto de dados de vídeos de jogos de mundo aberto. Se você quiser treinar seus próprios modelos ou fazer o ajuste fino de modelos existentes para gerar conteúdo semelhante a jogos, este é o ponto de partida.

O NVIDIA Cosmos foi criado para robótica e veículos autônomos, mas seus modelos fundacionais de mundo também funcionam para jogos. Eles entendem física, permanência de objetos e relações espaciais. A linha aberta atual é a Cosmos-Predict2.5, lançada em outubro de 2025 sob a NVIDIA Open Model License, que permite uso comercial e trabalhos derivados.

O Hunyuan-GameCraft (Tencent, agosto de 2025) é o modelo de mundo aberto com formato mais diretamente voltado a jogos. Ele foi treinado com mais de um milhão de gravações de mais de 100 jogos AAA e unifica as entradas de teclado e mouse em um espaço de controle compartilhado, gerando vídeos interativos de jogos que você realmente controla, em vez de apenas assistir. Ele usa a mesma Tencent Community License do Hunyuan3D, com a mesma exclusão da UE, do Reino Unido e da Coreia do Sul, então verifique os termos antes de lançar nessas regiões. O MineWorld (Microsoft, MIT) é a alternativa totalmente permissiva ao Oasis: um modelo de mundo do Minecraft em tempo real que você pode baixar e executar sem um motor de jogo.

O Genie 3 (DeepMind, anunciado em agosto de 2025) é o salto que merece atenção: o primeiro modelo de mundo com interação em tempo real, gerando mundos navegáveis em 720p a 24 fps que permanecem consistentes por alguns minutos, além de “eventos de mundo controláveis por prompt” que alteram o clima ou adicionam objetos sob comando. Ele foi aberto ao público como Project Genie em janeiro de 2026 para assinantes do Google AI Ultra nos EUA. Os pesos ainda são fechados, mas ele mostra o rumo que os mundos jogáveis e gerados estão tomando.

O Matrix-Game 3.0 (Skywork, março de 2026) é a resposta aberta ao Genie. É um modelo de mundo interativo com memória ampliada que transmite em 720p a 40 fps em tempo real e mantém as cenas consistentes em sequências de um minuto. Uma versão destilada de 5B realiza inferência em tempo real, uma versão MoE maior de 2x14B eleva a qualidade, e os pesos estão no Hugging Face sob a Apache 2.0. Se você quiser experimentar mundos gerados jogáveis hoje, em vez de esperar pela DeepMind, este é o modelo que você realmente pode baixar.

Para o desenvolvimento prático de jogos hoje, essas ainda são ferramentas de pesquisa. Mas, se você trabalha com conteúdo orientado por IA, geração procedural ou simplesmente pensa sobre o rumo de tudo isso, esta é a fronteira.

Grandes modelos de linguagem

Os LLMs viabilizam diálogos, geração de missões e lógica de jogo. E as opções abertas agora competem de verdade com o GPT-4. Isso não era verdade dois anos atrás.

ModeloOrganizaçãoLançamentoTamanhoMelhor paraLicençaCusto/1 mil tokens
DeepSeek-V3DeepSeekDez. de 2024MoE de 671B (37B ativos)Raciocínio, uso geralPermissiva~$0.02
DeepSeek-R1DeepSeekJan. de 2025Baseado no V3Cadeia de raciocínioPermissiva~$0.03
DeepSeek-V3.2DeepSeekDez. de 2025Atenção esparsa (DSA)Raciocínio + uso de ferramentasMIT~$0.02
DeepSeek-V4DeepSeekAbr. de 2026MoE de 1.6T (49B ativos)Raciocínio de ponta, contexto de 1MMIT~$0.02
GLM-5Zhipu / Z.aiFev. de 2026MoE de 744B (40B ativos)Programação, agentes, uso de ferramentasMIT~$0.02
GPT-OSSOpenAIAgo. de 2025MoE de 120B / 20BRaciocínio, uso de ferramentas, execução no dispositivoApache 2.0~$0.01
Kimi K2Moonshot2025MoE de 1T (32B ativos)Agentes, programaçãoMIT modificada~$0.02
Kimi K3MoonshotJul. de 2026MoE de 2.8T (~50B ativos)Agentes de ponta, programação, contexto de 1M, visãoPesos abertos (27 de jul.)~$0.03
Gemma 3Google20251B-27BExecução no dispositivo, 140 idiomas, visãoGemma~$0.01
Qwen3Alibaba2025MoE de 235B (22B ativos)Multilíngue, códigoApache 2.0~$0.01
Qwen3-CoderAlibaba2025MoE de 480B (35B ativos)Programação com agentes, contexto de 256KApache 2.0~$0.02
Llama 4Meta2025VáriosAgentes, contexto de até 10MLlama Community~$0.01
Qwen3-VLAlibaba20252B-235BVisão + linguagemApache 2.0~$0.02
InternVL3Shanghai AI Lab20251B-78BVisão, OCR, compreensão de interfacesMIT~$0.02

Comece por aqui: Qwen3-8B no Hugging Face ↗ · DeepSeek-V3 no Hugging Face ↗ · GLM-5 no Hugging Face ↗

Para criar jogos

O Qwen3 é a escolha prática para a maioria dos usos em jogos. A licença Apache 2.0 significa que sua integração pertence a você. O forte suporte multilíngue é importante se você estiver pensando em localização. Ele segue bem instruções estruturadas. As variantes 7B e 14B são executadas localmente em GPUs de consumo.

O DeepSeek-V3 iguala ou supera o GPT-4 na maioria dos benchmarks. A arquitetura é engenhosa: apenas 37B parâmetros são ativados por token, apesar do total de 671B. Você precisa de hardware robusto, com várias GPUs, mas obtém qualidade de ponta sem depender de uma API.

O DeepSeek-V3.2 (dezembro de 2025) reúne raciocínio e uso de ferramentas em um único modelo e apresenta o DeepSeek Sparse Attention (DSA), que reduz o custo da inferência com contextos longos, além de uma variante Speciale de alto poder computacional voltada aos principais benchmarks de raciocínio. Para lógica de jogo e diálogos, ele é um substituto direto do V3 mais robusto e com maior capacidade de atuar como agente.

O DeepSeek-V4 (abril de 2026) voltou a avançar a fronteira aberta. O V4-Pro é um MoE de 1,6 trilhão de parâmetros, com apenas 49B ativos por token, uma janela de contexto de 1 milhão de tokens e modos de raciocínio selecionáveis, tudo sob a licença MIT. A variante V4-Flash, com 284B no total e 13B ativos, mantém o contexto de 1M em um pacote que não exige um cluster completo de GPUs. Se você estiver escolhendo hoje um modelo aberto para lógica complexa de missões ou contextos extensos de estado do jogo, este é o limite atual.

O GLM-5 (Zhipu AI, fevereiro de 2026) é o modelo aberto a superar em programação e trabalhos com agentes, e a atualização GLM-5.2 elevou suas pontuações em uso de ferramentas e planejamento de longo prazo para perto da fronteira dos modelos fechados. É um MoE de 744B parâmetros, com 40B ativos por token, contexto de 200 mil tokens e licença MIT. A Z.ai é a primeira empresa de modelos fundacionais com ações negociadas em bolsa e oferece preços agressivos para sua API hospedada, por volta de US$ 1,40 por milhão de tokens de entrada, mas os pesos estão no Hugging Face se você preferir hospedar o modelo por conta própria. Se o seu jogo depende de um LLM para criação de scripts de missões, agentes que chamam ferramentas ou sistemas orientados por código, o GLM-5 é uma alternativa robusta à OpenAI que você controla por completo.

O GPT-OSS (OpenAI, agosto de 2025) é o primeiro lançamento de pesos abertos da OpenAI e se encaixa diretamente no tema deste guia. O modelo gpt-oss-120b raciocina e chama ferramentas aproximadamente no nível do o4-mini em uma única GPU de 80 GB, enquanto o gpt-oss-20b é executado em uma placa de consumo com 16 GB; ambos usam a licença Apache 2.0. Se você quiser um modelo de um laboratório ocidental que possa hospedar por conta própria para lógica de NPCs ou agentes que usam ferramentas, esta é a escolha.

O Kimi K2 (Moonshot) é o outro peso-pesado aberto para agentes, ao lado do GLM-5 e do DeepSeek. É um MoE de 1 trilhão de parâmetros, com 32B ativos, fortemente ajustado para programação e uso de ferramentas. Sua licença MIT modificada só acrescenta restrições acima de 100 milhões de usuários mensais, portanto, para estúdios independentes, ela é efetivamente uma licença MIT. Use-o quando um agente precisar planejar muitas etapas.

O Kimi K3 (Moonshot, julho de 2026) é o maior modelo de pesos abertos já anunciado e chega mais perto da fronteira fechada do que qualquer modelo aberto anterior. É um MoE de 2,8 trilhões de parâmetros, com apenas cerca de 50B ativos por token — 16 de 896 especialistas —, contexto de 1M tokens e visão nativa, construído sobre dois novos mecanismos de atenção chamados Kimi Delta Attention e Attention Residuals. Segundo os números da Moonshot, ele supera o Claude Opus 4.8 e o GPT-5.5 em benchmarks de programação e agentes, ficando atrás apenas dos melhores modelos proprietários. O problema é a escala: os pesos serão lançados em 27 de julho de 2026 com aproximadamente 1,4 TB em MXFP4, então a hospedagem própria exige um cluster de GPUs com vários nós, e a maioria das equipes usará a API, a US$ 3 por milhão de tokens de entrada e US$ 15 por milhão de tokens de saída. Para agentes que você realmente consegue executar por conta própria, o K2 continua sendo a opção prática da Moonshot, mas o K3 redefine o que “aberto” pode significar no topo.

O Gemma 3 (Google) é a melhor opção quando você precisa executar o modelo no hardware do jogador ou localizar seu jogo para vários idiomas. Ele está disponível em tamanhos de 1B, 4B, 12B e 27B, portanto escala a partir de uma placa de 8 GB, trabalha com 140 idiomas, permite chamadas de funções e, nas variantes de 4B ou mais, também processa imagens, funcionando também como um pequeno modelo de visão. A licença Gemma permite uso comercial.

O Qwen3-Coder (Alibaba) é o modelo aberto especializado em programação, substituindo a antiga linha DeepSeek-Coder na maioria dos usos. É um MoE de 480B, com 35B ativos, contexto nativo de 256K — extensível a 1M —, licença Apache 2.0 e desempenho na categoria do Claude Sonnet em benchmarks de programação com agentes. Se o seu jogo gera ou executa código, este é o limite dos modelos abertos. A família europeia Mistral — Devstral para programação e Mistral Small 3.x para execução no dispositivo, ambos sob a Apache 2.0 — é uma alternativa sólida para hospedagem própria.

O Qwen3-VL acrescenta compreensão visual, com modelos densos e MoE de 2B a 235B sob a Apache 2.0. É útil para jogos que precisam analisar capturas de tela, compreender conteúdo desenhado pelo jogador ou processar a entrada de uma câmera. A variante 8B é executada em uma única GPU. O InternVL3 (Shanghai AI Lab, MIT) é outra opção aberta robusta de visão e linguagem, especialmente competente em OCR e compreensão de interfaces, o que é importante se suas ferramentas precisam interpretar interfaces de jogos; o Pixtral 12B da Mistral (Apache 2.0) é uma opção mais leve e segura para uso comercial.

Para NPCs executados no dispositivo, com personagens que respondem em tempo real sem chamadas à nuvem, o Qwen3-8B por meio do NVIDIA ACE é o caminho mais prático atualmente. Ele é executado junto ao seu jogo no hardware do jogador.

Modelos utilitários

Eles não geram conteúdo diretamente, mas fazem seus pipelines funcionarem.

Segmentação com o SAM 2O SAM 2 segmenta qualquer objeto em imagens e vídeos. Clique uma vez e obtenha uma máscara perfeita

ModeloOrganizaçãoLançamentoO que faz
SAM 2MetaAgo. de 2024Segmenta qualquer elemento em imagens e vídeos
Depth ProAppleOut. de 2024Estima profundidade métrica a partir de uma única imagem
gsplatNerfstudio2024+Gaussian splatting acelerado por CUDA

O SAM 2 segmenta objetos em vídeos em tempo real. Clique em algo e obtenha uma máscara perfeita. É útil para rotoscopia, composição ou extração de objetos de filmagens para uso como assets de jogos. Experimente o SAM 2 ↗

O Depth Pro da Apple produz mapas de profundidade métrica a partir de imagens individuais em menos de um segundo. Isso abre muitas possibilidades: converter arte 2D em 2.5D com efeitos de paralaxe, gerar dados de profundidade para reconstrução 3D e criar mapas de normais a partir de imagens planas. Depth Pro no Hugging Face ↗

O gsplat é uma implementação rápida de Gaussian splatting. Se você estiver capturando ambientes reais para jogos, seja por fotogrametria ou escaneamento de ambientes, esta é a biblioteca que torna o processo viável.

O que eu realmente usaria

Se você está começando um projeto de jogo hoje, esta é a combinação de ferramentas que faz sentido:

Texturas e sprites: FLUX.1 [schnell], Apache 2.0, iteração rápida e qualidade pronta para lançamento

Arte conceitual: SD 3.5 Large com LoRAs para controle de estilo

Assets 3D: Hunyuan3D 2.1 ou TRELLIS.2 para malhas texturizadas, SAM 3D quando o ponto de partida for uma foto e, depois, Blender para os ajustes finais

Rigging automático: UniRig ou NVIDIA SOMA-X para criar esqueletos e aplicar skinning às malhas geradas — ambos são abertos — em vez de depender do Mixamo

Efeitos sonoros: modelo aberto Small-SFX do Stable Audio, executado localmente e com licença comercial

Música: ACE-Step para protótipos e, depois, um compositor para a produção final

Voz: Qwen3-TTS para clonagem e diálogos de ambientação (Apache 2.0), Chatterbox (MIT) quando uma fala precisar de emoção real e atores de voz para as falas que importam

Diálogos de NPCs: Qwen3-8B localmente ou um LLM em nuvem que permita hospedagem própria — GLM-5 ou DeepSeek-V4 — para raciocínio complexo e uso de ferramentas

Vídeo (cinemáticas): Mochi 1 localmente e HunyuanVideo na nuvem quando você precisar da qualidade final

A questão sobre tudo isso é a seguinte: o erro comum é tentar usar IA para tudo. São ferramentas, não substitutos. Elas reduzem o trabalho tedioso de tarefas como iteração, criação de variações e assets provisórios, para que você possa dedicar seu tempo às decisões criativas que realmente importam. Às partes que tornam o seu jogo verdadeiramente seu.

Uma análise realista do hardware

Sejamos honestos sobre o que você realmente precisa para executar tudo isso:

8 GB de VRAM (RTX 3060, 4060): SD 1.5/SDXL, Wan 2.1 pequeno, AudioGen, Fish Speech e LLMs pequenos (7B quantizados). É o nível de um notebook gamer e já basta para começar. 12 GB de VRAM (RTX 3080, 4070): SD 3.5, FLUX schnell, Mochi 1, MusicGen, TripoSR, Qwen 14B quantizado. É aqui que as coisas começam a ficar confortáveis. A maioria dos modelos úteis roda nessa configuração.

24 GB de VRAM (RTX 3090, 4090): a maioria dos modelos com precisão total, InstantMesh e LLMs maiores. Se você pretende levar esse fluxo de trabalho a sério, esse é o ponto ideal.

48–80 GB de VRAM (A100, H100): HunyuanVideo, LTX-2, DeepSeek-V3 e geração em escala de produção. Hardware empresarial. Você não vai comprar isso, vai alugá-lo.

Instâncias em nuvem na RunPod, Lambda Labs ou Modal custam entre US$ 2 e US$ 4 por hora para GPUs A100. Para uso ocasional, isso sai mais barato do que comprar o hardware. Inicie uma instância quando precisar da qualidade final e desligue-a ao terminar.

Sobre as estimativas de custo deste guia: os custos por geração consideram inferência auto-hospedada em GPUs na nuvem por cerca de US$ 2–3/hora (A100) ou US$ 0,40/hora (RTX 4090). Os custos reais variam conforme o hardware, a otimização e o tamanho dos lotes. Esses são valores aproximados para planejamento, portanto sua experiência pode variar.

Novidades de 2026

Lançamentos recentes: LTX-2 e LTX-2.3 trouxeram geração aberta e sincronizada de áudio e vídeo, com 4K nativo. O TRELLIS.2 da Microsoft (dezembro de 2025) tornou-se o líder aberto em conversão de imagem para 3D, e o SAM 3D da Meta (novembro de 2025) tornou prática a reconstrução 3D a partir de uma única foto. O FLUX.2 substituiu o FLUX.1 na geração de imagens, e o SOMA-X da NVIDIA trouxe rigging automático e retargeting abertos. O primeiro semestre de 2026 manteve o ritmo: o Qwen3-TTS (janeiro) deu à clonagem de voz um verdadeiro lar sob a licença Apache 2.0; o GLM-5 da Zhipu (fevereiro) lançou, sob a licença MIT, um modelo aberto de 744 bilhões de parâmetros voltado a programação e agentes; o Matrix-Game 3.0 da Skywork (março) disponibilizou pesos abertos para um modelo de mundo interativo em tempo real; o DeepSeek-V4 (abril) levou os LLMs abertos a um contexto de 1 milhão de tokens sob a licença MIT; o Stable Audio 3.0 (maio) lançou três modelos de áudio abertos treinados com dados licenciados; e a Ideogram lançou seu primeiro modelo de imagem com pesos abertos (junho). Em julho, a Moonshot anunciou o Kimi K3, um modelo de 2,8 trilhões de parâmetros com pesos abertos que supera o Claude Opus 4.8 e o GPT-5.5 em benchmarks de agentes, com os pesos chegando em 27 de julho.

A tendência a acompanhar: os principais laboratórios estão mantendo cada vez mais seus modelos mais recentes disponíveis apenas por API, mesmo quando as versões anteriores eram abertas. O Wan tornou-se fechado na versão 2.5 e continuou assim até a 2.7, o Qwen-Image fechou na versão 2.0 e o Hunyuan3D, na 2.5. O ecossistema aberto continua vibrante e evoluindo rapidamente, mas já não é seguro presumir que “a versão mais recente é aberta”. Portanto, confira a disponibilidade dos pesos antes de criar um pipeline em torno de um modelo.

A trajetória é clara: toda capacidade que existe em modelos fechados aparece em modelos abertos de 6 a 12 meses depois. A questão não é se os modelos abertos serão bons o bastante. Para a maioria dos usos, eles já são. A questão é quando eles se tornarão o padrão.

E isto é o que isso significa para criadores: as ferramentas que antes exigiam orçamentos empresariais ou assinaturas mensais estão se tornando algo que você pode simplesmente... executar. No seu próprio hardware. Sem precisar da permissão de ninguém.

Essa é a mudança. É para isso que estamos construindo.


Perguntas frequentes

Qual é o melhor modelo de IA de código aberto para gerar assets de jogos?

Depende do asset. Para modelos 3D, o Hunyuan3D é a opção aberta mais potente em 2026. Para arte 2D e texturas, o FLUX lidera em qualidade. Para efeitos sonoros e música, os modelos de áudio abertos evoluíram rapidamente. Não existe um único modelo “melhor”, porque jogos precisam de muitos tipos de assets. Por isso, a maioria dos criadores encadeia alguns modelos em vez de depender de apenas um.

Os modelos de IA de código aberto são bons o bastante para substituir APIs fechadas?

Para a maioria dos trabalhos com assets de jogos em 2026, sim. Os modelos abertos agora alcançam as APIs fechadas na geração de imagens, 3D e áudio, e você pode executá-los no seu próprio hardware, sem taxas por chamada nem mudanças inesperadas de preço. Os modelos fechados ainda lideram em algumas tarefas de ponta, como vídeos longos, mas essa diferença geralmente desaparece em um período de 6 a 12 meses.

Posso executar esses modelos de IA generativa na minha própria GPU?

Muitos deles, sim. Modelos de imagem e áudio rodam tranquilamente em uma única GPU para consumidores, como uma RTX 4090. Modelos maiores de vídeo e 3D exigem mais VRAM e, muitas vezes, uma GPU em nuvem da categoria da A100. A seção sobre hardware acima informa o que cada modelo exige para que você possa se planejar antes de assumir o compromisso.

Em geral, sim, no caso de modelos de código aberto que você mesmo executa, mas isso depende da licença do modelo e das premissas sobre seus dados de treinamento. Sempre verifique a licença específica do modelo e informe o uso de conteúdo gerado por IA quando a plataforma exigir. Consulte nossa política de conteúdo gerado por IA para saber como lidamos com isso.


Mais leituras

Experimente agoraVeja esses modelos criarem um jogo, não apenas assets

Modelos generativos são mais divertidos quando o resultado é jogável.

Criar de graça →É grátis, roda no seu navegador, nada para instalar.