Meilleurs modèles d’IA générative open source pour les jeux (2026)
Dernière mise à jour : juillet 2026.
Voilà ce qu’il faut comprendre à propos de l’IA générative. Pendant des années, les meilleurs modèles étaient enfermés derrière des clés API et des tarifs imprévisibles. Vous construisiez votre flux de travail autour d’un outil, preniez vos habitudes, puis vous vous réveilliez avec un e-mail annonçant un changement de tarif. Ou pire, l’entreprise changeait complètement de cap.
Cela a changé fin 2024. Tencent, Alibaba et DeepSeek ont commencé à publier des modèles que vous pouvez réellement télécharger. Des modèles capables de rivaliser avec les solutions propriétaires. Et soudain, les créateurs disposent d’options qui ne dépendent pas du modèle économique de quelqu’un d’autre.
Et si vous pouviez générer des vidéos, des ressources 3D, de la musique et des voix, le tout à partir de modèles que vous contrôlez ? C’est désormais possible. Ce guide présente ce qui existe vraiment, ce qui fonctionne et ce que vous pouvez commencer à utiliser dès aujourd’hui.
Génération vidéo
Pendant des années, la génération vidéo se résumait à Runway ou Pika : des plateformes fermées, des abonnements et des restrictions sur l’utilisation des résultats. Aujourd’hui ? Vous pouvez exécuter des modèles comparables sur votre propre matériel.
Génération texte-vers-vidéo avec HunyuanVideo, sortie en 720p produite par le modèle vidéo open source de référence
| Modèle | Organisation | Paramètres | Caractéristiques | Matériel | Coût |
|---|---|---|---|---|---|
| HunyuanVideo | Tencent | 13B | 720p, texte+image | 80GB | ~$0.20 |
| HunyuanVideo-1.5 | Tencent | 8.3B | 480p-1080p, texte+image | 14GB | ~$0.05 |
| Mochi 1 | Genmo | 10B | 480p@30fps | 12GB+ | ~$0.10 |
| LTX-Video | Lightricks | — | 768x512, temps réel | 12GB | ~$0.02 |
| LTX-2 | Lightricks | 19B | 4K, audio synchronisé | Haut de gamme | ~$0.30 |
| Wan 2.1 | Alibaba | 1.3-14B | 480p-720p | 8GB+ | ~$0.03 |
| Wan 2.2 | Alibaba | 27B MoE (14B actifs) | 720p, MoE | 8GB+ | ~$0.03 |
| CogVideoX1.5-5B | Tsinghua | 5B | 1360x768@16fps, jusqu’à 10s | 12GB | ~$0.04 |
| SkyReels-V3 | Skywork | 14-19B | Piloté par l’audio, référence-vers-vidéo, V2V | Haut de gamme | ~$0.10 |
| Step-Video-T2V | StepFun | 30B | Plus grand modèle T2V ouvert, 204 images | Haut de gamme | ~$0.15 |
| Open-Sora 2.0 | HPC-AI | 11B | Intégration de Flux | Haut de gamme | ~$0.20 |
Poids : HunyuanVideo ↗ · Mochi 1 ↗ · Wan 2.1 ↗ · Open-Sora ↗
Voir des exemples : Galerie HunyuanVideo ↗ · Exemples de Mochi ↗ · Exemples de CogVideoX ↗
Ce que cela signifie pour les créateurs
HunyuanVideo surpasse Runway Gen-3 dans les évaluations professionnelles, et il est entièrement ouvert. Le problème ? Il faut du matériel très puissant. Une A100 ou une H100 avec 80GB de VRAM. Pour la plupart d’entre nous, cela signifie louer des GPU dans le cloud quand nous en avons besoin.
HunyuanVideo-1.5 a changé la donne côté matériel. Tencent l’a publié en novembre 2025 sous la forme d’un modèle ouvert de 8.3B paramètres capable de fonctionner sur un GPU grand public de 14GB, avec génération texte-vers-vidéo et image-vers-vidéo en 480p/720p, ainsi qu’une mise à l’échelle facultative en 1080p. Un nouveau mécanisme d’attention sélective et par tuiles glissantes, Selective and Sliding Tile Attention (SSTA), lui offre une vitesse d’inférence environ deux fois supérieure à celle du HunyuanVideo original. Si vous vouliez la qualité de HunyuanVideo sans pouvoir justifier l’achat d’une carte de 80GB, voici la version que vous pouvez réellement exécuter chez vous.
Mochi 1 est celui que vous pouvez vraiment faire tourner. Un GPU de 12GB, soit le niveau d’une RTX 3060, suffit largement. Les résultats sont véritablement créatifs, avec une qualité artistique bien distincte. La fidélité n’atteint pas tout à fait celle de HunyuanVideo, mais vous contrôlez l’ensemble du processus.
LTX-2 est particulièrement intéressant pour les jeux. C’est le premier modèle ouvert à générer un son synchronisé avec la vidéo. Imaginez des cinématiques où le son, tout simplement… correspond à l’image. Aucune synchronisation en postproduction. Lightricks a publié en open source l’intégralité des poids, du code d’inférence et du code d’entraînement en janvier 2026, avec une sortie 4K native allant jusqu’à 50fps et un son synchronisé sur une durée maximale de 20 secondes. Une réserve concernant la licence : les poids ouverts de LTX-2 sont gratuits pour un usage universitaire et, pour un usage commercial, uniquement pour les entreprises dont le chiffre d’affaires annuel est inférieur à $10M. Vérifiez donc ce seuil avant de bâtir une activité dessus.
SkyReels-V3 (Skywork, janvier 2026) est la nouvelle gamme ouverte à retenir. Il s’agit d’un modèle multimodal unifié qui propose la génération vidéo pilotée par l’audio, la référence-vers-vidéo et la vidéo-vers-vidéo dans des variantes de 14B et 19B. Il est donc particulièrement performant lorsqu’un personnage ou une image de référence doit guider le plan. Step-Video-T2V (StepFun) est le plus grand modèle texte-vers-vidéo ouvert, avec 30B paramètres, et il est distribué sous une licence MIT claire. Il mérite votre attention si une licence permissive compte davantage pour vous que la possibilité de l’exécuter sur un petit GPU.
Wan 2.1 fonctionne sur un ordinateur portable gaming. Un GPU de 8GB suffit pour les petites variantes. Si vous avez toujours voulu prototyper avec la génération vidéo sans pouvoir justifier le coût du matériel, c’est votre porte d’entrée.
Wan 2.2 (Alibaba, juillet 2025) est le premier modèle vidéo open source fondé sur une architecture Mixture-of-Experts : 27B paramètres au total, dont seulement 14B actifs à chaque étape. Il est proposé en versions texte-vers-vidéo (T2V-A14B), image-vers-vidéo (I2V-A14B) et dans une variante hybride de 5B qui fonctionne sur des GPU grand public, toutes sous licence Apache 2.0 pour un usage commercial.
Une réserve importante : Wan 2.2 reste le dernier Wan ouvert. Les versions plus récentes Wan 2.5 (septembre 2025), 2.6 (décembre 2025) et 2.7 (avril 2026) ont ajouté l’audio synchronisé, le 1080p et un contrôle plus précis des images, mais elles ne sont disponibles que via API, sans poids publics. Si l’auto-hébergement est important pour vous, la version 2.2 constitue la limite. LTX-2 est le modèle ouvert à privilégier si vous avez besoin de 4K et d’audio synchronisé.
Le flux de travail le plus logique : Mochi 1 ou Wan 2.1 pour le prototypage local. HunyuanVideo-1.5 ou LTX-2 sur des GPU cloud lorsque vous avez besoin d’une qualité finale.
Génération d’images
C’est le domaine où l’open source a déjà gagné. Les modèles que vous pouvez télécharger aujourd’hui rivalisent réellement avec Midjourney. Pas « presque aussi bons », mais véritablement compétitifs.
Exemples de FLUX.1, une qualité photoréaliste obtenue avec un modèle sous licence Apache 2.0
| Modèle | Organisation | Publication | Paramètres | Fonctionnalité principale | Licence | Coût/image |
|---|---|---|---|---|---|---|
| FLUX.1 [schnell] | Black Forest Labs | Août 2024 | 12B | Génération en 4 étapes, rapide | Apache 2.0 | ~$0.001 |
| FLUX.1 [dev] | Black Forest Labs | Août 2024 | 12B | Qualité proche de Pro | Non commerciale | ~$0.002 |
| SD 3.5 Large | Stability AI | Oct. 2024 | 8B | Rendu du texte, styles variés | Licence Stability | ~$0.002 |
| SD 3.5 Large Turbo | Stability AI | Oct. 2024 | 8B | 4 étapes, rapide | Licence Stability | ~$0.001 |
| HiDream-I1 | HiDream.ai | Avr. 2025 | 17B | Haute qualité, variantes Full/Dev/Fast | MIT | ~$0.002 |
| CogView4 | Tsinghua / Zhipu | Mars 2025 | 6B | Texte chinois natif, jusqu’à 2048px | Apache 2.0 | ~$0.002 |
| Qwen-Image | Alibaba | Août 2025 | 20B | Rendu du texte et retouche parmi les meilleurs | Apache 2.0 | ~$0.002 |
| FLUX.2 | Black Forest Labs | Nov. 2025 | 32B | Texte+retouche, 4MP, références multiples | dev : non commerciale / klein 4B : Apache 2.0 | ~$0.003 |
| Ideogram 4.0 | Ideogram | Juin 2026 | 9.3B | Design, rendu du texte, contrôle de la mise en page par JSON | Non commerciale | ~$0.002 |
Essayez-les directement : Démo de FLUX.1 schnell ↗ · Démo de SD 3.5 Large ↗ · GitHub (FLUX) ↗
Voir des exemples : Galerie FLUX ↗ · Galerie FLUX LoRA ↗ · Exemples sur Replicate ↗
Pour créer des ressources de jeu
FLUX.1 [schnell] est celui qu’il faut connaître. Sa licence Apache 2.0 vous permet de commercialiser des jeux sans vous soucier de complications juridiques. Il génère une image en seulement 4 étapes, ce qui permet d’itérer rapidement. Décrivez ce que vous voulez, observez le résultat, ajustez, puis recommencez.
SD 3.5 Large gère enfin correctement le rendu du texte. Les versions précédentes déformaient tout texte que vous tentiez d’inclure. C’est important pour les maquettes d’interface, les panneaux dans le jeu, les écrans-titres et tous les cas où vos images doivent contenir des mots lisibles.
FLUX.2 (Black Forest Labs, novembre 2025) est son successeur plus imposant : un modèle de 32B qui gère la génération texte-vers-image et la retouche d’images dans un même checkpoint, avec une excellente cohérence des personnages et des styles entre plusieurs références, ainsi qu’un rendu fiable du texte jusqu’à 4 mégapixels. FLUX.2 [dev], dont les poids sont ouverts, utilise une licence non commerciale. En revanche, FLUX.2 [klein], une version distillée publiée en janvier 2026, propose sa variante 4B sous licence Apache 2.0, génère des images en moins d’une seconde et fonctionne avec environ 8GB de VRAM. Il existe donc toujours une option adaptée à la commercialisation d’illustrations de jeu. Choisissez précisément la version klein 4B : la version klein 9B, plus grande, reste soumise à la licence FLUX non commerciale. Les pipelines quantifiés permettent d’exécuter [dev] sur des GPU de 18 à 24GB.
Deux autres options ouvertes méritent votre attention. Chroma1-HD (8.9B, Apache 2.0) est un dérivé entièrement ouvert de FLUX.1-schnell. C’est donc la solution adaptée à un usage commercial pour obtenir la qualité de la famille FLUX sans les restrictions de la licence [dev]. OmniGen2 (Apache 2.0) est un modèle unifié qui combine la génération texte-vers-image et la retouche guidée par des instructions. C’est la solution la plus rapide lorsque vous itérez sur une ressource existante (« fais briller l’épée en bleu »), plutôt que de repartir de zéro.
Qwen-Image (Alibaba, août 2025) est le modèle ouvert à privilégier lorsque vos créations doivent contenir du texte lisible, par exemple pour des panneaux, des interfaces, des affiches ou des étiquettes d’objets. Ce modèle de 20B sous licence Apache 2.0 offre un rendu du texte parmi les meilleurs et une puissante variante de retouche guidée par des instructions. Il convient donc à un usage commercial et excelle dans un domaine où la plupart des modèles d’image restent peu fiables. La mise à jour de décembre 2025, Qwen-Image-2512, a amélioré le réalisme des personnages et la mise en page du texte tout en conservant la licence Apache 2.0. Choisissez donc ce checkpoint si vous l’auto-hébergez. Le plus récent Qwen-Image-2.0 (février 2026) est uniquement disponible via API.
Ideogram 4.0 (juin 2026) est la première publication d’Ideogram avec des poids ouverts : un transformeur de diffusion de 9.3B conçu pour le design, avec un excellent rendu du texte multilingue et un contrôle explicite de la mise en page et des couleurs grâce à des prompts JSON structurés. Attention avant de bâtir votre projet dessus : le code d’inférence est sous licence Apache 2.0, mais les poids sont soumis à une licence non commerciale. Il s’agit donc d’un outil de recherche et de prototypage, sauf si vous achetez la licence commerciale.
L’écosystème de Stable Diffusion reste inégalé. ControlNet permet de contrôler précisément la composition. L’inpainting sert à effectuer des corrections. Le fine-tuning LoRA permet de créer des styles personnalisés. FLUX rattrape son retard, mais si vous avez besoin d’une personnalisation poussée aujourd’hui, la maturité des outils de SD vous offre davantage de possibilités.
Voici comment je vois les choses : pour les textures et les sprites, les deux conviennent. Pour du concept art soumis à des exigences stylistiques précises, choisissez SD 3.5 avec des LoRA. Pour une qualité maximale dans un produit commercial, choisissez FLUX schnell.
Génération 3D
Si vous avez déjà passé huit heures à modéliser un accessoire qui apparaît trois secondes dans votre jeu, cette section est pour vous. La génération 3D est passée depuis un certain temps du stade de « recherche intéressante » à celui de véritable outil de production et, en 2026, les modèles ouverts sont réellement performants. Vous pouvez passer d’un croquis à un maillage texturé en moins d’une minute.
TRELLIS génère, à partir d’images uniques, des maillages 3D texturés avec des matériaux PBR
| Modèle | Organisation | Publication | Fonctionnalité principale | Sortie | Coût/maillage |
|---|---|---|---|---|---|
| TRELLIS.2-4B | Microsoft | Déc. 2025 | 4B paramètres, PBR natif, jusqu’à 1536³ | Maillage texturé avec normales | ~$0.03 |
| Hunyuan3D 2.1 | Tencent | Juin 2025 | PBR de qualité production, poids complets + code d’entraînement | Maillage texturé haute fidélité | ~$0.05 |
| SAM 3D | Meta | Nov. 2025 | Une image vers la 3D (objets + corps humain) | Maillage à partir d’une photo | ~$0.02 |
| Stable Fast 3D | Stability AI | Août 2024 | Image unique → maillage en ~0.5s | Maillage texturé rapide | ~$0.001 |
| TripoSG | VAST-AI | Mars 2025 | Génération de formes par flux rectifié de 1.5B | Maillage haute qualité | ~$0.01 |
| TripoSR | Stability / Tripo | 2024 | Reconstruction rapide à partir d’une image unique | Maillage (sans texture) | ~$0.001 |
| UniRig | Tsinghua / Tripo | 2025 | Rigging automatique : squelette + poids de skinning | Maillage riggé et animable | ~$0.01 |
| Essayez-les directement : démo TRELLIS.2 ↗ · démo Hunyuan3D ↗ · démo InstantMesh ↗ |
Voir des exemples : page du projet TRELLIS.2 ↗ · galerie de 3D AI Studio ↗
Un workflow qui fonctionne vraiment
L’approche qui séduit actuellement les créateurs consiste à enchaîner plusieurs modèles. Commencez par une image, générée ou photographiée, peu importe. Passez-la dans Stable Zero123 ou Wonder3D pour obtenir plusieurs vues. Transmettez ensuite ces vues à InstantMesh ou TripoSR pour créer le maillage. Puis utilisez TRELLIS.2 ou Hunyuan3D pour obtenir de vrais matériaux.
TRELLIS.2 de Microsoft est le nouveau leader pour les assets prêts pour la production. Il gère les géométries qui mettent les autres modèles en échec : surfaces fines, trous et topologies complexes. La version à 4 milliards de paramètres produit des maillages avec de véritables textures PBR, et non de simples couleurs de sommets déguisées en matériaux.
Stable Fast 3D mise sur la vitesse. Il lui faut environ une demi-seconde pour passer d’une image à un maillage. Le maillage nécessite un nettoyage et un texturage, mais pour le prototypage ? Pour vérifier si une idée fonctionne avant d’y consacrer des heures ? Imbattable. TripoSG est l’étape supérieure lorsque vous voulez obtenir une géométrie plus propre à partir d’une seule image.
Hunyuan3D 2.1 est le modèle ouvert de Tencent à utiliser : il fournit l’intégralité des poids et du code d’entraînement, avec un texturage PBR de qualité professionnelle. Attention aux noms, car ils prêtent à confusion. Hunyuan3D 2.5, 3.0 et 3.1 existent tous, mais uniquement sous forme d’API, sans poids publics. Pour l’auto-hébergement, le générateur de base s’arrête donc toujours à la version 2.1. Tencent a toutefois ouvert deux extensions utiles basées sur la version 2.1 : Hunyuan3D-Omni ajoute un contrôle reposant sur plusieurs types de conditions (nuage de points, voxel, squelette, boîte englobante), tandis que Hunyuan3D-Part décompose un maillage en parties modifiables. Sa licence exclut également l’UE, le Royaume-Uni et la Corée du Sud ; vérifiez donc les conditions avant de publier dans ces régions.
SAM 3D (Meta, novembre 2025) est la nouvelle porte d’entrée : une seule photo devient un maillage 3D, avec des modèles distincts pour les objets et les corps humains. Associé aux travaux de Meta sur la segmentation, il permet d’isoler un objet dans une image et de ne reconstruire que celui-ci.
UniRig (Tsinghua et Tripo, MIT) comble le manque auquel tout le monde se heurte juste après avoir obtenu un maillage : le rigging. Il génère automatiquement un squelette valide et les poids de skinning d’un maillage d’entrée, afin qu’un personnage généré puisse réellement être animé au lieu de rester un simple accessoire statique. Associez-le aux travaux de NVIDIA sur l’animation automatique dans SOMA-X, et un personnage entièrement généré et riggé cesse d’être une simple démonstration de recherche.
Voici ce à quoi les créateurs indépendants peuvent raisonnablement s’attendre : générez du concept art avec FLUX, passez-le dans InstantMesh pour créer la géométrie, puis réalisez les textures dans Blender ou utilisez TRELLIS pour automatiser le PBR. Comptez 30 à 60 minutes par asset au lieu de 4 à 8 heures. Ce n’est pas instantané, mais la différence est réelle.
Audio et musique
La génération audio n’a pas encore rattrapé celle des images et des vidéos. Mais il y a déjà assez d’outils pour transformer votre manière de travailler, en particulier pour le prototypage et les effets sonores.
Extrait musical généré par IA. Décrivez l’ambiance recherchée et obtenez une musique adaptée
| Modèle | Organisation | Publication | Fonction | Licence | Coût/30 s |
|---|---|---|---|---|---|
| ACE-Step 1.5 | StepFun/ACE Studio | janv. 2026 | Génère rapidement ~4 min de musique, 19 langues, clonage vocal | MIT | ~$0.02 |
| Stable Audio 3.0 | Stability AI | mai 2026 | Morceaux jusqu’à ~6 min ; modèles ouverts Small, Small-SFX et Medium | Stability Community | ~$0.02 |
| YuE | MAP | janv. 2025 | Morceaux complets à partir de paroles, chant + accompagnement | Apache 2.0 | ~$0.05 |
| MusicGen | Meta | 2023 | Génération de musique à partir de texte, contrôlable | code MIT / poids CC-BY-NC | ~$0.01 |
| DiffRhythm 2 | ASLP-lab | févr. 2026 | Génération rapide de morceaux complets | Apache 2.0 | ~$0.02 |
| Magenta RealTime | juin 2025 | Musique en temps réel pilotable par prompt | code Apache / poids CC-BY | ~$0.02 |
Essayez-les directement : démo MusicGen ↗ · espace d’expérimentation AudioCraft ↗
Voir des exemples : exemples MusicGen ↗ · extraits AudioGen ↗
Ce que vous pouvez réellement intégrer à un jeu publié
MusicGen de Meta reste un choix pratique pour prototyper l’audio d’un jeu. Décrivez l’ambiance souhaitée, obtenez une musique adaptée, le tout fonctionnant correctement sur un GPU de 12 Go. Attention à la licence : le code de MusicGen est sous licence MIT, mais les poids du modèle sont sous licence CC-BY-NC (usage non commercial). Utilisez-le donc pour vos prototypes, puis passez à un modèle doté d’une licence commerciale, comme ACE-Step ou Stable Audio, pour tout ce que vous publiez.
Le modèle ouvert d’effets sonores de Stable Audio (Small-SFX) gère les bruits de pas, les grincements de portes, le vent ambiant et les sons mécaniques. Il fonctionne localement et est distribué sous la licence communautaire de Stability : c’est donc l’option ouverte à privilégier lorsque vous avez besoin de sons réellement utilisables à des fins commerciales. C’est le meilleur choix, car les autres modèles ouverts d’effets sonores sont assortis de restrictions : AudioGen de Meta est sous licence CC-BY-NC et TangoFlux sous la licence communautaire non commerciale de Stability. Tous deux sont donc réservés au prototypage d’un jeu destiné à être publié.
Magenta RealTime (Google) se distingue de la meilleure manière qui soit : c’est le seul modèle à poids ouverts conçu pour générer en temps réel une musique continuellement pilotable par prompt. Au lieu de produire une piste finalisée, il génère de la musique en direct que vous pouvez orienter pendant la lecture. C’est exactement le format nécessaire à une bande-son de jeu adaptative, qui évolue selon les actions du joueur. Le code est sous licence Apache 2.0 et les poids sous licence CC-BY ; les deux autorisent un usage commercial.
YuE est véritablement enthousiasmant. C’est le premier modèle ouvert à générer des morceaux complets avec du chant. Des thèmes musicaux. De la musique de fond avec de vraies voix chantées. La qualité varie, mais il surpasse largement tout ce que vous pouvez télécharger et exécuter vous-même.
ACE-Step est le modèle musical ouvert à connaître aujourd’hui, et il a progressé rapidement : la gamme 1.5 (janvier 2026, avec une variante XL plus grande de 5 milliards de paramètres) remplace la version originale de mai 2025 et est désormais sous licence MIT. Il génère rapidement plusieurs minutes de musique, prend en charge 19 langues ainsi que le clonage vocal, le remixage et la modification des paroles. Pour le prototypage de jeux, il comble une grande partie des lacunes laissées par YuE et MusicGen.
Stable Audio 3.0 (mai 2026) est la mise à jour majeure pour le son. Il peut générer des morceaux d’environ six minutes, et Stability a publié les poids ouverts de trois des quatre variantes : Small et le modèle dédié aux effets sonores Small-SFX fonctionnent tous deux directement sur l’appareil, tandis que Medium améliore la structure musicale et prend en charge la durée maximale des pistes. Seul le modèle Large est resté limité à une API. Small-SFX est désormais l’option ouverte la plus performante spécifiquement pour les effets sonores de jeux. Toute la famille a été entraînée sur des données sous licence, ce qui lui confère une assise juridique plus solide que les générateurs musicaux visés par des procédures judiciaires encore en cours.
Soyons francs : l’écart entre les modèles ouverts et fermés (Suno, Udio) se réduit, mais reste réel pour les morceaux complets avec chant. Ces outils fermés font en outre l’objet de litiges non résolus concernant leurs données d’entraînement. Pour les effets sonores, les modèles ouverts, en particulier le modèle SFX de Stable Audio, sont réellement compétitifs. Pour les morceaux que vous souhaitez publier, attendez-vous à devoir beaucoup itérer, ou faites appel à un musicien pour la production finale et utilisez ces outils pour tout le reste.
Parole et voix
La génération vocale a largement dépassé le stade du « suffisamment bon pour les jeux », ce qui change radicalement les possibilités offertes aux petites équipes.
Narration de jeu générée par IA avec une élocution naturelle, un rythme juste et de l’émotion
| Modèle | Organisation | Publication | Fonction principale | Licence | Coût/min |
|---|---|---|---|---|---|
| Qwen3-TTS | Alibaba | janv. 2026 | Clonage vocal en 3 s, conception de voix, 10 langues | Apache 2.0 | ~$0.002 |
| Chatterbox | Resemble AI | 2025 | Contrôle de l’émotion, clonage à partir de ~5 s, 23 langues | MIT | ~$0.003 |
| CSM | Sesame AI | mars 2025 | Fluidité conversationnelle, pauses naturelles | Apache 2.0 | ~$0.005 |
| Fish Speech 1.5 | Fish Audio | 2024 | Clonage zero-shot à partir de 10 à 30 s | code Apache / poids CC-BY-NC-SA | ~$0.002 |
| OpenVoice V2 | MyShell/MIT | avr. 2024 | Contrôle de l’émotion et de l’accent | MIT | ~$0.003 |
| XTTS-v2 | Coqui (communauté) | 2024 | 17 langues, clonage vocal | CPML (usage non commercial) | ~$0.005 |
Écouter des exemples : voix Fish Audio ↗ · démo OpenVoice ↗
Donner aux PNJ une voix humaine
CSM (Conversational Speech Model) de Sesame a été spécialement conçu pour les dialogues. Il produit des pauses naturelles. Des variations d’intonation. Le rythme d’une véritable conversation. La plupart des systèmes de synthèse vocale donnent l’impression que quelqu’un lit un script, et cela s’entend immédiatement. CSM donne l’impression que quelqu’un parle réellement. Cette différence compte plus qu’on ne pourrait le croire.
Qwen3-TTS (Alibaba, janvier 2026) est le choix à privilégier pour les projets commerciaux. Toute la famille est sous licence Apache 2.0, clone une voix à partir d’environ 3 secondes d’audio de référence, parle 10 langues et permet de concevoir une voix à partir d’une description. Vous pouvez donc définir la voix d’un PNJ en langage naturel au lieu de chercher des enregistrements de référence. Les modèles de 0,6 et 1,7 milliard de paramètres fonctionnent sur du matériel modeste.
Chatterbox (Resemble AI) est le choix idéal pour les voix expressives, et sa licence MIT permet de l’intégrer à un jeu publié. Il clone une voix à partir d’environ 5 secondes, fonctionne avec une latence inférieure à 200 ms, couvre 23 langues et constitue le premier modèle ouvert doté d’un réglage d’accentuation des émotions. Un PNJ peut ainsi réellement paraître en colère ou effrayé, plutôt que de parler d’un ton monocorde. Deux autres options sous licence Apache 2.0 répondent à des besoins précis : Orpheus (Canopy) accepte des balises d’émotion intégrées comme <laugh> et <sigh>, faciles à associer aux répliques courtes des PNJ, et propose une variante de 150 millions de paramètres pour le matériel d’entrée de gamme ; Dia (Nari Labs) est conçu pour les dialogues à plusieurs locuteurs et génère en une seule passe des sons non verbaux comme la toux et les rires.
Fish Speech et OpenVoice prennent en charge le clonage vocal. Enregistrez 10 à 30 secondes de la voix d’un comédien, puis générez un nombre illimité de dialogues avec cette même voix. Pensez à ce que cela implique : vous pouvez engager des comédiens pour les répliques essentielles, puis prolonger leur interprétation afin de couvrir des centaines de variantes et de dialogues d’ambiance. Une remarque concernant la licence de Fish Speech : le code est ouvert, mais les poids de la version 1.5 sont sous licence CC-BY-NC-SA. Il s’agit donc d’un outil de prototypage. Pour les jeux publiés, utilisez plutôt OpenVoice (MIT) ou Qwen3-TTS (Apache 2.0).
NVIDIA ACE (pas entièrement ouvert, mais utile à connaître) prend désormais en charge Qwen3-8B pour le déploiement de PNJ directement sur l’appareil. LLM local + synthèse vocale locale + synchronisation labiale, le tout exécuté sur des GPU grand public. C’est la stack à utiliser pour des conversations en temps réel avec des PNJ, sans appel au cloud.
L’approche la plus logique pour les créateurs indépendants consiste à engager des comédiens pour les personnages principaux et les répliques les plus importantes. Utilisez Qwen3-TTS ou OpenVoice pour étendre la couverture aux dialogues d’ambiance, aux variantes et à toutes les répliques secondaires qui seraient autrement muettes ou beaucoup trop coûteuses.
Modèles de monde et simulation de jeux
C’est ici que les choses deviennent vraiment étranges, et véritablement passionnantes. Ces modèles ne génèrent pas des assets statiques. Ils produisent des expériences qui ressemblent à des jeux.
🎮 Jouez à Oasis : un Minecraft généré par IAGénération de monde en temps réel sans moteur de jeu, uniquement par prédiction IA
| Modèle | Organisation | Publication | Fonction | Statut | Coût/image |
|---|---|---|---|---|---|
| DIAMOND | Recherche | 2024 | Modèle de monde par diffusion, simulation Atari | Poids ouverts | ~$0.001 |
| Oasis | Decart/Etched | oct. 2024 | Génération de Minecraft en temps réel | Poids du modèle 500M ouverts | ~$0.002 |
| MineWorld | Microsoft | avr. 2025 | Minecraft en temps réel, alternative ouverte à Oasis | MIT | ~$0.002 |
| Hunyuan-GameCraft | Tencent | août 2025 | Vidéo de jeu interactive, contrôle au clavier et à la souris | Tencent Community | ~$0.005 |
| GameGen-X | Recherche | 2024 | Génération de vidéos en monde ouvert | Code + jeu de données ouverts | ~$0.005 |
| NVIDIA Cosmos | NVIDIA | oct. 2025 | Simulation d’IA physique (Predict2.5) | NVIDIA Open Model License | ~$0.01 |
| Matrix-Game 3.0 | Skywork | mars 2026 | Mondes interactifs 720p en temps réel, mémoire à long terme | Poids ouverts | ~$0.005 |
| Genie 2 | DeepMind | déc. 2024 | 3D interactive à partir d’images | Non publié | N/D |
| Genie 3 | DeepMind | août 2025 | Mondes 720p en temps réel, événements pilotables par prompt | Fermé (Project Genie) | N/D |
Voir les travaux de recherche : page du projet DIAMOND ↗ · blog Cosmos ↗À essayer : Démo en direct d’Oasis ↗ · Exemples de Genie 2 ↗
Pourquoi cela devrait vous intéresser
DIAMOND a démontré quelque chose qui change notre façon d’envisager l’IA dans les jeux. Il est possible d’entraîner un agent entièrement dans un monde généré. Aucun véritable moteur de jeu n’est nécessaire pour l’entraînement. L’IA joue dans l’imagination d’un modèle de diffusion, puis transfère ses acquis vers le jeu réel. Les implications sont considérables.
Oasis fait fonctionner en temps réel un monde similaire à Minecraft. Image par image. Sans moteur de jeu, sans textures ni ressources préconstruites. Seulement un transformeur qui prédit la suite. Ce n’est encore qu’une preuve de concept, mais imaginez jusqu’où cela peut aller. La version à 500 millions de paramètres est déjà ouverte.
GameGen-X a publié le plus grand jeu de données de vidéos de jeux en monde ouvert. Si vous souhaitez entraîner vos propres modèles ou affiner des modèles existants pour générer du contenu de type vidéoludique, c’est un excellent point de départ.
NVIDIA Cosmos a été conçu pour la robotique et les véhicules autonomes, mais ses modèles fondamentaux du monde fonctionnent aussi pour les jeux. Ils comprennent la physique, la permanence des objets et les relations spatiales. La gamme ouverte actuelle est Cosmos-Predict2.5, publiée en octobre 2025 sous NVIDIA Open Model License, qui autorise l’utilisation commerciale et les œuvres dérivées.
Hunyuan-GameCraft (Tencent, août 2025) est le modèle de monde ouvert qui se rapproche le plus directement d’un jeu. Il a été entraîné sur plus d’un million d’enregistrements issus de plus de 100 jeux AAA et regroupe les entrées au clavier et à la souris dans un espace de contrôle partagé. Il génère ainsi une vidéo de jeu interactive que vous pilotez réellement, plutôt qu’une vidéo que vous vous contentez de regarder. Il est soumis à la même Tencent Community License que Hunyuan3D, avec les mêmes exclusions pour l’UE, le Royaume-Uni et la Corée du Sud : vérifiez donc les conditions avant d’y commercialiser votre jeu. MineWorld (Microsoft, MIT) est l’équivalent entièrement permissif d’Oasis : un modèle de monde Minecraft en temps réel que vous pouvez télécharger et exécuter sans moteur de jeu.
Genie 3 (DeepMind, annoncé en août 2025) représente le bond en avant à retenir : c’est le premier modèle de monde permettant une interaction en temps réel, générant des mondes navigables en 720p à 24 images/s qui restent cohérents pendant quelques minutes, avec en plus des « événements de monde pilotables par prompt » capables de modifier la météo ou d’ajouter des objets sur commande. Il a été ouvert au public sous le nom Project Genie en janvier 2026, pour les abonnés Google AI Ultra aux États-Unis. Les poids restent fermés, mais il montre la direction que prennent les mondes jouables générés.
Matrix-Game 3.0 (Skywork, mars 2026) est la réponse ouverte à Genie. Il s’agit d’un modèle de monde interactif enrichi par une mémoire, capable de diffuser du 720p à 40 images/s en temps réel et de conserver la cohérence des scènes sur des séquences d’une minute. Une version distillée de 5 milliards de paramètres assure l’inférence en temps réel, une version MoE plus grande de 2x14 milliards améliore la qualité, et les poids sont disponibles sur Hugging Face sous licence Apache 2.0. Si vous souhaitez expérimenter dès aujourd’hui avec des mondes générés jouables plutôt que d’attendre DeepMind, c’est celui que vous pouvez réellement télécharger.
Pour le développement pratique de jeux aujourd’hui, ces technologies restent des outils de recherche. Mais si vous travaillez sur du contenu piloté par l’IA, de la génération procédurale ou si vous réfléchissez simplement à la direction que prend le secteur, voilà où se situe la pointe de la recherche.
Grands modèles de langage
Les LLM alimentent les dialogues, la génération de quêtes et la logique des jeux. Et les solutions ouvertes rivalisent désormais réellement avec GPT-4. Ce n’était pas le cas il y a deux ans.
| Modèle | Organisation | Publication | Taille | Idéal pour | Licence | Coût/1 000 jetons |
|---|---|---|---|---|---|---|
| DeepSeek-V3 | DeepSeek | Déc. 2024 | MoE 671 Md (37 Md actifs) | Raisonnement, usage général | Permissive | ~0,02 $ |
| DeepSeek-R1 | DeepSeek | Janv. 2025 | Basé sur V3 | Chaîne de raisonnement | Permissive | ~0,03 $ |
| DeepSeek-V3.2 | DeepSeek | Déc. 2025 | Attention parcimonieuse (DSA) | Raisonnement et utilisation d’outils | MIT | ~0,02 $ |
| DeepSeek-V4 | DeepSeek | Avr. 2026 | MoE 1,6 Bn (49 Md actifs) | Raisonnement de pointe, contexte de 1 M | MIT | ~0,02 $ |
| GLM-5 | Zhipu / Z.ai | Févr. 2026 | MoE 744 Md (40 Md actifs) | Programmation, agents, utilisation d’outils | MIT | ~0,02 $ |
| GPT-OSS | OpenAI | Août 2025 | MoE 120 Md / 20 Md | Raisonnement, utilisation d’outils, exécution locale | Apache 2.0 | ~0,01 $ |
| Kimi K2 | Moonshot | 2025 | MoE 1 Bn (32 Md actifs) | Agents, programmation | MIT modifiée | ~0,02 $ |
| Kimi K3 | Moonshot | Juil. 2026 | MoE 2,8 Bn (~50 Md actifs) | Agents de pointe, programmation, contexte de 1 M, vision | Poids ouverts (27 juil.) | ~0,03 $ |
| Gemma 3 | 2025 | 1-27 Md | Exécution locale, 140 langues, vision | Gemma | ~0,01 $ | |
| Qwen3 | Alibaba | 2025 | MoE 235 Md (22 Md actifs) | Multilingue, code | Apache 2.0 | ~0,01 $ |
| Qwen3-Coder | Alibaba | 2025 | MoE 480 Md (35 Md actifs) | Programmation agentique, contexte de 256 K | Apache 2.0 | ~0,02 $ |
| Llama 4 | Meta | 2025 | Diverses | Agents, contexte jusqu’à 10 M | Llama Community | ~0,01 $ |
| Qwen3-VL | Alibaba | 2025 | 2-235 Md | Vision et langage | Apache 2.0 | ~0,02 $ |
| InternVL3 | Shanghai AI Lab | 2025 | 1-78 Md | Vision, OCR, repérage dans les interfaces | MIT | ~0,02 $ |
Pour commencer : Qwen3-8B sur HuggingFace ↗ · DeepSeek-V3 sur HuggingFace ↗ · GLM-5 sur HuggingFace ↗
Pour créer des jeux
Qwen3 est le choix le plus pratique pour la plupart des usages vidéoludiques. Sa licence Apache 2.0 signifie que votre intégration vous appartient. Sa solide prise en charge multilingue compte si vous envisagez la localisation. Il suit bien les instructions structurées. Les variantes 7B et 14B s’exécutent localement sur des GPU grand public.
DeepSeek-V3 égale ou dépasse GPT-4 dans la plupart des tests de référence. Son architecture est ingénieuse : seuls 37 milliards de paramètres sont activés pour chaque jeton, malgré un total de 671 milliards. Il faut du matériel conséquent, avec plusieurs GPU, mais vous obtenez une qualité de pointe sans dépendre d’une API.
DeepSeek-V3.2 (décembre 2025) réunit le raisonnement et l’utilisation d’outils dans un même modèle et introduit DeepSeek Sparse Attention (DSA), qui réduit le coût de l’inférence sur de longs contextes. Il propose aussi une variante Speciale à forte puissance de calcul, destinée aux tests de raisonnement les plus exigeants. Pour la logique de jeu et les dialogues, c’est un remplacement direct de V3 plus puissant et plus apte à piloter des agents.
DeepSeek-V4 (avril 2026) a de nouveau repoussé les limites des modèles ouverts. V4-Pro est un MoE de 1,6 billion de paramètres, dont seulement 49 milliards sont actifs par jeton, avec une fenêtre de contexte d’un million de jetons et des modes de raisonnement sélectionnables, le tout sous licence MIT. La variante V4-Flash (284 milliards de paramètres au total, 13 milliards actifs) conserve le contexte de 1 million de jetons dans un format qui ne nécessite pas une grappe complète de GPU. Si vous choisissez aujourd’hui un modèle ouvert pour une logique de quête complexe ou un contexte d’état de jeu très long, c’est ce qui se fait de mieux.
GLM-5 (Zhipu AI, février 2026) est le modèle ouvert de référence pour la programmation et les tâches agentiques, et la mise à jour GLM-5.2 a rapproché ses résultats en utilisation d’outils et en planification à long terme de ceux des meilleurs modèles fermés. C’est un MoE de 744 milliards de paramètres, dont 40 milliards actifs par jeton, avec un contexte de 200 000 jetons et une licence MIT. Z.ai est la première entreprise cotée spécialisée dans les modèles fondamentaux et propose une API hébergée à un prix très compétitif, autour de 1,40 $ par million de jetons en entrée. Les poids sont toutefois disponibles sur Hugging Face si vous préférez l’auto-héberger. Si votre jeu s’appuie sur un LLM pour écrire des scripts de quêtes, piloter des agents appelant des outils ou gérer des systèmes fondés sur du code, GLM-5 constitue une solide alternative à OpenAI que vous contrôlez entièrement.
GPT-OSS (OpenAI, août 2025) est la première publication à poids ouverts d’OpenAI, parfaitement dans le thème de ce guide. Le modèle gpt-oss-120b raisonne et appelle des outils à un niveau proche d’o4-mini sur un seul GPU de 80 Go, tandis que gpt-oss-20b fonctionne sur une carte grand public de 16 Go, tous deux sous licence Apache 2.0. Si vous recherchez un modèle issu d’un laboratoire occidental que vous pouvez auto-héberger pour la logique des PNJ ou des agents utilisant des outils, c’est celui-ci.
Kimi K2 (Moonshot) est l’autre poids lourd ouvert pour les agents, aux côtés de GLM-5 et DeepSeek. C’est un MoE de 1 billion de paramètres, dont 32 milliards actifs, fortement optimisé pour la programmation et l’utilisation d’outils. Sa licence MIT modifiée n’ajoute des restrictions qu’au-delà de 100 millions d’utilisateurs mensuels : pour les studios indépendants, elle équivaut donc pratiquement à la licence MIT. Choisissez-le lorsqu’un agent doit planifier de nombreuses étapes.
Kimi K3 (Moonshot, juillet 2026) est le plus grand modèle à poids ouverts jamais annoncé, et il se rapproche davantage des meilleurs modèles fermés que n’importe quel modèle ouvert avant lui. C’est un MoE de 2,8 billions de paramètres, dont seulement environ 50 milliards sont actifs par jeton (16 experts sur 896), avec un contexte de 1 million de jetons et une vision native. Il repose sur deux nouvelles architectures d’attention appelées Kimi Delta Attention et Attention Residuals. Selon les chiffres de Moonshot, il surpasse Claude Opus 4.8 et GPT-5.5 dans les tests de programmation et d’agents, ne restant derrière que les tout meilleurs modèles propriétaires. Le problème est son échelle : les poids seront publiés le 27 juillet 2026 et pèseront environ 1,4 To au format MXFP4. Son auto-hébergement nécessitera donc une grappe de GPU répartie sur plusieurs nœuds, et la plupart des équipes y accéderont par l’API, facturée 3 $ par million de jetons en entrée et 15 $ par million en sortie. Pour des agents que vous pouvez réellement exécuter vous-même, K2 reste le choix Moonshot le plus pratique, mais K3 redéfinit ce que peut signifier « ouvert » au plus haut niveau.
Gemma 3 (Google) est le meilleur choix lorsqu’un modèle doit fonctionner sur le matériel du joueur ou prendre en charge une localisation étendue. Il est proposé en versions de 1, 4, 12 et 27 milliards de paramètres, ce qui lui permet de fonctionner à partir d’une carte de 8 Go. Il prend en charge 140 langues et l’appel de fonctions, tandis que les variantes de 4 milliards de paramètres et plus comprennent aussi les images et peuvent donc servir de petits modèles de vision. La licence Gemma autorise l’utilisation commerciale.
Qwen3-Coder (Alibaba) est le modèle ouvert spécialisé dans la programmation, qui remplace l’ancienne gamme DeepSeek-Coder pour la plupart des usages. C’est un MoE de 480 milliards de paramètres, dont 35 milliards actifs, avec un contexte natif de 256 000 jetons extensible à 1 million, sous licence Apache 2.0. Dans les tests de programmation agentique, il se situe dans la même catégorie que Claude Sonnet. Si votre jeu génère ou exécute du code, c’est actuellement le sommet des modèles ouverts. La famille européenne Mistral — Devstral pour la programmation et Mistral Small 3.x pour l’exécution locale, tous deux sous Apache 2.0 — constitue une solide solution auto-hébergeable.
Qwen3-VL ajoute la compréhension visuelle, avec des modèles denses et MoE allant de 2 à 235 milliards de paramètres sous licence Apache 2.0. Il est utile pour les jeux qui doivent analyser des captures d’écran, comprendre du contenu dessiné par les joueurs ou traiter l’entrée d’une caméra. La variante 8B fonctionne sur un seul GPU. InternVL3 (Shanghai AI Lab, MIT) est l’autre grande solution ouverte combinant vision et langage. Il excelle notamment en OCR et en repérage dans les interfaces, ce qui compte si vos outils doivent lire des interfaces de jeu. Pixtral 12B de Mistral (Apache 2.0) est une option plus légère et adaptée à un usage commercial.
Pour des PNJ exécutés localement, capables de répondre en temps réel sans passer par le cloud, Qwen3-8B via NVIDIA ACE est actuellement la solution la plus pratique. Il s’exécute en parallèle du jeu sur le matériel du joueur.
Modèles utilitaires
Ils ne génèrent pas directement de contenu, mais permettent à vos chaînes de production de fonctionner.
SAM 2 segmente n’importe quel objet dans les images et les vidéos. Un clic suffit pour obtenir un masque parfait
| Modèle | Organisation | Publication | Fonction |
|---|---|---|---|
| SAM 2 | Meta | Août 2024 | Segmente n’importe quel élément dans les images et les vidéos |
| Depth Pro | Apple | Oct. 2024 | Estime la profondeur métrique à partir d’une seule image |
| gsplat | Nerfstudio | 2024+ | Gaussian splatting accéléré par CUDA |
SAM 2 segmente les objets d’une vidéo en temps réel. Cliquez sur un élément et obtenez un masque parfait. C’est utile pour la rotoscopie, le compositing ou l’extraction d’objets depuis des séquences filmées afin de les utiliser comme ressources de jeu. Essayer SAM 2 ↗
Depth Pro d’Apple produit en moins d’une seconde des cartes de profondeur métrique à partir d’images uniques. Cela ouvre de nombreuses possibilités : convertir des illustrations 2D en 2,5D avec des effets de parallaxe, générer des données de profondeur pour la reconstruction 3D et créer des normal maps à partir d’images planes. Depth Pro sur HuggingFace ↗
gsplat est l’implémentation rapide du Gaussian splatting. Si vous capturez des environnements réels pour vos jeux, que ce soit par photogrammétrie ou par numérisation d’environnements, c’est la bibliothèque qui rend cette méthode réellement exploitable.
Ce que j’utiliserais réellement
Si vous démarrez un projet de jeu aujourd’hui, voici la pile technologique la plus pertinente :
Textures et sprites : FLUX.1 [schnell], Apache 2.0, itérations rapides et qualité prête pour la production
Concept art : SD 3.5 Large avec des LoRA pour maîtriser le style
Ressources 3D : Hunyuan3D 2.1 ou TRELLIS.2 pour les maillages texturés, SAM 3D lorsque vous partez d’une photo, puis Blender pour les retouches
Rigging automatique : UniRig ou NVIDIA SOMA-X pour créer le squelette et le skinning des maillages générés — les deux sont ouverts — plutôt que de dépendre de Mixamo
Effets sonores : le modèle ouvert Small-SFX de Stable Audio, exécuté localement et sous licence commerciale
Musique : ACE-Step pour les prototypes, puis faites appel à un compositeur pour la production finale
Voix : Qwen3-TTS pour le clonage et les dialogues d’ambiance (Apache 2.0), Chatterbox (MIT) lorsqu’une réplique exige une véritable émotion, et des comédiens de doublage pour les répliques importantes
Dialogues des PNJ : Qwen3-8B en local, ou un LLM cloud auto-hébergeable (GLM-5 ou DeepSeek-V4) pour le raisonnement complexe et l’utilisation d’outils
Vidéo (cinématiques) : Mochi 1 en local, HunyuanVideo dans le cloud lorsque vous avez besoin d’une qualité finale
Voici ce qu’il faut retenir : l’erreur courante consiste à vouloir utiliser l’IA pour tout. Ce sont des outils, pas des remplaçants. Ils réduisent le temps consacré aux tâches fastidieuses comme les itérations, les variantes et les ressources temporaires, afin que vous puissiez vous concentrer sur les décisions créatives qui comptent vraiment. Celles qui donnent à votre jeu son identité.
Les besoins matériels réels
Soyons honnêtes sur le matériel réellement nécessaire pour faire fonctionner tout cela :
8 Go de VRAM (RTX 3060, 4060) : SD 1.5/SDXL, petite version de Wan 2.1, AudioGen, Fish Speech, petits LLM quantifiés de 7 milliards de paramètres. C’est la catégorie des ordinateurs portables de jeu, et cela suffit pour commencer. 12 Go de VRAM (RTX 3080, 4070) : SD 3.5, FLUX schnell, Mochi 1, MusicGen, TripoSR, Qwen 14B quantifié. C’est à partir de là que les choses deviennent confortables. La plupart des modèles utiles fonctionnent avec cette configuration.
24 Go de VRAM (RTX 3090, 4090) : la plupart des modèles en pleine précision, InstantMesh et des LLM plus grands. Si vous comptez adopter sérieusement ce processus de travail, c’est le meilleur compromis.
48 à 80 Go de VRAM (A100, H100) : HunyuanVideo, LTX-2, DeepSeek-V3 et génération à l’échelle de la production. Du matériel d’entreprise. Vous ne l’achèterez pas, vous le louerez.
Les instances cloud de RunPod, Lambda Labs ou Modal coûtent entre 2 et 4 $/heure pour des A100. Pour une utilisation occasionnelle, cela revient moins cher que d’acheter le matériel. Lancez une instance lorsque vous avez besoin d’une qualité finale, puis arrêtez-la une fois votre travail terminé.
À propos des estimations de coût de ce guide : les coûts par génération supposent une inférence auto-hébergée sur des GPU cloud à environ 2 à 3 $/heure (A100) ou 0,40 $/heure (RTX 4090). Les coûts réels varient selon le matériel, l’optimisation et la taille des lots. Il s’agit d’ordres de grandeur destinés à la planification ; vos résultats peuvent donc varier.
Nouveautés de 2026
Sorties récentes : LTX-2 et LTX-2.3 ont apporté une solution ouverte de génération audio-vidéo synchronisée avec une définition 4K native. TRELLIS.2 de Microsoft (décembre 2025) est devenu la référence ouverte pour la conversion d’images en 3D, tandis que SAM 3D de Meta (novembre 2025) a rendu pratique la reconstruction 3D à partir d’une seule photo. FLUX.2 a remplacé FLUX.1 pour la génération d’images, et SOMA-X de NVIDIA a apporté une solution ouverte de rigging et de retargeting automatiques. Le premier semestre 2026 a maintenu le rythme : Qwen3-TTS (janvier) a offert au clonage vocal une véritable solution sous licence Apache 2.0, GLM-5 de Zhipu (février) a proposé sous licence MIT un modèle ouvert de 744 milliards de paramètres dédié au code et aux tâches agentiques, Matrix-Game 3.0 de Skywork (mars) a publié en poids ouverts un modèle de monde interactif en temps réel, DeepSeek-V4 (avril) a porté les LLM ouverts à un contexte d’un million de tokens sous licence MIT, Stable Audio 3.0 (mai) a lancé trois modèles audio ouverts entraînés sur des données sous licence, et Ideogram a publié son premier modèle d’image à poids ouverts (juin). Puis, en juillet, Moonshot a annoncé Kimi K3, un modèle à poids ouverts de 2 800 milliards de paramètres qui surpasse Claude Opus 4.8 et GPT-5.5 dans les benchmarks agentiques, avec une publication des poids prévue le 27 juillet.
La tendance à surveiller : les principaux laboratoires réservent de plus en plus leurs modèles les plus récents à leurs API, même lorsque les versions précédentes étaient ouvertes. Wan est devenu fermé avec la version 2.5 et l’est resté jusqu’à la 2.7, Qwen-Image est devenu fermé avec la version 2.0, et Hunyuan3D avec la version 2.5. L’écosystème ouvert reste dynamique et évolue rapidement, mais il n’est désormais plus prudent de supposer que « la dernière version est ouverte ». Vérifiez donc la disponibilité des poids avant de bâtir une chaîne de production autour d’un modèle.
La trajectoire est claire : chaque fonctionnalité proposée par les modèles fermés apparaît dans les modèles ouverts 6 à 12 mois plus tard. La question n’est pas de savoir si les modèles ouverts seront suffisamment performants. Ils le sont déjà pour la plupart des usages. La véritable question est de savoir à quelle vitesse ils deviendront la solution par défaut.
Et voici ce que cela signifie pour les créateurs : les outils qui nécessitaient auparavant des budgets d’entreprise ou des abonnements mensuels deviennent accessibles sous forme de logiciels que vous pouvez tout simplement… exécuter. Sur votre propre matériel. Sans avoir besoin de la permission de qui que ce soit.
Voilà le changement. Voilà l’avenir que nous construisons.
Questions fréquentes
Quel est le meilleur modèle d’IA open source pour générer des ressources de jeu ?
Cela dépend du type de ressource. Pour les modèles 3D, Hunyuan3D est la meilleure option ouverte en 2026. Pour les illustrations 2D et les textures, FLUX domine en matière de qualité. Pour les effets sonores et la musique, les modèles audio ouverts ont rapidement rattrapé leur retard. Il n’existe pas de modèle unique qui soit « le meilleur », car les jeux nécessitent de nombreux types de ressources. La plupart des créateurs enchaînent donc plusieurs modèles au lieu de n’en utiliser qu’un seul.
Les modèles d’IA open source sont-ils assez performants pour remplacer les API fermées ?
Pour la plupart des tâches de création de ressources de jeu en 2026, oui. Les modèles ouverts égalent désormais les API fermées pour la génération d’images, de contenus 3D et de contenus audio. Vous pouvez en outre les exécuter sur votre propre matériel, sans frais par appel ni modification tarifaire imprévue. Les modèles fermés conservent une avance sur quelques tâches de pointe, comme la vidéo longue durée, mais l’écart se résorbe généralement en 6 à 12 mois.
Puis-je exécuter ces modèles d’IA générative sur mon propre GPU ?
Pour beaucoup d’entre eux, oui. Les modèles d’image et d’audio fonctionnent confortablement sur un seul GPU grand public comme une RTX 4090. Les modèles de vidéo et de 3D plus volumineux nécessitent davantage de VRAM et souvent un GPU cloud de classe A100. La section consacrée au matériel ci-dessus indique les besoins de chaque modèle afin que vous puissiez planifier votre configuration avant de vous engager.
Est-il légal d’utiliser des ressources générées par IA dans un jeu commercial ?
En règle générale, oui pour les modèles open source que vous exécutez vous-même, mais cela dépend de la licence du modèle et des hypothèses relatives à ses données d’entraînement. Vérifiez toujours la licence propre au modèle et signalez les contenus générés par IA lorsque votre plateforme l’exige. Consultez notre politique relative aux contenus générés par IA pour savoir comment nous les gérons.
Pour aller plus loin
- Controverse autour de l’IA, confiance et économie post-IA — notre position sur l’IA dans les jeux
- Politique relative aux contenus générés par IA — notre approche de la transparence sur l’utilisation de l’IA
- Pile technologique des jeux web en 2026 — WebGL, WebGPU et Wasm pour les jeux
- Technologies de mondes ouverts 3D dans le navigateur — utiliser des ressources 3D générées par IA dans des mondes accessibles par navigateur
- Génération de paysages pour les mondes ouverts dans le navigateur — synthèse de terrains fondée sur la diffusion
- Où trouver des ressources de jeu gratuites — sources traditionnelles de ressources en complément de la génération par IA
- Outils de programmation agentique fondés sur l’IA — utiliser l’IA pour écrire le code d’un jeu, et pas seulement pour générer des ressources
Les modèles de génération sont plus amusants lorsque leur résultat est jouable.