Beste Open-Source-Modelle für generative KI in Spielen (2026)
Zuletzt aktualisiert: Juli 2026.
Das ist die Sache mit generativer KI: Jahrelang waren die besten Modelle nur hinter API-Schlüsseln und unvorhersehbaren Preismodellen zugänglich. Man baute seinen Workflow um ein Tool herum auf, gewöhnte sich daran und wachte dann eines Morgens mit einer E-Mail auf, die eine Preisänderung ankündigte. Oder schlimmer noch: Das Unternehmen richtete sich komplett neu aus.
Das änderte sich Ende 2024. Tencent, Alibaba und DeepSeek begannen, Modelle zu veröffentlichen, die man tatsächlich herunterladen kann. Modelle, die mit den geschlossenen Alternativen konkurrieren können. Und plötzlich haben Kreative Optionen, die nicht vom Geschäftsmodell eines anderen Unternehmens abhängen.
Was wäre, wenn du Videos, 3D-Assets, Musik und Stimmen mit Modellen generieren könntest, die du selbst kontrollierst? Genau da stehen wir heute. Dieser Leitfaden zeigt, was wirklich existiert, was funktioniert und was du schon heute einsetzen kannst.
Videogenerierung
Jahrelang bedeutete Videogenerierung Runway oder Pika: geschlossene Plattformen, Abogebühren und Einschränkungen bei der Nutzung der Ergebnisse. Heute kannst du vergleichbare Modelle auf deiner eigenen Hardware ausführen.
Text-zu-Video-Generierung mit HunyuanVideo, 720p-Ausgabe des führenden Open-Source-Videomodells
| Modell | Organisation | Parameter | Spezifikationen | Hardware | Kosten |
|---|---|---|---|---|---|
| HunyuanVideo | Tencent | 13B | 720p, Text+Bild | 80GB | ~$0.20 |
| HunyuanVideo-1.5 | Tencent | 8.3B | 480p-1080p, Text+Bild | 14GB | ~$0.05 |
| Mochi 1 | Genmo | 10B | 480p@30fps | 12GB+ | ~$0.10 |
| LTX-Video | Lightricks | — | 768x512, Echtzeit | 12GB | ~$0.02 |
| LTX-2 | Lightricks | 19B | 4K, synchronisiertes Audio | High-End | ~$0.30 |
| Wan 2.1 | Alibaba | 1.3-14B | 480p-720p | 8GB+ | ~$0.03 |
| Wan 2.2 | Alibaba | 27B MoE (14B aktiv) | 720p, MoE | 8GB+ | ~$0.03 |
| CogVideoX1.5-5B | Tsinghua | 5B | 1360x768@16fps, bis zu 10s | 12GB | ~$0.04 |
| SkyReels-V3 | Skywork | 14-19B | Audiogesteuert, Referenz-zu-Video, V2V | High-End | ~$0.10 |
| Step-Video-T2V | StepFun | 30B | Größtes offenes T2V-Modell, 204 Frames | High-End | ~$0.15 |
| Open-Sora 2.0 | HPC-AI | 11B | Flux-Integration | High-End | ~$0.20 |
Gewichte: HunyuanVideo ↗ · Mochi 1 ↗ · Wan 2.1 ↗ · Open-Sora ↗
Beispiele ansehen: HunyuanVideo-Galerie ↗ · Mochi-Beispiele ↗ · CogVideoX-Beispiele ↗
Was das für Kreative bedeutet
HunyuanVideo übertrifft Runway Gen-3 in professionellen Bewertungen und ist vollständig offen. Der Haken? Du brauchst leistungsstarke Hardware: eine A100 oder H100 mit 80GB VRAM. Für die meisten von uns bedeutet das, bei Bedarf Cloud-GPUs zu mieten.
HunyuanVideo-1.5 hat die Hardware-Kalkulation verändert. Tencent veröffentlichte es im November 2025 als offenes Modell mit 8,3 Milliarden Parametern, das auf einer Consumer-GPU mit 14GB läuft. Es unterstützt Text-zu-Video und Bild-zu-Video in 480p/720p sowie optionales Upscaling auf 1080p. Ein neuer Mechanismus namens Selective and Sliding Tile Attention (SSTA) sorgt für eine ungefähr doppelt so hohe Inferenzgeschwindigkeit wie beim ursprünglichen HunyuanVideo. Wenn du die Qualität von HunyuanVideo wolltest, aber eine 80-GB-Karte nicht rechtfertigen konntest, ist dies die Version, die du tatsächlich zu Hause ausführen kannst.
Mochi 1 ist das Modell, das du wirklich lokal ausführen kannst. Eine GPU mit 12GB – also etwa eine RTX 3060 – reicht problemlos aus. Die Ergebnisse sind ausgesprochen kreativ und haben eine unverwechselbare künstlerische Qualität. Nicht ganz die Detailtreue von HunyuanVideo, aber dafür gehört der Prozess dir.
LTX-2 wird für Spiele besonders interessant. Es ist das erste offene Modell, das synchronisiertes Audio zusammen mit dem Video generiert. Stell dir Zwischensequenzen vor, bei denen der Ton einfach … passt. Keine nachträgliche Synchronisierung. Lightricks stellte im Januar 2026 die vollständigen Gewichte sowie den Inferenz- und Trainingscode als Open Source bereit. Das Modell bietet native 4K-Ausgabe mit bis zu 50fps und synchronisiertes Audio für Clips von bis zu 20 Sekunden. Ein wichtiger Lizenzhinweis: Die offenen Gewichte von LTX-2 sind für akademische Zwecke kostenlos, für die kommerzielle Nutzung jedoch nur für Unternehmen mit weniger als 10 Millionen US-Dollar Jahresumsatz. Prüfe diese Grenze also, bevor du darauf ein Geschäft aufbaust.
SkyReels-V3 (Skywork, Januar 2026) ist die bemerkenswerte neuere offene Modellreihe. Das vereinheitlichte multimodale Modell beherrscht audiogesteuerte Videos, Referenz-zu-Video und Video-zu-Video in Varianten mit 14B und 19B. Es eignet sich daher besonders, wenn eine Figur oder ein Referenzbild die Aufnahme bestimmen soll. Step-Video-T2V (StepFun) ist mit 30B das größte offene Text-zu-Video-Modell und wird unter einer unkomplizierten MIT-Lizenz veröffentlicht. Es ist einen Blick wert, wenn dir eine freizügige Lizenz wichtiger ist als die Ausführung auf einer kleinen GPU.
Wan 2.1 läuft auf einem Gaming-Laptop. Für die kleineren Varianten reicht eine GPU mit 8GB. Wenn du schon immer mit Videogenerierung prototypisieren wolltest, die erforderliche Hardware aber nicht rechtfertigen konntest, ist dies dein Einstieg.
Wan 2.2 (Alibaba, Juli 2025) ist das erste Open-Source-Videomodell auf Basis einer Mixture-of-Experts-Architektur: insgesamt 27B Parameter, von denen pro Schritt nur 14B aktiv sind. Es ist als Text-zu-Video-Modell (T2V-A14B), Bild-zu-Video-Modell (I2V-A14B) und hybride 5B-Variante für Consumer-GPUs verfügbar – jeweils unter Apache 2.0 für die kommerzielle Nutzung.
Eine wichtige Einschränkung: Wan 2.2 ist weiterhin die letzte offene Wan-Version. Die neueren Versionen Wan 2.5 (September 2025), 2.6 (Dezember 2025) und 2.7 (April 2026) ergänzten synchronisiertes Audio, 1080p und eine präzisere Frame-Steuerung, sind aber ausschließlich über eine API verfügbar und haben keine öffentlichen Gewichte. Wenn Self-Hosting für dich wichtig ist, endet die Auswahl bei Version 2.2. LTX-2 ist das offene Modell der Wahl, wenn du 4K und synchronisiertes Audio benötigst.
Der sinnvollste Workflow: Mochi 1 oder Wan 2.1 für lokale Prototypen. HunyuanVideo-1.5 oder LTX-2 auf Cloud-GPUs, wenn du finale Qualität brauchst.
Bildgenerierung
Hier hat Open Source bereits gewonnen. Die Modelle, die du heute herunterladen kannst, konkurrieren tatsächlich mit Midjourney. Nicht „fast genauso gut“, sondern wirklich konkurrenzfähig.
FLUX.1-Beispiele: fotorealistische Qualität aus einem unter Apache 2.0 lizenzierten Modell
| Modell | Organisation | Veröffentlicht | Parameter | Hauptmerkmal | Lizenz | Kosten/Bild |
|---|---|---|---|---|---|---|
| FLUX.1 [schnell] | Black Forest Labs | Aug. 2024 | 12B | Generierung in 4 Schritten, schnell | Apache 2.0 | ~$0.001 |
| FLUX.1 [dev] | Black Forest Labs | Aug. 2024 | 12B | Qualität nahe an Pro | Nicht kommerziell | ~$0.002 |
| SD 3.5 Large | Stability AI | Okt. 2024 | 8B | Textdarstellung, vielfältige Stile | Stability-Lizenz | ~$0.002 |
| SD 3.5 Large Turbo | Stability AI | Okt. 2024 | 8B | 4 Schritte, schnell | Stability-Lizenz | ~$0.001 |
| HiDream-I1 | HiDream.ai | Apr. 2025 | 17B | Hohe Qualität, Full/Dev/Fast-Varianten | MIT | ~$0.002 |
| CogView4 | Tsinghua / Zhipu | März 2025 | 6B | Native chinesische Schrift, bis zu 2048px | Apache 2.0 | ~$0.002 |
| Qwen-Image | Alibaba | Aug. 2025 | 20B | Erstklassige Textdarstellung und Bearbeitung | Apache 2.0 | ~$0.002 |
| FLUX.2 | Black Forest Labs | Nov. 2025 | 32B | Text+Bearbeitung, 4MP, mehrere Referenzen | dev: Nicht kommerziell / klein 4B: Apache 2.0 | ~$0.003 |
| Ideogram 4.0 | Ideogram | Juni 2026 | 9.3B | Designarbeiten, Textdarstellung, JSON-Layoutsteuerung | Nicht kommerziell | ~$0.002 |
Direkt ausprobieren: FLUX.1-schnell-Demo ↗ · SD-3.5-Large-Demo ↗ · GitHub (FLUX) ↗
Beispiele ansehen: FLUX-Galerie ↗ · FLUX-LoRA-Galerie ↗ · Replicate-Beispiele ↗
Für die Erstellung von Spiel-Assets
FLUX.1 [schnell] ist das Modell, das du kennen solltest. Die Apache-2.0-Lizenz bedeutet, dass du kommerzielle Spiele veröffentlichen kannst, ohne dir über Lizenzprobleme Sorgen machen zu müssen. Es generiert in nur vier Schritten, sodass du schnell iterieren kannst. Beschreibe, was du möchtest, sieh dir das Ergebnis an, passe es an und wiederhole den Vorgang.
SD 3.5 Large stellt Text endlich korrekt dar. Frühere Versionen verstümmelten jeden Text, den man einfügen wollte. Das ist wichtig für UI-Mock-ups, Beschilderungen im Spiel, Titelbildschirme und überall dort, wo Bilder lesbare Wörter enthalten müssen.
FLUX.2 (Black Forest Labs, November 2025) ist der größere Nachfolger: ein 32B-Modell, das Text-zu-Bild und Bildbearbeitung in einem einzigen Checkpoint vereint. Es bietet eine starke Konsistenz von Figuren und Stilen über mehrere Referenzen hinweg sowie eine zuverlässige Textdarstellung mit bis zu 4 Megapixeln. Das Open-Weight-Modell FLUX.2 [dev] nutzt eine nicht kommerzielle Lizenz. Das größenreduzierte FLUX.2 [klein] (Januar 2026) veröffentlicht seine 4B-Version hingegen unter Apache 2.0, generiert in weniger als einer Sekunde und läuft mit etwa 8GB VRAM. Damit gibt es weiterhin eine kommerziell unbedenkliche Option für veröffentlichungsreife Spielgrafik. Verwende ausdrücklich die 4B-Version von klein: Die größere 9B-Version von klein bleibt unter der nicht kommerziellen FLUX-Lizenz. Quantisierte Pipelines reduzieren die Hardwareanforderungen von [dev] auf GPUs mit 18–24GB.
Zwei weitere offene Optionen solltest du kennen. Chroma1-HD (8.9B, Apache 2.0) ist ein vollständig offener Ableger von FLUX.1-schnell und damit der kommerziell unbedenkliche Weg zu Qualität aus der FLUX-Familie ohne die Lizenz von [dev]. OmniGen2 (Apache 2.0) ist ein vereinheitlichtes Modell, das Text-zu-Bild und anweisungsbasierte Bearbeitung an einem Ort kombiniert. Damit ist es der schnellste Weg, wenn du ein vorhandenes Asset iterativ bearbeitest („Lass das Schwert blau leuchten“), statt bei null anzufangen.
Qwen-Image (Alibaba, August 2025) ist das offene Modell der Wahl, wenn deine Grafik lesbaren Text enthalten muss, etwa auf Schildern, Benutzeroberflächen, Postern oder Gegenstandsbeschriftungen. Es ist ein 20B-Modell unter Apache 2.0 mit erstklassiger Textdarstellung und einer leistungsfähigen Variante für anweisungsbasierte Bearbeitung. Damit ist es kommerziell unbedenklich und ungewöhnlich gut in einem Bereich, mit dem die meisten Bildmodelle noch immer Schwierigkeiten haben. Die Aktualisierung vom Dezember 2025, Qwen-Image-2512, verbesserte die realistische Darstellung von Menschen und das Textlayout und behielt die Apache-2.0-Lizenz bei. Wenn du das Modell selbst hostest, solltest du daher diesen Checkpoint verwenden. Das neuere Qwen-Image-2.0 (Februar 2026) ist ausschließlich über eine API verfügbar.
Ideogram 4.0 (Juni 2026) ist Ideograms erste Veröffentlichung mit offenen Gewichten: ein Diffusion Transformer mit 9,3B Parametern, der für Designarbeiten entwickelt wurde und eine starke mehrsprachige Textdarstellung sowie explizite Layout- und Farbsteuerung über strukturierte JSON-Prompts bietet. Ein Haken, bevor du darauf aufbaust: Der Inferenzcode steht unter Apache 2.0, die Gewichte jedoch unter einer nicht kommerziellen Lizenz. Ohne den Kauf einer kommerziellen Lizenz ist es daher ein Werkzeug für Forschung und Prototyping.
Das Ökosystem rund um Stable Diffusion ist weiterhin unerreicht. ControlNet ermöglicht präzise Kompositionen. Inpainting eignet sich für Korrekturen. LoRA-Fine-Tuning ermöglicht individuelle Stile. FLUX holt auf, doch wenn du heute umfassende Anpassungsmöglichkeiten brauchst, bietet dir das ausgereifte Tooling von SD mehr Möglichkeiten.
So würde ich es einordnen: Für Texturen und Sprites funktionieren beide. Für Concept Art mit konkreten Stilanforderungen eignet sich SD 3.5 mit LoRAs. Für maximale Qualität bei kommerziellen Veröffentlichungen ist FLUX schnell die richtige Wahl.
3D-Generierung
Wenn du schon einmal acht Stunden lang ein Requisit modelliert hast, das in deinem Spiel nur drei Sekunden lang zu sehen ist, ist dieser Abschnitt für dich. Die 3D-Generierung hat sich schon vor einiger Zeit von „interessanter Forschung“ zu einem echten Produktionswerkzeug entwickelt, und 2026 sind die offenen Modelle wirklich gut. Du kannst in weniger als einer Minute von einer Skizze zu einem texturierten Mesh gelangen.
Diese Seite behandelt die offenen Modelle, die du selbst hosten kannst. Wenn du statt eines Modells ein Tool auswählst, vergleicht unser Leitfaden zu den besten KI-Generatoren für 3D-Modelle die gehosteten Optionen (Meshy, Tripo, Rodin, Hi3D) mit den offenen Alternativen – einschließlich Preisen und kommerzieller Nutzungsrechte.
TRELLIS generiert aus einzelnen Bildern texturierte 3D-Meshes mit PBR-Materialien
| Modell | Organisation | Veröffentlicht | Hauptmerkmal | Ausgabe | Kosten/Mesh |
|---|---|---|---|---|---|
| TRELLIS.2-4B | Microsoft | Dez. 2025 | 4 Mrd. Parameter, natives PBR, bis zu 1536³ | Texturiertes Mesh mit Normalen | ~0,03 $ |
| Hunyuan3D 2.1 | Tencent | Juni 2025 | Produktionsreifes PBR, vollständige Gewichte und Trainingscode | Hochauflösendes texturiertes Mesh | ~0,05 $ |
| SAM 3D | Meta | Nov. 2025 | Einzelbild zu 3D (Objekte und menschliche Körper) | Mesh aus einem Foto | ~0,02 $ |
| Stable Fast 3D | Stability AI | Aug. 2024 | Einzelbild → Mesh in ~0,5 s | Schnelles texturiertes Mesh | ~0,001 $ |
| TripoSG | VAST-AI | März 2025 | Rectified-Flow-Formgenerierung mit 1,5 Mrd. Parametern | Hochwertiges Mesh | ~0,01 $ |
| TripoSR | Stability / Tripo | 2024 | Schnelle Rekonstruktion aus einem Einzelbild | Mesh (ohne Textur) | ~0,001 $ |
| UniRig | Tsinghua / Tripo | 2025 | Auto-Rig: Skelett und Skinning-Gewichte | Geriggtes, animierbares Mesh | ~0,01 $ |
Direkt ausprobieren: TRELLIS.2-Demo ↗ · Hunyuan3D-Demo ↗ · InstantMesh-Demo ↗
Beispiele ansehen: TRELLIS.2-Projektseite ↗ · Galerie von 3D AI Studio ↗
Ein Workflow, der tatsächlich funktioniert
Der Ansatz, der bei Kreativen derzeit funktioniert, verkettet mehrere Modelle miteinander. Beginne mit einem generierten oder fotografierten Bild – das spielt keine Rolle. Verarbeite es mit Stable Zero123 oder Wonder3D, um mehrere Ansichten zu erhalten. Übergib diese Ansichten für das Mesh an InstantMesh oder TripoSR. Nutze anschließend TRELLIS.2 oder Hunyuan3D für richtige Materialien.
TRELLIS.2 von Microsoft ist der neue Spitzenreiter für produktionsreife Assets. Es bewältigt Geometrie, an der andere Modelle scheitern: dünne Flächen, Löcher und komplexe Topologie. Die Version mit 4 Mrd. Parametern erzeugt Meshes mit echten PBR-Texturen, nicht bloß Vertex-Farben, die Materialien imitieren.
Bei Stable Fast 3D steht die Geschwindigkeit im Mittelpunkt. Vom Bild zum Mesh dauert es ungefähr eine halbe Sekunde. Das Mesh muss bereinigt und texturiert werden, aber fürs Prototyping? Um herauszufinden, ob eine Idee funktioniert, bevor du Stunden investierst? Unschlagbar. TripoSG ist die nächste Stufe, wenn du aus einem einzelnen Bild sauberere Geometrie erzeugen möchtest.
Hunyuan3D 2.1 ist das offene Modell von Tencent, das du verwenden solltest: Es enthält vollständige Gewichte und Trainingscode sowie produktionsreife PBR-Texturierung. Achte auf die Bezeichnungen, denn sie führen leicht zu Verwirrung. Hunyuan3D 2.5, 3.0 und 3.1 existieren zwar alle, sind jedoch ausschließlich per API und ohne öffentliche Gewichte verfügbar. Beim Self-Hosting endet der Basisgenerator daher weiterhin bei Version 2.1. Tencent hat allerdings zwei nützliche, auf 2.1 basierende Erweiterungen veröffentlicht: Hunyuan3D-Omni ergänzt die Steuerung durch mehrere Bedingungen (Punktwolke, Voxel, Skelett, Begrenzungsrahmen), während Hunyuan3D-Part ein Mesh in bearbeitbare Teile zerlegt. Die Lizenz schließt außerdem die EU, das Vereinigte Königreich und Südkorea aus. Prüfe daher die Bedingungen, bevor du dein Spiel in diesen Regionen veröffentlichst.
SAM 3D (Meta, November 2025) ist der neueste Einstieg: Ein einzelnes Foto wird zu einem 3D-Mesh, wobei separate Modelle für Objekte und menschliche Körper verfügbar sind. In Kombination mit Metas Segmentierungsarbeit kannst du ein Objekt in einem Bild isolieren und nur dieses Objekt rekonstruieren.
UniRig (Tsinghua und Tripo, MIT) schließt die Lücke, auf die alle direkt nach der Mesh-Erstellung stoßen: das Rigging. Es erzeugt für ein Eingabe-Mesh automatisch ein gültiges Skelett und passende Skinning-Gewichte, sodass eine generierte Figur tatsächlich animiert werden kann, anstatt nur als statische Requisite herumzustehen. Kombiniert mit der automatischen Animationsarbeit in SOMA-X von NVIDIA ist eine vollständig generierte und geriggte Figur keine bloße Forschungsdemo mehr.
Das ist eine realistische Erwartung für Indie-Kreative: Erzeuge mit FLUX Konzeptgrafiken, verarbeite sie für die Geometrie mit InstantMesh und texturiere sie anschließend in Blender oder nutze TRELLIS für automatisiertes PBR. So benötigst du pro Asset 30–60 Minuten statt 4–8 Stunden. Das ist nicht gar keine Zeit, aber ein echter Unterschied.
Audio und Musik
Die Audiogenerierung hat noch nicht zu Bildern und Videos aufgeschlossen. Dennoch gibt es hier genug, um deine Arbeitsweise zu verändern – besonders beim Prototyping und bei Soundeffekten.
KI-generiertes Musikbeispiel. Beschreibe die gewünschte Stimmung und erhalte passende Musik
| Modell | Organisation | Veröffentlicht | Funktionsweise | Lizenz | Kosten/30 s |
|---|---|---|---|---|---|
| ACE-Step 1.5 | StepFun/ACE Studio | Jan. 2026 | Schnelle Generierung von ~4 Min. Musik, 19 Sprachen, Stimmklonen | MIT | ~0,02 $ |
| Stable Audio 3.0 | Stability AI | Mai 2026 | Songs von bis zu ~6 Min.; offene Modelle Small, Small-SFX und Medium | Stability Community | ~0,02 $ |
| YuE | MAP | Jan. 2025 | Vollständige Songs aus Liedtexten, Gesang und Begleitung | Apache 2.0 | ~0,05 $ |
| MusicGen | Meta | 2023 | Text zu Musik, steuerbar | Code MIT / Gewichte CC-BY-NC | ~0,01 $ |
| DiffRhythm 2 | ASLP-lab | Feb. 2026 | Schnelle Generierung vollständiger Songs | Apache 2.0 | ~0,02 $ |
| Magenta RealTime | Juni 2025 | Echtzeitmusik, durch Prompts steuerbar | Code Apache / Gewichte CC-BY | ~0,02 $ |
Direkt ausprobieren: MusicGen-Demo ↗ · AudioCraft-Playground ↗
Beispiele ansehen: MusicGen-Beispiele ↗ · AudioGen-Beispiele ↗
Was du tatsächlich veröffentlichen kannst
MusicGen von Meta ist weiterhin eine praktische Wahl für das Prototyping von Spielaudio. Beschreibe die gewünschte Stimmung und erhalte passende Musik; das Modell läuft problemlos auf einer GPU mit 12 GB. Bei der Lizenz gibt es allerdings einen Haken: Der MusicGen-Code steht unter MIT, die Modellgewichte dagegen unter CC-BY-NC (nicht kommerziell). Nutze es daher zum Prototyping und wechsle für alles, was du veröffentlichst, zu einem kommerziell lizenzierten Modell wie ACE-Step oder Stable Audio.
Das offene Soundeffekt-Modell von Stable Audio (Small-SFX) verarbeitet Schritte, knarrende Türen, Windgeräusche und mechanische Klänge, läuft lokal und wird unter der Community-Lizenz von Stability angeboten. Damit ist es die erste Wahl unter den offenen SFX-Modellen, wenn du Sounds benötigst, die du tatsächlich kommerziell nutzen kannst. Es ist vorzuziehen, weil die anderen offenen SFX-Modelle Einschränkungen mitbringen: Metas AudioGen steht unter CC-BY-NC und TangoFlux unter der nicht kommerziellen Community-Lizenz von Stability. Für ein veröffentlichtes Spiel sind beide daher nur fürs Prototyping geeignet.
Magenta RealTime (Google) ist im besten Sinne der Sonderling: Es ist das einzige Open-Weights-Modell, das für in Echtzeit erzeugte und kontinuierlich per Prompt steuerbare Musik entwickelt wurde. Anstatt einen fertigen Track zu rendern, generiert es Musik live, die du während der Wiedergabe beeinflussen kannst. Das entspricht genau einem adaptiven Spiel-Soundtrack, der sich an die Aktionen der Spielenden anpasst. Der Code steht unter Apache 2.0 und die Gewichte unter CC-BY; beides eignet sich für die kommerzielle Nutzung.
YuE ist wirklich spannend. Es ist das erste offene Modell, das vollständige Songs mit Gesang generiert. Titelsongs. Hintergrundmusik mit echtem Gesang. Die Qualität schwankt, doch es ist allem, was du sonst herunterladen und selbst ausführen kannst, meilenweit voraus.
ACE-Step ist das offene Musikmodell, das du jetzt kennen solltest, und es hat sich schnell weiterentwickelt: Die 1.5-Reihe (Januar 2026, einschließlich einer größeren 5B-XL-Variante) ersetzt die ursprüngliche Version vom Mai 2025 und steht nun unter der MIT-Lizenz. Sie generiert schnell mehrere Minuten Musik, unterstützt 19 Sprachen und beherrscht Stimmklonen, Remixen und die Bearbeitung von Liedtexten. Beim Prototyping von Spielen schließt sie viele der Lücken, die YuE und MusicGen offengelassen haben.
Stable Audio 3.0 (Mai 2026) ist das größere Update für Sound. Es kann Songs von bis zu ungefähr sechs Minuten erzeugen, und Stability veröffentlichte offene Gewichte für drei der vier Varianten: Small und das speziell für Soundeffekte entwickelte Small-SFX laufen beide direkt auf dem Gerät, während Medium eine bessere musikalische Struktur und die volle Tracklänge bietet. Nur das Large-Modell blieb auf die API beschränkt. Small-SFX ist nun die stärkste offene Option speziell für Spiel-SFX. Die gesamte Modellfamilie wurde mit lizenzierten Daten trainiert, sodass die rechtliche Grundlage klarer ist als bei Musikgeneratoren mit ungeklärten Rechtsstreitigkeiten.
Die ehrliche Einschätzung: Der Abstand zwischen offenen und geschlossenen Modellen (Suno, Udio) wird kleiner, ist bei vollständigen Songs mit Gesang aber weiterhin deutlich – und auch bei diesen geschlossenen Werkzeugen sind Rechtsstreitigkeiten über Trainingsdaten noch nicht geklärt. Bei Soundeffekten sind offene Modelle, insbesondere das SFX-Modell von Stable Audio, wirklich konkurrenzfähig. Bei Songs, die du veröffentlichen möchtest, solltest du mit vielen Iterationen rechnen oder für die Endproduktion einen Musiker oder eine Musikerin hinzuziehen und diese Werkzeuge für alles andere verwenden.
Sprache und Stimmen
Die Stimmerzeugung ist inzwischen weit über „gut genug für Spiele“ hinaus, und das verändert die Möglichkeiten kleiner Teams.
KI-generierter Spielkommentar mit natürlicher Sprache, passendem Tempo und Emotionen
| Modell | Organisation | Veröffentlicht | Hauptmerkmal | Lizenz | Kosten/Min. |
|---|---|---|---|---|---|
| Qwen3-TTS | Alibaba | Jan. 2026 | Stimmklonen mit 3 s Audiomaterial, Stimmgestaltung, 10 Sprachen | Apache 2.0 | ~0,002 $ |
| Chatterbox | Resemble AI | 2025 | Emotionssteuerung, Klonen aus ~5 s, 23 Sprachen | MIT | ~0,003 $ |
| CSM | Sesame AI | März 2025 | Natürlicher Gesprächsfluss und natürliche Pausen | Apache 2.0 | ~0,005 $ |
| Fish Speech 1.5 | Fish Audio | 2024 | Zero-Shot-Klonen aus 10–30 s | Code Apache / Gewichte CC-BY-NC-SA | ~0,002 $ |
| OpenVoice V2 | MyShell/MIT | Apr. 2024 | Emotions- und Akzentsteuerung | MIT | ~0,003 $ |
| XTTS-v2 | Coqui (Community) | 2024 | 17 Sprachen, Stimmklonen | CPML (nicht kommerziell) | ~0,005 $ |
Beispiele anhören: Stimmen von Fish Audio ↗ · OpenVoice-Demo ↗
So klingen NPCs wie echte Menschen
CSM (Conversational Speech Model) von Sesame wurde speziell für Dialoge entwickelt. Es erzeugt natürliche Pausen. Wechsel in der Intonation. Den Rhythmus echter Gespräche. Die meisten TTS-Systeme klingen, als würde jemand ein Skript vorlesen, und das hört man sofort. CSM klingt wie ein Mensch, der tatsächlich spricht. Dieser Unterschied ist wichtiger, als du vielleicht denkst.
Qwen3-TTS (Alibaba, Januar 2026) ist die beste Wahl für kommerzielle Projekte. Die gesamte Modellfamilie steht unter Apache 2.0, klont Stimmen aus ungefähr drei Sekunden Referenzmaterial, spricht zehn Sprachen und unterstützt eine beschreibungsbasierte Stimmgestaltung. So kannst du die Stimme eines NPCs in normaler Sprache festlegen, anstatt nach passenden Referenzaufnahmen zu suchen. Die Modelle mit 0,6 und 1,7 Mrd. Parametern laufen auf moderater Hardware.
Chatterbox (Resemble AI) ist die Wahl für ausdrucksstarke Stimmen und steht unter der MIT-Lizenz, sodass du es in veröffentlichten Spielen einsetzen kannst. Es klont eine Stimme aus ungefähr fünf Sekunden Audiomaterial, läuft mit einer Latenz von weniger als 200 ms, unterstützt 23 Sprachen und ist das erste offene Modell mit einer Steuerung zur Verstärkung von Emotionen. Dadurch kann ein NPC tatsächlich wütend oder verängstigt klingen, anstatt ausdruckslos zu bleiben. Zwei weitere Optionen unter Apache 2.0 decken bestimmte Nischen ab: Orpheus (Canopy) verarbeitet eingebettete Emotions-Tags wie <laugh> und <sigh>, die sich sauber auf kurze NPC-Sprachzeilen abbilden lassen, und bietet eine Variante mit 150 Mio. Parametern für schwächere Hardware. Dia (Nari Labs) ist dagegen für Dialoge mit mehreren Sprechenden und nonverbale Geräusche wie Husten und Lachen in einem einzigen Durchlauf ausgelegt.
Fish Speech und OpenVoice übernehmen das Stimmklonen. Nimm 10–30 Sekunden einer Synchronstimme auf und generiere anschließend unbegrenzt viele Dialogzeilen in dieser Stimme. Überlege, was das bedeutet: Du kannst Sprecherinnen oder Sprecher für zentrale Zeilen engagieren und ihre Darbietung anschließend auf Hunderte Varianten und Umgebungsdialoge ausweiten. Ein Lizenzhinweis zu Fish Speech: Der Code ist offen, die Gewichte von Version 1.5 stehen jedoch unter CC-BY-NC-SA. Damit ist es ein Werkzeug fürs Prototyping. Verwende für veröffentlichte Spiele stattdessen OpenVoice (MIT) oder Qwen3-TTS (Apache 2.0).
NVIDIA ACE (nicht vollständig offen, aber dennoch erwähnenswert) unterstützt inzwischen Qwen3-8B für die lokale Bereitstellung von NPCs. Lokales LLM, lokales TTS und Lippensynchronisation – alles läuft auf Consumer-GPUs. Das ist der passende Stack für NPC-Gespräche in Echtzeit, die keine Cloud-Aufrufe benötigen.
Der sinnvolle Ansatz für Indie-Kreative: Engagiere Sprecherinnen und Sprecher für Hauptfiguren und die wichtigsten Dialogzeilen. Nutze Qwen3-TTS oder OpenVoice, um Umgebungsdialoge, Varianten und all die beiläufigen Zeilen abzudecken, die sonst stumm bleiben oder unerschwinglich teuer wären.
Weltmodelle und Spielsimulation
Hier wird es wirklich seltsam – und wirklich spannend. Diese Modelle generieren keine statischen Assets. Sie generieren Erlebnisse, die sich wie Spiele anfühlen.
🎮 Oasis spielen: KI-generiertes MinecraftWelterzeugung in Echtzeit ohne Spiel-Engine – nur durch KI-Vorhersagen | Modell | Organisation | Veröffentlicht | Funktion | Status | Kosten/Frame | |-------|-----|----------|--------------|--------|------------| | [**DIAMOND**](https://github.com/eloialonso/diamond) | Forschung | 2024 | Diffusions-Weltmodell, Atari-Simulation | Offene Gewichte | ~$0.001 | | [**Oasis**](https://github.com/etched-ai/open-oasis) | Decart/Etched | Okt. 2024 | Minecraft-Generierung in Echtzeit | Gewichte der 500M-Version offen | ~$0.002 | | [**MineWorld**](https://huggingface.co/microsoft/mineworld) | Microsoft | Apr. 2025 | Minecraft in Echtzeit, offene Oasis-Alternative | MIT | ~$0.002 | | [**Hunyuan-GameCraft**](https://huggingface.co/tencent/Hunyuan-GameCraft-1.0) | Tencent | Aug. 2025 | Interaktives Spielvideo, Steuerung per Tastatur/Maus | Tencent Community | ~$0.005 | | [**GameGen-X**](https://github.com/GameGen-X/GameGen-X) | Forschung | 2024 | Open-World-Videogenerierung | Offener Code + Datensatz | ~$0.005 | | [**NVIDIA Cosmos**](https://huggingface.co/nvidia/Cosmos-Predict2.5-2B) | NVIDIA | Okt. 2025 | Simulation physischer KI (Predict2.5) | NVIDIA Open Model License | ~$0.01 | | [**Matrix-Game 3.0**](https://github.com/SkyworkAI/Matrix-Game) | Skywork | März 2026 | Interaktive 720p-Welten in Echtzeit, Langzeitgedächtnis | Offene Gewichte | ~$0.005 | | [**Genie 2**](https://deepmind.google/blog/genie-2-a-large-scale-foundation-world-model/) | DeepMind | Dez. 2024 | Interaktives 3D aus Bildern | Nicht veröffentlicht | k. A. | | [**Genie 3**](https://deepmind.google/blog/genie-3-a-new-frontier-for-world-models/) | DeepMind | Aug. 2025 | 720p-Welten in Echtzeit, Ereignisse per Prompt | Geschlossen (Project Genie) | k. A. |
Zur Forschung: DIAMOND-Projektseite ↗ · Cosmos-Blog ↗
Ausprobieren: Oasis-Live-Demo ↗ · Genie-2-Beispiele ↗
Warum das für dich wichtig ist
DIAMOND hat etwas bewiesen, das verändert, wie du über Spiele-KI denkst. Du kannst einen Agenten vollständig innerhalb einer generierten Welt trainieren. Für das Training ist keine echte Spiel-Engine nötig. Die KI spielt in der Vorstellung eines Diffusionsmodells und überträgt das Gelernte anschließend auf das echte Spiel. Die Auswirkungen sind erheblich.
Oasis führt eine Minecraft-ähnliche Welt in Echtzeit aus. Frame für Frame. Keine Spiel-Engine, keine Texturen, keine vorgefertigten Assets. Nur ein Transformer, der vorhersagt, was als Nächstes kommt. Es ist ein Machbarkeitsnachweis, doch stell dir vor, wohin das führt. Die Version mit 500 Millionen Parametern ist bereits offen.
GameGen-X hat den größten Datensatz für Open-World-Spielvideos veröffentlicht. Wenn du eigene Modelle trainieren oder bestehende Modelle für die Erzeugung spielähnlicher Inhalte feinabstimmen möchtest, ist das dein Ausgangspunkt.
NVIDIA Cosmos wurde für Robotik und autonome Fahrzeuge entwickelt, doch die World-Foundation-Modelle eignen sich auch für Spiele. Sie verstehen Physik. Objektpermanenz. Räumliche Beziehungen. Die aktuelle offene Reihe ist Cosmos-Predict2.5, veröffentlicht im Oktober 2025 unter der NVIDIA Open Model License, die kommerzielle Nutzung und abgeleitete Werke erlaubt.
Hunyuan-GameCraft (Tencent, August 2025) ist das offene Weltmodell, das am unmittelbarsten auf Spiele zugeschnitten ist. Es wurde mit mehr als einer Million Aufzeichnungen aus über 100 AAA-Spielen trainiert und vereinheitlicht Tastatur- und Mauseingaben in einem gemeinsamen Steuerungsraum. Dadurch erzeugt es interaktive Spielvideos, die du tatsächlich steuerst, statt sie nur anzusehen. Es steht unter derselben Tencent Community License wie Hunyuan3D, einschließlich desselben Ausschlusses der EU, des Vereinigten Königreichs und Südkoreas. Prüfe daher vor einer Veröffentlichung in diesen Regionen die Bedingungen. MineWorld (Microsoft, MIT) ist das vollständig freizügig lizenzierte Gegenstück zu Oasis: ein Minecraft-Weltmodell in Echtzeit, das du ohne Spiel-Engine herunterladen und ausführen kannst.
Genie 3 (DeepMind, angekündigt im August 2025) ist der Sprung, den du im Blick behalten solltest: das erste Weltmodell mit Echtzeitinteraktion, das navigierbare 720p-Welten mit 24 FPS erzeugt, die einige Minuten lang konsistent bleiben, sowie „Welt-Ereignisse per Prompt“, mit denen sich auf Befehl das Wetter ändern oder Objekte hinzufügen lassen. Im Januar 2026 wurde es als Project Genie für Google-AI-Ultra-Abonnenten in den USA öffentlich zugänglich. Die Gewichte bleiben geschlossen, aber es zeigt, wohin sich spielbare, generierte Welten entwickeln.
Matrix-Game 3.0 (Skywork, März 2026) ist die offene Antwort auf Genie. Es ist ein speichererweitertes interaktives Weltmodell, das 720p in Echtzeit mit 40 FPS streamt und Szenen über minutenlange Sequenzen hinweg konsistent hält. Eine destillierte 5B-Version bewältigt Echtzeit-Inferenz, eine größere 2x14B-MoE-Version steigert die Qualität, und die Gewichte stehen auf Hugging Face unter Apache 2.0 bereit. Wenn du heute mit spielbaren generierten Welten experimentieren möchtest, anstatt auf DeepMind zu warten, kannst du dieses Modell tatsächlich herunterladen.
Für die praktische Spieleentwicklung sind dies heute noch Forschungswerkzeuge. Wenn du jedoch an KI-gesteuerten Inhalten oder prozeduraler Generierung arbeitest oder einfach darüber nachdenkst, wohin sich all das entwickelt, dann ist dies der aktuelle Stand der Forschung.
Große Sprachmodelle
LLMs treiben Dialoge, Quest-Generierung und Spiellogik an. Und die offenen Optionen können inzwischen tatsächlich mit GPT-4 konkurrieren. Vor zwei Jahren war das noch nicht der Fall.
| Modell | Organisation | Veröffentlicht | Größe | Am besten geeignet für | Lizenz | Kosten/1K Token |
|---|---|---|---|---|---|---|
| DeepSeek-V3 | DeepSeek | Dez. 2024 | 671B MoE (37B aktiv) | Schlussfolgern, allgemeine Aufgaben | Freizügig | ~$0.02 |
| DeepSeek-R1 | DeepSeek | Jan. 2025 | Basiert auf V3 | Gedankenkette | Freizügig | ~$0.03 |
| DeepSeek-V3.2 | DeepSeek | Dez. 2025 | Sparse Attention (DSA) | Schlussfolgern + Werkzeugnutzung | MIT | ~$0.02 |
| DeepSeek-V4 | DeepSeek | Apr. 2026 | 1.6T MoE (49B aktiv) | Fortschrittlichstes Schlussfolgern, 1M Kontext | MIT | ~$0.02 |
| GLM-5 | Zhipu / Z.ai | Feb. 2026 | 744B MoE (40B aktiv) | Programmierung, Agenten, Werkzeugnutzung | MIT | ~$0.02 |
| GPT-OSS | OpenAI | Aug. 2025 | 120B / 20B MoE | Schlussfolgern, Werkzeugnutzung, auf dem Endgerät | Apache 2.0 | ~$0.01 |
| Kimi K2 | Moonshot | 2025 | 1T MoE (32B aktiv) | Agenten, Programmierung | Modifiziertes MIT | ~$0.02 |
| Kimi K3 | Moonshot | Juli 2026 | 2.8T MoE (~50B aktiv) | Fortschrittliche Agenten, Programmierung, 1M Kontext, Bildverständnis | Offene Gewichte (27. Juli) | ~$0.03 |
| Gemma 3 | 2025 | 1B-27B | Auf dem Endgerät, 140 Sprachen, Bildverständnis | Gemma | ~$0.01 | |
| Qwen3 | Alibaba | 2025 | 235B MoE (22B aktiv) | Mehrsprachigkeit, Code | Apache 2.0 | ~$0.01 |
| Qwen3-Coder | Alibaba | 2025 | 480B MoE (35B aktiv) | Agentengestützte Programmierung, 256K Kontext | Apache 2.0 | ~$0.02 |
| Llama 4 | Meta | 2025 | Verschiedene | Agenten, bis zu 10M Kontext | Llama Community | ~$0.01 |
| Qwen3-VL | Alibaba | 2025 | 2B-235B | Bildverständnis + Sprache | Apache 2.0 | ~$0.02 |
| InternVL3 | Shanghai AI Lab | 2025 | 1B-78B | Bildverständnis, OCR, UI-Verankerung | MIT | ~$0.02 |
Erste Schritte: Qwen3-8B auf HuggingFace ↗ · DeepSeek-V3 auf HuggingFace ↗ · GLM-5 auf HuggingFace ↗
Für die Spieleentwicklung
Qwen3 ist für die meisten Anwendungen in Spielen die pragmatische Wahl. Die Apache-2.0-Lizenz bedeutet, dass deine Integration dir gehört. Die starke Mehrsprachigkeit ist wichtig, wenn du über Lokalisierung nachdenkst. Das Modell kann strukturierte Anweisungen gut befolgen. Die Varianten 7B und 14B laufen lokal auf Consumer-GPUs.
DeepSeek-V3 erreicht oder übertrifft GPT-4 in den meisten Benchmarks. Die Architektur ist clever: Trotz insgesamt 671 Milliarden Parametern werden pro Token nur 37 Milliarden aktiviert. Du benötigst leistungsfähige Hardware mit mehreren GPUs, erhältst aber Spitzenqualität ohne Abhängigkeit von einer API.
DeepSeek-V3.2 (Dezember 2025) vereint Schlussfolgern und Werkzeugnutzung in einem Modell und führt DeepSeek Sparse Attention (DSA) für kostengünstigere Inferenz mit langen Kontexten ein. Hinzu kommt eine rechenintensive Speciale-Variante, die auf die anspruchsvollsten Reasoning-Benchmarks zielt. Für Spiellogik und Dialoge ist es ein stärkerer, agentenfähigerer direkter Ersatz für V3.
DeepSeek-V4 (April 2026) hat die Grenzen offener Modelle erneut verschoben. V4-Pro ist ein MoE mit 1,6 Billionen Parametern, von denen pro Token nur 49 Milliarden aktiv sind, einem Kontextfenster von einer Million Token und auswählbaren Reasoning-Modi – alles unter MIT. Die Variante V4-Flash (insgesamt 284B, davon 13B aktiv) behält den 1M-Kontext in einem Paket bei, das keinen vollständigen GPU-Cluster verlangt. Wenn du heute ein offenes Modell für komplexe Quest-Logik oder umfangreichen Spielzustandskontext auswählst, markiert dies die Obergrenze.
GLM-5 (Zhipu AI, Februar 2026) ist das derzeit führende offene Modell für Programmierung und Agentenaufgaben, und die Aktualisierung GLM-5.2 hat seine Werte bei Werkzeugnutzung und langfristiger Planung nahe an die geschlossene Spitzengruppe gebracht. Es ist ein MoE mit 744 Milliarden Parametern, davon 40 Milliarden aktiv pro Token, einem Kontext von 200.000 Token und einer MIT-Lizenz. Z.ai ist das erste börsennotierte Unternehmen für Foundation-Modelle und bietet seine gehostete API zu aggressiven Preisen an – etwa 1,40 US-Dollar pro Million Eingabe-Token. Wenn du lieber selbst hostest, stehen die Gewichte jedoch auf Hugging Face bereit. Wenn dein Spiel ein LLM für Quest-Skripting, Agenten mit Werkzeugaufrufen oder codegesteuerte Systeme nutzt, ist GLM-5 eine starke OpenAI-Alternative, über die du die volle Kontrolle behältst.
GPT-OSS (OpenAI, August 2025) ist die erste Veröffentlichung offener Gewichte von OpenAI und passt genau zum Thema dieses Leitfadens. Das Modell gpt-oss-120b kann auf einer einzelnen 80-GB-GPU ungefähr auf o4-mini-Niveau schlussfolgern und Werkzeuge aufrufen. gpt-oss-20b läuft dagegen auf einer Consumer-Grafikkarte mit 16 GB. Beide stehen unter Apache 2.0. Wenn du für NPC-Logik oder Agenten mit Werkzeugnutzung ein Modell aus einem westlichen Forschungslabor selbst hosten möchtest, ist dies die richtige Wahl.
Kimi K2 (Moonshot) ist neben GLM-5 und DeepSeek das andere offene Schwergewicht für Agentenaufgaben. Es ist ein MoE mit einer Billion Parametern, davon 32 Milliarden aktiv, und wurde intensiv für Programmierung und Werkzeugnutzung optimiert. Seine modifizierte MIT-Lizenz fügt erst ab 100 Millionen monatlichen Nutzern Einschränkungen hinzu, sodass sie für Indie-Entwickler praktisch einer MIT-Lizenz entspricht. Nutze es, wenn ein Agent über viele Schritte hinweg planen muss.
Kimi K3 (Moonshot, Juli 2026) ist das größte jemals angekündigte Modell mit offenen Gewichten und kommt der geschlossenen Spitzengruppe näher als jedes offene Modell zuvor. Es ist ein MoE mit 2,8 Billionen Parametern, von denen pro Token nur etwa 50 Milliarden aktiv sind (16 von 896 Experten), einem Kontext von einer Million Token und nativem Bildverständnis. Es basiert auf zwei neuen Attention-Konzepten namens Kimi Delta Attention und Attention Residuals. Laut Moonshots Zahlen übertrifft es Claude Opus 4.8 und GPT-5.5 bei Programmier- und Agenten-Benchmarks und liegt nur hinter den allerbesten proprietären Modellen. Der Haken ist die Größenordnung: Die Gewichte erscheinen am 27. Juli 2026 und umfassen in MXFP4 ungefähr 1,4 TB. Selbsthosting erfordert daher einen GPU-Cluster mit mehreren Knoten, und die meisten Teams werden über die API darauf zugreifen – für 3 US-Dollar pro Million Eingabe-Token und 15 US-Dollar pro Million Ausgabe-Token. Für Agenten, die du tatsächlich selbst ausführen kannst, bleibt K2 die pragmatische Wahl von Moonshot. K3 definiert jedoch neu, was „offen“ im Spitzensegment bedeuten kann.
Gemma 3 (Google) eignet sich am besten, wenn das Modell auf der Hardware der Spieler laufen oder umfassend lokalisiert werden soll. Es ist in den Größen 1B, 4B, 12B und 27B erhältlich und skaliert damit von einer Grafikkarte mit 8 GB aufwärts. Es beherrscht 140 Sprachen und Funktionsaufrufe, und die Varianten ab 4B können auch Bilder verarbeiten, sodass sie zugleich als kleine Bildmodelle dienen. Die Gemma-Lizenz erlaubt die kommerzielle Nutzung.
Qwen3-Coder (Alibaba) ist das spezialisierte offene Programmiermodell und ersetzt für die meisten Anwendungsfälle die ältere DeepSeek-Coder-Reihe. Es ist ein 480B-MoE mit 35B aktiven Parametern, einem nativen Kontext von 256K, der auf 1M erweitert werden kann, und steht unter Apache 2.0. In Benchmarks für agentengestützte Programmierung liegt es in der Klasse von Claude Sonnet. Wenn dein Spiel Code generiert oder ausführt, ist dies die offene Obergrenze. Europas Mistral-Familie – Devstral fürs Programmieren und Mistral Small 3.x für den Einsatz auf Endgeräten, beide unter Apache 2.0 – ist eine solide, selbst hostbare Alternative.
Qwen3-VL ergänzt Bildverständnis und bietet unter Apache 2.0 dichte sowie MoE-Varianten von 2B bis 235B. Es eignet sich für Spiele, die Screenshots analysieren, von Spielern gezeichnete Inhalte verstehen oder Kameraeingaben verarbeiten müssen. Die 8B-Variante läuft auf einer einzelnen GPU. InternVL3 (Shanghai AI Lab, MIT) ist die andere starke offene Vision-Language-Option und besonders gut bei OCR und UI-Verankerung. Das ist wichtig, wenn deine Werkzeuge Spieloberflächen lesen müssen. Mistrals Pixtral 12B (Apache 2.0) ist eine leichtere, kommerziell sicher nutzbare Wahl.
Für NPCs auf dem Endgerät – Figuren, die ohne Cloud-Aufrufe in Echtzeit reagieren – ist Qwen3-8B über NVIDIA ACE derzeit der pragmatischste Weg. Es läuft parallel zu deinem Spiel auf der Hardware der Spieler.
Hilfsmodelle
Diese Modelle erzeugen nicht direkt Inhalte, sorgen aber dafür, dass deine Pipelines funktionieren.
SAM 2 segmentiert beliebige Objekte in Bildern und Videos. Ein Klick genügt für eine perfekte Maske
| Modell | Organisation | Veröffentlicht | Funktion |
|---|---|---|---|
| SAM 2 | Meta | Aug. 2024 | Segmentiert beliebige Inhalte in Bildern und Videos |
| Depth Pro | Apple | Okt. 2024 | Metrische Tiefe aus einem einzelnen Bild |
| gsplat | Nerfstudio | 2024+ | Gaussian Splatting, CUDA-beschleunigt |
SAM 2 segmentiert Objekte in Videos in Echtzeit. Klicke auf etwas und du erhältst eine perfekte Maske. Das ist nützlich für Rotoskopie, Compositing oder das Extrahieren von Objekten aus Filmmaterial, um sie als Spiel-Assets zu verwenden. SAM 2 ausprobieren ↗
Depth Pro von Apple erzeugt in weniger als einer Sekunde metrische Tiefenkarten aus einzelnen Bildern. Das eröffnet viele Möglichkeiten: 2D-Grafiken mit Parallaxeneffekten in 2,5D umzuwandeln, Tiefendaten für die 3D-Rekonstruktion zu erzeugen und Normal Maps aus flachen Bildern zu erstellen. Depth Pro auf HuggingFace ↗gsplat ist die schnelle Implementierung von Gaussian Splatting. Wenn du reale Umgebungen für Spiele erfasst – ob per Photogrammetrie oder Umgebungsscan –, macht diese Bibliothek den Einsatz in der Praxis möglich.
Was ich tatsächlich verwenden würde
Wenn du heute ein Spieleprojekt startest, ist dieser Stack sinnvoll:
Texturen und Sprites: FLUX.1 [schnell], Apache 2.0, schnelle Iterationen, veröffentlichungsreife Qualität
Concept Art: SD 3.5 Large mit LoRAs zur Stilsteuerung
3D-Assets: Hunyuan3D 2.1 oder TRELLIS.2 für texturierte Meshes, SAM 3D, wenn du mit einem Foto beginnst, anschließend Blender zur Nachbearbeitung
Auto-Rigging: UniRig oder NVIDIA SOMA-X, um generierte Meshes mit Skeletten und Skinning zu versehen (beide offen), statt sich auf Mixamo zu verlassen
Soundeffekte: Das offene Small-SFX-Modell von Stable Audio, lokal ausführbar und kommerziell lizenziert
Musik: ACE-Step für Prototypen, anschließend einen Komponisten für die finale Produktion hinzuziehen
Stimmen: Qwen3-TTS für Stimmklonen und Umgebungsdialoge (Apache 2.0), Chatterbox (MIT), wenn eine Zeile echte Emotionen braucht, und Synchronsprecher für die wichtigen Zeilen
NPC-Dialoge: Qwen3-8B lokal oder ein selbst hostbares Cloud-LLM (GLM-5 oder DeepSeek-V4) für komplexes Schlussfolgern und den Einsatz von Tools
Video (Zwischensequenzen): Mochi 1 lokal, HunyuanVideo in der Cloud, wenn du finale Qualität brauchst
Der häufigste Fehler bei all dem ist der Versuch, KI für alles einzusetzen. Das sind Werkzeuge, kein Ersatz. Sie verkürzen zeitraubende Arbeitsschritte wie Iterationen, Varianten und Platzhalter-Assets, sodass du deine Zeit in die kreativen Entscheidungen investieren kannst, auf die es wirklich ankommt. In die Elemente, die dein Spiel unverwechselbar machen.
Realitätscheck zur Hardware
Seien wir ehrlich darüber, was du tatsächlich brauchst, um diese Modelle auszuführen:
8GB VRAM (RTX 3060, 4060): SD 1.5/SDXL, Wan 2.1 small, AudioGen, Fish Speech, kleine LLMs (7B quantisiert). Das ist Gaming-Laptop-Niveau und reicht für den Einstieg aus.
12GB VRAM (RTX 3080, 4070): SD 3.5, FLUX schnell, Mochi 1, MusicGen, TripoSR, Qwen 14B quantisiert. Ab hier wird es komfortabel. Die meisten nützlichen Modelle laufen mit dieser Ausstattung.
24GB VRAM (RTX 3090, 4090): Die meisten Modelle mit voller Präzision, InstantMesh und größere LLMs. Wenn du diesen Workflow ernsthaft nutzen willst, ist das der ideale Bereich.
48-80GB VRAM (A100, H100): HunyuanVideo, LTX-2, DeepSeek-V3 und Generierung im Produktionsmaßstab. Enterprise-Hardware. Die kaufst du nicht, sondern mietest sie.
Cloud-Instanzen bei RunPod, Lambda Labs oder Modal kosten für A100-GPUs 2–4 US-Dollar pro Stunde. Bei gelegentlicher Nutzung ist das günstiger als eigene Hardware. Starte eine Instanz, wenn du finale Qualität brauchst, und fahre sie wieder herunter, sobald du fertig bist.
Zu den Kostenschätzungen in diesem Leitfaden: Die Kosten pro Generierung basieren auf selbst gehosteter Inferenz auf Cloud-GPUs für etwa 2–3 US-Dollar pro Stunde (A100) oder etwa 0,40 US-Dollar pro Stunde (RTX 4090). Die tatsächlichen Kosten variieren je nach Hardware, Optimierung und Batch-Größe. Dies sind grobe Planungswerte, daher können deine tatsächlichen Kosten abweichen.
Was 2026 neu ist
Kürzlich veröffentlicht: LTX-2 und LTX-2.3 ermöglichten offene, synchronisierte Audio-und-Video-Generierung mit nativem 4K. Microsofts TRELLIS.2 (Dezember 2025) wurde zum führenden offenen Bild-zu-3D-Modell, während Metas SAM 3D (November 2025) die 3D-Rekonstruktion aus einem einzelnen Foto praxistauglich machte. FLUX.2 löste FLUX.1 bei der Bildgenerierung ab, und NVIDIAs SOMA-X brachte offenes Auto-Rigging und Retargeting. In der ersten Hälfte des Jahres 2026 blieb das Tempo hoch: Qwen3-TTS (Januar) gab dem Stimmklonen eine solide Heimat unter Apache 2.0, Zhipus GLM-5 (Februar) erschien als offenes Coding- und Agentenmodell mit 744B Parametern unter MIT, Skyworks Matrix-Game 3.0 (März) veröffentlichte ein interaktives Echtzeit-Weltmodell mit offenen Gewichten, DeepSeek-V4 (April) erweiterte offene LLMs unter MIT auf einen Kontext von 1M Token, Stable Audio 3.0 (Mai) veröffentlichte drei offene Audiomodelle, die mit lizenzierten Daten trainiert wurden, und Ideogram brachte sein erstes Bildmodell mit offenen Gewichten heraus (Juni). Im Juli kündigte Moonshot dann Kimi K3 an, ein Modell mit 2,8T Parametern und offenen Gewichten, das Claude Opus 4.8 und GPT-5.5 in Agenten-Benchmarks übertrifft und dessen Gewichte am 27. Juli erscheinen.
Der Trend, den du beobachten solltest: Die führenden Labore stellen ihre neuesten Modelle zunehmend nur noch per API bereit, selbst wenn frühere Versionen offen waren. Wan wurde mit Version 2.5 geschlossen und ist bis einschließlich 2.7 geschlossen geblieben, Qwen-Image wurde mit 2.0 geschlossen und Hunyuan3D mit 2.5. Das offene Ökosystem ist weiterhin lebendig und entwickelt sich schnell, aber „die neueste Version ist offen“ ist keine sichere Annahme mehr. Prüfe daher die Verfügbarkeit der Gewichte, bevor du eine Pipeline um ein Modell herum aufbaust.
Die Entwicklung ist eindeutig: Jede Fähigkeit, die in geschlossenen Modellen existiert, taucht 6–12 Monate später in offenen Modellen auf. Die Frage ist nicht, ob offene Modelle gut genug sein werden. Für die meisten Anwendungsfälle sind sie es bereits. Die Frage ist, wie schnell sie zum Standard werden.
Und für Kreative bedeutet das: Werkzeuge, die früher Enterprise-Budgets oder monatliche Abonnements erforderten, kannst du zunehmend einfach selbst ausführen. Auf deiner eigenen Hardware. Ohne die Erlaubnis anderer.
Das ist der Wandel. Darauf arbeiten wir hin.
Häufig gestellte Fragen
Welches ist das beste Open-Source-KI-Modell zur Generierung von Spiele-Assets?
Das hängt vom Asset ab. Für 3D-Modelle ist Hunyuan3D im Jahr 2026 die stärkste offene Option. Bei 2D-Grafiken und Texturen führt FLUX hinsichtlich der Qualität. Bei Soundeffekten und Musik haben die offenen Audiomodelle schnell aufgeholt. Es gibt kein einzelnes „bestes“ Modell, weil Spiele viele verschiedene Asset-Typen benötigen. Die meisten Kreativen kombinieren deshalb mehrere Modelle, statt sich nur auf eines zu verlassen.
Sind Open-Source-KI-Modelle gut genug, um geschlossene APIs zu ersetzen?
Für die meisten Arbeiten an Spiele-Assets im Jahr 2026: ja. Offene Modelle erreichen bei der Bild-, 3D- und Audiogenerierung inzwischen das Niveau geschlossener APIs. Du kannst sie auf deiner eigenen Hardware ausführen, ohne Gebühren pro Aufruf oder überraschende Preisänderungen. Bei einigen Spitzenaufgaben wie langen Videos liegen geschlossene Modelle noch vorn, aber die Lücke schließt sich üblicherweise innerhalb von 6 bis 12 Monaten.
Kann ich diese generativen KI-Modelle auf meiner eigenen GPU ausführen?
Viele davon schon. Bild- und Audiomodelle laufen problemlos auf einer einzelnen Consumer-GPU wie der RTX 4090. Größere Video- und 3D-Modelle benötigen mehr VRAM und häufig eine Cloud-GPU der A100-Klasse. Der Hardware-Abschnitt weiter oben führt auf, was die jeweiligen Modelle benötigen, damit du planen kannst, bevor du dich festlegst.
Ist es legal, KI-generierte Assets in einem kommerziellen Spiel zu verwenden?
Bei Open-Source-Modellen, die du selbst ausführst, ist das grundsätzlich zulässig. Es hängt jedoch von der Lizenz des Modells und deinen Annahmen zu den Trainingsdaten ab. Prüfe immer die konkrete Modelllizenz und kennzeichne KI-generierte Inhalte, wenn deine Plattform dies verlangt. In unserer Richtlinie für KI-generierte Inhalte erfährst du, wie wir damit umgehen.
Weitere Artikel
- KI-Kontroverse, Vertrauen und die Post-KI-Ökonomie — unsere Haltung zu KI in Spielen
- Richtlinie für KI-generierte Inhalte — wie wir mit der Kennzeichnung von KI umgehen
- Technologie-Stack für Webspiele im Jahr 2026 — WebGL, WebGPU und Wasm für Spiele
- Technologien für offene 3D-Welten im Browser — KI-generierte 3D-Assets in Browserwelten verwenden
- Landschaftsgenerierung für offene Browserwelten — diffusionsbasierte Terrainsynthese
- Wo du kostenlose Spiele-Assets findest — traditionelle Asset-Quellen als Ergänzung zur KI-Generierung
- Agentische KI-Programmierwerkzeuge — KI zum Schreiben von Spielcode, nicht nur zum Generieren von Assets
Generative Modelle machen mehr Spaß, wenn das Ergebnis spielbar ist.