Skip to content

Beste KI-Videomodelle mit Unterstützung für Referenzbilder (2026) ​

Zuletzt aktualisiert: September 2026.

Einen 10-sekündigen Clip zu generieren ist heute einfach. Das kann jedes große Modell. Die eigentliche Frage lautet: Kannst du 5 oder 10 Minuten zusammenhängendes Video erzeugen, in dem ein Charakter in Minute eins genauso aussieht wie in Minute acht? Wo die Szene über Hunderte von Frames hinweg zusammenhält?

Das ist das eigentlich schwierige Problem. Und genau hier bewegt sich gerade viel. Dieser Leitfaden behandelt jedes Modell, das wir gefunden haben und das entweder von Haus aus langes Video generiert oder die Workflows unterstützt, die für Langform-Inhalte mit konsistenten Charakteren durch Referenzbilder nötig sind. Wir teilen sie in drei Stufen ein: Modelle, die direkt minutenlanges Video erzeugen, Modelle mit starker Referenzbild-Unterstützung, die man durch Fortsetzung (Continuation) verlängert, und Open-Source-Optionen, die man selbst betreiben kann.

Stufe 1: Native Langform-Generierung (Minuten+) ​

Diese Modelle erzeugen Video, das in Minuten gemessen wird, nicht in Sekunden. Sie sind von Grund auf für zeitliche Konsistenz über lange Sequenzen gebaut.

LongCat Video ​

Meituan veröffentlichte LongCat Video Ende 2025. Es handelt sich um einen Diffusion-Transformer mit 13,6 Milliarden Parametern - das erste Modell, das zuverlässig zusammenhängendes Video bis zu 15 Minuten Länge erzeugen kann.

Das Modell unterstützt Text-zu-Video, Bild-zu-Video und Video-Fortsetzung in einer einheitlichen Pipeline. Im I2V-Modus wird das Eingabebild zum tatsächlichen ersten Frame des Videos. Es ist keine lose Charakterreferenz, die man in jede beliebige Szene setzen kann. Das Modell animiert ausgehend von diesem Startframe vorwärts und nutzt dabei "Cross-Chunk Latent Stitching", um während der gesamten Generierung weiterhin auf das Originalbild zu verweisen - das verhindert Farbdrift und erhält die visuelle Konsistenz über lange Sequenzen. Eine aktualisierte 2026er-Variante fügt audiogesteuerte Avatar-Generierung mit Lippensynchronisation für 5+ Minuten lange Talking-Head-Videos hinzu.

Unter der Haube nutzt LongCat einen Coarse-to-Fine-Generierungsansatz mit Block Sparse Attention, um die enormen Sequenzlängen zu bewältigen. RLHF-Feinabstimmung verbessert die Bewegungsqualität. Im VBench-2.0-Benchmark liegt es auf Platz drei insgesamt, hinter Google Veo 3 und Shengshus Vidu Q1.

Verfügbarkeit: Open Source unter MIT-Lizenz. Verfügbar über die fal.ai-API zu $0,04 pro generierter Sekunde ($36 für ein 15-minütiges Video in 720p). Auch über LongCats eigene Plattform mit kreditbasierter Preisgestaltung verfügbar.

SpezifikationWert
Maximale Länge~15 Minuten
Auflösung720p bei 30fps
Parameter13,6 Mrd.
ReferenzbilderNur erster Frame (I2V-Modus, keine Charakterreferenz)
LizenzMIT
API-Kosten~$0,04/Sekunde (fal.ai)

Seaweed APT2 ​

ByteDances Seaweed APT2 verfolgt einen anderen Ansatz. Statt ein komplettes Video im Voraus zu erzeugen, produziert es Frames autoregressiv mit 24fps bei nur 0,16 Sekunden Latenz pro Frame auf einer einzelnen H100. Das Ergebnis ist stabiles Video von bis zu 5 Minuten mit zeitlicher Konsistenz, die hält.

Der technische Trick heißt Autoregressive Adversarial Post-Training (AAPT), das ein vortrainiertes bidirektionales Video-Diffusionsmodell in einen unidirektionalen autoregressiven Generator umwandelt. Eine einzige Netzwerk-Vorwärtsberechnung pro Frame - das macht Echtzeit-Generierung überhaupt erst möglich.

Was dieses Modell über die reine Länge hinaus interessant macht, ist die Interaktivität. Man kann die Kamera steuern, Charaktere per Posenerkennung animieren und Szenen manipulieren, während das Video gerendert wird. Man sollte es weniger als "ein Video generieren" verstehen und mehr als "ein Video in Echtzeit steuern".

Verfügbarkeit: Nur Forschungsphase. Noch nicht öffentlich verfügbar. Für das 7B-Basismodell (Seaweed-7B) gibt es ein veröffentlichtes Paper, aber die APT2-Gewichte wurden nicht freigegeben.

SpezifikationWert
Maximale Länge~5 Minuten
Auflösung736x416 (Einzel-GPU), bis zu 720p (8 GPUs)
Parameter8 Mrd.
ReferenzbilderÜber I2V und interaktive Posensteuerung
LizenzNicht veröffentlicht
StatusForschungsvorschau

Helios ​

Helios stammt von der Peking University und baut auf Wan 2.1 auf. Es ist ein Modell mit 14 Mrd. Parametern, das minutenlanges Video mit 19,5 FPS auf einer einzelnen H100 erzeugt. Die zentrale Innovation liegt darin, wie es mit Drift bei langen Videos umgeht. Statt konventioneller Anti-Drift-Techniken wie Self-Forcing oder Keyframe-Sampling simuliert Helios das Driften bereits während des Trainings, sodass das Modell lernt, es zu korrigieren.

Es unterstützt nativ Text-zu-Video-, Bild-zu-Video- und Video-zu-Video-Aufgaben. Der I2V-Modus akzeptiert Referenzbilder, um die Generierung zu initialisieren.

Verfügbarkeit: Vollständig Open Source unter Apache-2.0-Lizenz. Veröffentlicht im März 2026. Code und Gewichte auf GitHub (PKU-YuanGroup/Helios). Integriert in Diffusers, SGLang und vLLM-Omni. Gradio-Demo auf HuggingFace Spaces.

SpezifikationWert
Maximale LängeMinutenmaßstab (keine feste Obergrenze)
Auflösung720p
Parameter14 Mrd.
ReferenzbilderJa (I2V-Modus)
LizenzApache 2.0
HardwareEinzelne H100 für Echtzeit

SkyReels V2 / V3 ​

SkyReels V3 akzeptiert 1-4 Referenzbilder und erzeugt Video unbegrenzter Länge mit Multi-Shot-Wechseln und audiogesteuerter Avatar-Synthese.

Skyworks SkyReels-Reihe zielt auf Video unendlicher Länge ab. V2 nutzt eine AutoRegressive-Diffusion-Forcing-Architektur, die Video ohne feste Längenbegrenzung erzeugt. V3, veröffentlicht im Januar 2026, vereint Referenzbild-zu-Video, Video-zu-Video-Erweiterung und audiogesteuerte Avatar-Generierung in einem einzigen Modell.

V3 akzeptiert 1 bis 4 Referenzbilder und bewahrt die Identität des Subjekts über das gesamte generierte Video hinweg. Der Video-zu-Video-Modus ermöglicht nahtlose Einzel-Shot-Fortsetzung und Multi-Shot-Wechsel mit filmischen Übergängen.

Skywork kündigte SkyReels V4 am 25. Februar 2026 an, ein Dual-Stream-Modell, das Video und Audio gemeinsam mit bis zu 1080p/32fps erzeugt und Text, Bilder, Videoclips, Masken und Audio als Konditionierungs-Eingaben akzeptiert. Eine Korrektur zu unserem Juli-Beitrag: V4 wurde nicht als Open Source veröffentlicht. Stand September 2026 enthält die SkyworkAI-GitHub-Organisation Repos für V1 bis V3 sowie Matrix-Game, aber keine V4-Gewichte oder eine öffentliche API - V3 bleibt damit die offene Referenz-zu-Video-Obergrenze von Skywork.

Verfügbarkeit: Vollständig Open Source. Modelle von 1,3 Mrd. bis 14 Mrd. Parametern. Verfügbar in 540p und 720p. Code und Gewichte auf GitHub und HuggingFace.

SpezifikationWert
Maximale LängeUnbegrenzt (autoregressiv)
Auflösung540p, 720p
Parameter1,3 Mrd., 5 Mrd., 14 Mrd.
Referenzbilder1-4 Bilder (V3)
LizenzOpen Source
HardwareMinimum RTX 4090, empfohlen 4-8x A100

Stufe 2: Kurze Clips mit starker Referenz + Erweiterung ​

Diese Modelle erzeugen 8-60 Sekunden lange Clips, bieten aber starke Referenzbild-Unterstützung und Videoerweiterungs-Funktionen. Für Langform-Inhalte verkettet man Clips mithilfe der Fortsetzungs- oder Erweiterungs-Endpunkte des Modells. Charakterkonsistenz entsteht durch Referenzbilder, die über mehrere Generierungen hinweg erhalten bleiben.

Das ist der praktische Workflow, den die meisten Creator heute für Inhalte verwenden, die länger als eine Minute sind. Die Qualität pro Clip ist oft höher als bei den nativen Langform-Modellen.

Kling 3.0 Omni (Kuaishou) ​

Kling 3.0 Omni kombiniert Charakterelemente, Stilreferenzen und Multi-Shot-Storyboarding in einem einzigen Aufruf mit nativer 4K-60fps-Ausgabe.

Kling verfügt über das vollständigste Referenzbild-System aller Videomodelle. Es unterteilt Referenz-Eingaben in drei unterschiedliche Kategorien, die jeweils einem anderen Zweck dienen:

Referenzbilder (image_urls): Bis zu 4 Bilder zur Stil- und Erscheinungssteuerung. Man taggt sie im Prompt als @Image1, @Image2 usw. Sie beeinflussen den Gesamtlook, den Szenenstil und die Umgebung, ohne der erste Frame zu sein.

Elemente (elements): Dedizierte Charakter-/Objekt-Eingaben. Jedes Element nimmt ein frontal_image_url (klares, frontal aufgenommenes Foto) plus optionale reference_image_urls (zusätzliche Blickwinkel). Man referenziert sie im Prompt als @Element1, @Element2. Das Modell extrahiert die Identität des Charakters und platziert ihn in jeder beliebigen beschriebenen Szene. Das ist die Schlüsselfunktion für Inhalte im Stil von Abenteuerfilmen: ein Charakterfoto hochladen, dann beschreiben, wie er durch einen Wald läuft, gegen einen Drachen kämpft, was auch immer man will.

Start-/End-Frames (start_image_url, end_image_url): Bestimmte Bilder als ersten oder letzten Frame festlegen. Das sind tatsächliche Frames, keine Stilvorgaben.

Die Gesamtzahl über alle drei Kategorien hinweg beträgt bis zu 7 Referenz-Eingaben (reduziert auf 4, wenn zusätzlich ein Referenzvideo genutzt wird). Ein einzelner Prompt wie "@Element1 and @Element2 are having dinner at this table on @Image1" kann Charaktere mit Szenenreferenzen kombinieren.

Für Langform-Inhalte bietet Kling zwei Wege. Der Multi-Shot-Modus erzeugt bis zu 6 Szenen in einem einzigen Aufruf, jede mit eigenem Prompt und eigener Dauer (jeweils 3-15s). Charakterelemente bleiben automatisch über alle Shots hinweg erhalten. Die Erweiterungs-API setzt ein fertiges Video dort fort, wo es endete, und erreicht durch verkettete Erweiterungen etwa 3 Minuten. Der V2V-Bearbeitungsmodus nimmt bestehendes Video (3-10 Sekunden) und transformiert es mithilfe von Elementreferenzen und einem Text-Prompt, wobei Kameraführung und Charakter-Blocking aus der Quelle erhalten bleiben, während Charaktere und Umgebungen auf Basis der Referenzen neu gestylt werden. Das macht Kling besonders nützlich für die Aufwertung bereits vorhandenen Filmmaterials, einschließlich niedrig aufgelöster 3D-Renderings.

Kling 3.0 Omni vereint Text-zu-Video, Bild-zu-Video, Referenz-zu-Video und Videobearbeitung in einem einzigen Modell mit nativer Audiogenerierung und Lippensynchronisation. Im Juni 2026 fügte Kuaishou Kling 3.0 Turbo hinzu, eine schnellere und günstigere Variante mit gebündeltem Audio bei 720p und 1080p, und rüstete Omnis Bearbeitungs-Pipeline so auf, dass sie 4K-Video akzeptiert und ausgibt. Bis September 2026 ist kein Kling 3.5 oder 4.0 erschienen, sodass 3.0 Omni weiterhin das aktuelle Videomodell ist.

Verfügbarkeit: Kommerzielle API über Kuaishou, fal.ai und Replicate, mit Preisen pro Sekunde, die je nach Auflösung und Variante variieren. Web-Oberfläche unter klingai.com.

SpezifikationWert
Native Clip-Länge3-15 Sekunden
Erweiterte Länge~3 Minuten (über verkettete Erweiterungen)
Auflösung720p, 1080p (4K bei Omni-Bearbeitung)
ReferenzbilderBis zu 4 (@Image-Stilreferenzen)
ElementeBis zu 4 (@Element-Charakterreferenzen mit Frontal- + Winkelaufnahmen)
Referenzen gesamtBis zu 7 kombiniert (4 mit Videoreferenz)
Multi-ShotJa (bis zu 6 Shots im Storyboard)
AudioNative synchronisierte Audiospur + Lippensynchronisation
VideobearbeitungJa (textgesteuerte Bearbeitung bestehenden Videos)
APIKuaishou, fal.ai, Replicate

Kling Bild-zu-Video mit mehreren Referenzbildern ​

Das ist die Frage, die uns zu Kling am häufigsten gestellt wird, daher hier die Kurzfassung, wie Multi-Bild-Referenz im aktuellen Modell funktioniert - entnommen aus Klings eigenem VIDEO-3.0-Omni-Leitfaden. Standard-Bild-zu-Video nimmt ein Bild und animiert es als ersten Frame. Multi-Bild-Referenz ist ein anderer Modus: Man lädt mehrere Bilder hoch, taggt sie im Prompt, und das Modell komponiert daraus einen neuen Shot. Ohne Referenzvideo in der Anfrage kann man bis zu 7 Bilder und Elemente kombiniert anhängen, mit Referenzvideo sinkt das auf 4. Ein einzelnes Charakterelement kann selbst aus bis zu 4 Fotos aus unterschiedlichen Blickwinkeln aufgebaut werden, oder aus einem 3 bis 8 Sekunden langen Einzelcharakter-Videoclip, und man kann ihm eine 5 bis 30 Sekunden lange Sprachaufnahme zuweisen, sodass der Charakter über mehrere Shots hinweg dieselbe Stimme behält. Im Prompt bezieht man sich mit @Image1 auf eine Stil- oder Szenenreferenz und mit @Element1 (oder dem Namen, den man dem Element gegeben hat) auf einen festgelegten Charakter oder ein festgelegtes Objekt - ein Prompt wie "@Grace walks through @Image1 at dusk" setzt also einen konsistenten Charakter in eine mitgelieferte Szene. Die Ausgabe läuft bis zu 15 Sekunden bei 720p oder 1080p mit nativem Audio, und dieselbe Elementbibliothek überträgt sich in Klings Multi-Shot-Storyboard, womit man einen Charakter über eine sechsteilige Shot-Sequenz hinweg konsistent hält. Wenn man nur konsistente Standbilder statt Video benötigt, akzeptiert Kling IMAGE 3.0 laut seinem Bild-Leitfaden bis zu 10 Referenzbilder, und ein gängiger Workflow besteht darin, den Charakter dort zuerst festzulegen und diese Standbilder dann als Elemente einzuspeisen.

Grok Imagine (xAI) ​

Grok Imagine trennt den Referenzmodus vom Erster-Frame-Modus und erlaubt es, bis zu 7 Bilder als Charakter- oder Objektreferenzen im Prompt zu taggen.
xAI hat den Referenz-zu-Video-Modus von Grok Imagine Anfang 2026 mit Unterstützung für 1-7 Referenzbilder eingeführt. Die Dokumentation unterscheidet dies ausdrücklich von Image-to-Video: „Im Gegensatz zu Image-to-Video, bei dem das Quellbild zum Startbild wird, beeinflussen Referenzbilder, was im Video erscheint, ohne das erste Bild festzulegen."

Sie markieren Bilder in Ihrem Prompt als <IMAGE_1>, <IMAGE_2> usw. Ein Prompt wie "the model from <IMAGE_1> walks onto the runway wearing the shirt from <IMAGE_2>" kombiniert eine Personenreferenz mit einer Kleidungsreferenz. Das Modell beherrscht virtuelle Anproben, Produktplatzierung und charakterkonsistentes Storytelling über mehrere Szenen hinweg.

Eine Einschränkung: Sie können Referenzbilder nicht mit Image-to-Video in derselben Anfrage kombinieren. Es ist entweder der First-Frame-Modus oder der Referenzmodus, nicht beides.

Grok Imagine verfügt außerdem über einen Video-Erweiterungs-Endpunkt, der neues Filmmaterial an das Ende eines bestehenden Videos anhängt. Der Parameter duration steuert nur den neuen Abschnitt. Sie können Erweiterungen aneinanderreihen, um längere Inhalte zu erstellen.

xAI veröffentlichte Grok Imagine 1.5 am 3. Juni 2026 als API-Vorschau und stellte es am 16. Juni als grok-imagine-video-1.5 allgemein verfügbar, wobei eine Fast-Variante schrittweise in die Consumer-Apps eingeführt wurde. Es handelt sich um ein Image-to-Video-Modell, das ein einzelnes Standbild in eine filmische Bewegung mit Kamerafahrten, Atmosphäre, Physik und nativ generiertem synchronisiertem Audio in demselben Inferenzdurchlauf animiert. Es unterstützt Multi-Shot-Sequenzierung zur Verkettung konsistenter Szenen, erzeugt einen 6-sekündigen 720p-Clip in etwa 25 Sekunden und belegte bei der Einführung Platz drei in der Artificial-Analysis-Image-to-Video-Arena. Stand September 2026 listet xAIs Modellseite Grok Imagine Video 1.5 mit $0,08 pro Sekunde und das ursprüngliche Grok Imagine Video mit $0,05 pro Sekunde. xAIs neueres Grok Imagine Image 2.0 (aufgeführt in den Release Notes) ist ein reines Standbild-Modell, nützlich um einen Charakter festzulegen, bevor man ihn animiert, aber kein neues Videomodell.

Verfügbarkeit: xAI API (gestartet Januar 2026), fal.ai und Replicate. Python SDK, JavaScript/AI SDK und REST API. $0,05/Sek. bei 720p mit Audio. Auch für X-Premium-Abonnenten verfügbar.

SpezifikationWert
Native Clip-Länge1-15 Sekunden
Erweiterte LängeVerkettbar über Erweiterungs-API
Auflösung480p, 720p
Referenzbilder1-7 (echte Referenz, kein First-Frame)
Prompt-Tags<IMAGE_1>, <IMAGE_2> usw.
AudioJa (720p)
VideobearbeitungJa (textgesteuert)
APIxAI API, fal.ai, Replicate
API-Kosten$0,05/Sekunde (Video), $0,08/Sekunde (Video 1.5)

Seedance 2.0 (ByteDance) ​

Seedance 2.0 akzeptiert bis zu 12 multimodale Eingaben gleichzeitig und generiert Video mit nativer Audiosynchronisation und phonembasierter Lippensynchronisation in über 8 Sprachen.

ByteDances Seedance 2.0 akzeptiert die meisten Referenzeingaben aller Modelle: bis zu 12 Dateien gleichzeitig, darunter bis zu 9 Bilder, 3 Videos und 3 Audiodateien. Das Modell unterstützt native Audio-Video-Generierung mit phonembasierter Lippensynchronisation in über 8 Sprachen.

Einzelne Bilder können jeweils bis zu 30 MB groß sein. Referenzvideos müssen 2-15 Sekunden lang sein. Das Modell nutzt die Referenzen für Charakterdarstellung, Szenenstil und Bewegungsführung.

Der nächste Sprung ist inzwischen erfolgt. ByteDance kündigte Seedance 2.5 auf seiner Volcano-Engine-FORCE-Konferenz am 23. Juni 2026 an und veröffentlichte es am 31. Juli 2026. Laut der Ankündigung des Seed-Teams erzeugt es einen einzigen nativen Clip von bis zu 30 Sekunden mit mehrstufigen Erweiterungen, akzeptiert bis zu 30 Bilder, 10 Videoclips und 10 Audioclips als Referenzen in einem Durchgang (50 Dateien, gegenüber 12 zuvor) und fügt eine zeitstempelgenaue Bearbeitung hinzu, mit der Sie einen einzelnen Moment eines Clips ändern können, ohne ihn neu zu generieren. Es erreichte zunächst Jimeng und Doubao, dann die BytePlus-ModelArk-Unternehmens-API, und Drittanbieter zogen schnell nach: Runways API fügte Seedance 2.5 am 7. August 2026 mit Laufzeiten von 4 bis 30 Sekunden und bis zu 30 Referenzbildern hinzu, laut dem Runway-Changelog. Für den narrativen Workflow in diesem Leitfaden entfällt durch eine einzige 30-Sekunden-Aufnahme mit 50 Referenzen ein großer Teil des unten beschriebenen Clip-Zusammensetzens.

Verfügbarkeit: ByteDance-offizielle API (über Volcengine, gestartet Februar 2026) und API-Anbieter von Drittanbietern. Ausgabe in 480p-720p über API, bis zu 2K-Kinoauflösung über die Plattform.

SpezifikationWert
Native Clip-Länge4-15 Sekunden
AuflösungBis zu 2K (Kino)
ReferenzbilderBis zu 9 Bilder + 3 Videos + 3 Audio (12 insgesamt)
Seedance-2.5-Clip-LängeBis zu 30 Sekunden nativ, mit Erweiterungen
Seedance-2.5-ReferenzenBis zu 30 Bilder + 10 Videos + 10 Audio (50 insgesamt)
AudioNativ mit Lippensynchronisation (über 8 Sprachen)
APIByteDance/Volcengine, BytePlus ModelArk (2.5), Runway API (2.5), Drittanbieter

Runway Gen-4.5 ​

Runway Gen-4.5 startete an der Spitze des Artificial-Analysis-Text-to-Video-Leaderboards mit 1.247 ELO, damals vor Veo 3 und Sora 2 Pro. Bis September 2026 hatte sich die Arena neu sortiert (Gemini Omni Flash und Alibabas Wan 3.0 teilen sich die Spitzenposition, Gen-4.5 liegt außerhalb der Top zehn), aber Gen-4.5 bleibt ein starkes Modell für filmische Qualität und kontrollierbare Action, und Runway hat bisher kein Gen-5 veröffentlicht. Das Modell erzeugt 2-10 Sekunden lange Clips für Text-to-Video und unterstützt charakterkonsistentes Langform-Video von bis zu einer Minute durch Multi-Shot-Sequenzierung.

Image-to-Video wurde Anfang 2026 hinzugefügt und unterstützt Referenzbilder für alle Seitenverhältnisse. Runways weitere Schritte in 2026 betrafen eher Bearbeitung und Routing als ein neues Basismodell: Aleph 2.0 (2. Juni 2026) bearbeitet ein bestehendes 2 bis 30 Sekunden langes Video anhand eines Textprompts plus bis zu 5 an Zeitstempeln festgelegten Keyframe-Bildern, Gen-3 Alpha Turbo und das ursprüngliche Gen-4 Aleph wurden am 30. Juli 2026 aus der API entfernt, und die API bedient nun auch Drittanbietermodelle einschließlich Gemini Omni Flash und Seedance 2.5, alles laut dem Runway-Changelog. Das Modell integriert Neural Radiance Fields und Gaussian Splatting innerhalb der Diffusionsarchitektur, was ihm ein 3D-geometrisches Verständnis anstatt reiner Pixel-Vorhersage verleiht. Das bedeutet bessere Objektpermanenz und physikalisch plausible Bewegung.

Verfügbarkeit: Kommerzielle API und Weboberfläche. SDKs für Node und Python. Auch über Replicate verfügbar.

SpezifikationWert
Native Clip-Länge2-10 Sekunden
Langform-ModusBis zu ca. 1 Minute
AuflösungBis zu 1080p
Referenzbilder0-1 pro Generierung
AudioNative Audiogenerierung
Multi-ShotJa
APIJa (Runway, Replicate)

Google Veo 3.1 ​

Googles Veo 3.1 erzeugt nativ 4, 6 oder 8 Sekunden lange Clips. Die Funktion „Extend Video" (derzeit in der Vorschau) verkettet Clips, um etwa 1-2,5 Minuten zu erreichen, obwohl die Kohärenz bei längeren Sequenzen abdriften kann.

Die Funktion „Ingredients to Video" akzeptiert bis zu 3 Referenzbilder als Eingabe. Sie können Charaktere zum Animieren, Hintergründe und Materialtexturen bereitstellen. Wenn Sie Referenzbilder verwenden, hält sich das Modell enger an Ihre visuellen Referenzen und nimmt weniger zufällige Änderungen vor. Eine Einschränkung: Der Referenzbild-Modus funktioniert nur mit der 8-Sekunden-Option.

Seit Januar 2026 hat Veo 3.1 vertikales Video (9:16) für referenzbasierte Generierung sowie 4K-Upscaling auf Vertex AI hinzugefügt. Google folgte am 31. März 2026 mit Veo 3.1 Lite als seinem günstigsten Videomodell, stellte Veo 2.0 und 3.0 am 30. Juni 2026 ein und hat Stand September 2026 kein Veo 4 angekündigt, laut dem Gemini-API-Changelog. Die neueren Videoarbeiten fließen in Gemini Omni Flash unten ein.

Verfügbarkeit: Google Vertex AI API, Gemini API und Google Flow. Erfordert ein Google-Cloud-Konto.

SpezifikationWert
Native Clip-Länge4, 6 oder 8 Sekunden
Erweiterte Länge~1-2,5 Minuten
AuflösungBis zu 4K (mit Upscaling)
ReferenzbilderBis zu 3 („Ingredients to Video")
AudioSynchronisierter Dialog und Musik
APIVertex AI, Gemini API

Google Gemini Omni Flash ​

Google kündigte die Gemini-Omni-Familie im Mai 2026 auf der I/O an und veröffentlichte Gemini Omni Flash als erstes Modell. Es erreichte schnell die Spitzenposition in der Artificial-Analysis-Arena, vor Veo 3.1. Das Konzept ist konversationelles Video: Sie erzeugen einen 10-sekündigen Clip aus Text, Bildern oder Video und bearbeiten ihn dann durch aufeinander aufbauende Folgeanweisungen. Ändern Sie die Beleuchtung, tauschen Sie ein Outfit aus, passen Sie die Kamera an – alles ohne komplette Neugenerierung.

Was die Referenzunterstützung betrifft, akzeptiert Omni Flash Bilder und kurze Videoclips als Stil-, Bewegungs- und Effektreferenzen, wobei Audioreferenzen geplant sind. Die Charakterkonsistenz hält über konversationelle Bearbeitungen hinweg, obwohl Googles eigene Dokumentation darauf hinweist, dass sie bei Szenenwechseln und Kameraschwenks abweichen kann – prüfen Sie charakterlastige Ausgaben daher vor der Veröffentlichung.

Verfügbarkeit: Die API (gemini-omni-flash-preview) wurde am 30. Juni 2026 als öffentliche Vorschau über Google AI Studio und die Gemini API zu etwa $0,10 pro Sekunde Ausgabe verfügbar, und gemini-omni-1.1-flash erreichte am 27. August 2026 mit Video-Erweiterung, Interpolation und Auflösungssteuerung die allgemeine Verfügbarkeit, laut dem Gemini-API-Changelog. Jeder Clip trägt ein SynthID-Wasserzeichen. Der Consumer-Zugang läuft über die Gemini-App, Google Flow und YouTube Shorts, und auch Runways API leitet dorthin weiter.

SpezifikationWert
Native Clip-Länge10 Sekunden (längere Laufzeiten geplant)
Auflösung720p
ReferenzeingabenBilder + kurze Videoclips (Audio geplant)
BearbeitungKonversationell, iterativ
AudioNativ
APIGemini API (GA als gemini-omni-1.1-flash), ~$0,10/Sek.

OpenAI Sora 2 / Sora 2 Pro ​

Wird eingestellt (2026): OpenAI fährt Sora zurück. Die Consumer-App Sora wurde am 26. April 2026 geschlossen, und die Sora-2-API läuft am 24. September 2026 aus, ohne angekündigten Nachfolger, laut OpenAIs Deprecations-Seite. Die unten aufgeführten Funktionen sind weiterhin bemerkenswert, aber bauen Sie keine neue Pipeline auf Sora auf. Verwenden Sie stattdessen Kling, Grok Imagine oder ein offenes Modell.

Sora 2 Pro erzeugt Clips von bis zu 20 Sekunden. Die Characters-API verfolgt einen anderen Ansatz als Kling oder Grok: Statt statische Bilder hochzuladen, erstellen Sie eine character_id, indem Sie die API auf einen Videoclip verweisen (mit einem Zeitstempelbereich von 1-3 Sekunden). Sora analysiert die Videobilder, um Gesichtsstruktur, Körperproportionen, Kleidungsstil und weitere identifizierende Merkmale zu extrahieren. Diese character_id bleibt dauerhaft bestehen und kann in unbegrenzt vielen zukünftigen Generierungen wiederverwendet werden.

Sie können bis zu 2 hochgeladene Charaktere pro Generierung referenzieren. Seit März 2026 funktionieren Charakterreferenzen auch für Objekte und Tiere, nicht nur für Menschen. Die Video-Erweiterung nutzt den gesamten Anfangsclip als Kontext für die Fortsetzung.

Das Charaktersystem erfordert Videoeingaben (keine Standbilder), um Charaktere zu erstellen. Wenn Sie nur Fotos haben, müssten Sie zunächst ein kurzes Video generieren und dann den Charakter daraus extrahieren.

Verfügbarkeit: OpenAI API mit Batch-API-Unterstützung für Produktions-Workflows.

SpezifikationWert
Native Clip-LängeBis zu 20 Sekunden
AuflösungBis zu 1920x1080
CharakterreferenzenBis zu 2 pro Generierung (persistente character_id)
CharaktereingabeVideoclip (Zeitstempelbereich 1-3 Sek.), keine Standbilder
AudioSynchronisiert
ErweiterungJa (vollständiger Clip als Kontext)
APIOpenAI API + Batch API

MiniMax Hailuo 02 ​

Hailuo 02 belegte bei der Einführung weltweit Platz 2 im Artificial-Analysis-Benchmark und schlug damit Veo 3. Es erzeugt 10-sekündige Clips in nativem 1080p mit einer der besten Physiksimulationen im Feld. Das Modell bewältigt extreme Bewegungen wie Gymnastik und Akrobatik, ohne auseinanderzufallen.

Es unterstützt Image-to-Video-Generierung mit starker Charakterkonsistenz durch Gesichtserkennung und Körperverfolgung. Die Noise-aware-Compute-Redistribution-Architektur weist die Rechenleistung dynamisch je nach Szenenkomplexität zu.

MiniMax ist inzwischen über Hailuo 02 hinausgegangen mit der Hailuo-2.3-Familie (Standard, Pro, Fast, Fast Pro), die physische Aktionen, Stilisierung und Charakter-Mikroexpressionen verbessert. Sie gibt 1080p bei 6 Sekunden oder 768p bei 10 Sekunden aus und ist über die MiniMax-Plattform und fal.ai verfügbar.

Verfügbarkeit: Kommerzielle API. Verfügbar über die MiniMax-Plattform, fal.ai und Replicate. $0,28 pro Video.

SpezifikationWert
Native Clip-LängeBis zu 10 Sekunden
Auflösung1080p nativ
ReferenzbilderJa (I2V-Modus)
AudioNicht nativ
PhysikErstklassige Simulation
APIMiniMax, fal.ai, Replicate

MiniMax H3 (Hailuo 3.0) ​

MiniMax hat die Hailuo-2.x-Reihe am 31. Juli 2026 durch MiniMax H3 ersetzt, was Hailuos Stellenwert in diesem Leitfaden verändert. Während Hailuo 02 ein First-Frame-Modell war, ist H3 ein omnimodales Modell: Ein einziger Transformer liest Text, Bilder, Video und Audio gemeinsam und liefert einen 4 bis 15 Sekunden langen Clip mit bis zu 2K und nativem Stereo-Audio, laut MiniMax' Ankündigung. Sein Referenzmodus (Ref2VA) akzeptiert bis zu 9 Referenzbilder, 3 Referenzvideoclips und 3 Audioclips, begrenzt auf 12 Dateien, was es in dieselbe echte-Referenz-Klasse wie Kling und Seedance 2.0 einordnet, und ein First-and-Last-Frame-Modus (FL2VA) deckt den klassischen Keyframe-Workflow ab. In der Artificial-Analysis-Text-to-Video-Arena liegen die Einträge H3 und H3 Max Stand September 2026 knapp hinter Omni Flash und Wan 3.0. Die größere Neuigkeit für Selbst-Hoster ist, dass MiniMax im August 2026 die 33B-Basisgewichte auf Hugging Face veröffentlicht hat, mit sowohl FL2VA- als auch Ref2VA-Checkpoints. Die Lizenz ist die MiniMax H3 Community License, und die Modellkarte bittet Nutzer in den USA, der EU, Großbritannien und Südkorea, vor der Nutzung ein Antragsformular einzureichen – es ist also offen, allerdings mit regionalem Sternchen, statt Apache-artig offen.

Verfügbarkeit: MiniMax API und Plattform, fal.ai und andere Hoster, plus herunterladbare Gewichte.

SpezifikationWert
Native Clip-Länge4-15 Sekunden
AuflösungBis zu 2K (768p Standard-Kurzseite)
ReferenzbilderBis zu 9 Bilder + 3 Videos + 3 Audiodateien (12 insgesamt, Ref2VA)
KeyframesErstes und/oder letztes Bild (FL2VA)
AudioNativ Stereo, 32 kHz
Offene GewichteJa, 33B, MiniMax H3 Community License (Antrag für USA/EU/UK/KR)
APIMiniMax, fal.ai

Luma Ray3.2 ​

Lumas Ray2 wurde von der Ray3-Familie abgelöst. Ray3 (September 2025) fügte Character Reference für Identitätsbindung und einen Modify-Video-zu-Video-Modus hinzu, und Ray3.2 (9. Juni 2026) brachte Frame-genaue Kontrolle mit bis zu 16 Keyframes pro Clip, eine Reframe-Funktion und Clips bis zu 20 Sekunden mit sowie die erste öffentliche API für die Ray3-Linie. Die Ausgabe erfolgt nativ in 1080p, 4K ist über Hi-Fi-Upscale verfügbar. Bild-zu-Video akzeptiert Referenzbilder als Start- oder Endbild.

Verfügbarkeit: Luma API und Web-Oberfläche.

SpezifikationWert
Native Clip-LängeBis zu 20 Sekunden (Ray3.2)
ReferenztypStart-/End-Keyframes + Character Reference (Identität)
Auflösung1080p nativ, 4K via Upscale
ReferenzbilderJa (Keyframes + Charakterreferenz)
APILuma API

Pika 2.5 ​

Pika verfolgt mit Pikaframes einen Keyframe-basierten Ansatz. Lade 2-5 Keyframes hoch (Referenzbilder an Schlüsselmomenten), und das Modell erzeugt weiche Übergänge zwischen ihnen. Die Gesamtdauer erreicht 20-25 Sekunden.

Pikascenes akzeptiert bis zu 10 Referenzbilder und kombiniert sie zu einem einzigen Video. Das Modell nutzt Bilderkennung, um die Rolle jeder Referenz (Charakter, Hintergrund, Requisite) automatisch zu bestimmen.

Verfügbarkeit: Pika Web-Plattform und API. Abonnements von kostenlos bis Pro.

SpezifikationWert
Native Clip-Länge5-10 Sekunden
Pikaframes-Länge20-25 Sekunden
AuflösungBis zu 1080p
ReferenzbilderBis zu 10 (Pikascenes), 2-5 Keyframes (Pikaframes)
APIJa

Vidu Q3 (ShengShu) ​

Vidu verdient einen Abschnitt, den es in früheren Versionen dieses Leitfadens nicht gab, denn seine Q3-Linie hat sich zu einem der stärksten Systeme für Subjektreferenzen entwickelt, die es gibt. ShengShu veröffentlichte Vidu Q3 Anfang 2026 mit nativem Audio und Clips bis zu 16 Sekunden, und am 13. April 2026 kam Q3 Reference-to-Video hinzu, laut der Launch-Ankündigung. Der Referenzmodus kombiniert Subjekte, Umgebungen, Kostüme, Requisiten und visuelle Stile in einer einzigen Anfrage. Laut den Vidu-API-Dokumenten nimmt der Endpunkt reference2video bis zu 7 Referenzbilder entgegen, die du im Prompt als @1, @2 und so weiter taggst ("@1 und @2 kochen zusammen"), die Dauer liegt bei viduq3 zwischen 3 und 16 Sekunden, die Auflösung reicht bis 1080p, und die Audioerzeugung ist ein einfaches Flag. Zusätzlich beherrscht es intelligente Kameraschnitte innerhalb eines einzigen Clips, was ungewöhnlich und für Dialogszenen nützlich ist. ShengShu gibt an, dass Q3 das erste Reference-to-Video-Leaderboard von SuperCLUE anführte, und Vidu war bereits das Modell, das Veo bei VBench 2.0 verdrängte, als wir diesen Leitfaden erstmals schrieben.

Verfügbarkeit: Vidu Web-App und API (viduq3, viduq3-turbo), sowie Alibaba Cloud Model Studio und Hoster von Drittanbietern.

SpezifikationWert
Native Clip-Länge3-16 Sekunden
AuflösungBis zu 1080p
ReferenzbilderBis zu 7 (@1, @2-Tags)
ReferenztypenSubjekte, Umgebungen, Requisiten, Kostüme, Stile
AudioNativ (Soundeffekte, Dialog, Musik)
APIVidu API, Alibaba Cloud Model Studio

Stufe 3: Open-Source-Modelle für selbst gehostete Workflows ​

Diese Modelle erzeugen kürzere Clips, sind dafür aber vollständig offen. Du kannst sie auf deiner eigenen Hardware betreiben, feinabstimmen und eigene Erweiterungs-Pipelines aufbauen, ohne von APIs abhängig zu sein.

Wan 2.1 (Alibaba) ​

Wan 2.1 ist die Grundlage, auf der mehrere andere Modelle aufbauen (darunter Helios). Die Wan-VAE-Architektur kodiert und dekodiert 1080p-Video beliebiger Länge unter Erhalt der zeitlichen Information. Das Modell gibt es als I2V-Varianten in 480p und 720p sowie als First-Last-Frame-to-Video-Modell, das Video zwischen zwei Referenzbildern erzeugt.

Wan-Edit ermöglicht Stil- und Inhaltsübertragung mithilfe von Referenzbildern bei gleichzeitiger Beibehaltung bestimmter Strukturen oder Charakterposen. Wan 2.2 (Juli 2025) ist die neuere offene Veröffentlichung, ein Mixture-of-Experts-Modell mit einer 5B-Variante, die auf einer einzelnen RTX 4090 läuft, weiterhin unter Apache 2.0. Ein wichtiger Vorbehalt für Selbst-Hoster: Wan wurde ab 2.5 geschlossen. Die neueren Modelle Wan 2.5, 2.6, 2.7 und jetzt Wan 3.0 fügten synchronisiertes Audio und höhere Auflösung hinzu, sind aber nur über API verfügbar ohne öffentliche Gewichte – 2.2 bleibt also die offene Obergrenze. Wan 3.0 kam im August 2026 auf Alibaba Cloud Model Studio heraus und erzeugt laut seiner Modellseite bis zu 30 Sekunden in einem Durchgang bei 480p, 720p oder 1080p aus Text-, Bild-, Video- und Audioreferenzen, und teilt sich seit September 2026 mit Gemini Omni Flash die Spitze der Artificial-Analysis-Text-zu-Video-Arena. Es ist ein gehostetes Produkt, kein Download. Ignoriere SEO-Seiten, die behaupten, Wan-2.7- oder 3.0-Gewichte seien herunterladbar. Die offizielle GitHub-Organisation und das Hugging-Face-Konto enden bei 2.2 (die neuesten Uploads sind Wan2.2-Animate-Auffrischungen).

SpezifikationWert
Parameter1,3B, 5B, 14B (2.1); 5B + 14B MoE (2.2)
I2V-ModiI2V-480P, I2V-720P, FLF2V-720P
Offene ObergrenzeWan 2.2 (2.5 bis 3.0 sind nur über API)
LizenzApache 2.0
Hardware8GB+ VRAM (kleinere Varianten)
PlattformenDiffusers, ComfyUI

HunyuanVideo (Tencent) ​

Tencents 13B-Parameter-Modell war über den größten Teil von 2025 der Open-Source-Videoerzeugungs-Marktführer. HunyuanVideo-I2V nutzt eine Token-Replace-Technik mit einem vortrainierten MLLM, um Referenzbild-Informationen einzubeziehen. HunyuanVideo-1.5, veröffentlicht im November 2025, verbesserte die Effizienz. HunyuanCustom ermöglicht multimodal gesteuerte, angepasste Videoerzeugung.

SpezifikationWert
Parameter13B
I2VJa (Token-Replace-Technik)
LizenzOpen Source
Hardware60GB+ VRAM (720p)
VariantenBase, I2V, 1.5, Avatar, Custom

LTX-2 (Lightricks) ​

Lightricks veröffentlichte LTX-2 im Januar 2026 als Open Source mit vollständigen Gewichten, Inferenzcode und Trainingscode. Es handelt sich um ein DiT-basiertes Modell, das Video und synchronisiertes Audio zusammen in einem Durchgang erzeugt, nativ in 4K und bis zu 50fps, mit Clips bis zu 20 Sekunden. Bild-zu-Video und Multi-Keyframe-Konditionierung sind eingebaut, sodass du Referenzstandbilder an Punkten entlang des Clips festlegen kannst, ähnlich wie bei Pikaframes.

Die Lizenz ist der Haken – oder auch nicht, je nach Größe deines Unternehmens. LTX-2 ist kostenlos für Forschung und kommerzielle Nutzung unter $10M Jahresumsatz. Darüber benötigst du eine kommerzielle Lizenz, es handelt sich also im strengen Sinne eher um offene Gewichte als um Open Source. LTX-2.3 war ein Update mit 22B Parametern mit besserem Audio und besserer Prompt-Treue, und LTX-2.5, der aktuelle Checkpoint mit Stand September 2026, behält die 22B-Größe bei und fügt native Multishot-Erzeugung hinzu, die einen Charakter und Look über mehrere verbundene Einstellungen hinweg beibehält, einen Diffusions-Video-Decoder anstelle einfacher VAE-Rekonstruktion sowie einen Gemma-4-12B-Textencoder für lange Prompts, weiterhin unter der LTX-2.x Community License mit derselben $10M-Umsatzgrenze. Die Gewichte sind auf Hugging Face verfügbar, mit destillierten Varianten, LoRA-Adaptern sowie ComfyUI- und Diffusers-Integrationen, und gehostete APIs laufen auf der LTX-Plattform, fal.ai und Replicate.

SpezifikationWert
Parameter22B (LTX-2.3 und LTX-2.5)
Max. Clip~20 Sekunden
AuflösungNativ 4K bei bis zu 50fps
AudioNativ synchronisiert
I2VJa (Bild- + Multi-Keyframe-Konditionierung)
LizenzLTX-2 Community License (kostenlos unter $10M Jahresumsatz)
HardwareDestillierte und FP8-Varianten für Consumer-GPUs

CogVideoX (Tsinghua/Zhipu AI) ​

CogVideoX nutzt eine 3D-Causal-VAE, die die Sequenzlänge reduziert und Flackern verhindert. Der adaptive LayerNorm-Transformer verbessert die Text-Video-Ausrichtung. Verfügbar in Varianten mit 2B (Apache 2.0) und 5B (Forschungslizenz) mit nativer Diffusers-Integration.

Clips sind 6-10 Sekunden lang bei 720x480. Kurz, aber das Verhältnis von Qualität zu Rechenaufwand ist gut, und es läuft auf einer 12GB-GPU.

SpezifikationWert
Parameter2B, 5B
I2VJa (CogVideoXImageToVideoPipeline)
Auflösung720x480 bei 8fps
LizenzApache 2.0 (2B), Forschung (5B)
Hardware12GB VRAM

Erstes Bild vs. echte Referenz: Die entscheidende Unterscheidung ​

Nicht jede Unterstützung für „Referenzbilder" ist gleich. Den Unterschied zu verstehen, ist entscheidend, um das richtige Modell auszuwählen.

First-Frame-Modelle (LongCat, Helios, Hailuo, Luma Ray2, HunyuanVideo) behandeln dein Bild als das buchstäbliche Startbild. Das Modell animiert von genau diesem visuellen Ausgangspunkt aus vorwärts. Du kannst kein Porträtfoto eines Charakters hochladen und ihn dann in einer anderen Szene beschreiben. Das Bild ist die Szene.

Echte Referenzmodelle (Kling, Grok Imagine, Seedance, Vidu Q3, MiniMax H3, SkyReels V3) extrahieren die Identität aus deinem Bild und platzieren diesen Charakter/dieses Objekt in jede beliebige von dir beschriebene Szene. Lade ein Foto einer Person hoch und prompte dann „diese Person geht bei Sonnenuntergang durch einen Wald." Der Charakter erscheint in einer völlig neuen Umgebung, während seine Identität erhalten bleibt. Genau das brauchst du für erzählerische Inhalte mit mehreren Szenen, etwa einen Abenteuerfilm.

Character-ID-Modelle (Sora 2 Pro) extrahieren Identität aus Videoclips statt aus statischen Bildern. Du erstellst einmalig eine dauerhafte Charakter-ID und verwendest sie in beliebig vielen künftigen Generierungen wieder.

Stil-/Zutaten-Modelle (Veo 3.1) verwenden Referenzbilder, um visuellen Stil, Texturen und das Gesamtaussehen zu beeinflussen, statt spezifische Charakteridentitäten zu extrahieren. Gut zur Wahrung visueller Konsistenz über ein Projekt hinweg, weniger präzise für die Kontrolle einzelner Charaktere.

Der reale Workflow für 10-Minuten-Videos ​

Hier die ehrliche Einschätzung, wo die Dinge Mitte 2026 stehen. Kein einzelnes Modell erzeugt zuverlässig 10 Minuten konsistentes, hochwertiges Video in einem Durchgang. LongCat Video kommt mit Angaben von 15 Minuten am nächsten heran, aber Qualität und Kohärenz variieren bei solchen Längen erheblich. Helios und SkyReels V2 erzeugen „minutenlange" beziehungsweise „endlose" Videos, aber die Ergebnisse brauchen sorgfältiges Prompting und oft mehrere Versuche.

Der Workflow, der für die meisten Ersteller von 5-15-Minuten-Videos tatsächlich funktioniert, kombiniert mehrere Ansätze:

Für Talking-Head-/Avatar-Inhalte: LongCat Videos audiogesteuerter Modus von 2026 oder SkyReels V3s Avatar-Erzeugung können 5+ Minuten eines konsistenten sprechenden Charakters erzeugen. Das kommt der Idee „Knopf drücken, langes Video bekommen" am nächsten.

Für erzählerische Inhalte mit mehreren Szenen (Abenteuerfilm-Stil): Nutze Kling 3.0, Grok Imagine oder Seedance 2.0 mit echten Charakter-Referenzbildern. Erzeuge einzelne Einstellungen von jeweils 10-15 Sekunden. Verwende dieselben @Element- oder <IMAGE>-Referenzen bei jeder Generierung, um die Charakteridentität zu wahren. Verkette Einstellungen mithilfe des Multi-Shot-Modus (Kling unterstützt 6 Einstellungen pro Aufruf) oder der Extend-API. Kling ist für diesen Workflow am erprobtesten. Grok Imagines klare Trennung zwischen „Referenzmodus" und „First-Frame-Modus" macht es zu einer starken Alternative. Seedance 2.5 akzeptiert inzwischen die meisten Referenzeingaben (50 Dateien) und erzeugt 30-Sekunden-Takes, was die Anzahl der nötigen Verbindungen etwa halbiert, und Vidu Q3 (7 Referenzen mit @-Tags) sowie MiniMax H3 (12 Dateien) sind glaubwürdige neuere Optionen.

Für Charakterkonsistenz über viele Clips hinweg: Sora 2 Pros persistentes character_id-System ist der sauberste Ansatz für sehr lange Projekte. Extrahiere den Charakter einmal aus einem kurzen Video und erzeuge dann Dutzende Clips unter Bezug auf diese ID. Die Charakteridentität verschlechtert sich nicht mit der Zeit, da sie als dauerhaftes Embedding gespeichert wird und nicht jedes Mal neu aus einem Bild interpretiert werden muss.

Für stiltransformierte Inhalte: Lucy Restyle auf fal.ai verarbeitet bestehendes Video von bis zu 30 Minuten und wendet KI-Stiltransformationen an, während die Bewegung erhalten bleibt. Wenn du Ausgangsmaterial hast, umgeht das die Problematik der Generierungslänge vollständig. $0,01 pro Sekunde Ausgangsvideo.

Für Open-Source-Pipelines: Baue auf Wan 2.2 oder Helios mit einer Video-Fortsetzungsschleife auf, oder auf MiniMax H3s Ref2VA-Checkpoint, falls dessen Community-Lizenz für deine Region passt, da es das erste offene Modell mit einem 9-Bild-Referenzmodus ist. Erzeuge einen Clip, verwende das letzte Bild als Startbild für den nächsten Clip, wiederhole. ComfyUI-Workflows automatisieren das. Die Konsistenz verschlechtert sich über viele Iterationen hinweg, aber es ist kostenlos und kontrollierbar.

Die Kernherausforderung bleibt: Selbst mit echter Unterstützung für Referenzbilder summiert sich die Charakterdrift über Dutzende Clips hinweg. Gesichtszüge, Haare, Kleidung und Hautton verschieben sich allmählich. Die Workarounds (hochwertige Referenzfotos, konsistentes Prompting, Batch-Verarbeitung von Einstellungen) sind notwendig. Aber Modelle wie Kling und Grok Imagine, die Charakteridentität von der Szenenkomposition trennen, machen das erheblich einfacher als reine First-Frame-Modelle.

Der 3D-Gerüst-Ansatz: Niedrig rendern, hoch transformieren ​

Es gibt einen Workflow, der zunehmend an Bedeutung gewinnt und die meisten Probleme der Langform-Generierung vollständig umgeht. Statt ein KI-Modell zu bitten, 10 Minuten Video von Grund auf zu erzeugen, renderst du eine niedrig aufgelöste 3D-Zwischensequenz mit korrekter Kameraführung, Charakterpositionierung und Timing und lässt sie dann durch ein Video-zu-Video-Modell mit Referenzbildern und einem Verbesserungsprompt laufen. Die 3D-Engine übernimmt die Struktur. Die KI übernimmt die Ästhetik. Das funktioniert, weil V2V-Transformation ein enger umrissenes Problem ist als vollständige Generierung. Das Modell muss keine Kamerabewegung, Charakterplatzierung oder Szenenkomposition erfinden. Es muss lediglich bestehendes Filmmaterial fotorealistisch aussehen lassen und dabei Ihren visuellen Referenzen folgen. Das ist deutlich beherrschbarer und skaliert auf jede Länge, die Ihre 3D-Engine rendern kann.

Warum das funktioniert ​

Ihre 3D-Engine liefert alles, womit KI-Videomodelle noch immer kämpfen: präzise Kamerakontrolle, exakte Charakterplatzierung im gesamten Bild, korrekte Physik-Interaktionen und konsistentes Timing über Minuten von Filmmaterial hinweg. Dolly-Zooms, Kamerafahrten, Charaktere, die zielgenau ins Bild ein- und aussteigen – all das ist in einer 3D-Engine trivial und in textgesteuerter Generierung unzuverlässig. Die einzige Aufgabe des V2V-Modells besteht darin, Materialien, Beleuchtung und Texturen in fotorealistische Ausgabe zu verwandeln, während Geometrie und Bewegung, die Sie bereits definiert haben, erhalten bleiben.

Auch die Charakterkonsistenz wird einfacher. Statt gegen Identitätsdrift über 50 separate KI-Generierungen anzukämpfen, zeigen Sie dem Modell denselben 3D-Charakter in jedem Frame. Die Referenzbilder sagen dem Modell, wie dieser Charakter im finalen Output aussehen soll. Das ist ein einfacheres Problem, als jedes Mal von Grund auf einen konsistenten Charakter zu generieren.

Und die Länge ist keine Einschränkung mehr. Lucy Restyle verarbeitet 30 Minuten in einem einzigen Aufruf. Wan 2.1 in ComfyUI kann jede Länge in Blöcken verarbeiten. Sie kämpfen überhaupt nicht mit dem Problem „Wie generiere ich 10 Minuten", weil das Filmmaterial bereits existiert.

RealMaster (Meta / Universität Tel Aviv) ​

RealMaster ist ein Forschungssystem, das speziell für diesen Workflow entwickelt wurde. Veröffentlicht im März 2026 von Meta Reality Labs und der Universität Tel Aviv, verwandelt es gerendertes 3D-Video in fotorealistisches Video, während die vollständige geometrische Ausrichtung mit der Quelle erhalten bleibt.

Die Methode extrahiert Kantenkarten aus dem 3D-Render, um Struktur und Bewegung zu erhalten, und wendet dann ein Video-Diffusionsmodell (aufgebaut auf der VACE/Wan-Architektur) an, um alles andere in fotorealistischen Output zu verwandeln. Ein leichtgewichtiger IC-LoRA-Adapter destilliert die Pipeline in einen einzigen Inferenzdurchlauf, der keine Ankerframes benötigt und Objekte handhabt, die mitten in der Sequenz auftauchen.

Getestet an GTA-V- und CARLA-Simulatorsequenzen übertrifft RealMaster allgemeine Video-Editing-Baselines deutlich. Es kann zudem Wettereffekte über den Text-Prompt einschichten („Lass es regnen", „Lass es schneien") zusätzlich zur Realismus-Transformation. Das Modell generalisiert über Simulatoren hinweg ohne erneutes Training. An GTA-V-Daten trainierte Gewichte funktionieren auf CARLA-Output ohne zusätzliches Feintuning.

Verfügbarkeit: Nur Forschung. Noch keine öffentlichen Gewichte oder API.

SpezifikationWert
InputGerendertes 3D-Video (jede Engine)
OutputFotorealistisches Video mit erhaltener Geometrie und Bewegung
ArchitekturIC-LoRA auf VACE/Wan-Video-Diffusions-Backbone
KonditionierungKantenkarten aus dem Quell-Render
Getestet mitGTA-V, CARLA-Simulator
LizenzNicht veröffentlicht (nur Forschungspaper)

Heute verfügbare Produktions-V2V-Tools ​

Kling 3.0 V2V mit Element-Referenzen ist die vollständigste Produktionsoption. Die Endpunkte Edit Video und Reference V2V auf fal.ai akzeptieren 3-10 Sekunden lange Quellvideoclips zusammen mit Element-Referenzen (@Element1, @Element2 mit Frontal- und Mehrwinkelfotos) und einem Verbesserungs-Prompt. Das Modell analysiert Bewegungstrajektorien und Kameramuster in der Quelle und generiert das Filmmaterial dann mit Ihren spezifizierten Charaktererscheinungen und Ihrem visuellen Stil neu, während die ursprüngliche Inszenierung und Kameraarbeit erhalten bleibt. Bis zu 7 Referenz-Inputs. Output in 1080p. Verarbeiten Sie Ihre Cutscene in 10-15-Sekunden-Blöcken mit denselben Element-Referenzen über alle Blöcke hinweg, um Charakterkonsistenz zu wahren.

Lucy Restyle 2 verarbeitet bis zu 30 Minuten Quellvideo in einem einzigen API-Aufruf zu $0,01 pro Sekunde Input. Es akzeptiert einen Text-Prompt und optional ein Referenzbild zur Stilvorgabe. Keine charakterspezifischen Element-Referenzen wie bei Kling, aber für die Gesamtübertragung eines kinematografischen Stils auf einen vollständigen 3D-Render ist es der einfachste und günstigste Weg. Füttern Sie es mit Ihrem kompletten Render und einem Prompt, der den Ziel-Look beschreibt. Output in 720p mit zeitlicher Konsistenz über Tausende von Frames.

Wan 2.1 VACE in ComfyUI ist der Open-Source-Weg. Das 14B-VACE-Modell führt referenzgesteuertes V2V durch: Input ist ein Quellvideo plus ein Stil-Referenzbild, Output ist eine restylte Version, die Struktur und Bewegung erhält. Kantenkarten-Konditionierung verbessert die strukturelle Treue. Sie können eine Verarbeitungsschleife bauen, die jede Länge in Blöcken mit konsistenten Stil-Referenzen handhabt. Kostenlos, läuft lokal auf Ihrer eigenen Hardware.

Grok Imagine V2V akzeptiert Quellvideo plus 1-7 Referenzbilder im Referenzmodus. $0,05 pro Sekunde bei 720p. Die explizite Trennung zwischen Referenzmodus und First-Frame-Modus bedeutet, dass Ihre Referenzen die Charaktererscheinung steuern, ohne die Struktur des Quellvideos zu überschreiben.

Was Ihr 3D-Render braucht ​

Die Render-Qualitätsschwelle ist wichtig. Ein blankes Wireframe gibt dem V2V-Modell nicht genug zum Arbeiten. Aber Sie brauchen auch keine Materialien oder Beleuchtung in Produktionsqualität.

Korrekte Proportionen und Geometrie. Charaktermodelle brauchen ungefähr korrekte Körperproportionen und Gesichtsstruktur, damit die Referenzbilder ordentlich abgebildet werden können. Grundlegende humanoide Geometrie mit korrekten Proportionen reicht aus. Eine Strichfigur wird keinen erkennbaren Charakter erzeugen.

Grundlegende Beleuchtungsrichtung. Ein einziges Richtungslicht, das die Gesamtbeleuchtung der Szene festlegt, hilft dem Modell, die beabsichtigte Stimmung zu verstehen. Die KI wird Details verbessern und hinzufügen, muss aber wissen, ob die Szene helles Tageslicht oder ein dunkles Interieur ist.

Sanfte Kamerabewegung. Stabile, bedachte Kamerabewegungen übertragen sich gut. Erratische oder extrem schnelle Bewegung kann V2V-Modelle verwirren. Halten Sie Ihre virtuelle Kamera so, wie sich eine echte Kamera verhalten würde.

Flat Shading statt Wireframe. Einfache flach schattierte oder Low-Poly-Geometrie liefert bessere Ergebnisse als Wireframes oder untexturierte Modelle. Selbst einfache Volltonfarben auf Oberflächen helfen dem Modell, Materialgrenzen zu verstehen.

Kosten und Skalierung ​

Verarbeitung einer 10-minütigen Cutscene durch verschiedene Tools:

ToolMax. Input-LängeKosten für 10 MinAuflösungReferenzbilder
Kling O3 V2V10s-Clips~$50-671080pBis zu 7 (Elemente + Stil)
Lucy Restyle 230 Minuten$6720p1 (nur Stil)
Grok Imagine V2V10s-Clips~$30720p1-7
Wan 2.1 VACEBeliebig (in Blöcken)Kostenlos (lokale GPU)720p1 pro Block

Diese Zahlen sind unsere Schätzungen basierend auf Anbieter-Listenpreisen, als wir den Vergleich Mitte 2026 erstmals durchgeführt haben, und Anbieter passen ihre Preise häufig an, daher sollten Sie sie eher als relative Rangfolge denn als verbindliches Angebot betrachten. Lucy Restyle ist am günstigsten für die Verarbeitung in voller Länge. Kling ist am präzisesten für charakterspezifische Verbesserung mit Element-Referenzen. Wan 2.1 ist kostenlos, sofern Sie die Hardware haben (benötigt etwa 60 GB VRAM für das 14B-Modell bei 720p, oder 8 GB für die 1,3B-Variante bei geringerer Qualität).

Vergleichstabelle ​

ModellMax. native DauerErweiterte DauerReferenztypMax. RefsAuflösungAPI verfügbarOpen Source
LongCat Video~15 Min.EntfälltNur First-Frame1720p/30fpsJa (fal.ai)Ja (MIT)
Seaweed APT2~5 Min.EntfälltI2V + Pose1720pNeinNein
HeliosMinutenmaßstabEntfälltFirst-Frame (I2V)1720pHF SpacesJa (Apache 2.0)
SkyReels V3UnbegrenztEntfälltEchte Referenz1-4720pNeinJa
Kling 3.015s~3 Min.Elemente + Stilrefs71080pJaNein
Grok Imagine15sVerkettbarEchte Referenz7720pJaNein
Seedance 2.015sEntfälltMultimodale Refs122KJaNein
Seedance 2.530sMehrfach-ErweiterungMultimodale Refs502KJa (BytePlus, Runway)Nein
Vidu Q316sEntfälltEchte Referenz71080pJaNein
MiniMax H315sEntfälltMultimodale Refs122KJaJa (Community-Lizenz)
Runway Gen-4.510s~1 Min.I2V (0-1)11080pJaNein
Veo 3.18s~2,5 Min.Ingredients (Stil)34KJaNein
Gemini Omni Flash10sKonversationelle Bearbeitung + Erweiterung (1.1)Multimodale RefsBilder + Video720pJa (GA)Nein
Sora 2 Pro ⚠️ wird eingestellt20sVerkettbarCharakter-ID (Video)21080pAPI endet Sep. 2026Nein
Hailuo 0210sEntfälltI2V (First-Frame)11080pJaNein
Luma Ray3.220sEntfälltKeyframes + Charakterref16 Keyframes1080p (4K-Upscale)JaNein
Pika 2.510s25sPikascenes101080pJaNein
Wan 2.1 / 2.2Kurze ClipsVia FortsetzungI2V / FLF2V1-2720pVia fal.aiJa (Apache 2.0)
Wan 3.030sEntfälltMultimodale RefsBilder, Video, Audio1080pJa (Alibaba Cloud)Nein
HunyuanVideoKurze ClipsVia FortsetzungI2V (First-Frame)1720pVia fal.aiJa
LTX-2.320sVia FortsetzungI2V + KeyframesMehrfach-Keyframe4KJa (LTX, fal.ai)Gewichte (ARR-gedeckelt)
CogVideoX6-10sVia FortsetzungI2V (First-Frame)1720x480Via fal.aiJa

Was als Nächstes kommt ​

Der Verlauf durch 2026 ist klar. LongCat Video hat bewiesen, dass Generierung im Minutenmaßstab mit Konsistenz in einem offenen Modell möglich ist. Helios zeigte, dass das in Echtzeit geschehen kann. Seaweed APT2 demonstrierte interaktive Langform-Generierung. Und die Echte-Referenz-Modelle (Kling, Grok, Seedance) bewiesen, dass Charakteridentität über beliebige Szenen hinweg bestehen bleiben kann.

Der nächste Schritt ist die Kombination dieser Fähigkeiten: native Langform-Generierung mit echter Charakterreferenz-Unterstützung. Momentan muss man sich für eines von beiden entscheiden. Wenn ein Modell 5 Minuten Video generieren kann, während es Charaktere aus Referenzbildern über Dutzende von Szenenwechseln hinweg erhält, wird der Workflow mit verketteten Clips überflüssig. Seedance 2.5 (native 30-Sekunden-Clips, bis zu 50 Referenzdateien, erschienen am 31. Juli 2026) und Wan 3.0 (30-Sekunden-Einzeltakes aus multimodalen Referenzen, August 2026) sind die ersten echten Schritte in diese Richtung.

Stand Anfang September 2026 führt die Artificial-Analysis-Text-zu-Video-Arena (mit Audio) Googles Gemini Omni Flash und Alibabas API-only Wan 3.0 gleichauf an der Spitze (~1.239 Elo), gefolgt von MiniMax H3 Max und H3 wenige Punkte dahinter, dann Seedance 2.0, Wan 2.7, den HappyHorse-Modellen, Sand.ais MAGI-2-Preview und Kling 3.0 Pro, die die Top Ten abrunden. Das Leaderboard mischt sich häufig neu, daher sollten Sie jede einzelne Platzierung als Momentaufnahme statt als feste Ordnung betrachten.

Der 3D-Gerüst-Ansatz bietet eine parallele Entwicklungslinie. Da V2V-Modelle ihre strukturelle Erhaltung und Fotorealismus verbessern, wird die Aufwertung von 3D-Renders niedriger Wiedergabetreue für die vollständige Produktion zunehmend praktikabel. RealMaster von Meta erreicht bereits Forschungsqualität bei der Sim-zu-Real-Transformation von Game-Engine-Output. Wenn diese Fähigkeit Produktions-APIs mit Referenzbild-Unterstützung erreicht, wird jeder mit grundlegenden 3D-Kenntnissen fotorealistisches Langform-Video mit vollständiger Kontrolle über Kamera, Inszenierung und Charakterplatzierung in beliebiger Dauer produzieren können.

Vorerst hängt die praktische Antwort von Ihrem Anwendungsfall ab:

Am besten für Multi-Charakter-Referenz: Kling 3.0 (bis zu 7 Refs mit separatem Element- + Stilsystem), Seedance 2.5 (bis zu 50 multimodale Inputs in einem 30-Sekunden-Take) oder Vidu Q3 (7 getaggte Referenzen mit In-Clip-Kamerawechsel).

Beste API für Referenz-zu-Video: Grok Imagine (saubere API, expliziter Referenzmodus, $0,05/Sek. für das ursprüngliche Modell), Vidu Q3 (@-Tags, 7 Refs) oder Kling via fal.ai.

Am besten für persistente Charaktere über viele Clips hinweg: Kling 3.0s Element-Referenzen oder SkyReels V3s Referenz-und-Erweitern-Ansatz. (Sora 2 Pros Charakter-ID-System war der sauberste Ansatz, wird aber 2026 eingestellt, also sollten Sie keine neue Arbeit damit beginnen.)

Beste Open-Source-Option: SkyReels V3 (1-4 echte Referenzbilder, unbegrenzte Länge), MiniMax H3 (9 Referenzbilder plus Video und Audio, Community-Lizenz mit regionaler Antragspflicht) oder Helios (Echtzeit, Apache 2.0).

Am besten für reine Dauer: LongCat Video (~15 Min., aber nur First-Frame).

Am besten für 3D-Render-Aufwertung: Kling 3.0 V2V (charakterspezifische Element-Refs, 1080p) oder Lucy Restyle 2 (30 Min. Input, $0,01/Sek.).


Häufige Fragen ​

Was ist das beste KI-Videomodell für lange Videos? ​

Für reine Dauer generiert LongCat Video native rund 15 Minuten, ist jedoch nur First-Frame-fähig. Für lange Videos mit konsistenten Charakteren ist die praktische Antwort 2026 ein Referenz-und-Erweitern-Workflow: Clips mit einem Modell mit starker Referenz-Unterstützung generieren (Kling 3.0, Runway Gen-4.5 oder das Open-Source-Modell SkyReels V3) und diese dann verketten. Kein einzelnes Modell läuft sowohl lange als auch hält die Charakteridentität perfekt, daher kombiniert die meiste Produktionsarbeit beides.

Welche KI-Videomodelle unterstützen Referenzbilder? ​

Kling 3.0 Omni, Runway Gen-4.5, Seedance 2.0 und 2.5, Vidu Q3, MiniMax H3, Googles Veo 3.1 und Gemini Omni Flash unterstützen alle Referenzbilder unter den kommerziellen Optionen. Auf der Open-Source-Seite akzeptieren SkyReels V2/V3, Wan 2.1 und 2.2, LTX-2.5 und die offenen MiniMax-H3-Gewichte Referenz-Inputs, die Sie selbst ausführen können. Die Unterstützungsqualität variiert stark, weshalb der Leitfaden oben sie in Stufen unterteilt.

Kann KI einen konsistenten Charakter über ein langes Video hinweg generieren? ​

Ja, aber nicht in einem Durchgang. Der zuverlässige Ansatz besteht darin, einen Charakter mit einem oder mehreren Referenzbildern festzulegen, kurze Clips zu generieren und diese zu erweitern oder zusammenzufügen, während dieselben Referenzen immer wieder eingespeist werden. Echte Referenz-Unterstützung (das Modell behält die Identität über neue Generierungen hinweg bei) ist hier deutlich wichtiger als First-Frame-Konditionierung, die nur den Eröffnungsframe vorgibt.

Was ist der Unterschied zwischen First-Frame- und echter Referenzbild-Unterstützung? ​

Frame-Konditionierung nutzt dein Bild als buchstäblichen Startframe des Clips und driftet dann im Verlauf des Videos ab. Echte Referenz-Unterstützung behandelt das Bild als Identitätsanker, den das Modell während der gesamten Generierung beibehält, sodass ein Charakter oder Stil über den ganzen Clip hinweg und über separate Clips hinweg konsistent bleibt. Der Abschnitt oben schlüsselt auf, welche Modelle was können.

Wie funktioniert Kling AI Image-to-Video mit mehreren Referenzbildern? ​

Klings Multi-Bild-Referenz ist ein eigener Modus, getrennt von einfachem Image-to-Video. Statt ein einzelnes Bild als ersten Frame zu animieren, lädst du bis zu 7 Bilder und Elemente hoch (4, wenn du zusätzlich ein Referenzvideo anhängst), markierst sie im Prompt als @Image1 oder @Element1 und beschreibst die Einstellung. Elemente sind feste Charaktere oder Objekte, die aus bis zu 4 Winkelfotos oder einem kurzen Videoclip erstellt werden, optional mit einer gebundenen Stimme, und sie bleiben über Klings Multi-Shot-Storyboard hinweg bestehen. Die vollständigen Regeln stehen im Kling-Abschnitt oben, direkt aus Kuaishous eigenem Guide.

Was ist mit Wan 2.2? Sind Wan 2.5 oder Wan 3.0 Open Source? ​

Wan 2.2 (Juli 2025) ist die neueste herunterladbare Wan-Version, ein Apache-2.0-Mixture-of-Experts-Release mit einer 5B-Variante, die auf einer einzelnen RTX 4090 läuft, und 14B-Text-zu-Video- sowie Bild-zu-Video-Modellen. Wan 2.5, 2.6, 2.7 und Wan 3.0 (August 2026, 30-sekündige Einzeleinstellungen mit bis zu 1080p) sind nur über die API von Alibaba Cloud verfügbar, ohne öffentliche Gewichte, egal was Affiliate-Blogs behaupten. Wenn du den Referenzbild-Workflow mit offenen Gewichten willst, nutze Wan 2.2s Image-to-Video- und First-Last-Frame-Modelle oder schau dir SkyReels V3 und MiniMax H3 an.

Was ist der Unterschied zwischen Image-to-Video und Reference-to-Video? ​

Image-to-Video animiert das Bild, das du angibst, sodass dein Bild der Startframe ist und das Modell von dort aus weitermacht. Reference-to-Video nutzt deine Bilder als Identitäts- und Stilanker und generiert eine neue Einstellung aus deinem Prompt, sodass ein im Studio fotografierter Charakter durch einen Wald laufend erscheinen kann. Image-to-Video eignet sich zum Animieren eines fertigen Standbilds. Reference-to-Video eignet sich für Multi-Szenen-Geschichten mit einem konsistenten Charakter. Kling, Vidu Q3, Seedance, Grok Imagine und MiniMax H3 bieten beide Modi an, und Vidu und Grok kennzeichnen sie explizit in ihren APIs.

Welche KI-Videomodelle behalten dasselbe Subjekt über mehrere Clips hinweg bei (Subjekt-Referenz)? ​

Für Subjekt- oder Charakter-Referenz über viele Clips hinweg sind die stärksten Optionen mit Stand September 2026 Kling 3.0 Omni (Element-Bibliothek mit Multi-Winkel-Fotos und Stimme), Seedance 2.5 (bis zu 50 Referenzen und 30-sekündige Einstellungen), Vidu Q3 (7 markierte Subjekte) und MiniMax H3 (9 Referenzbilder plus Video und Audio). Luma Ray3 bringt eine Character-Reference-Funktion mit, und Sora 2 Pros Charakter-IDs waren das sauberste System, aber Soras API wird am 24. September 2026 abgeschaltet. Bei offenen Gewichten sind SkyReels V3 und MiniMax H3 diejenigen mit echter Subjekt-Referenz.


Verwandte Themen ​

Probier es gleich ausMach die Szene spielbar statt gerendert

Überspring die Render-Warteschlange, fahr live hindurch.

Kostenlos erstellen →Kostenlos, läuft im Browser, keine Installation nötig.