Start Free Now
Limited Time Offer: Get 50% OFF Starter & Basic Yearly Plans 🎉

Charakterkonsistenz in KI-Videos: Multi-Image Fusion

Sep 21, 2026

Warum Charakterkonsistenz über die Qualität eines KI-Videos entscheidet

Ein einzelner Clip mit einer erstaunlich realistischen Figur ist heute schnell produziert. Sobald dieselbe Figur jedoch in mehreren Einstellungen auftaucht, beginnt das eigentliche Problem: Das Gesicht verschiebt sich, die Frisur wechselt die Länge, die Augenfarbe driftet ins Grünliche, die Jacke hat plötzlich einen Reißverschluss statt Knöpfe. Das Publikum erkennt solche Brüche sofort, auch wenn es sie nicht benennen kann. Es fühlt sich einfach falsch an.

Der Grund liegt in der Funktionsweise generativer Videomodelle. Sie besitzen kein Gedächtnis für Figuren. Jede Einstellung wird neu berechnet, konditioniert auf Text, Startbild, manchmal ein Referenzbild. Ohne zusätzliche Steuerungsmechanismen entscheidet das Modell bei jedem Durchlauf neu, wie eine Person aussieht. Genau hier setzt Multi-Image Fusion an: Statt die Figur nur zu beschreiben, wird sie über mehrere Referenzbilder visuell definiert und über die gesamte Szene hinweg stabilisiert.

Dieser Artikel ist ein praktischer Leitfaden. Er erklärt, wie Multi-Image Fusion technisch arbeitet, wie Sie ein belastbares Referenzbild-Set aufbauen, welcher Workflow sich für kurze Clips und welcher sich für ganze Serien eignet und welche Fehler die Konsistenz zuverlässig zerstören.

Wie Multi-Image Fusion technisch funktioniert

Multi-Image Fusion ist kein einzelner Schalter, sondern eine Sammlung von Techniken, die dasselbe Ziel verfolgen: Identität aus mehreren Quellen extrahieren und während der Generierung konstant halten.

Referenzbilder als Identitätsanker

Ein Bild-Encoder wandelt jedes Referenzbild in einen Vektor, ein Embedding, um. Dieses Embedding beschreibt nicht den Inhalt im wörtlichen Sinn, sondern die visuellen Merkmale, die das Modell für charakteristisch hält: Proportionen, Farbverteilung, Textur, Gesichtsgeometrie. Beim Generieren wird dieses Embedding über Cross-Attention in den Diffusionsprozess injiziert. Das Modell bekommt dadurch eine zusätzliche Bedingung neben dem Textprompt.

Wichtig ist: Ein einzelnes Referenzbild liefert meist nur einen Blickwinkel. Ein Profilbild erklärt nicht, wie die Nase von vorn aussieht. Deshalb arbeitet man mit mehreren Bildern, deren Embeddings kombiniert oder sequenziell gewichtet werden.

Gewichtung und Attribut-Mischung

Bei mehreren Referenzen stellt sich die Frage der Gewichtung. Typische Strategien:

  • Gleichgewichtung: Alle Referenzen zählen gleich. Gut, wenn die Bilder sehr ähnlich sind.
  • Hauptreferenz mit Unterstützung: Ein Bild erhält deutlich mehr Gewicht, die übrigen dienen als Korrektur für Winkel oder Lichtsituationen.
  • Attribut-Trennung: Gesicht, Frisur, Kleidung und Accessoires werden getrennt gewichtet, oft über getrennte Conditioning-Kanäle.

In der Praxis ist eine Hauptreferenz mit zwei bis vier Stützbildern robuster als fünf gleich gewichtete Bilder. Zu viele gleich starke Quellen erzeugen einen Mittelwert, der an eine durchschnittliche Person erinnert, aber an niemanden konkret.

Keyframes und Stiltransfer

Keyframes sind der zweite Stabilisierungshebel. Statt eine Bewegung komplett frei generieren zu lassen, geben Sie Anfangs- und manchmal Endbild vor. Das Modell interpoliert dazwischen, wodurch Identität und Bildkomposition im Fluss bleiben. Bei Dialogszenen mit Schnitt auf dieselbe Person reicht häufig ein konsistenter Keyframe pro Einstellung.

Stiltransfer sorgt für den zweiten Teil der Konsistenz: Licht, Farbtemperatur, Kontrast und Grading müssen über alle Einstellungen gleich wirken. Selbst eine perfekt identische Figur wirkt falsch, wenn die eine Einstellung warm und weich und die nächste kalt und hart ist. Ein festes Farbschema, angewendet als LUT oder als konsistente Stilbeschreibung im Prompt, verhindert diesen Bruch.

Referenzbild-Set aufbauen: die wichtigsten Regeln

Die Qualität der Referenzen bestimmt die Obergrenze der Konsistenz. Ein schlechtes Set lässt sich mit keinem Modell retten.

Empfohlene Zusammensetzung für eine realistische Figur:

  1. Ein frontales Portrait mit neutralem Ausdruck und weichem Licht
  2. Ein Halbprofil von links, eines von rechts
  3. Eine Dreiviertelansicht mit leichtem Lächeln
  4. Ein Ganzkörperbild für Proportionen und Kleidungsdetails
  5. Ein Bild mit der typischen Arbeits- oder Szenenkleidung
  6. Optional: eine Aufnahme mit dem häufigsten Requisit (Brille, Hut, Kopfhörer)

Was Sie vermeiden sollten:

  • Starke Weitwinkelverzerrung oder Selfie-Perspektive
  • Harte Schatten, die die Gesichtsgeometrie verfälschen
  • Unterschiedliche Frisuren oder Haarlängen im selben Set
  • Wechselnde Kleidung, wenn Kleidung Teil der Identität sein soll
  • Kompression, Unschärfe und sehr kleine Auflösungen
  • Nachträglich bearbeitete Gesichter mit sichtbaren Retusche-Artefakten

Ein häufiger Denkfehler: Man mischt Bilder aus verschiedenen Quellen, die jeweils gut aussehen. Wenn die Lichtrichtung in den Referenzen widersprüchlich ist, übernimmt das Modell widersprüchliche Beleuchtungsinformationen und reproduziert sie als flackernde Schatten im Video. Konsistenz beginnt bereits im Referenzmaterial.

Der praktische Workflow: von der Idee zur konsistenten Szene

Schritt 1: Charakterbibel schreiben

Bevor ein einziges Bild generiert wird, legen Sie schriftlich fest, was unveränderlich ist. Eine Charakterbibel enthält:

  • Alter, Herkunft, Körpertyp in klaren Worten
  • Gesichtsmerkmale: Augenfarbe, Augenform, Nase, Kinnlinie, Augenbrauen
  • Frisur: Länge, Farbe, Textur, Scheitel, gebunden oder offen
  • Garderobe pro Szene mit Material und Farbe
  • Eine feste Stilzeile für den Prompt, die in jeder Einstellung wiederholt wird
  • Verbotene Elemente als Negativliste

Diese Datei wird zur Referenz für alle Beteiligten. Ohne sie entstehen Varianten, die sich nur in Details unterscheiden, und genau diese Details fallen im fertigen Video auf.

Schritt 2: Referenzset erzeugen oder kuratieren

Wenn Sie eine echte Person als Vorbild nehmen, klären Sie vorher die Rechte und die Zustimmung. Wenn Sie eine fiktive Figur entwerfen, generieren Sie zunächst viele Varianten und wählen Sie danach konsequent. Der übliche Fehler ist, den Auswahlprozess offen zu lassen und mitten in der Produktion die Figur noch einmal leicht zu ändern.

Schritt 3: Methode wählen

Für ein einzelnes Video mit wenigen Einstellungen genügen Referenz-Conditioning und Keyframes. Für eine Serie mit vielen Szenen, wiederkehrenden Figuren und unterschiedlichen Umgebungen lohnt sich ein trainiertes Charaktermodell, etwa über eine kleine LoRA oder ein vergleichbares Fine-Tuning. Der Trainingsaufwand zahlt sich ab ungefähr der fünften bis zehnten Einstellung aus, weil jede weitere Generierung deutlich stabiler startet.

Schritt 4: Keyframes pro Einstellung festlegen

Planen Sie jede Einstellung als Storyboard mit Start- und Endbild. Diese Bilder können mit einem Bildmodell erzeugt und mit dem Charakter-Conditioning versehen werden. Danach dienen sie als Anker für die Videogenerierung. Wer nur den Textprompt variiert, verliert Kontrolle über Komposition und Identität gleichzeitig.

Schritt 5: Szene für Szene generieren, nicht alles auf einmal

Arbeiten Sie in kleinen Blöcken und prüfen Sie nach jeder Einstellung. Eine Einstellung mit falscher Augenfarbe zieht sich sonst durch die gesamte Sequenz. Speichern Sie Seeds, Promptversionen und Referenzgewichte, damit Ergebnisse reproduzierbar bleiben.

Schritt 6: Qualitätskontrolle mit Standbildvergleich

Legen Sie Schlüsselframes aller Einstellungen nebeneinander. Prüfen Sie in dieser Reihenfolge:

  1. Gesichtsgeometrie und Augenabstand
  2. Frisur und Haaransatz
  3. Kleidung, Farben und Material
  4. Lichtrichtung und Schattenwurf
  5. Bildkomposition und Achsensprung

Ein Vergleichsraster zeigt Drift schneller als das Abspielen des Videos, weil das Auge bei Bewegung großzügiger wird.

Schritt 7: Nachbearbeitung und Ausgabe

Erst nach der Konsistenzprüfung folgen Upscaling, Farbanpassung und Ton. Achtung: Aggressives Upscaling kann Gesichter leicht verändern, besonders bei niedriger Ausgangsauflösung. Prüfen Sie nach jedem Verarbeitungsschritt erneut, ob die Identität erhalten geblieben ist. Erzeugen Sie am Ende mehrere Exportvarianten für Hochformat, Querformat und quadratische Formate und kontrollieren Sie den Bildausschnitt, damit die Figur nicht angeschnitten wird.

Multi-Image Fusion versus Prompt-Anker: ein ehrlicher Vergleich

Prompt-Anker sind Textbeschreibungen, die in jeder Einstellung wiederholt werden. Sie sind einfach, kosten nichts extra und funktionieren überraschend gut für markante Figuren mit wenigen Merkmalen. Bei realistischen Gesichtern stoßen sie jedoch schnell an Grenzen.

Kriterium Prompt-Anker Multi-Image Fusion
Einrichtungsaufwand sehr gering mittel bis hoch
Konsistenz bei Gesichtern mittel hoch
Konsistenz bei Kleidung mittel sehr hoch
Kontrolle über Winkel gering hoch
Eignung für Serien eingeschränkt sehr gut
Abhängigkeit von Referenzqualität keine sehr hoch
Reproduzierbarkeit seed-abhängig gut bei fester Gewichtung

Die pragmatische Empfehlung: Nutzen Sie Prompt-Anker immer als Basis, weil sie Stil und Grundstimmung stabilisieren. Ergänzen Sie Multi-Image Fusion, sobald eine Figur mehr als zwei- oder dreimal auftritt oder wenn Nahaufnahmen vorkommen. Nahaufnahmen verzeihen keine Abweichung.

Entscheidungskriterien für die richtige Methode

Nicht jedes Projekt braucht denselben Aufwand. Diese Fragen helfen bei der Wahl:

  • Wie oft erscheint die Figur? Einmal: Referenzbild genügt. Fünfmal oder häufiger: trainiertes Charaktermodell.
  • Wie nah ist die Kamera? Nur Totale und Halbtotale: geringere Anforderungen. Nahaufnahmen: maximale Stabilität nötig.
  • Wie lang ist das Video? Unter 30 Sekunden reicht meist Keyframe-Interpolation. Über zwei Minuten braucht es eine Pipeline mit Versionskontrolle.
  • Wie wichtig ist Realismus? Stilisierte Figuren verzeihen mehr Drift als fotorealistische.
  • Wie oft ändert sich die Umgebung? Viele verschiedene Sets erhöhen das Risiko, weil Licht und Farbstimmung neu ausgehandelt werden müssen.
  • Gibt es ein Team? Mehrere Mitwirkende brauchen dokumentierte Standards, sonst entstehen inkonsistente Varianten.

Typische Fehler und wie Sie sie vermeiden

Zu viele Referenzen gleichzeitig. Mehr als sechs stark gewichtete Bilder verwässern die Identität. Reduzieren Sie lieber auf drei oder vier starke Referenzen.

Modellwechsel mitten im Projekt. Jedes Modell interpretiert Embeddings anders. Ein Wechsel verändert Gesichter, selbst bei identischem Referenzset. Legen Sie das Modell vor Produktionsbeginn fest.

Auflösungsmismatch. Referenzen in quadratischer Form und Ausgabe im Breitbild führen zu Beschnitt und Verschiebungen. Halten Sie Seitenverhältnisse konsistent oder planen Sie den Beschnitt bewusst ein.

Ignorierte Negativliste. Ohne explizite Verbote fügt das Modell gern Schmuck, Bartschatten oder Accessoires hinzu, die nicht zur Figur gehören.

Bewegung ohne Pose-Kontrolle. Wenn Körperhaltung wichtig ist, braucht es zusätzliche Steuerung über Pose- oder Tiefeninformationen. Ohne sie erfindet das Modell die Haltung bei jeder Einstellung neu.

Zu späte Kontrolle. Wer erst am Ende prüft, produziert doppelt. Die Prüfung nach jeder Einstellung spart deutlich mehr Zeit, als sie kostet.

Vermischung von Identität und Stil. Wenn Sie gleichzeitig Figur und Bildsprache ändern, wissen Sie nicht, welche Anpassung welchen Effekt hatte. Ändern Sie immer nur eine Variable pro Durchlauf.

Werkzeuge und ihr jeweiliger Platz in der Pipeline

Ein realistischer Werkzeugkasten kombiniert mehrere Bausteine:

  • Bildgenerierung: für Referenzbilder und Keyframes, mit Charakter-Conditioning
  • Videogenerierung: für Bewegungs- und Szenengenerierung, idealerweise mit Start- und Endbildsteuerung
  • Node-basierte Umgebungen: für volle Kontrolle über Conditioning, Gewichtung und Masken
  • Adapter für Identität: um Referenz-Embeddings in bestehende Modelle einzuspeisen
  • Pose- und Tiefensteuerung: für konsistente Körperhaltung und Kameraführung
  • Charaktertraining: für wiederkehrende Figuren über viele Einstellungen
  • Upscaling und Farbkorrektur: für die finale Vereinheitlichung
  • Schnittprogramm: für Taktung, Ton und Ausgabeformate

Die konkreten Produktnamen sind weniger wichtig als die Rolle im Ablauf. Wer versteht, welcher Baustein welche Aufgabe erfüllt, kann Werkzeuge austauschen, ohne die Pipeline neu zu erfinden. Ein Modell wie Runway, Kling, Luma oder Veo lässt sich ersetzen; eine dokumentierte Charakterbibel nicht.

Konsistenz in Serien und Teamproduktionen

Sobald mehrere Personen oder mehrere Episoden im Spiel sind, wird Konsistenz zu einem Prozessproblem.

Ordner- und Namensstruktur: Legen Sie pro Figur einen Ordner mit Unterordnern für Referenzen, Keyframes, generierte Clips und freigegebene Versionen an. Benennen Sie Dateien mit Szenennummer, Einstellung und Version.

Stil-Lock: Dokumentieren Sie Farbwerte, Lichtstimmung, Objektivwirkung und Grading in einer kurzen Stildatei. Diese Datei ist die Referenz für alle neuen Einstellungen.

Shot-Liste als Tabelle: Eine Tabelle mit Spalten für Szenennummer, Beschreibung, Figur, Kleidung, Referenzset, Status und Freigabe verhindert, dass Details verloren gehen.

Review-Rhythmus: Prüfen Sie täglich oder nach jedem Produktionsblock. Späte Korrekturen sind teuer, weil bereits generierte Einstellungen neu erstellt werden müssen.

Einheitliche Bewertung: Definieren Sie eine kurze Checkliste mit fünf Punkten, die jede Person bei jeder Freigabe abarbeitet. Subjektive Einschätzungen führen zu inkonsistenten Entscheidungen.

FAQ: häufige Fragen zur Charakterkonsistenz

Wie viele Referenzbilder brauche ich wirklich?

Für einfache Projekte reichen drei: ein frontales Portrait, ein Halbprofil und ein Ganzkörperbild. Für Serien mit Nahaufnahmen sind fünf bis acht Bilder sinnvoll, aufgeteilt nach Blickwinkel und Lichtsituation.

Reicht ein guter Prompt, um Konsistenz zu erzeugen?

Für markante, stilisierte Figuren oft ja. Für fotorealistische Gesichter in Nahaufnahme praktisch nie. Text beschreibt Merkmale, aber nicht die feinen Proportionen, die ein Gesicht wiedererkennbar machen.

Warum verändert sich die Figur, obwohl ich denselben Seed nutze?

Seeds wirken nur innerhalb desselben Modells und derselben Bedingungen. Ändern sich Referenzgewichte, Auflösung, Seitenverhältnis oder die Modellversion, verliert der Seed seine Wirkung.

Kann ich eine echte Person als Vorbild nutzen?

Nur mit ausdrücklicher Zustimmung und geklärten Rechten. Das gilt besonders für Stimme, Gesicht und Markenauftritt. Dokumentieren Sie die Freigabe schriftlich.

Wie gehe ich mit Kleidungswechseln um?

Halten Sie Gesichts- und Frisurreferenzen konstant und beschreiben Sie Kleidung separat pro Szene. Wenn Kleidung Teil der Identität ist, behandeln Sie sie wie ein eigenes Attribut mit eigenen Referenzen.

Was tun bei Drift in einer einzelnen Einstellung?

Erst Referenzgewichtung prüfen, dann die Einstellung als Keyframe-Paar neu aufsetzen. Wenn die Abweichung bleibt, liegt es meist an widersprüchlichem Licht in den Referenzen.

Lohnt sich ein trainiertes Charaktermodell?

Ab etwa fünf Einstellungen mit derselben Figur fast immer. Der Trainingsaufwand ist einmalig, die Zeitersparnis wächst mit jedem weiteren Clip.

Wie prüfe ich Konsistenz effizient?

Erstellen Sie ein Kontaktblatt mit einem Schlüsselbild pro Einstellung und betrachten Sie es in Originalgröße. Passen Augen, Haaransatz und Kleiderfarbe überein, passt auch das Video.

Fazit: Konsistenz ist ein Prozess, kein Zufall

Multi-Image Fusion ist kein magischer Knopf, sondern eine Methode, um Identität aus mehreren visuellen Quellen zu definieren und über eine ganze Produktion hinweg zu halten. Wer ein sauberes Referenzset aufbaut, die Methode an die Projektgröße anpasst, Keyframes bewusst einsetzt und nach jeder Einstellung prüft, bekommt Ergebnisse, die nicht nur technisch überzeugen, sondern eine Geschichte tragen.

Der wichtigste Rat zum Schluss: Behandeln Sie die Figur wie eine reale Person mit einer Akte. Alles, was Sie über sie wissen, wird schriftlich festgehalten, und jede neue Einstellung muss gegen diese Akte geprüft werden. Genau dieser unspektakuläre Schritt trennt ein technisches Experiment von einem Video, dem das Publikum folgt, ohne aus der Geschichte zu fallen.

Alexander

Alexander