Start Free Now
Limited Time Offer: Get 50% OFF Starter & Basic Yearly Plans 🎉

Konsistente KI-Charaktere mit Multi-Image-Fusion: Workflow-Guide

Oct 1, 2026

Warum Charakterkonsistenz über Erfolg oder Misserfolg entscheidet

Generatives Video hat in kurzer Zeit enorme Sprünge gemacht: Einzelaufnahmen wirken heute oft fotorealistisch, Bewegungen laufen flüssig, Licht und Materialien überzeugen. Der Bruch entsteht selten innerhalb einer Szene – er entsteht zwischen den Szenen. Dieselbe Figur, die in Einstellung eins noch markante Wangenknochen und eine ruhige Augenpartie hatte, bekommt zwei Schnitte später ein weicheres Gesicht, eine andere Frisur und plötzlich einen Bartschatten. Für Zuschauer ist das kein technisches Detail, sondern ein Identitätswechsel – und der zerstört die Geschichte.

Das Problem ist wirtschaftlich relevant. Serienformate auf Social Media, wiederkehrende Werbefiguren, Erklärvideos mit einem festen Sprecher, Testimonials, die über Wochen ausgespielt werden: Alles davon lebt von Wiedererkennung. Wer jede Einstellung isoliert generiert, produziert Ausschuss. Wer mit einem sauberen Referenzsystem arbeitet, produziert Assets.

Charakterkonsistenz ist deshalb weniger eine Prompt-Frage als eine Frage des Produktionsdesigns. Dieser Leitfaden erklärt, wie Multi-Image-Fusion technisch funktioniert, wie Sie ein belastbares Referenzset aufbauen, wie der Workflow von der Charakterbibel bis zum fertigen Clip aussieht – und an welchen Stellen die Qualität typischerweise kippt.

So funktioniert Multi-Image-Fusion technisch

Multi-Image-Fusion bedeutet: Das Modell erhält nicht ein einzelnes Referenzbild, sondern mehrere Aufnahmen derselben Figur und leitet daraus eine gemeinsame Identitätsrepräsentation ab. Statt ein Gesicht Pixel für Pixel zu kopieren, extrahiert das System konsistente Merkmale – Proportionen, Augenabstand, Nasenform, Kieferlinie, Hautton, Haarlinie – und verdichtet sie zu einem Signal, das jede generierte Szene mitsteuert.

Typische Videomodelle und Bildgeneratoren mit Referenzfunktion arbeiten dabei mit zwei Ebenen: einer strukturellen Bedingung (Pose, Komposition, Licht) und einer Identitätsbedingung (Gesichts- und Körpermerkmale). Die Identitätsbedingung wirkt als weiche Vorgabe. Sie ist stark genug, um ein Gesicht über zwanzig Einstellungen zu tragen, aber schwach genug, um bei widersprüchlichen Eingaben zu driften.

Identitätsvektoren statt Gesichtskopien

Der eigentliche Trick ist Abstraktion. Aus Ihren Referenzbildern entsteht ein Merkmalsraum, in dem „diese Person“ ein wiedererkennbarer Bereich ist. Bei jeder Generierung fragt das Modell im Kern: Wie nah liegt das entstehende Gesicht an diesem Bereich? Je klarer der Bereich definiert ist, desto stabiler das Ergebnis. Ein einzelnes Referenzbild definiert nur einen Punkt – und ein Punkt lässt sich leicht verfehlen.

Warum mehrere Bilder robuster sind als eines

Ein einziges Foto ist immer ein Zufallsprodukt: eine bestimmte Lichtsituation, ein bestimmter Winkel, ein bestimmter Ausdruck. Nutzt das Modell nur diese eine Quelle, überträgt es auch deren Zufälle: Schattenwurf, Kopfhaltung, Augenausdruck. Mit acht bis fünfundzwanzig Bildern mittelt das System diese Zufälle heraus und findet den gemeinsamen Nenner. Profilaufnahmen liefern Informationen, die ein Frontalfoto nicht enthält – etwa Nasenprofil und Kieferverlauf. Genau diese Winkel entscheiden später darüber, ob eine Dreivierteldrehung noch glaubwürdig ist.

Die Grenzen des Verfahrens

Multi-Image-Fusion stabilisiert Identität, nicht Anatomie. Extreme Blickwinkel, starke Verdeckungen durch Hände oder Requisiten, harte Seitenlichtsituationen und schnelle Kopfbewegungen bleiben schwierig. Auch Konsistenz jenseits des Gesichts – Kleidung, Requisiten, Raumgestaltung – entsteht nicht automatisch. Das Modell kennt keine Kontinuitätslogik; es kennt nur Ähnlichkeit. Wer das akzeptiert, plant anders: kürzer, kontrollierter, mit mehr Zwischenprüfungen.

Ein Referenzset aufbauen, das wirklich trägt

Die Qualität Ihres Referenzsets bestimmt die Obergrenze der erreichbaren Konsistenz. Ein schlechtes Set lässt sich später nicht durch Prompts reparieren.

Der Aufnahmeplan

Arbeiten Sie systematisch statt intuitiv. Ein Set aus fünfzehn bis fünfundzwanzig Bildern sollte abdecken:

  • Frontale Ansicht bei neutraler Grundbeleuchtung
  • Dreiviertelansicht von links und von rechts
  • Zwei Profilaufnahmen (links, rechts)
  • Eine Nahaufnahme des Gesichts, formatfüllend
  • Eine Halbtotale und eine Ganzkörperaufnahme
  • Neutrale Mimik, leichtes Lächeln, sprechender Mund mit sichtbaren Zähnen
  • Eine Aufnahme mit seitlichem Licht, eine mit weichem Gegenlicht
  • Maximal zwei Outfits, um Garderobensignale nicht zu verwässern

Alle Bilder sollten dieselbe Person, dieselbe Frisur und denselben Grundton haben. Wechseln Sie zwischen den Aufnahmen nicht die Brennweite zu stark, sonst entstehen perspektivische Verzerrungen, die das Modell als Merkmal interpretiert.

Auswahl und Aufbereitung

Weniger als acht Referenzen machen das Ergebnis fragil. Mehr als vierzig bringen kaum zusätzliche Stabilität und können widersprüchliche Signale einspeisen – etwa, wenn zwei Bilder unterschiedliche Gesichtsformen zeigen, weil eines stark retuschiert wurde. Aussortieren sollten Sie konsequent:

  • Bewegungsunschärfe oder Verwacklung
  • Sonnenbrillen, Schals, Hände vor dem Gesicht
  • Starke Beauty-Filter oder Weichzeichnung
  • Selfies mit Weitwinkelverzerrung
  • Bilder mit extrem unterschiedlicher Farbtemperatur

Schneiden Sie die Bilder auf einen einheitlichen Kopf-Schulter-Ausschnitt zu und markieren Sie das beste Frontalfoto als Hauptanker. Dieses Ankerbild verwenden Sie, wenn eine Einstellung besonders kritisch ist.

Synthetische Figuren und Rechte an realen Personen

Bei erfundenen Figuren empfiehlt sich der umgekehrte Weg: Zuerst entsteht ein Charakterblatt mit konsistenten Merkmalen, aus dem Sie anschließend Referenzaufnahmen ableiten. So bleibt die Figur von Anfang an frei von Zufällen. Bei realen Personen gilt: schriftliche Einwilligung einholen, Nutzungsumfang klären und festhalten, ob die Referenzen nach Projektende gelöscht werden müssen. Das ist keine Formalie – es bestimmt, welche Sets Sie überhaupt dauerhaft archivieren dürfen.

Der komplette Workflow: von der Charakterbibel zum fertigen Clip

Schritt 1: Charakterbibel anlegen

Eine Charakterbibel ist ein kurzes Dokument, das jede Einstellung überlebt. Sie enthält:

  • Name, Alter, Herkunft, Körperbau
  • Gesichtsmerkmale in Worten (Augenform, Brauen, Nasenrücken, Kieferlinie)
  • Frisur, Haarfarbe, Bartstatus
  • Grundgarderobe mit exakter Bezeichnung jedes Kleidungsstücks
  • Farbpalette der Figur und ihrer Umgebung
  • Accessoires, die immer oder nie vorkommen

Wichtigster Bestandteil ist der Identitätsblock: ein Textbaustein von vierzig bis sechzig Wörtern, der die Figur beschreibt und in jeder Einstellung wortgleich wiederholt wird. Nicht „ähnlich formuliert“ – wortgleich. Jede Variation ist ein neues Signal.

Schritt 2: Shotlist und Kontinuitätskarte

Erstellen Sie eine Tabelle mit einer Zeile pro Einstellung: Nummer, Einstellungsgröße, Blickrichtung, Garderobenzustand (Jacke offen oder geschlossen), Requisiten, Lichtstimmung, Tageszeit. Die Kontinuitätskarte ist der billigste Teil der Produktion und verhindert die teuersten Fehler. Wer sie weglässt, merkt erst beim Schnitt, dass zwischen zwei Einstellungen die Kaffeetasse ihre Seite gewechselt hat.

Schritt 3: Erst Keyframe, dann Bewegung

Generieren Sie zuerst ein Standbild pro Einstellung. Prüfen Sie es gegen die Charakterbibel – Gesicht, Garderobe, Licht. Erst wenn der Keyframe sitzt, wandeln Sie ihn in Bewegungsmaterial um. Dieser Zwischenschritt kostet wenige Minuten und spart komplette Generierungsläufe, weil Fehler sichtbar werden, bevor Rechenzeit in Animation fließt.

Schritt 4: Generieren, prüfen, verwerfen

Ändern Sie pro Iteration genau eine Variable. Wenn Gesicht und Garderobe stimmen, aber das Licht nicht passt, korrigieren Sie ausschließlich den Lichtteil des Prompts. Wer drei Dinge gleichzeitig ändert, lernt nichts über die Ursache. Vergleichen Sie Kandidaten in einer Kontaktbogenansicht nebeneinander – im direkten Vergleich sieht man Drift, die einzeln betrachtet unsichtbar bleibt.

Schritt 5: Postproduktion

Rechnen Sie mit Nacharbeit. Sanfte Stabilisierung, punktuelle Hautretusche, Farbanpassung über alle Einstellungen, Frame-Interpolation für flüssigere Bewegung und Ton, der die Aufmerksamkeit führt. Ein einheitliches Grading über alle Clips hinweg kaschiert kleine Unterschiede in Farbtemperatur und Kontrast deutlich besser als jedes Nachgenerieren.

Prompting für Konsistenz: die Bausteinmethode

Die fünf Blöcke

Bauen Sie jeden Prompt nach demselben Schema:

  1. Identitätsblock: wortgleich aus der Charakterbibel
  2. Garderobenblock: exakte Bezeichnungen, keine Synonyme
  3. Szenenblock: Ort, Handlung, Tageszeit
  4. Kamerablock: Brennweite, Einstellungsgröße, Bewegungsart
  5. Stilblock: Look, Farbton, Filmkorn, Bildrate-Anmutung

Dazu ein negativer Block mit unerwünschten Elementen: zusätzliche Personen im Hintergrund, Text im Bild, Wasserzeichen, verzerrte Hände, doppelte Gliedmaßen.

Wortdisziplin schlägt Ausführlichkeit

Der häufigste Grund für Identitätsdrift ist sprachliche Unschärfe. „Mann“ in Einstellung eins und „junger Kerl“ in Einstellung zwei sind für das Modell zwei verschiedene Konzepte. Dasselbe gilt für Synonyme bei Kleidung: „Hemd“, „Bluse“, „Oberteil“ erzeugen drei unterschiedliche Stoffe. Legen Sie eine Begriffsliste an und halten Sie sich daran.

Vorsicht auch bei widersprüchlichen Adjektiven. Wenn Ihre Referenzfigur weiche Gesichtszüge hat, Sie aber „markante Wangenknochen“ in den Prompt schreiben, entsteht ein Kompromiss – im Ergebnis ein drittes, unbekanntes Gesicht. Beschreiben Sie die Figur so, wie sie tatsächlich aussieht.

Seeds, Seitenverhältnisse und Parameterdisziplin

Für vertikale Kurzvideos setzen Sie das Seitenverhältnis einmal fest und ändern es nie innerhalb einer Serie. Fixieren Sie, wenn möglich, den Basisseed und die Stichprobenschritte. Halten Sie Kamerabewegungen klein: langsamer Schwenk, leichte Fahrt, subtiler Push. Drei bis sechs Sekunden pro Einstellung sind ein gutes Arbeitsmaß, weil sich Drift mit der Laufzeit summiert.

Kleidung, Requisiten und Sets konsistent halten

Konsistenz endet nicht am Kinn. Definieren Sie pro Figur ein Standard-Outfit und höchstens zwei Varianten, jeweils mit einer eigenen Referenzaufnahme. Notieren Sie Details, die später auffallen: Ärmelaufschlag, offener Kragen, Schmuck auf welcher Seite, Taschenposition.

Kontinuitätsklasse Was erfassen Artefakt
Figur Gesicht, Haare, Körperbau Referenzset plus Identitätsblock
Garderobe Schnitt, Farbe, Zustand Referenzbild pro Outfit
Requisiten Anzahl, Position, Zustand Inventarliste pro Einstellung
Umgebung Raum, Möbel, Hintergrunddetails Hintergrund-Referenzplatte
Licht Richtung, Härte, Tageszeit Lichtkarte pro Szene
Format Seitenverhältnis, Bildrate, Grading Projektprofil

Für Sets lohnt sich eine eigene Referenzplatte: ein Bild des Raums ohne Figur. Damit lassen sich Szenen neu generieren, ohne den Hintergrund zu verlieren. Farbpaletten pro Drehort verhindern, dass Szenen unterschiedlich „kalt“ oder „warm“ wirken.

Szenen mit mehreren Figuren

Zwei Figuren in einer Generierung sind der häufigste Grund für Identitätsvermischung. Das Modell mittelt Gesichtsmerkmale, Haarfarben und sogar Kleidung, wenn sich die Figuren ähneln. Praktikable Strategien:

  • Getrennte Durchläufe für jede Figur, anschließend zusammensetzen
  • Über-die-Schulter-Einstellungen, bei denen nur ein Gesicht groß im Bild ist
  • Weite Einstellungen, in denen Gesichter klein bleiben und Details nicht auffallen
  • Klare Differenzierung über Palette: unterschiedliche Haarfarben, Kleidungsfarben, Lichtseiten
  • Feste Blickrichtungen, damit der Schnitt später die Achse hält

Wenn eine gemeinsame Einstellung unvermeidbar ist, generieren Sie drei bis fünf Varianten mit reduzierter Bewegung und wählen die stabilste. Für Dialoge gilt: Nahaufnahmen im Wechsel, Reaktionen statt gleichzeitiger Präsenz. Das ist klassische Filmgrammatik und zufällig auch die technisch einfachste Lösung.

Troubleshooting: wenn das Gesicht kippt

Symptom Wahrscheinliche Ursache Maßnahme
Gesicht wird weicher oder älter Zu wenige Referenzen, widersprüchliche Adjektive Mehr Winkel ergänzen, beschreibende Adjektive entfernen
Identität wechselt nach dem Schnitt Stil- oder Seedwechsel zwischen Einstellungen Stilblock vereinheitlichen, Seed fixieren
Merkmale verschmelzen bei Bewegung Schnelle Kopfbewegung, lange Takes Kürzere Einstellungen, geringere Bewegungsintensität
Garderobe springt Synonyme im Prompt Begriffsliste erzwingen
Gesicht dauerhaft verdeckt Hände, Requisiten, Haare Kameraposition ändern, alternative Einstellungsgröße
Künstlicher Gesamteindruck Zu starke Nachschärfung oder Wiederherstellung Retusche reduzieren, Grading vereinheitlichen

Ein wichtiger Grundsatz: Nicht jeder Fehler ist ein Generierungsfehler. Kleine Abweichungen bei Nebenfiguren, Hintergrunddetails oder Requisiten lassen sich im Schnitt kaschieren. Investieren Sie Nacharbeit dort, wo die Hauptfigur betroffen ist, und akzeptieren Sie Mikrofehler im Randbereich. Wer jede Einstellung perfekt generieren will, produziert vor allem Stillstand.

Qualitätskontrolle mit Checkliste und Fehlerklassifikation

Prüfen Sie jede fertige Einstellung in fester Reihenfolge:

  1. Identität: Gesichtsproportionen, Augenabstand, Haarlinie
  2. Garderobe: Schnitt, Farbe, Zustand, Schmuck
  3. Requisiten: Anzahl, Position, Zustand
  4. Umgebung: Möbel, Hintergrunddetails, Tageszeit
  5. Licht: Richtung, Härte, Farbtemperatur
  6. Bewegung: Natürlichkeit, Drift über die Take-Länge
  7. Ton und Format: Lautheit, Seitenverhältnis, Grading

Klassifizieren Sie Fehler anschließend:

  • Klasse A – Identität gebrochen: neu generieren, kein Kompromiss
  • Klasse B – Kontinuitätsfehler: retuschieren oder Einstellung tauschen
  • Klasse C – Ästhetik: akzeptieren, wenn der Blick nicht hängen bleibt

Diese Klassifikation verhindert die typische Endlosschleife, in der eine eigentlich gute Einstellung zwanzig Mal neu generiert wird, weil ein Detail im Hintergrund stört.

Häufige Fehler und FAQ

Typische Fehler

  • Nur ein Referenzbild verwenden und dann Stabilität erwarten
  • Den Identitätsblock in jeder Einstellung neu formulieren
  • Licht, Garderobe und Kamerawinkel gleichzeitig ändern
  • Zu lange Takes generieren statt kurzer, kontrollierter Einstellungen
  • Keine Shotlist führen und Kontinuität erst im Schnitt prüfen
  • Referenzbilder mit unterschiedlicher Bearbeitung mischen
  • Bei mehreren Figuren auf eine gemeinsame Generierung hoffen

Wie viele Referenzbilder brauche ich wirklich?

Für eine wiederkehrende Hauptfigur sind fünfzehn bis fünfundzwanzig Aufnahmen ein solider Arbeitsbereich. Unter acht wird es fragil, über vierzig bringt kaum mehr Stabilität. Entscheidend ist die Vielfalt der Winkel, nicht die reine Menge.

Reicht ein gutes Standbild für eine ganze Serie?

Für kurze Formate mit überwiegend frontalen Einstellungen kann ein starkes Bild plus sauberer Identitätsblock erstaunlich weit tragen. Sobald Dreivierteldrehungen, Profilaufnahmen oder wechselnde Lichtsituationen dazukommen, brauchen Sie mehrere Winkel.

Warum sieht meine Figur in der Totalen anders aus als in der Nahaufnahme?

In der Totalen ist das Gesicht klein und liefert kaum Identitätssignal. Das Modell füllt die Lücke mit Wahrscheinlichkeiten. Gegenmaßnahmen: eine Ganzkörper-Referenz ergänzen, die Totale kürzer halten und Details wie Garderobe und Frisur exakt beschreiben, damit der Wiedererkennungseffekt über Kleidung und Silhouette läuft.

Kann ich Konsistenz nachträglich retten?

Teilweise. Sanfte Hautretusche, Farbanpassung und Stabilisierung helfen bei kleinen Abweichungen. Ein grundlegend anderes Gesicht lässt sich nicht glaubwürdig angleichen – hier ist Neugenerierung günstiger als Stunden in der Nachbearbeitung.

Wie gehe ich mit wechselnden Outfits um?

Legen Sie pro Outfit ein eigenes Referenzbild an und einen eigenen Garderobenblock, der immer vollständig zitiert wird. Ein Outfitwechsel innerhalb einer Einstellung funktioniert praktisch nie zuverlässig; planen Sie ihn als Schnitt zwischen zwei Einstellungen.

Was ist wichtiger: Prompt oder Referenzen?

Die Referenzen setzen die Obergrenze, der Prompt entscheidet, wie nah Sie herankommen. Ein gutes Set mit einem nachlässigen Prompt liefert mittelmäßige Ergebnisse; ein präziser Prompt mit einem schwachen Set liefert keine. Beginnen Sie immer beim Referenzset.

Alexander

Alexander