Limited Time Offer: Get 50% OFF your first month of Pro & Ultra plans 🎉

Konsistente Charaktere in KI-Videos: Multi-Image-Fusion

Sep 21, 2026

Warum Charakterkonsistenz der eigentliche Engpass ist

Ein einzelner Clip mit einer schönen Figur ist heute in wenigen Minuten produziert. Sobald daraus aber eine Serie, ein Werbespot mit wiederkehrendem Testimonial oder ein Erklärvideo mit fester Moderationsfigur wird, kippt die Stimmung schnell. In Szene drei trägt die Hauptfigur plötzlich eine andere Nasenform, die Augen sitzen anders, der Haaransatz wandert, und das Publikum spürt unbewusst: Das ist nicht dieselbe Person. Genau dieser Bruch ist der Grund, warum viele KI-Videoprojekte an der Schwelle vom Experiment zum brauchbaren Format scheitern.

Konsistenz ist dabei kein rein ästhetisches Problem. Sie entscheidet darüber, ob Zuschauer einer Figur über mehrere Minuten folgen, ob eine Marke wiedererkennbar bleibt und ob ein Team Aufnahmen wiederverwenden kann, statt Szenen dutzendfach neu zu rendern. Jeder Durchlauf, in dem die Figur kippt, kostet Zeit im Schnitt, in der Farbkorrektur und in der manuellen Reparatur. Wer Konsistenz von Anfang an als Teil des Workflows begreift, spart nicht nur Aufwand, sondern gewinnt erzählerische Freiheit: Nahaufnahmen werden möglich, Rückblenden, Perspektivwechsel und ganze Szenenfolgen mit derselben Person.

Die gute Nachricht: Das Problem ist lösbar. Multi-Image-Fusion (MIF) ist der Oberbegriff für Techniken, die mehrere Referenzbilder zu einem stabilen Identitätsprofil zusammenfassen und dieses Profil bei jeder Generierung erneut anwenden. Dieser Leitfaden erklärt, wie die Technik funktioniert, welche Vorbereitung wirklich zählt und wie ein reproduzierbarer Workflow aussieht – von der ersten Referenzaufnahme bis zum finalen Schnitt.

Multi-Image-Fusion verständlich erklärt

Multi-Image-Fusion bedeutet nicht, dass ein Modell mehrere Bilder einfach übereinanderlegt. Es bedeutet, dass aus mehreren Aufnahmen derselben Figur ein gemeinsames Merkmalsprofil gebildet wird, das anschließend jede neue Generierung steuert. Das Ergebnis ist eine Art digitaler Fingerabdruck der Figur, der unabhängig von Pose, Licht und Hintergrund funktioniert.

Von Pixeln zu Merkmalsvektoren

Jedes Referenzbild durchläuft einen Encoder, der es in einen Vektorraum übersetzt. Dort liegen Gesichtsgeometrie, Augenabstand, Kieferlinie, Hautton, Haarfarbe und charakteristische Details wie Muttermale oder Brillenformen dicht beieinander. Entscheidend ist die Trennung von Identität und Stil: Ein gutes System erkennt, dass ein Schatten auf der Wange zur Beleuchtung gehört und nicht zum Gesicht. Genau diese Trennung ist der Grund, warum ein Referenzbild bei grellem Seitenlicht die Identität stabilisieren kann, ohne dass jede neue Szene später ebenfalls grelles Seitenlicht bekommt.

Wie Referenzbilder gewichtet werden

Die Aggregation erfolgt meist über Mittelung, Attention-Mechanismen oder gelernte Gewichte. Praktisch heißt das: Nicht alle Referenzen sind gleich wichtig. Ein scharfes Frontalporträt trägt häufig mehr zur Identität bei als eine bewegte Ganzkörperaufnahme. Wenn Referenzen sich widersprechen – etwa zwei verschiedene Haarlängen oder unterschiedliche Bartformen – entsteht ein unscharfes Mittelbild, und die Figur driftet zwischen den Varianten hin und her. Deshalb gilt: lieber fünf widerspruchsfreie Bilder als zwanzig widersprüchliche.

Warum sich Modelle unterschiedlich verhalten

Manche Systeme arbeiten mit Conditioning, also einer Steuerung während der Generierung, andere mit einem fein abgestimmten Zusatzmodell für eine bestimmte Person oder Kleidung. Conditioning ist schnell und flexibel, ein Feinabstimmungslauf liefert oft höhere Treue, braucht aber mehr Vorbereitung und Daten. Zusätzlich unterscheiden sich Modelle darin, ob sie Gesichter oder Bewegungen besser halten. Ein häufiger Fehler ist, mitten in einer Szene das Modell zu wechseln: Selbst bei identischem Referenzset sehen Gesichter und Farbanmutung danach anders aus.

Das Referenzset: die Grundlage jeder stabilen Figur

Die Qualität des Referenzsets entscheidet mehr über das Ergebnis als jeder Prompt-Trick. Wer hier zwanzig Minuten investiert, spart später Stunden.

Welche Bilder gehören ins Set

Ein belastbares Set enthält meist sechs bis zehn Aufnahmen:

  • Frontal, neutral beleuchtet: das wichtigste Bild, Augen sichtbar, Mund geschlossen.
  • Dreiviertelansicht links und rechts: zeigt die Plastizität des Kopfes.
  • Profil: verankert Nase, Kinn und Haarlinie.
  • Nahaufnahme: für Details wie Augenfarbe, Wimpern, feine Hautstruktur.
  • Ganzkörper: für Proportionen, Körperbau und Kleidung.
  • Zwei bis drei Ausdrucksvarianten: lachen, neutral, nachdenklich – aber mit identischem Haar und Outfit, wenn ein kanonischer Look entstehen soll.

Technisch sollten die Bilder mindestens 1024 Pixel in der längeren Kante haben, scharf und frei von Filtern sein. Ein neutraler Hintergrund hilft, weil dann keine Kulissenfarben in den Vektorraum bluten.

Was Sie unbedingt vermeiden sollten

Problematisch sind Sonnenbrillen, die die Augen verdecken, extremes Weitwinkel mit verzerrtem Gesicht, Bewegungsunschärfe, stark farbiges Licht und Collagen mit mehreren Personen. Auch ein Wasserzeichen oder ein auffälliges Logo im Bild kann als Merkmal übernommen werden. Vermeiden Sie außerdem Referenzen, die sich in Frisur, Bart oder Alter widersprechen, wenn Sie eine einzige kanonische Identität anstreben.

Der Workflow von der Idee zum fertigen Clip

Schritt 1: Charakterdatenblatt anlegen

Bevor das erste Bild entsteht, gehört alles schriftlich festgehalten: Identitätsanker (Haarfarbe, Augenfarbe, besondere Merkmale), Stilanker (Linsenwirkung, Filmkorn, Farbpalette), Garderobe, Stimmlage und Verhalten. Dieses Dokument ist der Vertrag, an dem Sie jedes generierte Ergebnis messen. Ohne es bewerten Sie Bilder nach Bauchgefühl und verlieren die Linie.

Schritt 2: Look-Development mit Standbildern

Generieren Sie zunächst 20 bis 30 Standbilder der Figur und wählen Sie die sechs bis acht stärksten aus. Achten Sie darauf, dass die Auswahl zusammen ein konsistentes Bild ergibt und nicht nur die schönsten Einzelbilder enthält. Skalieren Sie die Gewinner hoch, entfernen Sie störende Hintergründe und speichern Sie sie mit klarer Namenskonvention, etwa figur-name_frontal_v2.png. Versionierung ist kein Luxus, sondern die Grundlage für reproduzierbare Ergebnisse.

Schritt 3: Shotlist und Ankerframes

Zerlegen Sie die Szene in einzelne Einstellungen und notieren Sie für jede: Bildausschnitt, Handlung, Kamerabewegung und Lichtrichtung. Erzeugen Sie dann pro Einstellung ein Anfangsbild und, wenn möglich, ein Endbild. Diese Ankerframes sind Ihr Sicherheitsnetz: Das Video wird anschließend zwischen zwei bekannten, konsistenten Zuständen interpoliert, statt frei zu driften.

Schritt 4: Clips generieren

Arbeiten Sie mit kurzen Clips von drei bis sechs Sekunden und lassen Sie pro Clip nur eine klar benannte Handlung zu. Verwenden Sie pro Szene dasselbe Referenzset, dieselbe Saat beziehungsweise denselben Seed und dieselben Stilangaben. Mehrere kleine Bewegungen in einem Clip sind der häufigste Grund für verzerrte Gesichter, weil das Modell zwischen widersprüchlichen Posen interpolieren muss.

Schritt 5: Verlängern und verbinden

Verlängern Sie einen Clip immer vom letzten Frame aus, nicht durch erneutes Prompten der ganzen Szene. Planen Sie eine Überlappung von etwa einer halben Sekunde ein, damit der Schnitt weich fällt. Wechseln Sie die Kamerarichtung nicht abrupt: Wenn die Figur nach links blickt, sollte sie in der Folgeaufnahme weiterhin in dieselbe Richtung schauen, sonst wirkt die Montage wie ein Sprung.

Schritt 6: Postproduktion

Im Schnitt gleichen Sie Restabweichungen aus. Ein einheitliches Farbprofil, etwas Filmkorn und eine sanfte Schärfung über alle Szenen hinweg bügeln kleine Unterschiede glatt, weil das Auge dann dieselbe Materialanmutung erkennt. Schneiden Sie möglichst auf Bewegung, also im Moment des größten Impulses, denn dort ist der Schnitt am wenigsten sichtbar. Bei hartnäckig abweichenden Gesichtern hilft es, die Aufnahme zu kürzen statt sie mühsam zu reparieren.

Prompting-Strategie für stabile Identitäten

Identitätsanker und Stilanker trennen

Formulieren Sie in jedem Prompt zwei Blöcke. Der erste beschreibt ausschließlich, was unverändert bleibt: Figur, Alter, Frisur, Kleidung, Stil. Der zweite beschreibt die Einstellung: Blickwinkel, Bewegung, Licht, Umgebung. Wenn Sie in Szene fünf plötzlich weitschweifig andere Haare beschreiben, driftet die Figur, obwohl das Referenzset unverändert ist.

Wiederholung schlägt Kreativität

Kopieren Sie die Identitätsformulierung wortwörtlich von Einstellung zu Einstellung. Variation gehört ausschließlich in den zweiten Block. Halten Sie Beschreibungen darüber hinaus knapp: Je mehr konkurrierende Adjektive im Prompt stehen, desto mehr Freiheit gibt das Modell auf.

Negative Prompts richtig einsetzen

Negativ-Prompts helfen gegen verzerrte Hände, Gesichtsmorphing, Doppelbilder und weiche Konturen. Vorsicht bei Verneinungen im positiven Prompt: „ohne Brille“ kann eine Brille erzeugen, weil das Modell das Substantiv stärker gewichtet als die Verneinung. Schreiben Sie stattdessen, was sichtbar sein soll, und nutzen Sie für Ausschlüsse die Negativliste.

Temporale Kohärenz über Szenengrenzen hinweg

Konsistenz endet nicht beim Gesicht. Zeitliche Kohärenz umfasst Licht, Garderobe, Requisiten und Bewegungsrichtung. Ein Kontinuitätsblatt mit Spalten für Szene, Lichtquelle, Tageszeit, Kleidung und Kamerarichtung verhindert die typischen Fehler, die auch im klassischen Filmdreh gelten.

Besonders wirksam sind drei Regeln. Erstens: Eine Szene, eine Lichtsituation. Wenn die Sonne von links kommt, bleibt sie von links, bis die Szene endet. Zweitens: Bewegungstempo angleichen. Eine Figur, die in einer Einstellung hektisch und in der nächsten in Zeitlupe geht, wirkt wie ein anderer Charakter. Drittens: Übergänge bewusst planen. Ein Zwischenschnitt auf ein Detail – Hände, Requisit, Umgebung – gibt dem Betrachter eine Pause und verdeckt kleine Identitätsdrifts, ohne dass Sie technisch nachbessern müssen.

Wer wiederkehrende Figuren über mehrere Episoden plant, sollte außerdem eine Referenzbibliothek pflegen. Jede Figur erhält einen Ordner mit dem kanonischen Set, einer Kurzbeschreibung und einer Liste der Varianten, die bereits verwendet wurden. So beginnt jede neue Folge nicht bei null.

Gezielte Variationen: Kostüm, Alter, Stil

Variation und Konsistenz sind kein Widerspruch, solange Sie Änderungen isolieren. Ändern Sie immer nur eine Dimension pro Durchlauf und halten Sie die Identitätsreferenzen unverändert. Für einen Kostümwechsel tauschen Sie ausschließlich die Garderobenreferenz; für eine Altersstufe erhöhen Sie die Altersangabe moderat, behalten aber Frontal- und Profilbild als Anker.

Bewährt hat sich das Prinzip der nicht-destruktiven Ebenen: Referenzset, Kleidung, Umgebung und Stil liegen gedanklich auf getrennten Ebenen, die einzeln verändert werden können. Wer dagegen gleichzeitig Frisur, Körperbau, Beleuchtung und Modell wechselt, kann nicht mehr nachvollziehen, welche Änderung die Figur zerstört hat. Führen Sie bei größeren Projekten außerdem A/B-Tests durch: dieselbe Einstellung zweimal generieren, einmal mit und einmal ohne die neue Variation, und die Ergebnisse nebeneinander bewerten.

Typische Fehler und wie Sie sie beheben

  • Die Figur altert innerhalb einer Einstellung: Meist liegt es an zu langer Clipdauer oder zu vielen Bewegungen. Verkürzen Sie auf drei Sekunden, reduzieren Sie die Handlung auf eine Bewegung.
  • Das Gesicht „schmilzt“ bei Drehungen: Fehlen Profil- und Dreiviertelreferenzen. Ergänzen Sie Aufnahmen aus mehreren Winkeln, bevor Sie das Modell wechseln.
  • Haare oder Bartfarbe springt: Widersprüchliche Referenzen im Set. Entfernen Sie alle Bilder, die nicht dem kanonischen Look entsprechen.
  • Die Kleidung ändert sich von Schnitt zu Schnitt: Der Stilanker ist zu vage. Beschreiben Sie Material, Farbe und Schnitt ausdrücklich und halten Sie den Wortlaut konstant.
  • Hände werden zu Fingerknäueln: Verstecken Sie Hände hinter Requisiten, halten Sie sie außerhalb des Bildes oder schneiden Sie die Einstellung früher – das ist schneller als jede Reparatur.
  • Doppelte Personen im Bild: Prüfen Sie, ob ein Referenzbild eine zweite Person enthält, und verwenden Sie Negativ-Prompts gegen Spiegelungen und Schattenwürfe.
  • Farbstich von Szene zu Szene: Legen Sie ein gemeinsames Look-Up-Table beziehungsweise eine einheitliche Farbkorrektur über das gesamte Projekt.
  • Bewegung wirkt wie ein Sprung: Prüfen Sie die Kamerarichtung und verlängern Sie lieber vom letzten Frame, statt die Szene neu zu generieren.

Tool-Auswahl: Entscheidungskriterien statt Bauchentscheidungen

Nicht das populärste Werkzeug gewinnt, sondern das, das zu Ihrem Prozess passt. Sieben Kriterien haben sich in der Praxis bewährt:

  1. Referenzunterstützung: Wie viele Bilder lassen sich einspeisen, und werden sie gewichtet?
  2. Clipslänge und Auflösung: Kurze Clips sind für Konsistenz oft von Vorteil, hochauflösende Ausgabe spart späteres Hochskalieren.
  3. Seed-Kontrolle: Ohne reproduzierbare Saat ist Feintuning kaum möglich.
  4. Bild-zu-Video-Qualität: Für Ankerframe-Workflows entscheidend.
  5. Lokale oder cloudbasierte Nutzung: Datenschutz, Hardware und Teamgröße spielen hier hinein.
  6. Automatisierung: Eine API oder Batch-Verarbeitung zahlt sich ab dem ersten größeren Projekt aus.
  7. Rechte und Lizenz: Klären Sie vorab, wie kommerzielle Nutzung geregelt ist.

Für Standbilder eignen sich bildstarke Generatoren, für kontrollierte Workflows mit Referenz- und Pose-Steuerung lokale Pipelines, für die Animation kurze Bild-zu-Video-Modelle und für den letzten Schliff ein klassisches Schnittprogramm mit Farbkorrektur. Die Kombination ist wichtiger als ein einzelnes Werkzeug.

FAQ: häufige Fragen zur Charakterkonsistenz

Wie viele Referenzbilder brauche ich wirklich?
In der Regel sechs bis zehn. Weniger als vier liefern selten stabile Gesichter, mehr als fünfzehn bringen nur Mehrwert, wenn die Bilder wirklich widerspruchsfrei sind.

Reicht ein gutes Referenzbild?
Es kann funktionieren, solange die Figur immer frontal und mit ähnlichem Licht erscheint. Sobald Drehungen, Profile oder dramatisches Licht dazukommen, bricht die Identität.

Warum sieht meine Figur in jeder Einstellung anders aus, obwohl das Set identisch ist?
Meist liegt es an uneinheitlichen Prompts, wechselnden Seeds oder einem Modellwechsel innerhalb der Szene. Prüfen Sie zuerst die Textbeschreibung: Wird die Frisur in einem Prompt anders formuliert, driftet das Ergebnis.

Lohnt sich ein eigenes Modell für eine Figur?
Bei wiederkehrenden Formaten mit vielen Einstellungen ja. Der Aufwand lohnt sich ab etwa zehn Minuten fertigem Material pro Figur, weil die Trefferquote deutlich steigt.

Wie verhindere ich, dass Hintergründe die Figur beeinflussen?
Nutzen Sie neutrale Referenzbilder und beschreiben Sie die Umgebung ausschließlich im Einstellungsblock des Prompts. Starke Farbflächen im Referenzbild färben sonst auf Haut und Kleidung ab.

Was mache ich bei Szenen mit schneller Action?
Kürzen Sie die Clips, planen Sie mehr Schnitte und verdecken Sie kritische Momente mit Detailaufnahmen. Action ist der schwierigste Fall für Identitätstreue.

Wie dokumentiere ich mein Setup für das Team?
Führen Sie ein Kontinuitätsblatt mit Referenzset, Prompt-Bausteinen, Seeds, Tool-Versionen und Ablageort aller Dateien. Dieses Dokument ist Ihr wichtigstes Werkzeug, wenn ein Projekt nach Wochen fortgesetzt wird.

Fazit: Konsistenz ist ein Prozess, kein Zufall

Konsistente Charaktere in KI-Videos entstehen nicht durch einen geheimen Prompt, sondern durch einen geordneten Ablauf: saubere Referenzen, getrennte Identitäts- und Stilangaben, kurze Clips mit stabilen Ankerframes, kontrollierte Verlängerung und eine Postproduktion, die kleine Abweichungen auffängt. Multi-Image-Fusion ist dabei das technische Herzstück, aber sie wirkt nur so gut wie das Material, das Sie ihr geben.

Beginnen Sie klein. Legen Sie für eine Figur ein Set aus sechs Bildern an, definieren Sie Identitäts- und Stilanker, produzieren Sie drei Einstellungen und vergleichen Sie die Ergebnisse nebeneinander. Wenn die Figur über diese drei Einstellungen hinweg glaubwürdig dieselbe bleibt, haben Sie einen Workflow, der sich skalieren lässt – auf längere Videos, mehrere Figuren und wiederkehrende Formate.

Alexander

Alexander