Warum wiederkehrende Figuren das eigentliche Problem der KI-Videoproduktion sind
Ein einzelner Clip mit einer schönen Figur ist heute in wenigen Minuten produziert. Sobald daraus aber eine Serie, ein Werbespot mit mehreren Einstellungen oder eine erklärende Videoserie wird, kippt die Stimmung schnell. Die Figur aus Einstellung eins hat plötzlich eine andere Nase, die Haarfarbe wandert ins Rötliche, das Jackett hat einen anderen Schnitt, und die Augen wirken in der Nahaufnahme wie die einer fremden Person.
Das ist kein Zufall und auch kein Zeichen dafür, dass man etwas falsch gemacht hat. Generierende Videomodelle arbeiten probabilistisch. Jedes neue Rendering ist eine eigenständige Interpretation des Prompts. Ohne zusätzliche Steuerungsinformationen hat das Modell keinen Grund, eine Figur aus einem früheren Clip als verbindlich zu betrachten. Es kennt nur Text – und Text beschreibt eine Person bestenfalls unvollständig.
Genau an dieser Lücke setzt Multi-Image Fusion an. Statt eine Figur immer wieder neu zu beschreiben, wird sie einmal definiert und danach als stabile Referenz in jeden Shot mitgenommen. Der Unterschied ist vergleichbar mit dem Wechsel von einem Improvisationstheater zu einer Produktion mit Casting, Kostüm und Continuity-Plan.
Dieser Artikel zeigt, wie Multi-Image Fusion technisch funktioniert, wie man ein belastbares Referenzpaket baut, wie der Produktionsworkflow aussieht und welche Fehler in der Praxis am häufigsten auftreten.
Multi-Image Fusion verständlich erklärt
Was hinter dem Begriff steckt
Multi-Image Fusion bezeichnet eine Familie von Techniken, bei denen ein generatives System mehrere Eingabebilder gleichzeitig auswertet und daraus eine gemeinsame Repräsentation einer Figur ableitet. Diese Repräsentation wird als Embedding bezeichnet: ein mathematischer Vektor, der Merkmale wie Gesichtsproportionen, Augenform, Frisur, Kleidungsstil, Materialien und Farbpalette komprimiert speichert.
Das Modell arbeitet dabei auf zwei Ebenen. Die semantische Ebene beschreibt, wer oder was zu sehen ist: Altersspanne, Gesichtsform, Frisurtyp, Accessoires. Die stilistische Ebene beschreibt, wie es aussieht: Lichtstimmung, Grading, Filmkorn, Textur der Kleidung, Linsencharakter. Beide Ebenen werden getrennt verrechnet. Das ist der entscheidende Punkt, denn nur so lässt sich die Figur in neue Umgebungen und Lichtsituationen versetzen, ohne dass ihre Identität zerbricht.
Warum mehrere Bilder besser sind als eines
Ein einzelnes Referenzbild liefert nur einen Blickwinkel. Das Modell muss dann raten, wie die Person von der Seite aussieht, wie sich die Frisur bei Bewegung verhält oder wie das Gesicht bei hartem Seitenlicht wirkt. Diese Lücken füllt es mit dem Durchschnitt seiner Trainingsdaten – und genau dort entsteht die Identitätsdrift.
Mehrere Bilder schließen diese Lücken. Idealerweise erhält das System drei bis acht Aufnahmen derselben Figur aus unterschiedlichen Perspektiven und Lichtsituationen. Aus der Schnittmenge dieser Aufnahmen entsteht ein viel präziseres Embedding. Das Modell lernt gewissermaßen, welche Merkmale in allen Bildern konstant bleiben – und das sind genau die Merkmale, die später geschützt werden müssen.
Hier entsteht auch eine wichtige Trennung. Ein Teil der Bilder definiert die Identität, ein anderer Teil definiert den Stil, und ein dritter Teil dient nur als Kompositionshilfe. Wer diese Rollen vermischt, bekommt Figuren, die zwar schön sind, aber zwischen den Shots ihre Persönlichkeit verlieren.
Abgrenzung zu klassischem Training und Einzelreferenzen
Der klassische Weg zur Charakterkonsistenz führt über ein eigenes Trainingsmodell. Man kuratiert zwanzig bis fünfzig Bilder, trainiert einen kompakten Zusatzbaustein und verwendet diesen dann in der Generierung. Das funktioniert zuverlässig, kostet aber Zeit, Rechenleistung und technisches Verständnis.
Multi-Image Fusion liegt zwischen diesem aufwendigen Weg und der einfachen Einzelbildreferenz. Sie liefert einen großen Teil der Stabilität ohne Training, benötigt aber eine sorgfältigere Auswahl der Eingabebilder. Genau deshalb lohnt sich das Verständnis der Mechanismen, bevor man die erste Szene rendert.
Das Referenzpaket: der wichtigste Hebel für Stabilität
Mindestanforderungen an das Bildmaterial
Ein gutes Referenzpaket für eine Figur enthält mindestens:
- Eine frontale Aufnahme mit neutralem Ausdruck und gleichmäßigem Licht. Sie definiert die Gesichtsgeometrie.
- Zwei Drittelansichten aus leicht unterschiedlichen Winkeln, um Tiefe und Wangenknochen zu erfassen.
- Eine Profilaufnahme, die Nasenprofil, Kinnlinie und Ohrform festhält.
- Eine Ganzkörperaufnahme, damit Körperproportionen und Silhouette nicht frei interpretiert werden.
- Eine Aufnahme mit anderer Lichtrichtung, idealerweise Gegenlicht oder weiches Seitenlicht, damit das Modell zwischen Identität und Beleuchtung unterscheiden lernt.
Wer nur Selfies aus derselben Pose hat, sollte zumindest die Brennweite variieren. Perspektivische Unterschiede sind wichtiger als stylistische Unterschiede.
Was aus dem Paket herausfällt
Alles, was die Identität verfälscht oder mehrdeutig macht, gehört nicht in das Paket. Dazu zählen starke Weitwinkelverzerrungen, Beauty-Filter, die die Gesichtsform verändern, Sonnenbrillen, Schals vor dem Kinn, sehr harte Schatten über den Augenpartien und Aufnahmen, in denen die Figur nur teilweise im Bild ist.
Ein häufiger Anfängerfehler ist ein Referenzpaket, das nur aus besonders ästhetischen Bildern besteht. Ästhetik ist kein Konsistenzmerkmal. Ein unspektakuläres, technisch sauberes Porträt bei Tageslicht leistet mehr als ein dramatisches Studioporträt mit Nebel und Gegenlicht.
Die Rolle von Kleidung und Requisiten
Kleidung ist ein Sonderfall. Wird ein Outfit in alle Referenzbilder aufgenommen, verschmilzt es mit der Identität der Figur. Das Modell wird dann versuchen, dieselbe Jacke auch in Szenen zu rendern, in denen sie nicht hingehört – und sei es nur als Farbstich oder als falsche Textur.
Die Lösung ist eine Trennung in zwei Sätze: ein Identitätspaket mit neutraler oder sehr schlichter Kleidung und ein separates Ausstattungspaket, das pro Szene oder pro Kapitel ausgetauscht wird. Wer diese Trennung einmal etabliert hat, kann eine Figur in wenigen Minuten von der Küche in ein Büro oder in eine historische Kulisse versetzen, ohne sie neu zu definieren.
Der Produktionsworkflow in sechs Phasen
Phase 1: Figurendossier anlegen
Vor dem ersten Rendering steht ein kurzes Dokument. Es enthält Name oder Kennung der Figur, eine Beschreibung in drei bis fünf Sätzen, Alter, Herkunft, Körperbau, Haarfarbe, Augenfarbe, typische Kleidung und zwei bis drei charakterliche Eigenschaften. Dieses Dossier ist kein kreatives Beiwerk, sondern die Referenz für alle Prompt-Formulierungen. Wer es weglässt, formuliert in jedem Shot anders und produziert dadurch Drift.
Phase 2: Referenzpaket kuratieren und bereinigen
Die ausgewählten Bilder werden auf ein einheitliches Format gebracht. Sinnvoll sind quadratische oder leicht hochformatige Zuschnitte, eine Zielauflösung von mindestens 1024 Pixeln auf der kurzen Seite und ein einheitliches Farbprofil. Letzteres ist wichtig, weil stark abweichende Weißabgleiche das Modell dazu bringen, Farbstiche als Identitätsmerkmal zu behandeln.
Anschließend wird jedes Bild geprüft: Ist die Figur vollständig sichtbar, ist das Gesicht scharf, ist der Ausdruck neutral genug, gibt es Artefakte oder Doppelkonturen? Bilder mit sichtbaren KI-Fehlern gehören aussortiert, auch wenn sie inhaltlich passen.
Phase 3: Embedding erzeugen und testen
Aus dem Paket wird die Figur-Repräsentation erzeugt. Bevor die eigentliche Produktion startet, folgt ein Testdurchlauf mit einem bewusst schwierigen Motiv: eine Nahaufnahme bei ungewohntem Licht, eine Szene mit Bewegung und eine Aufnahme aus untypischem Winkel. Erst wenn diese drei Testbilder die Figur glaubwürdig zeigen, ist das Embedding produktionsreif.
Phase 4: Shot-Liste und Szenenplanung
Jetzt wird die Sequenz geplant. Eine Shot-Liste enthält pro Zeile: Szenennummer, Einstellungsgröße, Kamerawinkel, Bewegung, Umgebung, Lichtstimmung, Dauer und die beteiligten Figuren. Diese Liste ist der eigentliche Schutzschild gegen Inkonsistenz. Wenn dieselbe Figur in zwei aufeinanderfolgenden Einstellungen mit völlig unterschiedlicher Lichtrichtung erscheint, wirkt das auch bei perfektem Embedding falsch.
Szenen sollten außerdem nach Umgebung gruppiert gerendert werden. Alle Shots im Büro hintereinander, dann alle im Freien. Das reduziert die Zahl der Stilwechsel und damit die Fehlerquote.
Phase 5: Prompting mit fester Struktur
Jeder Prompt folgt demselben Muster, nur die variablen Teile ändern sich:
[Figurenkennung] + [Handlung] + [Einstellungsgröße und Blickwinkel] + [Umgebung] + [Lichtstimmung] + [Stil und Materialität] + [Technische Parameter]
Beispiel: Figur A, geht langsam durch einen Flur, halbnah, leichte Untersicht, modernes Büro mit Glaswänden, kühles Tageslicht von links, dokumentarischer Look, 35-mm-Objektiv, sanfte Schärfentiefe.
Wichtig ist, dass die Figurenbeschreibung nie neu ausgeschrieben, sondern immer über die Kennung referenziert wird. Wer in drei Prompts dreimal anders beschreibt, wie die Haare aussehen, bekommt drei verschiedene Frisuren.
Phase 6: Review und Iteration
Nach jedem Rendering folgt ein strukturierter Review entlang von fünf Prüfpunkten: Gesicht, Frisur, Körperproportionen, Kleidung, Lichtkontinuität. Fällt ein Shot durch, wird nicht das gesamte Paket neu gebaut, sondern nur der betroffene Parameter korrigiert. Nach drei bis fünf Iterationen kennt man die Eigenheiten der Figur und trifft die richtigen Einstellungen meist beim ersten Versuch.
Modell- und Toolauswahl: worauf es wirklich ankommt
Referenzfähigkeit vor Bildqualität
Das wichtigste Auswahlkriterium für Serienproduktionen ist nicht die maximale Auflösung, sondern die Frage, wie viele Referenzbilder ein Modell verarbeiten kann und wie stark es sie gewichtet. Modelle wie Runway Gen-4, Kling, Luma Dream Machine, Pika oder Veo unterscheiden sich hier erheblich. Manche arbeiten besser mit einer klaren Einzelreferenz, andere mit einem Set aus mehreren Bildern.
Praktisch bedeutet das: Testen Sie dasselbe Referenzpaket in zwei oder drei Modellen mit identischem Prompt und vergleichen Sie die Ergebnisse über mindestens fünf Einstellungen. Der Unterschied wird schnell sichtbar und ist oft größer als der Unterschied zwischen zwei Prompt-Varianten.
Hybrid-Workflows mit Bildmodellen
Oft ist es sinnvoller, die Figur zunächst in einem Bildmodell zu erzeugen oder zu stabilisieren und die fertigen Standbilder anschließend zu animieren. Werkzeuge wie Midjourney mit Charakterreferenz, Flux, Stable Diffusion mit IP-Adapter oder FaceID sowie ComfyUI-Ketten liefern hier sehr präzise Kontrolle. Der Vorteil: Bildmodelle sind bei Gesichtern und Details deutlich zuverlässiger. Der Nachteil: Es entsteht ein zusätzlicher Arbeitsschritt, und die Animation muss das Standbild möglichst treu übernehmen.
Für Markeninhalte ist dieser Hybrid-Weg häufig die beste Wahl, weil er nicht nur Konsistenz, sondern auch eine höhere Bildqualität liefert.
Rechenzeit und Iterationsbudget einplanen
Wer Konsistenz ernst nimmt, plant Iterationen ein. Drei bis fünf Durchläufe pro schwieriger Einstellung sind normal, bei Bewegungsszenen auch mehr. Diese Zeit sollte man nicht als Verschwendung betrachten, sondern als Teil der Produktion. Wer den Iterationsaufwand unterschätzt, produziert am Ende eine Sequenz mit sichtbaren Brüchen.
Prompting-Strategien für stabile Figuren
Konsistenz vor Kreativität
In der ersten Produktionsphase sollten Prompts so schlicht wie möglich bleiben. Ein neutraler Raum, gleichmäßiges Licht, keine extremen Brennweiten. Erst wenn die Figur über mehrere Einstellungen hinweg stabil ist, lohnt es sich, mit Stilisierungen zu experimentieren.
Wiederkehrende Wortbausteine
Verwenden Sie für jede Figur einen festen Wortblock, der in jedem Prompt unverändert wiederkehrt. Er sollte maximal zwölf bis fünfzehn Wörter umfassen und nur dauerhafte Merkmale enthalten: Gesichtsform, Augenfarbe, Frisurtyp, Körperbau, Grundkleidung. Alles, was sich pro Szene ändert, gehört außerhalb dieses Blocks.
Negativbeschreibungen dosieren
Negative Prompts sind hilfreich, aber schnell kontraproduktiv. Wenn Sie Begriffe wie anderes Gesicht oder unbekannte Person in jeden Prompt schreiben, erhöhen Sie den Kontrast zwischen Referenz und Generierung und riskieren härtere, künstlichere Ergebnisse. Beschränken Sie Negativtipps auf technische Probleme: keine Doppelgesichter, keine zusätzlichen Finger, keine Verwischung im Gesicht.
Bewegung sparsam einsetzen
Jede starke Bewegung ist eine Belastungsprobe für das Embedding. Schnelle Kamerafahrten, Sprünge und Drehungen führen häufiger zu Identitätsverlust als ruhige Einstellungen. Für kritische Szenen gilt: erst langsam und stabil rendern, dann in der Postproduktion Bewegung hinzufügen, etwa durch digitale Zoomfahrten oder sanfte Kameraführung.
Typische Fehler und wie man sie behebt
Identitätsdrift über mehrere Einstellungen
Symptom: Die Figur sieht in jedem Shot ähnlich, aber nie gleich aus. Ursache ist meist ein zu kleines oder zu homogenes Referenzpaket. Behebung: Winkelvarianz erhöhen, mindestens ein Profilbild ergänzen, identische Lichtsituationen vermeiden.
Kleidung wechselt unbemerkt die Farbe
Symptom: Der Pullover ist mal grau, mal blau. Ursache ist ein Farbstich im Referenzbild oder eine unklare Formulierung im Prompt. Behebung: Weißabgleich aller Referenzen angleichen und die Kleidungsfarbe einmal präzise definieren, danach nur noch die Kennung verwenden.
Gesicht kippt in der Nahaufnahme
Symptom: Totale stimmt, Großaufnahme nicht. Ursache: Das Modell hat für Details zu wenig Referenzinformation und füllt mit Trainingsdaten. Behebung: Die kritische Nahaufnahme zuerst rendern und daraus ein Standbild als zusätzliche Referenz gewinnen.
Licht kontinuiert nicht
Symptom: Zwei Figuren im selben Raum wirken wie aus zwei Filmen. Ursache: unterschiedliche Lichtbeschreibungen pro Prompt. Behebung: Lichtrichtung und Farbtemperatur als festen Block in die Shot-Liste aufnehmen und wortgleich übernehmen.
Hände und Accessoires zerfallen
Symptom: Finger verschmelzen, Ringe verlieren ihre Form. Ursache: hohe Bewegungsdichte bei kleinen Objekten. Behebung: Hände aus dem Zentrum des Bildes nehmen, Bewegungen reduzieren oder die Szene in der Postproduktion neu schneiden, sodass die problematischen Frames entfallen.
Einsatzszenarien jenseits einzelner Clips
Figurenkonsistenz ist dann besonders wertvoll, wenn Inhalte wiederkehren. Drei Konstellationen zeigen das deutlich.
Episodische Formate: Eine wiederkehrende Hauptfigur in kurzen Erklärvideos oder Social-Sequenzen. Hier entscheidet Konsistenz darüber, ob Zuschauer die Serie wiedererkennen oder jeden Clip als Einzelstück wahrnehmen.
Markenkommunikation: Wenn dieselbe Testimonial-Figur oder dasselbe Maskottchen über mehrere Kampagnen hinweg auftritt, entsteht Wiedererkennung. Wer für jede Kampagne eine neue Figur generiert, verliert genau diesen Effekt.
Lerninhalte und Schulungen: In Erklärvideos mit wiederkehrenden Moderationsfiguren senkt visuelle Kontinuität die kognitive Belastung. Zuschauer folgen dem Inhalt leichter, wenn sie nicht bei jedem Szenenwechsel eine neue Person einordnen müssen.
In allen drei Fällen gilt dieselbe Regel: Die Figur ist ein Asset, kein Prompt-Detail. Sie wird einmal definiert, dokumentiert und dann wiederverwendet.
Qualitätssicherung, Postproduktion und Skalierung
Kontinuitätsprüfung als Standardprozess
Legen Sie alle Shots einer Sequenz nebeneinander und prüfen Sie sie in dieser Reihenfolge: Gesichtsform, Frisur, Körperproportionen, Kleidung, Lichtrichtung, Farbtemperatur, Schärfentiefe. Auffälligkeiten werden markiert und nicht sofort korrigiert, sondern gesammelt. Erst wenn alle Shots gerendert sind, entscheidet man, welche drei oder vier wirklich nachgearbeitet werden müssen.
Postproduktion als Korrekturwerkzeug
Nicht jeder Fehler braucht ein neues Rendering. Farbkorrektur gleicht Lichtunterschiede aus, ein leichter Crop beseitigt störende Details, und kurze Schnitte lassen schwierige Frames entfallen. Auch das Grading über alle Shots hinweg hilft: Ein einheitlicher Look überdeckt kleine Abweichungen deutlich.
Skalierung mit einem Charakter-Wiki
Sobald mehr als drei Figuren im Spiel sind, braucht es eine zentrale Ablage. Pro Figur: Dossier, Referenzpaket, Testrenderings, bewährte Prompt-Blöcke, bekannte Schwächen und bevorzugte Modelleinstellungen. Diese Datei ist der eigentliche Produktionsvorteil. Sie macht Figuren reproduzierbar und unabhängig von der Person, die gerade rendert.
Wer zusätzlich Versionen der Referenzpakete speichert, kann später nachvollziehen, warum sich eine Figur verändert hat – und gezielt zur letzten stabilen Version zurückkehren.
Häufige Fragen zur Multi-Image Fusion
Wie viele Referenzbilder sind optimal? Für die meisten Figuren sind vier bis sechs Bilder ein guter Bereich. Unter drei wird es instabil, über zehn bringt es selten zusätzlichen Nutzen und kann das Modell verwirren, wenn die Bilder stilistisch auseinanderlaufen.
Brauche ich zwingend ein eigenes Training? Nein. Für die meisten Serienproduktionen reicht eine gute Multi-Image-Fusion. Ein zusätzliches Training lohnt sich, wenn eine Figur über sehr viele Projekte hinweg in hoher Detailtreue gebraucht wird.
Funktioniert das auch mit stilisierten Figuren? Ja, sogar besonders gut, weil stilisierte Figuren meist klarere Merkmale haben. Wichtig ist, dass der Stil in allen Referenzbildern konsistent ist – ein Mix aus fotorealistisch und gezeichnet zerbricht das Embedding.
Was mache ich bei Tieren oder Objekten? Das Prinzip bleibt gleich. Auch hier gilt: mehrere Winkel, gleichmäßiges Licht, ein getrenntes Paket für Accessoires. Bei Objekten ist zusätzlich eine Aufnahme mit Maßstab hilfreich, damit die Proportionen stimmen.
Wie gehe ich mit wechselnden Altersstufen vor? Legen Sie für jede Altersstufe ein eigenes Referenzpaket an. Ein Embedding über zwanzig Jahre hinweg zu spannen führt fast immer zu einem uneindeutigen Mittelwert, der in keiner Szene überzeugt.
Warum sehen meine Figuren trotzdem unterschiedlich aus? Prüfen Sie zuerst die Referenzbilder auf widersprüchliche Merkmale, dann die Prompt-Struktur auf Abweichungen und erst zuletzt die Modelleinstellungen. In den meisten Fällen liegt die Ursache im Eingangsmaterial, nicht im Modell.
Fazit: Konsistenz ist eine Frage der Vorbereitung
Multi-Image Fusion ist kein einzelner Schalter, sondern eine Methode. Sie besteht aus einem sauber kuratierten Referenzpaket, einer getrennten Behandlung von Identität und Ausstattung, einer festen Prompt-Struktur, einer Shot-Liste mit kontrollierter Lichtkontinuität und einem Review-Prozess, der Fehler systematisch statt spontan behebt.
Wer diese fünf Elemente etabliert, produziert KI-Videos, die nicht mehr wie eine Sammlung einzelner Experimente wirken, sondern wie eine zusammenhängende Produktion. Der Aufwand liegt fast vollständig in der Vorbereitung – und zahlt sich in jedem weiteren Shot aus.

