Warum Figuren in KI-Videos auseinanderfallen
Wer eine Szene mit einer erfundenen Figur generiert, kennt das Ergebnis: Der erste Shot sitzt, der zweite wirkt wie ein Cousin derselben Person, und ab dem dritten Clip trägt die Hauptfigur plötzlich eine andere Jacke, eine andere Nase und einen anderen Hautton. Dieses Driften ist kein Bedienfehler, sondern eine strukturelle Eigenschaft generativer Modelle. Jede Anfrage erzeugt ein neues Sampling im latenten Raum, und das Modell besitzt kein persistentes Gedächtnis für das, was in der vorherigen Einstellung zu sehen war.
In der Praxis zeigt sich das Problem in vier wiederkehrenden Mustern:
- Gesichtsdrift: Proportionen, Augenabstand, Kinnlinie und Alterseindruck verändern sich zwischen den Shots.
- Kostüm- und Requisitendrift: Nahtverläufe, Materialglanz, Logo-Platzierungen und Accessoires wandern.
- Umgebungsdrift: Wandfarben, Lichtstimmung, Requisiten und Architekturdetails kippen, sobald sich die Kamera bewegt.
- Stildrift: Zwischen fotorealistisch, illustrativ und weichgezeichnet entstehen Brüche, die im Schnitt sofort auffallen.
Die Ursachen sind gut verstanden. Text beschreibt nur einen Bruchteil der visuellen Information, die eine Figur ausmacht. Ein Prompt wie eine Frau Ende dreißig mit dunklen Locken und grüner Jacke lässt tausende gültige Interpretationen zu. Bewegung im Bild erhöht die Varianz zusätzlich, weil das Modell Konsistenz über die Zeit nicht von selbst priorisiert. Und jeder neue Shot startet ohne Referenz von vorn.
Genau an dieser Stelle setzt Multi-Image Fusion an. Mehrere Referenzbilder werden nicht nacheinander, sondern gemeinsam ausgewertet und zu einer stabilen Identitätsrepräsentation verdichtet. Diese Repräsentation steuert dann die Generierung von Einzelbildern, Keyframes und ganzen Sequenzen.
Was Multi-Image Fusion leistet und wo ihre Grenzen liegen
Multi-Image Fusion ist im Kern ein Konditionierungsverfahren. Statt nur Text an ein Modell zu übergeben, liefern Sie zusätzlich mehrere Bilder derselben Figur oder derselben Umgebung. Die Bilder werden zu Merkmalsvektoren zusammengeführt, die Gesicht, Statur, Kleidung, Materialien und Lichtcharakter beschreiben. Diese Vektoren wirken wie ein wiedererkennbares Profil, das jede neue Generierung mitbestimmt.
Das Ergebnis: Die Figur bleibt über Shots hinweg erkennbar, selbst wenn Perspektive, Brennweite, Tageszeit und Handlung wechseln. Wichtig ist die Erwartungshaltung. Fusion ist kein Ersatz für Planung, sondern ein Werkzeug, das Planung belohnt.
Identitäts-Embeddings statt Prompt-Wiederholung
Ein Identitäts-Embedding entsteht aus der Kombination mehrerer Referenzansichten. Je heterogener die Ansichten sind, desto robuster wird das Profil. Zwei Frontalaufnahmen liefern kaum mehr Information als eine. Erst ein Profilbild, eine Dreiviertelansicht und eine Aufnahme bei anderem Licht zeigen dem Modell, welche Merkmale konstant bleiben und welche sich mit dem Blickwinkel verändern dürfen. Genau diese Trennung zwischen Identität und Perspektive ist der Unterschied zwischen einem starren Kopierverfahren und einer tragfähigen Figur.
Keyframes als Anker im Zeitstrahl
Keyframes sind die zweite Säule. Sie markieren Zeitpunkte, an denen die Figur exakt so aussehen muss wie definiert. Zwischen zwei Ankern interpoliert das Modell. Je weiter die Anker auseinanderliegen, desto größer die Freiheit des Modells und desto höher das Risiko, dass Details erfinden. Als Faustregel gilt: Bei ruhigen Dialogszenen reichen Anker alle zwei bis vier Sekunden, bei schnellen Bewegungen oder Schnitten alle ein bis zwei Sekunden.
Kamerabewegung und Übergänge kontrollieren
Kameraanweisungen sind ein unterschätzter Konsistenzfaktor. Eine langsame Fahrt nach vorn verändert das Gesicht weniger als eine halbe Drehung um die Figur. Wenn eine Einstellung eine starke Perspektivänderung braucht, planen Sie sie als eigenen Shot mit eigenem Keyframe und eigener Referenzgewichtung. Übergänge zwischen zwei Einstellungen profitieren davon, wenn der letzte Frame des ersten Shots als Anker für den ersten Frame des zweiten Shots dient.
Grenzen des Verfahrens
Fusion löst nicht alles. Feine Strukturen wie Finger, Schmuckketten, Brillenbügel, Zahnreihen und Text auf Kleidung bleiben schwierig, weil sie in den Referenzbildern selten in ausreichender Auflösung vorliegen. Extreme Perspektiven, Spiegelungen und starke Bewegungsunschärfe reduzieren die Trefferquote ebenfalls. Rechnen Sie damit, dass Sie bei zehn Prozent der Shots nacharbeiten müssen, entweder durch Retusche, Compositing oder einen zusätzlichen Generierungslauf.
Referenzmaterial vorbereiten: das Charakterblatt
Die Qualität der Fusion hängt fast linear von der Qualität der Referenzen ab. Erstellen Sie vor dem ersten Generierungslauf ein Charakterblatt. Das ist ein kuratiertes Set aus acht bis zwölf Bildern mit klarer Aufgabenverteilung.
| Bildtyp | Anzahl | Zweck |
|---|---|---|
| Frontalansicht, neutral | 2 | Grundgesicht, Symmetrie |
| Dreiviertelansicht links und rechts | 2 | Wangenknochen, Kieferlinie |
| Profil | 1 | Nase, Kinn, Haarlinie |
| Ganzkörper | 2 | Statur, Proportionen, Kleidungssilhouette |
| Detailaufnahmen | 2 | Hände, Schuhe, Accessoires, Stoffstruktur |
| Alternative Lichtsituation | 1–2 | Robustheit gegenüber Lichtwechsel |
Achten Sie auf technische Sauberkeit: mindestens 1024 Pixel Kantenlänge, scharfer Fokus, kein Wasserzeichen, kein Rauschen, keine Collagen und keine starken Filter. Vermeiden Sie Referenzen, die sich widersprechen – etwa ein Bild mit offenen Haaren und eines mit Zopf, wenn die Figur im fertigen Video immer offene Haare tragen soll. Jede Inkonsistenz im Referenzset wird vom Modell als erlaubte Variation interpretiert.
Ein häufiger Fehler ist die Verwendung von Standbildern aus einem anderen Stil. Wer fotorealistische Referenzen mit einem illustrativen Ziel kombiniert, bekommt Mischformen, die weder das eine noch das andere sind. Entscheiden Sie Stil, Lichtrichtung und Farbpalette, bevor Sie Referenzen sammeln.
Der Workflow in sieben Schritten
Ein reproduzierbarer Ablauf schlägt jedes Einzelexperiment. Bewährt hat sich folgende Reihenfolge.
- Lookdev: Klären Sie Stil, Lichtstimmung, Farbpalette und Bildformat. Testen Sie mit drei bis fünf Standbildern, ob die Zielästhetik erreichbar ist, bevor Sie Videozeit investieren.
- Referenzset kuratieren: Stellen Sie das Charakterblatt zusammen und prüfen Sie es auf Widersprüche.
- Identitätsprofil bauen und testen: Generieren Sie Testporträts in verschiedenen Winkeln und Lichtsituationen. Wenn das Profil bei diesen Tests wackelt, wird es im Video nicht stabiler.
- Keyframe-Plan erstellen: Zeichnen Sie ein Storyboard mit markierten Ankerframes. Notieren Sie pro Shot Startbild, Endbild und Kamerabewegung.
- In Shots segmentieren: Teilen Sie die Sequenz in Einheiten von zwei bis sechs Sekunden. Kurze Shots sind konsistenter und im Schnitt flexibler.
- Generieren und prüfen: Bewerten Sie jeden Shot anhand einer festen Checkliste, statt spontan zu urteilen.
- Gezielt nachjustieren: Ändern Sie immer nur eine Variable pro Iteration – Referenzgewichtung, Prompt, Seed oder Keyframe. Mehrere gleichzeitige Änderungen machen Ursachenanalyse unmöglich.
Ein Praxisbeispiel: Für einen zwölfsekündigen Dialog mit vier Einstellungen brauchen Sie realistisch vier Keyframes, eine Referenzgruppe, sechs bis zehn Generierungsläufe und eine halbe Stunde Nachbearbeitung. Wer ohne Charakterblatt startet, verdoppelt diese Zeit, weil die Figur in jedem Lauf neu erfunden wird.
Prompting für Konsistenz
Prompts bleiben wichtig, auch wenn Referenzbilder die Hauptarbeit leisten. Sie steuern Aktion, Kontext und Kamera. Eine klare Reihenfolge hilft dem Modell, Prioritäten zu erkennen:
- Subjekt und Identität: Figur, Alter, Statur, Kleidung, Frisur.
- Aktion: was passiert, in welcher Intensität.
- Kamera: Größe, Winkel, Bewegung, Brennweite.
- Licht und Atmosphäre: Tageszeit, Lichtrichtung, Wetter, Farbtemperatur.
- Stil: fotorealistisch, Filmkorn, Format, Objektivcharakter.
- Negativliste: was nicht vorkommen darf, etwa Wasserzeichen, weiche Gesichter, zusätzliche Personen.
Formulierungen, die sich bewährt haben: die identische Figur wie in den Referenzbildern, gleiche Gesichtsmerkmale, gleiche Kleidung, gleiche Frisur, durchgehend gleiche Lichtstimmung. Vermeiden Sie widersprüchliche Signale wie eine dramatische Oberlichtsituation kombiniert mit weichem Schönlicht.
Zur Steuerung gehören außerdem technische Hebel: die Gewichtung der Bildreferenz, die Stärke des Keyframe-Einflusses, der Seed für Reproduzierbarkeit und die Anzahl der Schritte. Ein höherer Keyframe-Einfluss erhöht die Treue, reduziert aber die Bewegungsfreiheit. Bei Dialogszenen ist hohe Treue meist wichtiger, bei Actionszenen die Bewegungsfreiheit.
Negative Prompts sind kein Allheilmittel, aber hilfreich gegen typische Artefakte: zusätzliche Finger, deformierte Hände, doppelte Personen, Text im Bild, unscharfe Augen, plastikartige Haut, wechselnde Haarlänge. Halten Sie diese Liste kurz und stabil. Lange Negativlisten mit widersprüchlichen Begriffen verwirren mehr, als sie verhindern.
Werkzeugauswahl nach Kriterien
Die Modelllandschaft ändert sich schnell, die Auswahlkriterien bleiben stabil. Bewerten Sie jedes Werkzeug anhand dieser Punkte, statt Marketingversprechen zu vergleichen:
- Identitätstreue: Wie stabil bleibt das Gesicht über zehn unterschiedliche Shots?
- Keyframe-Kontrolle: Können Start- und Endbild verbindlich vorgegeben werden?
- Bewegungsqualität: Wie gut lösen sich Hände, Stoffe und Haare auf?
- Konsistenz über Szenen: Bleiben Requisiten und Umgebung stabil, wenn die Kamera schwenkt?
- Ein- und Ausgabeformate: Auflösung, Seitenverhältnis, Bildrate, Länge pro Durchlauf.
- Schnittstellen: Batch-Verarbeitung, Skripting, API-Anbindung für wiederkehrende Aufgaben.
- Nachbearbeitbarkeit: Lässt sich das Ergebnis in Compositing- und Schnittprogramme integrieren?
- Teamfähigkeit: Versionierung, Kommentare, reproduzierbare Einstellungen.
Für den Arbeitsalltag hat sich eine Aufteilung bewährt: ein Bildwerkzeug für Lookdev und Keyframes, ein Videowerkzeug für die Sequenz, ein Upscaler für die Endauflösung und ein Schnittprogramm für Rhythmus und Farbanpassung. Diese Kombination ist robuster als der Versuch, alle Aufgaben in einem einzigen Werkzeug zu lösen. Für Gesichtstreue bei schwierigen Perspektiven hilft zusätzlich ein Tracking- oder Compositing-Schritt, bei dem das Gesicht aus einem sauberen Referenzframe auf die Zielaufnahme übertragen und weich eingemischt wird.
Anwendungsfälle in der Praxis
Marken- und Kampagneninhalte
Für Werbung zählt Wiedererkennbarkeit. Ein Testimonial-Charakter, der über dreißig Social-Clips hinweg gleich aussieht, senkt Produktionskosten und stärkt die Erinnerung. Mit einem Charakterblatt und einem festen Prompt-Gerüst erzeugen Sie Varianten für Format, Saison und Sprache, ohne das Gesicht neu zu erfinden.
Narrative Produktionen
Kurzfilme und Serienpiloten profitieren doppelt: Konsistenz erlaubt Rückblenden und Parallelhandlungen, ohne dass Zuschauer die Orientierung verlieren. Planen Sie Keyframes entlang der emotionalen Wendepunkte, nicht entlang technischer Bequemlichkeit. Szenenwechsel sind die riskantesten Momente und verdienen einen eigenen Ankerframe.
Schulung und Simulation
In Lernvideos ist Konsistenz ein Verständnisfaktor. Wenn dieselbe Figur eine Prozedur in mehreren Schritten erklärt, sinkt die kognitive Last. Hier lohnt sich eine reduzierte Bildsprache: stabiler Hintergrund, wenig Kamerabewegung, gleichmäßiges Licht. Das erleichtert dem Modell die Arbeit erheblich.
Lokalisierung und Varianten
Sobald eine Figur stabil ist, lassen sich Varianten günstig erzeugen: andere Hintergründe, andere Kleidungsfarben, andere Tageszeiten. Wichtig ist, Varianten immer vom selben Referenzset abzuleiten und nicht von einer bereits generierten Variante. Sonst kumulieren sich Abweichungen.
Typische Fehler und Troubleshooting
- Symptom: Gesicht kippt ab Shot drei. Ursache ist meist ein zu kleines Referenzset. Ergänzen Sie eine Profilansicht und eine Aufnahme bei anderem Licht.
- Symptom: Kleidung ändert die Farbe. Prüfen Sie, ob die Referenzbilder selbst unterschiedliche Farben zeigen. Wenn ja, vereinheitlichen Sie die Referenzen, statt den Prompt zu verschärfen.
- Symptom: Hintergrund wird weich und verschwommen. Das Modell investiert Kapazität in die Figur. Reduzieren Sie Kamerabewegung oder erhöhen Sie die Keyframe-Dichte.
- Symptom: Hände verschmelzen. Hände sind der häufigste Fehlerherd. Planen Sie Einstellungen so, dass Hände entweder ruhig liegen oder außerhalb des Bildes bleiben.
- Symptom: Figur wirkt älter oder jünger. Der Alterseindruck hängt stark an Licht und Textur. Fügen Sie eine Referenz mit neutralem Licht hinzu und halten Sie die Lichtbeschreibung über alle Shots identisch.
- Symptom: Zwei Personen obwohl nur eine gemeint war. Fügen Sie eine klare Negativanweisung hinzu und stellen Sie sicher, dass die Referenzbilder keine weiteren Personen enthalten.
- Symptom: Stilbruch im Schnitt. Legen Sie eine Farbkorrektur über die gesamte Sequenz. Schon eine gemeinsame Grading-Kurve kaschiert kleine Farbabweichungen.
- Symptom: Ergebnis ist nicht reproduzierbar. Notieren Sie Seed, Gewichtungen und Prompt-Version. Ohne Protokoll lässt sich ein guter Lauf nicht wiederholen.
Qualitätssicherung im Team und Checkliste
Konsistenz ist ein Prozess, kein Einzelergebnis. Wer mit mehreren Personen arbeitet, braucht feste Regeln:
- Eine Quelle der Wahrheit: genau ein Charakterblatt pro Figur, versioniert und für alle sichtbar.
- Namenskonventionen: Figur, Szene, Shot und Version im Dateinamen, damit Zuordnungen nie geraten werden müssen.
- Test in klein: Erst bei niedriger Auflösung und kurzer Länge prüfen, dann in Finalqualität rendern.
- Bewertung mit Checkliste: Identität, Kleidung, Licht, Hintergrund, Bewegung, Hände, Ton. Jeder Punkt mit Ja oder Nein.
- Freigabeschleifen begrenzen: maximal zwei Korrekturrunden pro Shot, danach neu aufsetzen statt weiterdrehen.
- Archiv pflegen: Erfolgreiche Prompt- und Referenzkombinationen dokumentieren. Das ist das eigentliche Produktionskapital.
Eine einfache Regel spart am meisten Zeit: Ändern Sie pro Iteration nur eine Variable. Wer gleichzeitig Prompt, Referenz und Keyframe anpasst, lernt nichts über die Ursache und verschwendet Rechenzeit.
FAQ
Wie viele Referenzbilder brauche ich wirklich?
Sechs bis acht gut gewählte Bilder sind ein solider Start. Unter vier Bildern wird die Figur instabil, über fünfzehn bringen selten zusätzlichen Nutzen, wenn sie sich stark ähneln.
Reicht ein einziges Referenzbild?
Für kurze Clips mit wenig Bewegung manchmal ja. Sobald sich Perspektive oder Licht ändern, sinkt die Trefferquote deutlich. Für alles, was länger als fünf Sekunden ist oder mehrere Shots umfasst, lohnt sich ein vollständiges Charakterblatt.
Warum funktioniert derselbe Prompt beim zweiten Lauf anders?
Generierung ist stochastisch. Ohne festen Seed und ohne identische Einstellungen entsteht ein anderes Ergebnis. Fixieren Sie Seed, Gewichtungen und Auflösung, wenn Sie vergleichen wollen.
Was ist wichtiger: Referenz oder Prompt?
Die Referenz bestimmt das Aussehen, der Prompt die Handlung und die Kamera. Beides muss zusammenpassen. Ein präziser Prompt mit schlechten Referenzen liefert eine schöne, aber fremde Figur.
Wie gehe ich mit Szenenwechseln um?
Setzen Sie einen Keyframe am Anfang jeder neuen Szene und übernehmen Sie die Identitätsreferenz unverändert. Ändern Sie nur Licht- und Umgebungsbeschreibung, nicht die Figurenbeschreibung.
Lohnt sich Nachbearbeitung oder ein neuer Lauf?
Wenn nur ein Detail fehlt, ist Nachbearbeitung schneller. Wenn Proportionen oder Identität kippen, hilft Retusche kaum. Dann ist ein neuer Lauf mit angepasster Referenz oder höherem Keyframe-Einfluss die bessere Entscheidung.
Wie teste ich effizient?
Erstellen Sie pro Figur einen Kurztest aus drei Einstellungen: frontal, Dreiviertelansicht in Bewegung, Szenenwechsel mit neuem Hintergrund. Wenn dieser Test hält, hält auch die Produktion.
Fazit
Multi-Image Fusion verwandelt Charakterkonsistenz von Glückssache in Handwerk. Der entscheidende Aufwand liegt vor der ersten Generierung: ein sauberes Referenzset, ein klarer Keyframe-Plan und ein stabiles Prompt-Gerüst. Wer diese drei Grundlagen ernst nimmt, produziert Sequenzen, in denen die Figur über alle Shots hinweg dieselbe bleibt – und spart am Ende mehr Zeit, als die Vorbereitung gekostet hat.



