Start Free Now
Limited Time Offer: Get 50% OFF Starter & Basic Yearly Plans 🎉

Konsistente KI-Videos: Figurenkonsistenz als Workflow

Sep 27, 2026

Warum Sequenzen an fehlender Figurenkonsistenz zerbrechen

Der erste Shot sitzt. Die Figur hat eine klare Silhouette, ein erkennbares Gesicht, glaubwürdiges Licht. Zwölf Shots später wirkt dieselbe Person wie eine entfernte Verwandte: Die Augenpartie ist breiter, die Frisur hat ihre Kante verloren, der Mantel sitzt plötzlich mit anderem Kragen. Niemand hat bewusst etwas falsch gemacht, und trotzdem lässt sich die Sequenz nicht mehr schneiden.

Das ist kein Werkzeugfehler, sondern eine Eigenschaft generativer Systeme. Modelle haben kein Gedächtnis. Jede Generierung ist eine eigene Wahrscheinlichkeitsrechnung aus Textbeschreibung, Zufallswert und optionalen Referenzbildern. Ohne Verankerung konkurrieren hunderte plausible Gesichter um dieselbe Beschreibung, und das Modell entscheidet bei jedem Durchlauf minimal anders. Ein Einzelbild verzeiht diese Abweichung. Eine Sequenz nicht, weil das Publikum dort direkt vergleicht.

Typische Folgen sind Retakes ohne Ende, manuelle Notkorrekturen und Kompromisse im Schnitt. Dieser Leitfaden beschreibt deshalb keinen Trick, sondern eine Produktionsdisziplin: Identität definieren, Referenzen kuratieren, Shots planen, Generierungen in zwei Durchgängen prüfen und alles gegen einen festen Maßstab kontrollieren.

Konsistenz in fünf Ebenen messen

Konsistenz ist kein einzelnes Merkmal, sondern ein Bündel von Eigenschaften mit unterschiedlicher Toleranz. Wer die Ebenen trennt, kann gezielt gegensteuern statt global nachzubessern.

Ebene Muss stabil bleiben Typische Drift Prüfmethode
Identität Gesichtsform, Augenabstand, Nase, Kinnlinie Gesicht wirkt runder, jünger oder fremder Standbild in Originalgröße neben das Golden Set legen
Haar und Accessoires Frisur, Haarlänge, Brille, Schmuck Kanten weichen auf, Details verschwinden Silhouetten vergleichen
Garderobe Schnitt, Farbe, Material, Logo Farbton kippt, Muster verschiebt sich Farbwerte mehrerer Shots gegenüberstellen
Stil Look, Palette, Kontrast, Korn Bild wirkt flacher oder übersättigt zwei Shots direkt hintereinander abspielen
Kontinuität Requisiten, Tageszeit, Wetter, Position Objekte tauchen auf oder verschwinden Shot-Liste abhaken

Identität ist die empfindlichste Ebene, weil das menschliche Sehsystem auf Gesichter spezialisiert ist. Wenige Pixel Unterschied in der Augenpartie genügen, damit Zuschauer eine andere Person wahrnehmen. Stil-Drift fällt dagegen oft erst im Schnitt auf, wenn zwei Einstellungen aneinandergrenzen und der Kontrast sichtbar springt.

Daraus ergibt sich eine Reihenfolge: erst Identität verankern, dann Stil, dann Kontinuität. Wer umgekehrt arbeitet, produziert hübsche Einzelbilder, die sich nicht montieren lassen. Toleranzen sind außerdem shotabhängig: Close-ups verlangen maximale Nähe zum Referenzset, Totale und Umgebungsaufnahmen verzeihen mehr Abweichung, weil dort weniger Pixel auf das Gesicht entfallen.

Die Charakter-DNA: Referenzset, Textanker, Steuersignale

Als Charakter-DNA lässt sich die Gesamtheit der Anker bezeichnen, aus denen ein Modell dieselbe Figur rekonstruieren kann. Drei Arten wirken zusammen und müssen alle gepflegt werden: visuelle Referenzen, sprachliche Beschreibung und technische Steuersignale.

Das Referenzset kuratieren

Ein gutes Set umfasst acht bis zwanzig Bilder und deckt bewusst Extrempositionen ab, nicht zwanzig Varianten derselben Pose. Bewährt hat sich dieses Raster:

  • frontal, Dreiviertel links, Dreiviertel rechts, Profil
  • leichte Aufsicht und leichte Untersicht
  • weiches Licht, hartes Licht, Gegenlicht, gedämpftes Licht
  • neutraler Ausdruck, Lächeln, ernst, überrascht
  • Ganzkörper für Proportionen, halbnah für Details

Technisch zählen Schärfe, Auflösung und ein ruhiger Hintergrund. Verwachsene oder stark komprimierte Referenzen schaden, weil das Modell Unschärfe als Merkmal interpretiert und später weiche Gesichter erzeugt. Kontaktbögen mit sechs bis neun Referenzen pro Figur sind ein praktikabler Kompromiss: genug Abdeckung, ohne dass Einzelbilder an Gewicht verlieren.

Der Textanker als Koordinatensystem

Die sprachliche Beschreibung wirkt stärker, als viele erwarten, und ist gleichzeitig die häufigste Fehlerquelle. Drei Regeln helfen:

  1. Formulierungen einmal festlegen und danach wörtlich wiederverwenden.
  2. Merkmale in stabiler Reihenfolge nennen: Alter und Gesichtsform, dann Augen und Brauen, dann Haare, dann Garderobe, dann Besonderheiten.
  3. Vage Adjektive ersetzen. Schön, markant oder sympathisch tragen nichts; kantige Kinnlinie, tief liegende Augen, dichte dunkle Brauen, kurze Nackenhaare wirken wie Koordinaten.

Ein zweiter typischer Fehler ist Synonymwechsel. Trägt die Figur im einen Prompt einen Mantel und im nächsten eine Jacke, erhält das Modell zwei verschiedene Signale. Dasselbe gilt für Farbnamen: Anthrazit, Dunkelgrau und Schiefergrau können je nach Modell unterschiedliche Farbwelten öffnen. Ergänzen Sie außerdem eine Liste verbotener Merkmale, etwa kein Bart, keine Brille, keine Kapuze. Solche negative Anker verhindern, dass das Modell Eigenschaften aus Referenzen oder Trainingsdaten einstreut, die nicht zur Figur gehören.

Steuersignale: Pose, Tiefe, Kanten

Steuersignale übertragen Komposition, Haltung und Bildaufbau, ohne die Identität zu überschreiben. Ein Posen-Skelett gibt Gelenkpositionen vor und eignet sich für wiederkehrende Bewegungen wie Gehen oder Sitzen. Eine Tiefenkarte steuert Vordergrund und Hintergrund, also Räumlichkeit und Größenverhältnisse. Ein Kantenbild überträgt Linienverläufe und ist nützlich, wenn ein bestimmtes Produkt oder Gebäude exakt wiederkehren soll.

Kritisch ist die Gewichtung. Zu schwach, und das Signal verschwindet in der Varianz. Zu stark, und die generierte Figur übernimmt Pose, Licht und Bildwinkel der Kontrollvorlage in jede Einstellung. Eine praktische Regel: Steuersignale so dosieren, dass die Zielpose erkennbar wird, Details wie Stofffalten und Lichtcharakter aber frei bleiben. Prüfen Sie jede Einstellung darauf, ob sie nach neuer Situation oder nach kopierter Vorlage aussieht.

Der Produktionsworkflow in acht Etappen

Der Ablauf funktioniert für einzelne Kurzclips genauso wie für episodische Formate. Entscheidend ist die Reihenfolge: erst definieren, dann generieren, dann prüfen.

Etappe 1: Charakterdossier anlegen. Bevor das erste Bild existiert, steht ein Dokument mit Textanker, Referenzset, Look-Bibel, Farbpalette, verbotenen Merkmalen und Accessoire-Liste. Dieses Dossier ist die einzige Wahrheitsquelle. Wer während der Produktion improvisiert, zahlt später mit Retakes.

Etappe 2: Referenzkandidaten erzeugen und kuratieren. Dreißig bis fünfzig Kandidaten in neutralem Look, bewertet nach Wiedererkennbarkeit, technischer Sauberkeit und Winkelabdeckung. Widersprüche zur Beschreibung, etwa eine Referenz mit Brille, obwohl das Dossier keine vorsieht, fliegen raus.

Etappe 3: Look-Bibel festlegen. Brennweite, Linsencharakter, Kontrastumfang, Farbtemperatur, Korn und eine Referenzfarbkorrektur. Diese Etappe verhindert, dass Stil-Drift später fälschlich als Identitätsproblem behandelt wird.

Etappe 4: Shot-Liste und Prompt-Schablonen. Das Drehbuch wird in Einstellungen zerlegt, mit Größe, Kamerabewegung, Lichtsituation, Requisiten und Dauer. Daraus entstehen Schablonen mit festen Blöcken, die im nächsten Abschnitt beschrieben werden.

Etappe 5: Generierung mit kontrollierter Varianz. Pro Shot mindestens vier Kandidaten mit unterschiedlichen Zufallswerten, aber identischem Identitätsblock. Wichtig: Der Zufallswert wird pro Setup gewählt, nicht über das ganze Projekt hinweg fixiert. Ein projektweit fester Wert macht Bewegungen und Ausdrücke monoton.

Etappe 6: Bewertung in zwei Durchgängen. Zuerst Ausschuss entfernen, also Anatomiefehler, Artefakte, gebrochene Bewegungen. Danach erst Ranking nach Ähnlichkeit zum Golden Set. Wer alle Kriterien gleichzeitig prüft, wird langsam und uneinheitlich im Urteil.

Etappe 7: Postproduktion. Drei Maßnahmen bringen den größten Effekt: Gesichtsabgleich über alle Shots, globaler Farbabgleich auf eine Referenz-LUT und temporales Denoising gegen Flimmern. Beim Hochskalieren gilt: einmal zentral skalieren statt pro Shot mit unterschiedlichen Einstellungen.

Etappe 8: Abnahme und Retake-Plan. Vor der Freigabe wird definiert, wie stark ein Shot abweichen darf. Retakes werden mit Ursache notiert, nicht nur mit Symptom. Wer nur festhält, dass ein Shot nicht passt, wiederholt denselben Fehler beim nächsten Projekt.

Shot-Liste und Prompt-Schablonen

Die Schablone sortiert Information nach Wichtigkeit. Identitätsrelevantes steht vorn, Szenenvariation hinten, weil Modelle frühe Token stärker gewichten.

  • Identitätsblock: Textanker, wörtlich unverändert
  • Garderobeblock: Kleidung, Accessoires, Material, Farbe
  • Kamerablock: Einstellungsgröße, Winkel, Bewegung, Brennweite
  • Lichtblock: Lichtsituation, Tageszeit, Atmosphäre, Kontrast
  • Handlungsblock: Bewegung, Interaktion, Dauer, Tempo

Eine Shot-Liste als Tabelle hält das Projekt übersichtlich:

Shot Größe Kamera Licht Requisite Identitätsrisiko
01 halbnah statisch Fensterlicht Notizbuch hoch
02 Totale Schwenk rechts Dämmerung Straße niedrig
03 Nahaufnahme Handkamera Neonlicht Kopfhörer sehr hoch
04 Dreiviertel Dolly vorwärts Innenraum warm Tasse mittel

Die Spalte Identitätsrisiko steuert den Arbeitsaufwand: Shots mit hohem Risiko bekommen mehr Kandidaten und strengere Prüfung, Totale weniger. Diese Differenzierung spart Rechenzeit an den Stellen, an denen Abweichungen ohnehin kaum sichtbar sind.

Ein Skelett für eine Schablone kann so aussehen:

[Identitätsblock: Figur, Alter, Gesichtsform, Augen, Haare, Besonderheit]
[Garderobeblock: Oberteil, Material, Farbe, Accessoire]
[Kamerablock: halbnah, Dreiviertel links, langsame Fahrt nach vorn]
[Lichtblock: Neonlicht von links, gedämpfte Umgebung, Nacht]
[Handlungsblock: Figur setzt Kopfhörer auf, Blick nach unten, vier Sekunden]

Der Nutzen liegt nicht in der Länge, sondern in der Wiederholbarkeit. Ein Team, das dieselbe Schablone verwendet, kann Prompts austauschen, ohne die Figur zu destabilisieren. Zwei Praktiken vermeiden Fehler: Schablonen versionieren, damit Änderungen nachvollziehbar bleiben, und Kommentare für Menschen klar von Prompttext trennen, damit niemand Anmerkungen versehentlich mitkopiert.

Modellwahl: Entscheidungskriterien und Hybridstrategie

Nicht jeder Shot braucht dieselbe Technik. Vier Ansätze decken die meisten Situationen ab:

Ansatz Kontrolle über Identität Flexibilität Typischer Einsatz
Bild-zu-Video mit Referenzbild sehr hoch niedrig Dialogaufnahmen, Porträts, Close-ups
Text-zu-Video mit Identitätsblock mittel hoch neue Winkel, Umgebungen, Totale
Video-zu-Video als Restyle mittel bis hoch mittel reale Aufnahmen in einen Stil überführen
Eigenes trainiertes Charaktermodell sehr hoch niedrig Serien mit gleichbleibendem Look und hohem Volumen

Für die meisten Projekte ist eine Hybridstrategie am effizientesten: referenzbasierte Generierung für alles, wo das Gesicht groß im Bild ist, freiere Generierung für Totale und Umgebungsshots. Totale sind im Retake billiger und verzeihen mehr Abweichung. Entscheidungskriterien für jeden Shot sind: Wie groß ist das Gesicht im Bild? Bewegt sich die Kamera stark? Wie lang ist der Shot? Gibt es ein wiederkehrendes Requisit? Je kritischer diese Fragen ausfallen, desto stärker sollte die Referenzbindung sein.

Zwei technische Details werden häufig unterschätzt. Erstens das Seitenverhältnis: Ein Referenzset im Querformat liefert bei vertikalen Formaten schwächere Ergebnisse, weil Beschnitt und Bildkomposition abweichen. Legen Sie für jedes Zielformat eigene Referenzen an. Zweitens Bildrate und Bewegungslänge: Kurze Clips mit ruhiger Bewegung halten Identität besser als lange Einstellungen mit schnellen Richtungswechseln. Wenn eine Sequenz driftet, ist die erste Gegenmaßnahme, den Shot zu verkürzen und in zwei Einstellungen zu teilen.

Ein Modellwechsel mitten im Projekt ist ein Identitätsrisiko. Wenn er nötig ist, generieren Sie eine Übergangsserie von fünf bis zehn Testshots derselben Figur und vergleichen sie gegen das Golden Set, bevor die Produktion weiterläuft. Ein Wechsel ohne diesen Test kostet erfahrungsgemäß mehr Zeit als jede Postproduktionsmaßnahme.

Konsistenz über Stile, Alter und Formate hinweg

Sobald eine Figur in mehreren Stilen auftreten soll, also fotorealistisch, illustriert oder animiert, müssen Identitätsmerkmale von Stilmerkmalen getrennt werden. Über Stilgrenzen tragen vor allem:

  • Silhouette und Körperproportionen
  • Frisurform und Haarfarbe
  • Augenfarbe und Augenform
  • ein unverwechselbares Accessoire
  • die Grundfarbpalette der Garderobe

Weg fallen Oberflächeneigenschaften: Hautporen, Stofftextur, Lichtcharakter, Korn. Deshalb funktioniert ein Stilwechsel nur, wenn der Anker auf Form und Farbe reduziert wird und der neue Stil über eigene Referenzen kommt. Ein häufiger Fehler ist, den fotorealistischen Textanker beizubehalten und lediglich den Stilbegriff auszutauschen. Das Ergebnis wirkt wie verkleideter Realismus.

Alterung oder Verwandlung sollten als eigene Version mit eigenem Dossier und eigenem Golden Set geführt werden. Zwischenstufen, die aus derselben Ankerbeschreibung entstehen, wirken fast immer wie Fehler statt wie Entwicklung. Auch das Format verändert die Anforderungen: Vertikale Kurzformate brauchen Gesichter, die mittig gut lesbar sind, während Breitbild von Umgebung lebt. Wer beides bespielt, plant zwei Referenzsets und zwei Shot-Listen.

Langform-Projekte: Assets, Versionierung, Golden Sets

Bei Serien verschiebt sich die Herausforderung von der einzelnen Generierung zur Verwaltung von Assets. Vier Praktiken haben sich bewährt.

Versionierung. Charakterdossiers brauchen Versionsnummern. Eine Änderung an Frisur oder Alter ist kein Detail, sondern eine strukturelle Änderung, die alle nachfolgenden Shots betrifft.

Namenskonventionen. Dateinamen sollten Figur, Version, Winkel und Lichtsituation tragen, etwa figur-a-v03-dreiviertel-neon. Wer nach Wochen eine Referenz sucht, verliert sonst mehr Zeit als mit jeder Generierung.

Onboarding. Jede Person im Team, die Prompts schreibt, braucht Zugriff auf Ankerblöcke und Look-Bibel. Ohne diesen Zugriff entstehen Parallelwelten, in denen dieselbe Figur zwei Gesichter hat.

Golden Sets. Fünf Referenzbilder pro Figur gelten als Maßstab. Jede neue Einstellung wird gegen dieses Set geprüft, nie gegen das eigene Gedächtnis. Golden Sets gehören versioniert und dürfen nicht überschrieben werden.

Ein Mini-Fallbeispiel: Eine sechsteilige Serie mit zwölf Shots pro Episode und einer Stiländerung ab Episode vier. Wird die Stiländerung als neue Version geführt, bleiben Identitätsanker unverändert und nur Licht- und Look-Block werden ersetzt. Wird stattdessen der Textanker umformuliert, muss jede Episode neu kalibriert werden. Der Unterschied liegt nicht in der Technik, sondern in der Buchführung.

Die häufigsten Fehler und ihre Korrektur

Fehler Symptom Korrektur
Zu viele ähnliche Referenzen Figur stabil, aber ausdrucksarm Set auf Winkel und Lichtsituationen umbauen
Umformulierte Anker Identität springt zwischen Shots Textanker wörtlich einfrieren
Zu hohe Referenzgewichtung Figur klebt in der Pose der Vorlage Gewichtung senken, Steuersignale prüfen
Bewertung aus dem Gedächtnis uneinheitliche Abnahme immer gegen das Golden Set vergleichen
Postproduktion erst am Ende Farb- und Schärfesprünge Farbabgleich und Gesichtsabgleich früh einplanen
Kein Retake-Budget Kompromisse in der Abnahme zwanzig bis dreißig Prozent der Shots einplanen
Modellwechsel ohne Test Figur wirkt wie ausgetauscht Übergangsserie mit Vergleich generieren
Fehlende Shot-Liste Requisiten und Tageszeit inkonsistent Einstellungen vor der Generierung dokumentieren

Qualität lässt sich ohne eigene Analysesoftware messen. Vier Kennzahlen genügen: Retake-Quote pro Shot, grober Ähnlichkeitsabstand zum Golden Set (passend, grenzwertig, unbrauchbar), Farbabweichung zwischen benachbarten Shots und Zeit pro akzeptiertem Shot. Die letzte Zahl ist die wichtigste Wirtschaftsgröße im gesamten Prozess, weil sie alle Verbesserungen sichtbar macht. Eine kurze wöchentliche Auswertung deckt systematische Probleme auf, die im Einzelfall wie Pech aussehen. Fällt die Ähnlichkeit bei Nachtaufnahmen konsequent ab, ist die Ursache meist kein Modellproblem, sondern ein unterbeleuchtetes Referenzset.

FAQ

Wie viele Referenzbilder brauche ich wirklich?

Für eine Figur mit gleichbleibendem Look reichen sechs bis zwölf, sofern Winkel und Licht variieren. Mehr hilft nur, wenn die zusätzlichen Bilder neue Situationen abdecken. Zwanzig Frontalaufnahmen bringen fast keinen Gewinn.

Geht Konsistenz auch ohne eigenes trainiertes Modell?

Ja. Referenzset, fester Textanker und passend dosierte Steuersignale erreichen in vielen Fällen ausreichende Stabilität. Ein eigenes trainiertes Modell lohnt sich vor allem bei hohem Volumen und gleichbleibendem Stil, weil es dann Genauigkeit und Zeitgewinn verbindet.

Warum sieht die Figur in Bewegung anders aus als im Standbild?

Bewegung erhöht die Zahl der Freiheitsgrade. Das Modell muss zwischen Einzelbildern konsistente Entscheidungen treffen, und Fehler akkumulieren über die Sequenz. Gegenmaßnahmen sind kürzere Clips, stärkere Referenzbindung und temporales Denoising in der Postproduktion.

Was tun, wenn nur die Totalen abweichen?

Das ist oft unkritisch. Priorisieren Sie Konsistenz dort, wo das Gesicht groß im Bild ist, und lassen Sie Totale mehr Freiheit. Ein einheitlicher Look über Farbkorrektur reicht dann in der Regel aus, um die Sequenz zusammenzuhalten.

Soll ich meine Figur altern oder verändern?

Ja, aber als eigene Version mit eigenem Dossier und eigenem Golden Set. Entwickeln Sie die Zwischenstufen bewusst und nicht als Nebenprodukt derselben Beschreibung, sonst lesen Zuschauer den Wandel als Fehler.

Wie gehe ich mit Händen und Requisiten um?

Requisiten gehören in den Identitätsblock, sobald sie wiederkehren. Für Hände lohnt ein kurzer Kandidatenlauf mit vielen Versuchen, weil sich Fehler dort am hartnäckigsten halten. Alternativ nehmen Sie Hände über Bildausschnitt, Bewegung oder Requisitenführung aus dem Fokus.

Wie viele Kandidaten pro Shot sind sinnvoll?

Vier bis acht für kritische Close-ups, zwei bis vier für Totale und Umgebungsshots. Die Zahl sollte am Identitätsrisiko hängen, nicht an einem festen Schema. Wichtig ist, dass alle Kandidaten denselben Identitätsblock verwenden, damit der Vergleich aussagekräftig bleibt.

Woran erkenne ich, dass der Anker verwässert ist?

Steigt die Retake-Quote im Projektverlauf, obwohl sich die Shot-Komplexität nicht verändert, ist meist der Anker uneinheitlich. Prüfen Sie dann, ob Prompts umformuliert, Referenzen ausgetauscht oder Steuersignale verändert wurden.

Zum Schluss: Wer Figurenkonsistenz als Produktionsdisziplin behandelt, braucht keine magische Funktion. Es genügt, Identität einmal sauber zu definieren, Anker wörtlich wiederzuverwenden, Shots vor der Generierung zu planen und Ergebnisse gegen ein Golden Set zu prüfen. Die Reihenfolge ist dabei wichtiger als jedes einzelne Werkzeug: erst Dossier und Referenzset, dann Look, dann Shot-Liste, dann Generierung, dann Postproduktion, dann Kontrolle. Der eigentliche Gewinn ist nicht das perfekte Einzelbild, sondern eine Sequenz, in der Zuschauer dieselbe Person vom ersten bis zum letzten Shot wiedererkennen.

Alexander

Alexander