Start Free Now
Limited Time Offer: Get 50% OFF Starter & Basic Yearly Plans 🎉

Visuelle Konsistenz in KI-Videos: Figuren dauerhaft gleich

Sep 27, 2026

Warum KI-Figuren zwischen Shots auseinanderfallen

Wer eine Figur über mehrere Einstellungen hinweg generiert, bekommt selten eine Figur, sondern eine Verwandtschaft: In der ersten Aufnahme ist die Protagonistin rothaarig mit Sommersprossen, in der zweiten eine Brünette mit weichem Kinn, in der dritten trägt sie plötzlich eine andere Jacke und eine andere Frisur. Das wirkt wie ein Zufallsfehler, ist aber das erwartbare Verhalten von Modellen, die jeden Prompt als eigenständigen Auftrag lesen. Jede Generierung startet praktisch ohne Gedächtnis: Das Modell weiß nicht, was es kurz zuvor erzeugt hat, und kennt die Figur nur über die Wörter, die im Prompt stehen.

Erschwerend kommt hinzu, dass ein Video-Modell nicht ein Standbild stabil halten muss, sondern eine Bewegung. Gesichtszüge, die in einem Einzelbild sitzen, können bei einer Kopfdrehung kippen, weil das Modell neue Bildinformationen erfinden muss: Ohren, Haaransatz, Kieferlinie von der Seite, Nacken. Je länger die Einstellung und je stärker die Bewegung, desto größer die Abweichung. Kurze Einstellungen sind deshalb nicht nur eine erzählerische Entscheidung, sondern auch eine Konsistenzstrategie.

Für Markenbotschafter, digitale Influencer, Erklärvideo-Serien und episodische Formate ist das kein Schönheitsfehler. Zuschauer erkennen Gesichter in Millisekunden und bemerken einen Wechsel sofort, auch wenn sie nicht benennen können, was sich verändert hat. Sobald eine Figur über mehrere Videos hinweg auftritt, wird aus einem technischen Detail eine Markenfrage: Wiedererkennbarkeit ist die halbe Miete einer Figur.

Dieser Leitfaden zeigt, warum Inkonsistenz entsteht, welche Ebenen betroffen sind und mit welchem Workflow Sie Figuren, Requisiten und Szenen dauerhaft stabil halten – ohne sich auf Glück oder endloses Neugenerieren zu verlassen.

Visuelle Konsistenz definieren: vier Ebenen

Viele Teams behandeln Konsistenz als ein einziges Problem und wundern sich, dass die Lösung nicht greift. Sinnvoller ist die Trennung in vier Ebenen, die jeweils eigene Anker brauchen:

  • Identität: Gesichtsform, Augen, Frisur, Hautton, Körperproportionen, Stimme oder Sprechweise. Diese Merkmale dürfen sich fast nie ändern.
  • Requisite und Kleidung: Jacke, Brille, Tattoo, Tasche, Werkzeug, Fahrzeug. Änderungen hier fallen am schnellsten auf, weil sie große Flächen im Bild einnehmen.
  • Szenografie: Raum, Grundriss, Fensterposition, Möbel, Wetter, Tageszeit. Hier ist Variation erlaubt, aber nur mit Begründung.
  • Stil: Lichtsetzung, Farbtemperatur, Objektivwirkung, Kontrast, Filmkorn. Der Stil ist der Kitt, der unterschiedliche Einstellungen wie ein Ganzes wirken lässt.

Wichtig ist die Unterscheidung zwischen Abweichung und Fehler. Eine andere Kameraposition, ein neuer Gesichtsausdruck oder ein anderer Hintergrund sind Abwechslung, nicht Inkonsistenz. Ein Fehler entsteht erst dann, wenn ein identitätsprägendes Merkmal wechselt. Die praktische Prüffrage lautet: Würde ein Zuschauer die Figur in einem Standbild ohne Kontext wiedererkennen?

Wer diese vier Ebenen getrennt dokumentiert, kann Probleme später gezielt einkreisen. Tritt ein Fehler auf, lässt sich schnell sagen, ob die Identität, die Requisite, die Umgebung oder der Look betroffen ist – und ob die Korrektur im Prompt, im Referenzbild oder in der Postproduktion passieren muss.

Die technischen Ursachen – und was daraus folgt

Fehlende Identitätsanker

Die meisten Text-zu-Video-Modelle kennen keine dauerhafte Identität. Es gibt keinen Speicherplatz, in dem „die Frau mit dem schiefen Lächeln“ abgelegt und bei jeder neuen Generierung wieder eingesetzt wird. Stattdessen wird Identität in Wörter übersetzt: Haarfarbe, Alter, Kleidung. Diese Wörter konkurrieren im Prompt mit Szenenbeschreibungen, Lichtstimmung, Bewegung und Stilvorgaben. Je mehr davon hinzukommt, desto stärker verdünnt sich die Beschreibung der Figur.

Die Konsequenz ist eindeutig: Identität muss aus dem Prompt heraus und in ein Format wandern, das das Modell pixelgenau lesen kann – in Referenzbilder. Ein Bild trägt Informationen über Licht, Struktur und Proportionen, die sich in Text nie vollständig abbilden lassen. Wer nur mit Wörtern arbeitet, arbeitet gegen die Architektur des Modells.

Modellwechsel und Kontextverlust

Verschiedene Modelle interpretieren dieselbe Beschreibung unterschiedlich. Ein und derselbe Prompt erzeugt in unterschiedlichen Systemen Gesichter, die sich ähneln, aber nicht gleichen – und diese Unterschiede summieren sich über eine Sequenz. Wer mitten im Projekt das Werkzeug wechselt oder für einzelne Aufnahmen ein anderes Modell nutzt, bekommt Brüche, die sich in der Montage deutlich zeigen.

Hinzu kommen technische Faktoren, die oft unterschätzt werden: Seitenverhältnis, Auflösung, Kompressionsstufen und Zufallswerte. Eine Aufnahme in 16:9 und eine in 9:16 können dieselbe Figur unterschiedlich darstellen, weil das Modell die Komposition anders auflöst. Die praktische Regel lautet: ein Hauptmodell pro Figur, dokumentierte Einstellungen, bewusste Wechsel nur mit neuer Referenzverankerung.

Das Charakter-Sheet als Single Source of Truth

Ein Charakter-Sheet ist kein Nice-to-have, sondern die zentrale Datei eines Projekts. Es bündelt alles, was die Figur ausmacht, an einer Stelle – und dient jedem Beteiligten als verbindliche Referenz.

Pflichtfelder eines Charakter-Sheets

  • Referenzbilder: sechs bis zwölf Aufnahmen. Frontal, Halbprofil, Profil, Nahaufnahme der Augen, Ganzkörper, Rückansicht. Alle mit neutralem Hintergrund und gleichmäßigem Licht.
  • Beschreibung: Altersbereich, Gesichtsform, Augenfarbe, Frisur mit Länge und Textur, Haaransatz, Körperbau, Haltung.
  • Kleidung: Material, Farbe, Schnitt, Zustand. Auch Accessoires wie Brille, Uhr, Schmuck, Schuhe.
  • Negativliste: Merkmale, die nie erscheinen dürfen – etwa Bart, Muttermal, bestimmte Farben.
  • Technische Angaben: Modellversion, Einstellungen, Seitenverhältnis, verwendete Referenzen.
  • Versionsnummer und Datum: damit Änderungen nachvollziehbar bleiben.

Objekt- und Szenen-Sheets

Dasselbe Prinzip gilt für alles, was wiederkehrt: ein Fahrzeug, ein Produkt, ein Maskottchen, ein Logo, ein Raum. Fotografieren oder generieren Sie Requisiten aus mehreren Winkeln und legen Sie fest, welche Details unveränderlich sind. Bei Szenen hilft ein einfacher Grundriss mit Fensterposition, Türen und Möbeln. So kann jede Einstellung an derselben Geografie ausgerichtet werden, statt bei jedem Shot eine neue Wohnung zu erfinden.

Eine konsequente Namenskonvention spart später Stunden: figur_name_front_v03.png, szene_kueche_licht_morgen_v02.png. Wer nach drei Wochen eine Aufnahme nachgenerieren muss, findet die richtige Referenz so in Sekunden.

Referenzstrategien: Einzelbild, Multi-Image, Referenzvideo

Nicht jede Produktion braucht dieselbe Methode. Die folgenden Ansätze unterscheiden sich in Aufwand, Kontrolle und Eignung:

  • Einzelbild als Startframe: Sie generieren ein starkes Standbild der Figur und lassen das Video-Modell daraus Bewegung ableiten. Schnell, günstig, gut für kurze Einstellungen. Schwach bei Drehungen und bei langen Takes.
  • Multi-Image-Referenz: Mehrere Ansichten derselben Figur werden gleichzeitig übergeben, damit das Modell Proportionen und Merkmale aus mehreren Winkeln ableitet. Deutlich stabiler, besonders bei Profilaufnahmen.
  • Personalisierte Modelle: Ein auf Ihre Figur abgestimmtes Zusatzmodell lernt Gesicht, Kleidung und Stil. Höchste Konsistenz, aber Einrichtungsaufwand und Datenpflege.
  • Start- und Endframe: Beide Bilder werden vorgegeben, das Modell füllt die Bewegung dazwischen. Ideal für kontrollierte Übergänge und präzise Kamerafahrten.
  • Referenzvideo: Aussehen und Bewegung kommen aus einem kurzen Clip. Stark für wiederkehrende Gesten und Gangarten.

Entscheidungskriterien: Wie viele Winkel brauche ich? Wie lang sind meine Einstellungen? Wie oft wird dieselbe Figur wiederverwendet? Ein Einzelbild reicht für einen Werbespot mit drei kurzen Shots; eine Serie mit zwölf Folgen braucht ein personalisiertes Modell und ein gepflegtes Sheet.

Der Workflow in acht Schritten

  1. Figur schriftlich festlegen. Ein bis zwei Seiten Beschreibung, bevor das erste Bild entsteht. Wer die Figur nicht beschreiben kann, kann sie nicht stabil halten.
  2. Referenzset erzeugen. Mit einem Bildmodell und festen Einstellungen mehrere Winkel generieren. Nicht den erstbesten Treffer nehmen, sondern gezielt auf Konsistenz prüfen.
  3. Sheet freigeben. Erst wenn alle Beteiligten zustimmen, wird das Set eingefroren. Änderungen danach nur mit neuer Versionsnummer.
  4. Shot-Liste mit Kontinuitätsmerkmalen. Für jede Einstellung notieren: Kleidung, Tageszeit, Ort, Requisiten, Emotion. Das ist Drehbuch und Kontinuitätsprotokoll in einem.
  5. Prompt-Template bauen. Ein fester Identitätsblock, der in jedem Prompt unverändert bleibt, plus ein variabler Szenenblock. Nie den Identitätsblock aus Bequemlichkeit umformulieren.
  6. In kurzen Einstellungen generieren. Vier bis sechs Sekunden statt zehn. Kürzere Takes bedeuten weniger Zeit für Drift und mehr Kontrolle in der Montage.
  7. Sofort prüfen, gezielt nachbessern. Nicht die Figur neu erfinden, sondern die eine fehlerhafte Einstellung mit derselben Referenz neu generieren.
  8. Versionieren und archivieren. Alle Referenzen, Prompts und Ergebnisse an einem Ort ablegen, mit klarer Ordnerstruktur pro Figur.

Der wichtigste Punkt ist Schritt fünf. Die meisten Konsistenzprobleme entstehen nicht durch schlechte Modelle, sondern durch Prompts, die bei jeder Einstellung neu getextet werden. Ein stabiler Identitätsblock wirkt wie ein Anker, der in jeder Aufnahme denselben Bezugspunkt setzt.

Konsistenz über Zeit: Licht, Farbe, Kamera

Konsistenz endet nicht beim Gesicht. Sie umfasst auch die Art, wie eine Szene aussieht und wie sich Figuren über Einstellungen hinweg verhalten.

  • Lichtrichtung und -härte: Weiches Seitenlicht in einer Aufnahme und hartes Gegenlicht in der nächsten zerlegt die visuelle Einheit. Legen Sie pro Szene eine Lichtsituation fest.
  • Farbtemperatur: Arbeiten Sie mit einer festen Farbstimmung pro Ort. Ein Raum sollte morgens und abends unterschiedlich aussehen dürfen, aber innerhalb einer Szene gleich.
  • Brennweite und Kamerahöhe: Ein Wechsel von Weitwinkel auf Tele verändert Proportionen deutlich. Wenn das Gesicht dadurch schmaler wirkt, liest das Publikum es als andere Person.
  • Garderobe über Schnitte hinweg: Notieren Sie, welche Ärmel hochgekrempelt sind, welcher Knopf offen ist, wo eine Tasche hängt. Diese Details sind häufig die auffälligsten Fehler.
  • Farbangleich in der Postproduktion: Eine gemeinsame Farbkorrektur über alle Einstellungen einer Sequenz glättet kleine Unterschiede und ist oft die günstigste Konsistenzmaßnahme überhaupt.

Ein einfacher Test: Legen Sie fünf Einstellungen nebeneinander und betrachten Sie sie aus zwei Metern Abstand. Was sofort auffällt, ist ein Konsistenzproblem. Was nur beim Standbildvergleich auffällt, ist ein Detail für die Feinarbeit.

Tool-Stack und Entscheidungskriterien

Sie brauchen keine einzelne Wunderanwendung, sondern eine Kette, in der jeder Baustein eine klar umrissene Aufgabe hat:

  • Bildgenerierung für Referenzen: Hier entsteht das Charakter-Sheet. Achten Sie auf reproduzierbare Einstellungen und die Möglichkeit, mehrere Winkel derselben Figur zu erzeugen.
  • Personalisierung oder Zusatztraining: Für Figuren, die über viele Videos hinweg auftreten. Entscheidend ist, wie einfach sich das Modell mit neuen Referenzen aktualisieren lässt.
  • Video-Modell: Das Arbeitstier. Prüfen Sie, ob mehrere Referenzbilder akzeptiert werden, ob Start- und Endframe möglich sind und wie stark die Bewegung die Identität belastet.
  • Upscaling und Rauschreduktion: Wichtig, damit die Figur in der finalen Auflösung nicht weichgezeichnet wird.
  • Schnitt und Farbkorrektur: Hier wird aus einzelnen Clips eine Sequenz. Feste Voreinstellungen für Look und Lautheit sparen viel Zeit.
  • Asset-Verwaltung: Ein geteiltes Laufwerk, eine Tabelle oder ein Projektboard, in dem Referenzen, Prompts und Versionen liegen.

Entscheidungskriterien für die Tool-Wahl: Akzeptiert das System mehrere Referenzbilder derselben Figur? Bleibt die Identität über mehrere Einstellungen erhalten? Lassen sich Einstellungen exportieren und wiederverwenden? Wie teuer ist eine Fehlgenerierung in Zeit? Wer diese vier Fragen beantwortet, findet schnell den passenden Stack – unabhängig davon, welcher Anbieter gerade populär ist.

Häufige Fehler und Gegenmittel

  • Zu viele Details im Prompt: Je länger die Beschreibung, desto stärker verliert der Identitätskern an Gewicht. Kürzen Sie auf die Merkmale, die wirklich unterscheiden.
  • Inkonsistente Referenzbilder: Ein Set aus unterschiedlich beleuchteten, unterschiedlich zugeschnittenen Bildern verwirrt das Modell. Erst angleichen, dann verwenden.
  • Ein einziges Referenzbild: Für Frontalaufnahmen mag es reichen, für Dreiviertelansichten nicht. Immer mehrere Winkel bereithalten.
  • Zu lange Einstellungen: Ab etwa acht Sekunden steigt die Drift deutlich. Zerlegen Sie lange Szenen in mehrere Takes.
  • Nachgenerieren ohne Referenz: Einzelne Shots nachträglich ohne das Sheet zu wiederholen, ist der häufigste Grund für Brüche.
  • Formatwechsel mitten im Projekt: Seitenverhältnis oder Auflösung zu ändern, verändert die Bildkomposition und damit die Figur.
  • Konsistenz nur in der Postproduktion lösen: Farbkorrektur hilft bei Stimmung, nicht bei falscher Nasenform.
  • Zu starke Stilisierung: Je extremer der Look, desto schwerer ist er über viele Einstellungen zu halten. Reduzieren Sie Stilisierung, wenn Stabilität wichtiger ist als Stil.

Qualitätskontrolle, Checkliste und FAQ

Testmatrix für jede neue Figur

Bevor Sie in die Serienproduktion gehen, generieren Sie fünf Testeinstellungen: frontal bei Tageslicht, Dreiviertelansicht mit Bewegung, Nahaufnahme der Augen, eine Szene bei schwachem Licht und eine Actionaufnahme mit schneller Bewegung. Bewerten Sie jede Aufnahme mit einer Skala von eins bis fünf in drei Kategorien: Identität, Garderobe, Farbe und Licht. Liegt der Durchschnitt unter vier, ist der Workflow noch nicht stabil – dann zuerst Referenzset oder Prompt-Template verbessern, nicht mehr Shots generieren.

Abnahme-Checkliste

  • Stimmen Gesichtsform, Augen und Frisur in allen Einstellungen?
  • Sind Kleidung und Accessoires über Schnitte hinweg identisch?
  • Passt die Lichtrichtung innerhalb einer Szene zusammen?
  • Haben alle Aufnahmen eine vergleichbare Farbstimmung?
  • Ist die Figur auch in einer Standbild-Montage wiedererkennbar?
  • Sind alle Referenzen, Prompts und Versionen gespeichert?

FAQ

Wie viele Referenzbilder brauche ich wirklich?
Für kurze Projekte reichen drei bis fünf Aufnahmen, wenn Frontal- und Dreiviertelansicht dabei sind. Sobald Profilaufnahmen, Nahaufnahmen oder Actionsequenzen geplant sind, sollten es sechs bis zwölf sein, inklusive Ganzkörper und Rückansicht.

Hilft ein fester Zufallswert bei der Konsistenz?
Ein fester Wert hilft, Variationen zu vergleichen, ersetzt aber keine Referenz. Sobald Sie den Prompt inhaltlich verändern, wirkt sich der Wert anders aus. Nutzen Sie ihn als Kontrollwerkzeug, nicht als Konsistenzgarantie.

Warum ändert sich ständig die Kleidung?
Weil Kleidung in den meisten Prompts nur mit einem oder zwei Wörtern beschrieben wird und das Modell die Lücke füllt. Beschreiben Sie Material, Schnitt und Farbe konkret und halten Sie diesen Block in jedem Prompt identisch. Bei längeren Projekten lohnt es sich, Kleidung als eigenes Referenzbild zu führen.

Geht Konsistenz auch ohne eigenes Training?
Ja, mit konsequenter Referenzarbeit und kurzen Einstellungen. Der Preis ist mehr manuelle Kontrolle und mehr Nachgenerierungen. Sobald dieselbe Figur in vielen Videos auftritt, amortisiert sich ein personalisiertes Modell schnell.

Was mache ich mit Nebenfiguren?
Reduzieren Sie den Aufwand bewusst. Nebenfiguren brauchen ein bis zwei Referenzbilder und eine knappe Beschreibung, aber kein vollständiges Sheet. Wichtig ist nur, dass sie sich über ihre Auftritte hinweg nicht widersprechen.

Wie viele Shots sollte eine Szene haben?
So viele wie nötig und so kurz wie möglich. Kürzere Einstellungen sind konsistenter, flexibler in der Montage und erlauben es, Fehler gezielt zu ersetzen, ohne eine ganze Sequenz neu zu generieren.

Kann ich mehrere Stile in einem Projekt mischen?
Ja, aber nicht innerhalb einer Szene ohne erzählerische Begründung. Wechselnde Looks eignen sich für Zeitsprünge oder Perspektivwechsel – solange Figur und Requisiten dabei stabil bleiben.

Fazit

Visuelle Konsistenz ist kein einzelnes Werkzeug, sondern ein Verfahren: Figur definieren, Referenzen erzeugen, ein Sheet einfrieren, mit stabilen Prompts arbeiten, kurz generieren und konsequent prüfen. Wer diese Reihenfolge einhält, verbringt weniger Zeit mit Nachbessern und mehr Zeit mit dem, was das Publikum tatsächlich sieht – einer Figur, die über jede Einstellung hinweg dieselbe bleibt.

Alexander

Alexander