Warum Gesichter in KI-Videos zuerst zerfallen
Wer zum ersten Mal eine lĂ€ngere Sequenz mit generativem Video baut, erlebt dasselbe Muster. Der erste Clip sitzt, der zweite wirkt noch ĂŒberzeugend, und ab dem fĂŒnften Shot stimmt etwas nicht mehr: Der Haaransatz sitzt ein paar Millimeter höher, die Augen wirken runder, das Kinn schmaler. Einzelne Frames bleiben beeindruckend, die Sequenz als Ganzes zerfĂ€llt.
Die Ursache liegt in der Funktionsweise der Modelle. Ein Videomodell besitzt kein GedĂ€chtnis fĂŒr Figuren. Jeder Clip entsteht als neue Stichprobe aus einer gelernten Verteilung, gesteuert durch Text, Zufallsrauschen und â wenn vorhanden â Referenzbilder. Ein Gesicht ist in diesem Raum ein extrem kleiner, instabiler Punkt. Schon eine leicht verĂ€nderte Lichtrichtung, ein anderer Kamerawinkel oder ein einzelnes zusĂ€tzliches Wort im Prompt verschieben diesen Punkt messbar.
Deshalb ist Konsistenz kein Detail, das man am Ende nachbessert. Sie ist die zentrale Produktionsanforderung, sobald mehr als ein hĂŒbscher Einzelclip entstehen soll. Kurze ErzĂ€hlungen, Serienformate mit wiederkehrender Hauptfigur, Werbespots mit einem Gesicht im Zentrum, animierte Storyboards fĂŒr Pitches, Musikvideos mit einem Protagonisten â all das funktioniert nur, wenn die Figur ĂŒber zwanzig Einstellungen hinweg erkennbar dieselbe bleibt.
Multi-Image-Fusion setzt genau dort an. Statt dem Modell ein einziges Referenzbild vorzuwerfen, bekommt es mehrere Aufnahmen derselben Person aus unterschiedlichen Blickwinkeln, Lichtsituationen und AusdrĂŒcken. Daraus entsteht ein stabiler IdentitĂ€tsvektor, der bei jeder Generierung mitgefĂŒhrt wird. Die Figur wird nicht mehr frei erfunden, sondern verankert.
Der Aufwand verschiebt sich dadurch spĂŒrbar. Nicht das Rendern ist die eigentliche Arbeit, sondern die Vorbereitung. Wer zwanzig brauchbare Referenzfotos kuratiert, aufeinander abstimmt und in einen konsistenten Szenenplan ĂŒbersetzt, verbringt schnell sechzig bis siebzig Prozent der Projektzeit vor dem ersten Render. Der Rest ist Feinarbeit â und genau deshalb lohnt es sich, die Vorbereitung zu systematisieren statt sie zu improvisieren.
IdentitÀt und Stil sauber trennen
Der wichtigste mentale Schritt vor jeder technischen Entscheidung ist die Unterscheidung zwischen IdentitÀt und Stil. Wer beides vermischt, trainiert das Modell auf einen Look statt auf eine Person.
Was zur IdentitÀt gehört
IdentitĂ€t sind die Merkmale, die eine Person unverwechselbar machen: Augenabstand, Nasenform und NasenrĂŒcken, Kieferlinie, Zahnstellung beim LĂ€cheln, Ohrform, Muttermale, Narben, die Art, wie die Augenbrauen sitzen, die Position der Augen relativ zur Gesichtsmitte. Diese Merkmale sind ĂŒber die Lebensspanne relativ stabil und Ă€ndern sich zwischen Szenen nicht.
Was Stil ist
Stil ist alles, was man Àndern kann, ohne die Person auszutauschen: Schminke, Lichtfarbe, Kleidung, Brennweite, Farbprofil, Filmkorn, Vignette, Kontrastkurve, Grad der Weichzeichnung. Zwei Aufnahmen derselben Person können stilistisch völlig unterschiedlich sein und trotzdem dieselbe IdentitÀt tragen.
Der teure Denkfehler
Wer Stilvarianten ins Kern-Referenzset mischt, produziert einen Charakter, der nur in Szenen stabil bleibt, die zufĂ€llig wie die Referenzen aussehen. Sobald die Szene auf Nacht, Regen oder Neonlicht umgestellt wird, kippt das Gesicht. Die Praxislösung ist simpel: ein Kern-Set pro Figur mit mindestens drei Lichtsituationen (weich, hart, seitlich) und drei Perspektiven (frontal, Halbprofil, Profil). Stilvarianten wandern in ein separates Set, das nur fĂŒr bestimmte Szenen eingeblendet wird.
Wie viele Referenzbilder wirklich sinnvoll sind
Mehr ist nicht automatisch besser. Sechs bis zwölf hochwertige, klar unterschiedliche Aufnahmen liefern in der Regel stabilere Ergebnisse als dreiĂig halbbrauchbare SchnappschĂŒsse. Zu viele Ă€hnliche Bilder verstĂ€rken einzelne Merkmale ĂŒberproportional â ein leicht schiefes LĂ€cheln aus fĂŒnf Ă€hnlichen Fotos wird dann zum dominanten IdentitĂ€tsmerkmal, und die Figur lĂ€chelt fortan immer asymmetrisch.
Sinnvolle Untergrenze sind drei Bilder. Sinnvolle Obergrenze fĂŒr handgefĂŒhrte Projekte liegt bei fĂŒnfzehn. Alles darĂŒber gehört in ein sauber dokumentiertes Asset-Verzeichnis mit Versionierung, sonst verliert man die Kontrolle darĂŒber, welche Referenz welchen Effekt verursacht. Ein nĂŒtzlicher Test: Wenn Sie nicht in einem Satz erklĂ€ren können, warum ein bestimmtes Foto im Set liegt, gehört es wahrscheinlich nicht hinein.
Referenzmaterial kuratieren: das Fundament
Die QualitĂ€t der Referenzen entscheidet mehr ĂŒber das Ergebnis als die Wahl des Modells. Ein durchschnittliches Modell mit exzellentem Referenzmaterial schlĂ€gt ein Spitzenmodell mit widersprĂŒchlichen Fotos.
Auswahlkriterien fĂŒr Fotos
- Gesicht vollstÀndig sichtbar, keine Sonnenbrille, kein Schal vor dem Kinn, keine Hand im Gesicht
- SchÀrfe auf den Augen, keine BewegungsunschÀrfe, kein Rauschen in den Tiefen
- NatĂŒrliche Hautstruktur, keine Beauty-Filter, keine Weichzeichnung
- Möglichst gleichbleibendes Alter und gleichbleibende HaarlÀnge im Kern-Set
- Neutraler bis einfacher Hintergrund, damit keine Umgebungsmerkmale ĂŒbertragen werden
- Keine starken Schattenkanten quer ĂŒber die Nase, die spĂ€ter als IdentitĂ€tsmerkmal gelesen werden
Aufbereitung und Zuschnitt
- Auf Kopf und Schultern zuschneiden, Gesicht etwa 60 bis 70 Prozent der BildflÀche
- Mindestens 1024 Pixel an der kurzen Kante, besser mehr; hochskalierte Bilder sind besser als unscharfe
- Einheitliches SeitenverhÀltnis im Set, damit das Modell keine Formatkanten als Stilmerkmal lernt
- Leichte Farbkorrektur ist erlaubt, aggressive Filter nicht
- Einzelne Bilder bei Bedarf freistellen, aber nicht alle, sonst lernt das Modell den freigestellten Look
Dokumentation: das Charakterblatt
Legen Sie fĂŒr jede Figur eine Textdatei an: Name, Alter, Herkunft, Frisur, HaarlĂ€nge, Augenfarbe, besondere Merkmale, Kleidungsstil, Sprachduktus. Diese Notizen wandern spĂ€ter in die Prompts und verhindern, dass Beschreibungen zwischen Szenen auseinanderlaufen. Ein Charakterblatt ohne Text ist ein halbes Charakterblatt.
ErgĂ€nzen Sie eine kurze Liste der Referenzdateien mit Kommentar, warum die jeweilige Aufnahme im Set liegt. Diese Dokumentation ist der Unterschied zwischen einem reproduzierbaren Workflow und einem GlĂŒcksspiel, das bei der nĂ€chsten Figur von vorn beginnt.
Der Produktionsworkflow in sieben Etappen
Etappe 1: Master-Bild festlegen
Beginnen Sie mit einer Produktionsreihe von Testbildern und wĂ€hlen Sie ein neutrales Master-Bild â frontal, weiches Licht, klare Augen, ruhiger Ausdruck. Dieses Master-Bild ist der Anker fĂŒr alles Weitere.
Etappe 2: Varianten erzeugen und prĂŒfen
Vom Master aus generieren Sie Varianten mit unterschiedlicher Blickrichtung und Lichtsetzung. PrĂŒfen Sie jede Variante gegen das Master-Bild: Augenform, NasenrĂŒcken, Kieferlinie, Ohrform. Erst wenn drei aufeinanderfolgende Varianten plausibel dieselbe Person zeigen, ist das Set reif fĂŒr die Fusion.
Etappe 3: Testshots mit Drift-Check
Erzeugen Sie zehn kurze Testclips mit bewusst unterschiedlichen Bedingungen: Nachtaufnahme, Gegenlicht, schnelle Kopfdrehung, Nahaufnahme, Halbtotale, Bewegung quer durchs Bild. Bewerten Sie nicht nach GefĂŒhl, sondern nach Checkliste. Notieren Sie pro Clip, welches Merkmal zuerst kippt. Diese Notizen zeigen prĂ€zise, welche Referenz fehlt.
Etappe 4: Szenenplan und Blockbildung
Planen Sie Blickrichtungen in Blöcken. Wenn Sie alle frontalen Einstellungen hintereinander rendern und danach alle Profilaufnahmen, bleibt die IdentitĂ€t stabiler, weil das Modell pro Block mit Ă€hnlichen Referenzen arbeitet. Mischen Sie nicht innerhalb einer Szene zwischen extremer Nahaufnahme und weiter Totale, wenn es sich vermeiden lĂ€sst. Ein Szenenplan auf Papier mit Spalten fĂŒr Lichtsituation, Perspektive, Garderobe und Referenzset kostet zwanzig Minuten und spart Stunden.
Etappe 5: Bild zuerst, Bewegung danach
Der zuverlĂ€ssigste Weg zu einem konsistenten Clip fĂŒhrt ĂŒber ein Standbild. Erzeugen oder wĂ€hlen Sie ein Bild, das der ersten Einstellung entspricht, und lassen Sie daraus eine kurze Bewegung generieren. Das Modell muss dann nicht mehr die IdentitĂ€t erfinden, sondern nur Bewegung ergĂ€nzen. Diese Reihenfolge â Bild zuerst, Bewegung danach â löst die meisten Konsistenzprobleme, bevor sie entstehen.
Etappe 6: Rendern in Blöcken
Rendern Sie blockweise und prĂŒfen Sie nach jedem Block. Wenn ein Block drei Clips hintereinander keine brauchbare Figur liefert, ist die Referenz oder der Prompt falsch â nicht die Geduld. Brechen Sie ab, korrigieren Sie die Ursache, starten Sie den Block neu. Weiterrendern aus Trotz ist der teuerste Fehler im Workflow.
Etappe 7: QualitĂ€tskontrolle Frame fĂŒr Frame
PrĂŒfen Sie die kritischen Frames: den ersten, den letzten und jeden Moment, in dem sich der Kopf stark dreht. Genau dort zeigt sich Drift am deutlichsten. Markieren Sie problematische Frames und entscheiden Sie, ob ein Reshoot des Clips oder eine Reparatur in der Nachbearbeitung gĂŒnstiger ist.
Technische Wege zur Konsistenz im Vergleich
IdentitÀts-Adapter
Adapter-AnsĂ€tze injizieren den IdentitĂ€tsvektor in mehrere Schichten des Generators. Sie sind schnell, erfordern kein Training und lassen sich mit verschiedenen Basismodellen kombinieren. Der Nachteil: Bei starken Perspektivwechseln verliert der Adapter an PrĂ€zision, weil er IdentitĂ€t ĂŒberwiegend aus zweidimensionalen Merkmalen ableitet. FĂŒr ruhige Einstellungen mit begrenzter Kopfbewegung ist das der beste Aufwand-Nutzen-Kompromiss.
Gesichtsreferenzierung nach der Generierung
Hier wird nach der Generierung ein Gesicht eingesetzt oder nachgeschĂ€rft. Das liefert sehr hohe Ăhnlichkeitstreue in Nahaufnahmen, kann aber bei schnellen Bewegungen, Teilverdeckungen oder Drehungen artefaktisch wirken. Als Rettungsnetz fĂŒr einzelne Shots hervorragend, als Grundlage fĂŒr eine ganze Sequenz zu instabil.
Eigenes Fine-Tuning
Ein auf die Figur abgestimmtes Modell oder ein leichtes Zusatztraining liefert die höchste Konsistenz, besonders fĂŒr wiederkehrende Formate. Der Preis ist Vorbereitungszeit: Materialauswahl, Ausschluss von Fehlbildern, TestlĂ€ufe, Bewertung, Dokumentation. FĂŒr ein Kurzprojekt selten wirtschaftlich, fĂŒr eine Serie mit derselben Hauptfigur fast immer.
Entscheidungsmatrix
| Situation | Empfohlener Weg |
|---|---|
| Einzelner Clip, eine Figur, wenig Zeit | Adapter mit sechs bis zehn Referenzen |
| Mehrere Szenen, stark unterschiedliche Lichter | Adapter plus getrennte Stilsets |
| Serie mit wiederkehrender Hauptfigur | Eigenes Fine-Tuning mit dokumentiertem Set |
| Bestehender Clip, Gesicht wirkt fremd | NachtrÀgliche Gesichtsreferenzierung |
| Kundenvorschau ohne finalen Anspruch | Adapter plus Bild-zu-Video-Kette in niedriger Auflösung |
| Historische oder Fantasy-Figuren | Fine-Tuning plus zusÀtzliche Garderoben-Referenzen |
KontinuitÀt jenseits des Gesichts
Konsistenz endet nicht am Gesicht. Zuschauer bemerken Fehler zuerst bei Details, die sich unbemerkt verĂ€ndern: Die Jacke wechselt die Farbe, ein Muttermal wandert, der Haarschnitt wird kĂŒrzer, die Brille verschwindet. Planen Sie pro Szene ein kurzes KontinuitĂ€tsprotokoll.
Licht
Notieren Sie Hauptlichtrichtung, Farbtemperatur und HĂ€rte. Szenen mit gleicher Lichtsignatur lassen sich zusammen rendern und liefern konsistentere Ergebnisse. Ein Wechsel von weichem Fensterlicht zu hartem Sonnenlicht mitten in einer Dialogszene ist nicht nur Ă€sthetisch falsch, sondern eine der hĂ€ufigsten Ursachen fĂŒr IdentitĂ€tsdrift.
Garderobe
Beschreiben Sie jedes KleidungsstĂŒck exakt, inklusive Material und Farbton. Farbnamen wie âdunkelblauâ sind zu ungenau; verwenden Sie Referenzbilder fĂŒr Kleidung oder sehr spezifische Beschreibungen wie âdunkelblaue, matte Baumwolljacke mit durchgehendem ReiĂverschlussâ. Kleidungsreferenzen sind oft wichtiger als das Gesicht, weil sie groĂe BildflĂ€chen einnehmen.
Requisiten und Verletzungen
Brille, Ohrringe, Uhren und Narben gehören ins Kern-Set und in jede Szenenbeschreibung. Fehlen sie in den Referenzen, tauchen sie nur zufĂ€llig auf. Wenn eine Figur im Verlauf einer Geschichte verletzt wird, dokumentieren Sie, in welcher Szene welche Wunde entsteht â und behalten Sie sie in allen spĂ€teren Szenen bei.
Alter und Zeitverlauf
Ăndert sich das Alter zwischen Szenen, verĂ€ndern Sie nur ein Merkmal pro Ăbergang â Falten, Haaransatz oder Haltung â nicht alles gleichzeitig. Ein Sprung von âjunge Erwachseneâ zu âgealterte Heldinâ ĂŒber Nacht wirkt immer kĂŒnstlich, weil das Modell aus widersprĂŒchlichen Referenzen einen Kompromiss bildet, der keinem Alter eindeutig zuzuordnen ist.
Typische Fehlerbilder und GegenmaĂnahmen
Das Gesicht driftet mitten im Clip. Ursache ist meist eine zu lange Generierung ohne Zwischenanker. Lösung: In kĂŒrzere Segmente aufteilen und fĂŒr jedes Segment das letzte gute Frame als Startbild verwenden. Drei Sekunden mit Anker schlagen acht Sekunden ohne.
Die Haut wirkt wÀchsern. Das passiert, wenn Referenzen zu stark retuschiert wurden. Tauschen Sie zwei Aufnahmen gegen unretuschierte, leicht texturierte Bilder und reduzieren Sie die NachschÀrfung.
Der Hintergrund ĂŒbertrĂ€gt sich auf die Figur. Ein dominanter Hintergrund in den Referenzen wird mitgelernt. Zuschneiden oder freistellen hilft, ebenso ein Set mit bewusst unterschiedlichen HintergrĂŒnden.
Die Frisur Àndert sich stÀndig. Meist liegt das an gemischten HaarlÀngen im Set. Reduzieren Sie auf eine LÀnge und beschreiben Sie Form und Textur konsistent in jedem Prompt.
Das Modell ignoriert die Referenz komplett. PrĂŒfen Sie Reihenfolge und Gewichtung: Das erste Bild im Set hat oft den gröĂten Einfluss. Ziehen Sie die beste Aufnahme nach vorn und entfernen Sie schwache Bilder.
Bewegung zerstört die IdentitĂ€t. Lange, schnelle Bewegungen sind der hĂ€rteste Fall. Setzen Sie kĂŒrzere Bewegung, langsamere Kamerafahrten und ruhigere Posen ein â das wirkt oft hochwertiger als hektische Action.
Die Augenfarbe kippt. Ein hÀufiges Symptom zu kleiner Referenzsets. ErgÀnzen Sie zwei Nahaufnahmen mit neutralem Licht, in denen die Augen klar sichtbar sind.
Kleidung Ă€ndert den Schnitt. Beschreiben Sie nicht nur Farbe, sondern auch LĂ€nge, Kragenform und Ărmelabschluss. Ein einzelnes Referenzbild der Garderobe behebt das Problem meist sofort.
Nachbearbeitung, Schnitt und Ton
Ein groĂer Teil der wahrgenommenen Konsistenz entsteht erst im Schnitt. Ein kurzer Blickwechsel versteckt Mikroabweichungen, ein Schnitt auf ein Detail kaschiert ein leicht verĂ€ndertes Gesicht. Nutzen Sie das bewusst.
- Schneiden Sie auf Bewegung, nicht auf Stillstand. Unruhige Frames fallen im Schnitt weniger auf.
- Korrigieren Sie Farbabweichungen zwischen Clips mit einem einheitlichen Farbprofil.
- Stabilisieren Sie wackelige Clips leicht; ĂŒbermĂ€Ăige Stabilisierung erzeugt weiche Gesichter.
- Setzen Sie Haut- und Augenkorrektur dezent ein. Zu viel NachschĂ€rfen lĂ€sst die Figur kĂŒnstlich wirken.
- Legen Sie eine Tonspur mit klarer SprachqualitĂ€t darunter. Guter Ton hebt die gefĂŒhlte BildqualitĂ€t deutlich an.
- Bei Dialogszenen: Schnitt auf Reaktion statt auf Sprecher reduziert die Zahl der Frames, in denen der Mund exakt stimmen muss.
Wenn mehrere Szenen dieselbe Figur zeigen, hilft ein kurzer Zwischenschnitt auf HĂ€nde, Requisiten oder Umgebung. Das reduziert die Anzahl der Frames, in denen das Gesicht exakt stimmen muss â und damit die AngriffsflĂ€che fĂŒr Fehler.
Zeitplan, Rechenzeit und Iterationsbudget
Planen Sie Iterationen ein, statt sie als Ausnahme zu behandeln. Realistisch liegt die Trefferquote in einem guten Workflow bei einer verwertbaren Einstellung aus zwei bis vier Versuchen â bei schnellen Bewegungen schlechter, bei ruhigen Einstellungen besser. Wer das im Zeitplan berĂŒcksichtigt, gerĂ€t nicht in Panik, wenn der dritte Versuch unscharf ist.
Halten Sie die Testphase gĂŒnstig: niedrigere Auflösung, kurze Clips, reduzierte LĂ€nge. Erst wenn IdentitĂ€t und Bewegung stimmen, rendern Sie in ZielqualitĂ€t. Diese Reihenfolge spart die meiste Rechenzeit, weil teure Fehler frĂŒh und billig sichtbar werden.
Ein nĂŒtzlicher Kalibrierungslauf fĂŒr neue Figuren: FĂŒnf Szenen mit maximal unterschiedlichen Bedingungen generieren, jede in niedriger Auflösung. Danach wissen Sie, wo die Grenzen Ihrer Referenzen liegen, und können den Szenenplan anpassen, bevor die Hauptproduktion startet.
PrĂŒfliste vor dem finalen Render:
- Kern-Set vollstÀndig, dokumentiert und versioniert
- Bestes Referenzbild als erstes Element im Set
- Szenenplan mit Licht-, Garderoben- und Perspektivangaben
- Testshots bewertet, Drift-Merkmale notiert
- Prompts ĂŒber alle Szenen hinweg sprachlich konsistent
- Bild-zu-Video-Kette vorbereitet, Startframes gesichert
- Korrekturpipeline definiert (Farbe, Stabilisierung, Gesicht)
- Ausgabeformat und SeitenverhÀltnis projektweit einheitlich
- Garderoben-Referenzen fĂŒr jede Figur vorhanden
- Abbruchkriterium fĂŒr erfolglose Blöcke festgelegt
FAQ
Wie viele Referenzfotos brauche ich mindestens?
Drei gut gewÀhlte Aufnahmen aus unterschiedlichen Winkeln sind das absolute Minimum. Mit sechs bis zwölf Bildern steigt die StabilitÀt deutlich, besonders bei Perspektivwechseln. Entscheidend ist die Vielfalt der Winkel, nicht die reine Anzahl.
Warum Àndert sich die Frisur trotz Referenzen?
Weil das Modell Frisur als Stilmerkmal behandelt und aus widersprĂŒchlichen Referenzen einen Kompromiss bildet. Lösen Sie das Problem, indem Sie HaarlĂ€nge und -form im Set vereinheitlichen und den Stil zusĂ€tzlich in jedem Prompt beschreiben.
Kann ich dieselbe Figur in mehreren Projekten weiterverwenden?
Ja, wenn Sie Referenzset und Charakterblatt archivieren. Speichern Sie zusĂ€tzlich die Prompt-Bausteine fĂŒr Licht und Garderobe. Ein wiederkehrender Charakter wird mit jedem Projekt stabiler, weil Sie wissen, welche Referenzen funktionieren.
Was tun, wenn das Gesicht in schnellen Bewegungen verschmiert?
Reduzieren Sie die Bewegungsgeschwindigkeit, verkĂŒrzen Sie die Clip-LĂ€nge oder teilen Sie die Bewegung in zwei Einstellungen. Alternativ rendern Sie ruhig und erzeugen die Dynamik im Schnitt ĂŒber Schnittfrequenz und Kamerafahrten.
Lohnt sich eigenes Fine-Tuning fĂŒr ein Kurzprojekt?
Meist nicht. Der Vorbereitungsaufwand amortisiert sich erst, wenn dieselbe Figur ĂŒber viele Szenen oder mehrere Projekte hinweg auftritt. FĂŒr einmalige Clips ist ein gut kuratiertes Referenzset mit Adapter der schnellere Weg.
Wie gehe ich mit Kindern oder Tieren als Figur um?
Beide verĂ€ndern Proportionen stĂ€rker als Erwachsene, weshalb Referenzsets hier mehr Bilder und klarere Altersangaben brauchen. Bei Tieren helfen zusĂ€tzlich Rasse, Fellfarbe und Fellmuster als feste Prompt-Bausteine. Bei Kindern ist die Kopfform der empfindlichste Punkt â dafĂŒr lohnt sich mindestens ein zusĂ€tzliches Profilbild.
Muss ich jede Szene einzeln rendern?
Ja, aber gruppieren Sie Àhnliche Szenen. Blöcke mit gleicher Lichtsituation, gleicher Perspektive und gleicher Garderobe liefern konsistentere Ergebnisse und sparen Iterationen im Vergleich zu stÀndig wechselnden Bedingungen.
Was mache ich, wenn die Figur in einer einzelnen Einstellung kippt, obwohl alle anderen sitzen?
Behandeln Sie diese Einstellung als Sonderfall. Rendern Sie sie ruhiger, verkĂŒrzen Sie die Bewegung und setzen Sie gegebenenfalls ein nachtrĂ€gliches Gesichtsverfahren ein. Wichtig ist, die Ausnahme zu dokumentieren, damit sie beim nĂ€chsten Projekt nicht erneut Zeit kostet.
Wie erkenne ich, ob mein Problem die Referenz oder der Prompt ist?
Testen Sie isoliert. Nehmen Sie denselben Prompt mit einem anderen Referenzset â bleibt der Fehler, liegt es am Prompt. Nehmen Sie dasselbe Referenzset mit einem stark vereinfachten Prompt â verschwindet der Fehler, ist der Prompt zu ĂŒberladen. Diese zwei Tests klĂ€ren die Ursache in wenigen Minuten.
Wie lange sollte ein einzelner Clip sein?
FĂŒr Figurenarbeit sind drei bis fĂŒnf Sekunden ein guter Standard. LĂ€ngere Clips erhöhen das Drift-Risiko ĂŒberproportional. Wenn eine Einstellung lĂ€nger wirken soll, teilen Sie sie in zwei Clips und verbinden Sie sie ĂŒber einen Schnitt oder eine Bewegung.
Fazit: Vorbereitung schlÀgt Rechenleistung
Charakterkonsistenz im KI-Video ist weniger ein Modellproblem als ein Produktionsproblem. Wer Referenzmaterial systematisch kuratiert, IdentitĂ€t und Stil trennt, Szenen blockweise plant und Fehler frĂŒh in niedriger Auflösung sichtbar macht, bekommt Figuren, die ĂŒber zwanzig Einstellungen hinweg tragen. Wer stattdessen jeden Shot einzeln promptet und auf GlĂŒck hofft, produziert beeindruckende Einzelbilder und unbrauchbare Sequenzen.
Der praktische Einstieg ist unspektakulĂ€r: eine Figur auswĂ€hlen, acht bis zwölf Fotos kuratieren, ein Charakterblatt anlegen, fĂŒnf Testclips mit unterschiedlichen Bedingungen rendern und die Ergebnisse nach Checkliste bewerten. Diesen Ablauf einmal sauber durchlaufen â danach ist jede weitere Figur deutlich schneller, weil die Dokumentation aus dem ersten Durchgang als Vorlage dient. Konsistenz entsteht nicht im Render, sondern in der Vorbereitung davor.



