Text-zu-Video hat in den letzten Jahren einen Sprung gemacht, der sich weniger in spektakulären Einzelclips zeigt als in einer viel praktischeren Frage: Kann ich eine ganze Geschichte erzählen, ohne dass meine Hauptfigur in der fünften Szene wie eine andere Person aussieht? Genau hier setzt Multi-Image-Fusion an. Statt für jede Einstellung ein neues Glücksspiel zu starten, arbeitest du mit mehreren Referenzbildern als Ankerpunkten und hältst Gesicht, Kleidung, Licht und Bildstil über eine komplette Sequenz hinweg stabil. Dieser Leitfaden beschreibt einen reproduzierbaren Workflow – von der Szenenliste über die Figurenbibel bis zur Qualitätskontrolle vor dem Export.
Warum Text-zu-Video heute ein Regieproblem ist, kein Prompt-Problem
Die Werkzeuge sind nicht mehr der Engpass. Ein einzelner guter Prompt liefert heute in wenigen Minuten einen beeindruckenden Clip. Der Engpass liegt eine Ebene höher: in der Dramaturgie, der Kontinuität und der Auswahl. Wer zwanzig Varianten generieren kann, braucht keine zwanzig weiteren Prompts, sondern klare Kriterien, nach denen er entscheidet, welche Variante in den Schnitt kommt.
Das Publikum verzeiht erstaunlich viel – unscharfe Details, leicht unnatürliche Bewegungen, ein unruhiges Korn. Was es sofort bemerkt, sind Brüche: ein Gesicht, das zwischen zwei Einstellungen die Proportionen wechselt; eine Jacke, die von Dunkelblau zu Anthrazit kippt; ein Fensterlicht, das plötzlich von links statt von rechts kommt. Diese Brüche sind keine Modellfehler, sondern Planungsfehler. Sie entstehen, wenn eine Sequenz als Sammlung einzelner Prompts gedacht wird statt als zusammenhängende Szene mit festgelegten Konstanten.
Hinzu kommt der Formatdruck. Kurzformate auf TikTok, Instagram Reels und YouTube Shorts belohnen Serien, nicht Einzelstücke. Wer regelmäßig veröffentlicht, braucht Figuren, die wiedererkennbar sind, und Sets, die sich wiederaufbauen lassen. Multi-Image-Fusion ist damit kein technisches Detail, sondern die Grundlage für alles, was nach dem ersten Clip kommt.
Ein letzter Punkt: Text beschreibt Absichten, nicht Bilder. Zwischen „eine Frau betritt nervös ein Büro“ und dem konkreten Frame liegen Dutzende Entscheidungen – Brennweite, Höhe der Kamera, Lichtfarbe, Kleidung, Requisiten, Tempo. Genau diese Entscheidungen musst du treffen, bevor du generierst. Die Fusion hilft dir, sie festzuhalten.
Multi-Image-Fusion verständlich erklärt
Multi-Image-Fusion bedeutet, dass du nicht ein einzelnes Startbild, sondern ein Set aus mehreren Referenzbildern mitgibst. Das Modell extrahiert daraus Merkmale und kombiniert sie während der Generierung. Typischerweise lassen sich drei Arten von Ankern unterscheiden: Identitätsanker, Stilanker und Umgebungsanker.
Was Referenzbilder technisch bewirken
Identitätsanker liefern Gesichtsform, Frisur, Augenabstand, Proportionen und charakteristische Details wie Sommersprossen, Bartwuchs oder eine bestimmte Augenbrauenform. Stilanker transportieren die visuelle Sprache: Farbpalette, Kontrast, Filmkorn, Objektivcharakter, Lichtstimmung. Umgebungsanker halten Architektur, Möbel, Requisiten und Farbwelt eines Ortes zusammen.
Wichtig ist die Gewichtung. In vielen Pipelines dominiert das erste oder das prominenteste Referenzbild. Wenn du also ein perfekt ausgeleuchtetes Portrait als Erstes einfügst, wird diese Lichtsituation die ganze Szene prägen – auch wenn die Geschichte in einem dunklen Flur spielt. Ordne deine Referenzen deshalb bewusst: Identität zuerst, dann Stil, dann Umgebung. Und prüfe nach jeder Änderung zwei bis drei Testbilder, bevor du eine ganze Szene generierst.
Auch die Bildqualität der Referenzen zählt. Mischlicht, extreme Weitwinkelverzerrung, Bewegungsunschärfe oder starke Beauty-Filter machen die Anker unzuverlässig. Besser sind nüchterne, gleichmäßig ausgeleuchtete Aufnahmen mit neutraler Pose, ähnlicher Brennweite und ohne ablenkenden Hintergrund. Ein Set aus fünf bis neun Bildern pro Figur deckt die meisten Situationen ab: frontal, Dreiviertelansicht, Profil, Ganzkörper, ein Detailbild und ein bis zwei Varianten mit Requisite.
Wo die Fusion an Grenzen stößt
Kein Verfahren löst jedes Kontinuitätsproblem. Kritisch bleiben in der Praxis Hände mit vielen Fingern in Bewegung, filigraner Schmuck, Text auf Kleidung, Spiegelungen, schnelle Drehungen um 180 Grad und Szenen, in denen zwei Figuren mit ähnlicher Silhouette interagieren. Auch große Kopfbewegungen mit starkem Schattenwurf führen regelmäßig zu Identitätsdrift.
Die Gegenstrategie ist unspektakulär: Baue solche Momente seltener ein, oder löse sie über Schnitt statt über Bewegung. Ein harter Schnitt auf eine Detailaufnahme der Hände wirkt professioneller als eine halb geglückte Handbewegung. Die Fusion ist ein Anker, kein Ersatz für szenische Disziplin.
Der Workflow in sieben Schritten
Wer zum ersten Mal eine längere Sequenz baut, unterschätzt meist den organisatorischen Teil. Die folgende Reihenfolge hat sich bewährt, weil sie Fehler früh sichtbar macht – bevor Zeit in Details fließt.
1. Story-Kern und Szenenliste festlegen
Beginne mit einem Satz, der beschreibt, was in dreißig Sekunden passiert. Danach zerlegst du ihn in sechs bis zwölf Einstellungen. Für jede Einstellung notierst du: Ziel der Einstellung, Ort, beteiligte Figur, sichtbare Handlung, Emotion und den Übergang zur nächsten Einstellung.
Eine einfache Tabelle reicht: ID, geplante Dauer, Beschreibung, benötigte Referenzen, Prompt-Status, Bewertung. Diese Tabelle ist dein Steuerinstrument. Ohne sie generierst du hübsche Clips, die sich nicht zu einer Geschichte fügen.
2. Figurenbibel und Referenzset aufbauen
Die Figurenbibel ist ein kurzes Dokument mit den Konstanten deiner Figur: Alter, Körperbau, Frisur, Haarfarbe, Augenfarbe, Hautton, Kleidung inklusive Farbwerten, Accessoires, typische Körperhaltung. Schreibe Farben als Hex-Codes oder eindeutige Bezeichnungen – „dunkelblau“ produziert sonst in jeder Einstellung einen anderen Ton.
Ordne jedem Eintrag passende Referenzbilder zu. Sortiere sie nach Gewichtung und benenne sie nach einem festen Schema, zum Beispiel figur-a_01_frontal.png. Das klingt pedantisch, spart aber in der Iteration mehr Zeit als jede Prompt-Optimierung.
3. Prompt-Rezept pro Szene schreiben
Schreibe einen Prompt pro Einstellung, nicht pro Szene. Ein Prompt sollte acht Bausteine enthalten: Figur, Handlung, Umgebung, Kameraposition, Bewegung, Licht, Stil und eine kurze Negativliste. Halte die Reihenfolge über die gesamte Sequenz konstant – Modelle reagieren empfindlich auf umsortierte Beschreibungen.
Verwende für wiederkehrende Elemente immer identische Formulierungen. Wenn die Figur in Einstellung zwei „eine dunkelblaue Wolljacke mit Metallreißverschluss“ trägt, dann heißt sie in Einstellung sieben genauso. Synonyme sind hier Gift.
4. Generieren, bewerten, iterieren
Plane drei bis vier Varianten pro Einstellung ein. Bewerte jede Variante nach vier Kriterien auf einer Skala von eins bis fünf: Identitätstreue, Bewegungsplausibilität, Lichtkonsistenz, Artefakte. Alles unter drei fliegt raus, ohne Diskussion.
Ein wichtiger Grundsatz: Erst alle Einstellungen auf „brauchbar“ bringen, dann feinschleifen. Wer die erste Einstellung zehnmal perfektioniert, bevor die letzte überhaupt existiert, verliert die Konsistenz über die Sequenz – weil sich Referenzen und Prompts zwischendurch verändert haben.
5. Übergänge und Schnittrhythmus planen
Übergänge sind der Ort, an dem KI-Material am professionellsten wirkt. Vier Muster haben sich etabliert: der harte Schnitt auf eine Detailaufnahme, der Bewegungsübergang (eine Handbewegung endet dort, wo die nächste beginnt), der Lichtwechsel als Szenentrenner und der Match Cut über eine ähnliche Form oder Farbe.
Halte die durchschnittliche Einstellungsdauer zwischen zwei und vier Sekunden und variiere bewusst. Gleichmäßige Schnittlängen wirken mechanisch, zu kurze Schnitte lassen das Publikum die Artefakte sehen.
6. Ton, Musik und Untertitel
Ton entscheidet mehr über die wahrgenommene Qualität als die Bildauflösung. Lege zuerst die Tonspur an – Sprachaufnahme oder Musik – und schneide die Bilder darauf. Schnitte auf den Takt oder auf Atempausen wirken sofort teurer.
Bei Untertiteln gilt: maximal zwei Zeilen, rund 42 Zeichen pro Zeile, ausreichend Abstand zu den Rändern, weil Plattform-Interfaces unten und rechts Elemente überlagern. Untertitel sollten nie den Bildfokus verdecken, den deine Einstellung aufbaut.
7. Qualitätskontrolle vor dem Export
Gehe die Sequenz einmal komplett in Echtzeit durch, ohne anzuhalten. Achte auf Gesichter, Hände, Lichtrichtung, Farbtemperatur, eingebrannten Text, Lautheit und Safe Zones. Erst danach exportierst du in den Zielformaten, meist 9:16 für Kurzformate, 16:9 für Landingpages und 1:1 als Reserve für Feeds.
Prompt-Bausteine für konsistente Szenen
Die folgende Übersicht zeigt, welche Bausteine wirklich über Kontinuität entscheiden und welche du getrost variieren kannst.
| Baustein | Beispiel | Wirkung auf Konsistenz |
|---|---|---|
| Figur | „Figur A, 34, dunkelblonde Kurzhaarfrisur, dunkelblaue Wolljacke“ | sehr hoch |
| Handlung | „hebt langsam eine gefaltete Karte auf“ | mittel |
| Umgebung | „altes Treppenhaus, grünliche Wandfliesen, Neonlicht“ | hoch |
| Kamera | „Halbnahaufnahme, 50 mm, Augenhöhe, statisch“ | hoch |
| Bewegung | „langsame Vorwärtsbewegung, ruhig“ | mittel |
| Licht | „warmes Seitenlicht von links, weicher Schattenwurf“ | sehr hoch |
| Stil | „analoger Look, leichtes Korn, entsättigte Palette“ | hoch |
| Negativliste | „keine Texte, keine zusätzlichen Personen, keine Handverzerrungen“ | mittel |
Für Variation sorgst du über Handlung und Bewegung. Alles andere bleibt konstant wie eine Kamera- und Lichtabteilung, die sich an ihren eigenen Plan hält.
Text-zu-Video, Bild-zu-Video oder Hybrid: Entscheidungskriterien
Nicht jede Einstellung sollte auf demselben Weg entstehen. Die folgende Zuordnung spart Iterationen.
| Szenentyp | Empfohlener Weg | Begründung |
|---|---|---|
| Establishing Shot einer Umgebung | Text zu Video mit Umgebungsanker | Stimmung wichtiger als Identität |
| Nahaufnahme eines Gesichts | Bild zu Video mit Identitätsanker | maximale Kontrolle über Merkmale |
| Dialog zweier Figuren | Hybrid, separat generieren und im Schnitt verbinden | Fusion wird bei zwei Figuren instabil |
| Detailaufnahme von Händen oder Objekten | Bild zu Video, ruhige Bewegung | geringe Fehlerquote |
| Schnelle Kamerafahrt | Text zu Video mit starkem Stilanker | Dynamik ohne Identitätslast |
| Wiederkehrende Figur in neuem Raum | Hybrid: Figur per Referenz, Raum per Text | trennt Identität von Umgebung |
Die Faustregel lautet: Je mehr Identität im Bild sichtbar ist, desto stärker solltest du mit Referenzbildern arbeiten. Je stärker die Bewegung und desto geringer die Identitätslast, desto eher ist reiner Text-Input effizienter.
Licht, Kamera und Bewegung als Stellschrauben
Drei technische Parameter bestimmen, ob eine Sequenz zusammenhängend wirkt.
Licht: Lege für jede Szene eine Lichtrichtung und eine Farbtemperatur fest und ändere sie nur, wenn ein Szenenwechsel es verlangt. Warmes Seitenlicht von links als Grundstimmung, kaltes Gegenlicht für Konflikte – dieses einfache Schema reicht für die meisten Geschichten. Wichtig ist, dass deine Referenzbilder diese Lichtstimmung widerspiegeln, sonst kämpfen Anker und Prompt gegeneinander.
Kamera: Definiere pro Figur eine Standardbrennweite. 35 mm wirkt nah und dynamisch, 50 mm neutral, 85 mm distanziert und portraithaft. Wenn du innerhalb einer Szene nicht die Brennweite wechselst, bleibt die Körperproportion stabil – und genau die ist eine der häufigsten Quellen für ungewollten Identitätswechsel.
Bewegung: Weniger ist mehr. Langsame Vorwärtsbewegungen, sanfte Schwenks und ruhige Handbewegungen liefern verlässlich gute Ergebnisse. Schnelle Drehungen, Sprünge und Kamerafahrten quer durch Räume sind reizvoll, aber teuer in der Nacharbeit. Nutze sie als Höhepunkt, nicht als Grundton.
Ergänzend hilft ein „Bewegungswörterbuch“ für dein Projekt: fünf bis acht Formulierungen, die du immer wieder verwendest, jeweils mit einer Referenzaufnahme, die zeigt, was du darunter verstehst. Damit wird aus vager Regie ein reproduzierbares Rezept.
Typische Fehler und Gegenmittel
- Zu viele Referenzbilder mit unterschiedlichem Licht. Das Modell mittelt und produziert Identitätsdrift. Gegenmittel: Referenzset auf eine Lichtsituation reduzieren.
- Synonyme in Prompts. „Mantel“ und „Jacke“ führen zu Kleidungswechseln. Gegenmittel: Glossar mit festen Begriffen anlegen.
- Szenen zu lang planen. Acht Sekunden am Stück erhöhen die Fehlerquote deutlich. Gegenmittel: in zwei Einstellungen aufteilen.
- Kein Bewertungssystem. Man behält die Variante, die zuletzt generiert wurde. Gegenmittel: feste vier Kriterien mit Punktzahl.
- Perfektion vor Vollständigkeit. Gegenmittel: erster Durchlauf im Entwurfsmodus für alle Einstellungen.
- Ton zu spät. Bilder werden auf eine Musik geschnitten, die es noch nicht gibt. Gegenmittel: Tonspur zuerst.
- Untertitel im Blindflug. Text liegt über Gesichtern oder hinter Plattform-Buttons. Gegenmittel: Safe-Zone-Vorlagen je Format.
- Keine Versionierung. Nach dreißig Änderungen ist die gute Variante nicht mehr auffindbar. Gegenmittel: Namensschema mit Einstellungs-ID, Versionsnummer und Kriterien-Score.
- Referenzbilder ohne Rechteklärung. Gegenmittel: eigene Aufnahmen oder lizenzierte Quellen, schriftlich dokumentiert.
- Erwartung, dass Fusion alles löst. Gegenmittel: Schnitt und Szenendisziplin als Teil der Planung akzeptieren.
Zeit, Iterationen und Erwartungsmanagement
Eine realistische Kalkulation für eine dreißigsekündige Sequenz mit acht Einstellungen: acht Einstellungen mal vier Varianten ergibt zweiunddreißig Generierungen. Dazu kommen Einrichtung des Referenzsets, Auswahl, Nachgenerierung der schwächsten drei Einstellungen, Schnitt, Ton und Untertitel. Plane für den ersten Durchlauf einen halben Arbeitstag ein, für spätere Projekte mit vorhandenem Figurenset deutlich weniger.
Die größten Zeitgewinne entstehen nicht durch bessere Prompts, sondern durch Wiederverwendung. Ein stabiles Referenzset, ein Prompt-Glossar und ein Bewegungswörterbuch machen aus jedem neuen Video eine Variation statt eines Neustarts. Lege deshalb eine Projektstruktur an: referenzen/, prompts/, generierungen/, schnitt/, export/. Versioniere nach dem Schema s03_v02_score-4.mp4 und dokumentiere in der Szenenliste, welche Version warum gewählt wurde.
Rechtlich solltest du drei Punkte früh klären: Rechte an allen Referenzbildern, den Umgang mit Gesichtern realer Personen (Einwilligung, keine Nachahmung identifizierbarer Menschen ohne Grundlage) und die Lizenz jeder verwendeten Musik. Diese Punkte kosten zehn Minuten vorab und sehr viel mehr, wenn sie später auffallen.
FAQ
Wie viele Referenzbilder sind ideal?
Für eine Hauptfigur haben sich fünf bis neun Bilder bewährt. Weniger führt zu unsicherer Identität, mehr zu widersprüchlichen Signalen, besonders wenn Licht und Perspektive stark variieren.
Reicht reiner Text-Input für eine ganze Geschichte?
Für atmosphärische Sequenzen ohne wiederkehrende Gesichter ja. Sobald dieselbe Figur mehrfach nah zu sehen ist, brauchst du Referenzanker, sonst bricht die Kontinuität spätestens in der dritten Einstellung.
Warum verändert sich die Kleidung zwischen Einstellungen?
Meist wegen uneinheitlicher Begriffe im Prompt oder weil das Referenzset unterschiedliche Outfits zeigt. Vereinheitliche die Formulierung und reduziere das Set auf eine Kleidungssituation.
Was tun bei unruhigen Händen?
Hände seltener in Großaufnahme zeigen, ruhige Bewegungen verwenden und Details über Schnitt auflösen. Wo Hände zentral sind, hilft eine separate, langsamere Einstellung mit reduzierter Bewegung.
Wie lang sollte eine einzelne KI-Einstellung sein?
Zwei bis vier Sekunden sind der sichere Korridor. Alles darüber erhöht die Wahrscheinlichkeit von Identitätsdrift und unlogischen Bewegungen.
Wie halte ich einen Wiedererkennungswert über mehrere Videos?
Indem du Figurenbibel, Referenzset, Glossar und Bewegungswörterbuch als Projekt-Assets pflegst und für jedes neue Video nur Handlung und Umgebung austauschst.
Lohnt sich ein Storyboard aus echten Fotos?
Ja, besonders bei wiederkehrenden Orten. Selbst grobe Handyfotos als Umgebungsanker reduzieren die Streuung deutlich, weil sie Perspektive und Lichtverhältnisse vorgeben.
Fazit: Dein nächster Testlauf
Der schnellste Weg zu verstehen, wie Multi-Image-Fusion für dich arbeitet, ist ein kontrollierter Test. Wähle eine Figur, erstelle fünf Referenzbilder mit einheitlichem Licht, schreibe eine Szenenliste mit sechs Einstellungen und generiere jede Einstellung dreimal. Bewerte mit den vier Kriterien, schneide die besten Varianten auf eine Tonspur und exportiere in 9:16.
Nach diesem Durchlauf kennst du deine kritischen Stellen – meist sind es Hände, Lichtwechsel und die erste Nahaufnahme. Genau dort investierst du künftig deine Zeit. Text-zu-Video mit Multi-Image-Fusion ist kein Werkzeug, das man einmal ausprobiert, sondern eine Arbeitsweise: Konstanten definieren, Variationen kontrolliert zulassen, konsequent bewerten. Wer das beherrscht, produziert nicht einzelne Clips, sondern Geschichten, die man wiedererkennt.



