Wer heute mit generativen Videomodellen arbeitet, stellt schnell fest, dass die größten Qualitätsunterschiede nicht vom Modell kommen, sondern von der Planung davor. Ein bildstarkes Modell kann eine mittelmäßige Idee in ein mittelmäßiges Video verwandeln – mit perfekter Hauttextur und weichem Licht. Umgekehrt entstehen aus einer präzise geplanten Einstellung selbst mit einfachen Werkzeugen Sequenzen, die man ernst nimmt. Genau hier setzt die Idee eines KI-Regieassistenten an: ein Werkzeug oder eine Kombination aus Werkzeugen, die Komposition, Framing und Schnittfolge mitdenken, statt nur Pixel zu erzeugen.
Dieser Leitfaden zeigt, wie man KI als Regieassistenz nutzt, ohne sich von ihr die Bildsprache diktieren zu lassen. Es geht um Kompositionsregeln, die auch für generierte Bilder gelten, um Shot-Design für kurze Clips, um konkrete Prompt-Bausteine und um einen Workflow, der von der Idee bis zum fertigen Schnitt funktioniert. Wer bereits mit Text-zu-Video, Bild-zu-Video oder Keyframe-Interpolation arbeitet, findet hier vor allem die Schrauben, an denen sich wirklich drehen lässt.
Warum Bildkomposition und Shot-Design über die Wirkung entscheiden
Zuschauer lesen Bilder, bevor sie Dialoge verstehen. In den ersten Sekunden entscheidet sich, wo der Blick landet, welche Figur sympathisch wirkt, wie viel Raum eine Landschaft bekommt und ob ein Schnitt als flüssig oder als Sprung empfunden wird. Diese Wirkung entsteht nicht durch Auflösung oder Farbtiefe, sondern durch Anordnung: Wo steht die Figur im Bild? Wie viel Luft über dem Kopf? Welche Linien führen wohin? Welche Fläche bleibt leer?
Bei generierten Videos kommt ein zweiter Effekt hinzu. Modelle lernen aus Filmmaterial und übernehmen dabei tausend implizite Konventionen: Weitwinkel für Establishing Shots, Aufsicht für Verletzlichkeit, Untersicht für Macht, langsame Fahrt für Bedeutung. Wer diese Konventionen kennt, kann sie gezielt auslösen – oder bewusst brechen. Wer sie ignoriert, bekommt Bilder, die technisch einwandfrei und emotional beliebig sind.
Shot-Design ist die zweite Hälfte der Gleichung. Ein einzelnes schönes Bild ergibt noch keine Szene. Erst die Abfolge von Einstellungsgrößen, Winkeln und Bewegungen erzeugt Rhythmus und Bedeutung. Eine Szene, die mit einer Totalen beginnt, zur Halbtotalen wechselt und in der Nahaufnahme endet, fühlt sich an wie ein ruhiges Näherkommen. Umgekehrt wirkt der Sprung von der Detailaufnahme zur Totale wie ein Schock – manchmal gewollt, oft versehentlich.
Der wirtschaftliche Aspekt ist ebenso relevant. Jede Einstellung kostet Zeit: Prompt schreiben, generieren, aussortieren, neu generieren. Wenn Komposition und Reihenfolge vorher feststehen, sinkt die Zahl der Versuche pro brauchbarer Einstellung deutlich. Planung ist bei KI-Video kein Luxus, sondern die günstigste Form der Qualitätskontrolle.
Was ein KI-Regieassistent leisten kann – und was nicht
Ein KI-Regieassistent ist kein Regisseur. Er ersetzt weder Intention noch Geschmack. Er kann aber eine Reihe mühsamer Zwischenschritte abnehmen, die sonst viel Zeit fressen.
Realistische Aufgaben
- Shot-Listen erzeugen und erweitern: Aus einer Szenenbeschreibung entsteht ein Vorschlag für Einstellungen, Größen, Winkel und Bewegungen. Nützlich, um Lücken in der Coverage zu finden.
- Komposition analysieren: Bestehende Standbilder oder Keyframes lassen sich beschreiben und bewerten – Blickführung, Balance, Kontrast, Headroom, dominante Linien.
- Referenzen finden und beschreiben: Ein Werkzeug kann aus einer Stimmung eine Sammlung visueller Merkmale ableiten: Lichtrichtung, Farbtemperatur, Textur, Linsenwirkung.
- Konsistenz prüfen: Bei Figuren, Kostümen und Schauplätzen hilft eine textliche Beschreibung, die bei jeder Einstellung wiederholt wird.
- Prompts strukturieren: Aus einer vagen Idee wird ein Prompt mit Brennweite, Kamerawinkel, Licht und Bewegung.
- Schnittfolgen vorschlagen: Reihenfolge, Dauer und Übergänge für einen Rohschnitt.
Klare Grenzen
- Keine Intention: Ein Assistent weiß nicht, was die Szene bedeuten soll. Er kennt Muster, nicht Absicht.
- Kein Gefühl für Rhythmus: Timing entsteht am Schnittplatz, nicht im Textfeld.
- Modellgrenzen bleiben: Viele Videomodelle können keine langen Verläufe, keine exakten Handbewegungen und keinen verlässlichen Text im Bild.
- Halluzinierte Details: Beschreibungen klingen oft präziser, als sie sind. Zahlen, Normen und Technikangaben sollte man prüfen.
- Trend-Bias: Ohne klare Vorgabe landet man bei dem Look, der im Trainingsmaterial am häufigsten vorkommt.
Die praktische Konsequenz: Man nutzt die Assistenz für Struktur und Varianten, entscheidet aber selbst über Blickwinkel und Bedeutung.
Die kompositorischen Grundlagen, die jede KI verstehen muss
Bevor man Prompts schreibt, lohnt es sich, die wenigen Regeln zu beherrschen, die in fast jedem Bild funktionieren. Sie sind auch die Regeln, die generative Modelle aus ihrem Trainingsmaterial gelernt haben.
Drittelregel, goldener Schnitt und bewusste Brüche
Die Drittelregel ist der einfachste Einstieg: Das Bild wird in neun Felder geteilt, wichtige Elemente liegen auf den Linien oder Schnittpunkten. Ein Horizont auf einem Drittel wirkt meist ruhiger als in der Mitte. Augen auf der oberen Drittellinie geben einem Porträt Spannung.
Der goldene Schnitt ist eine Variante mit ähnlicher Wirkung, aber anderem Verhältnis. Wichtiger als die exakte Mathematik ist die Erkenntnis dahinter: Asymmetrie wirkt lebendig, perfekte Zentrierung wirkt formal. Beides ist richtig, je nach Absicht. Zentrierte Kompositionen eignen sich für Macht, Ordnung, Stillstand oder Drohnenaufnahmen; dezentrierte für Bewegung und Alltag.
Für KI-Prompts heißt das: Wenn man keine Angabe macht, zentrieren viele Modelle das Motiv. Wer eine Drittelplatzierung will, sollte sie explizit beschreiben – etwa „Motiv links im Bild, offener Raum rechts“.
Vordergrund, Mittelgrund, Hintergrund
Tiefe ist das Merkmal, das generierte Bilder am häufigsten vermissen lassen. Ein Motiv vor einer Wand wirkt flach. Ein Motiv hinter einem unscharfen Türrahmen, mit einem erkennbaren Hintergrund dahinter, wirkt räumlich – selbst wenn nur wenige Bildebenen sichtbar sind.
Praktisch bedeutet das: In vielen Einstellungen sollte man drei Ebenen ansprechen. Ein Vordergrundelement (Pflanze, Geländer, Schulter einer Person), das Hauptmotiv im Mittelgrund, einen Hintergrund, der Ort und Zeit erzählt. In Prompts lässt sich das mit „Vordergrund unscharf, Motiv scharf, Hintergrund erkennbar“ beschreiben.
Blickführung, Negativraum und Balance
Blickführung entsteht durch Linien, Kontraste und Helligkeit. Ein helles Gesicht in einer dunklen Szene zieht den Blick automatisch. Führende Linien – Straßen, Flure, Zäune, Lichtkanten – transportieren den Blick durchs Bild.
Negativraum ist kein verschenkter Platz. Leere Flächen geben Figuren Luft, schaffen Einsamkeit oder Coolness und bieten Platz für spätere Texteinblendungen. Wer Videos für Social Media produziert, sollte bewusst Raum für Untertitel und Logo einplanen, statt Motive bis an den Rand zu füllen.
Balance schließlich ist die Verteilung visuellen Gewichts. Ein großes dunkles Objekt links wiegt mehr als ein kleines helles rechts. Wenn ein Bild kippt, liegt es meist an dieser Verteilung – und nicht an falscher Farbe.
Shot-Design: Von der Einstellungsgröße zur Sequenz
Shot-Design ist die Übersetzung einer Szene in eine Folge von Bildern. Es beantwortet zwei Fragen: Was sieht das Publikum – und wann?
Einstellungsgrößen und ihre Funktion
- Weite / Totale: Ort, Kontext, Größenverhältnisse. Ideal als Einstieg in einen Schauplatz.
- Halbtotale: Figur plus Umgebung. Standardgröße für Handlung.
- Amerikanisch / Halbnah: Figur etwa bis Oberschenkel. Klassisch für Dialoge und Western.
- Nahaufnahme: Gesicht dominiert. Emotion und Entscheidung.
- Großaufnahme: Detail eines Gesichts, oft Augen oder Mund. Intensität.
- Detail: Objekt, Hand, Requisite. Information oder Symbol.
Eine klassische Annäherung innerhalb einer Szene geht von weit nach nah. Eine klassische Distanzierung geht von nah nach weit und wirkt oft wie ein Fazit oder ein Rückzug. Wenn man in generierten Szenen zwischen Größen springt, sollte jeder Sprung eine Begründung haben – sonst wirkt es wie ein Versehen.
Kamerawinkel, Achse und Anschluss
Der Winkel verändert Bedeutung, bevor ein Wort fällt. Auf Augenhöhe wirkt neutral. Leichte Untersicht macht mächtig, leichte Aufsicht macht verletzlich. Ein gekippter Winkel signalisiert Unsicherheit und sollte sparsam eingesetzt werden, weil er schnell nach Effekt aussieht.
Für den Anschluss gilt die 180-Grad-Regel: Figuren behalten ihre Bildseite, solange die Kamera auf einer Seite der gedachten Achse bleibt. Wechselt sie die Seite, wirkt es, als hätten die Figuren die Position getauscht. In KI-Clips, die einzeln generiert und später geschnitten werden, ist das der häufigste unbemerkte Fehler. Es hilft, in der Shot-Liste für jede Einstellung zu notieren, wo die Figur steht und in welche Richtung sie blickt.
Bewegung: Schwenk, Fahrt, Handkamera
Bewegung im Bild hat zwei Ebenen: die Bewegung des Motivs und die Bewegung der Kamera. Beide gleichzeitig zu beschreiben, überfordert viele Modelle. Ein guter Ausgangspunkt ist eine einzige klare Kamerabewegung pro Clip: langsamer Schwenk nach rechts, gleichmäßige Vorwärtsfahrt, leichte Handkamera mit ruhigem Motiv.
Große Bewegungen wie Kreisfahrten um ein Objekt oder komplexe Dolly-Zooms funktionieren in kurzen Clips nur, wenn die Beschreibung reduziert wird. Weniger Bewegung, sauber ausgeführt, sieht teurer aus als viel Bewegung, die verschwimmt.
Der Workflow: Von der Idee zum fertigen Shot
Ein KI-gestützter Video-Workflow unterscheidet sich in einem Punkt von klassischen Dreharbeiten: Man iteriert nicht am Set, sondern im Browser. Das verändert die Reihenfolge der Arbeit.
Schritt 1: Briefing in einem Satz
Formuliere in einem Satz, was die Szene leisten soll: „Zeigen, dass die Figur allein ist, obwohl sie in einer vollen Stadt steht.“ Diese Absicht ist der Maßstab für jede spätere Entscheidung. Ohne sie wird jede Einstellung beliebig.
Schritt 2: Lookbook als Text
Lege Licht, Farbpalette, Textur und Linsenwirkung fest. Nicht als Stimmungsbilder, sondern als beschreibbare Merkmale: weiches Gegenlicht am späten Nachmittag, warme Hauttöne, kühle Schatten, leichte Körnung, 50mm, geringe Tiefenschärfe. Diese Beschreibung wird später in jeden Prompt kopiert.
Schritt 3: Shot-Liste mit Coverage
Plane mindestens drei Einstellungen pro Szene: eine weite, eine mittlere, eine nahe. Ergänze eine Detailaufnahme als Reserve. Diese vier Einstellungen decken fast jede Schnittentscheidung ab und erlauben es, später Tempo zu variieren.
Schritt 4: Keyframes vor dem Video
Der zuverlässigste Weg zu kontrollierter Komposition führt über das Standbild. Erst ein Bild generieren und aktiv umstellen – Motiv verschieben, Licht ändern, Hintergrund ergänzen –, dann das Bild animieren. Wer direkt aus Text generiert, verliert die Kontrolle über Rahmung und Bildaufbau.
Schritt 5: Konsistenz sichern
Für jede Figur und jeden Schauplatz gehört ein kurzer, wiederholbarer Beschreibungsblock in den Prompt: Alter, Kleidung, Frisur, Accessoires, Ort, Tageszeit. Zusätzlich helfen feste Startbilder oder Referenzbilder. Kleine Abweichungen in Nebenmerkmalen fallen weniger auf als Abweichungen in Gesichtsform oder Kleidungsfarbe.
Schritt 6: Generieren und radikal aussortieren
Rechne mit mehr Ausschuss als Treffern. Sortiere in drei Kategorien: verwendbar, fast verwendbar (ein Detail stört), unbrauchbar. Nur Kategorien eins und zwei werden weiterbearbeitet. Wer versucht, unbrauchbare Clips zu retten, verliert die Zeit, die für neue Versuche fehlt.
Schritt 7: Licht und Farbe vereinheitlichen
Generierte Clips aus verschiedenen Durchläufen haben unterschiedliche Farbsättigung, Kontrast und Weißabgleich. Ein Grading-Durchgang im Schnittprogramm schafft den Look, der aus Einzelclips eine Szene macht. Feste Regler für Schwarzwert, Weißabgleich und Hauttonkontrolle sind hier hilfreicher als kreative Presets.
Schritt 8: Schnitt und Ton
Der Schnitt entscheidet über Rhythmus. Beginne mit groben Schnitten und passe die Länge erst dann an die Musik an. Ton ist kein Anhang: Ein Raumhall oder ein leises Umgebungsgeräusch verankert ein generiertes Bild in der Realität und kaschiert kleine Ungenauigkeiten.
Prompt-Bausteine für Kamera, Licht und Framing
Prompts funktionieren am besten, wenn sie in klaren Blöcken aufgebaut sind. Generische Wörter wie „cinematic“ oder „epic“ tragen wenig Information. Konkrete Angaben wirken zuverlässiger.
| Baustein | Beispiel | Wirkung |
|---|---|---|
| Einstellungsgröße | „weite Totale“, „Nahaufnahme“, „Detailaufnahme der Hände“ | legt fest, was das Publikum sieht |
| Brennweite | „35mm“, „85mm“, „Teleobjektiv-Kompression“ | bestimmt Perspektive und Raumwirkung |
| Winkel | „auf Augenhöhe“, „leichte Aufsicht“ | steuert Machtverhältnis |
| Platzierung | „Motiv links im Bild, Blick nach rechts“ | erzeugt Negativraum und Blickführung |
| Tiefe | „unscharfer Vordergrund, scharfes Motiv, erkennbarer Hintergrund“ | schafft Räumlichkeit |
| Licht | „Gegenlicht zur goldenen Stunde, weiche Aufhellung von links“ | definiert Stimmung und Volumen |
| Bewegung | „langsame Vorwärtsfahrt“, „ruhige Handkamera“ | kontrolliert Dynamik |
| Atmosphäre | „leichter Dunst, Staub in der Luft“ | verbessert Tiefenwirkung |
| Negativ | „kein Text, keine Verzerrung, keine zusätzlichen Personen“ | reduziert typische Artefakte |
Ein vollständiger Beispielprompt für eine Einstellung könnte so aussehen: „Halbtotale, 35mm, auf Augenhöhe, Figur im linken Drittel mit Blick nach rechts in den offenen Raum, unscharfer Türrahmen im Vordergrund, Gasse mit Laternen im Hintergrund, warmes Gegenlicht am Abend, leichte Körnung, langsame Vorwärtsfahrt, keine Texteinblendungen.“
Wichtig: Prompt-Länge ist kein Qualitätsmerkmal. Zu viele Angaben erzeugen Widersprüche und lassen das Modell einzelne Teile ignorieren. Sechs bis acht präzise Blöcke sind meist wirksamer als zwanzig vage Adjektive.
Tool-Auswahl: Welches Werkzeug für welchen Schritt
Es gibt nicht das eine Werkzeug für alles. Sinnvoll ist eine Aufteilung nach Aufgaben.
Idee und Struktur: Textassistenten eignen sich, um Szenen zu zerlegen, Shot-Listen zu erweitern, Alternativen zu formulieren und Dialoge zu straffen. Sie ersetzen keinen Drehbuchautor, beschleunigen aber die Variantenbildung deutlich.
Storyboard und Keyframes: Bildgeneratoren liefern die visuelle Basis. Hier lohnt sich ein fester Referenzbild-Workflow, damit Figuren über mehrere Einstellungen ähnlich bleiben.
Bewegung: Videomodelle unterscheiden sich stark darin, wie gut sie Kameraanweisungen befolgen. Für ruhige, kontrollierte Fahrten sind Modelle mit starker Keyframe-Steuerung im Vorteil. Für schnelle, energiegeladene Aufnahmen eignen sich andere.
Bildqualität: Ein separates Upscaling-Werkzeug ist fast immer günstiger als ein weiterer Generierungsdurchlauf und liefert stabilere Ergebnisse für Nahaufnahmen.
Schnitt und Grading: Klassische Schnittprogramme bleiben die beste Wahl. Sie bieten Farbkorrektur, Tonwerkzeuge und Exportprofile, die generative Oberflächen selten erreichen.
Entscheidungskriterien für die Modellwahl:
- Wie gut bleibt eine Figur über mehrere Clips hinweg erkennbar?
- Wie präzise lassen sich Kamerabewegungen steuern?
- Welche maximale Cliplänge ist realistisch brauchbar?
- Wie stark flackern Texturen wie Haut, Stoff oder Wasser?
- Passt das Seitenverhältnis zur Ausspielplattform?
Typische Fehler und wie man sie vermeidet
Zu viele Bewegungen pro Clip. Zwei Bewegungen gleichzeitig führen meist zu einem zerfließenden Bild. Löse: eine Bewegung pro Einstellung.
Keine Achse definiert. Figuren wechseln die Bildseite und Zuschauer verlieren die Orientierung. Löse: Bildrichtung in der Shot-Liste festhalten.
Sprünge in der Einstellungsgröße ohne Grund. Von der Detailaufnahme zur Totalen ohne Übergang wirkt wie ein Fehler. Löse: Größen progressiv steigern oder senken.
Inkonsistente Figuren. Gesicht, Kleidung oder Alter verändern sich zwischen Clips. Löse: kurzer, wiederholter Beschreibungsblock plus festes Startbild.
Motive ohne Luft. Das Bild ist bis zum Rand gefüllt, Untertitel und Logo haben keinen Platz. Löse: Negativraum einplanen.
Generische Stimmungsadjektive. „Cinematic“ bedeutet für jedes Modell etwas anderes. Löse: konkrete Licht-, Linsen- und Farbangaben verwenden.
Fehlender Ton. Bilder wirken flach ohne Klang. Löse: Umgebungsgeräusche, Raumhall und Musik früh einsetzen.
Zu wenig Coverage. Ohne Reserveeinstellungen ist jede Schnittänderung ein neuer Generierungsdurchlauf. Löse: pro Szene mindestens eine zusätzliche Totale und ein Detail generieren.
Kein Grading-Durchgang. Clips aus verschiedenen Durchläufen wirken zusammengesetzt. Löse: einheitlicher Farbdurchgang mit festen Werten.
Modellfehler ignorieren. Verzerrte Hände, doppelte Gliedmaßen oder wandernde Hintergründe sind bei kurzen Clips oft unauffällig, in Zeitlupe aber sichtbar. Löse: kritische Clips in halber Geschwindigkeit prüfen.
Praxisbeispiel und Checkliste
Angenommen, eine kurze Szene soll zeigen, wie eine Person morgens eine leere Straße entlanggeht und innehält.
Die Absicht lautet: „Übergang von Anonymität zu einem Moment der Entscheidung.“ Der Look ist kühl, morgendlich, mit weichem Nebellicht und geringer Tiefenschärfe.
Die Shot-Liste umfasst fünf Einstellungen:
- Weite Totale: Straße von hinten, Figur klein im linken Drittel, Nebel im Hintergrund.
- Halbtotale von vorn: Figur auf Augenhöhe, leicht dezentriert, Blick nach links aus dem Bild.
- Detail: Füße auf nassem Asphalt, unscharfer Vordergrund.
- Nahaufnahme: Gesicht, Blick zur Seite, Atem sichtbar in der Kälte.
- Reserve: leere Straße nach dem Weitergehen, gleiche Komposition wie Einstellung eins.
Die Schnittfolge wechselt von der Weite über die Halbtotale zum Detail und zurück zur Nahaufnahme – eine Annäherung mit einem kurzen Umweg über die Requisite. Die Reserve-Einstellung erlaubt es, den Schluss zu verlängern oder zu kürzen, ohne neu zu generieren.
Checkliste vor dem Rendern:
- Absicht der Szene in einem Satz formuliert
- Look in Worten festgehalten (Licht, Linse, Farbe, Textur)
- Shot-Liste mit Größen, Winkeln und Bildrichtungen
- Konsistenzblock für Figur und Schauplatz vorbereitet
- Negativraum für Untertitel und Logo eingeplant
- Pro Einstellung nur eine Kamerabewegung
- Reserveeinstellungen vorhanden
- Farbdurchgang geplant
- Tonkonzept vorbereitet
- Kritische Clips in Zeitlupe geprüft
FAQ
Kann ein KI-Regieassistent Komposition wirklich bewerten?
Er kann beschreiben und vergleichen, was auf einem Bild zu sehen ist: Verteilung, Kontrast, Blickführung, Headroom. Das ist nützlich als zweite Meinung, aber subjektive Wirkung bleibt eine menschliche Entscheidung.
Brauche ich filmtheoretisches Wissen, um gute KI-Videos zu machen?
Grundkenntnisse über Einstellungsgrößen, Achse und Licht sparen enorm viel Zeit. Man kann sich die Regeln in wenigen Stunden aneignen – es reichen Drittelregel, Bildrichtung, drei Bildebenen und ein Gefühl für Einstellungsgrößen.
Warum sehen meine generierten Clips trotz guter Prompts flach aus?
Meist fehlt Tiefe. Beschreibe einen unscharfen Vordergrund und einen erkennbaren Hintergrund. Zusätzlich hilft Atmosphäre wie Dunst, Staub oder Lichtnebel.
Wie viele Einstellungen brauche ich für eine 30-Sekunden-Szene?
Je nach Tempo acht bis fünfzehn. Ruhige Szenen kommen mit weniger aus, actionreiche brauchen mehr. Plane lieber zwei Reserveeinstellungen zusätzlich ein.
Funktionieren deutsche Prompts genauso gut wie englische?
Viele Modelle sind auf englischsprachige Beschreibungen trainiert. Deutsch funktioniert oft, englische Fachbegriffe für Kamera und Licht liefern aber häufig stabilere Ergebnisse. Ein bewusster Mix ist praktikabel.
Wie verhindere ich, dass Figuren zwischen Clips ihr Aussehen ändern?
Wiederhole denselben Beschreibungsblock in jeder Einstellung und nutze ein festes Startbild als Referenz. Vermeide gleichzeitig zu viele Details, weil jedes zusätzliche Merkmal eine neue Fehlerquelle ist.
Wann lohnt sich Keyframe-Interpolation statt Text-zu-Video?
Immer, wenn Komposition entscheidend ist. Mit Keyframes bestimmt man Rahmung und Bildaufbau selbst und überlässt dem Modell nur die Bewegung dazwischen.
Wie gehe ich mit kleinen Fehlern im Clip um?
Kleine Artefakte lassen sich oft durch Schnitt, Bewegungsunschärfe oder kurze Cliplänge verdecken. Gravierende Fehler in Gesicht oder Händen rechtfertigen eine Neugenerierung.
Am Ende bleibt eine einfache Arbeitsteilung: Die KI liefert Tempo, Varianten und Struktur. Die Entscheidung über Bildausschnitt, Reihenfolge und Bedeutung bleibt beim Menschen. Wer Komposition und Shot-Design vor dem ersten Generieren klärt, verbringt weniger Zeit mit Aussortieren und mehr Zeit mit dem, was ein Video wirklich trägt – der Blick auf das richtige Bild zur richtigen Sekunde.

