Warum Prompt-Handwerk wichtiger ist als die Modellwahl
Es gibt in fast jedem Projekt einen Moment, in dem jemand sagt: Wir brauchen einfach das beste Modell. In der Praxis zeigt sich dann etwas anderes. Zwei Teams arbeiten mit demselben Generator und liefern völlig unterschiedliche Ergebnisse. Das eine Team bekommt weiche, austauschbare Bilder, das andere reproduzierbare Szenen mit klarer Lichtstimmung, passender Brennweite und einer Bildsprache, die zur Marke passt. Der Unterschied liegt fast nie am Werkzeug, sondern an der Struktur der Anweisung davor.
Bildgeneratoren lesen keine Ideen, sie rechnen mit Wahrscheinlichkeiten. Jedes Wort im Prompt verschiebt diese Wahrscheinlichkeiten ein Stück. Ein Satz wie ein schöner Wald bei Sonnenuntergang lässt dem Modell hunderte Entscheidungen offen: Welche Baumart? Welche Jahreszeit? Wie hoch steht die Sonne? Ist der Nebel dicht oder dünn? Welche Kamera schaut zu? Das Ergebnis wirkt deshalb oft beliebig, obwohl der Generator technisch einwandfrei arbeitet. Wer atemberaubende Szenen will, muss zwei Dinge trennen: die kreative Absicht und die technische Beschreibung. Die Absicht bleibt im Kopf, die Beschreibung geht in den Prompt.
Dazu kommt ein zweiter Faktor, der in der Diskussion oft untergeht: Konsistenz. Ein einzelnes schönes Bild ist heute kein Kunststück mehr. Schwierig wird es, wenn zwölf Motive zusammen ein Set ergeben sollen – für ein Storyboard, eine Kampagne, ein Produktvideo oder ein Spielkonzept. Genau dort entscheidet sich, ob du mit KI arbeitest oder nur mit KI spielst.
Dieser Leitfaden ist als Werkstatt gedacht, nicht als Rangliste. Du findest zuerst die Anatomie eines belastbaren Prompts, dann die Stärken verschiedener Modellfamilien, danach Syntax, Konsistenz, Workflow, typische Fehler und eine Entscheidungshilfe für die Tool-Auswahl. Alles ist so aufgebaut, dass du es direkt in dein eigenes Projekt übertragen kannst – unabhängig davon, mit welchem Generator du gerade arbeitest.
Die Anatomie eines Prompts, der atemberaubende Szenen erzeugt
Ein guter Prompt ist kein Gedicht, sondern ein Drehbuch in Kurzform. Er beantwortet fünf Fragen: Wer oder was ist zu sehen, wo passiert es, wie ist das Licht, mit welcher Optik wird es aufgenommen und in welcher visuellen Sprache wird es erzählt. Wenn eine dieser fünf Ebenen fehlt, füllt das Modell die Lücke mit einem Durchschnittswert – und Durchschnitt ist genau das, was du nicht willst.
Subjekt und Handlung
Beginne mit dem, was im Bild wirklich zählt. Statt eine Frau in einer Stadt schreibe lieber: eine Frau Mitte dreißig in einer gelben Regenjacke, die auf einer überfluteten Bordsteinkante stehen bleibt und nach oben schaut. Details wie Alter, Kleidung, Haltung und Blickrichtung machen den Unterschied zwischen einer Statistin und einer Figur. Wenn mehrere Personen vorkommen, beschreibe ihre Beziehung zueinander: zwei Personen, die sich gegenüberstehen, die Hände in den Taschen, mit sichtbarer Distanz. Beziehungen im Bild erzeugen Spannung, Aufzählungen erzeugen Langeweile.
Umgebung und Atmosphäre
Die Umgebung ist mehr als ein Hintergrund. Sie liefert Kontext, Maßstab und Stimmung. Nenne Ort, Tageszeit, Wetter und Materialien. Ein Bahnsteig aus nassem Beton mit Ölflecken wirkt anders als ein Bahnsteig aus poliertem Granit. Wähle zwei oder drei konkrete Umgebungsdetails statt zehn allgemeiner. Das Modell gewichtet klare, konkrete Substantive stärker als vage Adjektive wie schön oder beeindruckend.
Licht als wichtigstes Stilmittel
Licht ist die stärkste Einzelvariable in jedem Bildprompt. Beschreibe es wie ein Kamerateam: weiches Gegenlicht zur blauen Stunde, hartes Seitenlicht durch eine Jalousie, gleichmäßiges diffuses Licht aus einer großen Softbox, gerichtetes Licht mit sichtbarem Volumenstrahl durch Staub. Ergänze die Lichtfarbe – warmes Tungsten, kühles Tageslicht, gemischte Quellen aus Neon und Kerzenlicht. Sobald du Lichtrichtung, Qualität und Farbe festlegst, verschwindet der typische KI-Look fast von selbst.
Optik, Brennweite, Format
Beschreibe das Bild so, als wäre es tatsächlich fotografiert worden. Angaben wie 35-mm-Objektiv, leichte Weitwinkelverzerrung, geringe Schärfentiefe, Aufnahme auf Augenhöhe oder Draufsicht aus zwei Metern steuern Perspektive und Räumlichkeit. Auch das Seitenverhältnis gehört hierher: ein breites Panorama für Landschaften, ein quadratisches Format für Social-Media-Kacheln, ein Hochformat für Kurzvideos. Wer die Optik vergisst, bekommt ein technisch sauberes Bild, das aber nirgends richtig passt.
Stil, Material, Farbwelt
Der Stil ist die letzte Ebene und die, die am häufigsten überladen wird. Drei bis fünf Stilangaben reichen: zum Beispiel analoge Filmkörnung, entsättigte Blau-Grau-Palette, dokumentarischer Look, leichte Vignette. Vermeide Stapel aus zwanzig Künstlernamen. Solche Stapel erzeugen selten den gewünschten Stil, sondern mitteln sich zu einem beliebigen Ergebnis. Besser ist es, Materialeigenschaften zu beschreiben: gebürsteter Stahl, mattes Porzellan, feuchter Asphalt, Wollstoff mit sichtbarer Webstruktur.
Ein Grundgerüst, das du immer wieder verwenden kannst:
[Subjekt + Handlung], [Umgebung + zwei Details],
[Lichtrichtung + Lichtqualität + Lichtfarbe],
[Optik + Perspektive + Seitenverhältnis],
[Stil + Farbwelt + Material], [was vermieden werden soll]
Modellfamilien verstehen: welcher Generator passt zu welchem Stil
Es hilft wenig, Modelle als Rangliste zu denken. Sinnvoller ist eine Einteilung nach Aufgabenprofil. Fast alle aktuellen Generatoren lassen sich vier Familien zuordnen, und jede hat eine typische Stärke sowie eine typische Schwäche.
Fotorealismus und Produktaufnahmen
Diese Familie liefert überzeugende Hauttexturen, glaubwürdige Reflexionen und saubere Studiobeleuchtung. Sie ist die erste Wahl für Produktbilder, Porträts, Architektur und Lifestyle-Motive. Die Schwäche liegt in der Wiederholbarkeit: Ohne Referenzbilder oder feste Parameter driften Farben und Gesichter zwischen zwei Durchläufen. Für Kataloge und Kampagnen brauchst du deshalb immer eine Referenzstrategie.
Illustration, Konzeptkunst und Grafik
Hier dominieren Modelle, die klare Linien, flächige Farben und stilisierte Perspektiven mögen. Sie sind ideal für Storyboards, Moodboards, Kinderbuchillustrationen, Icon-Sets und Präsentationen. Die Schwäche ist Detailkontrolle: Kleine Elemente wie Logos oder Schrift verschwinden gern. Plane solche Details als spätere Montage ein, statt sie zu erzwingen.
Kino, Kamera und Bewegung
Diese Gruppe denkt in Einstellungen: Kamerafahrt, Schwenk, Dolly, langsamer Zoom. Sie ist für Animatics, Kurzfilme und Trailer interessant, weil aus einem Standbild eine Bewegung wird. Die Schwäche ist physikalische Logik: Hände, Spiegelungen und Schatten brechen bei schnellen Bewegungen häufiger. Arbeite mit kurzen Clips und wenigen Bewegungsimpulsen.
Konsistenz und Serienproduktion
Manche Werkzeuge sind nicht wegen eines einzelnen Bildes stark, sondern wegen ihrer Fähigkeit, denselben Charakter, dasselbe Produkt oder dieselbe Farbwelt über viele Motive zu halten. Das ist die wichtigste Familie für professionelle Arbeit. Prüfe bei jedem Kandidaten zuerst diese Frage: Wie viele Bilder brauche ich, bis das Ergebnis stabil ist?
| Aufgabenprofil | Stärke | Häufige Schwäche | Worauf du im Prompt achtest |
|---|---|---|---|
| Fotorealismus | Texturen, Licht, Material | Farb- und Gesichtsdrift | Lichtrichtung, Referenzbilder, feste Parameter |
| Illustration | Klare Formen, Stil | Feine Details, Schrift | Flächigkeit, Linienstärke, Palette |
| Kino und Bewegung | Einstellungslogik | Physik bei schnellen Bewegungen | Kamerabegriff, Bewegungsdauer |
| Serie und Konsistenz | Wiederholbarkeit | Weniger spektakuläre Einzelbilder | Stilbaustein, Seed, Charakterbeschreibung |
Prompt-Syntax und Semantik: Gewichtung, Negation, Referenzen
Wenn die Anatomie steht, geht es um Feinarbeit. Die folgenden vier Techniken bringen den größten Qualitätssprung pro aufgewendeter Minute.
Reihenfolge und Gewichtung
Die meisten Generatoren gewichten frühe Begriffe stärker. Was zuerst genannt wird, hat mehr Einfluss auf die Komposition. Setze deshalb Subjekt und Handlung an den Anfang, Licht und Optik in die Mitte, Stil ans Ende. Wenn ein Element zu dominant wird, verschiebe es nach hinten, statt es zu löschen. In Systemen mit Gewichtungssyntax reichen moderate Werte; extreme Gewichte erzeugen oft Artefakte.
Negative Anweisungen
Negativlisten sind wirksamer als ihr Ruf, aber nur, wenn sie konkret sind. Unscharf, verzerrt, zusätzliche Finger oder Wasserzeichen sind sinnvoll. Verzichte auf abstrakte Negationen wie nichts Hässliches, weil Modelle Konzepte verarbeiten, die sie benennen können. Wenn ein Fehler immer wieder auftaucht, beschreibe im positiven Teil des Prompts das gewünschte Gegenteil – das wirkt zuverlässiger als reines Verbieten.
Referenzbilder und Bild-zu-Bild
Referenzen sind der schnellste Weg zu Konsistenz. Nutze höchstens zwei bis drei Referenzen gleichzeitig und weise ihnen klare Rollen zu: eine für den Charakter, eine für die Farbwelt, eine für die Komposition. Zu viele Referenzen verwirren das Modell und führen zu einem Mischmasch. Wenn du eine Referenz nur für die Beleuchtung willst, schreibe das ausdrücklich in den Prompt.
Text im Bild
Text ist nach wie vor die Schwachstelle vieler Generatoren. Kurze Wörter in großen Lettern funktionieren meist, lange Sätze selten. Der praktikable Weg: Platz im Bild bewusst freihalten und Schrift später setzen. Beschreibe im Prompt den Freiraum – ruhige Fläche im oberen Drittel – statt den Text selbst zu erzwingen.
Stil-Konsistenz über ganze Szenenfolgen
Ein Set aus zwölf Bildern lebt von Wiedererkennbarkeit. Drei Werkzeuge helfen dabei.
Der Stilbaustein
Schreibe eine feste Formulierung für Licht, Palette und Material und kopiere sie in jeden Prompt. Der Baustein bleibt wörtlich identisch, nur Subjekt und Umgebung wechseln. Das klingt banal, ist aber der wirksamste Hebel überhaupt, weil das Modell dieselben Signale wiedererkennt.
Seeds und feste Parameter
Speichere Seed, Seitenverhältnis, Stilgrad und Modellversion für jedes Projekt. Notiere sie zusammen mit dem Prompt in einer einfachen Tabelle. Ohne diese Notizen kannst du ein gutes Ergebnis nicht reproduzieren, und jede Nacharbeit wird zum Ratespiel.
Charakter-Konsistenz
Für Figuren brauchst du drei bis fünf unveränderliche Merkmale: Gesichtsform, Frisur, ein Kleidungsstück, eine Farbe, ein Accessoire. Alles andere darf variieren. Wenn dieselbe Figur in unterschiedlichen Szenen auftritt, beschreibe zuerst die Merkmale und danach die Situation – niemals umgekehrt. Bei sehr anspruchsvollen Projekten lohnt es sich, ein Referenzbild der Figur zu erzeugen und es als Basis für alle weiteren Motive zu verwenden.
Workflow: vom Briefing zum fertigen Bild-Set
Ein reproduzierbarer Ablauf spart mehr Zeit als jedes Modell-Upgrade. Bewährt hat sich diese Reihenfolge:
-
Briefing in einem Satz. Schreibe auf, was das Bild leisten soll und wo es erscheint. Format, Zielgruppe und Aussage gehören hierher.
-
Moodboard mit drei bis fünf Referenzen. Suche Bilder, die Licht, Palette und Komposition zeigen. Beschreibe in Worten, was du daran magst.
-
Stilbaustein formulieren. Verdichte Licht, Palette und Material in zwei bis drei Zeilen. Dieser Baustein bleibt für das ganze Projekt stabil.
-
Ersten Prompt bauen. Subjekt, Umgebung, Optik, Stil. Bewusst kurz halten, maximal 60 bis 80 Wörter.
-
Vier Varianten generieren. Nicht zwanzig. Vier reichen, um die Richtung zu prüfen.
-
Analysieren statt würfeln. Fehlt Volumen im Vordergrund? Dann Perspektive ändern. Ist das Licht flach? Dann Lichtqualität konkretisieren. Notiere jede Änderung, damit du weißt, was gewirkt hat.
-
Bestes Ergebnis hochskalieren. Erst wenn die Komposition sitzt, in höhere Auflösung gehen und Details nachschärfen.
-
Set erweitern. Jetzt die weiteren Motive mit demselben Stilbaustein erzeugen, immer nur Subjekt und Umgebung tauschen.
Wichtig ist die Reihenfolge der Iterationen. Ändere pro Durchlauf nur eine Ebene: erst Komposition, dann Licht, dann Material, schließlich Detail. Wer gleichzeitig Perspektive, Stil und Subjekt wechselt, lernt nichts über die Wirkung der eigenen Worte.
Typische Fehler und ihre Korrektur
Die meisten Enttäuschungen entstehen aus wenigen, immer gleichen Ursachen.
| Symptom | Ursache | Korrektur |
|---|---|---|
| Beliebiges Bild | Prompt ohne Licht- und Optikangabe | Lichtrichtung, Lichtqualität, Brennweite ergänzen |
| Gesicht ändert sich | Keine Referenz, wechselnde Parameter | Referenzbild plus fester Seed |
| Überladene Komposition | Zu viele Objekte im Prompt | Auf ein Hauptmotiv reduzieren |
| Plastik-Look | Diffuses Licht, keine Materialangaben | Gerichtetes Licht, Texturen nennen |
| Farben driften | Stilbaustein variiert | Baustein wörtlich kopieren |
| Schrift unleserlich | Text im Bild erzwungen | Freiraum planen, Schrift nachträglich setzen |
Ein weiterer Klassiker ist der Wunsch nach Perfektion im ersten Versuch. Bildgenerierung ist ein Dialog, kein Automat. Rechne mit drei bis fünf Runden für ein gutes Motiv und mit zehn bis zwanzig Runden für ein ganzes Set. Wer diese Erwartung vorher klärt, spart sich Frust und liefert zuverlässiger.
Schließlich wird der Prompt oft zu lang. Ab etwa 100 Wörtern sinkt der Einfluss jedes einzelnen Begriffs, weil das Modell die Signale mittelt. Kürzen ist deshalb eine echte Qualitätsmaßnahme. Streiche Adjektive, die keine Entscheidung erzwingen, und behalte nur die Wörter, die eine sichtbare Konsequenz haben.
Von Bild zu Video: der Bewegungsworkflow
Sobald die Standbilder sitzen, ist der Schritt zur Bewegung verlockend. Damit er gelingt, gilt eine einfache Regel: Bewegung entsteht aus einem klaren Startbild plus einem präzisen Bewegungsauftrag.
Beschreibe Bewegung wie eine Regieanweisung: langsame Fahrt nach rechts, gleichmäßig, Kamerahöhe konstant. Ein Bewegungsimpuls pro Clip reicht. Zwei gleichzeitige Bewegungen – Kamera fährt und Figur dreht sich – überfordern viele Systeme. Halte Clips kurz, drei bis fünf Sekunden, und verlängere erst danach.
Achte besonders auf Vordergrundelemente. Ein Ast, eine Säule oder eine Person im Vordergrund erzeugt Tiefe und verankert die Bewegung glaubwürdig. Nutze außerdem Atmosphäre: Regen, Staub, Dampf oder fallende Blätter erklären Bewegung ohne zusätzliche Kamerafahrt. Wenn ein Clip unruhig wirkt, reduziere die Bewegungsdauer und erhöhe die Bildqualität des Startbilds, bevor du am Bewegungsprompt feilst.
Für Szenenfolgen empfiehlt sich eine feste Reihenfolge: erst alle Startbilder mit identischem Stilbaustein erstellen, dann pro Motiv einen Bewegungstest, danach die Auswahl verlängern. So bleibt der Look über die gesamte Sequenz stabil und du merkst früh, welches Motiv als Video nicht funktioniert.
Tool-Auswahl: Kriterien für den Alltag
Bevor du dich für ein Werkzeug entscheidest, prüfe fünf Kriterien an deinem echten Projekt statt an einer Demo:
- Reproduzierbarkeit: Bekommst du mit denselben Eingaben dasselbe Ergebnis?
- Kontrolle: Kannst du Perspektive, Licht und Format gezielt steuern?
- Konsistenz: Hält ein Charakter oder Produkt über zehn Motive?
- Geschwindigkeit: Wie lange dauert eine Iterationsrunde inklusive Nachjustierung?
- Weiterverarbeitung: Passt das Ergebnis in deinen bestehenden Prozess – Schnitt, Layout, Präsentation?
Ein Werkzeug, das bei Reproduzierbarkeit und Konsistenz gewinnt, ist für Auftragsarbeit fast immer die bessere Wahl, selbst wenn ein anderes spektakulärere Einzelbilder liefert. Spektakulär hilft nur, wenn du es wiederholen kannst. Praktisch bedeutet das: Baue dir einen kleinen Testparkour aus fünf Aufgaben – Porträt, Produkt, Landschaft, Text-im-Bild, Bild zu Video – und bewerte jedes Tool daran. Nach einem Nachmittag hast du belastbare Daten statt Marketingversprechen.
FAQ: häufige Fragen zu KI-Bildgeneratoren und Prompts
Wie lang sollte ein Prompt sein?
Für die meisten Modelle liegt der optimale Bereich zwischen 40 und 80 Wörtern. Kürzer wird unpräzise, länger verwässert. Wenn du mehr Details brauchst, erhöhe nicht die Wortzahl, sondern die Konkretheit.
Warum sehen meine Bilder trotz guter Prompts austauschbar aus?
Meist fehlen Lichtrichtung und Optik. Ergänze eine klare Lichtquelle mit Richtung und Qualität sowie eine Perspektive mit Brennweite. Diese zwei Ergänzungen verändern den Look stärker als jede Stilangabe.
Brauche ich Referenzbilder?
Für Einzelbilder nicht zwingend, für Serien fast immer. Referenzen sind der zuverlässigste Weg zu Charakter- und Farbkonsistenz.
Wie viele Varianten sollte ich pro Prompt erzeugen?
Vier bis sechs. Mehr Varianten ersetzen keine Analyse. Wer zwanzig Bilder würfelt und eines auswählt, lernt nichts über die Wirkung des Prompts.
Funktioniert ein Prompt für alle Modelle?
Nein. Modelle gewichten Begriffe unterschiedlich und reagieren verschieden auf Stilangaben. Ein guter Prompt ist deshalb portabel, aber nicht identisch: Behalte die Struktur, passe Formulierungen an.
Wie verhindere ich unerwünschte Elemente?
Beschreibe das gewünschte Gegenteil im positiven Teil und ergänze eine kurze, konkrete Negativliste. Drei bis sechs Negativbegriffe reichen.
Woran erkenne ich, dass ein Projekt bereit für Video ist?
Wenn Startbilder reproduzierbar sind, der Stil über mehrere Motive hält und du weißt, welche Bildbereiche Bewegung tragen können. Vorher ist Video meist teurer als nützlich.
Wie dokumentiere ich meine Prompts?
Führe eine einfache Tabelle mit Datum, Motiv, Prompt, Seed, Parametern und Bewertung. Diese Datei ist mit der Zeit wertvoller als jede Prompt-Sammlung aus dem Netz, weil sie zu deinem Projekt passt.
Abschließend lässt sich das Ganze auf eine kurze Checkliste bringen: klares Subjekt, zwei Umgebungsdetails, definiertes Licht, bewusste Optik, stabiler Stilbaustein, dokumentierte Parameter, vier Varianten pro Runde und immer nur eine Änderung pro Iteration. Wer diese acht Punkte einhält, braucht kein neues Modell, um atemberaubende Szenen zu erzeugen – nur Geduld und eine saubere Struktur.




