Start Free Now
Limited Time Offer: Get 50% OFF Starter & Basic Yearly Plans 🎉

Prompt Engineering per Video AI: Istruzioni Cinematografiche

Sep 27, 2026

Perché il prompt è la sceneggiatura tecnica del video AI

Un generatore video non legge le intenzioni: legge testo. Tutto ciò che non è scritto nel prompt viene deciso dal modello, e le decisioni automatiche sono quasi sempre generiche. È qui che nasce la differenza tra una clip che sembra un test e una clip che sembra girata da qualcuno che sapeva cosa voleva.

Il prompt engineering per video AI è, in pratica, la traduzione di un'idea visiva in istruzioni tecniche verificabili. Non serve scrivere poesie: serve descrivere con precisione soggetto, azione, inquadratura, luce, lente, ritmo e vincoli. Chi arriva dal cinema riconosce subito il vocabolario: campo, controcampo, focale, key light, rapporto d'aspetto, continuità. Chi arriva dal marketing riconosce un'altra cosa: la necessità di ripetere un risultato dieci volte senza perdere qualità.

Questa guida è pensata per entrambi. Vedremo come strutturare un prompt cinematografico, come adattarlo ai diversi tipi di modello, come mantenere la coerenza tra più clip e come correggere gli errori più frequenti. L'obiettivo non è imparare una formula magica, ma costruire un metodo riutilizzabile.

Come funziona un generatore video: cosa puoi davvero controllare

Prima di scrivere, vale la pena capire dove il prompt agisce e dove invece decide il modello. La maggior parte dei generatori lavora su una rappresentazione latente dello spazio visivo e del movimento: il testo guida l'attenzione del modello verso alcune caratteristiche, ma non impone un risultato deterministico.

In pratica, il prompt controlla bene:

  • il soggetto e l'abbigliamento
  • l'azione principale e la sua direzione
  • l'ambiente e il momento della giornata
  • lo stile visivo e la palette cromatica
  • il tipo di inquadratura e il movimento di macchina
  • il formato e la resa della grana

Controlla male, o non controlla affatto:

  • i dettagli anatomici minuti, come il numero esatto di dita
  • il testo leggibile dentro l'inquadratura
  • le interazioni fisiche complesse tra più persone
  • la continuità perfetta di un volto tra clip diverse
  • il tempismo preciso di un gesto rispetto al ritmo musicale

Sapere questo evita la frustrazione più comune: pretendere dal prompt ciò che il modello non è in grado di garantire, invece di costruire il risultato in più passaggi.

Testo, immagine o video: tre punti di partenza diversi

Un prompt solo testuale offre la massima libertà ma la minima ripetibilità. Un prompt che parte da un fotogramma di riferimento blocca composizione e stile, ma limita il movimento. Un prompt che estende un video esistente è ideale per continuare un'azione, ma tende a trascinare con sé gli errori già presenti.

La regola pratica: usa il testo per esplorare, l'immagine per fissare, il video per continuare. Mescolare i tre approcci nello stesso progetto senza criterio è la causa numero uno di incoerenza visiva.

Il costo reale di un prompt sbagliato

Ogni generazione consuma tempo, risorse di calcolo e attenzione creativa. Ma il costo più alto è la deriva del progetto: quando tre clip su dieci sono utilizzabili, si finisce per montare ciò che è uscito bene invece di ciò che serviva alla storia. Un prompt scritto con metodo riduce le iterazioni necessarie e, soprattutto, rende le iterazioni confrontabili.

La struttura in sei blocchi di un prompt cinematografico

Un prompt efficace non è una lista di aggettivi. È una gerarchia: prima l'ossatura narrativa, poi la tecnica, poi i dettagli. Saltare l'ordine produce istruzioni contraddittorie, e il modello risolve le contraddizioni nel modo meno prevedibile possibile.

Ecco i sei blocchi che funzionano nella maggior parte dei casi.

Blocco 1 — Soggetto e azione

Una sola azione principale per clip. Se servono due azioni, servono due clip. La formula è: chi, cosa fa, verso dove.

Esempio debole: "una donna cammina in una città".
Esempio forte: "una donna sulla quarantina, trench cammello bagnato di pioggia, cammina verso la camera lungo un marciapiede deserto, sguardo abbassato, passo lento e deciso".

Il secondo descrive un'azione con una direzione e uno stato emotivo. Il primo descrive un tema.

Blocco 2 — Inquadratura e movimento di macchina

Qui si decide la grammatica visiva. Specifica il tipo di piano, l'angolo e il movimento, ma evita di chiedere due movimenti incompatibili nello stesso momento.

  • piano: campo lungo, piano medio, primo piano, dettaglio
  • angolo: altezza occhi, dal basso, dall'alto, olandese
  • movimento: statico, carrello laterale, dolly in, panoramica lenta, camera a mano, drone
  • velocità: lento e controllato, oppure rapido e nervoso

"Dolly in lento mentre il soggetto resta immobile" è una richiesta chiara. "Movimento dinamico e coinvolgente" non dice nulla al modello.

Blocco 3 — Luce e palette

La luce è il parametro che più cambia la percezione di qualità. Descrivila come la descriverebbe un direttore della fotografia: direzione, qualità, colore, contrasto.

  • direzione: frontale, laterale, controluce, dall'alto, dal basso
  • qualità: dura con ombre nette, morbida e diffusa, mista
  • temperatura: calda al tramonto, fredda e clinica, neon verde e magenta
  • atmosfera: foschia, pioggia, polvere sospesa, fumo

"Controluce caldo al tramonto, ombre lunghe, foschia leggera" produce un risultato molto diverso da "illuminazione cinematografica".

Blocco 4 — Lente, formato e texture

Questo blocco definisce la resa materica. Focale, profondità di campo, formato e grana sono istruzioni potenti perché il modello le ha imparate associandole a milioni di immagini reali.

  • focale: 24 mm grandangolare, 50 mm naturale, 85 mm per ritratti
  • profondità di campo: ridotta con sfondo sfocato, oppure profondità estesa
  • formato: 16:9, 9:16 verticale, 2.39:1 anamorfico
  • texture: grana pellicola 35 mm, leggero rumore digitale, pulito e nitido

L'aggiunta di "anamorfico 2.39:1 con flare orizzontali" è una scorciatoia efficace per un look da grande schermo.

Blocco 5 — Tempo e ritmo

Il movimento ha una velocità percepita. Indicare ritmo e durata aiuta il modello a distribuire l'azione nella clip.

  • "azione che si svolge lentamente nei primi secondi e accelera alla fine"
  • "movimento continuo e uniforme, senza scatti"
  • "rallentatore leggero, come a 60 fps riprodotti a 24"

Attenzione: chiedere un ralenti marcato su un'azione rapida spesso produce artefatti. Meglio rallentare in post produzione quando il movimento è già fluido.

Blocco 6 — Vincoli e negazioni

Alcuni modelli accettano istruzioni negative, altri le ignorano. In generale è più efficace dichiarare ciò che vuoi invece di elencare ciò che non vuoi, ma un breve blocco di vincoli resta utile.

  • "nessun testo nell'inquadratura"
  • "un solo soggetto umano visibile"
  • "senza loghi o marchi"
  • "senza cambi di scena improvvisi"

Se il modello non supporta le negazioni, sposta questi vincoli nella scelta del fotogramma di riferimento: è lì che diventano realmente efficaci.

Adattare il prompt al modello che stai usando

Non tutti i generatori video hanno la stessa sensibilità al testo. Alcuni sono addestrati su grandi quantità di girato reale e premiano la precisione fotografica. Altri sono addestrati su animazione e illustrazione e premiano lo stile. Altri ancora sono specializzati nel movimento fisico e nella simulazione.

Scrivere lo stesso prompt per tutti è uno spreco. Ecco come orientarsi.

Modelli orientati al realismo

Questi modelli rispondono bene a terminologia fotografica e cinematografica: focale, diaframma, tipo di luce, pellicola, colore. Sono anche i più sensibili agli eccessi: troppi aggettivi stilistici producono immagini sovraccariche e poco credibili.

Strategia: prompt medio-lunghi, precisi, con un solo soggetto principale e un'azione semplice. Aggiungi riferimenti a lenti reali e condizioni di luce concrete.

Modelli orientati allo stile e all'animazione

Qui funzionano parole come stile illustrato, cel shading, acquerello animato, design di personaggio, linea pulita. La coerenza stilistica tra clip dipende quasi interamente dalla ripetizione letterale della stessa formula di stile: cambia la descrizione della scena, non il blocco stilistico.

Strategia: crea un "blocco stile" fisso di due o tre righe e incollalo identico in ogni prompt del progetto.

Modelli orientati al movimento e alla fisica

Questi modelli danno il meglio con azioni continue e ambienti coerenti: corse, cadute, acqua, fumo, veicoli. Soffrono le scene statiche con molti dettagli, che tendono a trasformarsi in micro-movimenti indesiderati.

Strategia: descrivi traiettorie e forze, non solo l'aspetto. "Il mantello si gonfia verso destra mentre il soggetto avanza" funziona meglio di "mantello elegante".

Il metodo dei tre tentativi

Quando provi un modello nuovo, non giudicarlo da una singola generazione. Prepara tre prompt con la stessa struttura ma variabile crescente di dettaglio: minimo, medio, ricco. Capirai rapidamente dove si trova il punto di saturazione, cioè il livello oltre il quale aggiungere parole peggiora il risultato invece di migliorarlo.

Coerenza narrativa: come tenere insieme più clip

Una singola clip può essere bellissima e inutile. Il valore reale nasce dalla sequenza. La coerenza si costruisce su quattro livelli.

Coerenza del personaggio. Fissa età, corporatura, capelli, abbigliamento e un dettaglio distintivo. Ripeti la stessa descrizione, parola per parola, in ogni prompt. Se il modello supporta riferimenti immagine, usa sempre lo stesso fotogramma del volto.

Coerenza dell'ambiente. Descrivi l'architettura, i materiali, il meteo e l'ora del giorno con le stesse parole. Una variazione minima, come "tramonto" invece di "luce dorata del tardo pomeriggio", produce salti visibili in montaggio.

Coerenza della macchina da presa. Se la prima clip è in piano medio con camera a mano, la seconda non dovrebbe essere un drone statico, a meno che il cambio non sia voluto. Definisci in anticipo la grammatica visiva della scena.

Coerenza del colore. Stabilisci una palette di tre colori dominanti e richiamala in ogni prompt. In post produzione, applica un'unica correzione colore a tutta la sequenza: è il modo più economico per unificare clip generate separatamente.

Il foglio di stile del progetto

Prima di generare, scrivi un breve documento con: descrizione canonica del protagonista, descrizione canonica dei luoghi, palette, formato, tipo di lente ricorrente e blocco stile. Questo foglio diventa la sorgente da cui copiare e incollare. Riduce la variabilità più di qualsiasi parametro tecnico.

Luce, ombra e colore: il controllo drammatico

Se dovessi scegliere un solo elemento su cui investire tempo nel prompt, sceglierei la luce. Il pubblico perdona una composizione semplice, non perdona un'immagine piatta.

Le quattro luci che funzionano sempre

Controluce al tramonto. Soggetto in ombra, contorno luminoso, foschia calda. Crea profondità immediata e separa il soggetto dallo sfondo.

Luce laterale dura. Ombre nette, texture visibile, atmosfera tesa. Ideale per interni drammatici e ritratti intensi.

Luce morbida diffusa. Pelle pulita, contrasto basso, tono sognante o pubblicitario. Attenzione: senza un accento di contrasto, il risultato sembra piatto.

Neon notturno. Magenta e ciano, superfici bagnate, riflessi. È il look più riconoscibile e anche il più abusato: usalo con intenzione.

Il contrasto si progetta, non si spera

Indica sempre dove vuoi il punto più chiaro e il punto più scuro dell'inquadratura. "La finestra sullo sfondo è la fonte più luminosa, il volto resta in penombra" è un'istruzione operativa. "Immagine suggestiva" non lo è.

Il colore come continuity

Definisci una palette e rispettala. Tre colori dominanti più un accento sono sufficienti. Se una clip introduce un colore estraneo, il montaggio lo farà sembrare un errore, non una scelta.

Errori frequenti e come correggerli

Errore 1: prompt enciclopedico. Venti righe di dettagli producono confusione. Correzione: riduci a soggetto, azione, inquadratura, luce, lente. Tutto il resto è opzionale.

Errore 2: aggettivi emotivi. "Triste, potente, epico" non sono istruzioni visive. Correzione: traduci l'emozione in elementi concreti, come postura, velocità, luce e distanza dal soggetto.

Errore 3: due azioni in una clip. Il modello ne sceglie una o le fonde male. Correzione: una clip, un'azione, un movimento di macchina.

Errore 4: movimento troppo complesso. Orbite, zoom e carrelli simultanei generano artefatti. Correzione: un solo movimento, eseguito lentamente.

Errore 5: nessun riferimento visivo. Il testo da solo lascia troppa libertà. Correzione: usa un fotogramma di riferimento quando la composizione conta.

Errore 6: variare troppe cose insieme. Se cambi soggetto, stile, luce e formato contemporaneamente, non saprai cosa ha causato il miglioramento. Correzione: modifica una variabile per volta.

Errore 7: ignorare il formato di destinazione. Generare in orizzontale per una piattaforma verticale costringe a tagli che distruggono la composizione. Correzione: decidi il formato prima di scrivere il prompt.

Flusso di lavoro pratico: dal brief alla sequenza montata

Un metodo in sette passaggi che funziona sia per un singolo spot sia per un cortometraggio.

1. Scrivi il brief in linguaggio naturale

Due o tre frasi su cosa deve comunicare la scena, a chi è rivolta e con quale tono. Questo documento non entra nel prompt, ma guida ogni scelta successiva.

2. Scomponi in clip da tre a cinque secondi

Elenca le clip necessarie con una riga ciascuna: azione, inquadratura, funzione narrativa. Se una clip non ha una funzione, eliminarla.

3. Compila il foglio di stile

Personaggi, luoghi, palette, formato, lente ricorrente, blocco stile fisso.

4. Genera un fotogramma campione per ogni scena

Prima di animare, verifica composizione e luce su un'immagine statica. È il passaggio che fa risparmiare più tempo in assoluto.

5. Scrivi i prompt completi

Sei blocchi, una variabile modificata per iterazione. Salva ogni versione con un numero progressivo: senza storico, non impari.

6. Seleziona e annota

Quando una generazione funziona, annota esattamente cosa conteneva il prompt. Quel testo diventa il tuo riferimento per le clip successive.

7. Unifica in post produzione

Correzione colore comune, stabilizzazione se serve, taglio sul movimento. La post produzione non salva una clip sbagliata, ma rende coerente una serie di clip buone.

Domande frequenti

Quanto deve essere lungo un prompt per video AI?
Per la maggior parte dei modelli, tra le 40 e le 90 parole funzionano bene. Sotto le 20 il controllo è insufficiente, sopra le 150 il modello tende a ignorare parte delle istruzioni.

Serve scrivere in inglese?
Molti modelli sono addestrati prevalentemente su dati in inglese e rispondono con maggiore precisione. Se il tuo modello gestisce bene la tua lingua, però, scrivere nella lingua madre riduce gli errori di traduzione concettuale. La soluzione più sicura è scrivere nella lingua che padroneggi e verificare con un test comparativo.

Come evito che il volto cambi tra una clip e l'altra?
Ripeti la descrizione letteralmente identica, usa lo stesso fotogramma di riferimento e mantieni invariati inquadratura e luce. Se il cambiamento persiste, riduci la durata delle clip: meno tempo significa meno deriva.

Le istruzioni negative funzionano?
Dipende dal modello. Quando funzionano, sono utili per escludere testo, loghi o soggetti indesiderati. Quando non funzionano, introducono rumore. Prova con e senza, e tieni ciò che dà risultati migliori.

Meglio generare clip lunghe o corte?
Corte. Una clip da tre secondi con movimento pulito è più utile di una da dieci secondi con artefatti a metà. La lunghezza si costruisce in montaggio, non nel prompt.

Come gestisco i dialoghi?
Meglio evitare. Genera il movimento e le espressioni, poi aggiungi voce e sincronizzazione in un secondo momento. Chiedere a un modello video di gestire dialogo e labiale contemporaneamente aumenta molto il rischio di risultati inutilizzabili.

Quante iterazioni sono normali per una clip utilizzabile?
Da due a cinque per una scena semplice, di più per azioni complesse o più soggetti. Se superi le dieci iterazioni, il problema non è il modello: è il prompt o la concept della scena.

Posso riutilizzare lo stesso prompt per progetti diversi?
Il blocco stile e il blocco lente sì, il resto no. I blocchi tecnici sono riutilizzabili come modello; soggetto e azione devono cambiare ogni volta.

Checklist finale prima di premere genera

  • Il soggetto è descritto con almeno tre elementi concreti?
  • C'è una sola azione principale e un solo movimento di macchina?
  • La luce è descritta con direzione, qualità e temperatura?
  • La focale e il formato sono dichiarati?
  • Il blocco stile coincide con quello delle clip precedenti?
  • La descrizione del personaggio è identica a quella canonica?
  • Il prompt sta sotto le 100 parole?
  • Ho cambiato una sola variabile rispetto al tentativo precedente?

Se tutte le risposte sono affermative, il prompt è pronto. Il resto lo fa la pratica: ogni progetto ben documentato rende il successivo più rapido, perché il tuo archivio di prompt diventa, di fatto, il tuo manuale di regia personale.

Alexander

Alexander