Il prompt è la nuova sceneggiatura
La generazione video con intelligenza artificiale ha spostato il collo di bottiglia della produzione: non è più la disponibilità di attrezzature, di troupe o di location, ma la capacità di descrivere con precisione ciò che si vuole vedere sullo schermo. Chi sa scrivere un prompt efficace ottiene in pochi minuti materiale che prima richiedeva giorni di pianificazione. Chi improvvisa ottiene clip casuali, incoerenti e difficili da montare.
Il prompt, in questo contesto, non è una parola magica: è un documento tecnico-creativo. Contiene una descrizione visiva, indicazioni di regia, vincoli tecnici e, quando serve, istruzioni narrative. Trattarlo come una frase digitata di getto porta a risultati mediocri; trattarlo come una sceneggiatura breve porta a risultati professionali.
Si possono distinguere tre livelli di competenza. Il primo è descrittivo: si elenca ciò che appare nell'inquadratura. Il secondo è tecnico: si controllano parametri, movimento di camera, formato e durata. Il terzo è narrativo: si costruisce una sequenza di inquadrature coerenti che raccontano qualcosa. La maggior parte degli utenti si ferma al primo livello, poi si chiede perché tutti i suoi video sembrino simili tra loro.
Questa guida copre i tre livelli con un approccio pratico: struttura del prompt, parametri da controllare, criteri per scegliere il modello giusto, tecniche di continuità visiva, organizzazione della pipeline ed errori da evitare. Nessuna formula magica, solo un metodo ripetibile che puoi adattare al tuo progetto.
L'anatomia di un prompt efficace
I nove componenti essenziali
Un prompt completo per la generazione video risponde a nove domande. Non tutte sono obbligatorie in ogni scena, ma sapere quali stai trascurando ti aiuta a capire perché un risultato non convince.
- Soggetto: chi o cosa è al centro dell'inquadratura, con età, abbigliamento, postura e tratti distintivi.
- Azione: cosa fa il soggetto e con quale ritmo (lento, brusco, continuo, interrotto).
- Ambiente: luogo, ora del giorno, condizioni meteo, densità di dettagli sullo sfondo.
- Luce: direzione, qualità (dura o morbida), colore, rapporto di contrasto.
- Camera: altezza, angolo, focale equivalente, tipo di movimento.
- Stile: realismo fotografico, animazione, pellicola anni Settanta, documentario, pubblicità.
- Atmosfera: emozione dominante, palette cromatica, grana, nitidezza.
- Vincoli tecnici: formato, durata, frame rate, risoluzione.
- Esclusioni: ciò che non deve comparire, elencato come prompt negativo.
Esempio commentato: da prompt debole a prompt operativo
Un prompt debole tipico è questo: «donna che cammina sotto la pioggia a Tokyo di notte, cinematico». Il modello riceve un soggetto vago, nessuna indicazione di camera, nessun vincolo di luce e un aggettivo di stile che significa tutto e niente. Il risultato sarà plausibile ma generico: un'inquadratura che potrebbe appartenere a qualsiasi progetto.
Un prompt operativo, invece, decide le questioni al posto del modello: «Inquadratura a figura intera in campo lungo: una donna di circa trent'anni con un trench color cammello cammina lentamente verso la camera su un marciapiede bagnato, in un quartiere di Tokyo. Notte, pioggia leggera, insegne al neon sfocate sullo sfondo. Camera a mano con leggero tremolio, obiettivo 35 mm, profondità di campo ridotta. Luce principale proveniente dalle insegne sul lato sinistro, riflessi sull'asfalto. Palette blu e magenta, grana sottile da pellicola. Durata cinque secondi, movimento continuo, formato 16:9». A questo si aggiunge un elenco negativo: «volti deformati, arti extra, testo sovrapposto, filigrane, sfarfallio, zoom improvviso».
La differenza non è poetica, è ingegneristica: ogni clausola rimuove una decisione dalle mani del modello. Meno decisioni lascia libere, più il risultato assomiglia a ciò che avevi in mente.
Ordine e densità delle informazioni
Metti il soggetto e l'azione nei primi quindici termini del prompt: la maggior parte dei modelli assegna più peso alle informazioni iniziali. Tieni il prompt tra le sessanta e le centotrenta parole: sotto i cinquanta mancano elementi di controllo, sopra le centocinquanta il modello tende a ignorare parti della richiesta. Evita gli aggettivi contraddittori nello stesso prompt, come «minimalista» e «riccamente decorato»: il modello non negozia, sceglie a caso. Scegli uno stile dominante e aggiungi al massimo un'influenza secondaria.
Parametri tecnici e variabili nascoste
Formato, durata e frame rate
Il formato va deciso prima di generare, non dopo. Un video pensato per i social verticali richiede composizioni centrate sul soggetto, mentre un formato orizzontale premia le inquadrature ampie con profondità. La durata ideale per una singola clip generata sta tra tre e otto secondi: più lunga è la clip, più alto è il rischio di deriva visiva e di perdita di coerenza del soggetto. Il frame rate, infine, cambia la sensazione di movimento: ventiquattro fotogrammi al secondo comunica cinema, trenta è neutro, sessanta è ideale per movimenti veloci e riprese di sport.
Movimento e intensità del moto
Molti strumenti espongono un parametro di intensità del movimento. Valori bassi producono clip stabili ma statiche; valori alti generano dinamismo ma introducono artefatti e deformazioni. La regola pratica è partire da un valore medio, aumentarlo solo se la scena richiede azione fisica e ridurlo quando il soggetto è un volto umano, perché i primi piani amplificano ogni imperfezione del movimento.
Seed, guidance e riproducibilità
Il seed è il numero che determina la variabilità casuale della generazione. Fissarlo è l'unico modo per rendere un risultato ripetibile: quando trovi una clip valida, annota seed, prompt esatto e parametri, così potrai rigenerare varianti minime invece di ricominciare da zero. Il parametro di aderenza al prompt, spesso chiamato guidance o scala di condizionamento, bilancia fedeltà e libertà creativa: valori bassi danno immagini più morbide e naturali, valori alti obbediscono al testo ma possono produrre colori saturi e contorni duri.
Prompt negativi: l'elenco che salva il montaggio
I negativi sono la parte più sottovalutata del lavoro. Un elenco fisso da riutilizzare include: arti duplicati, mani deformate, volti asimmetrici, testo illeggibile, filigrane, loghi, sfarfallio, salti di posizione, morphing improvvisi, sfondo che cambia forma. Aggiungi negativi specifici per la scena: «niente auto moderne» in un video in costume, «niente luci al neon» in una scena naturale.
Scegliere il modello giusto per ogni scena
Criteri di decisione
Non esiste un modello migliore in assoluto, esiste il modello giusto per la singola inquadratura. Valuta cinque criteri: il tipo di contenuto (reale, stilizzato, astratto), la necessità di coerenza del personaggio, la durata richiesta, il livello di controllo sul movimento di camera e la velocità di iterazione. Un modello eccellente sui paesaggi può essere mediocre sui primi piani umani; un modello specializzato in animazione non serve a chi gira una pubblicità realistica.
Matrice pratica per tipo di scena
- Primo piano di un volto che parla: servono modelli con sincronizzazione labiale e stabilità del volto. Genera clip corte, ripeti più volte e scegli la migliore.
- Paesaggio o establishing shot: privilegia modelli forti sulla resa dei materiali, dell'acqua e della vegetazione. Sono le scene in cui la qualità si vede di più.
- Azione e movimento fisico: cerca modelli con controllo esplicito della camera e buona gestione del motion blur.
- Prodotto e still life: servono precisione sui dettagli e controllo della luce riflessa. Meglio procedere per inquadrature brevi e montarle.
- Stile illustrato o animato: usa modelli con coerenza stilistica forte e riferimenti visivi, altrimenti ogni clip sembrerà di un autore diverso.
Quando combinare più strumenti
La pipeline professionale raramente usa un solo modello. Una strategia comune è generare il girato principale con un modello di alta qualità, produrre varianti rapide con un modello leggero per testare composizione e movimento, e usare uno strumento separato per upscaling e interpolazione dei fotogrammi. Così riduci i tempi di iterazione senza sacrificare la resa finale.
Continuità visiva tra più inquadrature
Ancoraggio del personaggio
Il problema principale dei video multi-scena è il volto che cambia tra un'inquadratura e l'altra. La soluzione è costruire un riferimento stabile: un'immagine del personaggio approvata, usata come input visivo insieme al prompt testuale. Descrivi sempre gli stessi tratti con le stesse parole — colore e taglio dei capelli, forma del viso, abbigliamento, accessori — perché una descrizione variabile produce un personaggio variabile. Se lo strumento supporta la fusione di più immagini di riferimento, combina un ritratto frontale, un profilo e un dettaglio del costume: il modello ricava un'identità più solida.
Riferimenti di stile e palette
La coerenza cromatica tiene insieme scene girate in momenti diversi. Definisci una palette di tre colori dominanti e ripetila in ogni prompt, insieme al tipo di luce. Se una scena è illuminata da una finestra laterale con luce calda, la scena successiva nello stesso ambiente deve dichiarare la stessa fonte luminosa, non una luce diffusa generica. Anche la grana e il contrasto vanno ripetuti: sono i dettagli che fanno sembrare un montaggio un progetto unico.
Raccordo tra inquadrature
Pensa in termini di raccordo cinematografico anche quando generi clip separate. Alterna piani larghi e primi piani, mantieni la direzione del movimento coerente tra un'inquadratura e la successiva, e cambia il punto di vista solo quando serve. Un errore frequente è generare cinque clip tutte con la stessa angolazione: il montaggio risulta piatto anche se ogni singola clip è ben fatta.
Storyboard, shot list e organizzazione della pipeline
Dal concept alla shot list
Prima di scrivere un solo prompt, scrivi la shot list. Per ogni inquadratura annota: numero, durata prevista, descrizione dell'azione, tipo di piano, movimento di camera, note di luce. Una shot list di dieci righe ti evita ore di tentativi casuali, perché ogni prompt nasce da una decisione già presa.
Versioning e naming
Usa una convenzione di nomi rigida, per esempio progetto_scena03_take02_seed4812. Senza versioning, dopo cinquanta generazioni non saprai più quale prompt ha prodotto la clip che ti piaceva. Conserva per ogni take il prompt completo, i parametri e il seed: è l'unico modo per ricostruire un risultato e per capire quali formulazioni funzionano nel tuo dominio.
Montaggio e ritmo
Genera sempre il dieci o quindici per cento di materiale in più rispetto al fabbisogno. In montaggio scoprirai che alcune clip non si incastrano per direzione del movimento o per temperatura colore, e avere alternative pronte evita di riaprire la fase di generazione. Tieni traccia delle clip scartate: spesso tornano utili come inserti o come transizioni.
Errori comuni e come correggerli
- Prompt sovraccarico: troppi soggetti, troppi aggettivi, troppi stili. Correzione: una scena, un'azione, uno stile dominante.
- Contraddizioni interne: «campo lunghissimo con dettaglio dei lineamenti». Correzione: scegli un solo tipo di inquadratura per prompt.
- Movimento eccessivo: camera che ruota mentre il soggetto corre mentre piove. Correzione: un solo movimento dominante per clip.
- Nessun negativo: il modello riempie i vuoti con elementi indesiderati. Correzione: elenco negativo standard più negativi specifici.
- Mancata fissazione del seed: impossibile replicare il take riuscito. Correzione: annota seed e parametri appena approvi una clip.
- Descrizioni variabili del personaggio: il volto cambia tra le scene. Correzione: vocabolario fisso e immagine di riferimento.
- Aspettative su testo e dettagli fini: loghi, scritte e piccoli oggetti restano instabili. Correzione: aggiungi testo e loghi in post-produzione.
- Formato deciso alla fine: composizioni sbagliate e soggetti tagliati. Correzione: definisci formato e durata prima di generare.
Workflow operativo in otto passi
- Definisci l'obiettivo: durata finale, piattaforma di pubblicazione, tono, pubblico. Da qui derivano formato e ritmo.
- Scrivi la shot list: una riga per inquadratura, con azione, piano e movimento.
- Costruisci il riferimento visivo del personaggio o del prodotto: un'immagine approvata vale più di dieci aggettivi.
- Scrivi il primo prompt per la scena più importante, non per la più semplice. Se il protagonista funziona, il resto è più facile.
- Genera da tre a cinque varianti cambiando un solo elemento per volta: luce, camera o intensità del movimento. Un esperimento controllato alla volta.
- Approva un take e congela i parametri: seed, prompt, formato, durata. Da quel momento lavori per continuità, non per esplorazione.
- Estendi la sequenza: applica la stessa formula alle altre inquadrature, cambiando solo piano e azione.
- Monta, corregge e rifinisci: stabilizzazione, upscaling, correzione colore, sound design e, se serve, sincronizzazione labiale.
Domande frequenti
Serve una conoscenza tecnica per scrivere buoni prompt? No, ma serve precisione nel linguaggio visivo. Sapere cosa significa controluce, focale corta o campo controcampo ti permette di descrivere esattamente ciò che vedi nella tua testa. Il vocabolario cinematografico di base è più utile di qualsiasi conoscenza di programmazione.
Quanto deve essere lungo un prompt? Tra le sessanta e le centotrenta parole è la fascia più affidabile. Prompt molto brevi lasciano troppe decisioni al modello, prompt molto lunghi diluiscono le informazioni importanti e aumentano il rischio che alcune istruzioni vengano ignorate.
Come evito che il personaggio cambi volto tra le inquadrature? Usando un riferimento visivo stabile e un vocabolario descrittivo identico in ogni prompt. Cambia il tipo di inquadratura e l'azione, mai le parole che descrivono l'identità del personaggio.
Perché il modello ignora una parte del mio prompt? Di solito perché quella parte è in fondo, è in conflitto con un'istruzione precedente o è troppo astratta. Sposta l'informazione all'inizio, elimina le contraddizioni e sostituisci gli aggettivi vaghi con dettagli osservabili.
Posso generare testo leggibile nei video? Raramente con risultati affidabili. La strategia professionale è generare la scena senza testo e aggiungere titoli, loghi e grafiche in post-produzione, dove hai controllo tipografico completo.
Come gestisco i movimenti di camera complessi? Un movimento per clip. Se la scena richiede un'inquadratura che si avvicina e poi ruota, spezzala in due clip e uniscile in montaggio: otterrai un risultato più pulito e avrai il controllo del ritmo.
Checklist finale e metriche di qualità
Prima di dichiarare finita una scena, verifica questi punti: il soggetto è riconoscibile e stabile per tutta la durata; la luce è coerente con le inquadrature adiacenti; il movimento di camera è leggibile e non distrae; la palette rispetta quella del progetto; non ci sono artefatti su mani, volti o bordi; il formato e il frame rate corrispondono al resto del montaggio; il seed e i parametri sono annotati.
Le metriche utili non sono solo estetiche. Misura il tasso di take utilizzabili per scena: se scarti più di otto clip su dieci, il problema è nel prompt o nella scelta del modello, non nella sfortuna. Misura anche il tempo medio per inquadratura approvata: è l'indicatore che migliora più rapidamente quando inizi a lavorare con una shot list invece che a tentativi. E misura la coerenza tra scene, cioè quante inquadrature richiedono una correzione colore in montaggio per sembrare parte dello stesso progetto.
La conclusione è semplice: la generazione video con intelligenza artificiale premia il metodo più del talento improvvisato. Un prompt scritto con struttura, parametri annotati, riferimenti visivi stabili e una shot list chiara trasforma uno strumento imprevedibile in una pipeline di produzione affidabile. Inizia dalla scena più difficile, congela ciò che funziona e costruisci il resto per continuità: è il percorso più breve tra un'idea e un video che puoi davvero pubblicare.


