Che cos'è il prompt chaining nel video storytelling
Il prompt chaining è la pratica di scomporre una visione video complessa in una sequenza ordinata di richieste più piccole, dove il risultato di ogni passaggio diventa il contesto, il vincolo o il riferimento visivo del passaggio successivo. Non è semplicemente "scrivere tanti prompt": è progettare una catena in cui ogni anello conserva le informazioni necessarie per non perdere identità, stile e direzione narrativa. Chi genera una clip isolata ottiene spesso un fotogramma spettacolare ma scollegato; chi lavora per catene costruisce un film.
La differenza fondamentale rispetto alla generazione singola è la gestione dello stato. In un unico prompt si affida tutto al modello: soggetto, ambiente, luce, movimento, durata, tono. Quando la storia si estende oltre pochi secondi, quella densità diventa un limite, perché il modello non ha memoria affidabile di ciò che ha prodotto prima. Il concatenamento introduce una memoria esterna, fatta di schede, descrizioni riutilizzabili, immagini di riferimento e annotazioni tecniche, che sopravvive alla singola generazione.
Nel video storytelling la posta in gioco è più alta che nella generazione di immagini statiche. Un volto che cambia leggermente tra due inquadrature può passare inosservato in una galleria fotografica, ma in un montaggio consecutivo salta immediatamente all'occhio. Lo stesso vale per la direzione della luce, la lunghezza focale percepita, il ritmo del movimento di camera e la palette cromatica. Il prompt chaining esiste per risolvere esattamente questi problemi di continuità.
Questa guida presenta un metodo operativo completo: come strutturare la catena, come serializzare i personaggi, come far dialogare modelli diversi, come gestire il movimento e come diagnosticare gli errori più frequenti. È pensata per chi produce cortometraggi, spot, contenuti social seriali, explainer aziendali o sequenze narrative per videogiochi, e vuole passare da clip casuali a un sistema ripetibile.
Perché la coerenza narrativa è il vero collo di bottiglia
La qualità tecnica dei modelli generativi è cresciuta più rapidamente della capacità degli autori di orchestrare storie lunghe. Oggi è relativamente semplice ottenere un'inquadratura convincente; è ancora difficile ottenere dodici inquadrature che sembrino appartenere allo stesso film. Il collo di bottiglia non è la risoluzione, né la fluidità del movimento: è la continuità.
La continuità si articola su quattro livelli distinti, e ognuno richiede una strategia diversa.
Continuità di identità. Il personaggio deve restare riconoscibile: struttura del viso, acconciatura, corporatura, abbigliamento, segni particolari. È il livello più visibile e il più difficile da mantenere quando cambia l'angolazione o l'illuminazione.
Continuità di spazio. Gli ambienti devono mantenere geografia coerente: dove si trova la porta, da che lato entra la luce, quale oggetto è sulla scrivania. Se la geografia cambia, lo spettatore percepisce uno stacco sbagliato anche senza saperlo razionalizzare.
Continuità di stile. Palette, contrasto, grana, tipo di ottica, linguaggio di movimento. Una sequenza può avere personaggi perfettamente identici e risultare comunque incoerente se il secondo piano sembra girato con un'altra macchina da presa e un'altra fotografia.
Continuità emotiva. Il tono della recitazione e il ritmo del montaggio devono seguire l'arco drammatico. Un momento di tensione girato con lo stesso respiro di una scena comica spezza l'immersione.
Il prompt chaining affronta questi quattro livelli in modo separato, invece di sperare che un unico prompt denso li risolva tutti insieme. Questa separazione è il cuore del metodo: ogni livello ha la sua documentazione, i suoi riferimenti e le sue verifiche.
Progettare la catena: dalla sceneggiatura ai segmenti
La catena non nasce dal prompt, nasce dalla sceneggiatura. Prima di scrivere qualsiasi richiesta, conviene produrre tre documenti brevi che resteranno aperti accanto all'interfaccia di generazione.
Il documento di segmentazione
Dividi la storia in unità minime chiamate shot. Ogni shot deve avere una sola funzione narrativa e una durata realistica: nella maggior parte dei casi tra due e otto secondi. Se un'unità contiene due azioni distinte, vale la pena spezzarla. Per ogni shot annota: numero progressivo, funzione drammatica, soggetto in campo, azione, tipo di inquadratura, movimento di camera, durata prevista e note di continuità.
Una tabella semplice funziona meglio di un documento discorsivo, perché costringe a essere sintetici e rende immediatamente visibili i salti logici. Se due shot consecutivi non condividono nulla, manca probabilmente un raccordo.
La bibbia visiva
La bibbia visiva raccoglie le decisioni estetiche globali: palette, temperatura colore, rapporto d'aspetto, tipo di illuminazione, epoca, materiali, atmosfera. È il documento che permette di tradurre lo stile in poche parole riutilizzabili in ogni prompt. Se la bibbia dice "luce morbida laterale, colori desaturati con accento ambra, grana fine da pellicola", quella formula entrerà in ogni richiesta, senza doverla reinventare.
La scheda di continuità
La scheda di continuità è la memoria operativa della catena. Contiene tutto ciò che deve rimanere invariato tra uno shot e l'altro: aspetto dei personaggi, oggetti di scena, posizione degli elementi, condizioni atmosferiche, ora del giorno. Va aggiornata solo quando la storia cambia davvero qualcosa, e ogni cambiamento deve essere intenzionale e annotato.
Definire la logica sequenziale
Con i tre documenti pronti, la catena si costruisce secondo una logica precisa: ogni prompt contiene un nucleo di continuità, una parte variabile e un'istruzione di raccordo. Il nucleo di continuità è copiato letteralmente dallo shot precedente; la parte variabile descrive solo ciò che cambia; l'istruzione di raccordo indica come il nuovo shot si collega al precedente, per esempio "continua il movimento di camera da sinistra a destra iniziato nello shot precedente".
Questa pratica riduce drasticamente la variabilità incontrollata, perché il modello riceve pochi elementi nuovi per volta. È molto più facile correggere un singolo parametro che rigenerare tutto da capo.
Serializzare gli attributi dei personaggi
La coerenza dei personaggi è il problema che genera più rigenerazioni, quindi merita un trattamento speciale. La soluzione più affidabile è la serializzazione degli attributi: trasformare il personaggio in una stringa descrittiva stabile, ordinata sempre nello stesso modo.
Come costruire una stringa di personaggio
Una buona stringa segue un ordine fisso e include solo elementi visivamente rilevanti. Per esempio: età apparente, corporatura, altezza relativa, capelli, tratti del viso, abbigliamento con colori e materiali, accessori, postura abituale, micro-espressione ricorrente. Mantenere lo stesso ordine in ogni prompt aiuta il modello a pesare gli attributi in modo coerente e aiuta te a individuare subito cosa manca.
Evita gli aggettivi valutativi come "affascinante" o "misterioso": non sono traducibili in pixel e introducono rumore. Preferisci descrizioni fisiche verificabili. Se un tratto è importante, ripetilo in ogni shot; se non lo è, eliminalo dalla stringa per non consumare attenzione.
Reference-to-video: quando usarlo e quando no
Le funzionalità di riferimento video o immagine permettono di ancorare il personaggio a un supporto visivo invece che a una descrizione testuale. Sono estremamente potenti, ma non vanno usate ovunque.
Usa un riferimento visivo quando il personaggio deve restare identico in molti shot, quando i tratti sono difficili da descrivere a parole, o quando serve un abbigliamento specifico con dettagli complessi. Evita il riferimento quando la scena richiede un cambio di look intenzionale, quando l'immagine di riferimento contiene un'illuminazione incompatibile con la nuova scena, o quando il volto è troppo piccolo per guidare il modello.
Il compromesso migliore nella maggior parte dei progetti è ibrido: riferimento visivo per gli shot in cui il personaggio è protagonista e riconoscibile, stringa testuale per i campi lunghi e le inquadrature di spalle, dove l'identità è suggerita dalla silhouette e dal costume.
Attenzione agli errori di deriva
La deriva del personaggio è progressiva: tende a peggiorare con la distanza dallo shot di ancoraggio. Per questo conviene riallineare periodicamente la catena, inserendo un nuovo riferimento visivo ogni quattro o cinque shot, oppure rigenerando lo shot che mostra il volto nel modo più frontale e usandolo come nuovo ancoraggio. Un controllo visivo a griglia, con i volti affiancati, rende la deriva evidente in pochi secondi.
Orchestrazione di più modelli nello stesso progetto
Nessun modello è il migliore su tutto. Alcuni eccellono nei primissimi piani realistici, altri nei movimenti di camera ampi, altri nella resa stilizzata o illustrata, altri ancora nel rispetto rigoroso delle istruzioni. Un progetto narrativo maturo distribuisce i compiti invece di forzare un unico strumento.
Mappatura dello stile narrativo
Prima di scegliere i modelli, definisci la mappa degli stili presenti nella storia. Un racconto può contenere sequenze realistiche, flashback stilizzati, inserti grafici e momenti onirici. Ogni stile riceve un trattamento dedicato: modello, parametri ricorrenti, riferimenti, formule di prompt. Così la catena non è una sola catena, ma un albero di catene parallele che convergono nel montaggio.
Passaggi di consegne tra modelli
Quando un segmento passa da un modello all'altro, il rischio è il salto visivo. Tre accorgimenti riducono il problema. Primo, mantenere la stessa formula di stile in entrambi i prompt, cambiando solo la parte descrittiva. Secondo, scegliere per il cambio un punto di montaggio naturale, come uno stacco su azione o un cambio di inquadratura ampia. Terzo, usare il fotogramma finale del segmento precedente come guida per il primo fotogramma del successivo, quando lo strumento lo consente.
Ordine di generazione
Una buona regola pratica è generare prima gli shot che definiscono l'identità e lo stile, cioè i piani ravvicinati del protagonista e l'inquadratura che stabilisce la fotografia della scena. Questi diventano gli ancoraggi. Solo dopo si generano i piani di raccordo, i campi lunghi e i dettagli. Lavorare al contrario, partendo dagli inserti, porta spesso a rigenerare tutto perché manca il riferimento principale.
Movimento, frame rate e coerenza cinematografica
Il movimento è la variabile che più facilmente rompe la sospensione dell'incredulità. Un personaggio con identità perfetta ma che scivola sul pavimento produce un effetto involontariamente comico. La coerenza del movimento richiede attenzione a tre aspetti.
Coerenza dei frame e della velocità percepita. Se una clip viene generata a una frequenza diversa dalle altre, il montaggio rivela un cambio di ritmo. Uniforma la frequenza di progetto e, se devi rallentare o accelerare un segmento, fallo in post-produzione in modo controllato, non affidandoti alla generazione.
Coerenza della direzione. Un movimento di camera verso destra nello shot A e verso sinistra nello shot B, con lo stesso soggetto, crea una sensazione di confusione. Definisci in anticipo la direzione dominante del movimento per ogni sequenza e rispettala.
Coerenza dell'inerzia. Corpi e oggetti devono rispettare una fisica plausibile. Nei prompt, descrivi il movimento in termini di velocità e accelerazione: "si alza lentamente, con un piccolo aggiustamento di equilibrio a metà movimento" funziona meglio di "si alza".
Un trucco utile è generare sempre un fotogramma di riferimento per ogni cambio di posizione del personaggio. Se il personaggio passa dalla sedia alla finestra, genera prima l'arrivo alla finestra e poi costruisci il movimento che ci conduce. Questo approccio a ritroso riduce le traiettorie impossibili.
Workflow operativo: un corto di sessanta secondi
Per rendere il metodo concreto, ecco come si struttura un corto narrativo di circa un minuto, composto da dodici shot da cinque secondi.
Fase 1 — Preparazione. Scrivi il soggetto in tre righe, poi la lista dei dodici shot con funzione narrativa. Compila bibbia visiva e scheda di continuità. Definisci due stringhe di personaggio.
Fase 2 — Ancoraggi. Genera lo shot 1, lo shot 6 e lo shot 12, cioè apertura, punto di svolta e chiusura. Sono i tre pilastri visivi. Se non funzionano, non proseguire: correggi identità e stile qui, dove il costo di rigenerazione è minimo.
Fase 3 — Riempimento in ordine narrativo. Genera gli shot 2-5, poi 7-11, mantenendo il nucleo di continuità e riallineando il riferimento visivo ogni quattro shot. Verifica ogni nuovo shot accanto al precedente, non isolato.
Fase 4 — Controllo di coerenza. Monta una sequenza grezza senza musica. Guardala a velocità normale una volta, poi fotogramma per fotogramma nei punti di stacco. Annota ogni problema in tre categorie: identità, spazio, stile.
Fase 5 — Correzioni mirate. Rigenera solo gli shot problematici, cambiando un solo parametro per tentativo. Se una correzione peggiora un altro aspetto, torna alla versione precedente invece di accumulare modifiche.
Fase 6 — Rifinitura. Uniforma colore e grana, stabilizza i movimenti residui, aggiungi audio e sound design. L'audio è spesso il collo di bottiglia percettivo: un suono ambiente continuo maschera piccole incoerenze visive meglio di qualsiasi correzione di prompt.
Errori comuni e come diagnosticarli
Il volto cambia lentamente. Causa tipica: nessun ancoraggio visivo recente. Soluzione: riallinea con un nuovo riferimento o rigenera lo shot frontale più vicino.
Il personaggio è identico ma sembra un altro film. Causa: incoerenza di stile, non di identità. Soluzione: confronta palette, contrasto e tipo di luce; riporta la formula di stile della bibbia visiva in ogni prompt.
Il movimento sembra pattinato. Causa: descrizione vaga dell'azione o frequenza incoerente. Soluzione: specifica velocità e punti di appoggio, uniforma la frequenza di progetto.
Gli oggetti si spostano tra gli shot. Causa: la scheda di continuità non elenca la posizione degli elementi. Soluzione: aggiungi una riga di geografia della scena e ripetila letteralmente.
Ogni rigenerazione peggiora le cose. Causa: troppe variabili modificate insieme. Soluzione: cambia un parametro per volta e conserva le versioni funzionanti.
Il tono emotivo è piatto. Causa: prompt puramente descrittivi, senza intenzione recitativa. Soluzione: aggiungi micro-azioni e ritmo, per esempio un respiro prima della battuta o uno sguardo che si sposta a metà frase.
Criteri di decisione: quando conviene una catena lunga
Il prompt chaining richiede tempo di progettazione. Non tutti i progetti lo giustificano. Conviene investire in una catena strutturata quando il video supera i trenta secondi, quando lo stesso personaggio appare in più di tre shot, quando il progetto fa parte di una serie con identità ricorrente, o quando il risultato deve superare una revisione professionale.
Conviene invece restare su prompt singoli quando si esplora uno stile, quando si producono varianti rapide per test creativi, quando il video è astratto e non richiede identità riconoscibili, o quando il tempo di consegna è di poche ore e la qualità di continuità non è un requisito.
Un criterio pratico: se prevedi di rigenerare più di due volte lo stesso shot per problemi di coerenza, la catena ti avrebbe fatto risparmiare tempo. Se invece ogni shot è indipendente e non condivide nulla con gli altri, la catena aggiunge solo burocrazia creativa.
FAQ
Il prompt chaining funziona anche con un solo modello? Sì, ed è il caso più comune. La catena è una struttura di lavoro, non una funzione di uno strumento specifico. Cambia solo il modo in cui passi i riferimenti: all'interno dello stesso modello usi immagini guida, descrizioni ripetute e continuazioni.
Quanto deve essere lungo un prompt in una catena? Più corto di quanto si pensi. Un prompt denso e confuso produce risultati incoerenti. Meglio un nucleo di continuità fisso, una parte variabile breve e una sola istruzione tecnica.
Serve una sola lingua per i prompt? No, ma la coerenza aiuta. Se mescoli lingue diverse, verifica che i termini tecnici siano tradotti in modo affidabile. Per progetti lunghi, una lingua unica riduce le ambiguità.
Come gestisco i cambi di costume? Trattali come nuovi personaggi: crea una variante della stringa con nome distinto, per esempio "protagonista — versione invernale", e usa un nuovo ancoraggio visivo per quella variante.
Posso riutilizzare una catena per un progetto diverso? Sì. La struttura, la bibbia visiva e le formule di stile sono riutilizzabili; cambiano solo le stringhe dei personaggi e la segmentazione.
Quante versioni devo conservare? Almeno una versione approvata per ogni shot, con nome che includa numero di shot e revisione. La disciplina dei nomi è ciò che rende possibile tornare indietro senza ricominciare.
Checklist finale prima del montaggio
Prima di dichiarare conclusa la catena, verifica questi punti. Tutti gli shot hanno lo stesso rapporto d'aspetto e la stessa frequenza di progetto. La formula di stile della bibbia visiva è presente in ogni prompt. Ogni personaggio ha una stringa aggiornata e un ancoraggio visivo recente. La scheda di continuità riflette lo stato finale della storia. Non esistono salti di direzione del movimento all'interno della stessa sequenza. Ogni shot ha una sola funzione narrativa. Le versioni approvate sono salvate con una nomenclatura leggibile. Hai guardato la sequenza senza audio almeno una volta, e con audio almeno un'altra.
Se tutti i punti sono soddisfatti, hai in mano qualcosa di più prezioso di dodici clip ben fatte: hai un sistema ripetibile. Ed è il sistema, non il singolo prompt, a trasformare la generazione video in regia.

