Pourquoi un prompt vidéo obéit à des règles différentes d'un prompt image
Un prompt d'image fixe décrit un état : un sujet, un décor, une lumière, un cadrage. Un prompt vidéo décrit une transformation continue. Le modèle doit comprendre ce qu'il voit, mais aussi anticiper comment chaque élément va bouger, se déformer, s'éclairer et interagir avec les autres pendant plusieurs secondes. C'est cette dimension temporelle qui rend l'exercice plus exigeant — et plus intéressant à maîtriser.
Quand une image générée déçoit, on la relance et on obtient une variante. Quand une vidéo déçoit, l'erreur se déploie dans le temps : un visage qui se déforme à la troisième seconde, un bras qui traverse un mur, une caméra qui avance puis recule sans raison, une lumière qui change de direction entre deux images. Ces défauts viennent rarement du hasard. Ils viennent presque toujours d'un prompt qui a laissé trop de liberté au modèle sur un point précis.
La bonne nouvelle, c'est que la génération vidéo réagit très bien à la structure. Un prompt vidéo efficace ressemble moins à une phrase poétique qu'à une courte note de réalisation : qui agit, où, comment la caméra se comporte, quelle est la qualité de lumière, quel format est attendu. Les modèles ne devinent pas vos intentions, ils remplissent les vides que vous avez laissés.
Il faut aussi accepter une part d'aléatoire. Deux rendus lancés avec le même prompt ne seront jamais totalement identiques. L'objectif n'est donc pas d'écrire le prompt parfait du premier coup, mais d'écrire un prompt suffisamment cadré pour que la majorité des variantes soient exploitables au montage.
L'anatomie d'un prompt vidéo qui fonctionne
Un prompt vidéo solide se lit comme une fiche technique condensée. On y trouve quatre blocs : le noyau narratif, le mouvement, la lumière et le rendu, puis le format. Tant que ces quatre blocs sont présents, l'ordre importe peu — même si placer le sujet en tout premier donne généralement de meilleurs résultats, car les modèles pondèrent davantage le début de la consigne.
Le noyau : sujet, action, décor
C'est la phrase la plus importante. Elle doit répondre à trois questions : qui ou quoi, fait quoi, dans quel environnement. Évitez les formulations vagues du type « une belle scène de ville ». Préférez « une livreuse en veste jaune remonte une ruelle pavée, un carton de fleurs sous le bras ». Plus le sujet est précis, plus le modèle a de prise.
Un piège fréquent consiste à empiler les adjectifs sans hiérarchie. « Magnifique, épique, incroyable, cinématographique » n'apporte aucune information visuelle. Chaque adjectif devrait décrire quelque chose de vérifiable à l'image : la matière d'un vêtement, l'âge approximatif d'un personnage, l'état d'un mur, la couleur d'un ciel.
Le mouvement : caméra, sujet, éléments secondaires
Dans un prompt vidéo, le mouvement se décrit sur trois niveaux. Le mouvement de caméra (travelling, panoramique, caméra portée), le mouvement du sujet (marche, saut, rotation lente), et le mouvement des éléments secondaires (fumée qui monte, feuilles qui tombent, foule qui circule). Si vous ne précisez rien, le modèle choisira à votre place — et ce choix sera souvent un léger zoom automatique peu excitant.
La lumière et le rendu visuel
La lumière est le levier le plus sous-estimé. « Lumière dorée de fin d'après-midi, contrastes doux, ombres longues » produit un rendu radicalement différent de « néons froids, contraste élevé, reflets sur sol mouillé ». Pensez en termes de direction (face, latérale, contre-jour), de qualité (douce, dure, diffuse) et de température de couleur.
Ajoutez ensuite le rendu : photographique, argentique, animation stylisée, 3D propre, maquette en papier. Ce simple mot change la grammaire visuelle de toute la séquence et évite les mélanges incohérents entre deux plans.
Le format et la durée
Indiquez le ratio (16:9, 9:16, 1:1), la durée visée si l'outil le permet, et la cadence souhaitée. Un plan vertical pensé pour un réseau social ne se compose pas comme un plan large de cinéma : le sujet doit rester dans la zone centrale. Ce détail technique évite des recadrages approximatifs en post-production.
Voici une structure réutilisable :
[Sujet + action précise] dans [décor concret], [mouvement de caméra],
[mouvement du sujet], [éléments secondaires en mouvement],
[qualité et direction de la lumière], [style de rendu],
[ratio], [durée], [contraintes négatives]
Construire un vocabulaire de caméra compris par les modèles
Les modèles vidéo ne sont pas des directeurs photo. Ils reconnaissent cependant très bien un vocabulaire emprunté au tournage réel, à condition de l'employer avec parcimonie : deux indications de caméra par plan suffisent.
Les mouvements de base
Travelling avant (la caméra se rapproche), travelling arrière (elle s'éloigne), panoramique horizontal ou vertical (elle tourne sur son axe), caméra portée (image légèrement instable, sensation documentaire), grue ou drone (élévation ou plongée), orbite (rotation autour du sujet). Ces termes produisent des résultats nettement plus stables qu'une description littéraire du genre « la caméra a l'air de flotter doucement ».
Valeurs de plan et focales
« Plan large », « plan taille », « gros plan », « très gros plan » orientent directement la composition. Ajouter une focale — 24 mm pour un effet large et immersif, 85 mm pour un portrait compressé et flatteur — améliore la perception de profondeur. En revanche, multiplier les indications contradictoires (« gros plan en plan large ») produit des images instables et des morphings désagréables.
Rythme et vitesse
Précisez si l'action est lente, fluide, saccadée, ou ralentie. Un ralenti élégant demande une action simple : une chevelure qui bouge, une goutte qui tombe, un tissu qui flotte. Un ralenti sur une action complexe devient vite une bouillie de pixels.
La cohérence des personnages sur plusieurs plans
C'est le mur contre lequel bute la majorité des projets. Un plan isolé peut être superbe et le suivant totalement inutilisable parce que le visage, la coiffure ou la veste ont changé.
La fiche personnage
Rédigez une fiche courte et figée : âge apparent, morphologie, couleur et coupe de cheveux, signe distinctif, tenue complète avec matières et couleurs. Cette fiche ne doit plus bouger d'un plan à l'autre. Copiez-la telle quelle dans chaque prompt. Toute variation d'un adjectif produira une variation du visage.
L'image de référence
La méthode la plus fiable reste de générer d'abord une image clé du personnage, de la valider, puis de l'utiliser comme référence pour les plans suivants dans un mode image-vers-vidéo. Le texte seul, même très détaillé, dérive davantage. Considérez l'image validée comme votre bible visuelle.
Continuité de décor, de lumière et de costume
La cohérence ne concerne pas seulement le visage. Si le plan 1 se déroule dans une lumière chaude et le plan 2 dans une lumière froide sans justification narrative, le spectateur ressent une rupture. Décidez d'une palette et d'une direction de lumière pour toute la séquence, et rappelez-les brièvement dans chaque prompt.
Le piège du plan unique parfait
Beaucoup de créateurs passent des heures à peaufiner un plan magnifique, puis découvrent qu'il ne s'enchaîne avec rien. Anticipez dès l'écriture : chaque plan doit avoir une fonction (établir, révéler, réagir, conclure) et un point de coupe prévu. Un bon plan seul vaut moins qu'une séquence moyenne mais fluide.
Adapter sa formulation au type de modèle
Tous les moteurs de génération ne réagissent pas de la même manière. La compétence clé consiste à reconnaître la famille d'outil et à ajuster la densité du prompt.
Modèles courts à image unique enrichie
Ces moteurs excellent sur des plans de quelques secondes avec un sujet unique et une action simple. Leur point fort est la qualité d'image, leur faiblesse est la mémoire temporelle. Utilisez des prompts courts, une seule action, un seul mouvement de caméra. Évitez les enchaînements du type « il entre, s'assoit, puis se retourne » dans un seul rendu.
Modèles séquentiels et plans longs
D'autres moteurs gèrent mieux la continuité d'action sur plusieurs secondes. Ils acceptent des descriptions narratives plus longues, mais perdent en précision sur les détails fins. Fractionnez les actions en micro-étapes ordonnées et placez la plus importante au début.
Image-vers-vidéo et vidéo-vers-vidéo
En image-vers-vidéo, le prompt ne décrit plus l'apparence mais uniquement le mouvement : « la fumée s'échappe lentement vers la gauche, la caméra recule de trente centimètres ». Décrire à nouveau le personnage est inutile et peut même perturber le modèle. En vidéo-vers-vidéo, on parle plutôt de style, de texture et de traitement colorimétrique.
Comment choisir en pratique
Trois critères suffisent : la durée nécessaire du plan, le besoin de continuité de personnage, et le niveau de contrôle du mouvement. Un plan court et autonome : moteur à image unique. Un plan long avec action continue : moteur séquentiel. Un personnage récurrent : image-vers-vidéo adossé à une image validée. Testez toujours le même prompt sur deux outils avant d'en tirer des conclusions sur votre écriture.
Un workflow en cinq étapes, du script au rendu final
1. Découper le script en plans
Écrivez votre idée en quelques lignes, puis découpez-la en plans de deux à six secondes. Chaque plan doit tenir sur une phrase : une intention visuelle, une action. Un découpage trop ambitieux est la première cause de déception.
2. Écrire le prompt-mère
Rédigez un prompt de référence long et complet pour le plan clé de la séquence : celui qui contient le personnage principal. Ce prompt-mère servira de base à tous les autres. Il contient la fiche personnage, la palette, le style de rendu et les contraintes de format.
3. Générer des variantes courtes
Déclinez ensuite des prompts plus courts pour les autres plans, en conservant la fiche personnage et la palette, mais en ne changeant que l'action et le mouvement de caméra. Lancez systématiquement plusieurs variantes par plan : c'est moins coûteux que de retoucher une mauvaise prise.
4. Sélectionner, puis affiner un seul paramètre à la fois
Choisissez la meilleure variante, puis corrigez un seul élément : la vitesse du mouvement, la direction de la lumière, l'angle. Modifier cinq paramètres simultanément rend impossible de savoir ce qui a amélioré ou dégradé le résultat. Notez vos versions à mesure.
5. Assembler et finaliser
Montez vos plans dans l'ordre, coupez au bon moment, ajoutez sons et musique, puis appliquez un étalonnage commun qui unifie la séquence. Un même filtre léger sur tous les plans masque une grande partie des micro-différences de couleur entre rendus.
Les erreurs fréquentes et comment les corriger
- Trop de détails contradictoires : le modèle oscille entre deux apparences. Gardez une seule description par élément.
- Aucune indication de mouvement : la vidéo reste statique ou fait un zoom automatique. Ajoutez un mouvement de caméra et un mouvement de sujet.
- Actions multiples dans un plan court : le rendu devient chaotique. Découpez en deux plans.
- Fiche personnage modifiée entre deux plans : le visage change. Copiez-collez la fiche à l'identique.
- Négations mal formulées : « pas de foule » peut paradoxalement faire apparaître une foule. Décrivez plutôt ce que vous voulez voir : « rue déserte ».
- Prompts trop poétiques : « une atmosphère d'éternité suspendue » n'indique rien de visuel. Traduisez en éléments concrets.
- Absence de format : le ratio par défaut ne correspond pas à votre montage, ce qui entraîne des recadrages destructeurs.
Dépannage : symptômes, causes probables, correctifs
| Symptôme | Cause probable | Correctif |
|---|---|---|
| Visage qui fond à mi-plan | Fiche personnage absente ou action trop complexe | Raccourcir le plan, ajouter une image de référence |
| Mouvements de mains irréalistes | Trop d'action simultanée | Simplifier l'action, cadrer plus large |
| Couleurs qui sautent entre plans | Palette non définie | Fixer une direction de lumière et un rendu communs |
| Caméra incontrôlée | Prompt sans indication de caméra | Ajouter un seul mouvement explicite |
| Décor qui se déforme | Description trop vague ou trop longue | Décrire deux ou trois éléments fixes seulement |
| Résultat plat | Aucune indication de lumière | Préciser direction, qualité et température |
Check-list avant chaque rendu
- La fiche personnage est-elle identique au plan précédent ?
- Une seule action principale par plan ?
- Un seul mouvement de caméra, explicite ?
- Direction, qualité et température de lumière indiquées ?
- Style de rendu mentionné une seule fois ?
- Ratio et durée conformes au montage prévu ?
- Avez-vous lancé au moins trois variantes ?
FAQ
Combien de mots doit contenir un prompt vidéo ?
Il n'existe pas de longueur idéale, mais un bon repère se situe entre trente et soixante mots pour un plan simple. Au-delà, chaque phrase doit apporter une information visuelle nouvelle. Si vous ajoutez des mots sans ajouter d'information, vous diluez le prompt.
Faut-il écrire ses prompts en anglais ?
L'anglais reste souvent le mieux compris, notamment pour le vocabulaire technique de caméra et de lumière. Cependant, dans une logique de production, il est plus efficace d'écrire dans la langue où vous pensez vos intentions, puis de traduire les termes techniques. Le plus important est la constance : gardez le même vocabulaire d'un plan à l'autre.
Comment éviter qu'un personnage change d'apparence entre deux plans ?
Trois leviers : une fiche personnage figée et copiée à l'identique, une image de référence validée utilisée en mode image-vers-vidéo, et une simplification des actions. Les gros plans sont plus risqués que les plans moyens pour les visages générés.
Pourquoi ma vidéo fait-elle toujours un zoom lent ?
C'est le comportement par défaut de nombreux moteurs quand aucun mouvement n'est spécifié. Indiquez explicitement ce que vous voulez : « caméra fixe, sujet qui marche vers la droite ». Vous pouvez aussi demander un plan statique, ce qui est parfaitement valable pour un insert.
Combien de variantes faut-il générer par plan ?
Trois à cinq variantes par plan est un bon équilibre entre qualité et temps de travail. Générer dix fois le même prompt avec un mot changé est rarement rentable : il vaut mieux tester deux formulations réellement différentes.
Comment traiter une séquence avec beaucoup de dialogues ?
Générez des plans courts sans dialogue, puis ajoutez les voix en post-production. Tenter de synchroniser une bouche générée avec une réplique précise reste aujourd'hui peu fiable et coûte beaucoup de temps. Le champ-contrechamp fonctionne mieux : un plan d'écoute, un plan de réaction, puis un plan d'ensemble.
Peut-on réutiliser un prompt d'un projet à l'autre ?
Oui, et c'est même recommandé. Créez une bibliothèque personnelle : fiches personnages, blocs de lumière, mouvements de caméra types, formats. Vous gagnerez énormément de temps en assemblant ces briques plutôt qu'en réécrivant chaque prompt depuis zéro.




