Qué significa realmente hacer prompt engineering de vídeo
Escribir un prompt de vídeo no es describir una escena con más adjetivos que en una imagen. Es diseñar instrucciones que un modelo pueda ejecutar a lo largo del tiempo, fotograma a fotograma, manteniendo la identidad de lo que aparece en pantalla y respetando una intención de montaje. Esa es la diferencia fundamental: en una imagen controlas un instante; en un clip controlas una secuencia de decisiones encadenadas donde cualquier inconsistencia se hace visible de inmediato.
Cuando hablamos de prompt engineering de vídeo nos referimos al proceso sistemático de construir, probar y refinar entradas de texto (y a menudo de imagen o audio) para obtener planos predecibles y reutilizables. Predecible no significa aburrido: significa que si cambias una sola variable —la hora del día, el objetivo de la cámara, el vestuario— sabes qué parte del resultado va a cambiar y cuál va a mantenerse estable. Esa previsibilidad es lo que separa a quien genera clips al azar de quien produce escenas que se pueden montar juntas.
La mayoría de los problemas que la gente atribuye a "la IA genera cosas raras" son en realidad problemas de especificación. Movimiento no definido, cámara ambigua, dos fuentes de luz contradictorias, un personaje descrito de forma distinta en cada plano. El modelo no adivina la intención; ejecuta la instrucción más probable. Si esa instrucción es vaga, el resultado será genérico.
Este artículo propone un enfoque práctico: entender la anatomía de un prompt de vídeo, dominar el vocabulario que realmente influye en el resultado, elegir el modelo adecuado para cada tipo de plano, mantener la coherencia entre tomas y encadenar herramientas para convertir fragmentos sueltos en una secuencia con sentido.
La anatomía de un prompt de vídeo que funciona
Un prompt de vídeo sólido se construye por capas. Cada capa responde a una pregunta distinta y conviene escribirla en un orden estable, porque muchos modelos ponderan más las primeras cláusulas. La estructura base que suele dar mejores resultados es: sujeto y acción, escena y contexto, cámara y encuadre, luz y color, movimiento y ritmo, estilo, restricciones.
Sujeto, acción y escena
El sujeto debe ser concreto y contable. "Una persona" genera un resultado distinto cada vez; "una ceramista de unos sesenta años con delantal de lino gris" fija identidad, edad, vestuario y textura en una sola frase. A continuación viene la acción, expresada con un verbo visible: no "está trabajando el barro", sino "gira el torno con la mano derecha mientras retira una viruta de arcilla con la izquierda". Los verbos observables producen movimiento real; los verbos mentales (piensa, recuerda, duda) no se pueden representar y suelen traducirse en planos estáticos.
La escena aporta el contexto material: ubicación, hora aproximada, objetos relevantes y atmósfera. Cuanto más específico sea el objeto, mejor se comporta el modelo. "Un taller" es débil; "un taller con estanterías metálicas, frascos de esmalte azul y una ventana alta con polvo suspendido" da al modelo puntos de anclaje sobre los que construir profundidad y parallax.
Cámara, lente y encuadre
Aquí es donde se gana o se pierde la sensación cinematográfica. Conviene indicar tipo de plano (primer plano, plano medio, plano general), ángulo (contrapicado, a la altura de los ojos, cenital), movimiento (estático, travelling lateral, dolly in, órbita, cámara en mano) y lente aproximada (gran angular, 50 mm, teleobjetivo con poca profundidad de campo).
Un error habitual es pedir dos movimientos incompatibles en el mismo plano, como "travelling lateral y zoom rápido". El modelo intenta ambos y produce deformaciones. Si necesitas dos movimientos, divídelos en dos planos y únelos en el montaje.
Luz, paleta y textura
La luz define el tono emocional más que ningún otro parámetro. Especifica dirección (luz lateral dura, contraluz, luz difusa cenital), calidad (suave, dura, práctica), hora (amanecer, mediodía, hora dorada, noche con farolas) y temperatura de color. Añade una paleta limitada: "tonos arena, verde oliva y sombra azulada" funciona mejor que "colores bonitos".
La textura también se puede pedir: grano fino de película, aspecto digital limpio, acabado de vídeo doméstico, render estilizado. Es una de las formas más rápidas de dar identidad visual a una serie de clips sin tocar la edición.
Movimiento y ritmo
El movimiento dentro del plano (lo que hace el sujeto) y el movimiento de cámara son cosas distintas y conviene separarlas en el texto. Indica velocidad: "giro lento y continuo", "paso rápido hacia la cámara", "goteo constante". Si el clip forma parte de un montaje, describe también el estado inicial y final del plano, porque eso facilita los cortes y las transiciones.
Estilo, referencias y límites
Las referencias de estilo ayudan cuando son descriptivas: "estética de documental de naturaleza de los años ochenta, teleobjetivo, colores desaturados". Las referencias a obras concretas funcionan de forma irregular y pueden arrastrar elementos no deseados. Es mejor describir los rasgos que te interesan que nombrar la fuente.
Los límites o restricciones negativas merecen su propia línea: "sin texto en pantalla, sin marcas de agua, sin manos adicionales, sin cambios de vestuario". Son especialmente útiles en planos con personas.
Vocabulario y sintaxis: cómo hablarle al modelo
Palabras que aportan control
El vocabulario técnico de rodaje es el que mejor se traduce a resultados: primer plano, plano detalle, contrapicado, travelling, dolly, grúa, cámara en mano, profundidad de campo reducida, luz rebotada, contraluz, hora dorada, niebla baja. Son términos con significado estable y el modelo los ha visto asociados a resultados concretos.
También funcionan los adjetivos medibles: lento, rápido, suave, entrecortado, continuo, sutil, marcado. En cambio, los adjetivos valorativos (hermoso, impresionante, épico) apenas cambian el resultado porque no describen nada representable.
Palabras que generan ruido
Las negaciones simples suelen empeorar el resultado: decir "sin coches" puede introducir coches. Cuando necesites excluir algo, usa una formulación positiva que describa lo que sí quieres ("calle peatonal vacía con adoquines mojados") y reserva la lista negativa para el final.
Las instrucciones contradictorias son otro foco de ruido: "minimalista y detallado", "oscuro pero luminoso", "realista pero estilizado". Si dudas entre dos direcciones, genera dos versiones y compáralas; mezclarlas produce un resultado intermedio que no satisface ninguna.
Orden de las cláusulas
Un orden estable te permite depurar. Por ejemplo: sujeto y acción → escena → cámara → luz → estilo → restricciones → parámetros técnicos. Cuando un plano falla, cambia un solo elemento de una sola capa y vuelve a generar. Si cambias cinco cosas a la vez, no aprendes nada sobre el modelo ni sobre tu propio prompt.
Elegir el modelo según el tipo de plano
No todos los modelos destacan en lo mismo. Antes de escribir el prompt conviene decidir qué modelo va a ejecutarlo, porque el prompt se adapta a sus fortalezas.
Los modelos orientados a realismo y física compleja rinden mejor en planos con agua, tela, humo o multitudes, donde la coherencia temporal es exigente. Los modelos orientados a estilización y animación permiten movimientos más expresivos y personajes no humanos con menos artefactos. Los modelos ligeros y rápidos son ideales para explorar variaciones de encuadre y luz antes de comprometerte con un render definitivo.
Algunas plataformas, como las suites de generación de vídeo basadas en modelos de difusión, ofrecen varios motores en el mismo entorno, lo que permite comparar sin cambiar de herramienta. Otras se especializan en control fino mediante imagen de referencia, máscaras o mapas de movimiento. La decisión práctica es: usa el modelo más controlable mientras buscas el plano, y el de mayor calidad final cuando ya tengas claro qué quieres.
Señales de que has elegido mal el modelo
Si el resultado ignora sistemáticamente el movimiento de cámara, el problema puede ser el modelo, no el prompt. Si los rostros se deforman en planos cercanos, prueba un motor especializado en retrato. Si los objetos cambian de forma entre fotogramas, necesitas un modelo con mejor coherencia temporal o un plano más corto. Y si todo sale con el mismo aspecto brillante y genérico, probablemente estés usando un motor muy estilizado para una escena que pedía sobriedad.
Consistencia de personajes y escenarios entre planos
La coherencia es el mayor reto del vídeo generativo, porque cada plano se genera de forma independiente. Si el personaje cambia de cara, de ropa o de peinado entre tomas, la secuencia se rompe.
Fichas de personaje reutilizables
Crea una ficha de texto para cada personaje y cópiala literalmente en todos los prompts. Debe incluir edad aproximada, etnia o rasgos físicos, peinado, vestuario completo con colores, y dos o tres detalles distintivos (una cicatriz, unas gafas de montura fina, un anillo). Repetir la misma redacción reduce la deriva.
Complementa la ficha con una imagen de referencia cuando el modelo la acepte. Una imagen base bien elegida aporta más consistencia que cien palabras adicionales.
Escenarios y objetos recurrentes
Haz lo mismo con las localizaciones: describe la misma habitación con las mismas palabras en cada plano, incluidos los objetos secundarios. Si en un plano hay una lámpara roja junto a la ventana, menciónala también en el plano siguiente aunque no sea protagonista. El espectador detecta estas continuidades de forma inconsciente y su ausencia genera una sensación de incoherencia difícil de justificar.
Estrategias de refuerzo
Cuando necesites máxima estabilidad, trabaja con planos cortos (dos a cuatro segundos), mantén la cámara relativamente fija y evita cambios bruscos de escala. Los planos largos con movimiento complejo son los que más deriva acumulan.
Encadenar modelos y añadir audio
Rara vez un único modelo resuelve todo el clip. El flujo más habitual encadena etapas: generar una imagen clave, animarla, interpolar fotogramas para alargar el movimiento, escalar la resolución y añadir audio.
El orden que mejor funciona
Primero define el aspecto visual con un modelo de imagen, porque es más rápido y barato iterar en estático. Después anima esa imagen con un modelo de imagen a vídeo, que hereda la composición y la identidad. Luego alarga o suaviza el movimiento con interpolación, y finalmente escala la resolución con una herramienta de mejora específica para vídeo, no con un escalador de imagen, porque el ruido temporal se comporta de forma distinta.
Audio, voz y sincronización
El audio se añade al final y se planifica antes. Decide si el clip llevará voz, ambiente o música, y si necesitas sincronía labial. Para voz, las herramientas de síntesis actuales permiten controlar tono, ritmo y pausas; para ambiente, conviene construir una capa base (sala, exterior, lluvia) sobre la que se monta todo lo demás.
Un truco útil: describe en el prompt de vídeo el tipo de sonido que esperas aunque el modelo no lo genere, porque a menudo influye en la energía del movimiento. Después sustituye ese audio por el definitivo en la edición.
Flujo de trabajo práctico paso a paso
- Escribe el guion de planos. Antes de tocar ninguna herramienta, divide la escena en planos de dos a cinco segundos con una frase cada uno: qué se ve, qué se mueve, qué cámara.
- Fija el mundo visual. Elige paleta, textura, tipo de luz y relación de aspecto. Escríbelo una vez y reutilízalo.
- Crea las fichas de personaje y localización. Texto literal, reutilizable, con detalles distintivos.
- Genera imágenes clave. Una por plano. Aquí decides composición y vestuario sin coste temporal alto.
- Convierte a vídeo. Usa la imagen como primer fotograma y añade en el prompt solo el movimiento y la evolución de la escena, no la descripción completa otra vez.
- Revisa fotograma a fotograma. Busca manos, ojos, bordes de objetos, cambios de color y objetos que aparecen o desaparecen. Anota cada fallo en una lista de correcciones.
- Itera con una variable por pasada. Cambia solo cámara, o solo luz, o solo vestuario. Guarda qué versión funciona.
- Alarga y estabiliza. Interpola, recorta los primeros y últimos fotogramas si son inestables, y escala la resolución.
- Monta. Ordena los planos, ajusta duraciones al ritmo del audio y añade transiciones solo cuando aporten algo.
- Documenta. Guarda los prompts finales como plantilla de serie. La siguiente escena te costará la mitad de tiempo.
Errores frecuentes y cómo corregirlos
Describir la escena pero no el movimiento. Si el clip sale casi estático, añade un verbo de acción visible y un movimiento de cámara explícito.
Repetir la ficha completa del personaje al animar. Cuando partes de una imagen clave, el modelo ya conoce el aspecto. Repetir el vestuario puede provocar cambios de ropa a mitad del plano. Deja en el prompt de animación solo acción y cámara.
Pedir demasiado en un solo plano. Cambios de localización, dos personajes nuevos y un giro de cámara no caben en cuatro segundos. Divide.
Ignorar la relación de aspecto hasta el final. Reencuadrar después destruye composiciones cuidadas. Decide el formato antes de generar.
Usar listas negativas largas. Cada negación introduce un concepto potencial. Reduce a dos o tres exclusiones críticas y formula el resto en positivo.
Mezclar luces incompatibles. "Luz de ventana suave y flash directo" produce resultados confusos. Una fuente principal, una de relleno.
No fijar el vestuario en planos con cambios de acción. Si el personaje corre, salta o se gira, el modelo puede reinterpretar la ropa. Menciona colores y prendas clave en cada plano de la secuencia.
Confundir resolución con calidad. Escalar no arregla un movimiento mal especificado. Primero arregla el movimiento, después la resolución.
Plantillas y ejemplos listos para adaptar
Plano de producto. "Primer plano de una botella de vidrio ámbar sobre superficie de piedra gris, gotas de condensación, cámara estática con ligero dolly in, luz lateral dura desde la izquierda, fondo negro, paleta ámbar y gris, acabado limpio y nítido, sin texto ni marcas de agua, dos segundos, formato cuadrado."
Plano de personaje en exterior. "Plano medio de [ficha de personaje], camina despacio hacia la cámara por una acera mojada, cámara en mano con ligero balanceo, hora azul, farolas encendidas al fondo desenfocado, paleta azul profundo y ámbar, grano fino, sin texto, cuatro segundos, formato vertical."
Plano atmosférico. "Plano general de un valle con niebla baja al amanecer, travelling lateral lento de izquierda a derecha, luz suave difusa, árboles recortados en silueta, paleta verde apagado y gris, textura de documental, movimiento constante y pausado, cinco segundos."
Plano de animación estilizada. "Plano detalle de un pequeño robot de latón que levanta la cabeza y parpadea con dos luces ámbar, fondo de taller desenfocado, cámara estática con ligera órbita, luz cálida de interior, acabado ilustrado con sombreado suave, sin texto, tres segundos."
Adapta cada plantilla cambiando solo lo que necesites. Si reescribes todo desde cero cada vez, pierdes la ventaja de tener un sistema.
Preguntas frecuentes
¿Cuánto detalle es demasiado? Cuando el prompt supera las ciento cincuenta o doscientas palabras y contiene elementos contradictorios o irrelevantes para el plano, el modelo empieza a repartir atención entre conceptos que no importan. Prioriza: identidad, acción, cámara, luz. Todo lo demás es opcional.
¿Debo escribir en inglés? Depende del modelo. Muchos están entrenados mayoritariamente en inglés y responden con más precisión en ese idioma, aunque los motores más recientes entienden bien español, portugués, francés, alemán, italiano, polaco y japonés. Si un prompt no funciona, tradúcelo al inglés antes de darlo por perdido.
¿Por qué el mismo prompt da resultados distintos? Porque la generación incorpora aleatoriedad. Para reducirlo, usa una semilla fija cuando el modelo lo permita, baja la variación creativa y mantén el prompt idéntico. Aun así, espera pequeñas diferencias.
¿Cómo alargo un clip más allá de su duración máxima? Genera un segundo plano que continúe el movimiento, o usa interpolación para estirar fotogramas. Alargar con interpolación funciona bien con movimientos lentos y mal con acciones rápidas.
¿Vale la pena generar imágenes clave antes del vídeo? Casi siempre. Iterar en imagen es más rápido y te obliga a resolver la composición antes de gastar tiempo en animación.
¿Cómo mantengo el mismo estilo en toda una serie? Escribe una plantilla de estilo de una sola línea —paleta, luz, textura— y añádela al final de todos los prompts. La consistencia viene de la repetición literal, no de la inspiración.
¿Qué hago si las manos salen mal? Evita que las manos sean protagonistas: encuádralas fuera, cúbrelas con un objeto o usa planos más cortos. Si necesitas manos visibles, reduce el movimiento y menciona la posición exacta en el prompt.
¿Necesito editar después de generar? Sí. El montaje, el color final, el audio y el recorte de fotogramas inestables se hacen en un editor. La generación produce material, no una película terminada.
Checklist antes de cada render
Antes de lanzar una generación, repasa cinco puntos: ¿el sujeto está definido con detalles concretos?, ¿hay un verbo de acción visible?, ¿el movimiento de cámara es único y compatible con la acción?, ¿la iluminación tiene una sola fuente principal?, ¿el formato y la duración coinciden con el plan de montaje? Si las cinco respuestas son afirmativas, el clip tiene muchas más probabilidades de ser utilizable a la primera.
El prompt engineering de vídeo no consiste en encontrar la frase mágica, sino en construir un sistema reproducible: vocabulario estable, fichas reutilizables, una variable por iteración y una plantilla de estilo común. Con ese sistema, la calidad deja de depender de la suerte y pasa a depender de decisiones que puedes documentar, repetir y mejorar.


