Un generador de vídeo por IA no lee tu mente: reconstruye una escena a partir de las palabras exactas que escribes. Por eso dos personas con la misma idea pueden obtener resultados radicalmente distintos. La diferencia casi nunca está en la herramienta, sino en cómo se describe el plano, la acción y la cámara. Esta guía explica cómo construir prompts que funcionen, cómo adaptarlos a distintos tipos de modelo y cómo mantener un estilo reconocible a lo largo de varias tomas.
Cómo funciona realmente un prompt de vídeo
Los modelos actuales de vídeo combinan arquitecturas de difusión con capas de atención temporal. Eso significa que no solo deciden cómo se ve un fotograma, sino cómo evoluciona hacia el siguiente. El prompt actúa como una especificación comprimida: cuanto más precisa sea esa especificación, menos margen deja el modelo a la improvisación. Cuando escribes «un perro corriendo», el modelo rellena cientos de decisiones por su cuenta: raza, luz, encuadre, velocidad, fondo, época del año. Cuando escribes «un galgo blanco corre sobre arena húmeda al amanecer, cámara baja lateral siguiendo al animal, luz cálida rasante, grano fino», esas decisiones se reducen drásticamente.
Existe además un sesgo interno en cada modelo, alimentado por los datos con los que fue entrenado. Algunos tienden al look cinematográfico saturado, otros a la textura de archivo, otros al render tridimensional limpio. Conocer ese sesgo es tan importante como conocer la sintaxis. Un prompt excelente para un modelo puede producir un resultado mediocre en otro, no porque uno sea mejor, sino porque esperan instrucciones distintas. La experimentación sistemática, cambiando una variable cada vez, es la única forma fiable de aprender ese comportamiento.
Otra consecuencia práctica: el prompt no es un contrato, es una negociación. Los modelos son probabilísticos y cada generación introduce variación. Por eso conviene trabajar con una versión base del prompt y modificarla de forma controlada, en lugar de reescribirlo entero cada vez que algo falla.
Los siete bloques de un prompt de vídeo eficaz
Un prompt sólido se puede descomponer en bloques que funcionan como casillas. No todos son obligatorios en cada caso, pero conocerlos evita olvidos que arruinan un plano.
Sujeto y apariencia
Define quién o qué aparece y con qué nivel de detalle. Edad aparente, vestuario, textura de piel o material, estado emocional. En vídeo, un detalle mal especificado se vuelve inconsistente entre fotogramas: si no dices que la chaqueta es de cuero negro, puede cambiar de color a mitad del plano.
Acción y verbo principal
El verbo gobierna el movimiento. «Camina», «se gira», «abre», «cae» producen resultados muy distintos de «está de pie». Un solo verbo dominante por plano funciona mejor que tres acciones encadenadas, que suelen confundir al modelo y producir transiciones borrosas.
Entorno y atmósfera
Lugar, hora del día, clima, densidad de elementos. Los modelos responden bien a contextos concretos: «azotea de un edificio en una ciudad costera, niebla baja, luces de ventanas encendidas». Los contextos abstractos («un lugar bonito») generan resultados genéricos.
Lenguaje de cámara
Aquí se gana o se pierde el realismo. Especifica tipo de plano (general, medio, primer plano), ángulo (picado, contrapicado, a la altura de los ojos), movimiento (travelling lateral, dolly in, órbita, cámara en mano) y velocidad. La mayoría de los clips decepcionantes fallan por falta de instrucción de cámara, no por falta de calidad del modelo.
Iluminación y paleta
La luz define el tono emocional. Contraluz suave, luz dura de mediodía, neón de noche, vela temblorosa. Añade una paleta limitada —dos o tres colores dominantes— y el resultado se vuelve coherente de inmediato y mucho más fácil de igualar en tomas posteriores.
Estilo y referencia visual
Puedes referenciar géneros o técnicas: documental, cine negro, animación en acuarela, stop motion, fotografía macro. Evita nombres de artistas vivos; además de problemas legales, suelen producir imitaciones superficiales. Es más útil describir rasgos: «contraste alto, sombras profundas, textura de película analógica».
Formato, duración y restricciones
Relación de aspecto, duración objetivo, movimiento de cámara permitido, elementos que no deben aparecer. Las restricciones negativas bien usadas («sin texto en pantalla», «sin deformaciones en las manos») ahorran muchas regeneraciones.
Adaptar el prompt a cada familia de modelos
No todos los modelos reaccionan igual, y agruparlos por comportamiento es más útil que memorizar nombres.
Modelos fotorealistas de alta fidelidad
Suelen responder mejor a descripciones densas y específicas, con vocabulario técnico de cámara y luz. Prefieren planos con un único sujeto y movimiento contenido. Si pides demasiados elementos simultáneos, tienden a «derretir» detalles finos como manos, ojos o texto. Ventaja: cuando aciertan, el resultado es indistinguible de metraje real.
Modelos de movimiento estilizado y animación
Aceptan mejor la exageración y la física imposible. Funcionan con descripciones más cortas y rítmicas, y agradecen indicaciones de tempo («movimiento rápido y elástico»). No conviene forzarlos hacia el fotorrealismo: es su peor terreno.
Modelos rápidos para exploración y borradores
Están pensados para iterar. Aquí la estrategia es la opuesta: prompts breves de una sola línea, muchas variaciones, y solo después trasladar la idea ganadora a un modelo de mayor fidelidad con un prompt reescrito en detalle. Usarlos para pulir el encuadre antes de invertir tiempo en un prompt completo ahorra horas.
Flujo de trabajo en siete pasos
- Define el objetivo del clip: ¿es un plano único, parte de una secuencia o material de archivo para montaje? Esto determina el nivel de detalle.
- Escribe una versión base de 15 a 25 palabras: sujeto, acción y entorno. Sin adornos.
- Añade cámara y luz: dos frases cortas. Son los dos campos con mayor impacto por palabra escrita.
- Genera tres variaciones cambiando solo un bloque cada vez, para identificar qué instrucción está causando el efecto.
- Selecciona y anota: guarda el prompt ganador con una etiqueta descriptiva. Tu biblioteca de prompts es el activo más valioso del proceso.
- Refina la coherencia: si el clip forma parte de una secuencia, replica los bloques de estilo, luz y paleta en las tomas siguientes.
- Prepara la entrega: decide resolución, relación de aspecto y si necesitarás interpolar o reencuadrar en postproducción.
Este ciclo convierte la generación en un proceso reproducible. Sin él, cada clip es una apuesta y el estilo nunca se estabiliza.
Coherencia visual entre tomas
La coherencia es el problema más frecuente al producir secuencias de más de un plano. La solución pasa por fijar un bloque de estilo literal y reutilizarlo palabra por palabra. Ese bloque debe contener: tipo de iluminación, paleta, textura, óptica sugerida y tono general. Todo lo demás —sujeto, acción, encuadre— cambia entre tomas.
Una práctica muy eficaz es crear dos capas de prompt: una capa fija de estilo y una capa variable de contenido. La capa fija pesa entre un 30 % y un 40 % del prompt total. Si al pegar la capa fija el modelo empieza a reproducir el mismo encuadre siempre, es señal de que has incluido elementos de cámara que deberían estar en la capa variable.
También ayuda trabajar con imágenes de referencia cuando el modelo lo permite: una imagen de encuadre y una de estilo. La imagen de estilo ancla la paleta y la textura mucho mejor que cualquier descripción textual, mientras que la imagen de encuadre fija la composición. La combinación de ambas reduce drásticamente la deriva visual entre tomas.
Por último, mantén un documento de continuidad donde anotes qué prompts produjeron qué tomas, con la fecha y el modelo usado. Cuando retomes el proyecto semanas después, ese documento vale más que cualquier apunte mental.
Errores comunes y cómo corregirlos
Sobrecomprimir el prompt. Cuando un prompt supera las cien palabras y mezcla cinco ideas, el modelo empieza a ignorar bloques enteros. Solución: divide en varios planos más cortos.
Olvidar la cámara. Sin instrucción de cámara, el modelo elige un plano medio estático casi siempre. Añade movimiento explícito y, si quieres quietud, dilo también: «cámara fija, trípode».
Contradecirse. «Atardecer luminoso y sombras nocturnas» produce resultados erráticos. Revisa que luz, hora y paleta no se contradigan.
Pedir texto legible. La mayoría de los modelos siguen fallando con tipografía pequeña. Si necesitas texto, resérvalo para postproducción.
Cambiar diez cosas a la vez. Si tras varias iteraciones el resultado no mejora, no sabrás por qué. Cambia una variable por generación.
Ignorar la física del movimiento. Acciones rápidas con muchos objetos producen desenfoques irreales. Reduce la velocidad o simplifica la escena.
No fijar la relación de aspecto desde el principio. Un formato elegido a mitad del proyecto obliga a reencuadrar y puede recortar elementos clave de la composición.
Plantillas listas para adaptar
Estas plantillas son puntos de partida. Sustituye los corchetes y mantén la estructura.
Anuncio de producto
«Plano [primer plano/macro] de [producto] sobre [superficie], [acción lenta: gira, se abre, gotea], fondo [color/material] desenfocado, luz [suave lateral/dura], cámara [dolly in lento], paleta [dos colores], estética publicitaria limpia, sin texto».
Escena narrativa
«[Personaje con dos rasgos distintivos] [acción principal] en [lugar concreto], [hora y clima], tercer plano de fondo con [elemento secundario], luz [tipo] con [dirección], travelling [lateral/lento] a la altura de los ojos, tono [melancólico/tenso/cálido], grano fino».
Clip vertical para redes
«Formato vertical, [sujeto] en el centro del encuadre, [acción breve y clara], fondo [color saturado], luz frontal suave, cámara fija con ligero zoom, ritmo rápido, alto contraste, sin texto en pantalla».
B-roll abstracto
«Macro de [material: tinta, humo, agua, tela] en movimiento lento, luz [contraluz/rasante], fondo [oscuro/claro] uniforme, cámara orbital lenta, paleta monocromática, textura orgánica, sin elementos reconocibles».
Audio, ritmo y montaje
El vídeo generado rara vez viene con sonido utilizable, así que planifica la banda sonora desde el guion. Un truco útil: escribe el prompt pensando en el ritmo del montaje final. Si el plano durará dos segundos, no necesitas una coreografía compleja; si durará ocho, necesitas movimiento continuo o el clip se sentirá congelado.
Para el montaje, deja un margen de entre diez y quince por ciento de duración extra en cada clip generado. Ese margen permite recortar transiciones imperfectas y ajustar el corte al ritmo de la música. Los fundidos cortos de tres a cinco fotogramas disimulan mejor las discontinuidades que los cortes duros cuando hay deriva visual entre tomas.
El color es la última capa de unificación. Aplicar una tabla de conversión común a todos los clips hace que las diferencias de modelo, luz o paleta se perciban como estilo deliberado en lugar de error. Si trabajas con varias herramientas, exporta siempre en el mismo espacio de color y resolución antes de unificar.
Criterios de decisión: refinar o regenerar
Saber cuándo insistir y cuándo empezar de nuevo ahorra mucho tiempo. Usa estos criterios:
- Si el fallo está en la composición o el encuadre, reescribe el prompt. Ninguna regeneración casual lo arreglará.
- Si el fallo está en detalles pequeños y aleatorios —una mano, un pliegue, un reflejo—, regenera dos o tres veces antes de tocar el texto.
- Si el movimiento es correcto pero el ritmo no, ajusta la velocidad y la duración, no el contenido.
- Si llevas cuatro intentos con el mismo prompt y el resultado no mejora, cambia de enfoque: simplifica la escena o divide el plano.
- Si el estilo general es bueno pero no encaja con la secuencia, corrige la capa de estilo, no la de contenido.
Además, decide de antemano cuántos intentos estás dispuesto a dedicar a cada plano. Un límite explícito evita la trampa de la iteración infinita, en la que se consume tiempo sin mejorar el resultado.
Preguntas frecuentes
¿Cuántas palabras debe tener un buen prompt?
Entre veinte y sesenta palabras cubren la mayoría de casos. Los prompts muy cortos dejan demasiadas decisiones al modelo; los muy largos diluyen la instrucción. Si necesitas más detalle, considera dividir la escena en dos planos.
¿Funcionan los prompts en inglés aunque escriba en español?
Muchos modelos rinden algo mejor en inglés por el sesgo de sus datos de entrenamiento, pero la diferencia se ha reducido mucho. Si escribes en español, mantén una terminología consistente y evita mezclar idiomas dentro del mismo prompt, porque introduce ruido.
¿Cómo evito que los personajes cambien de aspecto entre tomas?
Fija una descripción breve y muy concreta —dos o tres rasgos visuales distintivos— y repítela literalmente en cada prompt. Añade una imagen de referencia del personaje si el modelo lo permite. Cuanto más larga sea la descripción, más probable es que el modelo omita partes.
¿Qué hago si el modelo ignora mi instrucción de cámara?
Coloca la instrucción de cámara al principio del prompt en lugar del final. Algunos modelos ponderan más las primeras palabras. Si aun así la ignora, cambia el vocabulario: en lugar de «travelling», prueba «la cámara se desplaza lentamente hacia la derecha».
¿Vale la pena guardar todos los prompts?
Sí. Una biblioteca organizada por tipo de plano, estilo y modelo es el activo reutilizable más rentable de un flujo de trabajo con IA. Con el tiempo, reutilizar un prompt probado es mucho más rápido que escribirlo desde cero.
¿Cómo consigo un look cinematográfico sin imitar a nadie?
Describe los rasgos técnicos en lugar de la fuente: contraste, profundidad de campo, temperatura de color, textura de grano, tipo de objetivo. Ese vocabulario produce resultados consistentes y reutilizables en cualquier modelo.
¿Cuándo conviene pasar a postproducción?
En cuanto tengas un clip cuya composición y movimiento funcionen, incluso si el color o algún detalle no son perfectos. Corregir en edición suele ser más rápido y más barato que seguir generando variaciones para lograr la toma perfecta.

