Start Free Now
Limited Time Offer: Get 50% OFF Starter & Basic Yearly Plans 🎉

De texto a vídeo con IA: guía práctica de prompting

Sep 21, 2026

Qué ha cambiado en la producción de vídeo con IA

Hace pocos años, generar vídeo a partir de una descripción escrita era una curiosidad técnica. Los resultados tenían manos deformes, fondos que se derretían y una coherencia temporal mínima: el sujeto cambiaba de ropa entre planos o la cámara atravesaba paredes. Hoy la situación es muy distinta. Los modelos de difusión para vídeo aprendieron a razonar sobre física básica, iluminación y continuidad, y eso permite usar estas herramientas en flujos de trabajo reales: publicidad, redes sociales, formación interna, prototipado de ideas para cine y series, presentaciones de producto y contenido educativo.

El cambio importante no es solo la calidad visual, sino la previsibilidad. Un equipo puede iterar sobre un storyboard, generar variantes, elegir la mejor y seguir trabajando sobre ella sin empezar de cero. Eso convierte el vídeo generativo en una etapa más del pipeline de producción, no en un truco para redes sociales. Cuando el proceso está bien diseñado, la IA deja de ser un generador de sorpresas y se convierte en un colaborador que responde a instrucciones.

También cambió quién puede producir. Un diseñador gráfico sin equipo de rodaje puede entregar un anuncio de treinta segundos. Un profesor puede ilustrar un concepto abstracto en dos minutos. Una startup puede probar veinte versiones de un mensaje antes de invertir en una filmación real. La barrera técnica bajó, pero subió la exigencia de criterio: saber qué pedir, cómo evaluar y cuándo conviene rodar de verdad.

Este artículo propone un flujo de trabajo completo, desde la idea hasta el archivo final, con criterios concretos para elegir modelos, escribir prompts útiles, mantener personajes consistentes, construir audio y corregir los fallos más habituales. No es una lista de trucos: es una forma de trabajar que se puede repetir en equipo.

Cómo funciona un modelo de texto a vídeo por dentro

No hace falta ser ingeniero para trabajar bien con estas herramientas, pero entender qué ocurre bajo el capó ahorra horas de prueba y error.

Del espacio latente a los fotogramas

Los modelos actuales trabajan en dos fases. Primero interpretan el texto: lo convierten en una representación numérica que captura sujetos, relaciones, atributos y estilo. Después generan el vídeo en un espacio latente comprimido, donde la información visual ocupa mucho menos que los píxeles finales, y finalmente decodifican ese latente a fotogramas visibles. Esta arquitectura es la razón por la que un prompt vago produce resultados genéricos: el modelo rellena los huecos con lo más probable, que suele ser también lo más común y lo menos interesante.

Coherencia temporal y atención

El gran reto del vídeo no es pintar un fotograma bonito, sino mantenerlo estable. Los mecanismos de atención temporal permiten que el modelo relacione el fotograma actual con los anteriores y los posteriores, de forma que un personaje conserve su cara, su ropa y su dirección de movimiento. Cuando la coherencia falla, casi siempre es por tres motivos: el prompt introduce contradicciones, la duración supera lo que el modelo gestiona bien, o el movimiento pedido es demasiado complejo para el número de pasos disponible.

Qué variables controlas tú

Aunque cada herramienta nombra sus ajustes de forma distinta, casi todas exponen las mismas palancas: duración del clip, relación de aspecto, resolución, semilla o identificador de variación, intensidad del movimiento, fidelidad a una imagen de referencia y énfasis del texto. Saber qué palanca mover ante un problema concreto es la diferencia entre resolverlo en un intento o en veinte. Si el resultado tiembla, reduce movimiento; si el personaje cambia, añade referencias; si la escena se derrite, acorta duración.

Resolución, pasos y tiempo de generación

La resolución final suele construirse en etapas: primero una pasada rápida a baja resolución para validar composición y movimiento, después un refinado y, en muchos casos, una ampliación posterior. Este orden importa porque permite descartar ideas malas antes de gastar tiempo en detalles finos. Trabajar siempre a máxima calidad desde el primer intento es una de las formas más rápidas de perder una tarde.

Semillas y reproducibilidad

Guarda la semilla o el identificador de variación de cada resultado aprobado. Es la única manera de volver a un clip que funcionó cuando necesitas un plano muy parecido. Cuando exploras, en cambio, cambia la semilla deliberadamente: pequeñas variaciones de semilla producen diferencias de encuadre, expresión y luz que a veces son mejores que cualquier ajuste manual del texto.

Del brief al storyboard antes de escribir el prompt

El error más caro consiste en abrir la herramienta y empezar a escribir. El prompt es la última pieza, no la primera.

Los cinco pasos previos

  1. Define el objetivo: informar, emocionar, vender, enseñar.
  2. Escribe una frase de intención, por ejemplo: mostrar en diez segundos que el producto resiste el agua.
  3. Divide en planos. Un clip de cinco a ocho segundos por plano es un punto de partida seguro.
  4. Describe cada plano con sujeto, acción, entorno, luz y cámara.
  5. Anota qué elementos deben permanecer idénticos entre planos: rostro, vestuario, paleta, hora del día.

Tabla de planos sencilla

Antes de generar, construye una tabla con estas columnas: número de plano, duración objetivo, función narrativa, descripción visual, movimiento de cámara, audio previsto y notas de continuidad. Esta tabla se convierte luego en la lista de prompts y, sobre todo, en la lista de comprobación para revisar resultados. Un plano sin función narrativa es un plano que se puede eliminar sin que nadie lo note, y esa claridad ahorra mucho trabajo.

Referencias y tablero de estilo

Reúne de cinco a diez imágenes que representen el tono, la paleta y la textura que buscas. No son referencias para copiar, son anclas de estilo. Si el proyecto es de marca, añade una restricción de color y una regla de composición. Cuanto más concreto sea el tablero, menos tendrás que explicar dentro de cada prompt.

Por qué el storyboard ahorra esfuerzo

Generar sin planificar produce clips bonitos que no encajan entre sí. El resultado típico son veinte fragmentos sueltos que no se pueden montar. Con una tabla de planos, cada generación tiene un propósito y se descarta rápido lo que no encaja. El ahorro real no está tanto en el coste por generación como en las horas de edición y en las decisiones que se toman con criterio.

Anatomía de un prompt que funciona

Un prompt eficaz es una frase descriptiva con jerarquía. No es poesía ni una lista de palabras sueltas, y tampoco es una conversación larga.

La estructura de cinco capas

  • Sujeto: quién o qué aparece, con detalles distintivos.
  • Acción: qué hace exactamente en ese clip.
  • Entorno: lugar, hora, clima, materiales.
  • Luz y color: fuente de luz, dirección, temperatura, paleta.
  • Cámara: plano, altura, lente, movimiento y ritmo.

Ejemplo débil: un hombre camina por la ciudad.

Ejemplo trabajado: plano medio lateral de un hombre de unos cuarenta años con abrigo azul marino, camina despacio bajo la lluvia por una acera mojada, farolas amarillas reflejadas en los charcos, luz nocturna de contraste suave, cámara en travelling lateral a la misma velocidad que el sujeto.

El segundo prompt no es más largo por capricho: elimina ambigüedades que el modelo resolvería al azar.

Verbos concretos y magnitud

Los modelos responden mejor a acciones medibles. Se mueve es vago; da tres pasos y se detiene es concreto. La cámara se acerca es interpretable; la cámara se acerca despacio hasta un primer plano del rostro da un objetivo. Añadir magnitud y dirección reduce la varianza entre intentos y facilita la continuidad con el plano siguiente.

Restricciones y parámetros negativos

Indica lo que no quieres ver: sin texto superpuesto, sin marcas de agua, sin cambios de vestuario, sin manos visibles. Muchas herramientas aceptan un campo específico para exclusiones; si no lo tienen, integra la restricción en la frase como límite explícito. Sé conservador: una lista larga de exclusiones puede desestabilizar el resultado porque el modelo empieza a dudar de su propia composición.

Longitud y prioridad

Coloca lo más importante al principio. Si el modelo trunca el prompt o reparte atención de forma desigual, perderás los detalles finales. En general, entre treinta y ochenta palabras bien ordenadas funcionan mejor que párrafos de doscientas. Cuando algo funciona, guárdalo como plantilla y cambia solo la parte variable.

Estilo: cuánto y dónde

El estilo conviene declararlo una vez y no repetirlo en cada frase. Términos como documental, fotografía de producto, cine negro o imagen publicitaria orientan el acabado, pero acumular cuatro estilos distintos produce una mezcla sin identidad. Si necesitas un look muy específico, apóyate en una imagen de referencia en lugar de en adjetivos.

Control de movimiento, ritmo y temporalidad

Movimiento de cámara frente a movimiento del sujeto

Son dos controles independientes y conviene pedirlos por separado. Un travelling lateral con sujeto quieto cuenta una historia distinta a un plano fijo con sujeto caminando. Si pides ambos movimientos a la vez, el modelo puede repartir su capacidad de forma imprevisible. Empieza con un movimiento dominante por plano y añade el segundo solo cuando el primero ya sea estable.

Vocabulario útil de cámara

Plano general, plano medio, primer plano, contrapicado, picado, cenital, cámara en mano, dolly, travelling, órbita, zoom lento, profundidad de campo corta. Este vocabulario es más fiable que metáforas como mirada épica o sensación onírica, que cada modelo interpreta a su manera.

Ritmo y duración

Los clips cortos conservan mejor la coherencia. Si necesitas más tiempo, genera varios clips y móntalos. Los cortes funcionan a favor de la narrativa cuando el espectador ya entendió la acción. Además, incluir un pequeño margen al principio y al final de cada clip facilita el montaje: permite recortar sin perder el arranque del movimiento.

Movimiento complejo en pasos

Para coreografías o acciones con varias fases, divide. En lugar de el bailarín gira y salta, genera el bailarín inicia un giro lento y luego el bailarín completa el salto con los brazos abiertos. La continuidad se refuerza usando la última imagen del clip anterior como referencia del siguiente. Esta técnica de encadenar planos es una de las más útiles para secuencias largas.

Consistencia de personajes y referencias multimodales

Por qué un personaje cambia entre clips

Cada generación parte de ruido aleatorio. Si el prompt no fija rasgos, el modelo los reinventa. La solución pasa por aportar referencias visuales y describir el personaje con la misma fórmula en todos los prompts.

Referencia de imagen

Sube un retrato o un fotograma aprobado y describe al personaje igual en cada plano. Mantén constantes los elementos identificativos: color de pelo, forma de la barba, tipo de prenda, accesorios. Cambia solo lo que la escena exija. Si el personaje va a aparecer en muchos planos, dedica un clip exclusivo a fijarlo y úsalo como referencia principal.

Fusión de varias referencias

Cuando un plano necesita personaje, vestuario y localización a la vez, la fusión de referencias permite combinar varias imágenes en una misma generación. La clave es asignar un papel claro a cada referencia: una define el rostro, otra el vestuario, otra la atmósfera del lugar. Si dos referencias compiten por el mismo papel, el resultado se vuelve inestable y aparecen caras híbridas.

Continuidad de vestuario y paleta

Anota códigos de color aproximados y nombres de prendas. Guarda un documento de continuidad con capturas de los planos aprobados. Ese documento es el que evita que el protagonista aparezca con otra chaqueta en el plano siete. También sirve para que otra persona del equipo pueda continuar el proyecto sin preguntar cada detalle.

Cuándo conviene cambiar de personaje a propósito

No siempre quieres consistencia total. En un anuncio con varias personas o en una secuencia coral, la variedad aporta credibilidad. La regla práctica es simple: consistencia para el protagonista, variedad controlada para el resto del reparto.

Ejemplos comentados según el tipo de proyecto

Anuncio de producto

Objetivo: destacar textura y detalle. Prompt base: primer plano de una botella de vidrio sobre superficie de piedra, gotas de condensación, luz lateral fría, fondo oscuro desenfocado, cámara orbital lenta. Variante para cierre: la botella gira lentamente sobre sí misma, luz de contra que dibuja el contorno, fondo negro absoluto. Revisa que las gotas y los reflejos no parpadeen entre fotogramas, porque el brillo inestable es uno de los defectos más visibles en producto.

Retrato cinematográfico

Objetivo: emoción contenida. Prompt: plano medio de una mujer joven junto a una ventana, luz natural suave de mañana, polvo flotando, mirada baja, cámara fija con leve respiración de encuadre. El peligro aquí es el exceso de movimiento: en retratos, menos es más. Si el resultado parpadea en los ojos, acorta el clip y reduce la intensidad del movimiento facial.

Escena de acción

Objetivo: energía legible. Prompt: plano general de un ciclista descendiendo por una calle estrecha y empedrada, cámara en mano siguiendo el movimiento, luz de tarde cálida, polvo en suspensión. Divide la secuencia en tres clips y usa el último fotograma como referencia del siguiente para encadenar. En acción, la claridad del recorrido importa más que la espectacularidad.

Contenido educativo

Objetivo: claridad. Prompt: plano cenital de una mesa con dos vasos de agua, uno con sal disuelta, iluminación de estudio uniforme, cámara fija, sin elementos decorativos. Aquí conviene evitar estilos llamativos: la atención debe ir al concepto. Si el vídeo explica un proceso, repite el mismo encuadre en varios planos para que el espectador note solo lo que cambia.

Moda y lifestyle

Objetivo: textura y movimiento de tejido. Prompt: plano medio de una modelo caminando por una terraza al atardecer, vestido de lino que se mueve con el viento, luz cálida lateral, cámara en travelling paralelo. El movimiento de la tela es un excelente indicador de calidad: si se comporta como plástico, reduce la velocidad y acorta el clip.

Inmobiliaria y arquitectura

Objetivo: recorrido espacial. Prompt: travelling continuo por un salón amplio con ventanales, luz de mediodía, suelo de madera, cámara a la altura de los ojos avanzando hacia la ventana. La geometría es el punto débil de estos planos: mantén una sola dirección de avance y evita giros bruscos que deformen las líneas.

Documental corto

Objetivo: credibilidad. Prompt: plano medio de un artesano trabajando la madera en su taller, luz de ventana lateral, polvo en el aire, cámara fija, movimiento lento de las manos. En documental, lo imperfecto suma: un poco de grano y un encuadre no perfecto resultan más creíbles que una imagen impecable.

Redes sociales verticales

Objetivo: impacto en dos segundos. Prompt: plano vertical cerrado de manos abriendo una caja, luz cálida, movimiento rápido de aproximación, fondo de madera. Genera variantes del primer fotograma y prueba cuál detiene el desplazamiento del espectador. En formato vertical, el sujeto debe ocupar el centro del encuadre y las manos no deben salir del marco.

Audio, voz y posproducción

El vídeo generativo suele llegar mudo. El audio se construye aparte y suele ser la mitad del resultado percibido.

Capas de audio

  • Voz en off o diálogo: usa una voz sintética coherente o graba locución real.
  • Ambiente: sala, calle, lluvia, viento.
  • Efectos: pasos, puertas, impactos, ropa.
  • Música: define el tono emocional.

Alinea los cortes visuales con los acentos musicales. Si un plano dura ocho segundos y la música marca compases cada dos, corta en el compás.

Diálogo, doblaje y subtítulos

Si hay diálogo, graba la voz antes de montar y ajusta la duración de los planos a la frase. Es más fácil estirar la imagen que comprimir una interpretación. Para subtítulos, deja margen inferior y evita fondos muy claros bajo el texto. Si el proyecto se va a traducir, mantén un ritmo de habla moderado y sin solapamientos.

Sincronización y unificación visual

Cuando el clip es corto, añade un pequeño fundido o una transición que oculte la unión. Evita cortes secos en planos con movimiento de cámara muy distinto; el salto se nota y rompe la ilusión. Para unificar clips generados por separado, aplica una capa común de color, un ligero grano y la misma curva de contraste. Un grano suave unifica mejor que cualquier ajuste agresivo.

Errores frecuentes y cómo corregirlos

El personaje cambia de cara

Causa: falta de referencias o descripciones inconsistentes. Solución: fija una fórmula de personaje, usa imagen de referencia y reduce el movimiento.

Las manos salen deformes

Causa: manos en primer plano con movimiento complejo. Solución: encuadra las manos más pequeñas, reduce la duración, evita que crucen delante de la cara y cúbrelas con objeto o vestuario cuando sea posible.

El movimiento es errático

Causa: demasiadas instrucciones simultáneas. Solución: un movimiento dominante por plano y verbos concretos con dirección y velocidad.

La escena se desvanece o se derrite

Causa: duración excesiva o transición implícita en el prompt. Solución: acorta el clip, elimina palabras que sugieran transformación y usa la última imagen como referencia del siguiente plano.

Aparece texto ilegible

Causa: el modelo intenta imitar rótulos. Solución: prohíbe texto explícitamente y añade la tipografía en posproducción. Los rótulos generados casi nunca están a la altura de un diseño real.

Vistas duplicadas o geometría imposible

Causa: el prompt describe algo que no ocurre en el mundo real. Solución: imagina el plano desde una sola posición de cámara y descríbela con precisión.

Parpadeo y textura inestable

Causa: cambios de brillo entre fotogramas. Solución: evita reflejos especulares muy marcados, estabiliza en edición y reduce la duración. En superficies metálicas o mojadas, la inestabilidad es más visible.

Deriva de estilo entre planos

Causa: prompts con estilos distintos o referencias diferentes. Solución: fija una plantilla de estilo y cópiala en todos los planos, cambiando solo sujeto y acción.

Sobrecarga de referencias

Causa: demasiadas imágenes con roles ambiguos. Solución: máximo tres referencias por generación, cada una con una función clara.

Errores de gestión del proyecto

Nombra los archivos con número de plano, versión y fecha. Guarda por separado los clips aprobados y los descartados. Sin esta disciplina, el proyecto se convierte en una carpeta con cien archivos imposibles de ordenar y el equipo pierde más tiempo buscando que creando.

Criterios de decisión, flujo de trabajo y preguntas frecuentes

Cómo elegir herramienta o modelo

Pregúntate cinco cosas antes de decidir: qué control necesitas sobre el movimiento, si requieres consistencia de personaje, cuánta resolución final necesitas, si vas a generar audio integrado y cuánto tiempo puedes dedicar a la revisión. Para prototipos rápidos, prioriza velocidad y variedad. Para piezas de marca, prioriza fidelidad a referencias y estabilidad temporal. Para contenido educativo, prioriza claridad y control de encuadre. Para acción, prioriza tolerancia al movimiento intenso.

Señales de que necesitas cambiar de enfoque

Si tras cinco intentos el plano sigue fallando, el problema no es el número de intentos, es el planteamiento. Cambia una variable grande: acorta el clip, simplifica la acción, cambia el tipo de plano o divide la escena en dos. Los ajustes pequeños no salvan una idea mal formulada.

Flujo de trabajo en nueve pasos

  1. Define objetivo y formato.
  2. Escribe el guion en frases de una línea por plano.
  3. Construye la tabla de planos.
  4. Reúne referencias visuales.
  5. Escribe un prompt con estructura de cinco capas.
  6. Genera tres variantes del primer plano y elige.
  7. Bloquea personaje, vestuario y paleta.
  8. Genera el resto de planos usando el fotograma aprobado como referencia.
  9. Monta, añade audio, corrige color y exporta.

Preguntas frecuentes

¿Cuántos intentos necesito por plano? Entre tres y diez en la mayoría de casos; los planos simples se resuelven antes y los que incluyen manos o multitudes tardan más.

¿Es mejor texto a vídeo o imagen a vídeo? Si tienes una referencia clara, imagen a vídeo suele dar más control. Texto a vídeo es mejor para explorar y para descubrir encuadres que no habías imaginado.

¿Puedo usar los clips en publicidad? Depende de la licencia de la herramienta y del material de referencia que hayas subido. Revisa siempre los términos antes de publicar y conserva un registro de las fuentes de cada imagen.

¿Qué hago si el resultado es bueno pero corto? Usa el último fotograma como referencia y continúa la acción en un segundo clip. Encadena tres o cuatro y tendrás una secuencia larga.

¿Cómo mantengo continuidad de luz? Describe la hora, la dirección de la luz y la temperatura en todos los planos, y ajusta en color al final. La coherencia de luz es lo que hace que el espectador crea la escena.

¿Merece la pena rodar en lugar de generar? Si necesitas actuación matizada, producto físico preciso o texto legible en pantalla, grabar suele ser más rápido y más barato que insistir con generaciones.

¿Cómo evalúo un resultado con criterio? Mira el primer segundo, comprueba la coherencia del sujeto, revisa el movimiento y pregúntate si el plano aporta algo. Si no aporta, no lo salves por bonito.

Lista de comprobación final

Antes de exportar: ¿cada plano tiene una función? ¿el personaje es reconocible en todos? ¿la luz es coherente? ¿el audio está mezclado por capas? ¿el primer segundo retiene? ¿la resolución y el formato coinciden con la plataforma? Si alguna respuesta es no, corrige antes de publicar. El vídeo generativo premia la disciplina: prompts ordenados, referencias claras y revisión metódica producen resultados que parecen intencionados, no accidentales. Y cuando el proceso se repite, cada proyecto nuevo empieza con ventaja porque ya tienes plantillas, criterios y una forma de trabajar que el equipo comparte.

Alexander

Alexander