O prompt é o roteiro invisível do vídeo
Quem começa a gerar vídeos com inteligência artificial costuma levar para a ferramenta o mesmo hábito que desenvolveu com imagens estáticas: escrever uma frase curta, apertar o botão e torcer. O resultado aparece na tela, tem movimento, tem textura, mas quase nunca corresponde ao que estava na cabeça de quem pediu. A frustração não vem do modelo. Vem da ausência de um documento que quase ninguém escreve: o roteiro do prompt.
Gerar vídeo é diferente de gerar imagem por um motivo simples e implacável: existe tempo. Uma imagem precisa acertar composição, luz e estilo em um único quadro. Um vídeo precisa acertar tudo isso e ainda manter coerência entre dezenas de quadros, decidir para onde a câmera vai, controlar a velocidade de um gesto, manter o rosto do personagem estável e evitar que uma mão vire seis dedos quando ela cruza o quadro. Cada palavra do prompt deixa de ser uma sugestão estética e se torna uma instrução de direção.
É por isso que prompt engineering para vídeo se parece mais com escrever uma sinopse técnica de cena do que com descrever uma fantasia. Diretores de fotografia não dizem "faz um plano bonito". Dizem: plano médio, lente 50mm, contraluz suave, câmera em dolly lento para a esquerda. O modelo entende essa linguagem melhor do que entende poesia.
Este guia não promete um truque mágico. Ele propõe um método: entender a anatomia do prompt, dominar vocabulário cinematográfico, resolver consistência temporal com seeds e keyframes, adaptar a escrita ao comportamento de cada família de modelos e organizar tudo em um fluxo de trabalho repetível. Ao final, você terá um checklist para usar antes de cada geração.
A anatomia de um prompt de vídeo eficaz
Um prompt robusto raramente é uma frase. Ele é um bloco organizado em camadas, e cada camada responde a uma pergunta que o modelo faria se pudesse perguntar. Quando alguma camada está ausente, o modelo preenche a lacuna com a média estatística do treinamento dele — e a média é, quase sempre, genérica.
Camada 1: sujeito e ação
Comece pelo que existe e pelo que acontece. "Uma mulher de casaco verde" é um sujeito. "Uma mulher de casaco verde levanta lentamente a xícara até os lábios enquanto olha pela janela" é sujeito mais ação. O verbo é o coração do vídeo: sem ele, o modelo inventa um movimento qualquer, muitas vezes um deslizar estranho de câmera que não combina com a cena.
Prefira verbos específicos e mensuráveis. "Anda" é vago. "Atravessa a rua em passo firme, parando por um segundo antes de subir na calçada" dá ritmo, ponto de pausa e intenção. Se houver mais de um personagem, diga quem faz o quê e para quem. Ambiguidade de agente é a origem número um de vídeos em que duas pessoas fazem o mesmo gesto ao mesmo tempo, sem motivo.
Camada 2: cenário, época e atmosfera
Depois do sujeito, ancore o mundo. Onde isso acontece? Que horas são? Que estação? Há fumaça no ar, poeira, chuva fina, luz de fim de tarde entrando por uma janela? Atmosfera não é enfeite: ela determina paleta, contraste e comportamento da luz, três coisas que o modelo precisa decidir de qualquer forma. Se você não decidir, ele decide por você.
Seja concreto com época e tecnologia. "Futurista" gera clichês de neon e cromo. "Laboratório de pesquisa com paredes de concreto, equipamentos analógicos dos anos 1970 e monitores de fósforo verde" gera uma imagem mental muito mais restrita — e restrição é o que produz originalidade previsível.
Camada 3: câmera, lente e enquadramento
Aqui está o maior divisor de águas entre prompts amadores e profissionais. Especifique o tipo de plano (geral, médio, close, detalhe), a altura da câmera (na altura dos olhos, baixa, alta, aérea), a lente (grande angular, normal, teleobjetiva) e a profundidade de campo (rasa ou profunda). Esses quatro parâmetros juntos controlam praticamente toda a sensação de escala e intimidade da cena.
Um close com lente teleobjetiva e fundo desfocado cria intimidade e isola o sujeito. Um plano geral com grande angular cria contexto e alguma distorção nas bordas. Se você quer que o expectador sinta claustrofobia, peça plano fechado, câmera baixa e espaço comprimido. Se quer grandiosidade, plano aberto, câmera alta e horizonte largo.
Camada 4: movimento da câmera e ritmo
Movimento precisa de direção, velocidade e destino. Não escreva apenas "câmera se move". Escreva "a câmera avança lentamente em direção ao rosto, cerca de meio metro por segundo, e para quando o rosto preenche dois terços do quadro". Modelos respondem bem a instruções de início, meio e fim porque elas descrevem uma trajetória, não um estado.
Cuidado com o excesso. Dois movimentos simultâneos, como órbita e zoom, só funcionam quando você descreve como eles se combinam. Caso contrário, o resultado é um tremor. Se a cena é dramática e silenciosa, um plano fixo com micro movimento de respiração costuma ser mais forte que qualquer movimento elaborado.
Camada 5: estilo, textura e referência
Por último, defina o acabamento. Filmado em 16mm com grão visível? Digital limpo com leve halo nas luzes? Animação em 2D com contorno desenhado à mão? Aqui vale usar referências de linguagem visual, não nomes de artistas vivos nem franquias protegidas. Descreva características: alto contraste, sombras duras, paleta dessaturada com um único vermelho dominante, textura de papel, luz difusa de dia nublado.
Referências genéricas como "cinematográfico" são úteis, mas fracas sozinhas. Combine-as com dois ou três adjetivos técnicos. "Cinematográfico, contraste alto, sombras profundas, luz principal vindo de trás e à esquerda" diz ao modelo exatamente o que fazer com a luz.
Vocabulário cinematográfico que muda o resultado
Movimentos de câmera e quando usar cada um
Panorâmica horizontal revela um espaço; é ótima para estabelecer cenário. Tilt vertical enfatiza altura, poder ou vertigem. Dolly in aproxima emocionalmente. Dolly out afasta e cria distância ou despedida. Travelling lateral acompanha movimento e mantém o sujeito no quadro. Steadicam gera fluidez orgânica. Câmera na mão gera urgência e imperfeição. Drone ou plano aéreo dá escala geográfica. Órbita cria admiração em torno de um objeto.
Escreva o movimento como instrução de tempo: "começa parado, faz uma panorâmica lenta para a direita e termina enquadrando a porta". Isso evita que o modelo aplique movimento constante do primeiro ao último quadro, o que quase sempre parece artificial.
Luz como ferramenta narrativa
Luz dura cria sombras definidas e dramatiza. Luz difusa suaviza e cria neutralidade. Contraluz separa o sujeito do fundo e gera silhueta. Luz lateral revela textura. Luz superior cria olheiras e tensão. Temperatura de cor controla emoção: tons quentes aproximam, tons frios distanciam. Hora azul e hora dourada são atalhos úteis, mas descreva-os em termos de cor e direção da luz, não apenas pelo nome.
Profundidade, foco e textura
Profundidade de campo rasa isola. Profundidade profunda contextualiza. Movimento de foco dentro do plano redireciona a atenção do espectador sem cortar a cena. Grão, aberração cromática leve, halo de lente e respiração de foco são sinais de realismo óptico que modelos fotográficos e de vídeo reconhecem bem.
Consistência temporal: o problema mais difícil
Um vídeo pode ter cada quadro individualmente bonito e ainda assim parecer errado, porque algo mudou no meio. Jaqueta que troca de cor, cicatriz que desaparece, cenário que reorganiza móveis, mãos que ganham dedos extras. Consistência é o teste real de qualidade.
Seeds e a lógica da estabilidade
A seed é o número que inicializa o ruído aleatório do processo de geração. Com a mesma seed, o mesmo prompt e a mesma configuração, você tende a obter resultados semelhantes. Isso transforma a geração em algo iterativo: em vez de reescrever tudo, você mantém o que funcionou e ajusta apenas a variável que precisa mudar.
A prática recomendada é fixar a seed assim que um resultado agradar e, a partir dali, fazer variações mínimas. Mude um adjetivo, gere de novo, compare. Quando a seed muda, todo o universo visual muda, e você perde a referência de comparação.
Keyframes como âncoras narrativas
Keyframes são quadros-chave que você fornece para ancorar início, meio ou fim de um plano. O uso mais eficiente é o par primeiro e último quadro: você define onde a cena começa e onde termina, e o modelo interpola o movimento entre eles. Isso resolve dois problemas de uma vez — direção do movimento e continuidade de personagem.
Para diálogos ou ações com pontos de pausa, adicione um keyframe intermediário. Um plano de alguém abrindo uma carta fica muito mais controlado com três âncoras: mão fechada sobre o envelope, envelope aberto, folha na mão com o rosto reagindo.
Gestão de personagem em múltiplos planos
Manter o mesmo personagem em planos diferentes exige um bloco de descrição reutilizável. Escreva uma vez uma ficha com idade aproximada, tipo físico, cabelo, roupa, acessórios e traços distintivos, e cole esse bloco idêntico em todos os prompts da sequência. Nunca parafraseie: se no plano 1 o casaco é "verde-oliva com gola de lã", no plano 5 precisa ser exatamente isso.
Quando o modelo aceita referências visuais, use a imagem do personagem como referência e mantenha a descrição textual como reforço. Texto e imagem juntos reduzem deriva. Se houver conflito entre os dois, o visual costuma vencer — por isso a descrição precisa descrever a referência, não contradizê-la.
Movimento orgânico sem deformação
Movimentos rápidos e complexos, como dança, luta ou malabarismo, são os mais propensos a deformação. Estratégias que funcionam: encurtar a duração do plano, dividir a ação em trechos menores, reduzir o número de pessoas em quadro, evitar que mãos cruzem o rosto, manter a câmera mais estável e descrever o movimento como lento e contínuo. Se a ação precisa ser rápida, resolva o ritmo na edição, não na geração.
Cada família de modelos tem sua gramática
Não existe prompt universal. Modelos diferentes foram treinados com dados diferentes e reagem a estímulos diferentes. Ajustar a escrita ao comportamento do modelo economiza muito tempo.
Modelos focados em movimento
Alguns modelos priorizam fluidez de movimento e física plausível. Eles respondem bem a descrições de trajetória, velocidade relativa e interação com objetos. Frases como "a bola quica duas vezes e perde altura a cada quique" funcionam melhor do que listas de adjetivos. Nesses casos, reduza a carga estilística e aumente a precisão física.
Modelos focados em referência multimodal
Modelos que aceitam múltiplas imagens de referência — personagem, cenário, objeto ou estilo — exigem prompts mais enxutos, porque a informação visual já está lá. O erro comum é descrever em texto o que a imagem já mostra e criar conflito. Nesse cenário, use o texto para instruir movimento, câmera e duração, e deixe a aparência para as referências.
Modelos focados em realismo fotográfico
Quando o objetivo é parecer filmagem real, o prompt deve imitar ficha técnica: tipo de sensor, lente, abertura, temperatura de cor, tipo de iluminação e presença ou ausência de grão. Termos como "filmado com lente 35mm, abertura f/2, luz prática de luminárias de tungstênio" orientam o modelo para um resultado documental em vez de publicitário.
Modelos focados em animação estilizada
Para animação, o vocabulário muda: tipo de traço, espessura de contorno, paleta limitada, número de quadros por segundo, técnica (desenho, recorte, massa de modelar, 3D estilizado). Especificar uma paleta de quatro ou cinco cores ajuda a manter coerência visual entre planos, algo especialmente útil em séries de curtas.
Um fluxo de trabalho em cinco etapas
Etapa 1: escrever a cena em prosa simples
Antes de pensar em prompt, escreva a cena como você contaria para uma pessoa. Quem é, o que quer, o que acontece, como termina. Esse texto é o seu roteiro e vai impedir que você gere planos bonitos que não contam história.
Etapa 2: quebrar em planos
Divida a cena em planos curtos, de dois a seis segundos cada. Cada plano recebe um cartão com cinco campos: ação, cenário, câmera, luz e estilo. Preencher esses campos é literalmente montar o prompt.
Etapa 3: gerar imagens de referência
Gere primeiro imagens estáticas dos planos principais. É mais rápido, mais barato e permite ajustar composição e luz antes de investir em movimento. Aprove o visual antes de animar.
Etapa 4: animar com keyframes e seed fixa
Converta as imagens aprovadas em planos animados, usando primeiro e último quadro quando o modelo permitir. Mantenha a seed fixa dentro da mesma cena para reduzir variação de cor e textura.
Etapa 5: editar e finalizar
Nenhuma sequência gerada sai perfeita do modelo. Corte os primeiros quadros, que costumam ter instabilidade, ajuste ritmo, insira transições, corrija cor e adicione som. Áudio, aliás, é o que mais aumenta a percepção de qualidade: ambiência, passos, tecido, respiração. Um plano mediano com som bem construído convence mais do que um plano impecável e mudo.
Erros comuns e como corrigir
| Erro | Sintoma | Correção |
|---|---|---|
| Prompt curto demais | Resultado genérico, composição aleatória | Adicione as cinco camadas: sujeito, cenário, câmera, movimento, estilo |
| Excesso de movimentos | Imagem tremida, deformação | Um movimento principal por plano, com início e fim definidos |
| Descrição contraditória | Elementos que somem ou mudam | Revise o prompt procurando conflitos entre luz, cenário e estilo |
| Referência visual não descrita | Deriva de personagem entre planos | Use bloco de descrição fixo e copie literalmente entre prompts |
| Planos longos | Perda de coerência no final | Limite a duração e resolva ritmo na edição |
| Ignorar o som | Vídeo parece artificial | Adicione ambiência e efeitos na pós-produção |
| Mudar tudo de uma vez | Impossível saber o que funcionou | Altere uma variável por geração e registre o resultado |
Checklist antes de cada geração
Antes de enviar o prompt, passe por estas perguntas. O sujeito está claro e há um verbo de ação específico? O lugar e o horário do dia estão definidos? O tipo de plano, a lente e a profundidade de campo estão escritos? O movimento tem direção, velocidade e ponto de parada? A paleta e a textura estão descritas com pelo menos dois adjetivos técnicos? A duração está dentro do que o modelo sustenta com estabilidade? Existe apenas um movimento dominante? Há algum conflito entre texto e referências visuais? Você anotou a seed e o prompt exato do melhor resultado até agora?
Responder essas dez perguntas leva dois minutos e evita dezenas de tentativas perdidas. Manter um diário de prompts — com data, seed, prompt completo, modelo e observações — é a diferença entre sorte e método. Em poucas semanas, esse diário se transforma em um acervo de fórmulas que funcionam para o seu estilo.
Perguntas frequentes
Preciso escrever o prompt em inglês? Nem sempre. Muitos modelos têm desempenho melhor em inglês, mas modelos multilíngues respondem bem ao português. Se estiver em dúvida, teste o mesmo prompt nos dois idiomas e compare com a seed fixa. O importante é ser específico, não escolher o idioma da moda.
Quanto tempo deve durar um plano gerado? Comece com planos curtos, de dois a quatro segundos. Eles são mais fáceis de controlar e de descartar quando falham. Aumente a duração apenas quando a ação exigir continuidade real.
Como faço para manter o mesmo personagem em vários planos? Combine três recursos: uma ficha textual fixa e reutilizável, uma imagem de referência do personagem e a mesma seed quando possível. Nunca reescreva a ficha com sinônimos entre planos.
Vale a pena descrever emoção no prompt? Vale, desde que você traduza a emoção em comportamento observável. "Triste" é abstrato; "olhar baixo, ombros caídos, respiração lenta, pausa antes de responder" é direção de ator.
Meu vídeo tem aparência artificial de plástico. O que fazer? Peça imperfeições: grão, leve desfoque de movimento, respiração de foco, sombras duras, textura de superfície. O realismo costuma vir de defeitos controlados, não de nitidez perfeita.
Posso usar o mesmo prompt para qualquer modelo? Pode como ponto de partida, mas espere ajustes. Modelos com foco em movimento precisam de menos adjetivos; modelos de referência multimodal precisam de menos descrição visual. Adapte.
Como lidar com textos e logotipos dentro do vídeo? Evite depender do modelo para escrever palavras. Gere o plano sem texto e adicione tipografia ou marcas na pós-produção. Texto gerado costuma sair deformado, e isso destrói a credibilidade da cena.
Prática deliberada vence truques
Prompt engineering para vídeo não é uma coleção de palavras mágicas. É a prática de traduzir intenção em instrução técnica, iterar com controle e aceitar que o resultado final nasce na combinação de geração e edição. Quem domina isso deixa de ser refém da sorte e passa a dirigir.
Comece pequeno. Escolha uma cena de dez segundos, escreva o roteiro em prosa, quebre em três planos, gere as imagens de referência, anime com keyframes e finalize com som. Registre cada tentativa. Na segunda vez, você vai errar menos. Na décima, vai ter um vocabulário próprio — e um processo que qualquer pessoa da sua equipe consegue repetir.



