O prompt é roteiro, decupagem e direção de arte ao mesmo tempo
Quando você escreve um prompt para uma plataforma de vídeo com inteligência artificial, não está apenas descrevendo uma imagem. Você está definindo elenco, cenário, lente, movimento de câmera, ritmo e duração. A diferença entre um clipe que parece amador e um plano que poderia entrar em um comercial raramente está no modelo escolhido — está na clareza das instruções.
Modelos generativos são obedientes ao pé da letra. Se você escreve "um homem andando", o sistema escolhe idade, vestuário, cidade, clima, luz e enquadramento por conta própria. Cada escolha implícita é uma oportunidade de erro acumulado. Prompt engineering, nesse contexto, é o trabalho de eliminar ambiguidades sem engessar a capacidade do modelo de surpreender.
Na prática, prompts de vídeo funcionam melhor como briefings curtos e densos, com hierarquia clara de informação. Este guia percorre a estrutura canônica, um fluxo de trabalho replicável, os pontos de falha mais comuns e os critérios para decidir quando insistir em um prompt e quando é hora de mudar de abordagem.
Anatomia de um prompt de vídeo eficaz
Um prompt robusto responde a quatro perguntas: o que acontece, onde acontece, como é filmado e como deve parecer. A ordem importa menos do que a presença dos quatro blocos. Quando um deles falta, o modelo preenche a lacuna com o clichê mais provável do seu conjunto de treinamento — e clichê é exatamente o que faz um vídeo parecer genérico.
Sujeito e ação
Descreva quem ou o que aparece, com atributos visíveis e verificáveis: idade aproximada, tipo físico, roupa, textura de tecido, expressão facial. Em seguida, defina uma ação principal — no máximo duas por plano. "Uma mulher de jaqueta de couro desabotoando o casaco enquanto encara a câmera" é executável. "Uma mulher refletindo sobre a vida" não é. Verbos concretos reduzem interpretação; verbos abstratos convidam o modelo a inventar coreografia, cenário e elenco do zero.
Contexto imersivo
Ambiente, hora do dia, clima, direção da luz e atmosfera. "Rua estreita de paralelepípedos, fim de tarde, luz dourada entrando de lado, neblina leve no fundo" constrói clima emocional sem precisar escrever "melancólico". Modelos respondem muito melhor a descrições físicas do que a estados psicológicos abstratos. Se o ambiente tem som característico — mercado movimentado, floresta com vento, servidor zumbindo — vale mencionar, porque isso orienta escolhas de movimento e ritmo.
Estilo, estética e referências
Aqui entram linguagem cinematográfica (lente 35 mm, profundidade de campo rasa, grão de filme 16 mm), paleta de cores (azul-petróleo e âmbar, pastéis dessaturados, alto contraste monocromático) e referências de gênero ("documentário esportivo", "anime dos anos 90", "fotografia editorial de moda"). Evite citar nomes de pessoas reais ou marcas registradas. Descreva as características que você admira — enquadramento, luz, textura — e o resultado será mais seguro, mais original e geralmente mais fiel à sua intenção.
Parâmetros técnicos, formato e duração
Inclua proporção (16:9, 9:16, 1:1), duração desejada, movimento de câmera, presença ou ausência de áudio e nível de realismo. Se a ferramenta aceita imagem inicial ou final, deixe explícito qual é o papel dela na cena. Declare também o que você não quer: sem texto na tela, sem marca d'água, sem transições, sem corte no meio do movimento. Restrições negativas ajudam o modelo a não preencher lacunas com elementos indesejados.
Densidade: quanto detalhe é suficiente
Entre 40 e 90 palavras costuma ser o ponto ideal para um plano único. Acima disso, o modelo tende a diluir prioridades: um detalhe importante se perde entre dez secundários. Se você sente necessidade de escrever 200 palavras para explicar uma cena, o problema não é o prompt — é a decisão de concentrar tudo em um único plano. Divida em dois ou três planos e descreva cada um com precisão.
Fluxo de trabalho em cinco etapas
Gerar vídeo com IA sem método produz dezenas de clipes descartáveis. Com método, produz uma sequência montável. As cinco etapas abaixo funcionam em qualquer ferramenta e reduzem drasticamente o número de tentativas necessárias.
1. Briefing visual e lista de planos
Antes de abrir qualquer plataforma, escreva a sequência em linguagem simples, plano por plano: o que o espectador vê, o que muda entre um plano e outro, onde está o ponto de virada. Uma lista de seis a dez planos é suficiente para um vídeo curto. Sem essa etapa, você gera clipes bonitos que não conversam entre si e descobre isso só na montagem.
2. Imagem-chave antes do movimento
Muitos geradores de vídeo aceitam uma imagem inicial como referência. Aproveite isso. Gere primeiro um frame estático com o enquadramento, o figurino e a luz que você quer, e só depois transforme essa imagem em movimento. Isso separa dois problemas distintos — composição e animação — e impede que uma boa composição seja destruída por uma tentativa ruim de animação. Ferramentas como Midjourney, Flux ou geradores de imagem integrados são úteis nessa fase.
3. Um movimento por prompt
Cada prompt deve pedir uma única intenção de movimento: aproximação lenta, órbita lateral, câmera fixa com sujeito se aproximando, panorâmica da esquerda para a direita. Pedir "câmera orbitando enquanto ela caminha e o carro passa" costuma resultar em movimento errático. Planos simples e limpos se encaixam melhor na edição e escondem imperfeições.
4. Iteração controlada: uma variável por vez
Quando o resultado não agrada, mude apenas um elemento — a direção da luz, o movimento, a duração, o adjetivo de estilo. Se você reescreve o prompt inteiro a cada tentativa, perde a capacidade de aprender o que funciona. Mantenha um arquivo com as versões que deram certo; esse histórico se torna seu vocabulário pessoal de prompts.
5. Montagem, som e correção
Geração é metade do trabalho. Na montagem, você ajusta ritmo, corta os primeiros e últimos quadros (onde a instabilidade costuma aparecer), adiciona som ambiente, trilha e locução. Áudio é o elemento que mais rapidamente faz um vídeo gerado parecer profissional. Ferramentas como DaVinci Resolve ou CapCut resolvem essa etapa sem custo alto.
Consistência de personagem e cenário entre planos
Personagens que mudam de rosto entre planos quebram a ilusão mais rápido do que qualquer artefato técnico. Existem três abordagens que funcionam bem na prática.
A primeira é trabalhar com imagem de referência: gere um retrato nítido do personagem em boa luz e use esse arquivo como base para todos os planos seguintes, variando apenas enquadramento e ação. A segunda é descrição canônica repetida: mantenha um bloco fixo de texto sobre o personagem (idade, cabelo, roupa, marcas) e cole esse bloco literalmente em todos os prompts, alterando só a parte de ação e câmera. A terceira é reduzir a complexidade: se o rosto não aparece em close, consistência é muito mais fácil de manter.
Para cenários, o mesmo princípio vale. Descreva o ambiente com um conjunto fixo de elementos âncora — uma janela, um poste, um tipo de piso — e repita esses elementos em todos os planos da mesma locação. Se a plataforma permitir referência de estilo ou de imagem, use-a. Caso contrário, crie uma paleta de descritores e não os altere no meio da sequência.
Movimento de câmera e dinâmica de cena na prática
Movimento de câmera é o recurso mais poderoso e o mais mal utilizado. Algumas diretrizes ajudam a acertar com mais frequência.
Aproximação lenta (dolly in) cria tensão e funciona em closes e objetos. Afastamento revela contexto e serve para encerrar cenas. Órbita é excelente para apresentar produtos e personagens parados, mas exige fundo estável — se o ambiente se move junto, o resultado fica confuso. Travelling lateral funciona bem em paisagens e cenas de deslocamento. Câmera na mão transmite urgência e documentário, mas tende a produzir instabilidade excessiva em modelos generativos; use com moderação e descreva "handheld sutil, sem tremor exagerado".
A dinâmica interna da cena também importa. Movimento de cabelo, tecido, fumaça, água e folhas dá vida ao plano sem custo narrativo. Já movimentos humanos complexos — dança, luta, acrobacia, mãos manipulando objetos pequenos — são os pontos mais frágeis da geração atual. Se a cena depende disso, planeje mais tentativas, use planos mais curtos e considere gravar referência real ou usar captura de movimento como apoio.
Coerência temporal e lógica narrativa
Cada clipe gerado é um universo isolado: a IA não sabe o que aconteceu no plano anterior. A coerência é responsabilidade de quem escreve e monta.
Comece definindo a continuidade de luz e hora do dia. Se o plano dois é "fim de tarde dourado", o plano três não pode ser "meio-dia duro" sem motivo narrativo. Depois, controle a direção do olhar e a posição dos personagens no quadro: se ela olha para a esquerda no plano A, deve continuar olhando para a esquerda no plano B, a menos que haja corte de eixo intencional. Por fim, defina a progressão de escala: geral, médio, close. Alternar escalas cria ritmo e disfarça inconsistências de detalhe.
Uma técnica útil é escrever a sequência como uma linha do tempo de eventos, e não como uma lista de imagens. "Ela entra, olha em volta, encontra a caixa, hesita, pega e sai" orienta decisões de enquadramento e duração de forma muito mais clara do que "mulher, caixa, rua, noite".
Erros comuns, causas e correções
Prompt com muitas ações. Sintoma: movimento caótico e personagens fazendo coisas aleatórias. Correção: uma intenção por plano.
Adjetivos emocionais no lugar de descrições físicas. Sintoma: resultado genérico e sem identidade. Correção: troque "triste" por "ombros caídos, olhar baixo, luz fria lateral".
Ausência de especificação de câmera. Sintoma: planos estáticos ou movimentos aleatórios. Correção: declare sempre o tipo de movimento desejado.
Duração longa demais. Sintoma: deformação progressiva no meio do clipe. Correção: gere clipes curtos e monte vários em sequência.
Mistura de estilos incompatíveis. Sintoma: imagem sem unidade visual. Correção: escolha uma linguagem estética e mantenha-a por toda a sequência.
Prompt negativo ignorado. Sintoma: elementos indesejados persistem. Correção: reescreva o prompt de forma positiva, descrevendo exatamente o que deve aparecer em vez do que deve ser evitado.
Excesso de reaproveitamento do mesmo arquivo base. Sintoma: aparência de cópia, pouca variação. Correção: altere enquadramento, luz e ação, mantendo apenas a identidade do personagem.
Como escolher a ferramenta para cada tipo de plano
Não existe um gerador que ganhe em tudo. A escolha deve seguir o tipo de plano.
Para planos de produto e movimentos de câmera controlados, priorize ferramentas com bom controle de trajetória e consistência de objeto. Para cenas humanas com diálogo e expressão, prefira modelos que lidam bem com close-ups e sincronia labial — e considere gerar o áudio com um sintetizador de voz separado, como ElevenLabs, em vez de depender do áudio nativo. Para paisagens e planos abertos cinematográficos, modelos com boa renderização de textura e profundidade atmosférica entregam resultados mais consistentes. Para animação estilizada, ferramentas com controle de estilo por imagem de referência economizam tempo.
Critérios objetivos ajudam na decisão: velocidade de geração, custo por tentativa, suporte a imagem inicial, duração máxima do clipe, resolução de saída, controle de movimento e facilidade de manter um personagem. Teste o mesmo prompt em três ferramentas antes de fechar um projeto longo. Diferenças de desempenho aparecem rapidamente e evitam retrabalho caro mais adiante.
Checklist e modelo de prompt reutilizável
Antes de enviar, verifique: existe um sujeito claro com atributos visíveis? Há uma ação principal única? O ambiente está descrito com elementos físicos, não emocionais? A luz e a hora do dia estão definidas? O estilo visual está declarado? O movimento de câmera está especificado? A proporção e a duração estão corretas? Existe algum termo abstrato que possa ser substituído por algo observável?
Um modelo simples que funciona bem: [estilo e lente] + [sujeito com atributos] + [ação única] + [ambiente e hora] + [luz] + [movimento de câmera] + [duração e proporção]. Por exemplo: "filme 16 mm, grão visível, lente 35 mm — homem de 40 anos, barba curta, jaqueta verde-oliva — caminha lentamente enquanto acende um cigarro — beco estreito com tijolos úmidos, início da noite — luz de poste laranja vindo da direita — travelling lateral lento para a esquerda — 6 segundos, 16:9".
Mantenha esse esqueleto em um arquivo de texto e adapte cada campo. A repetição consciente de estrutura é o que permite comparar resultados e evoluir tecnicamente.
Perguntas frequentes
Quantas palavras deve ter um prompt de vídeo? Entre 40 e 90 palavras para planos únicos. Prompts muito curtos deixam decisões importantes para o modelo; prompts muito longos diluem prioridades e aumentam o risco de conflito entre instruções.
Preciso gerar uma imagem-chave antes? Não é obrigatório, mas melhora muito a previsibilidade. Separar composição de animação reduz tentativas e facilita ajustes específicos, especialmente em projetos com vários planos do mesmo personagem.
Como evitar mãos e rostos deformados? Prefira planos mais fechados ou mais abertos que evitem detalhes minuciosos, reduza a duração do clipe e evite pedir manipulação de objetos pequenos. Se o rosto é essencial, use imagem de referência nítida e boa iluminação.
Posso citar nomes de diretores ou filmes no prompt? É melhor não. Descreva as características visuais que você quer — tipo de lente, paleta, textura, ritmo — porque isso é mais seguro e produz resultados mais originais.
Como manter consistência entre planos sem sistema de referência? Repita um bloco fixo de descrição do personagem e do cenário em todos os prompts e varie apenas ação, câmera e enquadramento. Crie uma lista de elementos-âncora e não a altere durante a sequência.
Vale gerar tudo em alta resolução? Gere testes em resolução menor para acelerar a iteração e só faça a versão final em alta qualidade depois de aprovar movimento, enquadramento e ritmo. Isso economiza tempo e recursos ao longo do projeto.
E se o resultado nunca fica bom? Reformule o problema antes de reformular o prompt. Muitas falhas vêm de planos pedindo demais para um único clipe. Divida a ação em dois planos, simplifique o movimento e reduza a duração. Na maioria dos casos, a solução está na decupagem, não no texto.



