O que muda quando o vídeo passa a ser gerado por IA
A geração de imagens por IA já é rotina em estúdios pequenos e grandes. O vídeo, porém, obedece a outras regras: cada segundo exige coerência entre quadros, e qualquer oscilação de identidade, proporção ou iluminação aparece de forma muito mais evidente. É comum um plano isolado parecer impecável e, ao ser colocado ao lado de outro, revelar pescoço alongado, casaco que muda de cor ou cenário que se desloca sozinho.
O trabalho de quem produz vídeo com IA, portanto, deixou de ser apenas 'escrever um bom prompt' e passou a ser orquestração: planejar planos, escolher o modelo adequado para cada tipo de movimento, controlar referências visuais e tratar o resultado bruto como material de filmagem, não como produto final.
Três gargalos dominam a produção atual. O primeiro é a consistência: manter o mesmo rosto, o mesmo figurino e o mesmo cenário por mais de dois ou três planos. O segundo é o controle temporal: fazer a ação acontecer no ritmo certo, sem movimento acelerado nem congelamento. O terceiro é a integração de áudio: voz, ambiência, trilha e legendas precisam parecer parte do mesmo universo visual.
Este guia propõe um fluxo de trabalho reproduzível, do briefing à entrega, com critérios de decisão para cada etapa e os erros que mais consomem tempo em produções reais.
Antes de gerar: formato, duração e contexto de exibição
A maior fonte de desperdício em projetos de vídeo com IA é decidir o formato depois de gerar as cenas. Um plano gerado em 16:9 e depois recortado para 9:16 perde enquadramento, corta o sujeito e destrói a composição pensada originalmente.
Defina antes de qualquer geração:
| Contexto | Proporção | Duração alvo | Prioridade principal |
|---|---|---|---|
| Feed social | 9:16 | 8 a 20 s | Gancho visual nos 2 primeiros segundos |
| Anúncio curto | 1:1 ou 9:16 | 15 a 30 s | Clareza da oferta |
| Institucional / YouTube | 16:9 | 60 a 180 s | Narrativa e áudio |
| Página de produto | 16:9 ou 1:1 | 20 a 45 s | Demonstração funcional |
| Apresentação em tela grande | 2.39:1 | Variável | Textura, grão e escala |
Outra decisão antecipada é o consumo com ou sem som. Vídeos que rodam no modo mudo dependem de legendas embutidas, textos curtos e micro-movimentos constantes para prender atenção. Vídeos com áudio podem usar narração e trilha para conduzir o corte, o que permite planos mais longos e contemplativos.
Por fim, estime a quantidade de planos. Uma peça de 30 segundos raramente funciona com um único clipe gerado; o normal é reunir de 6 a 12 planos de 2 a 5 segundos, alternando planos abertos, médios e detalhes. Esse mapa é o que evita a sensação de 'vídeo de IA' arrastado.
Roteiro, storyboard e divisão em planos
Comece pelo roteiro em texto simples, sem pensar em ferramenta. Depois converta cada frase relevante em um plano. A regra prática é: uma ideia, um plano. Se um parágrafo descreve duas ações distintas, ele gera dois planos.
Monte uma tabela de planos com colunas fixas. Isso parece burocrático, mas reduz drasticamente a quantidade de gerações descartadas:
- Número do plano: 01, 02, 03.
- Duração pretendida: 3 s, 5 s.
- Sujeito: quem ou o que ocupa o quadro.
- Ação: o que muda entre o primeiro e o último quadro.
- Cenário: onde a ação ocorre.
- Luz: hora do dia, fonte, temperatura de cor.
- Câmera: fixa, em travelling, acompanhando, sobrevoando.
- Referência visual: imagem-base, frame de personagem ou link interno.
O storyboard pode ser feito com esboços à mão ou com imagens estáticas geradas previamente. O ganho de trabalhar com imagens primeiro é enorme: você aprova rostos, figurinos e paleta antes de gastar tempo com geração de movimento. Uma vez validada a imagem, ela se torna referência para o modelo de vídeo.
Separe também o que é plano de continuidade e o que é plano de corte. Planos de continuidade compartilham personagem, figurino e cenário e precisam das mesmas referências. Planos de corte podem introduzir um novo ângulo, um detalhe de mão, um relógio, uma paisagem, e servem para mascarar pequenas imperfeições do material principal.
Escolha do modelo certo para cada plano
Não existe um modelo único que resolva tudo. Modelos diferentes têm perfis diferentes de realismo, duração de clipe, aderência ao prompt e custo por segundo gerado. O critério de escolha deve partir do plano, não da preferência pessoal.
| Tipo de necessidade | Categoria de modelo | Quando usar |
|---|---|---|
| Cena nova a partir de descrição | Texto para vídeo | Planos de abertura, paisagens, inserts |
| Personagem já aprovado | Imagem para vídeo | Todos os planos com rosto recorrente |
| Estilo específico | Vídeo para vídeo | Transformar gravação própria em animação |
| Movimento controlado | Controle de câmera e movimento | Planos de produto, câmera orbitando |
| Nitidez final | Upscale e interpolação | Antes da montagem, nunca depois |
| Fala sincronizada | Lip sync e síntese de voz | Depoimentos, personagens falando |
Ferramentas como Runway, Kling, Luma Dream Machine, Pika, Veo e a família Sora cobrem boa parte dessas categorias, e muitas equipes mantêm duas ou três delas ativas: uma para planos realistas com pessoas, outra para cenas amplas e uma terceira para experimentação estilizada.
Critérios objetivos para decidir:
- Duração máxima do clipe. Se o plano precisa de 10 segundos contínuos e o modelo entrega 5, planeje a emenda ou escolha outro modelo.
- Fidelidade à referência. Se o rosto precisa permanecer idêntico, prefira imagem para vídeo com referência forte.
- Custo por segundo. Calcule o custo total do projeto, não de um clipe isolado, e reserve margem para regerações.
- Velocidade de fila. Em prazos curtos, um modelo com fila lenta pode inviabilizar a entrega.
- Acesso via API. Necessário se você pretende automatizar variações em escala.
Uma prática útil é gerar o mesmo plano em dois modelos diferentes, lado a lado, antes de comprometer o projeto com um deles. O teste custa pouco e evita descobrir limitações na metade da produção.
Consistência de personagem e cenário ao longo das cenas
Consistência é o problema mais caro do vídeo com IA. Rostos mudam de formato, roupas trocam de tom, cabelos mudam de comprimento e o cenário ganha ou perde elementos entre planos. A solução não é um prompt mais longo, mas um sistema de referências.
Referências visuais e fusão de múltiplas imagens
A abordagem mais confiável é criar uma folha de personagem com três a cinco imagens: rosto frontal, perfil, corpo inteiro e um detalhe de mãos ou acessório. Essas imagens podem ser combinadas como referência, e a força de cada uma pode ser ajustada. Quanto mais específica a referência, menor a liberdade do modelo e maior a estabilidade do resultado.
Imagens de referência devem compartilhar iluminação e paleta. Misturar um retrato com luz dourada e um perfil com luz azulada confunde o modelo e produz variações de pele estranhas.
Keyframes: primeiro e último quadro
Quando o modelo permite definir o primeiro e o último quadro, use isso a seu favor. O primeiro quadro estabelece composição e identidade; o último quadro define onde a ação termina. Isso torna o movimento previsível e permite encadear planos com transições suaves: o último quadro do plano 2 pode ser o primeiro do plano 3.
O que precisa ficar travado no prompt
Repita, em todos os planos do mesmo personagem, os mesmos descritores: idade aparente, formato do rosto, cor e corte do cabelo, tipo de roupa, cores exatas, acessórios. Evite sinônimos criativos entre planos. Se no plano 1 o sujeito usa 'jaqueta de lã cinza', no plano 4 ele não pode estar com 'casaco acinzentado'.
Cenário, figurino e objetos recorrentes
Trate cenário como personagem. Uma cozinha com bancada de mármore branco, azulejo azul e janela à esquerda precisa ser descrita do mesmo jeito em cada plano. Objetos como xícaras, telefones e relógios mudam de forma com facilidade; sempre que possível, mantenha-os fora de quadro ou use planos de detalhe isolados.
Como escrever prompts de vídeo que se sustentam
Um bom prompt de vídeo descreve o que muda no quadro, não apenas o que existe nele. Uma estrutura confiável:
Sujeito + ação + direção da ação + ambiente + luz + câmera + estilo + ritmo
Exemplo: 'Mulher de cerca de 30 anos, cabelo escuro preso, jaqueta de lã cinza, caminha lentamente da esquerda para a direita ao longo de uma bancada de mármore; luz da manhã entrando por uma janela lateral; câmera fixa na altura do peito, leve travelling para a direita; realista, profundidade de campo rasa; ritmo calmo, tempo real'.
Vocabulário de câmera que funciona bem em modelos de vídeo:
- Aproximação lenta (dolly in) e afastamento (dolly out)
- Deslocamento lateral (truck left / truck right)
- Órbita em torno do sujeito
- Câmera na mão, com leve tremor
- Subida vertical (crane up) e descida
- Foco passando do primeiro para o segundo plano (rack focus)
Vocabulário de tempo: tempo real, câmera lenta suave, ação contínua sem cortes, movimento constante. Termos vagos como 'cinematográfico' ou 'épico' acrescentam pouco; prefira descrições de luz ('contraluz quente ao pôr do sol'), lente ('50 mm, profundidade de campo curta') e textura ('leve grão de filme').
Quando o modelo aceitar instruções negativas, use-as com parcimônia: sem texto na tela, sem marca d'água, sem mãos deformadas, sem mudança de figurino. Listas negativas muito longas tendem a piorar o resultado.
Por fim, registre os prompts que funcionaram. Um arquivo de prompts aprovados por personagem e por cenário vale mais do que qualquer configuração de ferramenta.
Áudio, voz e trilha sonora
O áudio é o que separa um vídeo amador de uma peça profissional. Estratégia recomendada:
- Voz primeiro. Se houver narração, gere ou grave o áudio antes de montar. A duração da fala define o tempo de cada plano.
- Síntese de voz. Ferramentas como ElevenLabs produzem narrações naturais em português. Ajuste velocidade e pausas; leia em blocos curtos para manter naturalidade.
- Sincronia labial. Para personagens falando, gere o áudio, depois aplique lip sync sobre o plano com rosto estável. Evite planos muito abertos para fala sincronizada.
- Ambiência. Adicione som de ambiente coerente com o cenário: vento, trânsito distante, sala silenciosa, cafés. Ambiência constante entre planos do mesmo local cria continuidade.
- Trilha. Escolha uma faixa com dinâmica simples e faça o corte casar com os acentos musicais.
- Mixagem. Faça a voz ficar de 6 a 10 dB acima da trilha durante a fala; use automação para abaixar a música sob a narração.
Nunca use a faixa sonora gerada simultaneamente ao vídeo como elemento final. Ela serve como referência de clima, mas raramente é limpa o suficiente para uma entrega profissional.
Montagem, correção e pós-produção
Depois de gerar, você tem material bruto. O trabalho de montagem segue princípios de cinema:
- Corte no movimento. Troque de plano enquanto há ação, não em quadros parados.
- Ritmo variável. Alterne planos curtos com um plano mais longo para respirar.
- Correspondência de cor. Corrija temperatura, contraste e saturação para que planos do mesmo local pareçam filmados no mesmo dia.
- Estabilização leve. Movimentos flutuantes são comuns; uma estabilização sutil resolve, mas exageros produzem efeito líquido.
- Interpolação e upscale. Aplique antes da montagem final para não reprocessar o vídeo duas vezes.
- Legendas e tipografia. Prefira uma família tipográfica, no máximo duas, e mantenha margens seguras para plataformas verticais.
- Grão e textura. Um grão fino unifica planos gerados em modelos diferentes.
Ferramentas de edição tradicionais, como DaVinci Resolve, Adobe Premiere ou Final Cut, continuam sendo o centro do fluxo. O vídeo gerado por IA é matéria-prima, e não um atalho para pular a edição.
Um detalhe que faz diferença: gere 20 a 30 por cento mais material do que o necessário. Ter planos extras de detalhe, paisagem e mãos permite resolver furos de continuidade sem voltar ao estágio de geração.
Revisão, versionamento e entrega
Sem controle de versão, revisões de vídeo viram caos. Adote uma convenção simples: nome do projeto, número do corte e data. Exemplo: 'projeto-x_ep01_v03'.
Roteiro de revisão sugerido:
- Revisão interna de continuidade. Assista quadro a quadro procurando mudanças de figurino, objetos duplicados e sombras incoerentes.
- Revisão de áudio. Ouça em fones e em alto-falante de celular.
- Revisão de conteúdo. O vídeo comunica a ideia central nos primeiros cinco segundos?
- Revisão do cliente. Limite a duas rodadas estruturadas; comentários soltos em aplicativos de mensagem geram retrabalho infinito.
Checklist de entrega:
- Proporção correta por plataforma e margens seguras
- Legendas embutidas e arquivo separado, quando pedido
- Loudness consistente entre vídeos da mesma campanha
- Primeiro quadro com gancho visual, sem introdução longa
- Último quadro com espaço para chamada para ação
- Arquivo master em alta qualidade e versão comprimida para redes
- Documento com prompts e referências usados, para reaproveitamento futuro
Erros comuns e perguntas frequentes
Erros que se repetem
Gerar antes de escrever. Sem roteiro e lista de planos, a produção vira coleção de clipes bonitos que não formam narrativa.
Mudar o prompt a cada tentativa. Se cada regeração altera palavras diferentes, você nunca saberá o que causou a melhora. Altere uma variável por vez.
Confiar em planos longos. Modelos de vídeo tendem a degradar em clipes muito longos. Prefira cinco segundos excelentes e monte a sequência.
Ignorar o áudio até o fim. Narração pronta muda o tempo dos planos e força recortes.
Recortar vídeo horizontal para vertical. O enquadramento se perde; gere já no formato final.
Não guardar referências aprovadas. Sem folha de personagem, o segundo episódio não parecerá do mesmo universo.
Aplicar upscale no material já montado. Isso dobra o tempo de processamento e complica ajustes.
Tratar o resultado bruto como produto final. Cor, som, ritmo e legendas continuam sendo parte do trabalho.
Esquecer direitos de uso. Músicas, vozes sintéticas e imagens de referência precisam de licença compatível com o uso comercial.
Perguntas frequentes
Qual é a duração ideal de um clipe gerado por IA? Entre 2 e 5 segundos na maioria dos casos. Clipes curtos mantêm coerência de movimento e são mais fáceis de encaixar na montagem.
Como manter o mesmo rosto em vários planos? Use uma folha de personagem com múltiplas imagens, gere por imagem para vídeo, mantenha os descritores idênticos e, quando possível, fixe o primeiro quadro com a imagem de referência.
Preciso saber editar vídeo para trabalhar com IA? Sim, em nível básico. Notebooks e aplicativos de jogos fazem cortes e legendas, mas noções de ritmo, eixo de câmera e mixagem elevam muito a qualidade final.
Quanto tempo leva um vídeo de 30 segundos? Entre algumas horas e dois dias, dependendo de quantos planos exigem regeração e do nível de acabamento em áudio e cor.
Vale a pena usar vários modelos no mesmo projeto? Sim, desde que o grão final, a paleta e a correção de cor unifiquem os planos. A consistência visual é responsabilidade da pós-produção.
Como evitar aparência artificial? Reduza o excesso de movimentos de câmera, evite planos muito longos, adicione grão fino, case o corte com a música e inclua ambiência em todas as cenas.
Posso usar imagens de referência de terceiros? Depende da licença e do uso pretendido. Para projetos comerciais, prefira referências próprias, com direitos claros, ou personagens claramente fictícios.
O que fazer quando um plano não sai de jeito nenhum? Divida a ação em dois planos menores, elimine o movimento mais complexo, ou resolva com um plano de corte de detalhe. Trocar de abordagem costuma ser mais rápido do que insistir no mesmo prompt.



