Start Free Now
Limited Time Offer: Get 50% OFF Starter & Basic Yearly Plans 🎉

Prompts para IA de imagem e vídeo: guia prático completo

Oct 4, 2026

O prompt é o novo briefing criativo

Gerar imagens e vídeos com inteligência artificial deixou de ser experimento de laboratório e virou rotina de produção. Estúdios pequenos entregam campanhas completas sem equipe de filmagem; criadores independentes publicam séries em ritmo semanal; equipes de produto testam dezenas de variações visuais antes de decidir a identidade de um lançamento. Em todos esses cenários, o gargalo raramente é o modelo. É a instrução.

A comparação mais útil é com um briefing de agência. Um briefing ruim diz "quero algo moderno e impactante". Um briefing bom define público, tom, referências, restrições de formato e o que conta como sucesso. Prompts funcionam exatamente assim. Quando você escreve quatro palavras vagas, transfere todas as decisões para o comportamento estatístico do modelo — e esse comportamento tende ao clichê mais provável do conjunto de treino: luz suave, saturação média, composição centralizada, expressão neutra, fundo levemente desfocado.

O que separa um resultado aproveitável de um resultado descartável quase nunca é o tamanho do prompt, mas a quantidade de decisões que ele resolve. Cada frase deve eliminar uma escolha. Se uma frase não elimina nada, ela ocupa espaço e dilui as instruções que realmente importam.

O que mudou na prática nos últimos ciclos de modelos

Os modelos atuais são muito melhores em três frentes: coerência de movimento, compreensão de instruções compostas e aderência a descrições físicas. Isso significa que pedidos como "luz de janela lateral difusa, lente 85mm, profundidade de campo rasa" agora produzem diferenças visíveis, enquanto antes eram quase ignorados.

Ao mesmo tempo, a capacidade de seguir listas longas criou uma armadilha nova: prompts quilométricos que se contradizem. Se você pede "minimalista" e "rico em detalhes ornamentais" na mesma frase, o modelo resolve o conflito por conta própria — e você perde o controle justamente onde achava que tinha ganhado.

Os três erros que mais aparecem em testes

  1. Descrever emoção sem descrever causa visual. "Triste" é vago; "olhar baixo, ombros caídos, luz fria de fim de tarde entrando pela direita" é executável.
  2. Empilhar eventos em um único clipe de vídeo. Quatro ações em cinco segundos resultam em quatro ações mal executadas ou em uma só, escolhida pelo modelo.
  3. Mudar cinco variáveis por rodada. Quando o resultado melhora, você não sabe por quê e não consegue repetir.

A anatomia de um prompt de imagem: quatro camadas

Quase todo prompt profissional pode ser decomposto em quatro camadas. Quando o resultado decepciona, normalmente falta uma delas — não é o conjunto inteiro que está errado.

Camada 1 — Intenção artística

É a resposta para a pergunta: o que esta imagem deve provocar? Tensão, calma, nostalgia, urgência, humor, elegância, desconforto? Essa camada define o clima e serve de filtro para todas as decisões seguintes.

Em vez de "floresta", escreva "floresta de pinheiros ao amanhecer, sensação de silêncio absoluto, névoa baixa entre os troncos, atmosfera contemplativa, ausência de presença humana".

Camada 2 — Sujeito e ação

Descreva quem ou o que está em cena, o que faz, como está posicionado, o que veste e para onde olha. Em imagem estática, a ação é um estado: "sentado na beira de um cais, pernas balançando, olhar voltado para o horizonte".

Detalhes que parecem secundários mudam muito o resultado: idade aproximada, textura de pele, tipo de tecido, estado de conservação dos objetos, quantidade de pessoas no quadro. Números concretos ("três bicicletas encostadas") funcionam melhor que quantidades vagas ("algumas bicicletas").

Camada 3 — Linguagem visual, luz e óptica

Aqui entra o vocabulário técnico. Termos físicos mudam o resultado; adjetivos de qualidade, quase nunca. "Alta qualidade" e "bonito" são ruído. Já os itens abaixo são comandos reais:

  • Fonte de luz: luz do dia, tungstênio, neon, vela, LED prático, luz de janela, refletores de estúdio.
  • Direção: frontal, lateral esquerda, contraluz, luz de topo, esquema de três pontos, luz recortada.
  • Qualidade: difusa, dura, suave, alto contraste, sombras marcadas, preenchimento mínimo.
  • Atmosfera: neblina, poeira suspensa, fumaça, chuva fina, partículas visíveis no ar.
  • Óptica: grande angular, 35mm, 50mm, 85mm, teleobjetiva, macro, profundidade de campo rasa ou profunda.
  • Enquadramento: plano fechado, plano médio, plano aberto, plano detalhe, perspectiva de baixo para cima, composição descentralizada, espaço negativo à esquerda.
  • Paleta e textura: tons terrosos, verdes dessaturados, contraste frio, grão de filme, aparência digital limpa.

Camada 4 — Restrições, formato e limites

Proporção, resolução, presença ou ausência de texto, uso de pessoas reconhecíveis, elementos que não devem aparecer. Restrições funcionam melhor quando escritas como afirmações positivas: em vez de "sem carros", prefira "rua completamente vazia, apenas pedestres ao fundo".

O modelo mental que resume tudo: intenção + sujeito + técnica + formato. Falta de uma dessas partes gera instabilidade.

Exemplo comentado: do prompt vago ao reproduzível

Prompt fraco:

retrato de uma mulher, estilo cinematográfico, ultra detalhado

Prompt eficaz:

Retrato em plano fechado de uma mulher de cerca de 40 anos,
pele com textura natural e linhas de expressão visíveis,
olhar direto para a câmera, expressão serena e levemente cansada,
luz de janela lateral difusa vinda da esquerda,
fundo de apartamento desfocado com plantas,
lente 85mm, f/2.0, paleta de tons terrosos e verdes dessaturados,
referência de fotografia documental, sem retoque de beleza

A diferença não está no tamanho, mas na quantidade de decisões resolvidas. O segundo prompt deixa pouquíssimas escolhas para o modelo — e é justamente isso que o torna repetível em outras cenas.

Prompts para vídeo: escrever movimento, tempo e câmera

Vídeo acrescenta duas dimensões que a imagem estática não tem: tempo e movimento. Isso muda a lógica do prompt de forma profunda.

Estrutura em blocos

Uma estrutura que funciona bem na prática:

  1. Cena e sujeito — o que existe no quadro e onde está posicionado.
  2. Ação contínua — o que acontece ao longo do clipe, expresso como verbo em progresso.
  3. Câmera — fixa, travelling, panorâmica, órbita, aproximação, plano sequência.
  4. Ritmo e duração — contemplativo e lento ou rápido e energético.
  5. Luz e paleta — consistentes com o restante do projeto.
  6. Restrições — o que não deve aparecer e o que deve permanecer estável.

Vocabulário de câmera que vale memorizar

  • Fixa: câmera parada, sujeito se move dentro do quadro. Ideal para ações precisas.
  • Travelling lateral: a câmera desliza na horizontal, revelando o ambiente.
  • Panorâmica: rotação horizontal no mesmo eixo, útil para apresentar cenário.
  • Tilt: rotação vertical, boa para revelar altura.
  • Órbita: a câmera circula o sujeito, criando sensação de destaque.
  • Dolly in / dolly out: aproximação ou afastamento físico, não zoom.
  • Câmera na mão: instabilidade controlada, sensação documental.
  • Drone ou grua: movimento amplo, paisagem, escala.

Uma regra prática: movimentos complexos de câmera competem com movimentos complexos de personagem. Se o sujeito precisa fazer algo preciso, mantenha a câmera simples — e vice-versa.

Duração, ritmo e compressão de ação

Modelos de vídeo comprimem eventos. Se você descreve quatro acontecimentos em cinco segundos, é provável que apenas um sobreviva ou que todos apareçam atropelados. A solução profissional é um evento por clipe e montagem na edição. Um clipe de quatro segundos com uma ação clara vale mais que um clipe de dez segundos com quatro ações confusas.

Também vale especificar direção de movimento ("da esquerda para a direita"), velocidade ("passo lento", "corrida contida") e o que permanece parado no quadro, porque referências de estabilidade ajudam o modelo a não inventar movimento.

Exemplo comentado de prompt de vídeo

Plano aberto de uma rua estreita de cidade litorânea ao entardecer.
Um ciclista atravessa o quadro da esquerda para a direita em ritmo calmo.
Câmera fixa na altura do peito, com leve movimento de respiração.
Luz dourada baixa, sombras longas, reflexos em poças no asfalto.
Duração aproximada de 5 segundos, plano único, sem texto na tela.
Paredes da rua permanecem estáticas, sem transeuntes.

Observe a última linha: ela impede que o modelo popule a cena com figurantes aleatórios, um dos problemas mais comuns em planos de rua.

Consistência entre cenas: personagem, figurino e cenário

Consistência é o problema mais caro da produção com IA. Um personagem que muda de rosto entre planos destrói a narrativa mais rápido do que qualquer falha técnica.

Crie uma ficha canônica de personagem

Escreva uma descrição fixa e reutilize-a literalmente, palavra por palavra, em todos os prompts. Exemplo:

Homem de 32 anos, cabelo escuro ondulado na altura da orelha,
pele morena clara, cicatriz fina acima da sobrancelha esquerda,
jaqueta verde-oliva de lona, camiseta cinza, porte atlético, altura média

Nas cenas seguintes, mude apenas o que precisa mudar: enquadramento, ação, cenário, luz. Se você reescreve a descrição com sinônimos, o rosto muda. Isso parece exagero, mas é o erro mais frequente em produções de várias cenas.

Use referências visuais quando o modelo aceitar

Se o sistema permite imagens de referência, forneça retratos do personagem em ângulos diferentes e diga no texto o que deve ser preservado: rosto, cabelo, figurino, proporção corporal. Seja explícito. "Manter consistência" é uma instrução interpretável demais; "preservar formato do rosto, cor e corte do cabelo, e a jaqueta verde-oliva" é acionável.

Controle a continuidade de cenário

Paleta, hora do dia, clima e posição de câmera também precisam de ficha canônica. Um detalhe importante: mudanças de iluminação entre cenas são aceitáveis e até desejáveis para marcar passagem de tempo. Mudanças de arquitetura, mobiliário ou geografia, não. Se a porta ficava à esquerda no plano um, ela precisa continuar à esquerda no plano cinco.

Como testar consistência antes de produzir tudo

Faça um teste barato: gere o mesmo personagem em três cenas curtas e em três escalas diferentes (plano fechado, médio, aberto). Se o rosto e o figurino sobrevivem às três escalas, o projeto está pronto para produção. Se não sobrevivem, ajuste a ficha canônica antes de gerar trinta clipes que depois serão descartados.

Diagnóstico: corrigir em vez de reescrever

Antes de reescrever tudo, identifique o tipo de falha. Reescrever o prompt inteiro apaga as pistas sobre o que funcionou.

Sintoma Causa provável Correção
Imagem genérica Intenção artística ausente Adicione clima, emoção e uma referência visual concreta
Rosto muda entre cenas Personagem não especificado de forma canônica Reutilize a descrição fixa e adicione referências visuais
Vídeo acelerado Muitos eventos no mesmo clipe Um evento por clipe, divida na edição
Estilo inconsistente Termos conflitantes no mesmo prompt Elimine contradições e padronize o vocabulário visual
Enquadramento errado Falta de linguagem de câmera Especifique plano, lente e altura da câmera
Mãos deformadas Complexidade alta, mãos em primeiro plano Simplifique a cena e evite gestos precisos
Texto ilegível no vídeo Pedido de tipografia dentro do clipe Gere o vídeo limpo e adicione texto na edição
Cena vazia ou errada Instrução negativa sendo ignorada Reescreva como afirmação positiva do que deve existir

Duas regras valem para toda a tabela. Primeira: mude uma variável por vez. Segunda: quando uma instrução for ignorada, mova-a para o início do prompt e remova instruções concorrentes — muitas instruções "ignoradas" na verdade foram derrotadas por outras mais fortes no mesmo texto.

Fluxo de produção em oito etapas

Um processo replicável, do briefing ao master final:

  1. Briefing curto. Objetivo, público, formato, duração, tom. Uma página, no máximo.
  2. Moodboard textual. De dez a quinze palavras que definem o universo visual: paleta, época, textura, referências de fotografia ou pintura.
  3. Fichas canônicas. Personagens, figurinos, cenários e objetos recorrentes, descritos uma única vez e reutilizados literalmente.
  4. Prompts em blocos. Cena, ação, câmera, luz, restrições, formato. Um bloco por clipe.
  5. Testes em baixa resolução. Valide enquadramento, ritmo e silhueta antes de gastar tempo em alta qualidade.
  6. Iteração dirigida. Uma mudança por rodada, registrando em uma linha o que foi alterado e o que melhorou.
  7. Pós-produção. Corte, correção de cor, som, texto e ajuste de continuidade entre planos.
  8. Arquivo de prompts aprovados. Guarde os prompts que funcionaram junto com uma imagem de referência do resultado.

A etapa oito é a mais subestimada e a mais valiosa. Ela transforma tentativa em ativo reutilizável: meses depois, você regenera a mesma cena sem refazer toda a pesquisa. Times que mantêm esse arquivo reduzem o tempo de produção das cenas seguintes de forma drástica, porque param de redescobrir a paleta, a luz e a descrição do personagem a cada nova rodada.

Como escolher a abordagem certa

Não existe um formato ideal único. Existe o formato adequado à tarefa.

  • Prompt curto (5 a 15 palavras). Excelente para explorar direções e descobrir referências. Ruim para produção repetível, porque não documenta decisões.
  • Prompt longo descritivo. Bom para imagens autorais e detalhadas. Ruim quando acumula elogios vagos ou sinônimos redundantes.
  • Prompt em camadas com ficha canônica. O mais indicado para vídeo e para projetos com múltiplas cenas. Exige organização, mas reduz drasticamente o retrabalho.
  • Prompt guiado por referência. Ideal quando já existe um ativo visual aprovado: uma foto de produto, um retrato, um layout. O texto passa a descrever apenas o que muda.

Critério de decisão simples: se o resultado precisa ser repetido, continuado ou aprovado por outra pessoa, vá para o formato em camadas. Se você está apenas pesquisando, use o curto e não perca tempo.

Erros caros que consomem prazo

  1. Não separar exploração de produção. Gerar vinte variações criativas no mesmo arquivo da cena oficial mistura as decisões e contamina o padrão visual.
  2. Pedir tipografia em vídeo. Modelos de vídeo ainda falham em texto legível, especialmente em movimento. Gere limpo e componha o texto na edição.
  3. Ignorar proporção até o final. Uma cena horizontal não se converte bem em vertical sem repensar enquadramento. Defina a proporção no briefing.
  4. Deixar a paleta implícita. Sem paleta declarada, cada cena recebe um tratamento de cor diferente e a sequência parece colagem.
  5. Excesso de sujeitos no quadro. Duas ou três pessoas já aumentam muito a chance de rostos ou mãos deformados.
  6. Ausência de registro. Sem anotar o que mudou entre versões, você repete erros e perde acertos.

Perguntas frequentes

Preciso escrever os prompts em inglês?
Depende do modelo. O português funciona bem em vários sistemas atuais, mas alguns respondem com mais precisão a termos técnicos em inglês, sobretudo quando o vocabulário vem da fotografia e do cinema. Uma solução prática é manter a descrição narrativa no seu idioma e a camada técnica com termos internacionais consolidados.

Prompt mais longo é sempre melhor?
Não. Prompt longo é melhor quando cada frase resolve uma decisão. Se você está apenas repetindo sinônimos ou acumulando elogios vagos, o excesso dilui as instruções úteis e aumenta a chance de contradições internas.

Como evitar rostos deformados ou mãos estranhas?
Reduza a complexidade da cena, evite muitos sujeitos no mesmo quadro e prefira planos que não coloquem as mãos em primeiro plano. Em vídeo, mantenha o personagem em movimento contínuo e evite gestos precisos quando não forem essenciais para a narrativa.

Posso usar o mesmo prompt de imagem em vídeo?
Parcialmente. A camada estética é reaproveitável, mas vídeo exige ação contínua, duração, direção de movimento e instruções de estabilidade. Copiar um prompt de imagem sem adaptações costuma gerar clipes estáticos ou confusos.

Quantas iterações são normais até uma cena ficar boa?
Em média, de três a oito rodadas dirigidas para uma cena nova. Com fichas canônicas prontas e um arquivo de prompts aprovados, esse número cai bastante nas cenas seguintes do mesmo projeto.

O que fazer quando o modelo ignora uma instrução?
Mova a instrução para o começo do prompt, transforme-a em afirmação positiva e remova comandos concorrentes. Na maioria dos casos, a instrução não foi ignorada: ela foi sobrescrita por outra mais forte no mesmo texto.

Vale a pena usar imagens de referência mesmo com prompts bem escritos?
Sim, quando o objetivo é manter um ativo estável entre cenas. Referência visual resolve o que o texto descreve mal: formato exato do rosto, corte de cabelo, caimento de roupa, detalhes de produto. O texto, então, passa a cuidar de ação, luz e câmera.

Como lidar com prazos apertados?
Congele o estilo primeiro: paleta, luz e fichas canônicas. Depois produza em série, mantendo câmera simples e um evento por clipe. Complexidade narrativa se resolve na montagem, não dentro de cada geração.

Exercício prático para esta semana

Comece pequeno e com escopo fechado. Escolha uma cena, escreva a ficha canônica do personagem, defina paleta e luz, e gere três variações mudando apenas o enquadramento — plano fechado, plano médio e plano aberto. Anote o que cada versão ensinou sobre a ficha.

Depois escreva um prompt de vídeo de cinco segundos com um único evento e uma câmera fixa ou em travelling simples. Gere quatro vezes mudando só a direção do movimento. Por fim, monte uma sequência de três planos do mesmo personagem em cenários diferentes e verifique se ele continua reconhecível.

Repita esse ciclo em cinco cenas distintas e você terá, na prática, um método próprio de escrita de prompts — mais valioso do que qualquer lista de palavras mágicas. Modelos mudam de versão, atalhos expiram, referências de estilo saem de moda. O que permanece útil é a capacidade de transformar intenção em instrução precisa, com restrições explícitas, fichas reutilizáveis e um registro claro de cada decisão. É isso que separa quem apenas experimenta de quem realmente produz.

Alexander

Alexander