提示词决定视频的天花板
同样的模型,有人生成的视频像随手拍的素材,有人生成的有电影质感。差别不在运气,在提示词。AI视频生成的技术门槛越来越低,剩下的竞争都集中在「把想法准确翻译成指令」这件事上。对中文创作者来说,还有一个额外的问题:直接用翻译腔的英文提示词,效果往往不如用精心组织的中文描述。
这篇文章不讲玄学,只讲能直接上手的技巧:结构化写法、镜头语言、负面提示、角色锁定、多模型配合和成本控制。
用结构代替长句
新手最常见的错误是把提示词写成一段又长又散的描述,信息全混在一起。更好的做法是分段结构,让模型知道每部分管什么:
- 主体:谁,长什么样,穿什么,在做什么;
- 环境:在哪里,什么时间,什么天气;
- 镜头:什么景别,什么角度,怎么运动;
- 光影:什么光线,什么色调,什么氛围;
- 风格:写实、动漫、胶片感、赛博朋克等。
写的时候每部分单独成句,不要揉成一团。模型的注意力有限,信息越清晰,越能按你的意图执行。
用电影术语精准控场
中文里有很多现成的影视词汇,用对了,效果立竿见影:
- 景别:远景、全景、中景、近景、特写;
- 镜头运动:推轨、摇移、跟拍、升降、手持;
- 角度:俯拍、仰拍、平视、低角度;
- 光线:逆光、侧逆光、轮廓光、硬光、柔光。
比如「主角站在雨夜的街头」和「低角度仰拍,主角站在雨夜的街头,霓虹灯在他脸上打出冷暖对比,镜头缓缓推进」,完全是两个层级的结果。写提示词时,把镜头当导演来指挥。
文学化描述是中文的优势
中文表达情感和氛围的能力特别强,这正是提示词需要的。「疏离感弥漫的清晨」「霓虹灯下带着一丝疲惫的独行」这类描述,能直接给模型传递情绪方向。英文提示词往往要堆形容词才能达到类似效果,中文一句就够了。
但要注意:氛围词负责情绪,具体词负责画面。两者都要有,别只写氛围,模型不知道具体拍什么;也别只写具体,画面会干巴巴没有感觉。
负面提示词不能省
告诉模型「不要什么」和告诉它「要什么」同样重要。常见的负面提示:
- 避免卡通化、避免过度锐化;
- 排除不自然光影、排除肢体扭曲;
- 不要文字水印、不要多余人物。
尤其在做写实风格时,负面提示能挡住很多AI视频的典型瑕疵。
角色一致性靠锁定
AI视频最大的痛点,是同一个角色在不同镜头里长相漂移。解决办法是「锁定描述符」:
- 给角色写一套固定描述,包括面部特征、服装、标志性道具;
- 每次生成都用完全相同的前缀引用这套描述;
- 先生成角色的参考图,再用图生视频做动画。
比如「主角:李明,脸上有浅浅的疤痕,黑色运动服,戴银色耳机」,这套描述在每一段里都要原样出现,不能今天长这样、明天换件衣服。描述锁定加参考图锁定,双保险。
多模型配合:分工协作
没有一个模型是万能的,专业创作者的做法是分工:
- 用生成快的模型做草稿,验证构图和氛围;
- 用擅长写实的模型做主体画面;
- 用擅长运动的模型做动作场景;
- 用风格化模型做特定艺术效果。
提示词也要跟着模型调:给擅长中文语义的模型,写更有文化细节的中文描述;给追求速度的模型,写简洁直接的指令。工具选对了,提示词省一半力气。
成本控制:草稿便宜,成片舍得
生成是有成本的,但钱要花在刀刃上:
- 测试和试错用低成本模型,快速验证方向;
- 最终成片用高质量模型,把预算留给真正投放的内容;
- 每段视频设定生成上限,防止无限重试;
- 提示词精简精确,避免冗余描述浪费计算。
一个常见做法是:先用低成本模型生成10个版本的构图和表情测试,选出最好的方向,再用高质量模型精修。既省钱,又出效果。
长视频的连贯性技巧
做超过一分钟的内容时,提示词不能每段孤立。两个实用技巧:
环境演变而不是固定
描述环境的渐变过程,比如「时间从正午(明亮、高对比)过渡到黄昏(暖色调、长阴影)」,而不是把每个镜头都写死。模型理解演变,画面才连贯。
继承前镜状态
如果上个镜头里箱子是打开的,下个镜头要写明「继承前一镜中打开的箱子状态」。跨镜头的道具和人物状态,靠提示词显式传递。
可直接套用的模板
给你一个中文提示词模板,改参数就能用:
【主体】[人物描述],[动作描述]
【环境】[地点],[时间],[天气]
【镜头】[景别],[角度],[运动方式]
【光影】[光线类型],[色调],[氛围]
【风格】[写实/动漫/胶片等]
【负面】[不要的内容]
每次生成前把模板填完,比临场发挥稳定得多。
常见问题
中文提示词和英文提示词哪个好?
看模型。中文模型对中文语义理解更好,国际模型可能英文更稳。建议同一个想法两种都试,对比结果。
提示词越长越好吗?
不是。有效信息越多越好,废话越少越好。能删掉的词就删掉。
角色还是会漂移怎么办?
检查两点:描述是否每次都一模一样;是否用了参考图。两个都做到位,漂移会大幅减少。
怎么知道自己写得好不好?
对比实验。同一段提示词,只改一个变量,看结果差异。多做几次,你就知道哪个词起作用。
总结
Prompt工程不是背模板,是理解模型怎么读你的话。结构化分段、电影术语、氛围描述、负面限制、角色锁定、模型分工——这些技巧组合起来,能把AI视频生成从碰运气变成可控的生产流程。先写好角色描述,配合AI视频生成器和AI工具集合练手,再看GPT Image、Seedance 2.0这些模型的表现,你的作品会很快拉开差距。

