Start Free Now
Limited Time Offer: Get 50% OFF Starter & Basic Yearly Plans 🎉

短视频AI提示词完全指南:结构、一致性与进阶控制

Oct 2, 2026

先把提示词当成通告单,而不是许愿池

很多人第一次接触 AI 视频生成时,会写出这样的提示词:「一个很酷的未来城市,氛围感拉满,电影级画面」。然后盯着加载条等了很久,得到一个模糊、平淡、说不清哪里不对的十秒片段。问题不在模型不够强,而在于这句话里几乎没有可执行的信息量。

把提示词换成给真人摄影组的通告单,思路立刻就变了。你不会对摄影指导说「拍得酷一点」,你会说:黄昏,35mm 镜头,低角度跟拍,主体在画面右侧三分之一处行走,背景霓虹灯轻微失焦,浅景深,手持微晃。模型需要的正是这种级别的信息——它没有常识,只有你对画面的具体描述。

这个认知转变会带来三个直接好处。第一,结果可复现。当你把一次成功生成拆解成明确的描述层,下次换个主体、换套服装,其余部分照抄,成功率会大幅提高。第二,改动有方向。画面太暗不是你运气不好,而是光线层写漏了。第三,团队可协作。通告单可以交接,灵感不能。

还需要接受一件事:提示词不是一次写好的,是迭代出来的。专业创作者通常会准备三到五个版本,从高度结构化的长提示词开始,逐步删减,观察哪一个信息层是真正起作用的。删到画面开始崩坏的那一刻,你就找到了这条素材的「最小有效描述」。

提示词的七个构成层:逐层拆解与写法

结构化的意义不是把句子写长,而是让每一类信息各就各位。混乱的长句里,模型往往会忽略掉中间部分,只抓住开头和结尾的关键词。把信息分层,并在层级之间用逗号、分号或短句断开,能明显提升执行度。

层一:主体与动作

主体要具体到可识别:不是「一个人」,而是「三十岁左右的女性,短发,穿深灰色风衣」。动作要写成可以被相机拍到的物理行为:不是「她在思考」,而是「她停下脚步,低头看向手中的纸页,指尖轻轻翻动」。

动作还要考虑时长。十秒的片段适合一个完整的小动作或者一个连贯的姿态变化。如果动作包含三个以上阶段,结果通常会变成快进式的混乱。把复杂动作拆成多个镜头,比塞进一条提示词里更稳。

层二:场景与时间

场景写三层就够:地点类型、具体材质与陈设、时间或天气。比如「老式地铁站台,水泥墙面有水渍,站牌是褪色的蓝白配色,深夜,无乘客」。加入一两件标志性物件,能显著提升画面可信度,也方便在多条素材之间维持场景统一。

层三:镜头语言

这是最容易被忽略、却最影响成片质感的一层。至少写清四件事:景别(远景、中景、特写)、机位(平视、俯拍、低角度)、运动方式(固定、横移、推近、环绕、跟拍)、镜头特性(广角、长焦、浅景深、轻微畸变)。

举个可直接套用的写法:「中近景,平视机位,镜头缓慢向右横移,浅景深,背景光斑呈圆形」。当你想强调情绪时,把机位压低压近;想交代环境时,拉远并固定机位。

层四:光线与色彩

光线写来源、方向、软硬、色温。来源可以是窗光、霓虹、路灯、屏幕反光;方向分顺光、侧光、逆光;软硬决定阴影边界;色温决定冷暖倾向。色彩则写主色与点缀色的关系,比如「整体冷青色调,暖橙色只出现在人物脸部一侧」。

层五:风格与介质

风格描述要落到可识别的参照上:纪录片手持质感、复古胶片颗粒、广告级高光干净、动画赛璐璐上色、微缩模型实拍感。注意不要堆砌互相冲突的风格词,「写实」和「水彩插画」放在同一句里,模型只能随机取舍。

层六:节奏与音频线索

视频模型对节奏的响应正在变好。你可以写明「动作节奏缓慢,几乎没有多余肢体摆动」「快速剪辑感,画面在每个节拍切换」。如果生成结果自带音频,写明环境音类型与情绪强度,往往能让画面表演更贴合。

层七:负面约束

负面描述不要写成「不要丑」「不要奇怪」,而要写出具体要避免的视觉元素:多余手指、面部扭曲、文字乱码、镜头剧烈抖动、画面边缘断裂、过曝高光。把负面部分集中放在提示词末尾,并用统一的分隔符标出,便于后续复用。

一个完整的分层示例如下:

主体:三十岁女性,短发,深灰风衣,右手提一只旧皮包
动作:停在站台边缘,侧头看向轨道深处,风衣下摆被风吹起
场景:老式地铁站台,水泥地面有浅浅积水,褪色蓝白站牌,深夜,无人
镜头:中近景,平视,镜头缓慢向前推近至半身,浅景深,轻微手持呼吸感
光线:站台顶部冷白荧光为主光,右后方有一盏暖黄指示灯作为轮廓光
风格:写实,纪录片质感,轻微胶片颗粒,冷青色调
节奏:缓慢,动作克制,无快速剪辑
负面:多余肢体、面部扭曲、文字乱码、剧烈抖动、过曝

从一句话到成片:一条短视频提示词的完整工作流

有了分层意识之后,把它放进流程里才有价值。下面这套流程适用于大多数文生视频与图生视频场景。

第一步,先写一句话日志。 用一句人话说明这条素材要传达什么,比如「深夜独自等车的疲惫感」。这句话不会进提示词,但它是后面所有取舍的裁判。任何一层描述如果与它无关,就删掉。

第二步,写静帧描述。 先不写运动,只描述这一秒画面里有什么。如果这一帧作为照片都不好看,加上运动也不会变好。

第三步,加运动与镜头。 明确镜头是固定还是移动,主体是原地动作还是位移。这一步决定片段是「会动的照片」还是「一个镜头」。

第四步,压缩到核心描述。 把七层里对结果影响最大的四到五条留下。新手常犯的错误是把所有信息都塞进去,反而稀释了关键指令。

第五步,生成三个版本。 同一条提示词连跑三次,观察哪些元素稳定出现、哪些随机漂移。稳定的部分说明描述有效,漂移的部分需要更具体的措辞。

第六步,只改一个变量。 比如只把机位从平视改成低角度,其他不动。这样你才能知道是哪个词在起作用。一次改五处,等于重新开始。

第七步,记录与归档。 把提示词原文、参数、参考图、输出结果一起存下来。你在未来某天一定会需要「上次那条地铁站台的写法」。

角色与场景一致性:真正难的部分

单条素材好看不难,难的是三条素材拼在一起,观众相信这是同一个人、同一个地方。一致性问题几乎全部来自描述不统一,而不是模型不稳定。

建立角色词表并原样复用

给每个主要角色写一份固定描述,包括年龄区间、发型与发色、面部显著特征、固定服装、常带物件。这份描述在每一个镜头里都要原样出现,不允许同义替换。今天写「深灰风衣」,明天写「灰色长外套」,模型就会给你两个人。

如果使用了参考图或首帧图,把它固定下来并长期复用。图片锚定比文字描述的约束力强得多,尤其是脸型与发型。

场景锁定与镜头分组

把同一场景的所有镜头分成一组,共享同一段场景描述与光线描述。只改机位、景别和动作。当你想换场景时,明确写出新环境,不要靠一两个词暗示。

用首尾帧衔接镜次

把上一个镜头的末帧导出,作为下一个镜头的首帧输入。这是目前拼接多镜头最可靠的做法之一,能同时锁住人物姿态、服装连续性、环境光线和背景陈设。

统一后期参数

生成阶段就把色调和颗粒感写进提示词,比后期再调色更容易保持一致。如果你计划三条素材使用同一套风格描述,就把这段风格描述单独存成一个可复用片段。

不同模型的「方言」:提示词适配策略

同一个创意,在不同模型上需要不同的写法。把模型当成不同性格的摄影指导,你就不会用同一种语气跟所有人沟通。

写实与电影感向模型

这类模型对光学与光线的描述响应最好。尽量使用摄影术语:焦段、光圈感、景深、逆光轮廓、柔光箱。风格词要克制,一到两个就够,堆砌会让画面变得又脏又假。

对这类模型,可以把提示词写得更像一段短场景描述,而不是关键词堆。完整的句子能提供上下文,让模型理解各元素之间的关系。

叙事与文化向模型

这类模型对情境与人物关系的理解更强,对文化语境和服饰陈设的处理更自然。写这类提示词时,可以适当加入叙事信息:人物此刻的处境、与画面的关系、环境中的生活痕迹。

需要注意,叙事描述要服务于画面,而不是写小说。每一句情绪描述都应该能对应到某个可见细节,比如「疲惫」对应「肩膀下沉、眼下阴影、手里拎着的包松垮下坠」。

长镜头与多镜头向模型

这类模型能处理更长时间的连续动作,但对指令顺序更敏感。按时间顺序写:先发生什么,紧接着发生什么。使用「随后」「与此同时」「镜头切至」这类明确的时间标记,比并列结构更有效。

模型类型 提示词偏好 常见问题 应对方式
写实电影向 摄影术语、完整句、光线细节 风格词堆砌导致画面脏 风格词不超过两个
叙事文化向 情境描述、服饰环境细节 情绪词多但不可见 每条情绪对应一个可见动作
长镜头多镜头向 时间顺序、镜头切换标记 动作顺序错乱 用「随后」「切至」明确排序
动画风格向 上色方式、线条粗细、参考风格 风格混杂、比例不稳 只用一个风格锚点

进阶控制:分镜化、首尾帧与运动幅度

当你已经能稳定出片,下一步是从「生成素材」升级到「导演素材」。

分镜化写作。 把一条十五秒的创意拆成三个镜头,每个镜头单独写提示词,共享同一段角色与场景描述。这样既保证了连续性,也让每个镜头都能精心设计构图。多镜头模型的部分,可以用一句总纲加三条分镜的方式组织。

运动幅度控制。 运动幅度过大是画面崩坏的首因。写「缓慢」「轻微」「稳定」这类词,比写「动态强烈」更容易得到可用的结果。如果模型支持运动强度参数,从低档开始往上试,找到画面开始变形的临界点。

首尾帧配合。 首帧定姿态,尾帧定落点,中间交给模型补间。这对产品展示、动作衔接、转场设计特别有用。尾帧不一定要精细,大致构图正确即可。

收音与配乐预留。 如果后续要配音或对口型,提示词里要写明人物嘴部动作克制、面部正对镜头、光线均匀。这些描述能让后期对口型顺利很多。

时长与信息量的匹配。 五秒只能容纳一个动作,十秒能容纳一个动作加一次镜头变化。不要指望五秒讲完三个信息点。

建立自己的提示词模板库

模板库是长期效率的来源。没有它,你每次都在重新发明轮子。

命名与版本管理

给每条提示词起一个可检索的名字,包含场景、主体、镜头类型三个要素,例如「地铁站台-女性风衣-推近」。用日期或版本号区分变体,把有效版本标记出来。命名混乱的模板库等于没有模板库。

变量化写法

把经常替换的部分做成占位符:主体描述、动作、场景、镜头、光线、风格、负面约束。下次做同类内容,只改主体和动作,其余照抄。这样一条模板可以衍生出几十条素材。

主体:{角色描述}
动作:{单个可拍动作}
场景:{地点},{标志物},{时间与天气}
镜头:{景别},{机位},{运动方式},{景深}
光线:{主光来源与方向},{轮廓光或补光}
风格:{单一风格锚点},{色调},{颗粒或介质}
负面:多余肢体,面部扭曲,文字乱码,剧烈抖动,过曝

失败样本同样有价

记录失败版本和原因,比只记录成功版本更有价值。你会逐渐积累出一份「这个模型的禁区清单」,比如某些模型对快速手部动作、复杂镜面反射、密集人群的处理不稳定。这份清单能帮你提前避开大量返工。

常见错误与排查清单

错误一:形容词代替画面。 「高级感」「氛围感」「大片感」对模型没有意义。改成具体的光线、构图、色调描述。

错误二:一次改太多变量。 画面不满意时逐项调整,否则你永远不知道哪个词在起作用。

错误三:风格词互相打架。 写实加水彩加赛博朋克加复古,只会得到难以使用的结果。一个锚点足够。

错误四:动作密度过高。 十秒塞五个动作,画面会变成抽搐。拆镜头。

错误五:忽略镜头信息。 不写景别和机位,模型默认给一个平庸的中景固定镜头。

错误六:角色描述每次都换措辞。 一致性崩坏的根源就在这。原样复制。

错误七:负面约束写成抽象概念。 要写具体视觉现象。

错误八:不记录参数。 同一个提示词在不同参数下结果差异巨大,不记录就无法复现。

错误九:只追求单条惊艳。 短视频需要的是多镜头连续可用,不是三张漂亮的截图。

错误十:跳过静帧验证。 先用图片模型或首帧生成验证构图,能省下大量视频生成的等待时间。

当结果不对劲时,按这个顺序排查:先看主体描述是否模糊,再看动作是否超出时长容量,接着检查镜头与光线是否缺失,然后确认风格词是否冲突,最后检查负面约束与参数设置。多数问题在前三项就能定位。

团队协作与效率习惯

提示词一旦进入团队流程,就不再是个人技巧,而是文档资产。

用共享文档而不是聊天记录。 提示词、参数、参考图、输出样例放在同一份可检索的文档里。聊天记录里的提示词等于丢失。

建立术语表。 团队内部统一说法:「推近」不叫「拉近又推近」,「浅景深」不写「模糊背景」。术语统一的团队,出片一致性能提升一个量级。

设定风格基线。 每个项目先定一条风格描述,所有成员复用。基线上的差异只允许出现在主体与动作层。

分工而非分权。 有人专写提示词,有人专做后期,有人专管素材归档。让每个人都写提示词,通常会导致风格四分五裂。

批量化的正确姿势。 批量生成不等于批量随机。同一模板跑十条、只改主体与动作,然后挑出最好的三条,这样效率远高于十条完全不同的尝试。

常见问题 FAQ

提示词一定要写得很长吗? 不一定。结构化比长度重要。一个把主体、动作、镜头、光线说清楚的短提示词,效果通常好于一段含糊的长描述。先从五层写起,只在画面需要时才加细节。

中文和英文提示词哪个更好? 这取决于模型训练数据。如果某个模型对英文响应更准,就用英文写技术性描述(镜头、光线、风格),人物与场景用中文也能正常工作。最实际的做法是两种各跑一次做对比,以结果为准。

为什么同一个提示词每次结果都不一样? 生成过程带有随机性。想要更确定的结果,可以固定随机种子、固定参考图、固定首帧,并把提示词中的变量降到最低。

角色一致性总是失败怎么办? 优先用首帧或参考图锚定人物,其次确保角色描述在每个镜头里逐字一致,最后统一光线和镜头风格。文字描述在人物脸部上的约束力有限,图片锚定更可靠。

负面约束真的有用吗? 有用,但要写具体。写「多余手指」「文字乱码」「画面撕裂」这类可见现象,比写「不要难看」有效得多。

生成十秒片段总是动作崩坏怎么办? 缩短时长、降低动作复杂度、减少镜头运动。先拿到稳定的五秒,再逐步加长。一次加两秒,观察崩坏点在哪里。

应该先写提示词还是先想分镜? 先想分镜。提示词是执行层,分镜是结构层。没有结构的提示词,写得多漂亮也只是单张素材。

怎么判断一条提示词已经足够好了? 连跑三次,主体、服装、场景、光线、风格都保持稳定,且画面里没有需要后期修复的明显缺陷,就可以归档进模板库。

需要为每个模型维护一套提示词吗? 核心描述可以共享,技术细节建议按模型微调。把共享部分写成模板,把模型差异写成附加段落,维护成本会低很多。

结语:把提示词变成可复用的资产

短视频创作的竞争,最终会从「谁有更好的工具」转移到「谁有更稳定的表达系统」。一个好提示词的定义不是它写出了多华丽的画面,而是它能被反复执行、被别人接手、被稳定地变成成片。

从今天开始,你可以只做三件事:把手上最满意的一条提示词按七个层次拆解归档;为你的主角写一份固定描述并在下一个镜头里原样复用;为最常见的三个场景各建一条变量化模板。三周之后,你会发现自己的返工率明显下降,出片速度明显提升。

工具会换代,模型会更新,分层描述、镜头意识、一致性控制这些能力不会过期。它们本质上不是 AI 技巧,而是把画面想清楚的能力——AI 只是让它第一次变得可以批量执行。

Alexander

Alexander