Start Free Now
Limited Time Offer: Get 50% OFF Starter & Basic Yearly Plans 🎉

AI视频提示词实战指南:结构化指令、镜头运动与多镜头连贯工作流

Oct 2, 2026

为什么“卡壳”总发生在工具最多的时代

很多人以为创作卡壳是灵感问题。真正做过 AI 视频项目的人知道,卡壳更接近一种信息缺失:你脑子里有画面,但交给模型的文字不足以支撑这个画面,于是模型开始替你猜。它每猜一次,就产生一次随机;一条成片通常由十来个片段组成,只要有四五个片段被猜错,整条片子就散了。

以下四种症状最能说明问题。

  • 角色漂移:同一个角色在同一条片子里换了脸型、发长、外套颜色。你在每个片段的提示词里都写了“短发女性”,但你没有定义她的脸型、发长、服装材质和随身道具,模型只能在“短发女性”这个宽泛概念里自由发挥。
  • 动作断层:片段单独看没问题,但动作只有起点没有终点,剪辑时接不上下一个镜头。提示词里写“她走进房间”,模型可能让她走到画面中央就停住,也可能让她一直走向镜头直到穿模。
  • 空间混乱:上一个镜头角色坐在窗边左侧,下一个镜头她出现在桌子右侧,观众需要重新建立空间关系。这是缺少场景锚点和视线方向描述造成的。
  • 风格撕裂:每个片段单独看都很漂亮,拼在一起像四条不同品牌的产品广告。原因是每个片段的风格描述用了不同的词,色温、对比度和颗粒感都对不上。

这四类问题几乎都能在提示词层面提前解决,而不必在后期花五倍时间修补。关键在于把提示词从“许愿”变成“需求文档”。

一个粗略的经验是:你少写一句关键约束,模型就多一次自由发挥的机会。三十秒的成片往往需要 8 到 15 个片段,如果每个片段平均有一次跑偏,你就要在重生成、挑素材和剪辑上多花好几个小时。把这些时间换成一个结构化的提示词模板,是投入产出比最高的一步。

提示词的四层结构:把许愿变成需求文档

模型不会读心,它只读文本。一段可复用的提示词可以拆成四层:主体与动作、风格与美术、摄影与技术参数、序列与一致性。四层不是仪式感,而是四条防止模型乱猜的防线。少了任何一层,模型都会在那一层上替你随机决定。

下面是一个可以直接套用的模板:

[主体] 三十岁出头的亚洲女性,齐肩黑发,深蓝工装夹克,左袖口有磨损
[动作] 从画面左侧走入,在机床前停下,低头检查一枚金属齿轮
[环境] 老式机修车间,水泥地面有油迹,背景墙上挂着扳手
[风格] 冷调纪实摄影,低饱和,细腻颗粒,轻微暗角
[镜头] 等效 85mm,F1.8,浅景深,手持轻微呼吸感
[光线] 侧逆光,窗格阴影落在右脸,主光色温约 4300K
[一致性] 沿用角色卡 A;光源方案 B;色调曲线 C
[约束] 画面内不出现文字,不出现第二个主体,避免广角畸变

把这段话和“一个女生在车间里检查零件”对比一下,差别不在辞藻,而在可执行性。前者几乎每一个词都能对应到画面上可验证的元素,后者则把一半以上的决定权交给了模型。

主体与动作层:动词优先,状态代替情绪

主体描述的顺序建议是:年龄段、外貌特征、服装、随身道具、当前状态。顺序本身不重要,重要的是“特征要少而区分度高”。与其写“漂亮的年轻女性”,不如写“眉骨高、下颌线明显、鼻梁有细小雀斑的年轻女性”,后者更容易在不同片段里稳定复现。

动作层最容易踩的坑是写情绪形容词。写“她悲伤地看着齿轮”,模型会给你一张表情模糊的脸;写“她低头看齿轮,眉头轻皱,手指在齿面上来回摩挲两下,然后停住”,模型才有可执行的目标。

一个好用的动作公式是:起点 + 过程 + 终点。

  • 起点:她原本在哪里,朝向哪边。
  • 过程:她做了什么,做了几次,速度如何。
  • 终点:最后一个画面帧停在什么状态。

终点尤其重要,因为剪辑点通常落在动作完成的那一刻。如果你不写终点,模型会在动作中途收尾,你就要在后期的十几帧里硬找切点。

风格与美术层:只选一个主导风格

风格描述有三个常见的维度:媒介(实拍、动画、定格、像素)、摄影参照(某种胶片、某种布光流派)、色彩与材质(低饱和、高对比、奶油质感、粗颗粒)。

问题在于,很多人一次写了三个维度的词,而且互相冲突:既要“电影级写实”,又要“水彩质感”,还要“赛博霓虹”。模型的反应是把它们平均一下,结果谁都不像。

建议只选一个主导风格,其余维度作为修饰,并且把修饰控制在两三个词以内。比如:

[风格] 主导:纪录片实拍质感;修饰:低饱和、细腻颗粒

如果你确实需要混合风格,把它拆到不同镜头里,而不是塞进同一句提示词。第一幕实拍、第二幕插入动画闪回,这种对比是剪辑层面的设计,不需要模型在同一帧里完成。

摄影与技术参数层:把摄影棚语言搬进来

这一层是很多创作者最忽略、但提升最明显的一层。可用的参数包括:

  • 焦距:等效 24mm 适合环境交代,50mm 接近人眼,85mm 以上适合人物特写与压缩背景。
  • 光圈与景深:F1.4 到 F2.0 是浅景深,F5.6 以上是深景深。浅景深能让杂乱背景不抢戏,深景深适合展示空间关系。
  • 稳定方式:三脚架固定、滑轨、肩扛、手持、稳定器。这一项直接决定画面是“稳”还是“有点呼吸感”。
  • 颗粒与色温:颗粒影响复古程度,色温影响情绪。冷调偏理性,暖调偏亲密。
  • 画幅与帧率:宽银幕适合叙事,竖屏适合社交平台,逐帧略慢的节奏适合慢动作。

写这一层时注意不要自相矛盾。写“浅景深”同时写“背景细节清晰”,模型只能选一个。写“手持”同时写“绝对稳定”,也是一样的道理。

序列与一致性层:为跨镜头提前铺路

一致性层的作用不是提高单帧质量,而是让你在拼片时不崩溃。它的写法有两种:一种是直接复述关键特征,另一种是引用你事先准备好的“角色卡”“光源卡”“色调卡”。

角色卡记录 5 到 8 个不可变特征:脸型、发型、发色、服装主色、服装材质、标志性道具、体态。光源卡记录主光方向、色温、明暗比。色调卡记录饱和度、对比度和暗部倾向。

在每个片段的提示词末尾加一句“沿用角色卡 A、光源方案 B、色调曲线 C”,成本极低,但能让整条片子的观感统一得多。

五步工作流:从一句话到可交付片段

结构清楚了,接下来要把它放进流程。下面这套五步法适用于大多数以叙事为主的短视频项目。

第一步:写一句话意图

用一句话说清楚:谁,在什么处境下,想要什么,遇到什么阻碍。这句话不写进提示词,它是你所有后续决策的裁判。当你纠结某个镜头要不要保留时,回到这句话就能判断。

第二步:列镜头表

不要直接开始生成。先用表格把片段列出来,一行一个镜头。

编号 时长 景别 内容 运动 一致性锚点
01 3s 大全景 车间外观,晨光 固定 光源卡 B
02 4s 中景 主角走入,停在机床前 缓慢推进 角色卡 A
03 2s 特写 手指摩挲齿轮 固定微晃 角色卡 A
04 5s 近景 抬头,看向窗外 轻微上摇 光源卡 B

表格一旦排好,你会发现很多问题在生成之前就暴露了:两个连续镜头景别太接近、动作方向相反、缺少环境交代镜头。

第三步:逐镜头扩写四层提示词

按上一节的模板,把每个镜头扩写成四层结构。这一步最耗时,但也是最值得花时间的一步。建议给每个镜头写两个版本:一个“保守版”(参数少、动作简单、成功率高),一个“激进版”(构图更难、运动更复杂、效果更好但容易失败)。

第四步:小批量测试与筛选

每个镜头先跑少量变体,观察它是否满足三个条件:主体是否稳定、动作是否有终点、风格是否与相邻镜头接近。不要一次生成二十个版本再挑,那样只会增加选择成本。

筛选时用一个简单的三分法:可以直接用的、需要微调的、需要重写提示词的。只有第三类才值得回头改结构,前两类改参数就够了。

第五步:固化变量并归档

把通过的提示词存下来,标记哪些词是可变的(比如时间、天气、服装颜色),哪些是不可变的(角色卡、光源卡)。下一次做同系列内容时,你只需要替换可变部分。

镜头语言与运动控制:让画面“会演戏”

静止画面也能讲故事,但运动画面更容易带节奏。问题在于,运动是 AI 视频里最容易出错的维度,因为它要求模型在时间轴上保持空间逻辑。

常用运动词与写法

  • 推:镜头向主体靠近,压迫感增强。写法:缓慢推进,三秒内由中景变为近景。
  • 拉:镜头远离主体,通常用于结尾或揭示环境。写法:缓慢后拉,结束时露出整个车间。
  • 摇:机身不动,镜头左右转动,用于展示空间。写法:从左向右平移视线,扫过墙面工具架。
  • 移:机身平行移动,空间层次变化明显。写法:沿走廊向右移动,前景有立柱掠过。
  • 升降:垂直运动,适合呈现规模。写法:从桌面高度缓缓升高至俯视。
  • 跟:跟随主体移动,适合动作场面。写法:跟在人物身后,保持半身景别。
  • 环绕:围绕主体旋转,适合强调人物状态。写法:绕人物顺时针环绕约九十度。
  • 手持微晃:增加临场感。写法:肩扛手持,轻微呼吸式晃动。
  • 变焦推轨:背景压缩同时主体不变,制造眩晕感。写法:向前推进同时缩小焦距,背景向后拉伸。

速度与幅度必须写清楚

“缓慢推进”和“快速推进”在模型眼里可能是同一件事。加上时间和幅度,控制力会明显提升:

[镜头] 固定起幅,中景;在三秒内匀速推进至近景;推进过程中保持主体在画面中央偏左

这类写法还有一个附带好处:它天然限定了片段时长。你写“三秒内”,生成或挑选素材时就有了明确的判断标准。

三类高风险运动

第一类是快速横摇,模型容易产生糊成一片的画面。第二类是穿越遮挡物,比如镜头穿过门框或枝叶,空间连续性极易断裂。第三类是主体与镜头反向运动,方向写不清就会变成来回拉锯。

如果项目时间紧,把这三类运动换成等价但更稳的方案:横摇换成固定镜头加人物走动,穿越换成切镜,反向运动换成两个独立镜头拼接。

多镜头连贯性:三种锚定法

连贯性是长片与短片的真正分水岭。单个片段再漂亮,如果十个片段像十个不同世界,观众依然会出戏。下面三种锚定法可以叠加使用。

文字锚定:角色卡与场景卡

在项目开始时写两份文档。角色卡记录不可变特征,场景卡记录空间布局:门在哪、窗在哪、主角通常朝向哪一边、光源来自哪个方向。

每一段提示词里都重复引用这两张卡。重复看起来很笨,但它是目前最稳定的做法。

图像锚定:首帧与关键帧

如果工作流支持首帧或关键帧参考,优先使用它。先固定一张符合角色卡的形象图,再让后续片段以它为起点。这比纯文字描述稳定得多,因为文字里“齐肩黑发”这四个字无法描述脸型的具体弧度。

注意参考图与提示词的一致性。如果参考图里角色穿深蓝夹克,而提示词写的是灰色外套,模型会左右摇摆,结果两边都不像。

剪辑锚定:用切点掩盖不一致

不是所有不一致都必须靠生成解决。把切点放在运动最剧烈的那一帧,观众的眼睛会被运动吸引,忽略细节差异。在动作切换、镜头切换、光线突变处切,是成本最低的连贯性手段。

同样地,插入一个不含角色的空镜作为过渡,可以让观众的大脑重置对角色外观的记忆,再出现时更容易接受。

光线锚定:最容易被忽略的一项

同一场戏里,光源方向和色温必须一致。上午的窗光与傍晚的暖光混用,观众第一反应不是“光线变了”,而是“这两个镜头不是一场戏”。在提示词里明确写“主光来自画面右后方窗格,色温约 4300K”,比写十个风格形容词更有效。

不同模型的提示词适配策略

不同生成模型对提示词的响应方式差别很大。与其记具体型号,不如记住四类模型的性格。

写实电影感型

这类模型对摄影参数非常敏感,对文学化描写反应一般。提示词应该短句化、名词化,把焦距、光圈、布光写在显眼位置。避免使用“梦幻”“唯美”这类主观词,改成“柔光罩打底、边缘轻微过曝、阴影保留细节”。

风格化与动画型

这类模型更吃风格词和材质词,对摄影参数反应较弱。可以用“手绘赛璐璐”“水粉质感”“粗线条勾边”这类表述。缺点是主体一致性往往比写实模型差,因此更需要角色卡和参考图。

长镜头叙事型

这类模型适合一次生成多秒连续画面,优势是运动自然,劣势是难以精确控制中途事件。写提示词时应该描述整段动作的弧线,而不是逐帧指令。比如写成“她从犹豫到决定,最后转身离开”,比写“第一秒皱眉、第二秒抬头”更有效。

图生视频与局部编辑型

这类工具的核心是“改动幅度”。提示词要明确哪些部分保持不变,比如“仅改变头发飘动方向,人物外貌、服装与背景保持不变”。如果不写这句,模型很可能把整张图重画一遍。

原生音频与对白提示

如果模型支持生成音频,把声音描述放进提示词能省掉后期对轨的大量时间。可写的内容包括:环境声来源、音量关系、是否有对白、对白语气与语速。注意不要在同一段里同时要求“安静环境”和“嘈杂市场”,这类冲突会让音频输出变得随机。

常见错误与排错清单

下面这张表可以直接贴在工位上。看到症状,去对应栏找原因和修法。

症状 可能原因 修法
角色每个片段都变脸 主体特征不足或未复用角色卡 补 5 到 8 个区分度高的特征,逐段引用角色卡
画面好看但动作僵硬 只写了情绪,没有写动作起点与终点 改成起点加过程加终点的写法
运动方向前后矛盾 未指定运动方向与幅度 写明方向、速度、起止景别
风格忽冷忽暖 风格词冲突或色温未固定 只保留一个主导风格,另加光源卡
背景元素乱入 约束条件缺失 加入“画面中不出现第二个人物”等约束
手指与文字崩坏 主体过小或过远 提高景别,减少画面内文字需求
片段太长、节奏拖 未设定时长与速度 在提示词中写明秒数与运动速度
拼接处跳变 切点落在静止帧上 把切点移到运动最大的一帧
音频与画面错位 声音描述缺失 补充环境声与对白描述,或后期单独铺轨
每次结果都不一样 提示词过长且层次混乱 按四层结构重排,删掉互相冲突的词

排错时有一个原则:一次只改一个变量。同时改三处,你就不知道是哪一处起了作用。

提示词库与版本管理

当项目从一条片子变成一系列片子,提示词就变成了资产。它需要一套简单的管理办法。

命名与变量占位

给每个提示词一个可读的编号,例如 scene-03-hand-closeup-v2。把可变量用占位符标出来,比如 {{时间}}、{{服装主色}}、{{天气}},这样复用的时候不容易漏改。

A/B 测试记录

每次做对比测试,记录三件事:改了哪个词、结果差异是什么、是否采用。三列表格就够了。坚持记录几周,你会得到一份属于自己的提示词偏好清单,比任何通用教程都贴合你的项目。

复用与迁移

结构化的提示词更容易迁移到新工具。因为主体层和一致性层是内容层面的描述,与具体模型无关;只有技术参数层需要按模型特性调整。这也是为什么把四层分开写,比写一段混合的长句更有长期价值。

关于提示词的常见问题

提示词越长越好吗?

不是。长度本身没有价值,覆盖的信息维度才有价值。一段两百字但把主体、动作、镜头、光线、约束都说到位的提示词,比一段八百字堆满形容词的提示词有效得多。判断标准很简单:删掉任何一句,画面会不会变得不确定?会,就留着;不会,就删。

一定要写摄影参数吗?

不一定,但写了通常更稳。参数的作用是压缩模型的选择空间,让结果更可预测。如果你追求的是随机的惊喜感,可以少写;如果你要交付一条风格统一的成片,建议把焦距、景深、稳定方式和色温固定下来。

为什么同一个提示词跑两次结果完全不同?

生成过程本身带有随机性,这是正常的。解决办法不是反复重跑同一个提示词,而是把提示词写得足够具体,让随机性发生在你不关心的维度上。同时固定参考图、画幅比例和其他可设置的参数,也能显著降低波动。

角色一致性到底能靠文字解决吗?

部分能。文字能锁定发型、服装、体态、道具这些高区分度特征,但无法精确描述脸部骨骼。因此最稳的做法是文字锚定加图像锚定:用文字定义不可变特征,用参考图锁定面孔,再用剪辑锚定掩盖剩下的差异。

一次生成多少个版本比较合适?

对于结构清晰的提示词,每个镜头两到三个版本通常够用。如果五个版本都没有可用的,问题几乎肯定出在提示词结构上,继续生成只是浪费时间和资源。

没有灵感的时候怎么办?

不要盯着空白输入框。先去写镜头表,把每个镜头当成一个独立的小问题:这个镜头要交代什么信息?用哪个景别最省空间?这样想,提示词会自己长出来。

竖屏和横屏的提示词要改吗?

要改,主要改构图描述。竖屏更适合上半身近景和纵向运动,横屏更适合环境交代和横向移动。如果在竖屏里写“大全景加横向移动”,通常会得到主体过小、运动被裁掉的画面。

团队协作时怎么保证风格统一?

把角色卡、光源卡、色调卡做成共享文档,并要求所有成员在提交提示词前引用同一套卡片。再加上一份提示词命名规范,基本就能避免每个人按自己喜好写风格的混乱。

结语:把卡壳变成流程

卡壳很少是因为没有工具。它更多是因为在“想清楚”和“说出来”之间少了一道工序。提示词工程做的就是这道工序:把脑子里的画面翻译成模型能执行的需求文档。

如果你只从这篇文章带走一件事,就带走四层结构:主体与动作、风格与美术、摄影与技术参数、序列与一致性。把它写成模板,贴在项目文件夹里,每次开工先填一遍。

开工前的十项检查清单:

  1. 一句话意图是否写清楚。
  2. 镜头表是否排好,景别是否有变化。
  3. 每个镜头是否覆盖了四层结构。
  4. 角色卡、光源卡、色调卡是否建立并在提示词中引用。
  5. 运动是否写明了方向、速度与起止景别。
  6. 是否存在互相冲突的描述词。
  7. 是否写明时长与输出画幅。
  8. 约束条件是否包含“不出现什么”。
  9. 切点位置是否确定在运动帧上。
  10. 通过的提示词是否已归档并标记可变量。

这十项花不了多少时间,却能省掉后期最痛苦的那几个小时。真正稳定的产出从来不靠运气,而是靠一套愿意被重复执行的流程。

Alexander

Alexander