期間限定オファー:Pro / Ultraプラン初月が50%OFF🎉

AI短视频提示词工程实战:结构化Prompt与角色一致性

Sep 21, 2026

从剪辑到“写指令”:短视频生产的范式变化

短视频的竞争规则一直很直接:前两秒抓不住人,后面做得再好也很难挽回。这意味着创作团队必须同时满足三个条件——更新频率高、单条成本低、风格还要稳定。传统流程里,这三件事几乎互相矛盾:拍摄要人、要场地、要灯光,剪辑要时间,改一版就要重新协调所有人。

生成式视频把其中一部分工作从“执行”转移到了“描述”。你不再需要租摄影棚,但你需要在几行文字里,把摄影棚里会发生的一切讲清楚。这就是提示词工程在短视频语境下的真实含义:它不是玄学咒语,而是一份写给模型看的、无法被追问的拍摄脚本。

这里有一个关键差别。当你把分镜交给一位摄影指导,他会自动补齐大量信息:知道夜戏要补光,知道特写要换长焦,知道演员走位要留出余量。模型不会。你没写的部分,它要么随机猜,要么用一个平均化的结果糊过去。所以提示词的第一原则是:不要写你觉得重要的,要写模型无法自己决定的。

实践中,新手最容易掉进三个坑。

第一,把提示词当成关键词堆砌。“电影感、4K、超写实、大师作品、极致细节”这类词堆上二十个,模型并不会因此更懂你,反而会稀释真正有信息量的描述。注意力是有限的,形容词越多,每个词分到的权重越少。

第二,把提示词写成长篇小说。模型对结构的敏感度远高于对长度的敏感度。一段三百字、没有分句逻辑的描述,效果往往不如三句层次分明的话。

第三,跑一次就下结论。同一个提示词连跑五次,出来的可能是四条废片加一条能用的。生成式视频的本质是概率采样,筛选是流程的一部分,而不是失败的证明。

理解了这三点,后面的所有技巧才有落点。提示词工程的目标不是“写出漂亮的句子”,而是“降低结果的方差”。当你发现同一条提示词每次都能给出可用素材时,说明你已经掌握了它。

提示词的结构骨架:把一句话变成可执行的拍摄脚本

一个稳定的提示词通常包含五块信息:主体、动作、环境与光线、风格与镜头、技术规格。这五块的顺序不必绝对固定,但缺哪一块,模型就会在哪一块自由发挥。

一个可以直接套用的模板长这样:

主体:一位三十多岁的女性,深灰色风衣,短发,表情克制
动作:推开门,缓慢走进便利店,脚步停在货架前
环境与光线:雨夜,便利店冷白灯与街道霓虹混合,地面湿润反光
风格与镜头:写实电影质感,35mm 镜头,中景推近,浅景深,轻微手持感
技术规格:垂直画幅 9:16,24fps,单镜头约 5 秒
约束:不要出现文字水印,不要多余肢体,不要快速镜头晃动

主体与动作:越具体越可控

“一个女孩”是无效描述。“二十岁出头、扎低马尾、穿米白色针织开衫的女孩”才是可执行的。主体描述里真正起作用的是可识别的视觉特征:年龄区间、发型、服装颜色与材质、体态、表情状态。这些特征同时也是后面做角色一致性的锚点。

动作要写“可被镜头拍到”的动作。模型不理解“她很焦虑”,但理解“她反复看手机屏幕,然后咬了一下嘴唇”。心理活动必须翻译成身体动作,这是从文案思维切换到导演思维的关键一步。

还有一个容易被忽略的细节:一个镜头里不要塞太多动作。让角色同时走路、转身、说话、挥手,失败概率会成倍上升。把复合动作拆成两个镜头,成片反而更顺,也更符合真实拍摄的分镜逻辑。

环境与光线:决定画面“贵不贵”

观众判断一条片子“专业还是廉价”,往往取决于光线逻辑是否统一。写环境时至少要明确三件事:时间与天气、主光源来自哪里、色温倾向。

对比一下两种写法:

  • “在咖啡馆里” → 模型随机给一个中性照明,画面平淡。
  • “下午四点,靠窗位置,侧逆光穿过百叶窗,在桌面投下条纹阴影,暖黄主光加窗外冷蓝补光” → 画面立刻有层次。

材质与质感也属于这一块。湿润地面、磨砂玻璃、金属反光、布料褶皱,这些词能显著提升画面的可信度,尤其在近景和特写里。

风格与镜头:让模型知道“谁来拍”

风格词要少而准。写“写实电影质感”比写“大师作品、超高清、顶级画质”更有效。如果你想要某种明确的视觉参照,可以用拍摄语言描述:手持纪录片感、航拍俯视、微距特写、低角度仰拍。

镜头信息包括景别、焦距感、运动方式。特别提醒:景别与运动要匹配内容。人物情绪变化用中近景,空间关系用全景,细节质感用特写。在一个全景镜头里塞满特写式的细节描述,模型会给出一个不伦不类的折中结果。

技术规格:画幅、时长、帧率

这块最容易被省略,但它直接决定成片能不能用。垂直平台需要 9:16,横屏内容需要 16:9,方形适合部分社交场景。时长上,生成模型对单镜头 3 到 6 秒的稳定度通常最好,更长的镜头更容易出现结构漂移。帧率选择 24fps 偏电影感,30fps 更贴近常规社交媒体的观看习惯。

把这五块写全,你的提示词就不再是一句“感觉”,而是一份可复现的规格说明。复现能力,是团队协作里最值钱的东西。

模型匹配:不同模型“听得懂”的语言不一样

同一个提示词,换一个模型可能效果天差地别。这不是模型好坏的问题,而是训练数据与对齐方式的差异。有的模型对自然语言长句理解得好,能处理复杂场景描述;有的模型更吃关键词,长句反而让它抓不到重点;有的模型对镜头术语响应极佳,写“推镜”“环绕”就有明显反馈;还有的模型对光线描述极其敏感,对风格词却反应迟钝。

所以真正专业的做法,是为常用模型各建一张“模型卡片”,记录四件事:

  1. 触发词:哪些词能让它明显变好,哪些词几乎无影响。
  2. 镜头响应:它理解运镜指令的程度,是否需要换成更直白的说法。
  3. 典型失败模式:它容易在什么地方崩,比如手部、快速横向运动、多人场景。
  4. 最佳单镜头时长:超过多少秒开始漂移。

文生视频与图生视频:提示词重心完全不同

文生视频需要你描述一切,包括画面构成。图生视频则不同:参考图已经确定了外观、服装、构图和色彩基调,此时提示词的重心应该转向运动与镜头,而不是重复描述已经在图里的内容。

常见错误是在图生视频里再写一遍“穿红色连衣裙的女性,站在海边”,这不仅多余,还可能与参考图冲突,让模型在两者之间反复妥协,导致画面抖动或变形。

图生视频的提示词应该长这样:“镜头缓慢向右平移,人物转头看向镜头,头发被风轻吹起,海浪持续涌动,光线保持不变。”——全部是变化量。

参数优先于形容词

很多“画面崩坏”的问题,其实不是提示词写得不好,而是参数设置不合理。运动强度过高会让结构和纹理撕裂;单镜头过长容易在中段出现身份漂移;分辨率与画幅比例不匹配会引入奇怪的裁剪。遇到问题先检查参数,再改文字,往往更快找到原因。

负面约束:避免画面崩坏的隐形防线

负面提示词的作用是划定边界。虽然不同平台的支持方式不同——有的提供独立的负面输入框,有的只能写在正文里用“不要出现……”表达——但思路是一致的:把已知的高频失败模式提前挡掉。

短视频里最常见的崩坏类型包括:

  • 手部与手指变形、多指、多余肢体
  • 画面中出现乱码文字、水印、logo 残留
  • 面部扭曲、双眼不对称、牙齿异常
  • 整体模糊、过度锐化、噪点堆积
  • 帧间闪烁、物体突然出现或消失
  • 镜头畸变、地平线倾斜

一个实用的负面清单可以这样写:“不要文字,不要水印,不要多余手指,不要面部扭曲,不要突然的镜头晃动,不要画面闪烁,不要出现第二个人物。”

两个注意事项。第一,负面词不是越多越好。堆上三四十个负面词,会占用模型的注意力预算,正向描述反而被削弱。第二,负面约束要针对具体模型。某个模型容易在快速横移时撕裂,就专门写“避免快速横向运动”,比笼统地写“不要变形”有效得多。

还有一个更聪明的思路:与其事后修补,不如在设计阶段就绕开难点。手部动作容易崩,那就用中景或远景,用袖口、口袋、道具遮住手;多人互动容易糊,那就用单人镜头加剪辑节奏来表达。这本质上和实拍里的“藏拙”是同一门手艺。

角色一致性:让同一个人物跨镜头出现

如果一条短视频里同一个人物在不同镜头里变成不同的人,观众会立刻出戏。角色一致性是 AI 短视频从“能看”到“能用”的分水岭,也是最需要系统方法的环节。

参考图与特征锚点

最可靠的方法仍然是参考图驱动:先确定一张满意的角色图,然后在后续所有镜头里沿用同一张图作为首帧或参考。参考图决定了模型的身份基线,比任何文字描述都更稳定。

如果只能靠文字,就需要建立“特征锚点”,并且逐字复制到每个镜头的提示词里。锚点通常包括:

  • 发型与发色(长度、分缝、是否扎起)
  • 脸型与五官特征(如圆脸、单眼皮、唇角有痣)
  • 服装(颜色、材质、领口样式、配饰)
  • 体型与身高等比例特征

注意,锚点描述必须完全一致。这一次写“深灰色风衣”,下一次写“灰色外套”,模型很可能理解为两个不同的人。

服装、发型与光线锁定

除了外观,还有三个变量会破坏一致性:

光线方向。 同一个人物在同一场景里,主光从左变到右,脸型视觉上会变。把光线描述固定下来,是低成本的一致性保障。

镜头距离。 从特写切到全景时,模型需要重新推断全身比例,容易出现身高与体型变化。如果某个镜头需要全景,先在提示词里再次声明身高与体型特征。

造型变化。 如果你想表现时间流逝或场景切换,可以换装,但要保证面部特征锚点不变,并且换装要有叙事理由,否则观众会以为是另一个人。

一个高级技巧是首尾帧衔接:用上一个镜头的最后一帧作为下一个镜头的参考图,这样角色、光线、环境都能自然延续,剪在一起时几乎看不出拼接痕迹。

镜头语言:把导演意图写成可执行指令

镜头语言是把“叙述”变成“影像”的翻译层。同样的内容,用一个缓慢的推镜和一个快速的手持跟拍,观众感受到的情绪完全不同。

景别、运镜与节奏

景别方面,常用的三类是:

  • 特写:强调情绪与细节,适合开头的钩子和情绪高潮。
  • 中景:交代人物与动作,是最通用的叙事景别。
  • 全景:交代空间关系与规模感,适合开场建立环境。

运镜方面,提示词里最好用直白动词描述:“镜头缓慢向前推近”“镜头从人物右侧环绕半圈”“镜头跟随人物向前移动”“镜头匀速向上升起”。对于响应较慢的模型,可以加上速度限定词,比如“缓慢推近,全程平稳”。

节奏方面,短视频的黄金法则是:单镜头尽量短,剪辑密度高。生成 3 到 5 秒的素材,剪成 1.5 到 2.5 秒,只保留最有力的部分。这既能避开模型在镜头中后段容易出现的漂移,也能让成片更有节奏感。

转场与镜头衔接

生成式视频最容易被忽略的是镜头之间的接缝。如果每个镜头都是独立的随机画面,剪在一起会有明显的断层感。解决办法有三种:

  1. 动作衔接:上一镜头人物开始转身,下一镜头从他转过一半开始。
  2. 视线衔接:上一镜头人物看向画面右侧,下一镜头接他看到的东西。
  3. 光线衔接:用光线变化作为章节分隔,比如从室内暖光切到室外冷光。

在提示词层面,这意味着你要在写分镜时就想好衔接点,而不是生成完再想怎么剪。

动态场景与复杂交互:物理合理性怎么保证

到了这一步,画面里开始出现真实世界的物理问题:人物跑动、开门、倒水、多人对话、物体碰撞。这些是模型最容易翻车的地方,因为需要对物理规律做隐式推断。

几条实战经验:

减少同一时间发生的动作数量。 一个人走路是稳的,走路同时说话同时拿东西是难的。把动作拆到不同镜头,用剪辑表达连续性。

降低速度。 高速动作对模型是巨大挑战。把“快速奔跑”改成“小跑”,成功率会明显提升,而成片里的速度感可以通过剪辑节奏补回来。

用道具和遮挡简化交互。 需要表现“打开盒子”,可以让盒盖先入画,或者从侧面角度拍摄,减少手部精细动作的暴露。

注意群像场景的层级。 画面里超过三个人,模型很容易把人物特征混淆,出现脸部融合。解决方案是把群像虚化处理,只让主角清晰,或者用分组分镜拍摄再剪接。

给动作留出起止的余量。 提示词里写“动作开始时人物已在画面中,动作结束后停留一秒”,可以减少动作被硬切的情况。

如果某个镜头连续多次失败,不要死磕。换角度、换景别、换镜头时长,通常比继续改形容词更有效。这是生成式创作与传统剪辑最不一样的心态:素材是可以被设计出来的,但不是每条都能被命令出来。

可复用工作流:从脚本到成片的七个步骤

把上面的技巧串起来,就是一套可以稳定运行的流程。

第一步:明确目标与画幅。 先确定发布平台、竖屏还是横屏、目标时长。画幅在流程一开始就应该锁定,中途更改会让所有素材作废。

第二步:写文学脚本。 用纯文字写清楚这条片子要说什么、情绪怎么走。这一步不需要考虑镜头,重点是把逻辑理顺。

第三步:拆成分镜表。 把脚本拆成 6 到 12 个镜头,每个镜头一行。建议的字段包括:镜头编号、时长、景别、运镜、画面内容、提示词、备注。

第四步:为每个镜头写结构化提示词。 按主体、动作、环境光线、风格镜头、技术规格五块填写。同一个人物的特征锚点要逐字复制。

第五步:准备参考图与首帧。 有参考图的镜头优先使用图生视频,没有的用文生视频。同一角色的参考图应保持同一张。

第六步:批量生成与筛选。 关键镜头建议一次生成三到五次,从里面挑最好的一条。建立命名规则,比如“镜头03_第2次_可用”,否则素材一多就找不到。

第七步:后期与声音。 剪辑、调色、加字幕、配乐、配音、音效。注意:声音往往比画面更影响完播率,尤其是前三秒的声音设计。

这套流程最大的价值不是效率,而是可复现。当团队里换一个人来写提示词,产出的质量依然稳定,说明流程真正建立了。

常见错误与排查清单

遇到问题先按症状查表,比盲目改提示词快得多。

症状 最可能的原因 优先尝试的修复
画面闪烁、纹理碎裂 运动强度过高或单镜头过长 降低运动强度,缩短到 4 秒以内
人物中途变脸 缺少参考图或特征描述不一致 锁定参考图,统一特征锚点文字
动作做不完整 单镜头动作过多 拆成两个镜头,用剪辑衔接
画面出现乱码文字 场景里出现了招牌、屏幕、书籍 简化为无文字环境,或明确写“无文字”
风格前后不统一 风格词每次都不一样 把风格词固定成一段可复制的文本
画面平淡没有层次 缺少光源方向与色温描述 补上主光位置与冷暖对比
节奏拖沓 单镜头太长 剪短每个镜头,增加镜头数量
人物比例异常 全景与特写直接硬切 中间加一个中景过渡

另外三个“软性错误”值得单独提醒:

把提示词写成了产品说明。 影视语言和生活语言才是有画面感的语言,技术术语堆砌不会让画面变好。

忽略音频设计。 很多创作者在画面上花十小时,在声音上花十分钟。实际上,音乐节奏和环境音对观感的影响极大。

忽略素材管理。 一天生成上百条素材,没有命名规则和版本记录,最后会浪费大量时间在“找那条还不错的”。

常见问题解答

提示词到底应该写多长?

没有固定字数,但有结构要求。对于大多数模型,四到八句、覆盖五块信息的提示词,效果优于一段两百字的长文,也优于十来个孤立的形容词。判断标准很简单:如果一句话里包含两个以上独立的视觉信息,就考虑拆句。

为什么同一个提示词每次结果都不一样?

因为生成过程本身带有随机性。这不是缺陷,而是特性:它让你可以从一次描述里获得多种可能性。专业做法是把筛选纳入流程,为关键镜头预留多次生成的时间预算。

角色一致性必须用参考图吗?

参考图是最稳的方案。如果只能靠文字,就把特征锚点写得足够细并且逐字复用,同时固定光线方向与镜头距离。即便如此,长时间跨场景的一致性仍然需要靠后期微调来兜底。

负面提示词该写多少条?

建议控制在十条以内,只针对你已经遇到过的具体问题。每遇到一种新的崩坏类型,就把它加进清单,让它慢慢长成你自己的一套模板。

短视频单镜头多长最合适?

生成时通常 3 到 6 秒最稳定,成片里剪到 1.5 到 2.5 秒最舒服。情绪镜头可以稍长,信息量大的镜头要更短。

模型不响应我的镜头指令怎么办?

换更直白的说法。把“电影感的缓慢推进”改成“镜头缓慢向前移动,全程平稳”,把抽象形容词换成具体动作。如果仍然无效,说明这个模型对镜头语言的响应有限,可以改用它更擅长的风格化描述来间接达到效果。

新手应该先练哪一项能力?

先把结构化提示词写熟,再练角色一致性,最后学镜头语言。这个顺序的原因是:结构决定了你有没有可用素材,一致性决定了素材能不能剪成一条片子,镜头语言决定了片子好不好看。跳过前两步直接追求“高级感”,通常只会得到一堆单看惊艳、合起来不能用的片段。

当你把这套方法跑通之后,提示词工程就不再是碰运气。它会变成一项可以传授、可以复盘、可以持续优化的手艺——而这,恰恰是短视频团队最需要的能力。

Alexander

Alexander