从剪辑到“写指令”:短视频生产的范式变化
短视频的竞争规则一直很直接:前两秒抓不住人,后面做得再好也很难挽回。这意味着创作团队必须同时满足三个条件——更新频率高、单条成本低、风格还要稳定。传统流程里,这三件事几乎互相矛盾:拍摄要人、要场地、要灯光,剪辑要时间,改一版就要重新协调所有人。
生成式视频把其中一部分工作从“执行”转移到了“描述”。你不再需要租摄影棚,但你需要在几行文字里,把摄影棚里会发生的一切讲清楚。这就是提示词工程在短视频语境下的真实含义:它不是玄学咒语,而是一份写给模型看的、无法被追问的拍摄脚本。
这里有一个关键差别。当你把分镜交给一位摄影指导,他会自动补齐大量信息:知道夜戏要补光,知道特写要换长焦,知道演员走位要留出余量。模型不会。你没写的部分,它要么随机猜,要么用一个平均化的结果糊过去。所以提示词的第一原则是:不要写你觉得重要的,要写模型无法自己决定的。
实践中,新手最容易掉进三个坑。
第一,把提示词当成关键词堆砌。“电影感、4K、超写实、大师作品、极致细节”这类词堆上二十个,模型并不会因此更懂你,反而会稀释真正有信息量的描述。注意力是有限的,形容词越多,每个词分到的权重越少。
第二,把提示词写成长篇小说。模型对结构的敏感度远高于对长度的敏感度。一段三百字、没有分句逻辑的描述,效果往往不如三句层次分明的话。
第三,跑一次就下结论。同一个提示词连跑五次,出来的可能是四条废片加一条能用的。生成式视频的本质是概率采样,筛选是流程的一部分,而不是失败的证明。
理解了这三点,后面的所有技巧才有落点。提示词工程的目标不是“写出漂亮的句子”,而是“降低结果的方差”。当你发现同一条提示词每次都能给出可用素材时,说明你已经掌握了它。
提示词的结构骨架:把一句话变成可执行的拍摄脚本
一个稳定的提示词通常包含五块信息:主体、动作、环境与光线、风格与镜头、技术规格。这五块的顺序不必绝对固定,但缺哪一块,模型就会在哪一块自由发挥。
一个可以直接套用的模板长这样:
主体:一位三十多岁的女性,深灰色风衣,短发,表情克制
动作:推开门,缓慢走进便利店,脚步停在货架前
环境与光线:雨夜,便利店冷白灯与街道霓虹混合,地面湿润反光
风格与镜头:写实电影质感,35mm 镜头,中景推近,浅景深,轻微手持感
技术规格:垂直画幅 9:16,24fps,单镜头约 5 秒
约束:不要出现文字水印,不要多余肢体,不要快速镜头晃动
主体与动作:越具体越可控
“一个女孩”是无效描述。“二十岁出头、扎低马尾、穿米白色针织开衫的女孩”才是可执行的。主体描述里真正起作用的是可识别的视觉特征:年龄区间、发型、服装颜色与材质、体态、表情状态。这些特征同时也是后面做角色一致性的锚点。
动作要写“可被镜头拍到”的动作。模型不理解“她很焦虑”,但理解“她反复看手机屏幕,然后咬了一下嘴唇”。心理活动必须翻译成身体动作,这是从文案思维切换到导演思维的关键一步。
还有一个容易被忽略的细节:一个镜头里不要塞太多动作。让角色同时走路、转身、说话、挥手,失败概率会成倍上升。把复合动作拆成两个镜头,成片反而更顺,也更符合真实拍摄的分镜逻辑。
环境与光线:决定画面“贵不贵”
观众判断一条片子“专业还是廉价”,往往取决于光线逻辑是否统一。写环境时至少要明确三件事:时间与天气、主光源来自哪里、色温倾向。
对比一下两种写法:
- “在咖啡馆里” → 模型随机给一个中性照明,画面平淡。
- “下午四点,靠窗位置,侧逆光穿过百叶窗,在桌面投下条纹阴影,暖黄主光加窗外冷蓝补光” → 画面立刻有层次。
材质与质感也属于这一块。湿润地面、磨砂玻璃、金属反光、布料褶皱,这些词能显著提升画面的可信度,尤其在近景和特写里。
风格与镜头:让模型知道“谁来拍”
风格词要少而准。写“写实电影质感”比写“大师作品、超高清、顶级画质”更有效。如果你想要某种明确的视觉参照,可以用拍摄语言描述:手持纪录片感、航拍俯视、微距特写、低角度仰拍。
镜头信息包括景别、焦距感、运动方式。特别提醒:景别与运动要匹配内容。人物情绪变化用中近景,空间关系用全景,细节质感用特写。在一个全景镜头里塞满特写式的细节描述,模型会给出一个不伦不类的折中结果。
技术规格:画幅、时长、帧率
这块最容易被省略,但它直接决定成片能不能用。垂直平台需要 9:16,横屏内容需要 16:9,方形适合部分社交场景。时长上,生成模型对单镜头 3 到 6 秒的稳定度通常最好,更长的镜头更容易出现结构漂移。帧率选择 24fps 偏电影感,30fps 更贴近常规社交媒体的观看习惯。
把这五块写全,你的提示词就不再是一句“感觉”,而是一份可复现的规格说明。复现能力,是团队协作里最值钱的东西。
模型匹配:不同模型“听得懂”的语言不一样
同一个提示词,换一个模型可能效果天差地别。这不是模型好坏的问题,而是训练数据与对齐方式的差异。有的模型对自然语言长句理解得好,能处理复杂场景描述;有的模型更吃关键词,长句反而让它抓不到重点;有的模型对镜头术语响应极佳,写“推镜”“环绕”就有明显反馈;还有的模型对光线描述极其敏感,对风格词却反应迟钝。
所以真正专业的做法,是为常用模型各建一张“模型卡片”,记录四件事:
- 触发词:哪些词能让它明显变好,哪些词几乎无影响。
- 镜头响应:它理解运镜指令的程度,是否需要换成更直白的说法。
- 典型失败模式:它容易在什么地方崩,比如手部、快速横向运动、多人场景。
- 最佳单镜头时长:超过多少秒开始漂移。
文生视频与图生视频:提示词重心完全不同
文生视频需要你描述一切,包括画面构成。图生视频则不同:参考图已经确定了外观、服装、构图和色彩基调,此时提示词的重心应该转向运动与镜头,而不是重复描述已经在图里的内容。
常见错误是在图生视频里再写一遍“穿红色连衣裙的女性,站在海边”,这不仅多余,还可能与参考图冲突,让模型在两者之间反复妥协,导致画面抖动或变形。
图生视频的提示词应该长这样:“镜头缓慢向右平移,人物转头看向镜头,头发被风轻吹起,海浪持续涌动,光线保持不变。”——全部是变化量。
参数优先于形容词
很多“画面崩坏”的问题,其实不是提示词写得不好,而是参数设置不合理。运动强度过高会让结构和纹理撕裂;单镜头过长容易在中段出现身份漂移;分辨率与画幅比例不匹配会引入奇怪的裁剪。遇到问题先检查参数,再改文字,往往更快找到原因。
负面约束:避免画面崩坏的隐形防线
负面提示词的作用是划定边界。虽然不同平台的支持方式不同——有的提供独立的负面输入框,有的只能写在正文里用“不要出现……”表达——但思路是一致的:把已知的高频失败模式提前挡掉。
短视频里最常见的崩坏类型包括:
- 手部与手指变形、多指、多余肢体
- 画面中出现乱码文字、水印、logo 残留
- 面部扭曲、双眼不对称、牙齿异常
- 整体模糊、过度锐化、噪点堆积
- 帧间闪烁、物体突然出现或消失
- 镜头畸变、地平线倾斜
一个实用的负面清单可以这样写:“不要文字,不要水印,不要多余手指,不要面部扭曲,不要突然的镜头晃动,不要画面闪烁,不要出现第二个人物。”
两个注意事项。第一,负面词不是越多越好。堆上三四十个负面词,会占用模型的注意力预算,正向描述反而被削弱。第二,负面约束要针对具体模型。某个模型容易在快速横移时撕裂,就专门写“避免快速横向运动”,比笼统地写“不要变形”有效得多。
还有一个更聪明的思路:与其事后修补,不如在设计阶段就绕开难点。手部动作容易崩,那就用中景或远景,用袖口、口袋、道具遮住手;多人互动容易糊,那就用单人镜头加剪辑节奏来表达。这本质上和实拍里的“藏拙”是同一门手艺。
角色一致性:让同一个人物跨镜头出现
如果一条短视频里同一个人物在不同镜头里变成不同的人,观众会立刻出戏。角色一致性是 AI 短视频从“能看”到“能用”的分水岭,也是最需要系统方法的环节。
参考图与特征锚点
最可靠的方法仍然是参考图驱动:先确定一张满意的角色图,然后在后续所有镜头里沿用同一张图作为首帧或参考。参考图决定了模型的身份基线,比任何文字描述都更稳定。
如果只能靠文字,就需要建立“特征锚点”,并且逐字复制到每个镜头的提示词里。锚点通常包括:
- 发型与发色(长度、分缝、是否扎起)
- 脸型与五官特征(如圆脸、单眼皮、唇角有痣)
- 服装(颜色、材质、领口样式、配饰)
- 体型与身高等比例特征
注意,锚点描述必须完全一致。这一次写“深灰色风衣”,下一次写“灰色外套”,模型很可能理解为两个不同的人。
服装、发型与光线锁定
除了外观,还有三个变量会破坏一致性:
光线方向。 同一个人物在同一场景里,主光从左变到右,脸型视觉上会变。把光线描述固定下来,是低成本的一致性保障。
镜头距离。 从特写切到全景时,模型需要重新推断全身比例,容易出现身高与体型变化。如果某个镜头需要全景,先在提示词里再次声明身高与体型特征。
造型变化。 如果你想表现时间流逝或场景切换,可以换装,但要保证面部特征锚点不变,并且换装要有叙事理由,否则观众会以为是另一个人。
一个高级技巧是首尾帧衔接:用上一个镜头的最后一帧作为下一个镜头的参考图,这样角色、光线、环境都能自然延续,剪在一起时几乎看不出拼接痕迹。
镜头语言:把导演意图写成可执行指令
镜头语言是把“叙述”变成“影像”的翻译层。同样的内容,用一个缓慢的推镜和一个快速的手持跟拍,观众感受到的情绪完全不同。
景别、运镜与节奏
景别方面,常用的三类是:
- 特写:强调情绪与细节,适合开头的钩子和情绪高潮。
- 中景:交代人物与动作,是最通用的叙事景别。
- 全景:交代空间关系与规模感,适合开场建立环境。
运镜方面,提示词里最好用直白动词描述:“镜头缓慢向前推近”“镜头从人物右侧环绕半圈”“镜头跟随人物向前移动”“镜头匀速向上升起”。对于响应较慢的模型,可以加上速度限定词,比如“缓慢推近,全程平稳”。
节奏方面,短视频的黄金法则是:单镜头尽量短,剪辑密度高。生成 3 到 5 秒的素材,剪成 1.5 到 2.5 秒,只保留最有力的部分。这既能避开模型在镜头中后段容易出现的漂移,也能让成片更有节奏感。
转场与镜头衔接
生成式视频最容易被忽略的是镜头之间的接缝。如果每个镜头都是独立的随机画面,剪在一起会有明显的断层感。解决办法有三种:
- 动作衔接:上一镜头人物开始转身,下一镜头从他转过一半开始。
- 视线衔接:上一镜头人物看向画面右侧,下一镜头接他看到的东西。
- 光线衔接:用光线变化作为章节分隔,比如从室内暖光切到室外冷光。
在提示词层面,这意味着你要在写分镜时就想好衔接点,而不是生成完再想怎么剪。
动态场景与复杂交互:物理合理性怎么保证
到了这一步,画面里开始出现真实世界的物理问题:人物跑动、开门、倒水、多人对话、物体碰撞。这些是模型最容易翻车的地方,因为需要对物理规律做隐式推断。
几条实战经验:
减少同一时间发生的动作数量。 一个人走路是稳的,走路同时说话同时拿东西是难的。把动作拆到不同镜头,用剪辑表达连续性。
降低速度。 高速动作对模型是巨大挑战。把“快速奔跑”改成“小跑”,成功率会明显提升,而成片里的速度感可以通过剪辑节奏补回来。
用道具和遮挡简化交互。 需要表现“打开盒子”,可以让盒盖先入画,或者从侧面角度拍摄,减少手部精细动作的暴露。
注意群像场景的层级。 画面里超过三个人,模型很容易把人物特征混淆,出现脸部融合。解决方案是把群像虚化处理,只让主角清晰,或者用分组分镜拍摄再剪接。
给动作留出起止的余量。 提示词里写“动作开始时人物已在画面中,动作结束后停留一秒”,可以减少动作被硬切的情况。
如果某个镜头连续多次失败,不要死磕。换角度、换景别、换镜头时长,通常比继续改形容词更有效。这是生成式创作与传统剪辑最不一样的心态:素材是可以被设计出来的,但不是每条都能被命令出来。
可复用工作流:从脚本到成片的七个步骤
把上面的技巧串起来,就是一套可以稳定运行的流程。
第一步:明确目标与画幅。 先确定发布平台、竖屏还是横屏、目标时长。画幅在流程一开始就应该锁定,中途更改会让所有素材作废。
第二步:写文学脚本。 用纯文字写清楚这条片子要说什么、情绪怎么走。这一步不需要考虑镜头,重点是把逻辑理顺。
第三步:拆成分镜表。 把脚本拆成 6 到 12 个镜头,每个镜头一行。建议的字段包括:镜头编号、时长、景别、运镜、画面内容、提示词、备注。
第四步:为每个镜头写结构化提示词。 按主体、动作、环境光线、风格镜头、技术规格五块填写。同一个人物的特征锚点要逐字复制。
第五步:准备参考图与首帧。 有参考图的镜头优先使用图生视频,没有的用文生视频。同一角色的参考图应保持同一张。
第六步:批量生成与筛选。 关键镜头建议一次生成三到五次,从里面挑最好的一条。建立命名规则,比如“镜头03_第2次_可用”,否则素材一多就找不到。
第七步:后期与声音。 剪辑、调色、加字幕、配乐、配音、音效。注意:声音往往比画面更影响完播率,尤其是前三秒的声音设计。
这套流程最大的价值不是效率,而是可复现。当团队里换一个人来写提示词,产出的质量依然稳定,说明流程真正建立了。
常见错误与排查清单
遇到问题先按症状查表,比盲目改提示词快得多。
| 症状 | 最可能的原因 | 优先尝试的修复 |
|---|---|---|
| 画面闪烁、纹理碎裂 | 运动强度过高或单镜头过长 | 降低运动强度,缩短到 4 秒以内 |
| 人物中途变脸 | 缺少参考图或特征描述不一致 | 锁定参考图,统一特征锚点文字 |
| 动作做不完整 | 单镜头动作过多 | 拆成两个镜头,用剪辑衔接 |
| 画面出现乱码文字 | 场景里出现了招牌、屏幕、书籍 | 简化为无文字环境,或明确写“无文字” |
| 风格前后不统一 | 风格词每次都不一样 | 把风格词固定成一段可复制的文本 |
| 画面平淡没有层次 | 缺少光源方向与色温描述 | 补上主光位置与冷暖对比 |
| 节奏拖沓 | 单镜头太长 | 剪短每个镜头,增加镜头数量 |
| 人物比例异常 | 全景与特写直接硬切 | 中间加一个中景过渡 |
另外三个“软性错误”值得单独提醒:
把提示词写成了产品说明。 影视语言和生活语言才是有画面感的语言,技术术语堆砌不会让画面变好。
忽略音频设计。 很多创作者在画面上花十小时,在声音上花十分钟。实际上,音乐节奏和环境音对观感的影响极大。
忽略素材管理。 一天生成上百条素材,没有命名规则和版本记录,最后会浪费大量时间在“找那条还不错的”。
常见问题解答
提示词到底应该写多长?
没有固定字数,但有结构要求。对于大多数模型,四到八句、覆盖五块信息的提示词,效果优于一段两百字的长文,也优于十来个孤立的形容词。判断标准很简单:如果一句话里包含两个以上独立的视觉信息,就考虑拆句。
为什么同一个提示词每次结果都不一样?
因为生成过程本身带有随机性。这不是缺陷,而是特性:它让你可以从一次描述里获得多种可能性。专业做法是把筛选纳入流程,为关键镜头预留多次生成的时间预算。
角色一致性必须用参考图吗?
参考图是最稳的方案。如果只能靠文字,就把特征锚点写得足够细并且逐字复用,同时固定光线方向与镜头距离。即便如此,长时间跨场景的一致性仍然需要靠后期微调来兜底。
负面提示词该写多少条?
建议控制在十条以内,只针对你已经遇到过的具体问题。每遇到一种新的崩坏类型,就把它加进清单,让它慢慢长成你自己的一套模板。
短视频单镜头多长最合适?
生成时通常 3 到 6 秒最稳定,成片里剪到 1.5 到 2.5 秒最舒服。情绪镜头可以稍长,信息量大的镜头要更短。
模型不响应我的镜头指令怎么办?
换更直白的说法。把“电影感的缓慢推进”改成“镜头缓慢向前移动,全程平稳”,把抽象形容词换成具体动作。如果仍然无效,说明这个模型对镜头语言的响应有限,可以改用它更擅长的风格化描述来间接达到效果。
新手应该先练哪一项能力?
先把结构化提示词写熟,再练角色一致性,最后学镜头语言。这个顺序的原因是:结构决定了你有没有可用素材,一致性决定了素材能不能剪成一条片子,镜头语言决定了片子好不好看。跳过前两步直接追求“高级感”,通常只会得到一堆单看惊艳、合起来不能用的片段。
当你把这套方法跑通之后,提示词工程就不再是碰运气。它会变成一项可以传授、可以复盘、可以持续优化的手艺——而这,恰恰是短视频团队最需要的能力。





