Start Free Now
Limited Time Offer: Get 50% OFF Starter & Basic Yearly Plans 🎉

AI视频提示词工程实战指南:新手也能稳定出片的工作流

Oct 6, 2026

为什么提示词工程决定AI视频的成败

很多人第一次用AI生成视频的体验都差不多:输入一句“一个女孩在海边奔跑,夕阳”,得到的画面可能很漂亮,但完全不是自己想要的样子——人物跑向错误方向、镜头忽然拉远、光线像正午、海面像塑料。问题通常不在模型,而在于提示词同时承担了导演、摄影、美术和剪辑四个岗位的工作,而写提示词的人往往只补充了其中一个岗位的信息。

AI视频模型本质上是“条件生成”系统。它根据你给出的文本条件,在庞大的可能性空间里采样出一条路径。你给出的条件越具体、越互相约束,采样空间就越小,结果就越可控。提示词的作用不是“描述一个画面”,而是“缩小可能性空间”。

在实践中,含糊的提示词通常导致三类失败。

  • 语义漂移:画面主体被替换,比如“穿红裙的舞者”变成了“红色的舞台”。
  • 动作崩塌:单步动作还行,一旦涉及多步动作(起身、转身、推门、走出画面),肢体就会变形或粘连。
  • 风格漂移:同一个序列里,第一个镜头是胶片质感,第三个镜头却变成了塑料感CG。

这三类问题的解法各不相同,但都指向同一个基础:把提示词拆成结构化的模块,让每个模块只负责一件事,再用一套固定的迭代流程去验证和修正。本指南不会告诉你“念一句咒语就能出大片”,而是给出一套可以复用、可以交接、可以规模化的方法。

视频提示词的五大核心模块

把提示词当成一份拍摄通告单来写,是最容易上手的心智模型。一份合格的视频提示词通常包含五个模块:主体与动作、镜头语言、光线与色彩、风格与介质、输出约束。模块化的好处是,当结果不对时,你能迅速判断是哪一块出了问题,而不是整句重写然后碰运气。

模块一:主体与动作

主体描述要回答三个问题:谁、长什么样、正在做什么。顺序建议从“类别”到“特征”再到“状态”。例如“一位三十岁上下的女性,短发,深灰色风衣,左手提着帆布包,正快步穿过街道”。

动作描述的关键是单一动作原则。一个五秒镜头里塞进三个动作,模型通常只能做到一个半。与其写“她起身、转身、推开门、走下台阶”,不如拆成两个镜头:镜头A“她起身并转身面对门”,镜头B“她从门内走出,走下台阶”。拆分不是降低质量,而是把复杂度交给剪辑而不是交给模型。

如果必须在一个镜头里完成连续动作,用“主动作 + 辅助动作”的结构,并明确动作的起点与终点,例如“从画面左侧走入,在桌前停下并低头看文件”。

模块二:镜头语言与运镜

镜头语言是新手最容易忽略、却是提升成片质感最快的模块。至少要写清四件事:景别、机位角度、运镜方式、镜头特性。

  • 景别:远景、全景、中景、近景、特写。
  • 机位:平视、俯拍、仰拍、过肩、主观视角。
  • 运镜:固定机位、缓推、缓拉、横移、跟随、环绕、手持晃动。
  • 镜头特性:广角畸变、长焦压缩、浅景深、微距。

一个实用的写法是把它们合并成一句话:“中近景,略微仰拍,镜头缓慢横移跟随人物,浅景深,背景轻微虚化。”注意一个镜头里只写一种主要运镜。写“先推后拉再环绕”几乎必然得到混乱的运动轨迹。

模块三:光线、色彩与氛围

光线决定了画面的“贵不贵”。常用的光线关键词分四类:时间(清晨、黄昏、正午)、方向(侧逆光、顶光、窗光)、质感(柔光、硬光、体积光、轮廓光)、氛围(雾气、尘埃、雨丝、霓虹反光)。

色彩建议用一句“主色 + 辅助色 + 肤色倾向”,例如“主色为青灰,辅助色为暖橙街灯,肤色自然偏暖”。这样写的好处是,跨镜头时你可以直接复用同一组色彩词,从而维持序列的视觉统一。

模块四:风格、介质与画质

风格词需要落到具体介质,而不是抽象形容。“电影感”太模糊,“35毫米胶片质感,轻微颗粒,高光柔和溢出”才可执行。常见的风格维度包括:年代(复古、当代、未来)、介质(胶片、数字、VHS、16毫米)、流派(纪录片、黑色电影、广告片)、渲染倾向(写实、半写实、插画、三维动画)。

画质词只保留两到三个,例如“高细节、锐利主体、自然皮肤纹理”。堆叠“8K、超清、极致细节、大师作品”往往不会提升质量,反而会稀释真正重要的描述。

模块五:输出约束与负面清单

约束是让结果“稳定复现”的关键。需要写清:画面比例、时长、帧率倾向、是否允许文字出现、是否需要留出后期加字幕的安全区域。

负面清单则用来排除反复出现的顽疾。与其写“不要难看”,不如写具体项:“不要多余的手指、不要画面内字幕、不要极端广角畸变、不要快速闪白转场”。负面清单最好按项目维护成一份共享文档,因为不同项目踩的坑高度相似。

建立模型匹配地图:不同模型吃哪一套语言

同一段提示词,在不同模型上表现可能天差地别。原因在于训练数据、运动建模方式和文本编码器各不相同。与其记住每个模型的所有参数,不如建立一张自己的“模型匹配地图”:列出你常用的三到五个模型,分别标注它们擅长的题材、对提示词长度的容忍度、对负面提示词的敏感度,以及修改后需要多少次重生成才能稳定。

写实与电影感模型

这类模型对光影、材质、镜头术语的响应最精确。写实倾向的模型通常偏好较长的描述性句子,喜欢明确的光源和材质词(拉丝金属、绒面布料、湿润沥青),并且对“浅景深”“长焦压缩”这类摄影术语反应良好。它们的短板往往是夸张运动:快速跑动、激烈打斗时容易产生肢体瑕疵。应对方式是把运动速度降下来,用运镜代替人物大幅位移。

风格化与动漫模型

风格化模型对风格词和线条描述更敏感,对物理光线的敏感度反而较低。写这类提示词时,把重点放在线条、色板、笔触和渲染方式上,例如“赛璐璐上色、粗轮廓线、双色调阴影、背景水彩质感”。同时要减少写实材质词,因为“湿润沥青”这类描述在动画语境里几乎没有意义,只会干扰模型。

快速迭代模型

还有一些模型走的是速度路线,适合在前期做构图和节奏测试。它们的细节保真度不一定最高,但胜在出片快、成本低。合理用法是:用快速模型验证分镜和构图,用高质量模型产出最终镜头。这样能把大部分试错成本压在前期,而不是压在最终渲染上。

匹配地图的维护方式

每次项目结束后,花十分钟更新地图:记录哪个模型在哪个题材上翻车、哪个提示词模板被证明稳定。三个月后,这张地图的价值会超过任何通用教程,因为它记录的是你自己的失败样本。

结构化提示词模板:从自由写作到模块拼接

自由写作适合灵感和草稿,模块拼接适合量产和团队协作。建议两者结合:先用自由写作找到感觉,再把有效句子拆进模板。

单镜头模板

一个可复用的单镜头模板长这样:

[主体] + [外观特征] + [单一动作]
[景别] + [机位] + [一种运镜] + [镜头特性]
[时间/光源] + [光线质感] + [主色与辅助色] + [氛围元素]
[风格介质] + [画质关键词(最多三个)]
[画面比例] + [时长] + [负面清单]

实际写出来是这样一段:

一位三十岁上下的女性,短发,深灰色风衣,左手提帆布包,从画面左侧走入并在公交站牌前停下。中近景,平视,镜头缓慢横移跟随,浅景深。黄昏,侧逆光,暖橙轮廓光,主色青灰、辅助色暖橙,空气中有轻微尘埃。35毫米胶片质感,自然皮肤纹理,高细节。16:9,五秒。不要画面内文字,不要多余手指,不要快速变焦。

模板的价值不在于每格都必须填满,而在于当你发现结果不对时,知道该改哪一格。

多镜头与序列模板

序列层面需要额外的三个字段:镜头编号、与前一个镜头的连续性要求、以及转场意图。例如:

镜头 03
连续性:同一角色、同一服装、同一色调(青灰+暖橙)
与前镜头关系:机位从人物右侧转到左后方
转场:动作接动作,人物抬手动作在两个镜头间延续

这类元信息不会直接进入提示词,但它能帮你判断哪些镜头必须共享同一套描述词。序列一致性问题,八成源于元信息缺失,而不是模型不行。

保持一致性:角色、场景与色调的跨镜头控制

叙事型项目最难的从来不是单个镜头好看,而是十个镜头放在一起像同一个故事。一致性可以从三个层面控制:角色、场景、色调。

角色卡:把人物写成一页可复制的档案

角色卡的写法是固定“不变量”,只允许“变量”随剧情变化。不变量包括:年龄段、脸型、发型、发色、肤色、服装、明显特征(疤痕、眼镜、配饰)。变量包括:表情、姿态、所在环境、手中物品。

每次生成时,把不变量原样复制进提示词,不要改写措辞。措辞一改,模型就可能认为这是另一个人。如果某个角色特别重要,可以把不变量做成一段固定文本块,团队内所有人直接粘贴使用。

参考图与首尾帧

当纯文本无法稳定角色时,参考图是更可靠的路径。常见做法有三种:

  1. 角色参考图:用一张清晰正面照作为人物锚点,提示词只描述动作与环境。
  2. 首帧图:用上一镜头的末帧作为下一镜头的首帧,保证动作和构图连续。
  3. 首尾帧控制:同时提供起始画面与结束画面,让模型在两者之间插值,适合有明确起止状态的动作,比如“抬手”到“握住门把手”。

参考图不是万能的。它会把图中所有信息一起带入,包括背景和光线。所以做参考图时,尽量用中性背景、均匀光线、干净构图,避免把不想要的元素一起锁进画面。

场景与色调锚点

场景一致性靠“场景锚点”:为每个主要场景写一段固定描述,包括空间结构、材质、标志物和光线方向。例如“老式公寓走廊,米色墙纸,木质地板,尽头有一扇带磨砂玻璃的门,光源来自画面右侧窗户”。

色调锚点则是一组固定的色彩词,全序列复用。它比任何后期调色都更省事,因为画面在生成阶段就已经统一,后期只需要微调对比度和饱和度。

进阶技巧:负面提示词、权重与运镜语法

基础打好之后,下面这些技巧能进一步提升可控性。

负面提示词的写法。 负面描述要具体且单一。写“模糊、畸变、多余肢体、水印、字幕、面部扭曲”比写“不要难看”有效得多。另外,负面清单不宜过长,超过十几项后,模型对每一项的注意力会被摊薄,反而可能引入新的问题。

权重与强调。 部分工具支持用括号或权重标记强调某个元素。权重是双刃剑:强调过头会让画面失衡,比如把“红衣”权重拉太高,整幅画面的色彩都会向红偏移。建议只在必要时微调,并且每次只调一个词。

时间轴描述。 如果模型支持分段时间提示,可以把一个长镜头拆成时间段描述:“前两秒人物静止看向镜头,中间两秒缓慢转头,最后两秒低头。”这种写法的稳定性通常优于一句笼统的“她缓慢转头”。

运镜语法的一致性。 同一个词在不同模型里可能对应不同动作。“推镜”有时指镜头前进,有时指变焦。建立自己的术语对照表,用固定词汇描述固定效果,可以显著降低跨模型迁移的成本。

少即是多的画质词。 画质关键词之间存在互相竞争。写三个精准的词(自然皮肤纹理、柔和阴影、高细节主体)通常优于写十个套话。

迭代工作流:三稿法与批量质检

专业和业余的差别,往往不在第一稿的质量,而在修改效率。推荐一套“三稿法”。

第一稿:结构稿。 目标是确认构图、动作和节奏对不对。这一稿不必追求画质,用快速模型、较低分辨率即可。评价标准只有三条:主体对不对、动作能不能看懂、镜头运动是否合理。

第二稿:风格稿。 结构与动作确认后,再叠加光线、色彩和风格描述。这一稿要开始固化色彩锚点和风格词,并测试它们在不同镜头上的稳定性。

第三稿:精修稿。 用高质量模型输出,同时处理细节:皮肤纹理、材质反光、边缘干净度、背景杂物。此时才值得投入更多生成次数。

每一稿之间设置明确的验收标准,避免出现“感觉还差点什么”这种无法收敛的状态。一个可执行的验收清单:

  • 主体身份与角色卡一致,无换脸或换装。
  • 动作起止状态清晰,无肢体粘连。
  • 镜头运动方向符合分镜意图。
  • 色调与序列锚点一致。
  • 画面内无意外文字、水印、多余物件。
  • 首尾帧可自然衔接前后镜头。

批量生成时,建议一次只改一个变量。同时改光线、风格和运镜,你就无法判断是哪个改动带来了改善。用编号命名文件,把提示词版本一起记录在文件名或注释里,几轮之后你会感谢自己做过这件事。

叙事项目实战:从剧本到分镜到成片

把方法落到一个完整项目上,流程大致是这样。

第一步,写镜头清单。 把剧本拆成“每句话一个镜头”。一个三十秒的短片通常需要八到十五个镜头。每个镜头写一行:画面内容、景别、运镜、时长、情绪。

第二步,建资产库。 整理角色卡、场景锚点、色彩锚点、风格词,做成四份可复制的文本块。这一步花的时间,会在后面十倍地省回来。

第三步,做分镜静帧。 先用图像生成把关键镜头做成静帧,确认构图和色调。静帧修改成本远低于视频,这是整个流程里性价比最高的一步。

第四步,静帧转视频。 用首帧图加提示词生成动态。把动作描述压缩到一到两个动作,运镜只保留一种主运镜。

第五步,补齐衔接镜头。 检查相邻镜头的首尾帧,如果跳跃明显,补一个过渡镜头,比如手部特写、道具特写或环境空镜。这类镜头生成难度低,却能大幅提升连贯感。

第六步,剪辑与声音。 剪辑阶段解决节奏问题,声音阶段解决情绪问题。环境音、脚步、呼吸声对“真实感”的贡献,往往比再多生成十个镜头更大。

常见错误与修复清单

下面这张表可以作为快速排查工具。

症状 可能原因 修复方向
主体被替换 主语描述太短或被风格词淹没 把主体描述前置,增加外观细节
动作变形 一个镜头里动作过多 拆镜头,或改为首尾帧控制
画面黏滞 运镜词冲突 只保留一种主运镜
风格跳变 序列缺少固定风格词 建立风格锚点并全序列复用
光线像正午 缺少时间与光源方向 补充时间、方向、光线质感
人物越长越不像 提示词措辞每次都在变 使用固定角色卡文本块
出现奇怪文字 提示词含引号、标语类描述 加入负面清单,避免写文字内容
画面过度锐化 画质词堆叠 精简到两三个词
运动太快 动作描述含速度副词 改为“缓慢”“轻微”,或延长时长

另一类常见错误是“提示词考古”:不断往提示词里加词,试图修复问题,最后变成一段谁也不懂的混合物。正确做法是回溯:删掉最近加入的三个词,看看问题是否消失。保持提示词精简,比不断加词更接近专业工作方式。

常见问题FAQ

提示词应该写多长?

视模型而定。写实类模型通常能处理较长的结构化描述,风格化模型偏好更短的句子。一个实用判断标准是:如果删掉某个词后画面没有变化,那这个词就是多余的。

需要记住所有模型的参数吗?

不需要。你只需要维护一张自己的匹配地图,记录三到五个常用模型的特点和翻车场景。参数会更新,方法不会。

中文提示词和英文提示词有区别吗?

很多模型对英文更敏感,尤其是摄影和材质术语。如果发现某个描述词效果不稳定,可以试试换成英文对应词,例如把“浅景深”写成“shallow depth of field”,再对比结果。

角色一致性一定要用参考图吗?

不一定。如果角色特征足够鲜明(发型、服装、配饰都很具体),纯文本角色卡也能达到不错的稳定性。但涉及特写或跨多个场景时,参考图仍然是更可靠的选择。

为什么同一个提示词两次结果差别很大?

生成过程带有随机性,尤其在运动建模上。想要复现,尽量固定随机种子、提示词和参考图三要素,并保持其他参数不变。

负面提示词写得越多越好吗?

不是。负面清单过长会稀释注意力。建议控制在十项以内,只针对反复出现的具体问题。

多久能形成稳定的工作流?

如果每周完成一个小项目,并坚持记录失败样本,通常几周内就能形成属于自己的模板库。真正的门槛不是工具,而是有没有把每次失败转化成可复用的规则。

把提示词当成可维护的资产

回到最初的问题:新手和进阶创作者之间的差距在哪里?不在工具,而在是否把提示词当作一次性消耗品,还是当作可维护的资产。前者每做一个项目都从零开始,后者每做一个项目都会留下角色卡、场景锚点、风格块和一份更新的匹配地图。

具体可以从三件事开始。第一,给下一个项目建立四份文本块:角色卡、场景锚点、色彩锚点、负面清单。第二,用三稿法推进,不要在第一稿上追求完美。第三,每天花十分钟把当天的失败样本写成一条规则。

AI视频生成的门槛正在快速下降,但稳定产出和专业可控之间的差距依然存在。而这个差距,恰恰是可以靠方法和记录一点一点补上的。当你的提示词从一句话变成一套系统,你就已经不在“碰运气”的阶段了。

Alexander

Alexander