为什么提示词工程正在取代“多试几次”
过去做 AI 视频,很多人的策略是“多跑几次,总有一条能用”。当模型只能输出四五秒的抽象画面时,这种随机试错勉强可行。但当生成时长延长到十几秒甚至更长,单条视频里包含角色、动作、场景转换和节奏变化时,随机试错的时间成本会急剧上升。一个十秒的镜头如果平均要试五十次,一天能推进的镜头数量就极其有限,而且结果无法复现,团队协作也无从谈起。
提示词工程的价值,在于把“随机结果”转化为“可复现的流程”。它至少包含三件事:把抽象创意翻译成模型能理解的视觉语言;把视觉语言组织成稳定、可调整的结构;为每一次生成建立可比较的变量,让迭代有方向而不是靠运气。
换个角度理解:写提示词的人同时在扮演三个角色——编剧、摄影指导和美术指导。编剧决定发生什么,摄影指导决定怎么拍,美术指导决定看起来像什么。这三类信息如果揉成一句自然语言,模型只能靠猜;如果分层写清楚,输出的可控性会明显提升。
还有一点值得强调:主流模型的画面清晰度、光影质感和基础物理表现在逐渐趋同。真正拉开成片质量差距的,往往不是“用了哪个模型”,而是“指令的组织方式”。同一个模型,结构化提示词和随手一句话之间的产出差异,常常比两个不同模型之间的差异更大。所以提示词能力是一项可迁移的资产,换工具不会作废。
一条高质量提示词的五个层次
把提示词想象成一张拍摄通告单,而不是一段散文。专业提示词通常由五个可拆分的层次组成,每一层解决一个独立问题。层与层之间不要互相掺杂,否则模型会优先响应其中一个而忽略其他。
主体层:画面里到底有什么
写清楚人物、动物、物件、数量与外观特征。避免“一个男人”这种模糊表述,改成“三十多岁的男性,短发,浅灰色针织衫,右手拿着一只白色马克杯”。模型对具体名词的响应远好于抽象形容词。如果主体有多个,明确主次关系,比如“前景是一位站立的女性,背景右侧有两名虚化的路人”。
环境层:在哪里,什么时间,什么天气
地点、时间、天气、季节、空间尺度、背景元素。例如“清晨的城市天台,远处是雾中的高楼群,地面有薄薄一层积水”。环境层同时承担氛围塑造的功能。很多“感觉不对”的问题,其实不是风格参数错了,而是环境描述太笼统,模型只能填一个平均值的背景。
镜头层:怎么拍
景别、角度、焦距、构图、机位高度。这一层是专业与业余的分水岭。与其写“拍得好看一点”,不如写“中景,略低角度,35mm 焦段,浅景深,人物位于画面右侧三分之一处”。镜头层的描述越具体,模型在构图上的自主发挥空间就越小,结果越可预测。
运动层:画面里发生了什么,镜头怎么动
主体动作和镜头运动必须分开写。主体动作例如“缓慢转头看向窗外”,镜头运动例如“镜头从左向右缓慢横移,速度平稳”。把两者混在一句话里,模型常常只执行其中一个。如果动作有先后顺序,用“先……然后……”的句式表达时间顺序。
风格层:看起来像什么介质
电影感、纪录片手持、胶片颗粒、动画质感、广告棚拍效果等。可以进一步写色彩倾向和光影倾向,例如“低饱和度冷色调,柔和侧逆光,高光不过曝,暗部保留细节”。尽量避免直接点名具体导演、明星或受版权保护的作品,这类词在不同模型上的理解差异极大,还可能触发内容限制,用描述性语言更稳定。
技术层:最终约束
画幅比例、时长、清晰度倾向、是否固定机位。技术层通常放在提示词末尾,作为对输出的最终约束,不影响前面的创意表达。
从模糊概念到可拍指令的四步转化法
大多数提示词写得不好,不是词汇量不够,而是没有经过转化。客户说“要高级一点”,导演听懂了,模型听不懂。转化的过程可以拆成四步。
第一步:把情绪拆成视觉元素
“高级感”不是指令,“低饱和配色、大留白、慢速平移、柔和顶光”才是。任何形容词都要向下拆解到可以被摄像机拍到的层面。一个实用练习:拿到一个形容词,强制自己写出三个具体的画面特征。写不出来,说明这个概念还没有被真正想清楚。
第二步:把视觉元素写成可拍摄的描述
用“谁 + 做什么 + 在哪里 + 怎么拍”的句式组织。写完自查:这句话如果交给一位摄影师,他能直接拍出来吗?如果他需要再问你三个问题,说明描述还不够具体。这个自查动作能过滤掉八成无效提示词。
第三步:按层级排列并控制长度
推荐顺序是:镜头层 → 主体层 → 运动层 → 环境层 → 风格层 → 技术层。把最重要的信息放在前三分之一,模型对提示词开头的响应权重通常更高。长度不是越长越好,超过一定长度后,冗余描述会稀释关键信息,反而降低执行准确度。经验做法是:核心信息用短句,修饰信息用短语,不要用嵌套三层的长句。
第四步:建立变量表,一次只改一个
把提示词拆成若干可替换的字段,每次生成只修改一个字段。这是把“玄学”变成“工程”的关键。记录每次修改和结果,积累二三十次之后,你会得到一份属于自己的“模型行为笔记”,里面写着哪些词有效、哪些词被忽略、哪些词会引发意外效果。
镜头语言:让模型听懂导演意图
景别与角度
远景交代环境,全景展示人物与环境的关系,中景适合对话和动作,近景强调情绪,特写放大细节。角度上,平视最中性,俯拍显得渺小或受控,仰拍显得强势或压迫,荷兰角制造不安。写提示词时,景别和角度最好成对出现,因为模型对单独一个维度的响应往往不稳定。
运镜术语
推(靠近主体)、拉(远离主体)、摇(机位不动,镜头转向)、移(机位平行移动)、跟(跟随主体)、升降(垂直移动)、环绕(围绕主体旋转)。只写术语不够,还要写速度和幅度,例如“缓慢环绕四分之一圈,速度均匀,无抖动”。速度描述缺失时,模型容易给出忽快忽慢的运动。
焦距与景深
广角适合空间感和夸张透视,标准焦段接近人眼感受,长焦压缩空间并突出主体。浅景深让背景虚化,适合突出人物;深景深保留前后景信息,适合环境叙事。这两项在提示词里往往比风格词更能决定“专业感”。
光线与时间
顺光平实,侧光塑造体积,逆光制造轮廓和氛围,顶光偏冷峻。时间上,清晨和黄昏的斜射光最容易出质感,正午硬光对比强烈,夜晚需要明确主光源位置。写提示词时至少要交代光源方向和软硬程度,不要只写“光线很好看”。
剪辑与节奏
一条生成通常只适合完成一个连续镜头。不要在一个提示词里要求“先拍手,再切到脸,然后拉远景”,模型很难在单次生成里完成多段剪辑。正确做法是拆成三个镜头分别生成,再在后期剪辑。
角色与场景一致性:让多个镜头像同一部片子
多镜头项目最大的痛点是一致性。同一个角色在不同镜头里换脸、换衣服、换年龄,观众立刻出戏。以下方法可以组合使用。
参考图与首尾帧
用一张角色定妆图作为参考输入,是最直接的一致性手段。首尾帧控制则适合需要精确衔接的两个镜头:把上一镜的最后一帧作为下一镜的起始帧,模型会尽量延续画面状态。这种方法对连续动作和场景推进特别有效。
固定描述串
如果模型不支持参考图,或者你需要更强的风格统一,可以为每个角色写一段固定的描述串,逐字复制进每一条提示词。描述串的顺序和用词都不要改,哪怕只是把“浅灰色针织衫”改成“灰针织衫”,也可能导致输出差异。
种子与参数锁定
在支持固定随机种子的工具里,锁定种子并只修改提示词中的单一维度,是测试一致性的高效方法。注意种子不能保证跨模型的画面一致,它只在同一模型、同一参数组合下有效。
负面提示词的用法
负面提示词用来排除不需要的元素,比如多余的手指、字幕、水印、扭曲的脸、过度锐化。它的作用是缩小解空间,而不是用来表达审美偏好。把“不要难看”写成负面提示词没有意义,要写成具体可排除的视觉特征。
后期兜底
现实中,一致性很难靠生成一次性解决。调色统一、轻微稳定、局部修补、必要时替换某一帧,都是常规手段。把生成当作素材生产,而不是成品输出,心态会轻松很多。
不同模型的指令偏好与适配策略
不同模型对同一段提示词的解读方式差异很大。与其记住某个模型的固定配方,不如理解几类典型偏好,然后自己测试。
文字遵循度高的模型
这类模型能处理较长的描述和较复杂的时间逻辑,适合叙事型提示词。但要注意,它们有时会“过度执行”,把提示词里所有细节都塞进画面,导致构图拥挤。对策是精简描述,只保留必要元素。
物理与运动优先的模型
这类模型在人物动作、物体碰撞、液体和布料的表现上更自然,但对抽象风格和精确构图的理解相对弱。适合用短句描述动作和运动路径,减少风格修饰词。
写实风格见长的模型
擅长人物特写、皮肤质感、光影层次,适合广告和写实短片。缺点是大幅运镜和复杂动作容易崩坏。对策是把复杂镜头拆成静态机位的多个片段。
风格化与动画见长的模型
对抽象、插画、动画风格的响应更稳定,适合概念片和风格化内容。使用这类模型时,风格层要写得更明确,否则容易在写实和动画之间摇摆。
建立自己的测试矩阵
准备三个标准测试提示词:一个静态特写、一个运动镜头、一个复杂场景。把同一段提示词投给不同模型,记录构图、运动、质感、错误率四项。二十次测试之后,你就有了自己的选型依据,而不是依赖别人的榜单。
实战:一条三十秒产品短片的提示词链路
假设要为一只无线耳机做三十秒短片,整体调性安静、克制、有质感。下面是完整链路。
分镜拆解
拆成六个五秒镜头:一,产品静置于桌面,晨光斜射;二,人物戴上耳机,近景侧脸;三,城市街道行走,环境虚化;四,地铁车厢内闭眼听音乐,光线流动;五,产品特写,缓慢旋转;六,字幕收尾,画面留白。每个镜头只承担一个信息点。
逐镜提示词写法
第一个镜头的提示词可以是:“中景俯拍,白色无线耳机静置于浅灰色石质桌面,清晨侧逆光从画面左上方射入,长而柔和的阴影向右延伸,浅景深,背景为虚化的窗框,画面静止,胶片颗粒轻微,冷灰色调,16:9。”注意这里每一层都独立存在,并且没有冗余形容词。
第二个镜头:“近景,年轻女性侧脸,短发,浅灰色高领衫,缓缓将耳机戴入耳中,手指动作轻缓,镜头固定,略低角度,85mm 焦段,浅景深,柔和自然光从右侧补入,低饱和度,无背景杂物。”
其余镜头按同样结构逐条写出。关键在于:每条提示词的结构完全一致,只有字段内容变化。这样后期调整时,你能快速定位是哪个字段出了问题。
迭代与筛选
每个镜头生成八到十二条,先看构图是否符合,再看运动是否自然,最后看质感。不要因为某一帧很好看就留用,要判断它能否和其他镜头剪在一起。筛选标准和拍摄一样:连贯性优先于单帧美感。
声音与后期
生成素材本身通常没有可用音频。环境音、脚步声、呼吸声、音乐和字幕需要在后期补齐。调色时统一色温和对比度,让六个镜头看起来像同一天拍的。这一步经常被忽略,但对成片质感的提升非常明显。
常见失误与排查清单
画面崩坏或结构错误
通常是主体描述太少、姿态描述缺失或模型能力边界被跨越。排查顺序:先简化提示词,再增加主体细节,最后考虑换模型。一次只改一项。
动作漂移与变形
长时长、大幅动作、快速运镜是主要诱因。对策是缩短单条生成时长,把动作拆成更小的单元,或者改用静态机位加轻微运动。
风格跑偏
原因通常是风格层写了互相冲突的词,比如同时要求“纪录片手持”和“广告棚拍”。检查提示词里是否存在相互矛盾的风格描述,只保留一个主风格加一个修饰。
文字、手部与人群
画面中的文字、细长手指和密集人群是常见弱点。能避免就避免:用留白代替字幕,用手部动作幅度小的构图,用背景虚化代替人群特写。
时长与节奏对不上
生成结果的节奏和你脑中的剪辑节奏往往不一致。解决办法是在剪辑时重新配节奏,而不是要求模型生成“刚好三秒”的动作。把生成素材当作可剪的镜头,而不是成品。
效率工具与团队协作
提示词模板库
把常用的镜头层、风格层、技术层写成可复用的片段,按项目组合。模板库能显著降低沟通成本,尤其当团队有多个创作者时,统一的模板能让不同人的产出风格接近。
版本管理与批注
每条提示词都记录版本号、修改点、使用的模型和参数、结果评级。用表格就够了,不需要复杂系统。关键是让下次打开项目的人能在三十秒内理解之前发生过什么。
分工方式
常见分工是:一人负责分镜和提示词结构,一人负责批量生成和筛选,一人负责后期。提示词写作者不要同时做筛选,因为写作者容易对结果产生期待,判断不够冷静。
常见问题
提示词是不是越长越好?
不是。提示词的效果取决于信息密度,而不是字数。超过模型的有效处理长度后,冗余内容会稀释关键信息。判断标准很简单:删掉某个词后,画面有没有变化?没有变化就删掉。
中文提示词和英文提示词有区别吗?
在多数模型上,英文的描述性词汇覆盖更广,尤其在摄影术语和材质描述上更精确。中文写作则更容易表达情绪和氛围。实用做法是用中文构思,用结构化的英文或中英混合提交,并且对同一内容做一次双语对比测试,看哪个结果更稳定。
为什么同一个提示词每次结果都不一样?
因为生成过程包含随机性。要降低波动,一是固定随机种子,二是减少提示词中的歧义描述,三是把复杂镜头拆成简单镜头。稳定性的提升靠的是减少变量,不是靠加更多限制词。
需要懂摄影术语吗?
不需要成为摄影师,但需要掌握基础词汇。景别、角度、光线方向、焦段这四组词,学会之后提示词的精确度会有明显提升。它们的作用是让你能用更少的字表达更多信息。
预算和时间有限时,应该优先优化哪一步?
优先优化镜头层和主体层。这两层决定了画面“对不对”,而风格层只决定“好不好看”。顺序错了,再好的质感也救不回来。第二优先是缩短单条生成时长,它对成功率的影响往往比换模型更大。
怎么判断一个提示词是不是写好了?
把它交给另一位创作者,看他能否在不问任何问题的情况下生成接近预期的画面。如果他能做到,说明提示词已经具备可复现性,这是工程化的最低标准。
生成结果不理想时,第一反应应该是什么?
先看是构图不对、运动不对还是质感不对,然后只改对应的那一层。很多人的第一反应是重写整条提示词,这会让变量彻底混乱,试了二十次也不知道问题出在哪里。


