提示词工程不是"会说话",而是把创意变成可执行参数
很多人第一次用 AI 写剧本时的体验高度相似:输入一句话,几秒钟后得到一段还算通顺的文本,读下去也挑不出语法毛病,但就是完全不是自己想要的东西。于是顺理成章地得出结论——"AI 不懂我"。真实原因往往不在模型,而在输入:信息太少、太模糊、太缺少边界。
提示词工程(Prompt Engineering)听上去很技术,但它解决的是一个非常日常的问题。你脑子里已经有一部片子,模型手里只有一个概率分布,中间那段把意图翻译成可执行参数的翻译工作,就是提示词工程。它不是学几个神奇句式,而是学会把"我知道我想要什么,但说不清"的模糊判断,拆成模型能接住的具体条件:谁、在哪、什么时候、发生什么、情绪往哪走、镜头怎么拍、什么绝对不能出现。
一个典型的失败提示词长这样:"写一个关于失去与救赎的科幻短片剧本。"这句话对人类来说信息量很足,对模型来说几乎是空的。它不知道主角是谁,不知道世界规则,不知道情绪曲线,不知道篇幅,不知道要不要对白,不知道结尾是开放还是闭合。模型只能按训练数据里最常见的平均值来补全,于是产出那种"看起来像剧本、读起来没记忆点"的文本。
而一个可用的提示词会是这样的结构:题材与时长、主角与核心欲望、阻碍来源、世界的一条特殊规则、三幕的转折点、期望的情绪曲线、对白密度、结尾类型,再加上一份排除清单。同样的模型、同样的创作能力,输出质量可以差出一个量级。
理解这一点之后,就会明白为什么提示词工程是创意工作者最值得投资的一项基础能力:它不替代你的审美判断,它让审美判断能够被精确地表达出来。剧本是这样,分镜是这样,图生视频、文生视频同样是这样。你输出的提示词越接近一份可执行的制作说明书,AI 返回的内容就越接近成片。
从一句创意到结构化提示词:剧本开发的第一层拆解
模糊的创意火花和结构化的指令集之间,隔着一次自觉的拆解动作。拆解做得好,后面所有环节都会顺;拆解偷懒,后面每一步都要反复返工。
五个必须写清的要素
无论你是在写一部长片大纲还是三十秒短视频脚本,下面这五个要素都应该在提示词里被明确写出来:
- 故事梗概与前提:一句话能够说清的核心冲突是什么。不是主题词,而是"谁想要什么,被什么挡住"。
- 角色设定:主角的年龄感、职业、说话方式、核心缺陷、表层目标与深层需求。配角只需要写明功能与态度,不必过度堆砌。
- 场景与氛围:空间类型、时间、天气、光线基调、声音环境。这些直接决定后续画面提示词的可执行程度。
- 情绪曲线:从哪个情绪开始,在哪里升高,在哪里松弛,最后落在什么情绪上。情绪曲线是剧本的骨架,比情节更容易被模型忽略。
- 风格与体裁坐标:写实还是风格化,冷峻还是温暖,对白驱动还是画面驱动。最好给出两到三个参考作品作为风格锚点,但要说明参考的是哪一层(叙事节奏、色彩、镜头习惯),否则模型容易整体模仿。
把这五个要素写在一个提示词里,长度通常在三百到八百字之间,阅读时间不到一分钟,但它能把输出的"平均脸"问题降低一大截。
把散点创意整理成线性叙事框架
人的创意通常不是线性的,而是跳跃的:先想到一个画面,再想到一句台词,再想到结尾。直接把这些碎片丢给模型,模型会努力把它们全部塞进去,结果结构混乱。
正确的做法是先自己做一次线性化整理,用"起始状态 → 触发事件 → 升级 → 危机 → 选择 → 新平衡"这条链把碎片串起来。这个链条不要求精彩,只要求完整。完整之后,你才有一个可以被优化的对象。
实际操作中,可以先让 AI 帮你做一次结构化追问,例如:"不要写剧本,先根据我给的材料列出主角目标、阻碍、转折点、结局,并指出其中逻辑跳跃的地方。"这一步产出的不是文本,而是检查清单。发现漏洞的成本在概念阶段最低,在成片阶段最高。
一份概念阶段提示词示例
任务:为一个 3 分钟科幻短片撰写故事大纲。
前提:近未来,城市居民可以付费删除某一段记忆,但删除后会在梦中以碎片形式返回。
主角:32 岁的声音剪辑师,习惯用工作回避私人情绪,表面目标是完成一部商业广告的音效,深层需求是承认自己主动删除了与妹妹有关的记忆。
阻碍:删除后返回的碎片开始影响她的职业判断,客户开始察觉异常。
结构要求:按起始状态 / 触发 / 升级 / 危机 / 选择 / 新平衡六段输出,每段用两到三句话描述,不要写对白。
情绪基调:压抑、克制,结尾保留一点未解释的温柔。
排除项:不要出现反派组织,不要用旁白解释设定,不要给圆满和解。
这份提示词的价值不在于它写得多漂亮,而在于它对每一个方向都做了约束。约束越清晰,模型需要"猜"的部分就越少。
三根支柱:约束、迭代与风格注入
提示词工程的实操能力,基本可以拆成三个动作:加约束、做迭代、注入风格。三者顺序不能颠倒。
约束:告诉模型边界在哪里
约束包含正反两面。正面约束是"要什么",反面约束是"不要什么"。绝大多数创作者只写正面,结果模型会自作主张地补上大量陈词滥调:励志台词、慢镜头拥抱、雨中对白、结尾字幕解释一切。
反面约束要具体,不要写"不要太俗",而应该写"不要使用雨夜、拥抱、旁白总结、最后一秒反转这四类收尾方式"。具体到元素级别,模型才真的能避开。
还有一类容易被忽略的约束是格式约束:段落长度、是否分场、是否标镜头号、每场大致时长、对白上限。格式约束决定了产出的内容能不能直接进入下一步工作流。如果后面要接分镜和视频生成,那么从剧本阶段就应该按场次和节拍输出,而不是一整块散文。
迭代:一次只改一个变量
迭代最常见的错误是"一次提十个意见"。你说"节奏太慢、角色太单薄、结尾太仓促、对白太文艺",模型会同时修改四处,结果你无法判断哪一处改对了、哪一处改坏了。
更有效的做法是逐项反馈,而且给出方向性判断而不是形容词:
-
不好:"这段太平淡了。"
-
好:"把第二场的信息密度提高,删掉主角与同事的寒暄,让观众在第三句对白里就意识到她删过记忆。"
-
不好:"情绪不够悲伤。"
-
好:"主角得知真相后不要哭,改成她在录音台前反复重放同一段素材,让它一次比一次慢,用行为代替情绪表达。"
第二种反馈方式等于你替模型把"怎么做"想清楚了,模型只需要执行。这个过程会倒逼你自己也把剧本想清楚,是提示词工程最大的副产品。
建议在迭代时保留版本记录:把每一轮修改的提示词和输出都存下来。当某一版突然变好时,你能回溯到是哪条约束起了作用,那条约束就可以进入你的常备模板。
风格注入:把形容词翻译成参数
"有电影感""高级""有质感"这类词几乎没有执行价值。真正能被执行的风格描述,通常落在下面几个层面:
- 镜头层面:大量固定机位还是手持;低角度还是平视;是否使用长焦压缩。
- 光线层面:单一硬光源还是柔和漫射;高对比还是低对比;主色调偏冷还是偏暖。
- 节奏层面:平均镜头时长;是否允许留白;对白之间的停顿长度。
- 声音层面:环境音占比;是否使用音乐渲染情绪;沉默的使用频率。
当你把这些写成提示词的一部分,风格就不再依赖模型的自由发挥,而变成一组可以被检查、被复用的参数。这也让"换一个模型重新生成"变得可行——因为风格不再藏在某个模型的黑箱里,而在你的提示词里。
导演思维:把文本语言翻译成镜头语言
剧本是文字,成片是画面与声音。提示词工程中段最容易被跳过、也最容易掉分的一步,就是把文字层面的信息翻译成镜头层面的指令。
从文本到镜头语言的转换
同一句"她意识到自己被欺骗了",至少有五种拍法:特写眼神变化、手部动作停顿、她继续说话但语句开始破碎、别人说话而她的视线越过对方、环境声音逐渐抽离只剩呼吸。选择哪一种,取决于你想让观众在什么时间点知道什么。
在提示词里,这一步应该写成可执行的镜头描述,例如:"中近景,固定机位,人物位于画面右侧三分线,背景虚化;她从说完整句子到中途停顿,视线从对方移到桌面上的文件;环境音保持连续,不加音乐。"这类描述对视频模型非常友好,因为它同时给出了构图、机位、表演和声音四个维度。
潜台词与情绪的提示词化
潜台词是无法直接生成的,只能通过行为可观察化。一个可复用的转换规则是:把内心状态翻译成"动作 + 对象 + 节奏"三件套。
- 焦虑 → 反复整理同一件物品,动作比正常快半拍。
- 隐瞒 → 说话时把视线放在对方肩侧,回答比问题慢一秒。
- 释然 → 停止手上的动作,第一次完整看向对方。
把这些写进镜头提示词,画面就不会只剩"面无表情地站着"。很多 AI 生成视频之所以看起来呆板,不是因为模型画得不好,而是因为提示词里没有任何可以表演的动作。
节奏:用节拍表控制呼吸
节奏是短片最容易被忽略、也最能拉开差距的部分。一个实用做法是在剧本阶段就写出节拍表:每一场标注目标情绪强度和大致时长,然后检查曲线是否有起伏,而不是一路平推。
如果你的短片只有三分钟,节拍表可以粗到六到八个节点。你可以明确要求模型按照这个节拍表输出场次,并在提示词里写上每个节点的目标时长。这样生成出来的内容天然具备剪辑空间,而不是需要你后期硬砍。
长文本与一致性管理:让角色和场景不"变脸"
当内容超过一定长度,一致性问题会集中爆发:主角在第 3 场和第 9 场看起来像两个人,同一个房间在两场里结构完全不同,色调前后割裂。这些问题的根源通常不是模型能力,而是缺少统一的信息锚。
角色一致性
有效的角色锚定需要一份简短的"角色卡",并在每次生成时重复引用。角色卡应包含:年龄感、体型特征、发型与发色、常穿服装的材质与颜色、两个辨识度高的细节(例如左手腕的旧手表、右眉尾的小疤)。
如果角色卡超过三行,说明写得太细,反而不稳定。要点是找出最容易被模型抓住的少数特征,然后每一次都原样重复,不要换同义词。"深灰色粗针织毛衣"和"灰色毛衣"在模型看来是两件不同的衣服。
场景与美术一致性
场景同样需要锚点:空间布局(门在左还是右)、主要光源(窗光从哪个方向进来)、色彩基调、陈设中最显眼的三件物品。这三件物品是判断"是不是同一个房间"的关键。
一个实用技巧是为每个主要场景写一句"空间句",每次出现时都放在提示词前面。例如:"狭长录音棚,右侧墙面为深色吸音棉,左侧一扇水平窄窗透入冷白日光,木地板,中间一张老式调音台。"这句空间句能让不同场次、不同镜头的画面保持在同一空间逻辑内。
分块与上下文压缩
长内容不要一次性丢给模型。更稳的方式是分块处理:先确定整体结构与角色卡,再按场次逐块生成,每块都带上角色的关键信息和空间句。
随着内容变长,上下文会变得臃肿,模型的注意力会被稀释。此时需要主动做压缩:把已经确定的设定、已经写过的情节点、下一块必须承接的钩子整理成一个简短的"当前状态摘要",每块生成时只携带这份摘要加上当前场景的具体要求。这会显著提升稳定性,也让返修成本降低。
一套可复用的完整工作流
下面这套流程按顺序执行,适合短片、广告、概念预告片等各类项目。每一层的输出都是下一层的输入,任何一层偷懒都会在成片阶段暴露。
第一步:概念提炼
用一段话写清前提、主角、阻碍、核心问题。然后再压缩成一句 logline。logline 的作用是检验故事是否成立:如果一句话讲不清冲突,说明冲突本身还没想明白。
这一步可以让 AI 做压力测试,例如让它指出"这个故事最可能失败的地方"。这个提问比让它称赞你的创意有用得多。
第二步:分场与节拍表
按六段结构或自己喜欢的三幕结构输出场次清单,每场标注:地点、人物、目标、冲突、结束时的状态变化、目标时长。状态变化是判断一场戏是否必要的标准——删掉之后故事依然成立,那它就应该被删掉。
第三步:镜头级提示词
把每一场拆成镜头,每个镜头写清景别、机位、运动、构图位置、人物动作、光线、声音。这一步可以直接决定视频生成的成败。经验做法是每个镜头只保留一个主要动作和一个视觉重点,动作越多越容易崩。
第四步:生成、筛选与返修
同一镜头一次生成多个版本,挑选时优先看叙事是否清楚,其次看一致性,最后才看画面漂亮程度。顺序反了就会得到一堆好看但无法连贯的素材。
返修时优先改提示词而不是反复重抽:如果三次生成都有同一个问题,问题一定在描述上,不在随机性上。
第五步:剪辑、声音与字幕整合
声音是这整套流程里最容易被低估的部分。环境音的连续性可以掩盖画面之间的细微差异,音乐的进出点可以决定情绪曲线是否成立。字幕除了可读性之外,还要注意时间轴与配音的匹配。
成片完成后,把这次项目中验证有效的提示词片段整理进模板库。三个项目之后,你会拥有一套只属于自己风格的提示词资产。
常见错误与排查清单
输出太"平均"
症状:文本通顺但没有任何独特之处。原因通常是提示词缺少具体约束。排查方式:检查是否有明确的时长、结构、禁止项、角色缺陷、结尾类型。缺少任意一项,模型都会用平均值填空。
角色前后不一致
症状:同一个角色在不同场次气质发生变化。排查方式:确认角色卡是否被逐字重复引用,是否在迭代中无意修改了描述词。
情绪不到位
症状:画面正确但观众没有感觉。排查方式:检查是否存在可观察的表演动作,是否所有情绪都靠对白说明,是否在情绪高点之前留出了足够的铺垫。
画面好看但叙事没推进
症状:单看每个镜头都不错,连起来却松散。排查方式:逐场检查"状态变化",凡是删掉不影响理解的都是赘余。
提示词越写越长却越乱
症状:加入大量要求后输出反而更差。排查方式:给提示词分层——设定层、场景层、镜头层分开写,不要让不同层级的信息混在一段话里互相干扰。
工具与模型怎么选
工具选择的核心不是"哪个最强",而是"哪个和我的工作流匹配"。可以从四个维度判断:
- 文本理解深度:能否稳定处理千字以上的上下文,是否容易在中途丢失早期的设定。写剧本和大纲阶段,这一项权重最高。
- 画面控制精度:是否支持镜头运动、构图位置、风格参考等结构化输入。做分镜和镜头生成阶段,这一项最关键。
- 一致性表现:在多镜头、多场景条件下,角色与空间能否保持稳定。
- 迭代成本:单次生成的时间与资源开销。返修频繁的项目,快而便宜的组合往往比慢而精致的组合总产出更高。
实际做法是分层搭配:用文本能力强的工具做结构与剧本,用画面控制强的工具做镜头生成,中间用自己维护的角色卡和空间句做桥接。不要在同一个工具上解决所有问题,也不要每换一个项目就换一整套工具。
可直接改写的提示词模板
大纲模板
任务:为 [类型] 短片撰写 [时长] 故事大纲。
主角:[年龄感/职业/核心缺陷/表层目标/深层需求]
阻碍:[外部阻碍 + 内部阻碍]
世界规则:[一条必须被遵守的特殊规则]
结构:按起始状态 / 触发 / 升级 / 危机 / 选择 / 新平衡六段输出,每段 2-3 句。
情绪基调:[起点情绪] → [高点情绪] → [终点情绪]
禁止项:[不要旁白解释 / 不要大团圆 / 不要反转结局 / 不要出现具体反派]
分场模板
根据上一步大纲输出分场表,每场包含:
场号 / 地点 / 时间 / 在场人物 / 本场目标 / 冲突 / 结束时的状态变化 / 预计时长
要求:总时长不超过 [时长],每场只推进一件事,不写对白。
镜头模板
将第 [场号] 拆分为 [数量] 个镜头,每个镜头包含:
景别 / 机位 / 运动 / 主体在画面中的位置 / 人物动作 / 光线方向与质感 / 环境声
要求:每个镜头只有一个主要动作;角色卡与空间句原样保留;不添加音乐描述。
返修模板
当前输出:
[粘贴内容]
需要修改的问题:[只写一个问题]
修改方向:[具体到元素级别,不要用形容词]
保持不变的部分:[角色设定 / 结构 / 结尾 / 其他已确认内容]
常见问题 FAQ
问:提示词工程需要学多久才能用得上?
答:基础部分一两个小时就能上手,真正提升来自实践反馈。写满十个项目的提示词记录,你会形成自己的判断体系,比读任何教程都有效。
问:写得越详细越好吗?
答:不是。详细指的是关键信息完整,而不是句子数量多。模糊的形容词堆叠会让模型无所适从,明确的结构化参数才是有效信息。判断标准是:删掉这句,输出会不会发生变化?不会,就删掉。
问:为什么同一个提示词两次输出差别很大?
答:生成带有随机性。如果差异只体现在细节,属于正常;如果结构都变了,说明提示词的约束不足,模型仍有太多自由发挥空间。
问:要给模型看参考作品吗?
答:可以,但要说明参考的是哪一层。参考叙事节奏和参考色彩是两件事,如果不加区分,模型往往会连带模仿其表面风格,导致你的作品失去辨识度。
问:AI 会替代编剧吗?
答:它替代的是从零开始的空白页,以及在多个版本之间做机械对比的时间。判断什么值得写、什么该删、情绪是否成立,这些依然需要人来做。提示词工程的意义,正是让你对这些判断的控制力更强,而不是更弱。
问:如果我不懂技术,能做好提示词吗?
答:能。提示词工程里技术成分很少,主要能力是结构化和精确表达。这两项能力,恰恰是编剧和导演本来就训练过的。
把方法变成习惯
提示词工程最终会变成一种思考方式:当你想到一个灵感时,会自然地去拆解它的主角、冲突、情绪曲线和画面呈现方式。这种拆解不是为了迎合 AI,而是因为任何媒介的创作,都需要把模糊的直觉转化成可执行的结构。
开始的时候不要追求完美。选一个三分钟以内的小故事,从 logline 写到镜头表,完整走一遍流程,把每一步的提示词记录下来。做完之后回头看哪一步最卡,那就是你最该补的那块能力。
累积几十个镜头之后,你会发现自己对"什么样的描述能生成什么画面"有了直觉。那时候提示词就不再是障碍,而是你表达能力的延伸。



