Start Free Now
Limited Time Offer: Get 50% OFF Starter & Basic Yearly Plans 🎉

提示词工程进阶:用Sora与Luma打造电影级AI短片的工作流

Oct 6, 2026

电影感不是形容词堆出来的:先理解三个可控变量

绝大多数人写视频提示词时的第一反应,是往上堆形容词:「超美的」「史诗感的」「震撼的」「电影级的」。这类词几乎不产生有效约束,因为它们不指向任何可以被渲染的具体参数。模型拿到这种提示词,只能用训练数据里的平均分布去补全画面,结果就是那种说不出哪里怪、但一眼就看出是AI味的画面。

真正决定画面质感的是三个可以拆解的变量:空间、时间、光线。

空间回答的是「画面里有什么、在哪里、彼此距离多远」。主体处于画面的哪个位置,前景有没有遮挡物,中景有什么支撑叙事的信息,远景是不是用来交代环境的纵深。一个只有主体的画面是海报,一个有三层结构的画面才是场景。

时间回答的是「这一秒到下一秒发生了什么」。镜头持续多久,主体是静止还是移动,移动的速度是缓慢还是急促,动作处在起始、进行还是收束的阶段。很多生成结果显得假,不是因为画得不好,而是因为动作没有节奏,从头到尾都是匀速运动。

光线回答的是「光从哪里来、什么颜色、多硬」。是正午顶光还是黄昏侧逆光,是单一主光还是多光源混合,是硬光带来的强对比还是柔光带来的低反差。光线直接决定情绪:同样的街道,冷青色顶光和暖橙色窗光会讲出两个完全不同的故事。

写提示词时可以用这三项做自检:如果某个维度没有写清楚,模型就会用它自己的默认值来填充,而默认值通常是平庸的来源。

提示词六模块结构:把一句话变成一张拍摄单

专业剧组不会用一句话描述一场戏,他们用剧本、场记单、镜头表和灯光方案,把一场戏拆成可以执行的模块。提示词工程应该模仿这套流程。一个可复用的结构化提示词通常包含六个模块。

**模块一,主体与动作。**写清楚谁、在做什么、动作处在什么阶段。不要写「一个侦探」,而要写「一位穿棕色皮夹克的女性侦探,右手撑伞,缓慢向前走,脚步带起水花」。动作要有主语、有方式、有结果。

**模块二,环境与时间尺度。**地点、天气、季节、具体时段、空间纵深。写「雨夜的城市街道」还不够,可以补上「霓虹灯牌在湿沥青上拉出长条反射,蒸汽从井盖升起,远处是密集的广告牌」。细节的密度决定了模型的空间一致性表现。

**模块三,镜头语言。**景别、焦距、机位、运动方式、构图。这一块是业余与专业之间最明显的分水岭,后文会单独展开。

**模块四,光线与色彩。**光源方向、色温、对比强度、整体调色倾向。可以写「侧逆光,冷青色环境光与暖橙霓虹形成对比,浅景深,背景虚化成光斑」。

**模块五,质感与介质。**胶片颗粒、镜头光晕、材质反光、渲染风格。这些词负责把画面从「干净的3D渲染」推向「有拍摄痕迹的影像」。

**模块六,约束与排除。**不想要的东西、稳定要求、画幅比例、是否允许文字。比如「无字幕,无水印,无logo,画面稳定,16:9」。

把六个模块串起来,一条完整提示词大致是这样的:

35mm定焦,中近景,低角度微微仰拍;雨夜的城市街道,霓虹灯牌在湿沥青上拉出长条反射,蒸汽从井盖升起,远处是密集的广告牌;主体是一位穿棕色皮夹克的女性侦探,右手撑伞,缓慢向前走,脚步带起水花;侧逆光,冷青色环境光与暖橙霓虹形成对比,浅景深,背景虚化成光斑;胶片颗粒,轻微手持晃动;无字幕,无水印,画面稳定,16:9。

为什么这样写有效?因为每一个短句都对应一个可渲染参数,模型不需要猜。写提示词的核心不是文学性,而是把创作意图翻译成可执行的规格。

镜头语言:把「运镜」翻译成模型能听懂的语言

焦距与景深

焦距决定透视关系和空间压缩感。广角会让空间显得开阔,前后景距离感被夸张,适合交代环境或制造压迫感;长焦会压缩空间,把远处的主体拉近,背景虚化明显,适合情绪特写。可以直接在提示词里写「广角」「35mm」「85mm」「长焦压缩」「浅景深」「深焦」。

景深是一个容易被忽略但效果显著的控制项。浅景深让主体从环境中剥离出来,观众注意力被强制集中;深焦让画面所有层次都清晰,适合展示信息量大的群像或复杂环境。

机位与角度

机位高度直接改变观众对主体的心理判断。低角度仰拍让主体显得强势、有压迫感;高角度俯拍让主体显得渺小、弱势或处于被观察的位置;平视则中性、亲近。这些词模型响应良好,写「低角度仰拍」比写「让他看起来很强大」有效得多。

机位还有水平方向的变化:正面、侧面、四分之三侧面、过肩、背面。背面跟随镜头非常适合开场或结尾,因为观众看不到主体表情,会自动把注意力放到环境上。

运动方式与速度

运镜是提示词中最容易出错的部分,因为很多人会把互相冲突的运动写在一起。常见的可控运动包括:

  • 推轨前进:镜头向主体靠近,用于逐步加强情绪。
  • 拉远后退:镜头远离主体,用于交代环境或收尾。
  • 横移跟拍:镜头平行于主体移动,适合行走场景。
  • 摇摄:机位不动,镜头方向转动。
  • 升降:机位垂直移动。
  • 手持晃动:增加纪录感和不安感。
  • 环绕:镜头围绕主体旋转,适合展示或高光时刻。

关键是不要在一句话里同时要求「镜头推进」和「保持固定机位」。模型面对冲突指令时,通常会在两者之间随机跳变,导致画面出现莫名其妙的抖动或形变。

构图与留白

对称构图带来秩序感,三分法带来稳定但不呆板的平衡,中心构图强调主体,留白可以制造孤独或悬念。写「主体置于画面左侧三分之一,右侧保留大面积空景」这种具体描述,比写「构图很美」有用得多。

角色一致性:参考图、锚点与分段生成

为什么角色一致性是最难的部分

视频模型的逐帧生成机制天然倾向于「每一帧都重新想象一次人物」。哪怕提示词完全一致,两次生成的主角发型、脸型、外套颜色都可能漂移。想拍一支多镜头短片,角色一致性是必须解决的问题。

角色卡:先把人物固定下来

在写任何镜头提示词之前,先做一张角色卡,用一段固定文本描述人物:年龄区间、脸型特征、发型发色、服装款式与颜色、标志性配件。这段文本之后在每个镜头提示词中都原样复制,不要改写、不要缩写。改写会引入变量,变量会导致漂移。

角色卡示例:

一位三十岁左右的东亚女性,短黑发齐耳,左眉上方有一道浅疤;穿深棕色皮质短夹克,内搭灰色高领毛衣,下身深色长裤;右手腕戴一只银色手表。

参考图与关键帧锚定

纯文本很难锁定五官细节,这时需要引入参考图。做法有两种。第一种是多图参考:给模型提供一张正面、一张四分之三侧面、一张全身图,让模型在生成时融合这些视觉锚点。第二种是首尾帧控制:用一张已经确认的角色图作为起始帧,让模型在此基础上生成动作。

图生视频的一致性通常明显优于纯文生视频,因为起始帧已经把人物形象固定住了,模型需要「编造」的只有动作与环境变化。如果项目对角色要求高,建议先用图像生成工具把关键画面做出来,再逐镜头转成视频。

服装、道具与光源的一致性

角色一致性不只是脸。外套颜色在夜戏与日戏中要一致,手上的道具不能凭空消失,同一场戏里的光线方向不能突然反转。可以在提示词中加一句约束:「保持夹克颜色不变,手表始终在右手腕,光源均来自画面右侧」。

分段生成再拼接

长镜头不要指望一次生成。更稳的做法是把一场戏拆成三到五个短片段,每段三到八秒,让相邻片段共享首尾帧:上一段的最后一帧作为下一段的第一帧。这样既保证了视觉连续性,也降低了单次生成的失败成本。

时间与运动控制:让镜头按计划走

运动轨迹要可描述

「主体向右移动」是模糊的,「主体从画面左侧边缘入场,沿水平方向匀速移动到画面中央后停下」是可执行的。如果模型支持轨迹绘制或运动笔刷,直接在画面上标一条路径往往比文字更精确;如果只支持文本,就把路径拆成起点、方向、速度、终点四个要素。

动作节拍与镜头时长

一个动作在现实中有起势、发力、收束三个阶段。写提示词时可以明确指定阶段:只拍起势,画面会有悬念;只拍收束,画面会有余味。三到五秒的镜头只够完成一个清晰的动作,硬塞两个动作会让模型把两者混合成糊状。

慢动作与速度曲线

「慢动作」「高速摄影」「时间流逝」是三种完全不同的时间表达。慢动作适合情绪放大,时间流逝适合交代环境变化,实时速度适合写实叙事。需要注意的是,慢动作提示词常常会连带影响画面质感,模型可能同时加上类似高速摄影的清晰度与光线特征,这时要在质感模块里补一句「保留自然光照,不要额外补光」。

转场设计

AI生成短片最常见的毛病是镜头之间像PPT一样硬切。解决办法是在写分镜时就设计转场:

  • 动作衔接:上一段人物抬手,下一段从手落下的位置开始。
  • 视线引导:上一段人物抬头看天,下一段切到天空。
  • 形状匹配:两个镜头有相似的构图或圆形元素。
  • 光线衔接:两段的光源方向与色温接近,剪辑时不会突兀。

在提示词里预留转场信息,比后期硬接自然得多。

模型选择:不同模型有不同的脾气

文生视频模型

文生视频模型擅长把你脑海里的画面快速具象化,适合前期概念探索。它们的强项是构图想象力与环境复杂度,弱项通常是动作精度和角色稳定性。用它们找方向,不要用它们做最终交付。

图生视频模型

图生视频模型把已有的画面变成动态,一致性更好,控制感更强。适合已经有分镜图、角色设定图或产品图的团队。这类模型对提示词的要求更偏向「运动描述」而非「画面描述」,因为画面已经被起始帧确定了,提示词应该聚焦于镜头如何运动、主体如何动作。

首尾帧与运动控制型模型

支持首尾帧的模型是叙事型短片的利器:给定起点和终点,模型负责生成中间过程。这类模型对「动作简洁、路径明确」的镜头表现最好,如果中间过程太复杂,反而容易出现形变。

组合使用与降级方案

实际项目里很少只用一个模型。常见的组合方式是:用图像模型做角色与场景设定,用图生视频模型做角色主导镜头,用文生视频模型做环境空镜与氛围镜头,最后统一剪辑与调色。

一定要准备降级方案:如果某个镜头反复失败,就换模型、缩短时长、简化动作,或者改成不需要角色露脸的替代方案。做短片时,进度比完美更重要,一个能用的替代镜头远胜于卡住三天的完美执念。

实战工作流:从一句话到一支成片

第一步:剧本拆镜

先写一段一到两页的短剧本,不要超过三个场景、六个镜头。然后做镜头表,每一行包含:镜头编号、时长、景别、机位、动作、环境、情绪目标。镜头表是整支片子的骨架,也是提示词的来源。

第二步:写提示词卡

为每个镜头写一张提示词卡,按六个模块填满。建议同时写一个「简版」和一个「详版」:简版用于快速试拍,详版用于最终生成。简版控制在二十字以内,只保留主体、动作、镜头、光线;详版把六个模块全部补齐。

第三步:低成本试拍

不要一上来就用最高质量设置生成。先用低分辨率、短时长跑一轮,验证构图、动作方向、角色形象是否符合预期。很多问题在低质量试拍阶段就能看出来,此时修改成本最低。

第四步:生成与筛选

每个镜头至少生成三到五条,然后建立筛选标准:动作是否自然、主体是否变形、光线是否符合设定、是否有闪烁或跳帧。不要因为一条画面「好看」就选它,如果它与前后镜头不搭,再好看也是负担。

第五步:剪辑、声音与调色

剪辑阶段要做三件事:调整镜头节奏、处理转场、统一色调。声音往往被忽略,但它是短片质感提升最快的部分:环境音铺底、动作音点缀、配乐控制情绪。画面再有电影感,没有声音也会显得像半成品。

第六步:交付与归档

输出至少两个版本:一个适合竖屏平台的竖版,一个适合横屏的横版。同时把提示词卡、角色卡、参考图、镜头表一起归档。这些资产在下一个项目里可以直接复用,是效率提升的真正来源。

常见错误与排查清单

错误一:形容词堆叠。「震撼的、唯美的、史诗的」这类词占了一半篇幅,却没有一个可执行参数。解决方式是每写一个形容词,就问自己:它对应的是空间、时间还是光线里的哪一项?如果答不上来,就删掉换成具体描述。

**错误二:一个提示词塞进多个镜头。**模型会把多个镜头的描述混合成一个画面,导致构图混乱。一个提示词只对应一个镜头,这是硬规则。

**错误三:主体描述前后不一致。**第一个镜头写「棕色皮夹克」,第三个镜头写成「褐色外套」,模型会认为是两个人。把角色卡原样复制,不要临场改写。

**错误四:运动指令互相冲突。**同时要求固定机位和镜头推进、同时要求慢动作和快速运动,模型只会随机跳变。写之前检查一遍所有运动指令是否兼容。

**错误五:忽略画幅与分辨率。**竖屏平台、横屏平台、方形投放对构图的要求完全不同。在提示词阶段就确定画幅,避免后期裁切破坏构图。

**错误六:把音频、字幕需求写进画面提示词。**画面模型不擅长处理文字与对白,字幕和对白应该在剪辑阶段添加,否则画面里会出现扭曲的文字。

**错误七:生成量失控。**一次生成几十条,筛选成本会超过生成成本。建议按镜头分批生成,每批十到十五条,筛完再进入下一步。

**错误八:跳过试拍直接做终版。**这是最常见的返工来源。用十分钟做一次低质量试拍,可以省掉几小时的重新生成。

迭代与版本管理:把提示词当成代码

成熟的创作者会把提示词当作可维护的代码资产。具体做法包括:

第一,给每条提示词编号。用「场次-镜头-版本」的命名方式,例如S02-C03-v4,方便回溯哪一版效果最好。

第二,记录变更日志。每次修改只动一个变量,并记录改了什么、结果如何。同时改三个变量,你永远不知道是哪个起了作用。

第三,做小规模对照测试。想验证「侧逆光」是否比「正面柔光」更合适,就跑两组各五条,其他条件完全一致。这种一次一变量的方法,比凭感觉改十遍有效得多。

第四,建立自己的提示词片段库。把反复用到的模块保存成片段:雨夜城市、黄昏室内、手持跟随、胶片质感。写新镜头时直接拼接,效率会大幅提升。

第五,把失败案例也归档。失败提示词往往比成功提示词更有价值,因为它划定了模型的边界。知道模型做不到什么,才能设计出可行的镜头。

FAQ:关于AI短片创作的常见疑问

中文提示词和英文提示词哪个效果更好?

这取决于模型本身。多数主流模型对英文提示词的语义理解更细腻,尤其在摄影术语上;但不少模型对中文的响应已经足够好。一个实用的折中方案是:结构说明用中文写方便协作,技术术语与镜头语言保留英文原词,比如「浅景深」「dolly in」混排。关键不在语言,而在参数是否具体。

提示词越长越好吗?

不是。长度本身没有价值,信息密度才有价值。一条三十字的提示词如果每个词都对应一个可渲染参数,效果会优于一条两百字的形容词集合。建议先用简版试拍,确认方向后再逐步补充细节。

如何让同一角色跨镜头保持一致?

三件事同时做:固定角色卡文本原样复制;使用参考图锚定五官与服装;用首尾帧把相邻镜头串起来。三者结合时,一致性会有明显提升。如果只有一个条件可用,优先使用参考图,视觉锚点比文字描述有效得多。

生成的动作不自然怎么办?

先把动作拆解。一个镜头只保留一个清晰动作,去掉次要动作。其次缩短时长,三秒的动作比八秒的动作更容易生成自然。最后检查提示词里是否存在速度描述缺失——如果不写速度,模型会自己选择,通常选择得并不好。

一次应该生成多少条?

按镜头分批,每批十到十五条。少于十条容易因为偶然性错过好结果,多于二十条则筛选成本过高。筛选时先看动作与变形,再看构图与光线,最后看情绪是否匹配。

没有参考图能做角色一致性吗?

可以但更困难。做法是把角色特征写得极其具体,尤其是发型、服装颜色、标志性配件这些模型容易记住的锚点,并且每个镜头原样复制。如果条件允许,还是建议先用图像工具生成一张角色设定图,投入很小,回报很大。

怎么让画面更有电影感?

优先调整三件事:镜头语言、光线方向、质感元素。把「平视中景、正面均匀光、干净无颗粒」换成「低角度中近景、侧逆光带对比、轻微胶片颗粒」,画面立刻会产生叙事感。电影感来自取舍和限制,而不是把画面填满。

生成的素材可以直接用于商业项目吗?

每个工具的使用条款不同,商用范围、素材归属与限制条件都需要在使用前逐项确认。稳妥做法是保留生成记录与提示词档案,并且避免在提示词中引用真实人物、品牌标识或受保护的角色形象。合规检查应该是项目流程的一部分,而不是事后补救。

怎样的短片长度适合练手?

十五到三十秒最合适。这个长度足够讲一个完整的小情境,又不会让镜头数量与一致性压力失控。等你能稳定完成三镜头、五镜头、八镜头的递进,再去尝试一分钟以上的叙事结构。

把方法变成习惯

提示词工程的核心并不是背术语,而是建立一种把创作意图翻译成可执行规格的思维习惯。每次写提示词时,先问空间、时间、光线这三件事是否交代清楚;再用六模块结构检查信息是否完整;最后用一次一变量的方式迭代。

这套方法的回报是复利式的。当你的提示词卡、角色卡、片段库积累到一定规模,新项目的启动成本会明显下降,你不再需要从零开始猜测模型喜欢什么,而是像导演调用剧组资源一样,直接调用自己已经验证过的方案。

电影级短片从来不是靠一个神奇的提示词产生的,它来自清晰的分镜、稳定的角色、可控的运动、匹配的光线,以及在剪辑台上耐心打磨的节奏感。把提示词当作拍摄单来写,把生成当作试拍来对待,把剪辑当作真正的创作来完成——这才是AI短片创作中最稳定的进阶路径。

Alexander

Alexander