想让 AI 视频生成的画面稳定、可控、有质感,靠的从来不是把描述写得更长,而是把描述写得更“像指令”。中文创作者常有一种误解:以为模型能像人一样自动补全没说出口的部分。但在视频生成里,没写出来的东西就等于不存在——镜头、光线、动作幅度、人物特征,都必须显式落到文字里。下面这套方法围绕六个层次展开,从结构搭建到迭代工作流,配合大量可直接套用的中文模板,帮助你把模糊的灵感变成可重复执行的提示词。
中文提示词为什么容易“翻车”
很多创作者第一次用中文写视频提示词时都会遇到同一个困惑:画面在脑子里很清楚,写出来的句子也不短,生成的视频却总是偏移。问题通常不在于模型“听不懂中文”,而在于中文是一种高度依赖语境和省略的语言。我们说“一个很酷的女孩站在雨中”,人脑会自动补全服装、气质、光线、镜头景别和情绪,而模型只会按训练语料里的统计规律去猜。
更麻烦的是,主流视频模型的中文语料占比普遍低于英文。同一句描述,用英文写往往更稳定,因为训练数据里存在大量“主体 + 动作 + 环境 + 镜头”的英文样本。中文表达里的成语、双关、行业黑话、方言语气词,对模型来说都是噪声。至于“氛围感”“高级感”这类词,它们在人脑里有明确指向,在模型的向量空间里却是高度分散的一团。
所以中文提示词优化的本质,不是把中文写得更华丽,而是把中文写得更像结构化数据:把隐含信息显式化,把模糊形容词替换成可观测的视觉特征,把修辞换成参数。
以下是三种最常见的“翻车”类型:
- 意象过载:一句话塞进“孤独、史诗、赛博朋克、温暖”四个互相冲突的情绪词,模型只能随机挑一个,于是每次生成结果都不一样。
- 指代缺失:“她转身看向他”,但提示词里没有定义“他”,模型会凭空生成一个人,或者干脆忽略这个动作。
- 感官越界:“空气中弥漫着海盐味”——气味、温度、心理活动都不是视频模型能直接渲染的维度,必须转译成可见的视觉线索,比如“湿润的地面反光、被风吹起的发丝、远处翻涌的灰蓝色海浪”。
理解这三类问题,接下来的所有技巧才有落脚点。
一条合格提示词的六层结构
把提示词想象成一份给摄影组的通告单,而不是一句诗。对于大多数主流视频模型,下面六层结构都能带来稳定的提升:主体层、动作层、环境层、镜头层、光线与色彩层、风格与质量层。顺序可以调整,但层次不能缺失。
主体层:可识别的视觉身份
主体层要回答“谁/什么”,并且给出至少两个可辨识特征。年龄、发型、服装材质、配饰、体态、表情基调都属于这一层。
对比一下:
- 模糊版:一位漂亮的女性
- 可用版:三十岁左右的东亚女性,黑色齐肩短发被雨水打湿,穿深灰色羊毛大衣,右手提一只磨损的皮质公文包
“可用版”的每个词都能被渲染成像素:齐肩短发是长度,羊毛是有纹理的材质,磨损是旧化细节。这就是“可观测”和“可想象”的区别。
动作层:用动词锁定时间切片
视频模型最怕的不是复杂,而是动作被拆得不够清楚。一个提示词里塞进“奔跑、回头、扔出、接住”四个连续动作,通常只会得到一个四不像的中间姿态。
正确做法是一条提示词只承载一个主要动作,用副动词补充细节:
- 主动作:她推开玻璃门
- 副动作:肩膀微微前倾,风衣下摆被气流掀起
如果叙事需要多个动作,就把它们拆成多个镜头分别生成,再在剪辑里连接。这也是短片段生成比一次性描述整段故事更可靠的原因。
环境层:地点 + 时间 + 天气 + 人群密度
环境层最容易漏掉的是“人群密度”和“空间尺度”。同样是“街道”,空无一人的街道、人潮涌动的街道、只有远景几个模糊人影的街道,是三种完全不同的画面。
建议固定四个变量:地点(旧城区窄巷)、时间(黄昏)、天气(细雨)、人群密度(几乎无人,仅远处一名撑伞路人)。这四个变量一旦固定,后续多个镜头的空间感就会一致。
镜头层:把摄影机写进句子
镜头层包含景别、机位高度、焦段倾向、运动方式。中文里可以这样写:
- 景别:中近景、全景、过肩镜头
- 机位:低角度仰拍、与视线齐平、俯拍
- 焦段倾向:广角强化纵深、长焦压缩背景、浅景深虚化后方
- 运动:缓慢推近、横移跟随、手持轻微晃动、环绕半圈
镜头层是区分“随机好看”和“可控成片”的分水岭。多数人只写主体和动作,自然只能得到模型默认的中景固定机位。
光线与色彩层:情绪的真正来源
光线决定质感,色彩决定氛围。可用的中文光线词汇包括:侧逆光勾边、窗棂透入的斑驳光、荧光灯冷绿色调、钨丝灯暖橙、阴天柔和的漫射光、单一光源高对比、霓虹与雨面反射。
色彩方面,比起“好看的颜色”,更有效的是指定有限色板:“以青灰、暗红、暖黄三色为主”。限制色板比堆砌形容词更容易得到统一的视觉风格,也更利于多镜头之间的衔接。
风格与质量层:媒介词优于情绪词
“电影感”这个词几乎不产生有效信息。更可靠的做法是指定媒介与工艺:35mm 胶片颗粒、数字摄影机高锐度、纪录片手持质感、定格动画、水墨风格、赛璐璐动画。
质量词也有边际递减:三到四个足够,堆到十个只会互相稀释权重。
语序即权重:排列与标点逻辑
绝大多数视频模型对提示词的处理都带有位置偏置:靠前的内容权重更高,靠后的内容更容易被忽略或被截断。因此提示词的第一句应该放你最不能妥协的元素。
一个实用的排列优先级:
- 主体 + 核心动作
- 环境与时间
- 镜头与构图
- 光线与色彩
- 风格与质量
- 负面约束(多数模型有独立字段)
标点不是装饰,而是分隔语义块
中文创作者常用顿号罗列意象,但顿号在模型眼里往往只是弱分隔。当你想强调并列的不同维度时,可以用中文逗号分句,用换行切分大块,用中文句号结束一个完整语义单元。
例如:
- 差:赛博朋克、雨夜、霓虹、女孩、奔跑
- 好:赛博朋克风格的雨夜都市。一名穿亮面风衣的年轻女性在积水巷道上奔跑。霓虹招牌的粉紫色光映在湿地面上。低角度跟拍,中近景。
后者读起来像分镜脚本,模型更容易逐句解析。而且每一句都只承担一个信息职责,出问题时也更容易定位是哪一句造成的偏差。
强调与降权的中文写法
英文提示词生态里常见的括号加权语法,在中文里通常不被识别。替代方案有三种:
- 重复关键概念:把最重要的元素在句首和句尾各出现一次。
- 用数量词强化:例如“占据画面三分之一的巨大机械臂”比“巨大机械臂”更能控制比例。
- 用相对描述降权:想弱化背景时,明确写“背景轻微虚化、几乎不可辨认”,而不是期待模型自己忽略。
长度不是越多越好
超过模型上下文窗口后,后半段描述会被截断,而且有些模型在提示词过长时开始平均化处理,导致每个元素都变得平淡。经验做法是:主提示词控制在 60 到 120 个中文词之间,把补充说明放进负面提示词或参考图。
如果一条提示词改到第五版还是不稳定,问题通常不是信息不够,而是信息互相冲突。此时应该删,而不是加。
风格锚定与负面提示词
风格锚定:用具体名词替代抽象形容词
想要稳定复现某种视觉风格,最有效的办法不是描述感觉,而是引用已知的媒介、工艺、时代与流派。中文里可以直接使用这些锚点词:
- 媒介与工艺:35mm 胶片、16mm 手持纪录片、CCD 数码相机、柔焦滤镜、漂浮颗粒
- 时代与地域:八十年代香港街头、九十年代东京涩谷、民国时期江南水乡、近未来赛博都市
- 艺术流派:水墨、工笔、浮世绘、构成主义、包豪斯、超现实主义
- 动画方向:赛璐璐、厚涂、三维渲染、定格黏土、皮影
这些词之所以有效,是因为它们在训练数据中与大量稳定的视觉特征绑定。相对地,“高级感”“氛围感”“大师风格”这类词几乎没有稳定指向。
模糊词的视觉转译表
| 模糊表达 | 可观测转译 |
|---|---|
| 高级感 | 低饱和配色、单一主光源、大面积留白 |
| 温暖 | 钨丝灯暖橙、柔和散射光、米黄色调 |
| 科技感 | 冷白荧光、金属与玻璃反光、对称构图 |
| 孤独 | 人物占画面比例小于五分之一、空阔背景、阴天平光 |
| 紧张 | 手持轻微晃动、浅景深、高对比侧光 |
| 梦幻 | 柔焦、高光溢出、浅粉与淡青配色、轻微雾气 |
一个可复用的中文风格句
把风格锚定写成一个固定句式,能显著减少试错:
画面风格:{媒介},{时代或地域},{色彩限制},{质感词}
例如:“画面风格:35mm 胶片,九十年代南方小城,以墨绿与米黄为主色,轻微颗粒与暗角。”
负面提示词的三种类型
负面提示词不是许愿池,写得越长效果越差。真正有用的大致分三类:
- 结构性缺陷:多余的手指、肢体扭曲、面部崩坏、文字与水印、重复出现的人物
- 风格漂移:三维渲染感、塑料光泽、过度锐化的 HDR、卡通化
- 画质降级:模糊、噪点过多、压缩块、过曝
需要警惕的是,把“不要”写成肯定句反而会激活概念。中文里“不要有模糊”不如直接写“清晰锐利”,因为部分模型对否定词的处理并不稳定。最好的做法是先跑一次纯净版本,看看到底会出现什么问题,再有针对性地补负面词。
镜头语言数字化
景别与构图的常见中文表达
- 大远景:强调环境与人物的渺小,适合开场
- 全景:交代人物全身与空间关系
- 中景:腰部以上,适合对白与动作过渡
- 中近景:胸部以上,情绪与手势的重点
- 特写:脸部或物件,强调细节与信息
构图上可以补充:中心对称构图、三分法、前景遮挡、框架式构图(门框或窗框套住人物)、大面积留白。
运镜描述要写清方向、速度与终点
“镜头移动”几乎等于没说。完整的运镜描述包含三件事:从哪开始、怎么动、停在哪。
- 缓慢推近,从全景过渡到中近景,最终停在人物面部
- 沿轨道从左向右横移,跟随主体移动,保持人物始终在画面右侧三分之一处
- 手持轻微晃动,跟随人物穿过走廊,在门口短暂停留
时长与节奏要写进提示词
不同模型的可生成时长不同,但提示词里说明“这是 5 秒内的单镜头”或“缓慢、几乎静止的动作”能显著提高稳定性。动作幅度大而时长短的组合,最容易出现形变与拖影。
节奏上还有一个常被忽略的技巧:把“慢”写具体。例如“整个动作在一个呼吸的时长内完成”,比单纯写“慢动作”更能让模型理解速度层级。
光线描述的可执行模板
光源位置 + 光源性质 + 受光面 + 阴影走向
例:“单一窗户光源位于人物左前方,柔和散射的阴天光,照亮右半边脸,左侧落下浅淡阴影,背景整体压暗。”
这样写比“光线很美”有用得多,因为它给出了可计算的几何关系。
一致性工程
角色一致性:建立定妆描述卡
跨镜头保持角色一致,最稳的做法是提前写一份“定妆描述卡”,每次生成都原样复制同一段文本,而不是每次重新描述。这张卡包含:年龄与性别、发型与发色、面部显著特征、服装与配饰、体态。
改动越少越好。如果需要不同视角,只调整镜头层,主体层保持逐字一致。词语顺序也不要随意调整,因为顺序本身参与权重分配。
道具与场景一致性
道具要用同样的名词反复指代。第一镜写“磨损的皮质公文包”,后续镜头就不要改写成“旧包”“手提箱”,因为模型会把不同词映射到不同的视觉原型。
场景一致性则依赖固定的环境四件套(地点、时间、天气、人群密度),再加上固定的色彩限制。只要这两组信息逐字复用,不同镜头之间的空间感就会自然连贯。
运动一致性
人物走路的速度、镜头移动的速度、光线变化的方向,都属于运动一致性。常见错误是三个镜头里人物一会朝左走一会朝右走,剪在一起像倒放。写提示词时固定“人物始终朝向画面右侧移动”这种方向约束,会省掉大量返工。
参考图与提示词的分工
如果工作流支持首帧参考或角色参考图,那么提示词的职责应该相应收缩:把稳定交给参考图,把变化交给文字。用参考图再去堆重复的主体描述,反而容易造成特征冲突。
一个实用的分工比例是:参考图负责身份与轮廓,提示词负责动作、镜头与光线。这样即使更换角色,镜头语言也不需要重写。
模型适配策略
西方模型:中文短句 + 关键术语保留英文
以英文语料为主训练的模型,对中文长句的解析深度有限。有效策略是“中文为主、关键术语用英文括号补充”:
一名女性在雨夜奔跑(running in rain),霓虹反射积水(neon reflection on wet asphalt),低角度跟拍(low angle tracking shot)
这种混写能显著提高术语命中率,尤其是镜头与光照术语。但混写不能过度:每句最多补一个英文短语,否则整句的语义重心会漂移。
本土模型:可以大胆使用中文意象与文化词
面向中文语料训练较多的模型,对水墨、国风、武侠、汉服、灯笼、牌坊等文化词的理解通常更到位,也能处理“留白”“写意”这类抽象美学词汇。这类模型上,反而要避免英文术语混写打断语义。
分镜一致性模型:把描述压到最简
有些模型专为跨镜头一致性设计,此时提示词越简洁越稳定。把复杂描述留在分镜脚本里,喂给模型的只保留主体动作与运镜。
选择模型的三个判断维度
- 动作复杂度:多关节大幅动作优先选物理稳定性强的模型
- 风格复现需求:需要特定美术风格时,优先选风格化样本多的模型
- 镜头可控性:需要精确运镜时,优先选支持运镜参数的模型
不要指望一个模型解决所有镜头。混用多个引擎,再用统一的分镜脚本和色彩规范把画面拉齐,往往比死磕单一模型更高效。切换引擎时,先跑一次低分辨率试探,确认解析方向没有跑偏,再投入正式生成。
五轮迭代工作流
第一轮:文字草稿(不生成)
先在纯文本里把六层结构写完整,检查每一句是否可观测。这一步能省掉大量生成时间,也能避免“边写边试”导致的变量失控。
第二轮:低分辨率试探
用最短时长、最省资源的方式生成 2 到 4 个版本,只看构图与动作是否成立,不看细节。此阶段的目标是排除方案,而不是挑选成品。
第三轮:锁定结构与运镜
确定景别、机位与运动后,把它们固化进模板,之后只微调光线与风格。结构一旦锁定,就不要在后续轮次里反复改动。
第四轮:质感与风格微调
加入媒介词、色彩限制、颗粒质感,逐项调整。每次只改一个变量,否则无法判断是哪个改动起了作用。做记录很重要:把每次使用的提示词版本编号保存,回头对比时能快速找到有效改动。
第五轮:批量一致化
把定稿模板参数化,替换主体与场景变量,批量生成同一系列的镜头。这一轮的核心是控制差异:除了预设的变量,其他所有文字都应逐字相同。
参数化提示词模板示例
主体:{角色描述卡}
动作:{单一主动作},{副动作}
环境:{地点},{时间},{天气},{人群密度}
镜头:{景别},{机位},{运镜}
光线:{光源位置与性质}
色彩:{三色限制}
风格:{媒介},{时代或地域}
把这个模板存成文本片段,每次只替换大括号内容,效率和一致性都会明显提高。
常见错误与排查清单
画面元素随机漂移
原因通常是描述过散、缺少镜头约束。排查:是否写了景别与机位?是否给了色彩限制?主体描述里有没有互相冲突的关键词?
人物面目崩坏
多数出现在特写加快速运动,或人物占比过小的全景里。排查:是否把脸部作为主体并写清特征?是否把大幅动作放在近景?可以尝试改中景、增加稳定光线。
动作变形、肢体粘连
通常是动作过多或时长过短。排查:一条提示词里是否有两个以上主动作?是否要求了不可能的物理过程(如穿墙、瞬移)?
风格不统一
跨镜头风格漂移的根源往往不在模型,而在描述词每次都不一样。排查:媒介词与色彩限制是否逐字复用?是否混用了“胶片颗粒”和“超清晰数字”这类冲突描述?
中文语义被忽略
如果整段描述只有后半段生效,说明提示词过长或语序不当。排查:核心主体是否在最前面?是否用了太多成语和修辞?把句子拆短通常比换模型更有效。
反复生成仍不满意
停下来改结构,而不是继续加词。九成的情况是六层结构里缺了一层,或某两层互相矛盾。写出你真正想要的那一帧画面,再逐项反推需要哪几层信息。
场景化模板与常见问题
产品广告镜头
中近景,白色磨砂质感的无线耳机置于深灰石质台面,顶部柔和条形光从左上方打下,勾勒出金属边框的高光,背景渐次压暗为纯黑。镜头缓慢环绕四分之一圈,浅景深,产品始终位于画面中心略偏左。风格:高锐度商业摄影,无颗粒。
产品场景的关键是光线与材质,而不是情绪词。写清受光面与倒影,比写“高端大气”有效十倍。
叙事短片镜头
黄昏,旧居民楼天台。一名穿洗旧卫衣的少年背对镜头坐在矮墙上,双手插兜。远处城市轮廓在暖橙色雾霾中虚化。全景,与视线齐平,镜头极缓慢推近,最后停在少年肩部。风格:16mm 胶片,轻微颗粒,米黄与灰蓝为主色。
叙事镜头要突出“留白”和“静止中的微小动作”,大幅动作留给下一个镜头。
竖屏社媒短视频
竖屏的构图逻辑与横屏不同:主体通常占据画面中央 60% 到 70% 的高度,上下留出文字区域。提示词里可以直接写“竖构图,主体居中,顶部与底部保持简洁背景”。运镜优先选择推近与轻微手持,避免大幅横移——横移在竖屏里容易被裁切。
常见问题
问:中文提示词一定要写得很长吗?
不必。长度只在你需要多层控制时才增加。一条 40 字但层次完整的提示词,往往胜过 200 字的形容词堆砌。先写全六层,再逐轮删掉没有实际作用的部分。
问:同一段中文提示词在不同模型上效果差异很大,怎么办?
这是正常现象,因为各家模型的训练语料与文本编码方式不同。做法是:为每个常用模型维护一份“方言版”提示词,只在术语层面调整,主体与环境描述保持一致。
问:负面提示词写多长合适?
建议控制在 8 到 15 个词,按“结构缺陷、风格漂移、画质降级”三类组织。每加一条都问自己:这条是否真的出现过?只针对实际出现的问题添加,而不是预防性地堆满。
问:如何让多镜头看起来像同一个团队拍摄的?
固定三样东西:色彩限制、媒介风格词、镜头焦段倾向。把这三项写成一段“全片规范”,复制到每个镜头的提示词末尾。观众感知到的“统一感”,大多来自这三项,而不是剧情。
问:中文成语和诗意表达完全不能用吗?
可以少量使用,但要用在能映射到具体视觉的地方。“落日熔金”可以保留,因为它指向暖橙高光与金属反光;“物是人非”就不可用,因为它描述的是心理状态而非画面。
问:什么时候该放弃调提示词,改用参考图或后期?
当目标涉及精确的人物身份、品牌标识、特定文字排版时,提示词不是合适工具。这类需求应交给参考图、分镜控制或后期合成。提示词擅长的是氛围、运镜、光线与动作方向。
一页速查清单
- 主体是否包含两个以上可观测特征?
- 是否只有一个主要动作?
- 环境四件套(地点、时间、天气、人群密度)是否齐全?
- 是否写了景别、机位、运镜?
- 光线是否写清了光源位置与受光面?
- 色彩是否限制在三个主色以内?
- 风格词是否使用媒介与时代锚点,而非情绪词?
- 负面提示词是否只针对真实出现的问题?
- 跨镜头是否逐字复用了角色卡与全片规范?
- 每次迭代是否只改动了一个变量?
把这十条当作发布前的检查表,绝大多数返工都能在生成之前被拦住。中文提示词优化真正考验的不是文笔,而是把想象拆解成可执行指令的耐心和条理。当你能用同一套模板稳定产出风格统一的镜头时,提示词就从“碰运气的咒语”变成了可交付的生产工具。


