AI 视频提示词完全指南:从基础结构到高级控制技巧
2025 年,AI 视频生成已经从实验室里的演示变成了内容行业的日常工具。无论是短视频创作者、广告团队还是独立动画师,都可以通过一句提示词生成一段风格化视频。但真正拉开差距的,往往不是模型本身,而是提示词的质量。同一个模型,有人能稳定输出电影级画面,有人却只能得到画面漂移、角色变形的片段,差别几乎都出在提示词上。
这篇文章会从零开始,把 AI 视频提示词拆解成一套可以复用的方法:先讲清楚提示词的基础结构,再深入负面提示词、权重控制、模型选择、角色一致性这些进阶话题,最后给出可直接套用的模板和常见错误清单。读完你就能系统地写出更稳定、更可控的 AI 视频提示词。
为什么提示词决定视频的成败
很多人以为 AI 视频生成是"输入一句话,等待奇迹",但实际上,提示词是创作者与模型之间唯一的沟通渠道。模型不会读心,它只能根据你提供的文字,在训练数据里寻找最接近的视觉模式。
这意味着提示词的质量直接决定了三件事。第一是画面质量:主体是否清晰、细节是否丰富、光影是否正确。第二是可控性:你想要的镜头运动、时间节奏、角色状态能否被准确还原。第三是稳定性:多个片段之间风格是否统一,角色形象会不会在下一段里完全变样。
行业里常说提示词工程是一门"新的编程语言",这个比喻并不夸张。好的提示词就像代码,有结构、有参数、有约束条件;差的提示词就像随手发的聊天消息,模型只能靠猜。理解了这一点,你就会明白为什么同样用一款模型,专业团队和业余用户产出的效果天差地别。
另一个容易被忽视的点是成本。视频生成比图像生成昂贵得多,一次生成可能就要消耗大量算力或额度。提示词写得越精准,需要的重试次数就越少,长期下来省下的时间和资源非常可观。把提示词当作需要打磨的资产,而不是一次性消耗品,是专业创作者和普通用户的分水岭。
提示词的基础结构:主体、动作、风格与技术参数
一个高质量的视频提示词通常包含四个层次:主体、动作、风格、技术参数。把它们组合起来,模型才能同时理解"拍什么""发生什么""看起来像什么""怎么拍"。
主体(Subject) 是提示词的核心,必须具体明确。不要写"一个人走在街上",而要写"一位三十岁左右、穿深色风衣的亚洲女性,短发,戴圆框眼镜,走在雨后潮湿的东京街道上"。主体的细节越具体,模型的想象空间越小,输出越稳定。模糊的代词、笼统的名词,都会让模型自由发挥,结果自然难以控制。
动作与叙事(Action / Narrative) 描述画面中发生的事件。这里的关键是动词要具体:是"奔跑"还是"缓步前行",是"回头微笑"还是"皱眉看向远方"。如果有连贯的叙事,最好按时间顺序描述,比如"她先抬头看天,然后低头打开手中的信封"。模型对动作的理解深度有限,所以动作描述要直白、单一,不要在同一句里塞进太多事件。
风格定义(Style) 是提示词的风格化开关。你可以使用摄影术语,比如"浅景深、逆光、35mm 镜头、电影质感";也可以使用艺术风格,比如"赛博朋克、油画质感、吉卜力风格、黑白纪录片"。风格词的效果因模型而异,通常建议一次只叠加两到三个风格关键词,堆砌过多会导致画面不伦不类。
技术参数(Technical Parameters) 负责镜头语言和输出规格,比如"缓慢推进镜头、4K、高帧率、无缝循环"。这类词直接影响成片的观感,但对不同模型的支持程度不同,需要针对性地测试。
把这四层组合起来,一个完整的提示词大致长这样:
一位穿深色风衣的短发女性站在雨后的东京街头,她抬头望向霓虹灯牌,然后低头微笑,浅景深,逆光,35mm 电影镜头,赛博朋克氛围,缓慢推进,4K 画质。
注意顺序:主体和动作放在最前面,风格和技术参数放在后面。多数模型对提示词前部的信息更敏感,所以最重要的内容一定要靠前。
负面提示词:告诉模型不想要什么
正面描述告诉模型要生成什么,负面提示词则告诉模型要排除什么。对于视频生成来说,负面提示词的重要性甚至超过图像生成,因为视频中的错误会被时间放大:一个在单帧里可以忽略的变形,在连续画面里会变得非常明显。
常见的负面词包括三类。第一类是画面质量问题,比如"模糊、低分辨率、噪点、过度锐化、伪影、色块"。第二类是内容问题,比如"多余的手指、变形的手、畸形肢体、多余的眼睛、文字乱码"。第三类是风格问题,比如"过饱和、卡通化、塑料感、抖动、扭曲"。
负面提示词的写法也有技巧。第一,用简单直接的否定词,避免"没有模糊"这种双重否定结构,模型很难理解。第二,同类问题尽量合并,比如"模糊、失焦、低清"一起写,比单独写一个词更有效。第三,负面词要贴合模型特性,不同模型对负面词的敏感度差异很大,需要针对你常用的模型单独调优。
一个实用的做法是建立自己的"负面词库"。每次遇到输出问题,就把对应的负面词加进模板里,一段时间后,你就拥有了一套针对特定模型、特定题材的优化词表。这比每次从头写要高效得多。
权重控制:调整提示词的重点
有些模型支持权重语法,允许你为提示词的不同部分分配优先级。常见的写法是用括号加数字,比如 (主体:1.5) 表示强调,(背景:0.8) 表示弱化。权重功能让提示词从"平铺描述"升级为"有重点的表达"。
权重使用的核心原则是:突出关键信息,弱化次要信息。比如生成一段强调材质质感的片段时,可以把"光影交互、金属反光、布料纹理"这类词加权,把"背景装饰、路人"降权。这样模型会把有限的注意力集中在你真正需要的元素上。
但权重不是万能的。第一,过度加权会导致画面过拟合,出现不自然的僵硬感。第二,权重语法在不同模型间的兼容性不同,有的模型完全不支持,有的模型只支持特定格式。在正式生成前,最好先小批量测试权重语法是否生效。
更进阶的用法是结合阶段控制。部分模型支持在不同生成阶段应用不同的提示词,比如前期强调构图,后期强调细节。这类功能的学习曲线更陡,但控制力也更强,适合追求极致效果的创作者。
选对模型:不同模型吃不同的提示词
很多人以为提示词是通用的,换个模型照样用,这其实是个很大的误区。不同模型在训练数据、架构、擅长领域上的差异,决定了它们对提示词的反应完全不同。
以几个常见模型为例:有些模型擅长写实风格和复杂光影,对摄影术语反应敏感;有些模型叙事理解能力强,适合多镜头连贯的场景描述;有些模型在物理真实感上表现突出,但对风格化词汇理解有限;还有些模型擅长快速生成和动态控制,但细节表现力一般。
所以,正确的工作流是先选定模型,再针对该模型优化提示词,而不是反过来。如果你是刚开始接触 AI 视频,建议固定一到两个主力模型,把它们的"脾气"摸透,再逐步扩展。盲目在多个模型之间切换,只会让你的提示词库永远无法沉淀。
多模型混合使用也有讲究。比如用 A 模型生成关键帧,用 B 模型把关键帧扩展成动态视频,再用 C 模型做细节增强。这种流水线式的工作流,比单模型硬扛所有环节要可靠得多,但每个环节的提示词都需要单独设计。
角色一致性:让同一个角色贯穿所有场景
AI 视频最让人头疼的问题之一,就是角色一致性:上一段还是个红发女孩,下一段头发就变成了黑色,脸也完全变了样。对于需要多镜头叙事的创作来说,这几乎是致命的。
目前解决角色一致性的主流方法有两种。第一种是基于参考图的方法:先生成一张角色的基准图像,然后把这张图作为参考输入,让模型在生成视频时保持该角色的外貌特征。这要求参考图的角度、光照尽量丰富,通常准备 5 到 10 张不同角度的基准图效果最好。
第二种方法是多图像融合技术,把多张参考图"融合"成一个身份特征向量,再在生成时反复引用。这种方法的好处是即使中途更换生成模型,角色的身份特征依然可以保持稳定。对于需要跨模型协作的复杂项目,这种方案几乎是必需品。
无论用哪种方法,角色一致性都不是一次性设置就能搞定的。你需要在每个场景生成后检查角色的细节是否漂移,必要时回到基准图重新校准。把角色一致性当作一个持续维护的过程,而不是一个开关,是长期创作的基本心态。
时间与运动:控制帧率、速度与过渡
视频区别于图像的根本在于时间维度,而提示词中对时间与运动的控制,恰恰是很多创作者最容易忽略的部分。
首先明确时间概念:你生成的视频时长有限,通常只有几秒到十几秒。提示词描述的事件必须在这个时间窗内可以发生,不要写"他花了一整天寻找宝藏"这种跨越漫长时空的描述,而要写"他推开门,环顾四周,走向桌边的地图"。
其次是运动描述。镜头运动(推、拉、摇、移、跟)、主体运动(行走、奔跑、跳跃)、物体运动(水流、烟雾、飘落),都要在提示词里明确。模糊的运动描述会让模型随机选择运动方式,导致片段之间无法衔接。
过渡效果是另一个控制点。无缝循环、溶解、硬切、匹配剪辑等过渡方式,有些可以直接用提示词指定,有些则需要后期在剪辑软件里完成。建议把"能靠提示词解决"和"必须靠后期解决"的过渡分开处理,不要指望一个提示词搞定所有效果。
最后是帧率与节奏。高帧率适合动作场景,低帧率适合氛围营造;快节奏适合短视频平台,慢节奏适合叙事长片。这些参数虽然在部分模型里可以直接设置,但也可以通过提示词中的节奏描述来间接影响,比如"快速剪辑感""缓慢长镜头"。
常见错误与修复清单
根据大量实战反馈,以下是 AI 视频提示词最常见的几个错误,以及对应的修复方法。
错误一:提示词过短。 只有"一个机器人跳舞"这种程度的描述,模型只能给出随机结果。修复方法:按主体、动作、风格、技术参数四层结构补全。
错误二:一次描述太多事件。 "他走进房间,坐下,打开电脑,然后打电话,又站起来"这种长串动作,模型无法准确执行。修复方法:把复杂动作拆成多个片段分别生成。
错误三:风格词堆砌。 "赛博朋克、水墨画、油画、3D、卡通"混在一起,模型只能四不像。修复方法:每次只保留两到三个能兼容的风格词。
错误四:忽视负面提示词。 遇到变形、模糊等问题不加负面词,而是反复重试。修复方法:建立负面词库,把问题词加进去再生成。
错误五:频繁更换模型。 每个模型只试几次就换,永远摸不透任何模型的特性。修复方法:固定主力模型,沉淀针对性的提示词模板。
实用提示词模板
最后,分享几个可以直接上手的基础模板,你可以根据自己的需求调整。
产品展示模板: 主体描述 + 产品核心卖点动作 + 干净背景 + 产品摄影风格 + 镜头运动。适合电商和广告场景。
人物叙事模板: 人物详细外貌 + 单一连贯动作 + 场景环境 + 情绪氛围词 + 电影镜头语言。适合剧情类内容。
场景氛围模板: 环境细节 + 天气与光照 + 时间感(黄昏/夜晚)+ 氛围风格词 + 缓慢镜头。适合空镜和转场素材。
循环动画模板: 主体 + 周期性动作 + 无缝循环关键词 + 固定镜头。适合做背景动态素材。
模板的价值在于提供了一个稳定起点,但真正的好提示词,都是在模板基础上针对具体模型反复调优出来的。把每一次生成都当作一次实验,记录什么有效、什么无效,你的提示词水平会提升得很快。
常见问题
问:提示词越长越好吗? 不一定。提示词过长容易稀释重点,模型可能忽略关键信息。建议控制在合理长度,把最重要的信息放在开头,用负面词处理排除项。
问:中文提示词和英文提示词效果有差别吗? 多数模型对英文的理解更稳定,尤其是风格词和摄影术语。如果模型对中文支持一般,可以先用中文构思,再翻译成英文生成。
问:为什么同一个提示词每次生成结果都不一样? 这是生成模型的固有特性,每次采样都会引入随机性。想要稳定输出,可以固定随机种子(如果模型支持),或者多做几次生成再挑选。
问:角色在连续镜头里总是变样怎么办? 优先使用参考图或图像融合方案固定角色基准,同时检查参考图本身是否一致。参考图越统一,输出越稳定。
AI 视频提示词没有一劳永逸的万能公式,但掌握结构、负面词、权重、模型适配和一致性控制这几块核心能力之后,你已经能够系统性地解决大部分问题。剩下的,就是带着实验心态,在你的主力模型上持续积累自己的提示词库了。


