引言:为什么提示词决定 AI 视频的成败
同样一个模型,有人生成的是模糊、跳变、毫无电影感的片段,有人却能稳定产出画面精致、叙事连贯的成片。差别往往不在工具,而在提示词。AI 视频生成的本质,是把你的语言描述翻译成画面与运动。提示词写得越清晰、越结构化,模型的理解就越准确,结果就越可预测。
过去几年,AI 视频生成市场经历了爆炸式增长,提示词工程也从"玄学"变成了可以系统学习的方法论。这篇文章会从结构化设计原则讲起,覆盖核心要素拆解、负面提示词、场景一致性、角色锚定、镜头语言,再到完整的实战案例。读完你就能把"我想要一个好看的视频"变成一套可复现、可迭代的提示词工作流。
结构化 Prompt 设计原则
好的提示词不是一句话,而是一份结构清晰的"拍摄简报"。把模糊概念拆成可量化的指令,是提示词工程的第一步。一个通用的结构模板是:
[主体] + [动作] + [环境] + [风格/媒介] + [镜头与光线] + [负面提示词]
每一部分都承担明确职责:主体告诉模型"拍谁",动作告诉模型"在做什么",环境确定空间与氛围,风格决定美学方向,镜头与光线模拟真实摄影,负面提示词排除常见瑕疵。按这个模板写,提示词就有了跨模型的兼容性——换一个生成模型,稍微调整措辞就能继续用。
核心要素拆解:主体、动作、环境与风格
主体:越具体越好
描述主体时,要使用高细节度的词汇。比如"一位身着蒸汽朋克风格皮甲的女性探险家,面部特征清晰,目光坚定"就比"一个女孩"有效得多。可以补充年龄、发型、服饰材质、肤色、表情等维度。对于需要跨镜头出现的角色,还要加上稳定的身份锚点,例如"棕色短发、左脸有颗小痣、穿着深蓝色工装夹克"。
动作:避免模糊动词
"走路""看"这类词太模糊,模型会给出平庸的演绎。改成"疾步穿越潮湿的巷道,侧身躲避落下的水滴"这种具体、有动感的描述,画面立刻生动起来。动作描述还要考虑物理合理性:手放上桌面的过程、风吹起衣角的幅度,都可以写进提示词。
环境:建立空间感
环境描述决定场景的可信度。不要只说"一个房间",要说"一间堆满旧书与黄铜仪器的阁楼书房,午后斜阳透过天窗洒在木地板上,空气中漂浮着尘埃"。空间感越强,模型越容易生成有层次的画面。
风格:一句话锁定美学
风格描述要放在固定位置,形成"风格头"。例如"电影感,35mm 镜头,浅景深,暖色调,胶片颗粒"。整组镜头都使用同一句风格头,是保持系列一致性的最简单方法。
负面提示词的精细化应用
在 AI 生成领域,"不要什么"和"要什么"同样重要。负面提示词用于去除瑕疵和强制风格隔离,尤其是多帧生成时容易出现的伪影、角色面部微小差异、画面闪烁等问题。一个稳健的负面提示词列表包括:
低分辨率, 模糊, 畸形的手指, 水印, 风格冲突, 颜色失真, 闪烁, 噪点, 多余肢体, 文字乱码
负面提示词不是越多越好,而是越对症越好。每类模型有自己的弱点:有的容易过度平滑,有的容易颜色过饱和,有的动作幅度失控。建议在项目开始时先跑一组小样,把该模型最常见的失败模式写进负面提示词。
场景一致性与模型选择
AI 视频创作经常需要在多个镜头间保持同一场景。此时不能只靠提示词,还要配合技术手段:
- 参考图锚定:把场景的关键参考图(街道、房间、道具)传给模型,要求它保持空间与光线一致。
- 关键帧控制:设置首帧和尾帧,让模型在既定范围内补全运动,避免场景漂移。
- 模型分工:高保真写实场景优先选择细节渲染强的模型,动画或特定艺术风格则选择对应擅长的模型。不要用一个模型硬扛所有任务。
角色一致性:多图融合与关键帧锚定
角色一致性是 AI 视频最头疼的问题,也是专业与业余的分水岭。一个角色在镜头一和镜头十二里长得不一样,故事就垮了。推荐两种技术组合使用:
- 多图像融合:提供角色多个角度的照片,让模型融合出稳定的身份特征,包括脸型、发型、肤色、标志性服装。
- Prompt 锚定:在每一个镜头的提示词里重复同样的身份描述与风格头,形成文本层面的锚。
实际操作中,先建"角色卡":把角色的全部关键描述写成一段标准文本,每次生成直接复制。这样既快又不容易遗漏。
镜头语言:像摄影师一样写提示词
专业感的一大来源是镜头语言。把摄影术语写进提示词,模型就能模拟真实拍摄:
- 景别:特写、中景、全景、大远景。
- 运镜:推近、拉远、横移、升降、手持晃动、固定机位。
- 镜头与光圈:50mm、24mm 广角、长焦压缩、浅景深。
- 光线:黄金时刻、硬光、柔光箱主光、霓虹灯氛围光。
例如,"镜头缓慢推近,特写,浅景深,人物身后霓虹灯虚化成光斑"就比"拍一张脸"专业得多。学会用镜头语言描述画面,是提示词工程里回报最高的一项技能。
实战案例:从提示词到成片
用一个完整案例串起全部技巧。目标:为一家咖啡品牌生成 15 秒产品视频,风格是"温暖、自然、高端"。
第 1 步:写主体与场景。
"一杯手冲咖啡放在橡木桌上,咖啡液缓慢滴落,蒸汽缓缓升腾,背景是明亮的落地窗,窗外绿植虚化。"
第 2 步:加动作与镜头。
"镜头从侧面缓缓横移,靠近咖啡杯,蒸汽在逆光中清晰可见,浅景深,前景轻微虚化。"
第 3 步:加风格头。
"电影感,35mm,暖色调,自然光,胶片颗粒,高端产品摄影质感。"
第 4 步:加负面提示词。
"低分辨率, 颜色失真, 闪烁, 畸形的液体, 文字乱码, 过曝。"
第 5 步:迭代。
第一版生成后检查:咖啡液滴是否自然?蒸汽是否闪烁?背景是否稳定?针对问题只改一个变量:要么改动作描述,要么改光线,要么改模型参数。两三轮后通常就能得到满意结果。
第 6 步:成片处理。
把生成的素材放进剪辑软件,加音乐、音效与字幕,完成最终导出。
常见错误与排查
- 提示词太笼统:画面平庸。解决:拆解要素,逐项细化。
- 角色变形:跨镜头不一致。解决:角色卡 + 多图融合 + 风格头。
- 画面闪烁:多帧不稳定。解决:简化运动、降低动作幅度、启用关键帧控制。
- 风格漂移:整组镜头风格不统一。解决:每个 Prompt 都带上同一句风格头。
- 过度依赖一个模型:某些场景效果差。解决:建立模型分工,按任务选型。
进阶:风格迁移与视频到视频
当你掌握基础后,可以探索视频到视频模式:把已有视频重新渲染成另一种风格。这特别适合:
- 实拍素材转动画,
- 同一素材适配不同平台的视觉风格,
- 快速测试多种调色方向。
视频到视频的提示词重点不在"画面里有什么",而在"画面应该变成什么感觉"。风格头的权重变得更高,主体描述可以适当简化。
AI 视频创作的伦理与规范
提示词技巧之外,成熟的创作者还要面对伦理与规范问题。以下几点值得认真对待:
- 标识要求:越来越多的平台要求标注 AI 生成内容。如实标注不是束缚,而是建立长期信任的基础,尤其当你面向商业客户或公众传播时。
- 肖像与授权:生成接近真实人物的画面需要谨慎,涉及真实人物、公众人物或受保护品牌时,应确认是否具备使用与传播的授权。
- 信息来源:用 AI 视频传达信息时,要确保内容不误导观众,尤其是新闻、科普、产品演示等对真实性要求高的场景。
- 版权边界:虽然提示词本身通常不被视为作品,但使用他人图片作为参考或训练素材时,要遵守平台条款与著作权法。
把规范当作工作流的一部分,而不是事后补救。一个明确标注、内容可信的作品,比一个来源模糊、随时可能引发争议的作品更有长期价值。
FAQ
提示词用什么语言写效果最好?
多数模型对英文理解最稳定,中文提示词也能用,但建议关键风格词保留英文术语。用你熟悉的语言组织逻辑,再用模型处理细节。
新手应该先学什么?
先学会结构模板和负面提示词,这两个性价比最高。然后再练角色一致性与镜头语言。
为什么同样的提示词每次结果不一样?
生成模型有随机性。这是特性不是缺陷:多生成几个变体再挑选,是标准做法。
提示词越长越好吗?
不是。关键是信息密度和结构清晰。啰嗦的提示词会稀释重点,建议控制在 50–150 词,重点信息前置。
如何快速提高提示词水平?
建立自己的"提示词库",把每次成功的 Prompt 按场景分类保存。迭代速度比天赋更重要。
结语
从提示词到成品,中间隔着的不是运气,而是方法论。结构化设计、负面提示词、角色锚定、镜头语言,这些技巧组合起来,就能把 AI 视频生成从碰运气变成可复现的生产流程。
模型会不断进化,但提示词工程的核心逻辑不会变:想清楚你要什么,然后用最清晰的语言告诉模型。现在就从一个小项目开始,拆解要素、写结构模板、跑第一版、迭代三轮。你会发现,高质量成片离你并不远。



