← 返回博客

AI视频提示词工程完全指南:从「抽卡」到「精准控制」

AI视频提示词工程完全指南:从「抽卡」到「精准控制」
快速要点

你有没有算过一笔账——你花了多少时间在"抽卡"上?

立即试试这个流程

你有没有算过一笔账——你花了多少时间在"抽卡"上?

打开AI视频工具,输入一段描述,生成,不满意,改几个词,再生成,还是不满意……循环十几次,最后勉强选了一条凑合用的。如果你在2026年还在这样做AI视频,那你真的在浪费这个时代的工具。

真相是:AI视频生成不是玄学,而是一门可以被系统化掌握的工程学科。 那些你羡慕的"一次就出片"的创作者,不是运气比你好,是他们的提示词写得比你好。今天这篇文章,就是要把这门手艺掰开揉碎了教给你。

一、AI视频提示词的底层逻辑

在学怎么写之前,你必须先理解一个核心概念:AI视频模型不是在"理解"你的文字,而是在"翻译"你的文字。

当你写"一个女孩在雨中奔跑"时,模型干了三件事:

  • 场景解析:识别"女孩""雨""奔跑"三个实体
  • 关系建模:建立"女孩-奔跑"(动作)、"雨-场景"(环境)的关系
  • 视觉映射:将文字描述映射到训练数据中对应的视觉模式

问题是:你的提示词里有没有给这三步提供足够的信息?如果不够,模型就会用它的"默认模板"来填充——而默认模板通常就是最平庸、最AI感的那个版本。

好的提示词 = 约束条件 × 创意空间

这是一个反直觉的公式。很多新手以为提示词越自由越好,但实际上,约束越多,效果越好。因为约束条件降低了模型的"选择空间",让它更容易做出正确的决策。

来看两个提示词的对比:

新手写法

一个女孩在雨中奔跑,电影感

进阶写法

一个25岁左右的亚洲女性,黑色长发湿漉漉地贴在脸颊上,
穿着深蓝色风衣和白色衬衫,在傍晚的东京涉谷十字路口奔跑。
中雨,雨滴清晰可见。暖黄色的路灯灯光透过雨幕形成光晕。
镜头:35mm定焦,从侧面跟拍,低角度仰拍。
色调:冷蓝+暖橙对比,德味电影调色。
人物表情:坚定中带着焦急,嘴角紧闭,眉毛微蹙。

为什么第二个效果好?因为它给模型提供了:

  • 人物细节:年龄、发型、服装、表情(限制角色外观)
  • 环境细节:时间、地点、天气、光线(限制场景氛围)
  • 镜头语言:焦距、机位、角度(限制视觉呈现)
  • 色彩风格:色调、调色风格(限制色彩倾向)

每一层信息都在缩小模型的"猜测空间",最终生成的画面就更接近你脑子里想的那个。

二、提示词的七层结构法

经过大量实践(以及无数次的翻车),我总结了一套适用于几乎所有AI视频模型的提示词结构——七层法

第一层:主体描述(Who/What)

描述画面中的核心主体:人物、物体、动物。包括外观、服装、姿态、表情。

一位穿着白色实验服的中年男性科学家,戴着金丝边眼镜,
头发花白但精神矍铄,双手撑在实验台上。

第二层:动作描述(Action)

主体在做什么?动作的幅度、速度、节奏是怎样的?

他缓慢地抬起头,摘下眼镜,用拇指和食指捏了捏鼻梁,
然后深吸一口气,重新戴上眼镜。动作沉稳、不紧不慢。

第三层:场景环境(Where/When)

时间、地点、空间特征。

深夜的生物实验室,凌晨两点。房间里只有他一个人。
四周是发着蓝光的实验设备和培养皿。
窗外的城市灯光在远处闪烁。

第四层:光线与氛围(Lighting/Mood)

光源方向、光质、色温、整体氛围感。

主光源来自实验台上的蓝色LED培养灯,从下方打在他的脸上,
形成戏剧性的底光,阴影锐利。房间的其余部分处于半黑暗中。
整体氛围:孤独、专注、带着一丝科学狂人的偏执感。

第五层:镜头与构图(Camera/Composition)

镜头焦段、机位、运动方式、构图规则。

镜头:50mm定焦,大光圈f/1.8,浅景深。
机位:正面中近景,与人物视线齐平。
运动:镜头极缓慢地向前推进,模仿呼吸感的手持拍摄。
构图:人物居中偏右,左侧留白给实验设备。

第六层:风格与质感(Style/Texture)

视觉风格、质感、后期处理方向。

风格:参考《银翼杀手2049》的视觉美学。
质感:数字胶片质感,微量的胶片颗粒。
后期方向:青橙色调,高对比度,暗部保留细节。

第七层:技术与参数(Technical)

分辨率、帧率、画幅比例、特殊要求。

输出:4K分辨率,24fps电影帧率,2.35:1宽银幕画幅比。
特殊要求:画面中的发光物体应产生柔和的辉光效果(bloom)。

完整示例(七层合并)

把以上七层合并成一个完整的提示词,就是这个效果:

一位穿着白色实验服的中年男性科学家,戴着金丝边眼镜,头发花白但精神矍铄。

他缓慢地抬起头,摘下眼镜,用拇指和食指捏了捏鼻梁,然后深吸一口气,重新戴上眼镜。

深夜的生物实验室,凌晨两点。四周是发着蓝光的实验设备和培养皿,窗外的城市灯光在远处闪烁。主光源来自实验台上的蓝色LED培养灯,从下方打在他的脸上,形成戏剧性的底光。

镜头:50mm定焦,f/1.8,正面中近景,极缓慢推进,手持呼吸感。

风格参考《银翼杀手2049》,青橙色调,数字胶片质感,4K/24fps/2.35:1宽银幕。

这个提示词大约300字,看起来很长,但它符合"约束条件 × 创意空间"的原则——每一个信息块都在帮模型做正确的决策。用这个提示词在Kling 3上测试,3次以内必出一条可用的素材。

三、不同模型的提示词策略差异

七层法是一个通用框架,但不同的模型对不同类型的描述敏感度不同。你需要根据模型特性做针对性调整:

Kling 3 优化策略:加重动作描述

Kling 3对动作细节极其敏感。你在提示词里写了"转身",它就是一个转身;你写了"缓慢转身,先转动肩膀,再带动腰部,最后移动脚步",它就能生成一个层次分明的转身。

Kling 3黄金法则:动作描述越细,生成越稳。

针对Kling 3的优化提示词片段:

动作:她不是直接转身,而是先微微侧头看向右后方,
然后右肩向后转动45度,带动整个上半身旋转,
左脚作为轴心不动,右脚跟随身体旋转向后迈出一步,
最后完全转过身去。整个过程约3秒。

Veo 3.1 优化策略:强化文字与结构描述

Veo 3.1对结构化信息敏感。如果你需要精确的构图、文字位置或者多元素布局,用分点式描述比自然段落效果更好:

针对Veo 3.1的优化提示词:

画面结构(从上到下):
- 顶部20%:标题"THE FUTURE IS NOW",白色无衬线字体,居中
- 中部60%:主视觉——一位宇航员在火星表面行走,远景
- 底部20%:底部渐变黑色遮罩,无文字

Sora 2 优化策略:多用意象和类比

Sora 2的"艺术直觉"非常强。你不需要告诉它具体怎么做,给它一个美学方向和感觉就行:

针对Sora 2的优化提示词:

这个场景应该让人想起特伦斯·马利克的电影——
光线像蜂蜜一样流淌,每一个镜头都像一幅可以挂在美术馆里的照片。
不是记录现实,而是捕捉现实的诗意。

Seedance 2.0 优化策略:明确风格锚点

Seedance 2.0对风格关键词极其敏感。不要只说"中国风",要精确到具体的风格流派:

针对Seedance 2.0的优化提示词:

风格:北宋院体山水画,参考范宽《溪山行旅图》。
特征:高远构图,雨点皴法,水墨为主、淡赭石渲染。
画面动态:山间的云雾缓慢流动,瀑布倾泻而下,松树枝叶随风微动。

MiniMax 优化策略:简洁直给

MiniMax对复杂描述的消化能力有限,提示词控制在100字以内效果最好。聚焦在"主体+动作+场景"三层,不要加太多修饰:

针对MiniMax的优化提示词:

一个年轻人坐在咖啡店里对着笔记本电脑工作,阳光从窗户照进来。
中景,固定镜头,自然色彩。

四、提示词实战:5个可直接复用的模板

以下模板已经过Kling 3、Veo 3.1和Sora 2的实测验证,你可以直接套用或基于它们修改:

模板1:产品展示类

[产品]放置在[材质/颜色的台面]上,[光照方式]从[方向]打光。
镜头做[运动方式],[速度描述]。
背景为[颜色/场景],虚化处理。
画面比例为[比例],整体风格[风格关键词]。
高光处有[特殊光效描述]。

模板2:人物叙事类

[人物描述:年龄、外貌、服装],正在[动作细节]。
场景为[时间+地点+环境特征]。光线来自[光源描述],形成[光影效果]。
镜头:[焦段]+[机位]+[景别]+[运动方式]。
人物表情:[具体表情描述,细化到眉毛、嘴角]。
色调:[色彩倾向],整体氛围[情绪关键词]。

模板3:风景空镜类

[地点/场景]在[时间/季节/天气]下。
画面从[起始构图]开始,镜头做[运动方式]。
光线[角度+质感],[特殊光影效果]。
色调[风格],[参考作品或摄影师]。

模板4:文字/标题动画类

文字"[具体文字内容]"以[出现方式]呈现在画面[位置]。
文字风格:[字体特征]+[材质质感]+[颜色]。
背景为[场景描述],与文字形成[对比关系]。
动画持续[时长],节奏[快/慢/缓入缓出]。

模板5:创意转场类

场景A:[起始场景描述],[持续时长]后开始过渡。
过渡方式:[具体描述A如何变成B]。
场景B:[结束场景描述]。
过渡期间:[中间状态的视觉特征]。
整体风格:[风格关键词],过渡流畅自然。

五、避坑指南:最常见的5个提示词错误

错误1:抽象形容词太多

❌ "一个美丽的、令人惊叹的、史诗般的日落风景"

✅ "日落时分,橙红色的太阳在地平线上,天空从深紫渐变到金黄。逆光下的棕榈树形成黑色剪影。低角度广角拍摄,前景有波光粼粼的海面。"

为什么错:"美丽""令人惊叹""史诗"这些词对AI来说毫无意义——它在训练数据里见过100万种"美丽"的日落,但它不知道你想要哪一种。

错误2:矛盾的描述

❌ "明亮的夜晚,月光照亮整个房间,同时窗外阳光明媚"

为什么错:别让模型精神分裂。一个场景只能有一种主光源。

错误3:忽略了"不想要什么"

很多模型支持否定提示词(negative prompt),用好它:

否定提示词:文字、字幕、Logo、水印、模糊、变形、额外的手指、不自然的面部表情、过曝、欠曝

Kling 3和Seedance 2.0都支持否定提示词字段,不要浪费。

错误4:提示词太短

2024年的时候,50字的提示词可能够了。但2026年的模型更强了,它能消化300字的详细描述,并且转化得更好。写得越细,翻车越少。

错误5:不迭代提示词

每次生成失败都是一个数据点。不要只是重新点"生成"——分析问题出在哪里,修改提示词。建立一个"提示词→问题→修正"的循环:

第1版:女孩在雨中奔跑 → 人物模糊
第2版:一个亚洲女性在雨中奔跑,中景 → 动作僵硬
第3版:一个25岁亚洲女性,黑发湿贴在脸上,在傍晚雨中奔跑,
       侧面跟拍,35mm镜头 → 效果满意

结语:提示词是你和AI之间的语言

很多人以为AI视频生成的未来是"一句话生成一部电影"——你不需要学任何技巧,AI会自己搞定一切。但我认为这个想法至少在5年内是不现实的。

提示词工程不是你为了用AI而学的"额外技能",而是你作为创作者,借AI之手表达你内心画面的一种语言。你越熟练掌握这门语言,AI就越能忠实地成为你的画笔。

如果你不想从零开始写提示词,Tomato AI (cctocv.com) 提供了智能提示词优化功能——你输入简单的创意描述,平台自动扩展为结构化的专业提示词,同时支持Kling 3、Veo 3.1、Sora 2、Seedance 2.0等多模型一键切换生成。让工具帮你省掉"翻译"的过程,你只需要专注创意本身。


本文由 Tomato AI 内容团队出品。访问 cctocv.com 体验AI视频智能创作。

在 Tomato AI 上免费体验 AI 视频生成

注册即送免费积分,一键使用 Seedance 2.0、Hailuo 2.3 Fast、Tomato Agent 等顶级模型。无水印,1080P 输出。

立即免费体验 →