← 返回博客

AI视频提示词的玄学与科学:从碰运气到系统化提升生成质量

AI视频提示词的玄学与科学:从碰运气到系统化提升生成质量
快速重點

AI 视频模型不是"理解"你的提示词——它是在做概率映射。

立即試用這個流程

你写了一条提示词:"一只猫在窗台上晒太阳"。AI 给你生成了一个猫形的马赛克坐在一个不知道是什么的东西上。你改了 5 次,每次结果都不一样,但没有一次是"好用"的。你开始怀疑:AI 视频是不是看运气?为什么别人能用同样的模型做出电影级画面,而你连"猫"都叫不出来?别急。不是你运气差——是你还没掌握 AI 视频提示词的底层逻辑。


一、先理解 AI 是怎么"读"你的提示词的

AI 视频模型不是"理解"你的提示词——它是在做概率映射

当你写"一只猫在窗台上晒太阳"时,AI 做的是:

  • 把"猫""窗台""太阳"映射到训练数据中对应的视觉特征
  • 把"在...上""晒太阳"映射到空间关系和光照模式
  • 在潜空间中组合这些特征,生成一个满足所有条件的画面序列

关键洞察:AI 对每一类词汇的"理解精度"不同。

词汇类型AI 理解精度示例
物体名词★★★★★ 最高猫、车、桌子、杯子
颜色/材质★★★★☆ 高红色、金属、玻璃、毛绒
光线条件★★★★☆ 高阳光、逆光、霓虹灯、柔光
空间关系★★★☆☆ 中在...上面、旁边、穿过
动作描述★★★☆☆ 中走、跑、转头、落下
情绪/氛围★★☆☆☆ 低悲伤的、宁静的、紧张的
抽象概念★☆☆☆☆ 最低自由的、未来的、爱的

这意味着:你应该把提示词的"语义重心"放在 AI 最擅长理解的高精度词汇上,用低精度词汇做辅助修饰,而不是反过来。


二、提示词的黄金结构:五层洋葱模型

把提示词想象成一颗洋葱,从里到外五层。每层解决一个问题,层层叠加。

[第一层:主体] → 画面里有什么?(名词)
[第二层:动作] → 主体在做什么?(动词)
[第三层:环境] → 在哪里?什么光?什么色调?
[第四层:镜头] → 怎么拍的?什么景别?怎么运动?
[第五层:风格] → 什么质感?什么风格?什么画幅?

完整示例:
[一只橘猫] [在窗台上伸懒腰,尾巴缓缓摆动] 
[午后阳光从左侧窗户斜射入室,木质地板上投射出温暖的光斑] 
[中景镜头,缓慢推近至猫咪面部] 
[电影感色调,浅景深,胶片颗粒感,8mm复古风格,1080P]

每一层的写作原则

第一层——主体(必须精确):

  • ✅ "一只橘色短毛猫" > "一只猫"
  • ✅ "一位穿着白色衬衫的年轻亚洲女性" > "一个人"
  • ❌ 避免模糊指代:"某个人""一些东西"

第二层——动作(必须简单):

  • ✅ 单一动作:"缓缓转头" > "转头、伸懒腰、舔爪子、跳下来"
  • 黄金法则:一个提示词只描述一个核心动作。 多个动作让 AI 分心,结果每个动作都做不好
  • 速度修饰词极重要:"缓缓""快速""慢动作"——不写速度,AI 默认中等速度

第三层——环境(场景+光线+色调):

光线模板(选一种):
- 自然光:"午后金色阳光""阴天柔和的散射光""清晨冷调蓝光"
- 人造光:"暖色台灯从45度角照入""霓虹灯光从下方投射"
- 特殊光:"逆光形成剪影""侧光突出纹理""顶光营造压抑感"

色调模板(选一种):
- "电影感色调"(高对比,暖暗部)
- "日系清新色调"(低饱和,偏蓝绿)
- "赛博朋克色调"(蓝紫+洋红,高饱和)
- "胶片暖调"(偏黄,柔和高光)

第四层——镜头(景别+运动):

景别速查:
- 特写(Extreme Close-up)→ 面部、产品细节
- 中景(Medium Shot)→ 人物半身,日常对话
- 全景(Wide Shot)→ 场景全貌,环境叙事
- 跟拍(Tracking Shot)→ 跟随主体移动
- 俯拍(Overhead)→ 从上方拍摄,上帝视角

镜头运动速查:
- 静态 → "固定镜头"
- 推近 → "缓慢推近"(Slow Push-in)
- 拉远 → "缓缓拉远"(Slow Pull-out)
- 平移 → "水平横移"(Pan)
- 环绕 → "围绕主体旋转"(Orbit)

第五层——风格(质感+格式):

风格参数(叠加使用):
- 质感:"4K""电影级""胶片颗粒感"
- 风格:"写实""动漫风格""水彩风格"
- 特殊:"浅景深""微距""延时摄影"
- 格式:"1080P""9:16竖屏""16:9宽屏"

三、不同模型的提示词偏好

同样的提示词,不同模型的效果差异很大。因为它们的训练数据和架构偏好不同:

Kling 3:中文原生,重"词频"

Kling 3 对中文的理解是五个模型中最好的。它偏好高频中文词汇明确的构图指令

Kling 3 偏好风格:
一只橘猫趴在窗台上,阳光下眯着眼睛打盹,
画面温馨宁静,毛发被阳光照得发亮,
镜头慢慢推近到猫的脸部特写,可以看到胡须的细节,
暖色调,1080P

关键:多用中文高频词,"温馨""宁静"这类氛围词Kling理解很好

Veo 3.1:画质天花板,重"物理准确"

Veo 3.1 在物理真实感上碾压其他模型,但提示词需要更"技术化"的描述。

Veo 3.1 偏好风格:
An orange tabby cat sleeping on a wooden windowsill,
golden hour sunlight streaming through the window from left side,
dust particles floating in the light beam visible,
the cat's fur has visible individual strands with subsurface scattering where light hits the edges,
slow camera push-in, shallow depth of field, f/2.8 aperture,
cinematic color grading, photorealistic, 1080P

关键:描述物理现象(灰尘粒子、次表面散射、光圈值),Veo理解这些技术参数

Seedance 2.0:多模态王者,重"参考锚定"

Seedance 2.0 的核心优势是 <图片N> 语法和多模态参考,提示词应该利用参考图减轻描述负担

Seedance 2.0 偏好风格:
<图片1>中的猫在<图片2>的窗台上缓慢伸懒腰,
光线从<图片2>的窗户方向射入,
猫的动作自然,毛发的纹理与<图片1>保持一致,
中景,浅景深,1080P

关键:描述已经通过图片传递的信息不需要在文字中重复,
文字专注于"运动"和"变化"

Sora 2:物理引擎,重"运动连续性"

Sora 2 的物理真实感来自其内置的物理模拟能力。提示词应注重运动过程描述

Sora 2 偏好风格:
A cat walking along a windowsill, each paw placed deliberately,
the cat turns its head slowly to look out the window,
its tail swishes once then settles, ears rotate forward,
maintaining continuous motion throughout the 10-second shot,
natural window light, photorealistic, 1080P

关键:描述连续的运动过程,Sora擅长维持长时间的运动自然性

MiniMax:速度优先,重"简洁"

MiniMax 擅长快速出片,但提示词必须极其简洁——太长反而出问题。

MiniMax 偏好风格:
橘猫在窗台上晒太阳,打盹,暖光,浅景深,1080P

关键:越短越好,核心元素传达到位即可

四、从"碰运气"到"可复现":建立你的提示词调优系统

第一步:建立"版本记录"习惯

每次生成都记录:提示词版本 + 模型 + 结果评估。

| 版本 | 提示词关键差异 | 模型 | 评分 | 问题 |
|------|-------------|------|------|------|
| v1 | "一只猫" | Kling 3 | 2/5 | 猫品种不可控 |
| v2 | "一只橘色短毛猫" | Kling 3 | 3/5 | 动作僵硬 |
| v3 | v2 + "缓缓转头" | Kling 3 | 4/5 | 背景杂乱 |
| v4 | v3 + "纯白背景" | Kling 3 | 5/5 | ✅ |

第二步:识别你的"失败模式"

每次失败归类到一种"失败模式",下次避免:

失败模式症状根因解法
主体模糊不知道画面里是什么主体描述不够具体增加物体细节(品种、材质、颜色、形状)
动作鬼畜动作抽搐、不自然动作描述太复杂简化为单一动作 + 速度修饰词
画面脏乱背景元素混乱缺少环境约束明确背景和空间关系
人物变脸同一个人在不同镜头中长相不同缺少角色锚定用 Seedance 2.0 <图片N> 保持一致性
画质劣化视频过程中画质下降运动幅度过大降低运动速度,减少镜头运动
色彩漂移视频色调逐渐偏离光线描述不稳定在首尾帧都明确光线条件

第三步:建立提示词组件库

把验证过的"好用的词组"存下来,下次直接调用:

# 光线库
"golden hour backlight" → 黄金时刻逆光,适合温馨感
"soft diffused window light" → 柔和窗光,适合人物/产品
"neon street lighting with rain reflection" → 霓虹街灯+雨水反光,赛博朋克

# 运动库
"slow gentle pan left to right" → 缓慢左至右平移,安全运动
"subtle breathing movement only" → 仅呼吸感微动,最安全的产品展示运动
"smooth 15-degree per second rotation" → 15°/秒旋转,产品展示标准速度

# 色调库
"Kodak Portra 400 color palette" → 柯达 Portra 400 色调,复古暖调
"Wes Anderson symmetrical pastel" → 韦斯·安德森式对称粉彩色调
"Blade Runner teal and orange" → 银翼杀手蓝橙对比色

五、不同场景的提示词速查模板

场景一:产品展示

[产品名称/描述] 在 [纯色/简单背景] 上 [缓慢旋转/平移],
[关键材质] 的 [光泽/纹理] 在 [光线] 下清晰可见,
镜头 [运动方式],[景别],[色调],1080P

场景二:人物叙事

一位 [年龄] [性别],[外貌特征],[着装],
在 [场景] 中 [单一动作],[情绪/表情],
[光线条件],[氛围描述],
[景别],[色调],1080P

场景三:风景/空镜

[地点/场景] 的 [时间/天气],
[主要视觉元素] 在画面中 [位置/运动],
[光线特色],[氛围],
[景别 通常全景],[色调],[特殊效果如延时摄影],1080P

场景四:抽象/艺术

[核心视觉隐喻] 表达 [抽象概念],
[颜色] 和 [形状] 的 [变化方式],
[风格参照],[质感],
[比例],1080P

六、终极心法:好提示词是"减法"不是"加法"

新手常犯的错误:觉得提示词写得越长越好,把能想到的词全堆进去。

真相:每增加一个不精确的描述词,就是给 AI 的语义空间增加一个维度的噪声。

❌ 堆砌式(147字):
一只可爱的橘色短毛猫,很萌很治愈,在一个温暖舒适的木质窗台上,
阳光洒下来,猫看起来很享受,懒洋洋地伸着懒腰,
旁边还有一盆绿植,窗外是蓝天白云,还有一些小鸟飞过,
画面很唯美很温馨,电影质感,希望有那种日系的清新感觉,
最好浅景深虚化背景,1080P

✅ 精炼式(78字):
一只橘色短毛猫在木质窗台上缓缓伸懒腰,尾巴微微卷起,
午后阳光从左侧窗户斜射,光斑落在猫的背部和窗台上,
镜头缓慢推近至猫的面部,浅景深,背景干净,
暖色调电影感,1080P

两者的差距不在文采——在"信息密度"。 精炼版每 7-8 个字就有一个精确的有效信息;堆砌版每 20 个字才有一个模糊信息,中间全是噪声。

记住这个公式:

生成质量 = 提示词信息密度 × 模型匹配度 / 语义噪声


总结

AI 视频提示词不是玄学,是一门可以被拆解、被优化、被复用的工程学。

五层洋葱(主体→动作→环境→镜头→风格)、四个模型偏好(Kling 中文、Veo 技术、Seedance 多模态、MiniMax 简洁)、三种失败模式识别——把这些框架用起来,你的"出片可用率"能从 20% 提升到 60% 以上。

最终心法就八个字:宁精勿滥,宁少勿多。

打开 Tomato AI,用上面的模板重写一条你之前"跑废了"的提示词。你会发现,同样一个画面在你的脑子里,差的不是想象力——是"翻译成 AI 能听懂的语言"的能力。而这个能力,从现在开始,已经被拆解成了可学习的模块。

在 Tomato AI 上免費體驗 AI 視頻生成

註冊即送免費積分,一鍵使用 Seedance 2.0、Hailuo 2.3 Fast、Tomato Agent 等頂級模型。無水印,1080P 輸出。

立即免費體驗 →