告别抽卡式生成:7步掌握多模态视频AI提示词工程
AI视频生成工具最实用的状态,是你写的提示词(Prompt)不再像是一堆华丽形容词的盲目堆砌,而是一份紧凑且精准的“拍摄脚本”。我们的目标不是塞满视觉词汇,而是明确告诉AI:什么必须保持不变、什么需要动、镜头怎么运镜、观众能听到什么。
提米哥最近在测试 MiniMax H3 AI Video Studio,它支持在同一个工作流中同时使用文本、图像、视频和音频作为参考。这套“脚本化”的提示词规划方法,不仅能让生成效果精准可控,也同样完美适用于其他支持参考素材的视频生成系统。
1. 用一句话明确核心意图
在写长篇大论之前,先用一句话概括这个镜头的核心任务:
在一个连续的商业广告镜头中,展示一台便携式榨汁机的使用过程,最后画面定格在榨好的果汁上。
这给AI分配了一个明确的单一任务。如果你的一句话里包含了三个场景、几次时间跳跃或毫无关联的动作,请把它们拆分成多个独立的片段。
检验标准:一个真实的摄像团队能看懂这个镜头要证明什么吗?如果是产品视频,答案可能是“证明盖子锁得很紧”;如果是人物视频,可能是“角色认出某人并放松下来”。
2. 区分“死规定”与“活要求”
当你使用参考图或参考视频时,明确告诉AI哪些细节“绝对不能变”,效果会好得多。
死规定(必须保持不变的元素) 包括:
– 人物的脸部、发型、服装或身材比例
– 产品的几何形状、Logo位置、按钮布局
– 房间的布局和光照方向
– 界面上的具体文字及其位置
– 每个说话人的身份特征
活要求(需要变化的动作) 包括:
– 镜头从俯拍平滑过渡到平视
– 角色转身面向窗户
– 界面卡片重新排列
– 液体从分离的食材变成顺滑的果汁
这种明确的区分,比你在提示词里反复强调“保持一致性”要精准得多。
3. 给参考素材分配明确的“角色”
参考图或视频不能只是模糊地用来“找找感觉”。你必须明确告诉AI:抄什么,换什么。
对于图像参考:
# 图像参考提示词示例
# 告诉AI保留原图的哪些特征,并替换哪些背景
Preserve the character's face, hairstyle, jacket, and color palette from the image. Change the environment to a sunlit train carriage.
# 中文释义:保留图像中角色的面部、发型、夹克和调色板。将环境更改为阳光充足的火车车厢。
对于动作/视频参考:
# 视频动作参考提示词示例
# 明确只借用参考视频的动作节奏,替换主体
Use the reference video only for body timing, footwork, and camera rhythm. Replace the performer with the supplied robot character and preserve the robot's exact proportions and surface materials.
# 中文释义:仅使用参考视频中的身体节奏、步法和镜头节奏。将表演者替换为提供的机器人角色,并保留机器人的精确比例和表面材质。
对于音频参考:
# 音频参考提示词示例
# 保留音频的情绪和节奏,但重新生成具体内容
Keep the pacing and emotional rise of the reference audio, but generate new dialogue and new environmental sound for the scene.
# 中文释义:保持参考音频的节奏和情绪起伏,但为该场景生成新的对话和新的环境音。
这样做可以防止AI把不需要的背景、奇怪的镜头角度或错误的主体身份一起“抄”进去。
4. 描述一条清晰的运镜路径
提示词翻车的一个常见原因,是在短短几秒内塞入了无人机航拍、微距镜头、手持追逐、环绕和特写。请只选择一条主要的运镜路径。
容易让AI理解的运镜语言示例:
– 从中景缓慢推进到特写 (slow push from medium shot to close-up)
– 在视线高度顺时针环绕 (clockwise orbit at eye level)
– 固定三脚架镜头,主体从左向右穿过 (locked tripod frame with the subject crossing left to right)
– 从俯拍开始,平滑降低到桌面高度 (overhead opening that lowers smoothly to countertop height)
– 穿过前景蒸汽的轻微横向平移 (gentle lateral move past foreground steam)
然后再补充构图和速度。“缓慢推进,最后定格在紧凑的特写”比一句干瘪的“电影感运镜”要有用得多。
5. 把音频当成时间线来设计
一句“添加逼真的声音”是远远不够的。你需要列出声音图层,并将重要的音效与画面动作绑定。
一个实用的音频计划包含三个图层:
– 前景音:对话、按钮点击声、脚步声或引擎启动声。
– 环境音:雨声、房间底噪、交通声、风声或厨房的白噪音。
– 可选音乐:流派、能量感,以及是否需要垫在对话下面。
对于立体声空间分布,简单的方位描述就足够了:
# 音频空间分布提示词示例
# 明确各种声音在立体声场中的位置和触发时机
Dialogue remains centered. Rain is wide at the sides. Kitchen activity sits softly behind the speakers. The lid click and motor start align exactly with the visible actions.
# 中文释义:对话保持在正中间。雨声在两侧宽广分布。厨房的活动音柔和地留在扬声器后方。盖子咔哒声和电机启动声与可见动作完全对齐。
如果不需要音乐,直接说明。去掉一个多余的图层,反而能让短片显得更专业、更克制。
6. 把限制条件放在最后
把限制条件集中放在一起,最方便检查和修改:
# 限制条件提示词示例
# 集中列出绝对不能出现的错误和必须遵守的规则
Keep the logo centered and correctly spelled. Preserve the appliance shape and button layout. One continuous shot. No extra hands. No background music. 12 seconds.
# 中文释义:保持Logo居中且拼写正确。保留电器形状和按钮布局。一镜到底。不要出现多余的手。不要背景音乐。时长12秒。
不要搞一个庞大的“反向提示词(Negative Prompt)”词库。只需专注于那些会让镜头直接报废的少数几个致命错误。
7. 完整的产品演示案例
把上面的结构组合成一个完整的提示词:
# 完整的多模态视频提示词实战案例
# 包含了动作、运镜、死规定、视觉处理、音频和限制条件
A pair of hands demonstrates a compact travel blender on a bright kitchen counter. Show three clear actions in one continuous shot: add fruit, lock the lid, then start blending. The camera begins overhead and smoothly lowers to eye level for the blending moment, ending on the finished drink. Preserve the appliance shape, button layout, material colors, and exact brand text from the reference image. Natural daylight, crisp commercial color, controlled reflections, and realistic liquid physics. Stereo audio: fruit pieces dropping into the cup, a precise lid click, the motor ramping up, and a final glass placement. Keep the logo legible. No extra hands, no cuts, no music, 15 seconds.
# 中文释义:一双手在明亮的厨房台面上演示一台便携式榨汁机。在一个连续镜头中展示三个清晰的动作:放入水果、锁上盖子、然后开始榨汁。镜头从俯拍开始,在榨汁时平滑降低到平视高度,最后定格在成品饮料上。保留参考图像中的电器形状、按钮布局、材质颜色和精确的品牌文字。自然日光,清晰的商业色彩,可控的反光,以及逼真的液体物理效果。立体声音频:水果块落入杯中、清脆的盖子咔哒声、电机加速声,以及最后的玻璃杯放置声。保持Logo清晰可读。没有多余的手,没有剪辑,没有音乐,15秒。
注意看,这里的每一句话都有明确的工作:动作、运镜、死规定、视觉风格、音频和限制条件。
8. 每次迭代只改一个图层
当生成的结果已经“差不多”时,千万不要推翻重写。每次只调整一个变量:
– 如果人物长相变了(身份漂移),加强“死规定”列表。
– 如果场景看起来很乱,减少动作的数量。
– 如果镜头晃动不稳定,把多个运镜动作替换为一条简单的路径。
– 如果声音听起来很假,增加动作触发时机和空间方位的描述。
– 如果产品上的文字变了,指定精确的拼写和屏幕位置。
– 如果参考图的影响太大(喧宾夺主),缩小它的参考范围。
这样,你的每一次重新生成都是在验证一个具体的假设,而不是在盲目地“抽卡”。
最终检查清单
在点击生成之前,检查你的提示词是否回答了以下问题:
– 这个镜头的唯一目的是什么?
– 哪些细节必须保持不变?
– 每个参考素材需要被“抄”走什么?
– 主要的运镜路径是什么?
– 开始和结束的动作是什么?
– 哪些声音与画面动作同步发生?
– 哪两三个限制条件决定了这个视频的成败?
一个优秀的多模态提示词不一定要写得很长,但一定要有条理。一旦制作意图、参考素材、动作、运镜、音频和限制条件都有了清晰的角色定位,你的迭代速度会大幅提升,排查问题也会变得异常简单。
