# 视频生成Prompt指南
一个好的视频生成Prompt需要清晰、具体、结构化的描述，并提供丰富的视觉与动态描述。其核心是将文字想象力转化为算法可理解的视觉脚本。本文将介绍如何撰写高质量的文生视频提示词，助您快速上手视频制作，将您的创意转化为视频。
#### 视频生成模型
MaaS提供多种视频生成大模型，支持文生视频（T2V）、图生视频（I2V/IT2V）、参考生视频（R2V）和首尾帧生视频（H2V/KF2V）等能力。
| **模型系列** |                                                                                                       **核心能力**                                                                                                        |                                                             **特色**                                                              |
|---|---|---|
| 通义万相    | 应用场景：文生视频、图生视频 最大时长：5s 最大分辨率：1080P                                                                                       | 成本低，适合快速创意打样与超短视频。                                                                                                            |
| 生数科技    | 应用场景：文生视频、图生视频、首尾帧生成视频、参考生成视频。 最大时长：16s 最大分辨率：1080P 支持输出无声/有声、单镜头/多镜头视频。    | Turbo版：推理速度快、成本低，适合快速创意打样与社交媒体短视频。 Pro版：画面细节与人物一致性最优，影视级光影与叙事效果，适合广告大片与精品商业成片。 |
| 爱诗科技  | 应用场景：文生视频、图生视频、首尾帧生成视频、参考生成视频。 最大时长：16s 最大分辨率：1080P 支持输出无声/有声、单镜头/多镜头视频。 | 秒级生成，复杂运动与物理模拟表现突出，声画协同能力强。                                                                                                      |
   
视频生成模型的关键能力，请参考[视频生成模型信息](https://support.huaweicloud.com/model-list-maas/model_list_0001.html#section7)。视频生成模型的API调用可参考[视频生成](https://support.huaweicloud.com/model-call-maas/model-call-013.html)。
#### 文本生成视频提示词
提示词作为文本生成视频大模型的主要交互语言，直接决定了模型生成的内容。因此，掌握有效的提示词技巧是视频创作者必备的技能。MaaS提供了文生视频提示词模板（括号中的内容为可选填项），帮助您快速上手。
```
提示词 = 主体（主体描述） + 运动 + 场景（场景描述） + （镜头语言 + 光影+氛围）
```
提示词模板最核心的构成是**主体** 、 **运动** 和**场景**，这是描述一个视频画面最简单、最基本的单元。
当用户希望更详细地描述主体与场景时，可以通过列举多个描述词短句，保持提示词中希望出现要素的完整性。大模型会根据这些表达进行提示词扩写，生成符合预期的视频。
表1文生视频提示词模板说明 
| 提示词内容 | 说明                                                                                                      |
|:---|:---|
| 主体      | 视频中的主要表现对象，是画面主题的重要体现者，例如人、动物、植物或物体等。                                                                     |
| 主体描述  | 对主体外貌细节和肢体姿态等描述，可通过多个短句进行列举，例如运动表现、发型发色、服饰穿搭、五官形态、肢体姿态等。                                                |
| 运动     | 运动包含主体的具体运动和非主体的运动状态，可以是静止、小幅度运动、大幅度运动、局部运动或整体动势。                                                         |
| 场景     | 主体所处的环境，包括前景、背景等。                                                                                        |
| 场景描述    | 对主体所处环境的细节描述，可通过多个短句进行列举，但不宜过多，符合视频内可以展现的画面即可，例如室内场景、室外场景、自然场景等。                                        |
| 镜头语言    | 通过镜头的各种应用以及镜头之间的衔接和切换来传达故事或信息，并创造出特定的视觉效果和情感氛围，例如超大远景拍摄、背景虚化、特写、长焦镜头拍摄、地面拍摄、顶部拍摄、航拍、景深等（注意：这里与运镜控制作区分）。 |
| 光影     | 光影是赋予摄影作品灵魂的关键元素，光影的运用可以使照片更具深度和情感。通过光影可以创造出富有层次感和情感表达力的作品，例如氛围光照、晨光、夕阳、光影、丁达尔效应、灯光等。                  |
| 氛围   | 对预期视频画面的氛围描述，例如热闹的场景、电影级调色、温馨美好等。                                                                       |
   
表2提示词效果示例 
| 提示词                                                                     | 视频效果示例                                                                                                |
|:---|:---|
| 一只猫在咖啡厅里看书。                                                              | ![](https://support.huaweicloud.com/bestpractice-maas/figure/zh-cn_image_0000002694742468.gif "点击放大")  |
| 一只猫戴着黑框眼镜在咖啡厅看书，书本放在桌子上，桌子上还有一杯咖啡，冒着热气，旁边是咖啡厅的窗户。                        | ![](https://support.huaweicloud.com/bestpractice-maas/figure/zh-cn_image_0000002724501909.gif "点击放大")  |
| 镜头中景拍摄，背景虚化，氛围光照，一只猫戴着黑框眼镜在咖啡厅看书，书本放在桌子上，桌子上还有一杯咖啡，冒着热气，旁边是咖啡厅的窗户，电影级调色。 | ![](https://support.huaweicloud.com/bestpractice-maas/figure/zh-cn_image_0000002724381971.gif "点击放大") |
   
**提示词技巧**
- 简洁表达：使用简单词语和句子结构，避免复杂语言。
- 文化元素：使用"东方意境、中国、亚洲"等词语，更容易生成中国风格和中国人的画面。
- 分屏场景：可以使用提示词"4个机位，春夏秋冬"来生成分屏场景。
- 物理运动：现阶段较难生成复杂的物理运动，例如球类的弹跳、高空抛物等。
 
#### 图片生成视频提示词
当用户输入一张图片，大模型可以根据图片理解生成3秒或5秒的视频画面；当用户输入图片和文本提示词，大模型可以根据文本提示词将图片生成一段视频。
图片生成视频是当前创作者使用频率较高的功能，这是因为从视频创作角度来看，图片生成视频更可控，创作成本和门槛也更低。
MaaS当前支持图生视频、参考生视频和首尾帧生视频三种场景。针对这三种场景，MaaS提供提示词模板，助您快速上手。
- [图生视频]
  图像已经确定了主体、场景与风格，因此提示词主要描述动态过程及运镜需求。提示词模板如下：
  ```
  提示词 = 运动 + 运镜
  ```
  提示词模板最核心的构成是**主体**和运镜。与文生视频不同，图生视频已经有了场景，因此只需要描述图片中的主体与希望主体实现的运动，如果涉及多个主体的多个运镜，依次列举即可。大模型会根据用户的表达与对图片画面的理解进行提示词扩写，生成符合预期的视频。
  表3图生视频提示词模板说明 
  | 提示词内容 | 说明                                                                                                                               |
  |:---|:---|
  | 运动     | 目标主体希望实现的运动轨迹。 结合图像中的元素（如人物、动物），描述其动态的过程，如奔跑、打招呼。可以通过形容词来控制动态的程度与速度，如"快速地"、"缓慢地"。 |
  | 运镜   | 若对镜头运动有特定要求，通过提示词如"镜头推进"、"镜头左移"控制。若希望镜头不要发生变化，可以通过"固定镜头"来强调。                                                                   |
     
  表4提示词效果示例 
  | 提示词                        | 视频                                                                                                    |
  |:---|:---|
  | 小猫在散步。                       | ![](https://support.huaweicloud.com/bestpractice-maas/figure/zh-cn_image_0000002724189217.gif "点击放大") |
  | 小猫面向镜头快速奔跑（运动），镜头从左向右平移（运镜）。 | ![](https://support.huaweicloud.com/bestpractice-maas/figure/zh-cn_image_0000002694711892.gif "点击放大")  |
     
  **提示词技巧**
  - 简洁表达：使用简单词语和句子结构，避免复杂语言。
  
  - 描述一致：描述内容应与图片相符，避免引起不必要的镜头切换。
  
  - 物理运动：描述的运动应符合物理规律，尽量用图片中可能发生的运动。
  
  - 
  
  - 简单运动：现阶段较难生成复杂的物理运动，例如球类的弹跳、高空抛物等。
   
- [参考生视频]
  参考生视频是基于参考图像和文本提示词生成视频。例如，以一张或者多张静态图片作为基础，通过模型根据这张图片的内容、风格或结构，生成一段连贯视频。简单来说，就是让一张或者多张"静止的画"动起来，或者基于这张图的创意延伸出新的视频画面。
  参考生视频提示词模板如下：
  基于参考图片在不同场景中保持角色一致性，使用"图n"在提示词中指代参考文件。
  ```
  提示词 = 参考指代 + 动作 + 场景 + 台词（可选） + 背景音乐（可选）
  ```
  表5参考生视频提示词模板说明 
  | 提示词内容 | 说明                                                               |
  |:---|:---|
  | 参考指代  | 使用"图n"在提示词中指代参考文件，n为该文件在该类型中的序号，序号与上传顺序一致。若只有一个参考时，序号可不写，简化为"参考图片"。 |
  | 动作    | 描述参考主体的具体动作与动态过程。                                                 |
  | 场景    | 描述目标视频中的场景环境。                                                      |
  | 台词     | 描述角色说话的内容、情绪、语调与语速。                                                |
  | 背景音乐    | 描述背景音乐的风格与氛围。                                                      |
     
  本文以ViduQ3-Turbo R2V模型为例，展示参考生视频效果。
  表6提示词效果示例 
  | 提示词                                               | 视频                                                                                                   |
  |:---|:---|
  | 参考图片生成一幅，明月高悬，微风习习，树上的梅花花瓣随风而落，女子的长发也随风飘动。         | ![](https://support.huaweicloud.com/bestpractice-maas/figure/zh-cn_image_0000002694763242.gif "点击放大") |
  | 明月高悬，微风习习，树上的梅花花瓣随风而落，图1女子的长发随风飘动。镜头右移，图2的男子缓缓走来。 | ![](https://support.huaweicloud.com/bestpractice-maas/figure/zh-cn_image_0000002724522743.gif "点击放大") |
     
- [首尾帧生视频]
  首尾帧生视频基于首尾帧技术，指定视频的起始画面和结束画面，让AI生成一段连贯的过渡动画。
  首尾帧生成视频的提示词，需要针对首帧图和尾帧图分别描述。并给出首帧图到尾帧图之间的主要运动变化。模板如下：
  ```
  首帧提示词 = 详细描述起始画面，包含主体、环境、动作、风格。
  尾帧提示词 = 详细描述结束画面，突出与首帧的对比和变化。
  通用参数 = 风格（艺术风格、灯光、色调等） + 负面提示（不要出现的元素，如水印等）。
  说明 = 说明主体从首帧图到尾帧图之间的中间过程的动态。
  ```
  表7首尾帧生视频提示词模板说明 
  | 提示词内容 | 说明                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                           |
  |:---|:---|
  | 首帧    | **强描述性、奠定基础**。 - 详细描述场景主体：明确主角（人、物、角色）、其外观、姿态、位置、表情。  - 设定环境与背景：时间（白天/夜晚）、地点（森林/工作室）、氛围（温馨/神秘）。  - 定义初始状态：物体的特写、场景的初始构图。 提示词示例：主体 + 环境 + 动作，以及相应的细节描述。                                                                                                            |
  | 尾帧       | **目标明确、强调变化。** - 清晰描述最终状态：与首帧对应的"变化点"必须清晰、可实现。  - 保持主体一致性：如果主体不变，描述其变化后的状态（如表情、位置、形态）。  - 环境或视角的最终结果：背景的变化、镜头视角（如从特写拉到全景）。   提示词示例：主体\] + 新环境/新状态 + 最终动作或构图。                                                                                                               |
  | 通用参数     | **通用要素（贯穿首尾帧**）。 - 风格统一：艺术风格（如水墨风、皮克斯3D、写实摄影）、色调、电影质量需保持一致。  - 主体连贯：确保首尾帧中描述的核心主体是同一个，避免AI混淆生成不同的物体。  - 过渡逻辑：首尾帧之间的变化必须是物理上或逻辑上可能的（如种子长成大树、表情从哭到笑），避免矛盾。  - 负向提示：（可选但重要）用于排除不需要的内容，如：no distortion, no blur, no extra limbs。   |
  | 说明      | 说明主体从首帧图到尾帧图之间的中间过程的动态。                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                     |
     
  本文以ViduQ3-Turbo KF2V模型为例，展示首尾帧生视频效果。
  表8提示词效果示例 
  | 提示词                                                                                                                                                                                                                                        | 视频                                                                                                    |
  |:---|:---|
  | 首帧：一朵含苞待放的牡丹花沐浴在晨光中，暖色调。 尾帧：同一朵牡丹花，花瓣已经全部绽开，颜色艳丽，在夕阳中格外耀眼，暖色调。 风格：干净商业摄影，高对比度。 说明：生成一朵红色牡丹花盛开的过程。 | ![](https://support.huaweicloud.com/bestpractice-maas/figure/zh-cn_image_0000002724402205.gif "点击放大") |
     
