VidVid 的提示词由 25 个独立字段构成,覆盖导演意图、空间、镜头、人物、声音与约束六大维度。按规范填写,即可稳定产出风格统一、可用率高的视频,而不再依赖运气。
AI 视频模型对提示词中不同维度的敏感度不同。把信息拆成独立字段,比写一段长文本更容易被模型准确遵循。
画面内容可预期、风格表现可统一、质量标准可衡量。每个字段都有明确的优先级、格式与检查项。
跨镜头角色面部、服装、色调不漂移。靠「定妆照 + 角色一致性 + 角色约束」三重机制保障。
按 P0→P3 顺序填写,时间紧时至少保障 P0 完整,即可输出技术上可用的片段。
25 个字段按「从基础到修饰、从空间到时间、从画面到声音」组织为六层,遵循「逐层叠加」原则。
| 层级 | 功能定位 | 字段数 | 核心职责 |
|---|---|---|---|
| 创作意图层 | 风格统摄 | 1 | 确立整体视觉风格,作为所有字段的决策基准 |
| 画面基底 | 基础参数 | 2 | 画幅、分辨率、画质等级等底层技术参数与全局约束 |
| 空间层 | 环境搭建 | 2 | 构建物理空间与光影体系,形成画面的三维载体 |
| 镜头语言层 | 画面组织 | 4 | 通过运镜、构图、色彩、景深组织视觉叙事 |
| 人物层 | 角色刻画 | 4 | 定义角色的外在形象与动态表现 |
| 物件层 | 道具配置 | 1 | 布置场景中的关键物品与手持道具 |
| 质量/调度/渲染/过渡/音频/叙事层 | 多维修饰 | 11 | 跨层保障画面质量、情绪、时间调度、衔接、声音与台词 |
字符超限时按此顺序截断——P0 不可裁剪,P1 优先保留,P2 可压缩,P3 首裁。
| 优先级 | 级别 | 字段数 | 缺失后果 |
|---|---|---|---|
| P0 | 致命级 | 12 | 视频不可用或出现严重错误 |
| P1 | 核心级 | 7 | 视频可用但质量显著降低 |
| P2 | 增强级 | 4 | 质量达标但专业感不足 |
| P3 | 可选级 | 2 | 不影响主体表达 |