把「我想拍一支咖啡店广告」变成一段 25 字段的提示词,中间要穿过五层结构、三阶段制作引擎,最后还有一道 FieldGuard 校验。这一页讲清楚每一层的责任主体和产出物,以及 25 个字段各自从哪条链路来。
| 层级 | 责任主体 | 产出物 | 作用 |
|---|---|---|---|
| Layer 0 需求清单确认 | 人工运营 | 确认后的需求清单 | 全链路唯一的人工干预点 |
| Layer 1 剧本引擎 ScriptEngine | 剧本引擎 | ScriptBlueprint | 事实来源,含场景 + 台词 + 角色 |
| 适配层 FormatAdapter | 结构转换器 | 镜头 shot 结构 | 把「场景」改写为「镜头」 |
| Layer 2 · Phase 1 | SceneDesignAgent / OpeningDesignAgent | 【场景】、片头设计 | 定下空间基底与开场方式 |
| Layer 2 · Phase 2 | VisualLanguageAgent / AudioDesignAgent / ContinuityReviewAgent | 【运镜】【动作】【情绪】【音频】、连续性检查报告 | 补齐镜头语言、声音与连续性 |
| Layer 2 · Phase 3 | PromptFusionAgent | 25 字段融合结果 | 把各环节产出合成一份提示词 |
| 导演技能 Hollywood Director Skills | DirectorSkillInjector | 选择性增强后的字段 | 在融合后、校验前强化风格并保留原意 |
| 链路 | 字段数 | 代表字段 | 生成机制 |
|---|---|---|---|
| 硬编码注入 | 4 | constraint、baseline、portraits、consistency | 固定模板或按 character 对象自动注入 |
| LLM 生成 | 14 | director_instruction、lighting、negative 等 | 上下文感知、分段调用,失败有硬编码兜底 |
| 专用 Agent 输出 | 7 | scene、camera_movement、audio、dialogue 等 | Agent 直接产出,character / dialogue 零失真 |