多镜头最容易崩的地方不是画质,是镜头之间的「同一性」 —— 第 1 个镜头是短发,第 2 个镜头变成卷发;第 1 个镜头是傍晚,第 2 个镜头突然成了正午。
解决办法不是把提示词写得更长,而是把提示词写成带转场的镜头单元。
写法骨架
Scene 1: [场景 + 主体 + 动作],[景别]
Transition: [cut / fade / 跟随动作切换]
Scene 2: [新景别 + 动作承接]
Transition: [缓慢拉开]
Scene 3: [全景收尾]
Visual style: [电影感 / 动画 / 写实]
Motion quality target: [流畅 / 克制 / 有力]
四条硬规则
- 镜头显式编号:写 Scene 1 / Scene 2 / Scene 3,不要用「然后」「接着」这种口语连接词。
- 用承接短语锚定同一性:需要时写「同一个人物」「同一地点」「服装不变」「光线方向保持」。这些短语是给模型的锚点。
- 每个镜头只有一个镜头意图:要么推近,要么横摇,别在同一个 Scene 里写两种运动。
- 转场要写出来:切(cut)、叠化(fade)、跟随动作切(cut on movement)、缓慢拉开(slow pull-back)。不写转场,模型会自己乱接。
完整示例(可直接复制)
Scene 1: 一位年轻厨师在明亮的测试厨房里,站在不锈钢操作台前切香草,中景。
Transition: 在切菜动作上切换。
Scene 2: 同一个厨师给意面装盘,特写,蒸汽可见。
Transition: 缓慢拉开。
Scene 3: 餐桌上成品菜的全景揭示。
Visual style: 电影感商业广告风格,暖色高光。
Motion quality target: 平滑,节奏克制。
为什么这样写有效
长提示词失败的原因是「信息糊成一段」,而不是「不够长」。把提示词切成带明确转场的镜头单元后,模型有了可执行的节拍结构:先演什么、在哪一刀切、切完演什么。这比在提示词里堆形容词有效得多。
配套建议:多镜头依然要控制总时长。3 个镜头放进 10-15 秒是舒服的节奏,放进 5 秒会变成快进。