15 秒的片子,如果指望「一条提示词直接生成」,大概率是要返工的。把流程拆开,反而更快。下面是一条跑了多次之后沉淀下来的工作流。
第 0 步:先定分镜,再碰提示词
15 秒拆成 3 个 5 秒镜头,或 2 个 8 秒镜头。每个镜头写一句话:这一镜要让观众看到什么。不写这一步,后面所有调整都是瞎调。
第 1 步:出关键帧静图
先用生图把每个镜头的画面定下来(构图、色调、人物形象)。这一步花的时间最少,省下的返工最多 —— 因为形象一旦锁定,后面只改「怎么动」。
第 2 步:图生视频,一镜一动作
镜头 1:产品从画面右下缓慢入画,停稳(Push in 微弱)
镜头 2:人物伸手拿起产品,抬到胸前(Static shot)
镜头 3:产品特写,光扫过高光面(Pedestal up 微弱)
每个镜头只写一个动作、一种运镜。多个动作混在一个 5 秒里,出来一定是快进。
第 3 步:用首尾帧接力保证连贯
镜头 1 的最后一帧导出 → 作为镜头 2 的首帧参考 → 只描述「接下来发生什么」,不重复描述人物长相。这样跨镜头的形象、光线、场景能对上。
第 4 步:挑片,而不是「再生成一次看看」
同一提示词跑 3-4 次,从里面挑一条动作最干净的,而不是一直重跑等奇迹。挑片的标准按优先级排:动作不崩 > 形象稳定 > 构图好看 > 细节锐利。
第 5 步:剪辑与声音
- 镜头之间用「动作接动作」的剪切,比叠化更利落。
- 音乐先铺节奏,再对画面卡点 —— 反过来做会一直改。
- 需要人声对白的,用原生音频生成的模型(如 Veo)单独出几个对白镜头,再剪进去。
第 6 步:输出规格
竖版投放 1080×1920,9:16,24 或 30fps
横版投放 1920×1080,16:9,24fps
封面帧 从成片里挑最稳的一帧,不要另生成
避坑清单(每条都踩过)
- 单镜头塞多个动作 → 动作错乱、快慢放拼接。
- 一次性写超长提示词 → 信息互相干扰;正确做法是分层迭代(Runway 的逐层叠加思路可迁移到所有模型)。
- 关键帧与提示词风格不一致 → 首尾帧的色调、光线、风格必须对齐,否则接缝一眼可见。
- 负向词滥用 → 写太宽会误伤场景里本该有的元素。
- 只用 10 秒以上长片段起步 → 短片段质量更稳,先出 5 秒再延长或拼接。
- 不记录参数 → 出一个好片却复现不了。每次生成把提示词、模型、随机种子记在同一处。