可灵的强项是运动物理感:流体、布料、肢体动作还原度高,短镜头精准可控,并且支持首尾帧参考。这三条决定了它的提示词应该怎么写。
4 段式公式
[主体] + [动作] + [环境] + [风格/镜头]
实测对比过:同样一段场景,按 4 段式写的提示词可用率明显高于松散描述。但要注意 —— 环境细节不要超过 3-5 个,堆太多要素模型会顾此失彼。
法则一:单镜头单叙事
把一个长故事拆成 5-10 秒的独立单镜头,每个镜头只写 1 个核心动作、1 种运镜,分别生成后再用剪辑串起来 —— 比一次性写长提示词稳定得多。
⚠ 绝对不要在单镜头内写多个连续动作(跑 → 跳 → 转身 → 回头)。结果是动作错乱、快慢放拼接、肢体畸变。
法则二:首尾帧接力法(解决跨镜头连贯性)
- 生成第 1 个镜头后,把最后一帧截图存下来;
- 把它作为下一个镜头的首帧参考图上传;
- 下一个镜头只描述「接下来发生什么」,不要重复描述人物长相。
这样人物、场景、光影能跨镜头一致。武打、舞蹈这类大幅度动作,建议拆成「起势 – 动作 – 收势」三个镜头,用首尾帧锚定串起来。
法则三:给动作写终点
动作描述末尾加一个「落定点」:「猫跳上桌子,然后坐下看向镜头」。不写终点,模型常会用最后 1-2 秒随机乱动。这个技巧在 5 秒片段上效果最好。
法则四:写导演说明,不写关键词清单
❌ 清单式:一个女人,红裙,海边,日落,电影感
✅ 叙事式:一位穿红裙的女人赤脚走在黄昏的海岸线上,浪花拂过脚背,镜头缓慢向前推近
叙事式的可用率明显更高 —— 因为清单没有「运动弧线」,模型只能自己猜。
负向词表(按需取用,别全塞)
no text overlay, no watermark, no distorted hands, no extra fingers,
no blurry edges, no morphing, no cartoonish, no over-saturated colors,
no low resolution, no static frozen pose, no stock photo look
⚠ 负向词写太宽会误伤:写过「no text」之后,场景里本该有的招牌也没了。
两个工程化建议
- 先出 5 秒:短片段质量更稳,挑出好的再延长或拼接。
- 先生成静帧,再图生视频:先用任意生图工具出一张定妆图,再喂给可灵的图生视频模式,人物一致性远超纯文生视频。