导语
直接用一段 200 字的提示词让 Sora 2 或可灵生成 60 秒电影感短片,在 2026 年仍然不现实。专业团队的通行做法是”分两步走”:先用 Midjourney 或 Stable Diffusion 把每一帧关键画面画好,再把关键帧送入 Runway Gen-3、可灵 2.0 或 Sora 2 做”图生视频”插帧。这种”关键帧预生成 + 视频接力”的工作流,能把可控性、风格统一性和角色一致性提升一个量级。
一、为什么必须先做关键帧
1.1 文字生视频的天然瓶颈
文生视频模型在”动作—风格—角色”三个维度同时控制时容易失控。OpenAI 的 Sora 2 Prompting Guide 明确指出”长 prompt 容易出现属性漂移”,可灵、即梦也普遍存在以下三个问题:
- 角色不一致:同一段视频中人物面孔会”漂移”。
- 构图不可控:想要的画面角度、景别无法精确指定。
- 风格难统一:跨镜头色调、光线出现跳跃。
1.2 关键帧的杠杆作用
提前把每一帧画好,相当于”把分镜台搬到 AI 时代”。Midjourney 创始人 David Holz 在 V7 版本发布会上说:”关键帧定义了视觉语法,视频模型负责把这些语法变成连贯的句子。”

二、四步工作流:从分镜脚本到成片
2.1 第 1 步:写分镜脚本
不要直接打开 Midjourney,先写一份包含 8–16 个镜头的分镜表。模板:
| 镜号 | 时长 | 景别 | 主体 | 动作 | 场景 | 光线 | 风格 |
|---|---|---|---|---|---|---|---|
| 01 | 3s | 大远景 | 城市天际线 | 镜头下摇 | 雨夜赛博朋克都市 | 蓝紫霓虹 | 电影感 |
| 02 | 2s | 中景 | 女主角 | 撑伞驻足 | 街角便利店前 | 暖色招牌侧逆光 | 写实 |
| 03 | 4s | 近景 | 女主角面部 | 抬眼看向镜头 | 同上 | 眼神光 | 胶片颗粒 |
| 04 | 3s | 特写 | 伞面雨滴 | 慢动作 | 同上 | 暖色侧光 | 微距 |
2.2 第 2 步:用 Midjourney 出关键帧
参数建议(2026 年 7 月最新文档):
--ar 16:9:匹配标准视频画幅,避免后期裁切损失像素。--stylize 250:保留 MJ 风格又不至于过度艺术化。--seed 12345:同一角色的所有镜头用相同 seed,配合--cref(角色参考)保证一致性。--q 2:高质量档,适合做关键帧。--v 7:2026 年主推版本,纹理细节最好。
例如分镜 02 的提示词:
A 25-year-old Chinese woman with long straight black hair, holding
a transparent umbrella, standing under a neon-lit convenience store
sign, light rain, looking at camera with subtle smile, medium
shot, cinematic warm side lighting, shallow depth of field,
photorealistic --ar 16:9 --stylize 250 --seed 42890 --v 7
生成 4 张后,用 U1/U2/U3/U4 选定一张最高清的图,对它再跑一次 --q 2 上采样到 2K,作为关键帧。
2.3 第 3 步:图生视频接力
三种主流接力方式:
| 工具 | 输入 | 擅长 | 时长 | 价格参考 |
|---|---|---|---|---|
| Midjourney Animate | 单张 MJ 关键帧 | 艺术化、风格化运动 | 5 秒/段,可延长至 21 秒 | Fast 模式算 GPU 分钟 |
| Runway Gen-3 | 单张图 + 文本 | Motion Brush 局部运动 | 4–10 秒 | 免费 125 credits/月 |
| 可灵 2.0 图生视频 | 单张图 + 提示词 | 角色一致性、长镜头 | 5–10 秒 | 约 8 元/段(标准) |
| Sora 2 Image-to-Video | 单张图 + 提示词 | 物理一致性、长镜头 | 5–15 秒 | ChatGPT Pro 包含 |

2.4 第 4 步:剪辑 + 调色 + 配乐
把所有片段导入 DaVinci Resolve 或剪映,按分镜表顺序排列。Amos LeBlanc 在 2026 年 3 月的 AI 音乐 MV 教程中强调三点:
- 统一调色:AI 生成的各片段色调不一致,必须用 LUT 或节点式调色统一。
- 节拍剪辑:配 BGM 时按鼓点切镜头,避免 AI 视频常见的”匀速感”。
- 转场克制:硬切最好用,叠化容易暴露 AI 痕迹;运动匹配切(Motion-matched cuts)效果最自然。
三、Stable Diffusion 路径:ControlNet 关键帧工作流
如果需要更精细的姿态控制(例如舞蹈、武打动作),Stable Diffusion + ControlNet 是更专业的方案。FluxNote 2026 年 4 月教程里的标准工作流:
3.1 准备参考视频
先用真人拍摄 5–10 秒的参考视频(手机即可),用 OpenPose 提取每一帧的骨骼关键点。
3.2 加载 ControlNet 工作流
在 ComfyUI 或 A1111 里使用 control_v11p_sd15_openpose 预处理器,把参考视频的关键点序列作为控制条件。
3.3 用 SD 1.5 / SDXL 逐帧生成
设置固定 seed + 一致的提示词,每帧只微调表情/光线参数。生成 16–24 帧后用 ffmpeg 合成 24fps 视频。
3.4 常见坑
- 显存:SD 1.5 需 8GB+,SDXL 需 12GB+。
- 帧间闪烁:用低 denoise(0.3–0.5)+ LoRA 风格锚定。
- 角色穿模:启用 ADE 调度器或重启 latent。

四、参数速查表(2026 年 7 月)
| 参数 | 推荐值 | 用途 |
|---|---|---|
--ar |
16:9 / 9:16 / 1:1 | 视频画幅匹配 |
--stylize |
100–500 | 风格化强度,250 平衡最好 |
--seed |
同一角色相同 | 角色一致性 |
--cref |
角色参考图 URL | 多镜头复用同一人物 |
--motion |
low / high | MJ Animate 运动强度 |
--loop |
启用 | 首尾帧相同做循环 |
--end |
末帧图 URL | 指定视频结束帧 |
--raw |
启用 | 减少 MJ 自由发挥 |
--bs |
1 | 视频生成批次大小 |
五、工具组合实战建议
- 个人创作者(预算 < 200 元/月):Midjourney Basic $10 + Runway 免费 + 剪映剪辑。
- 小型工作室(预算 500–2000 元/月):Midjourney Pro $30 + 可灵 2.0 会员 + DaVinci Resolve + SD ComfyUI 本地。
- 企业团队(预算 5000+ 元/月):Midjourney Mega + Sora 2 Pro + Runway Gen-3 企业 + ComfyUI 集群。
无论哪个档位,关键帧永远是第一步。把分镜台搬到 AI 时代,剪辑师就能从”猜”AI 变成”导”AI。
信息核实
- Midjourney 官方文档,《Video》,2026。https://docs.midjourney.com/hc/en-us/articles/37460773864589-Video
- amosleblanc.com,《How to make an AI music video》,2026-03-25。https://www.amosleblanc.com/how-to-make-an-ai-music-video
- 550W AI实验室,《AI视频生成提示词大全》,2026-05-31。https://www.550wai.cn/blog/ai-video-prompt-engineering.html
- CSDN(Dwen512),《从静到动的创作革命:Midjourney Video V1重塑AI影像叙事》,2026-07-18。https://blog.csdn.net/Dwen512/article/details/149270936
- FluxNote,《How to Animate Midjourney Images Free》,2026-04。https://fluxnote.io/guides/how-to-animate-midjourney-images-free
