
参考图优先:从静态图到 AI 视频的稳定工作流
先确认人物、产品和起始帧,再进入 Seedance 图生视频,减少身份漂移、构图变化和无效重复生成。
直接从一段很长的提示词开始生成视频,常见问题是人物、产品、构图和动作同时发生变化。更稳定的方式是先解决静态画面,再让视频模型只负责运动。
为什么先做参考图
一张确认过的起始图可以提前固定:
- 人物身份、发型、服装和主体比例
- 产品外形、颜色、材质和摆放位置
- 镜头景别、画幅与视觉重心
- 场景光线、色调和背景结构
- 视频第一帧必须出现的关键信息
视频模型需要决定的内容越少,结果通常越可控。参考图不是保证完全一致,而是减少模型需要重新解释的变量。
第一步:明确最终发布画幅
先确定成片要发布到哪里:
| 发布场景 | 常用画幅 | 构图重点 |
|---|---|---|
| 短视频平台 | 9:16 | 主体居中,重要内容避开上下界面区域 |
| 网页或横版视频 | 16:9 | 为横向运动和字幕保留空间 |
| 社交媒体帖子 | 1:1 或 4:5 | 主体清晰,减少边缘关键信息 |
不要在参考图确认后随意切换画幅。重新裁切可能破坏主体比例,也会迫使模型补画新的背景区域。
第二步:生成或整理起始图
可以在图片工作台使用 GPT Image 2 创建起始图,也可以上传已有素材进行编辑。
起始图应满足:
- 主体边缘清楚,没有明显结构错误
- 人物脸部、手部和服装已经达到可接受状态
- 产品名称、包装和关键细节经过人工复核
- 背景为预期动作留下足够空间
- 图片分辨率与最终用途匹配
如果静态图本身存在错误,图生视频通常会放大这些问题,而不是自动修复它们。
第三步:把动作提示词写得更具体
图生视频提示词重点描述“接下来发生什么”,不必重复参考图中已经清楚的所有视觉信息。
一个实用结构是:
主体动作 + 镜头运动 + 环境变化 + 节奏限制 + 需要保持的内容
例如:
产品缓慢旋转约四分之一圈,镜头轻微向前推进,背景灯光从冷色过渡到暖色;动作平稳,保持包装文字、产品比例和桌面位置不变。
避免在一个短镜头中安排过多连续动作。动作越多,模型越可能省略步骤或改变主体结构。
第四步:先用低成本规格验证运动
第一次生成的目标不是最终交付,而是检查:
- 动作方向是否正确
- 镜头速度是否合适
- 主体是否发生明显漂移
- 时长是否足够完成动作
- 画面边缘是否出现结构变化
可以先用当前可用的 Mini 或 Fast 渠道验证,再根据结果决定是否使用 Max 生成关键镜头。具体可选模型仍以工作台实时渠道为准。
第五步:每轮只改一个变量
如果结果不理想,同时更换参考图、提示词、时长和模型,很难判断问题来自哪里。
更有效的迭代方式是:
- 身份不稳定:先换更清晰的参考图
- 动作过大:缩短动作描述或降低运动幅度
- 镜头太快:只调整镜头运动词
- 构图变化:强调需要保持的主体位置,并减少复杂环境变化
- 细节不足:方向确认后再提高模型或分辨率规格
提交前检查
在工作台点击生成前,确认以下信息:
- 当前模型渠道仍然可用
- 分辨率、时长和画幅与参考图一致
- 页面显示的人民币任务总价符合预期
- 参考图已经上传完成且预览正确
- 提示词没有包含互相冲突的动作要求
参考图优先的价值,是把“画面应该是什么”和“画面应该怎么动”拆成两个可以分别检查的阶段。这样不仅更稳定,也更容易知道每次修改解决了什么问题。