我们的短视频产线走「AI 生图 → 图生视频(可灵 Kling / Seedance)」这条链路,成片效果一直不够理想:真实感差、嘴形对不上、镜与镜之间人物长得不一样。问题到底出在提示词、图片,还是模型?这是一次真实的三层归因排查——结论先说:图片层嫌疑最大,模型参数层次之,提示词层问题最轻但修起来最便宜。排查方法本身可以复用到任何 AIGC 产线。
「生成效果不好」是所有 AIGC 产线都会遇到的投诉,但它是个复合症状:可能是图假、可能是参数低、可能是提示词烂,也可能三个都占。直接换模型是最常见的第一反应,也往往是最贵、最无效的一步。这篇讲解把我们 7 月这轮排查完整复盘一遍——证据从哪来、怎么分层、结论是什么、下一步验证实验怎么设计。
产线是典型的两段式:第一段生图——用即梦 / Midjourney(手工出图)或万相文生图 API(脚本出图)按分镜稿逐镜生成静帧;第二段图生视频(I2V)——把静帧喂给可灵 Kling 让画面动起来,Seedance、Wan、LTXV 做过横评备选。一条完整成片约 32 张图、32 段视频再拼接。
分镜稿(LLM/人工) → 逐镜生图(即梦/MJ/万相) → I2V 出画(可灵 v2.5)
↓
配音对齐(音频输入) → 拼接字幕(ffmpeg) → 成片
「效果不好」拆开是四个具体症状,这一步很关键——症状不拆开,归因就无从下手:
两段式产线的归因要按数据流向分层:图片是 I2V 的输入,提示词是两段各自的控制信号,模型是执行器。排查顺序必须从上游往下游——因为上游的污染下游救不回来:图是假的,视频模型再强也只是"忠实地让一张假图动起来";反过来,如果先在下游换模型调参数,上游问题没解决,换什么都白换、还白烧钱。
图本身假不假、每张图之间一致不一致、分辨率够不够、有没有质检。本轮排查的最大嫌疑。
模型版本选对没有、档位(std/pro)、分辨率链条、输入通道(音频)支不支持。部分问题已实锤并修复。
运镜/动作描述写法、负向提示词强度、防御性措辞。问题最轻,但修起来最便宜。
把四个症状对回三层,会发现真实感差和跨镜不一致这两个最痛的症状,都指向图片层:
| 问题 | 证据 | 等级 |
|---|---|---|
| 输入图本来就是 AI 图 | 现产线的图来自即梦 / MJ 手工出图——I2V 引擎拿到的输入本身就带"AI 味",动起来只会放大这种假;跨镜不一致同理:每张图是独立生成的,"同一个人"在每张图里本来就长得不一样 | C · 已设计盲评实验待跑 |
| 脚本出图用的是极速档 | 自动化链路用的文生图是万相 turbo 极速档(约 0.14 元/张的档位),而内部横评早已证明同类内容 Seedream 出图质量显著更强——调研结论没有落进产线代码 | A · 代码实查 |
| 出图无质检环节 | 脚本一次生成直接进合成,没有重试、没有打分、没有人工闸口;此前横评里"3 张只有 1 张能用"的教训说明单次出图合格率并不高 | A · 代码实查 |
| AI 直接画中文字 | 让生图模型直接在画面里画中文(封面字、包装字)必糊必错——正确做法是生成无字底图,再用 ffmpeg 叠真实文字层 | B · 横评实测 |
团队已经写好了一个图源对照盲评实验:同一条运镜提示词,分别喂「真实照片」和「AI 生成图」给同一个 I2V 模型,产出的视频打乱顺序后由不看答案的人按五个维度打分(真实感 / 主体保持 / 运镜服从 / 形变控制 / 整体可用),最后揭盲对比。如果真图组显著胜出,图片层主因实锤——后续预算就该花在图源上(实拍素材、更强的生图模型、出图质检),而不是升级视频模型档位。
模型层有一个已经闭环的真实案例,值得完整讲一遍,因为它示范了"换版本"不等于"升级版本":
口播镜头嘴形对不上台词,第一反应是"提示词再调调"。但排查发现根因在输入通道:当时用的可灵 V3 standard 不支持音频输入——模型根本听不到台词,嘴形只能瞎编,提示词写出花也没用。解法反直觉:回退到支持音频输入的 v2.5,嘴形基本对上。B · 团队实测闭环
画质代际更新,但无音频输入通道——口播场景下嘴形永远对不上,这是结构性缺陷,调参数救不了。
版本号更低,但有产线需要的输入通道。选模型看能力矩阵,不看版本号大小。
| 坑 | 问题 | 等级 |
|---|---|---|
| 档位硬编码 std | 对照脚本里可灵档位写死 standard——而横评结论明确"竖屏成片别用 std 档:更慢、分辨率低一档、性价比最差" | A · 代码实查 |
| 分辨率链条断档 | 生图 720×1280 → I2V 输出 720p → 目标成片 1080×1920。横评原话:"704p 放大到 1080 会糊,做正片这个差距致命";超分(RealESRGAN)还停在待评估清单里 | A |
| 平台自动改写提示词 | 对照实验的 Wan 臂开着 prompt_extend(平台侧自动扩写 prompt)——可能画出图里不存在的内容,还污染对照实验的变量控制 | A · 代码实查 |
| Seedance 只测过 Lite | Seedance 横评只跑过 Lite 档(704p),Pro 档没验过——拿 Lite 的表现给 Seedance 整体下结论,或直接用 Lite 出竖屏正片,都不成立 | B |
提示词层排查出四个具体问题。单独看每个都不致命,但它们的共同特点是修复成本几乎为零——所以虽然排第三,反而应该最先动手:
归因排查的价值在于把"感觉不好"变成"下一步做什么"。按投入产出排序的行动清单:
prompt_extend 自动改写。否则实验结果本身不可信任何多段式 AIGC 产线(文生图→图生视频、脚本→配音→数字人、素材→剪辑→成片)都适用同一套动作:拆症状 → 按数据流分层 → 从上游往下游排查 → 每个假设配一个可跑的对照实验 → 实验结果决定预算流向。最贵的错误永远是跳过归因直接换模型。