ROUTE A · 默认真人讲解
真人底片裁窗 + 素材库检索补 B-roll,只给出镜段买口型。默认路线,也是最便宜的一条。
档 $6 · 实测 $1.78 · 98% 花在口型解构、复刻、短剧、广告、跨平台五条线,共用一套素材、身份与闸门底座。
// 面向视频工作流共建方 · 工程与成本口径 · 数据截至 2026-08-11
两端不直接调用彼此,接口只有一份分镜 JSON——解构端产出骨架,生成端只消费。
// 灰=外部源 · 青=机器自动 · 琥珀=交接契约 · 紫=生成端 · 玫红=资产底座
解构端和生成端从不直接说话。中间那份 shots[] 既是交付给客户的分镜稿,也是喂给流水线的输入骨架——同一份 JSON 两用,所以「照着爆款重拍」不是让模型凭空想分镜,而是拿真实跑出成绩的骨架去驱动。
四型共享同一副骨架——判型、文稿、预算预检、配音对齐、合成、审片、响度、封面、归档全一样,只有画面来源分叉。
// B 表显 $9.92 未含大脑费,含大脑费后真实约 $18–20;D 是试用卡,只接人工指定的试产单
真人底片裁窗 + 素材库检索补 B-roll,只给出镜段买口型。默认路线,也是最便宜的一条。
档 $6 · 实测 $1.78 · 98% 花在口型全程无人出镜:母图 → 派生底图 → 付费前闸门 → 图生视频。95% 的钱都在图生视频这一步。
档 $15 · 实测 $9.92(不含大脑费)参考图锁身份、源片当动作参考,一次调用出「边走边指边讲」,解掉裁窗改不了动作的死结。
档 $30 · 已预留 $11.25零件化装配层落地后新挂的一型,四段全量。只接人工显式指定的试产单,自动路由选不到它。
档 $12 · 换场景口播镜实测 ≈$1.7/镜不吃整条锁死的路线:每镜声明用哪几个零件——配音 / 口型 / 文生图 / 图生视频 / 真人裁窗 / 素材检索。
首张零件卡约 $1.7 / 镜小红书视频笔记 → 去水印 + 破画面 hash + 1.02 变速,文案按抖音爆款结构重写并校验。
Fly 必须部署美区:小红书封 Tokyo IP 段产品图 + 卖点 → 八环节竖屏素材。脚本与分镜已接真实 LLM,出画之后的五环节仍是占位。
FastAPI 独立子应用 · 自动部署默认关闭产线吃不下任意源片。留着等于把失败率转嫁给店长,还要他自己猜为什么这条做出来是坏的。
只保留过了品类闸与真人讲解闸的候选池纯 AI 换脸做整片复刻会被平台打「AI」角标并限流。同脚本同镜序的一手对照:真人原版 5.3 万赞 / 5391 评论,纯 AI 复刻版 324 赞 / 1 评论——差 2–4 个数量级。这是「真人底片 + 唇形同步」成为默认路线的原因,不是审美偏好。
验收句是逐字写死的:客户打开自己的链接,用自己登记的出镜人和素材,提一单、拿到成片、完成一次审核,全程不需要我们任何人碰后台。
qc / deliver 对 producer 已禁用,它也不能把任务设为 done
// 两把密钥非空且相同时,两条接口同时 503 —— 分权失效就不许开工
| video_type | 施工计划 stages | 预算 / 策略 / 挂牌 |
|---|---|---|
| talking_broll 真人讲解 | script · materials · lipsync · final(四段全量) | $6 · v1.0 · certified |
| scene_only 纯场景画外音 | script · materials · final(没有口型段,全片无人出镜) | $15 · v1.1 · certified |
| host_in_scene 实景走位讲解 | script · materials · lipsync · final(四段全量) | $30 · v1.1 · certified |
| scene_swap_talking 换场景口播 | script · materials · lipsync · final(四段全量) | $12 · v1.1 · trial |
| '' 未声明 / 老单 | 四段全量(在表里但不可被声明) | $6 · v1.0 · — |
// v1.0 是 24 项;v1.1 加了口播镜人脸覆盖率与句内停顿离群,合计 26 项
查完得到 stages,一切下游——认领推进、派活提示词、界面、审核——只认 stages 数组,不许再按类型分支。
预留 / 提交 / 销账三步的编号由服务端固定下发,断线重连不会产生第二笔费用;超预算即 409。
这四天的改动几乎全压在同一件事上:在花钱之前、在人来问之前,先把自己哪儿不对说出来。
判型的两个决策变量是会话现场看帧填的纯模型输出,工作目录又按任务号起——同一条源片先判真人讲解、再判纯场景,两条产线各烧一次。
声明值与缓存不符 → 409 附缓存值,翻案是人工删行纯场景形式的画面全靠门店实拍打底。零实拍就只能纯文生图硬编——七个镜头七个卫生间、自流平画成冰淇淋盘圈,$15 打水漂。
判型照常落库,止的是生产不是记录换模型那晚第一条真单三连失败:根因是接口地址尾巴多了个 /v1,而模型侧回的文案把人往「模型不存在 / 没权限」上带。
混进生成费的后果不是「数字大一点」:一单还没开始做画面,就先被自己的思考费打爆 $6,然后预留与销账连锁 409。
模型侧自报金额比账面高 67% → 只取 token 数,钱按自己价格表算换认领是付费链条倒下的第一张骨牌:旧编号作废 → 僵尸预留 → 再预留撞 409 → 下一个会话照着错误现场误诊。
八条件全满足才续 · 共享 3 小时墙钟 · 余量须 ≥600 秒会话死在预留与提交之间,继承者手上没有任何能处置它的动作,新编号一律 409——白烧 9 个编号,最后靠人工重置才脱困。
六道护栏 + 满 3 分钟年龄闸;409 全部结构化并带处方侧边栏那四步是所有任务共用的一套流程,回答不了这个问题。库存=方案里有、任务表里没有的差集,不新增任何状态。
长片切分后其余各集的文稿与镜头脚本当场写好回填老板的一句话原来只能换成整片重做。现在按时间戳对照分镜解析成结构化返修单,只重跑指出来的那几段。
解析不出的如实报出有几处,不假装每处都精确落段两者指向同一个文件,服务端只多一个响应头——录屏一秒钟的事,它不是控制是摩擦。用胁迫换来的反馈是假反馈。
机器四阶段过了就能下;「要改」留着,真有问题的人才会点| 参数 | 为什么是这个值 | 取值 |
|---|---|---|
| 心跳间隔 | 守护进程发,不由模型侧脚本发——模型忘了发不能等于这单死了 | 60 秒 |
| 判死阈值 | 只对发过心跳的单生效:老协议单静默 20 分钟是它的正常状态,兜底判会把合法单当场判死 | 5 分钟 |
| 自动重排上限 | 到顶转 failed 终态;判死同时把认领就地过期,吊死的会话据此收到 409 并自杀 | 2 次 |
| 会话原地续跑 | 与首启共享同一条墙钟,续跑不重置计时;一个开关即可回到改动前 | ≤2 次 · 余量 ≥600 秒 |
| 返修轮次 | 与自动重排各记各的数:一个数「人说了几次不行」,一个数「机器崩了几次」 | 2 轮 |
| 返修预算 | 不另造一套账,把预算上限抬到「已花 + 本轮上限」,现成的超支闸就是执行者 | 基线 30% · 下限 $0.5 |
| 并发额度 | 10 家店 × 额度 2 = 20 条在产,而灶位只有 2 个——多店之后必然脱钩 | 默认 2 · 硬上限 8 |
| 僵尸预留年龄闸 | 残余双花窗口要求服务端连续 3 分钟不可写,那时产线早停摆了 | 满 3 分钟 |
| 失败分类 | 非法值 API 直接拒收——静默吞掉一个拼错的 code,页面会安静地显示成「未分类失败」 | 14 类 |
// 八条件:已退出 / 任务态可续 / 失败分类可续 / 非登录失败 / 抓到会话号 / 次数未尽 / 墙钟余量 ≥600 秒 / 开关未关
无头模式的合同是「哪一轮回复只有文字、没有工具调用,就视为收工」,而聊天型模型会写下「Let me fix it…」然后等对面接话——可无头模式没有对面。于是任务书开头把「每一轮回复必须至少含一个工具调用」当成 harness 物理规则写死,结尾再追一句收尾自检,锚句有测试钉住防止被顺手删掉。
不轻易加新状态。每加一个状态值,全仓每处状态分支都要多判一次,漏判一处那批片子就从页面上静默消失。所以「还没做的那几支」不是状态(它们根本还没建单,是算出来的差集);「已交付」复用既有终态而不另起一个同义词;只有「返修中」这一个真新增,因为「从头做」和「只重跑这一段」是两条产线指令,合成一个状态 agent 只能靠备注里有没有那段文字来猜。
一条 355 秒源片走全自动路线,会话自行把它压成 179 秒成片——投放不可用,而配音和口型的钱已经花完。切分能力一直都有,可它只写在产线说明书里。说明书是「看到了才生效」,任务书是「每一轮都念一遍」——四条成片时长硬要求因此从说明书搬进了任务书,并且返修轮返回空串,存量返修路径的提示词逐字不变。
全开源组件本地跑,单条 API 花费 0 元,只有看图出稿那步花几毛钱 token。92 秒视频约 7–8 分钟出稿。
字幕轨是作者手写的标准答案,语音轨补它漏的句子、修 OCR 的形近字;语音听错的专有名词以字幕为准。
文字描述可以自圆其说地错着,配图往那一摆对不上就是对不上——首例靠它逮到一次「拉焦」被误判成「换被摄物」。
产出一份交付版分镜稿(去掉内部工艺细节,只留风格参数 / 分镜表 / 解说词 / JSON / 待决策项),推上主干即自动发成带图文档并进索引。同一份 shots[] 转身就是生成端的输入骨架。
形象是参考图、声音是租来的 voice_id、口型是后处理、表情全来自真人底片——肢体动作那一层至今是真空。
// 悬停右侧图例行,对应层浮起 · 越上层越「属于这个人」,越下层越「属于这条片子」
78 张图库是小黑、14 条模特素材是小黄、9 条成片出镜的是第三位小美。两两余弦相似度只有 0.07–0.18。
阈值 0.375 由 245 帧两两余弦的双峰谷底标定,与开源模型官方 0.363 独立吻合;检测置信度须 ≥ 0.85。
整段先平均再比对会双向漏报——阳性对照两边都「像」。必须先聚类、再逐簇比对,同素材结论完全相反。
LoRA 只锁得住身份(脸 / 发 / 体型),动作是每条片子现场的东西,不是人的属性。缺的从来不是模型能力,是动作素材——而 replace 模式只取驱动视频的骨架和表情,驱动视频里是谁并不重要,动作源因此不需要客户配合补拍。
四轮返工全花在「遮」上——遮挡条会让该段和全片字幕款式不一致,观众一眼看出是补丁。最后靠时域回填真擦掉才过审。
// 验收门 FAIL 时换方案,不调阈值——合格区与失败区之间有 11 个点的空档
| 闸门 | 判据 | 失败时怎么办 |
|---|---|---|
| mask_ratio | 掩码面积 ÷ 字幕带面积 ≤ 0.33(6 个真实片段标定) | 非零退出并删半成品 |
| 闪烁比 | 带内帧间差 ÷ 带上方参照区帧间差 ≤ 2,超了肉眼可见沸腾 | 改单帧稳定填充 + 全窗口传播 |
| 唯一帧比 | mpdecimate 按 5 秒窗口统计,> 85% 为正常 | < 60% 重编码或插帧 |
| 眼线位置 | 成片眼线落在画幅 33–42%,按眼线反解裁窗而非写死上沿 | 直接 FAIL,重算裁窗 |
| 身份唯一 | 出镜帧 person_id 唯一且等于分镜声明值 | 拦住脸声错配 |
| 响度 | loudnorm I=-14 LUFS + 转双声道 | 交付前补跑一次 |
| 机器审片 | 四阶段逐段独立审,v1.1 合计 26 项(分布见第 03 节) | 逐项给可读失败原因 |
客户投放素材即商用:STTN(MIT)可商用;质量最好的那个开源权重是 CC-BY-NC,只能当内部天花板基准,不能进成片。
擦除模型只重绘掩码内像素。掩码漏掉 80–185 灰度的抗锯齿软阴影环,换任何内核都留那圈灰晕。
批量能等、实时不能等。路由按等待方分,不按模型强弱分——这是实时生图从自建搬到托管 API 的唯一理由。
// 序号跨行跳 = 一次交接 · 虚线格 = 这个角色这一阶段不参与
两个入口、三个生图子流程、换装、提示词优化、错误通知,加两条视频链路。写这页时逐个实读校验过。
本地 JSON 是唯一事实源推送触发同步到 n8n,每天凌晨反向导出 UI 端改动回仓库,提交带跳过标记防循环;同步脚本有护栏挡非 n8n 文件。
禁止 SSH 进去直接改库经自建链路端到端 60–120 秒,冷启动最坏 10 分钟以上。交互式场景等不起,改成按用户开关直调托管 API。
SFW 与 NSFW 走两家不同供应商大脑费换模型后已降到可忽略——同一批 token 从 $60.50 降到 $0.58。现在的大头是图生视频和一台常开的云工厂机。
// 三段顺序固定:云工厂机 → 生成费 → 其他 · 合计月省 $401(59%)
机器没有 HTTP 入口,「按请求自动停」判据不成立;改成按队列深度起停,队列有单就起、排空就停。
720 小时/月 → 180 小时图生视频是纯场景片 95% 的成本。一次 A/B 约 $3.4、一天出结论,但这是唯一可能影响画质的一项。
$0.225/秒 → $0.08/秒同一个卖点,16 个碎镜比 8 个长镜贵一倍,还正好是「一段七个卫生间」那类空间不连续问题的温床。
省钱和提质在这里是同一个动作失败单的钱不退——跑到口型那步失败,配音与口型已付款、片子没出,四条单里就有一条这样。大脑费对不上账——账户消耗混着素材标注、审片、编排等多条业务线,云端各密钥的值取不出来,无法按 key 拆分;逐单记账刚上线,样本还只有两条。
图生视频模型页标价 $0.16/秒,实付约 1.40 倍。这个倍数是用一条超支 $43 的片子量出来的——按标价估会系统性低估四成,所以记账一律按实付单价。
纯工程口径。没上线的一律不写成已上线——这既是产线自己的诚实性要求,也是这一页的写法。
| 接口面 | 现在是什么状态 | 交接契约 |
|---|---|---|
| 动作层 · motion transfer | 真空。裁窗 + 口型只能改嘴,改不了走路 / 弯腰;纯 AI 生成又会被打角标 | 驱动视频 + 锚点图 → 替换后视频 |
| 自建音色 | 现在租 voice_id:闲置 7 天回收、绑死单一供应商密钥、情绪不可控 | 文本 + 音色底片 → wav |
| 字幕擦除内核 | 自研掩码 + 时域回填;没有干净帧时只能退回逐帧 inpaint,纹理区必糊 | mp4 + 掩码视频 → 擦净 mp4 |
| 图生视频后端 A/B | 单条可省 $6.09,但分辨率接近不代表运动质感一样,不验完不切 | 同批底图 7 镜 → 可比成片 |
四面都不与主链路耦合:产线通过分镜 JSON 和阶段包交接,任何一面换实现都不动上下游。真正的验收标准也已经写死在第 07 节那七道后期验收门里——能不能过闸门,比谁做的更重要。
单价与规格取自生产在用的零件卡与计价代码,不是模型页标价。
| 环节 | 在用的技术 | 单价 / 规格 |
|---|---|---|
| 编排 | n8n(10 个 active 工作流)· GitHub Actions 双向同步 | Fly.io 东京 |
| 解构 | TransNetV2 · RapidOCR · SenseVoice · Claude 看图出稿 | 本地 CPU · 单条 0 元 |
| 文生图 / 图生图 | Seedream 4.0(text-to-image / edit) | $0.03 / 张 |
| 图生视频 | MiniMax H3 image-to-video | $0.225 / 秒(实付口径) |
| 参考生视频 | MiniMax H3 reference-to-video | $0.225 / 秒 · 超 5 张参考图 +$0.08/张 |
| 唇形同步 | sync-lipsync v2(lipsync-2) | $3.00 / 分钟 |
| 配音 / 音色克隆 | MiniMax speech-02-hd · voice-clone | $0.10 / 千字 · $1.50 / 次 |
| 封面 | gpt-image-2 + 放大 | $0.10 / 次 |
| 生产大脑 | qwen3.7-flash(经 OpenRouter) | 入 $0.03 / 出 $0.13 每百万 token |
| 审片大脑 | qwen3-vl-235b 看图 | 入 $0.21 / 出 $1.90 每百万 token |
| 批量生图 · 自建 | RunPod Serverless ComfyUI:SDXL / FLUX.1-dev fp8 | 模型烘焙进镜像,不挂网络卷 |
| 批量生图 · 托管 | Venice.ai chroma(steps 10 · cfg 3.5 · 832×1216) | 约 10 秒 / 张 |
| 实时生图 | fal FLUX schnell + face-swap | 约 $0.012 / 张 · 6–10 秒 |
| 动作转移(未投产) | Wan v2.2-14b animate/replace | $0.04 / $0.06 / $0.08 每视频秒 |
| 字幕擦除 | 自研时域回填 · TELEA · LaMa · STTN(MIT) | 本地 $0 · 许可优先于质量 |
| 身份判定 | YuNet 检测 + SFace embedding | 阈值 0.375 · score ≥ 0.85 |
| 合成 | ffmpeg 单次 filter_complex 全流编码 | loudnorm I=-14 LUFS · 双声道 |
| 子应用 | ad-studio · xhs-pipe(FastAPI) | Fly 东京 / 美区 |
| 本地零成本环节 | B-roll 检索 · 真人裁窗 · 转写 · 切镜头 | 只吃机器时间 |
产线八个岗位逐站讲开、按症状查故障见 一条视频,里面到底发生了什么;逐单账本与单价表见 视频产线成本量化说明;零件化装配层的来龙去脉见 把三条流水线拆成一个零件柜。复刻产线的分权与失败分类见 短视频复刻产线 · 现状全景;音色克隆 / 唇形 / 表情保真见 换人换声技术方案;解构六步动态图解见 解构复刻产线;图生视频效果归因见 图生视频效果不好,怪谁。