AI 视频工作流全景 · 给共建方的对接速览

一条爆款进来
一条能投的成片出去

解构、复刻、短剧、广告、跨平台五条线,共用一套素材、身份与闸门底座。

// 面向视频工作流共建方 · 工程与成本口径 · 数据截至 2026-08-11

N8N ×10 ACTIVE MINIMAX H3 I2V SYNC-LIPSYNC V2 SEEDREAM 4.0 RUNPOD SERVERLESS VENICE.AI CHROMA FLY.IO / NRT 26 道审片闸门
0
张已定档的风格卡真人 $6 / 换场景 $12 / 纯场景 $15 / 走位 $30
$0
真人复刻单条实测生成费逐笔回执累加,非估算
0
个 active n8n 工作流生图 + 视频编排底座
0
位已注册主播身份按人脸 embedding 判定,不按服装
SCROLL / 向下滚动
01
Landscape Map

一个解构端,五条生成线

两端不直接调用彼此,接口只有一份分镜 JSON——解构端产出骨架,生成端只消费。

SRC 原片 · 抖音 / 小红书 DOUYIN · XHS DEC 解构端 · 本地跑 TRANSNETV2 · OCR · ASR JSON 分镜 JSON · 交接契约 SHOTS[] 数组 生成端 · 五条路线 FAL · RUNPOD · FFMPEG GEN AST 资产底座 · 脸 / 声 / 图库 QA 后期 · 闸门 · 交付 shots[] 骨架喂产线 锚点 / 音色 成片回流

// 灰=外部源 · 青=机器自动 · 琥珀=交接契约 · 紫=生成端 · 玫红=资产底座

这张图里最要紧的一条线

解构端和生成端从不直接说话。中间那份 shots[] 既是交付给客户的分镜稿,也是喂给流水线的输入骨架——同一份 JSON 两用,所以「照着爆款重拍」不是让模型凭空想分镜,而是拿真实跑出成绩的骨架去驱动。

02
Production Routes · Budget Tiers

路线按「画面从哪来」分岔

四型共享同一副骨架——判型、文稿、预算预检、配音对齐、合成、审片、响度、封面、归档全一样,只有画面来源分叉

四档预算上限 vs 真实产单已花
美元 / 条 · 生成费口径 · 逐笔回执累加 · 2026-08-11
A · 真人讲解 $6.00$1.78
D · 换场景口播 $12.00试用中
B · 纯场景画外音 $15.00$9.92
C · 实景走位讲解 $30.00$11.25
预算档上限(服务端定,产线无权自报) 真实产单已花

// B 表显 $9.92 未含大脑费,含大脑费后真实约 $18–20;D 是试用卡,只接人工指定的试产单

ROUTE A · 默认真人讲解

真人底片裁窗 + 素材库检索补 B-roll,只给出镜段买口型。默认路线,也是最便宜的一条。

档 $6 · 实测 $1.78 · 98% 花在口型

ROUTE B纯场景画外音

全程无人出镜:母图 → 派生底图 → 付费前闸门 → 图生视频。95% 的钱都在图生视频这一步。

档 $15 · 实测 $9.92(不含大脑费)

ROUTE C实景走位讲解

参考图锁身份、源片当动作参考,一次调用出「边走边指边讲」,解掉裁窗改不了动作的死结。

档 $30 · 已预留 $11.25

ROUTE D · 试用卡换场景口播

零件化装配层落地后新挂的一型,四段全量。只接人工显式指定的试产单,自动路由选不到它。

档 $12 · 换场景口播镜实测 ≈$1.7/镜

试验中 · 代码未合逐镜点菜

不吃整条锁死的路线:每镜声明用哪几个零件——配音 / 口型 / 文生图 / 图生视频 / 真人裁窗 / 素材检索。

首张零件卡约 $1.7 / 镜

XHS-PIPE · v1跨平台搬运线

小红书视频笔记 → 去水印 + 破画面 hash + 1.02 变速,文案按抖音爆款结构重写并校验。

Fly 必须部署美区:小红书封 Tokyo IP 段

AD-STUDIO · Phase 1广告素材线

产品图 + 卖点 → 八环节竖屏素材。脚本与分镜已接真实 LLM,出画之后的五环节仍是占位。

FastAPI 独立子应用 · 自动部署默认关闭

已下线 · 2026-08-09粘一条链接直接做

产线吃不下任意源片。留着等于把失败率转嫁给店长,还要他自己猜为什么这条做出来是坏的。

只保留过了品类闸与真人讲解闸的候选池
Red Line

纯 AI 换脸做整片复刻会被平台打「AI」角标并限流。同脚本同镜序的一手对照:真人原版 5.3 万赞 / 5391 评论,纯 AI 复刻版 324 赞 / 1 评论——差 2–4 个数量级。这是「真人底片 + 唇形同步」成为默认路线的原因,不是审美偏好。

03
Store Workbench · Separation of Powers

把产线交到店长手里

验收句是逐字写死的:客户打开自己的链接,用自己登记的出镜人和素材,提一单、拿到成片、完成一次审核,全程不需要我们任何人碰后台。

SERVER
派活
认领带租约;服务端按风格表下发施工计划(stages 有序子集)与预算档——producer 无权自报预算
PRODUCER
只生产
四阶段逐段提交不可变阶段包。manifest 必须声明独立核心 payload SHA、完整 lineage,并列出包内每个文件的 SHA-256
REVIEWER
只审核
唯一权威审核方是固定只读镜像:审核代码与 policy 在镜像构建时烘焙,producer 写不进去,也拿不到 reviewer 密钥
SERVER
复验
每次读取都重查 package SHA + 核心 payload SHA + 强 ETag;Range 请求也必须过 If-Match,旧 claim / 跨阶段一律 fail closed
店长
人工终审
发布前完整复验四个当前 package、root 与 final payload,任一变化都在继续付费或发布前阻断
发布权
谁都没有
producer 与 reviewer 都没有发布权qc / deliver 对 producer 已禁用,它也不能把任务设为 done

// 两把密钥非空且相同时,两条接口同时 503 —— 分权失效就不许开工

风格表 · 服务端唯一事实源
平台不认识「风格」,只认施工计划 · 与产线仓 registry 逐字一致,单测钉着
video_type施工计划 stages预算 / 策略 / 挂牌
talking_broll
真人讲解
script · materials · lipsync · final(四段全量)$6 · v1.0 · certified
scene_only
纯场景画外音
script · materials · final(没有口型段,全片无人出镜)$15 · v1.1 · certified
host_in_scene
实景走位讲解
script · materials · lipsync · final(四段全量)$30 · v1.1 · certified
scene_swap_talking
换场景口播
script · materials · lipsync · final(四段全量)$12 · v1.1 · trial
''
未声明 / 老单
四段全量(在表里但不可被声明)$6 · v1.0 · —
审片闸门按阶段分布 · replica-review-v1.1
项 · 每项独立返回 通过 / 警告 / 不适用 · 闸门绑工序不绑类型
script 文稿4
materials 素材5
lipsync 口型8
final 成片9

// v1.0 是 24 项;v1.1 加了口播镜人脸覆盖率句内停顿离群,合计 26 项

video_type 的作用止步于查表那一下

查完得到 stages,一切下游——认领推进、派活提示词、界面、审核——只认 stages 数组,不许再按类型分支。

付费调用由服务端托管

预留 / 提交 / 销账三步的编号由服务端固定下发,断线重连不会产生第二笔费用;超预算即 409。

04
Recent Changes · 2026-08-08 → 08-11

让产线学会自己喊疼

这四天的改动几乎全压在同一件事上:在花钱之前、在人来问之前,先把自己哪儿不对说出来

A · 花钱之前拦住
01

判型缓存 · 一次判终身用同一条片判两次型 = 两笔钱

判型的两个决策变量是会话现场看帧填的纯模型输出,工作目录又按任务号起——同一条源片先判真人讲解、再判纯场景,两条产线各烧一次。

声明值与缓存不符 → 409 附缓存值,翻案是人工删行
02

准入止损 · 一分生成费都没花判成纯场景,本店零实拍

纯场景形式的画面全靠门店实拍打底。零实拍就只能纯文生图硬编——七个镜头七个卫生间、自流平画成冰淇淋盘圈,$15 打水漂。

判型照常落库,止的是生产不是记录
03

开工前先问大脑一句话不通就不接单

换模型那晚第一条真单三连失败:根因是接口地址尾巴多了个 /v1,而模型侧回的文案把人往「模型不存在 / 没权限」上带。

停在门口每分钟喊一次原因,不退出进程、不静默改写环境变量
B · 花了的钱不白花
04

两本账 · 绝不合并大脑费单开一列

混进生成费的后果不是「数字大一点」:一单还没开始做画面,就先被自己的思考费打爆 $6,然后预留与销账连锁 409。

模型侧自报金额比账面高 67% → 只取 token 数,钱按自己价格表算
05

会话死了不换认领原地续跑,最多 2 次

换认领是付费链条倒下的第一张骨牌:旧编号作废 → 僵尸预留 → 再预留撞 409 → 下一个会话照着错误现场误诊。

八条件全满足才续 · 共享 3 小时墙钟 · 余量须 ≥600 秒
06

僵尸预留有了出口只放行「从未提交」这一种形状

会话死在预留与提交之间,继承者手上没有任何能处置它的动作,新编号一律 409——白烧 9 个编号,最后靠人工重置才脱困。

六道护栏 + 满 3 分钟年龄闸;409 全部结构化并带处方
C · 店长这一侧
07

任务看板 + 内容库存「我哪一条到哪了」

侧边栏那四步是所有任务共用的一套流程,回答不了这个问题。库存=方案里有、任务表里没有的差集,不新增任何状态。

长片切分后其余各集的文稿与镜头脚本当场写好回填
08

定向返修「12.4 秒口型不对」变成工单

老板的一句话原来只能换成整片重做。现在按时间戳对照分镜解析成结构化返修单,只重跑指出来的那几段。

解析不出的如实报出有几处,不假装每处都精确落段
09

成片不再拿反馈来换下载与预览同条件

两者指向同一个文件,服务端只多一个响应头——录屏一秒钟的事,它不是控制是摩擦。用胁迫换来的反馈是假反馈。

机器四阶段过了就能下;「要改」留着,真有问题的人才会点
产线自愈的硬参数
每一个数字后面都有一次真实事故 · 实读代码校验 2026-08-11
参数为什么是这个值取值
心跳间隔守护进程发,不由模型侧脚本发——模型忘了发不能等于这单死了60 秒
判死阈值只对发过心跳的单生效:老协议单静默 20 分钟是它的正常状态,兜底判会把合法单当场判死5 分钟
自动重排上限到顶转 failed 终态;判死同时把认领就地过期,吊死的会话据此收到 409 并自杀2 次
会话原地续跑与首启共享同一条墙钟,续跑不重置计时;一个开关即可回到改动前≤2 次 · 余量 ≥600 秒
返修轮次与自动重排各记各的数:一个数「人说了几次不行」,一个数「机器崩了几次」2 轮
返修预算不另造一套账,把预算上限抬到「已花 + 本轮上限」,现成的超支闸就是执行者基线 30% · 下限 $0.5
并发额度10 家店 × 额度 2 = 20 条在产,而灶位只有 2 个——多店之后必然脱钩默认 2 · 硬上限 8
僵尸预留年龄闸残余双花窗口要求服务端连续 3 分钟不可写,那时产线早停摆了满 3 分钟
失败分类非法值 API 直接拒收——静默吞掉一个拼错的 code,页面会安静地显示成「未分类失败」14 类
会话退出之后怎么走
改造前只有一条路:判失败 → 重排 → 换认领
生产会话退出 SESSION EXITED 这一单交付了吗 DELIVERED? 是 · YES 否 · NO 正常收尾 NORMAL EXIT 八条件全满足 RESUME GATE 满足 任一不满足 判失败 → 重排闸 ATTEMPT<2 ? 重排 : FAILED 原地续跑 同一认领 · ≤2 次

// 八条件:已退出 / 任务态可续 / 失败分类可续 / 非登录失败 / 抓到会话号 / 次数未尽 / 墙钟余量 ≥600 秒 / 开关未关

Root Cause

无头模式的合同是「哪一轮回复只有文字、没有工具调用,就视为收工」,而聊天型模型会写下「Let me fix it…」然后等对面接话——可无头模式没有对面。于是任务书开头把「每一轮回复必须至少含一个工具调用」当成 harness 物理规则写死,结尾再追一句收尾自检,锚句有测试钉住防止被顺手删掉。

一条贯穿全部改动的纪律

不轻易加新状态。每加一个状态值,全仓每处状态分支都要多判一次,漏判一处那批片子就从页面上静默消失。所以「还没做的那几支」不是状态(它们根本还没建单,是算出来的差集);「已交付」复用既有终态而不另起一个同义词;只有「返修中」这一个真新增,因为「从头做」和「只重跑这一段」是两条产线指令,合成一个状态 agent 只能靠备注里有没有那段文字来猜。

另一条:任务书 ≠ 说明书

一条 355 秒源片走全自动路线,会话自行把它压成 179 秒成片——投放不可用,而配音和口型的钱已经花完。切分能力一直都有,可它只写在产线说明书里说明书是「看到了才生效」,任务书是「每一轮都念一遍」——四条成片时长硬要求因此从说明书搬进了任务书,并且返修轮返回空串,存量返修路径的提示词逐字不变。

05
Deconstruction · Free Stack

先把爆款拆开,再谈复刻

全开源组件本地跑,单条 API 花费 0 元,只有看图出稿那步花几毛钱 token。92 秒视频约 7–8 分钟出稿。

01 · Fetch取无水印母版自建去水印服务直出母版,非涂糊
02 · Cut切镜头 + 抽帧TransNetV2,实测 87% 准确率
03 · Dual Track双轨拿文字OCR 抠烧录字幕 × ASR 转写,互校
04 · Draft看图出稿七要素分镜表 + 带时间戳解说词
05 · Blind QA反向重建盲测没看过原片的人盲写重拍脚本

为什么一定要双轨

字幕轨是作者手写的标准答案,语音轨补它漏的句子、修 OCR 的形近字;语音听错的专有名词以字幕为准。

截图是免费的质检

文字描述可以自圆其说地错着,配图往那一摆对不上就是对不上——首例靠它逮到一次「拉焦」被误判成「换被摄物」。

交付形态

产出一份交付版分镜稿(去掉内部工艺细节,只留风格参数 / 分镜表 / 解说词 / JSON / 待决策项),推上主干即自动发成带图文档并进索引。同一份 shots[] 转身就是生成端的输入骨架。

06
Host Assets · Identity Registry

我们从来没「训练」过任何一位主播

形象是参考图、声音是租来的 voice_id、口型是后处理、表情全来自真人底片——肢体动作那一层至今是真空

L0 动作
L1 声音
L2 表情
L3 身份
L3 · 身份层78 张擦字锚点图库 → SEEDREAM /EDIT(LORA 挂起)
L2 · 表情层真人底片裁窗 —— AI 感的根因是锚点不是模型
L1 · 声音层MINIMAX VOICE-CLONE 租用 · 闲置 7 天回收
L0 · 动作层目前真空 → WAN ANIMATE/REPLACE 转移(未投产)

// 悬停右侧图例行,对应层浮起 · 越上层越「属于这个人」,越下层越「属于这条片子」

×3

三个人,一个名字

78 张图库是小黑、14 条模特素材是小黄、9 条成片出镜的是第三位小美。两两余弦相似度只有 0.07–0.18。

判定用 embedding,不用衣服

阈值 0.375 由 245 帧两两余弦的双峰谷底标定,与开源模型官方 0.363 独立吻合;检测置信度须 ≥ 0.85。

最贵的一个坑

整段先平均再比对会双向漏报——阳性对照两边都「像」。必须先聚类、再逐簇比对,同素材结论完全相反。

「训练」和「转移」是两件事

LoRA 只锁得住身份(脸 / 发 / 体型),动作是每条片子现场的东西,不是人的属性。缺的从来不是模型能力,是动作素材——而 replace 模式只取驱动视频的骨架和表情,驱动视频里是谁并不重要,动作源因此不需要客户配合补拍。

07
Post-Production & Deterministic Gates

烧录字幕:能擦就不要遮

四轮返工全花在「遮」上——遮挡条会让该段和全片字幕款式不一致,观众一眼看出是补丁。最后靠时域回填真擦掉才过审

底片带烧录字幕 SOURCE FOOTAGE 有无字幕帧 CLEAN FRAME? 有 · YES 无 · NO 时域回填 · 首选 TEMPORAL REFILL mask_ratio ≤ 0.33 ACCEPT GATE 通过 超阈 · FAIL 换窗口 / 最小遮挡条 LAST RESORT TELEA 逐帧擦除 INPAINT + GATE

// 验收门 FAIL 时换方案,不调阈值——合格区与失败区之间有 11 个点的空档

闸门判据失败时怎么办
mask_ratio掩码面积 ÷ 字幕带面积 ≤ 0.33(6 个真实片段标定)非零退出并删半成品
闪烁比带内帧间差 ÷ 带上方参照区帧间差 ≤ 2,超了肉眼可见沸腾改单帧稳定填充 + 全窗口传播
唯一帧比mpdecimate 按 5 秒窗口统计,> 85% 为正常< 60% 重编码或插帧
眼线位置成片眼线落在画幅 33–42%,按眼线反解裁窗而非写死上沿直接 FAIL,重算裁窗
身份唯一出镜帧 person_id 唯一且等于分镜声明值拦住脸声错配
响度loudnorm I=-14 LUFS + 转双声道交付前补跑一次
机器审片四阶段逐段独立审,v1.1 合计 26 项(分布见第 03 节)逐项给可读失败原因

商用许可是第一道筛子

客户投放素材即商用:STTN(MIT)可商用;质量最好的那个开源权重是 CC-BY-NC,只能当内部天花板基准,不能进成片。

换内核之前先修 mask

擦除模型只重绘掩码内像素。掩码漏掉 80–185 灰度的抗锯齿软阴影环,换任何内核都留那圈灰晕。

08
Image Base Layer · n8n Orchestration

三条生图链路,按「谁在等」分流

批量能等、实时不能等。路由按等待方分,不按模型强弱分——这是实时生图从自建搬到托管 API 的唯一理由。

入口
路由
生成
落地
n8n
编排
01entry-api(API Key)· entry-internal(UUID webhook)
02SFW / NSFW / Scene 三路分流;ai-optimize 先翻译并结构化提示词
05传对象存储 → Review Callback → 通知;error-notifier 集中报错
RunPod
自建
03SDXL(InstantID)· FLUX.1-dev fp8(PuLID),模型烘焙进镜像
托管
API
04Venice chroma 约 10s/张 · fal FLUX schnell 实时 6–10s

// 序号跨行跳 = 一次交接 · 虚线格 = 这个角色这一阶段不参与

10 个 active 工作流

两个入口、三个生图子流程、换装、提示词优化、错误通知,加两条视频链路。写这页时逐个实读校验过。

本地 JSON 是唯一事实源

改工作流 = 改文件再推送

推送触发同步到 n8n,每天凌晨反向导出 UI 端改动回仓库,提交带跳过标记防循环;同步脚本有护栏挡非 n8n 文件。

禁止 SSH 进去直接改库

实时生图为什么搬走

经自建链路端到端 60–120 秒,冷启动最坏 10 分钟以上。交互式场景等不起,改成按用户开关直调托管 API。

SFW 与 NSFW 走两家不同供应商
09
Cost Ledger · Where The Money Goes

钱不花在「想」上,花在「画」上

大脑费换模型后已降到可忽略——同一批 token 从 $60.50 降到 $0.58。现在的大头是图生视频和一台常开的云工厂机

月度支出构成 · 现在 vs 三项优化后
美元 / 月 · 按月产 30 条纯场景片估算 · 口径 2026-08-10
现在 $675
优化后 $274
云工厂机$272 → $68 生成费$298 → $101 其他机器 + CI + 大脑费$105 不变

// 三段顺序固定:云工厂机 → 生成费 → 其他 · 合计月省 $401(59%)

01

月省 ~$204 · 无质量风险云工厂机按队列起停

机器没有 HTTP 入口,「按请求自动停」判据不成立;改成按队列深度起停,队列有单就起、排空就停。

720 小时/月 → 180 小时
02

单条省 $6.09 · 需先验质量图生视频换后端

图生视频是纯场景片 95% 的成本。一次 A/B 约 $3.4、一天出结论,但这是唯一可能影响画质的一项。

$0.225/秒 → $0.08/秒
03

单条最多省 $11.2 · 零技术风险控镜头数与单镜时长

同一个卖点,16 个碎镜比 8 个长镜贵一倍,还正好是「一段七个卫生间」那类空间不连续问题的温床。

省钱和提质在这里是同一个动作
两个漏洞

失败单的钱不退——跑到口型那步失败,配音与口型已付款、片子没出,四条单里就有一条这样。大脑费对不上账——账户消耗混着素材标注、审片、编排等多条业务线,云端各密钥的值取不出来,无法按 key 拆分;逐单记账刚上线,样本还只有两条。

一个已经交过学费的坑

图生视频模型页标价 $0.16/秒,实付约 1.40 倍。这个倍数是用一条超支 $43 的片子量出来的——按标价估会系统性低估四成,所以记账一律按实付单价。

10
Current Status & Co-build Interfaces

已上线 / 待合入 / 还没解决

纯工程口径。没上线的一律不写成已上线——这既是产线自己的诚实性要求,也是这一页的写法。

SHIPPED已上线

  • 四张风格卡与四档预算(一张 trial)
  • 四阶段不可变阶段包 + 独立审核契约
  • 私有对象存储 + 服务端鉴权代理
  • 付费调用服务端托管、固定编号防重复扣费
  • 心跳 / 判死 / 自动重排 / 14 类失败分类
  • 判型缓存 + 纯场景准入止损
  • 会话原地续跑 + 僵尸预留出口
  • 定向返修闭环 + 任务看板 + 内容库存
  • 大脑费按 token 记账 + 对账脚本
  • 自助开户:运营在产品内开店发链接
  • 声音克隆闭环:录完自动做、当场试听
  • 解构端六步链路(本地零 API 费)
  • 主播 person registry(三人已注册)
  • B-roll 检索系统(三个检索器同题可比)

PENDING已提交 · 待合入

  • 会话级美元硬闸:单次会话烧到上限即停
  • 上下文压缩窗口钉死,堵住每步全量重发
  • 烧穿预算单列一类失败原因,不进自动重排
  • 字幕擦除稳定填充实现尚未并入团队 skill

OPEN还没解决

  • 逐镜点菜:首张零件卡试验中,代码未合
  • 换场景口播卡仍是 trial:跑通真单才能挂牌
  • 音色失效不自动重克隆——重克隆要付费且必须人耳确认,自愈留二期
  • 云工厂机常开,实测利用率约一半
  • 失败单已付款项无自动重试或退单归因
  • 动作层真空:走位 / 弯腰只能改讲解镜
  • 根治靠输入侧:需要主播无字幕拍摄母版
  • 平台 AIGC 标注:未标即限流,须发布时勾选
四个可切分的协作面
按「缺口明确 + 契约可写死」排序 · 每一面都能独立交付独立验收
接口面现在是什么状态交接契约
动作层 · motion transfer真空。裁窗 + 口型只能改嘴,改不了走路 / 弯腰;纯 AI 生成又会被打角标驱动视频 + 锚点图 → 替换后视频
自建音色现在租 voice_id:闲置 7 天回收、绑死单一供应商密钥、情绪不可控文本 + 音色底片 → wav
字幕擦除内核自研掩码 + 时域回填;没有干净帧时只能退回逐帧 inpaint,纹理区必糊mp4 + 掩码视频 → 擦净 mp4
图生视频后端 A/B单条可省 $6.09,但分辨率接近不代表运动质感一样,不验完不切同批底图 7 镜 → 可比成片
怎么读这张表

四面都不与主链路耦合:产线通过分镜 JSON 和阶段包交接,任何一面换实现都不动上下游。真正的验收标准也已经写死在第 07 节那七道后期验收门里——能不能过闸门,比谁做的更重要

11
Tech Stack · One Page

一页看全用了什么

单价与规格取自生产在用的零件卡与计价代码,不是模型页标价

环节在用的技术单价 / 规格
编排n8n(10 个 active 工作流)· GitHub Actions 双向同步Fly.io 东京
解构TransNetV2 · RapidOCR · SenseVoice · Claude 看图出稿本地 CPU · 单条 0 元
文生图 / 图生图Seedream 4.0(text-to-image / edit)$0.03 / 张
图生视频MiniMax H3 image-to-video$0.225 / 秒(实付口径)
参考生视频MiniMax H3 reference-to-video$0.225 / 秒 · 超 5 张参考图 +$0.08/张
唇形同步sync-lipsync v2(lipsync-2)$3.00 / 分钟
配音 / 音色克隆MiniMax speech-02-hd · voice-clone$0.10 / 千字 · $1.50 / 次
封面gpt-image-2 + 放大$0.10 / 次
生产大脑qwen3.7-flash(经 OpenRouter)入 $0.03 / 出 $0.13 每百万 token
审片大脑qwen3-vl-235b 看图入 $0.21 / 出 $1.90 每百万 token
批量生图 · 自建RunPod Serverless ComfyUI:SDXL / FLUX.1-dev fp8模型烘焙进镜像,不挂网络卷
批量生图 · 托管Venice.ai chroma(steps 10 · cfg 3.5 · 832×1216)约 10 秒 / 张
实时生图fal FLUX schnell + face-swap约 $0.012 / 张 · 6–10 秒
动作转移(未投产)Wan v2.2-14b animate/replace$0.04 / $0.06 / $0.08 每视频秒
字幕擦除自研时域回填 · TELEA · LaMa · STTN(MIT)本地 $0 · 许可优先于质量
身份判定YuNet 检测 + SFace embedding阈值 0.375 · score ≥ 0.85
合成ffmpeg 单次 filter_complex 全流编码loudnorm I=-14 LUFS · 双声道
子应用ad-studio · xhs-pipe(FastAPI)Fly 东京 / 美区
本地零成本环节B-roll 检索 · 真人裁窗 · 转写 · 切镜头只吃机器时间
一句话总括:一套解构与生成分离、生产与审核分权的视频工作流——一份分镜 JSON 当契约,四张风格卡把画面来源与预算钉死,26 道审片闸门加七道后期验收门挡住返工,钱按逐笔回执记两本账。真正的缺口不在生成质量,在动作层至今是空的,以及每一分钱和每一次放行都要有据可查
继续往下读

产线八个岗位逐站讲开、按症状查故障见 一条视频,里面到底发生了什么;逐单账本与单价表见 视频产线成本量化说明;零件化装配层的来龙去脉见 把三条流水线拆成一个零件柜。复刻产线的分权与失败分类见 短视频复刻产线 · 现状全景;音色克隆 / 唇形 / 表情保真见 换人换声技术方案;解构六步动态图解见 解构复刻产线;图生视频效果归因见 图生视频效果不好,怪谁