给不写代码的人看的生产控制图

一条视频,
里面到底发生了什么?

把“粘一条参考视频”到“拿到可下载成片”之间的黑箱,拆成 8 个能看懂、能定位问题、也知道从哪里优化的工作环节。

1这一站在干什么?

看它吃进什么、里面做什么、最后交出什么。

2坏了会看到什么?

从你能看见的症状,反推最可能出错的环节和证据。

3想变好该改哪里?

把画面、自然度、速度、成本和稳定性分别对应到真正的优化旋钮。

现在有两条流程,
不能混在一起看

一条是目前准备上线的“云端制作 + 人工终审”简版;另一条是目标中的“四段机器审核 + 人工终审”完整版。旧页面把两者画得太像,所以很容易误以为 24 项机器检查已经在生产运行。

当前事实
最新制作工人部署没有通过验真;独立机器审核员也仍未上线。

制作工人的代码已经接入部署流程,但新机器 5 分钟内没有发出“已准备好”的信号,因此系统拒绝承认这次部署。简版路线的设计是一个云端制作工人做完整条、再由人终审;现在还要先修好制作工人并跑通真实任务。

CURRENT DESIGN / 当前准备启用的简版

先做完整条,再由人把关

工人未就绪
工作台提单冻结链接、主播和要求
云端制作从拆解一直做到成片
私有存放成片进 R2 并绑定版本
人工终审完整播放 + 5 项确认
受控下载服务器复验后放行

设计已经接通,但最新部署未通过运行验真。下一步先让云端工人稳定启动,再用一条新任务验证这五站真的能走完。

TARGET / 目标完整路径

每做完一段,就先独立验一段

审核员锁门
文稿做完 → 冻结 → 审核
素材做完 → 冻结 → 审核
口型做完 → 冻结 → 审核
成片做完 → 冻结 → 审核
人工放行看完并确认业务内容

目标价值:问题在哪一段发生,就在哪一段退回;不必等成片做好才发现前面早已出错。

它不是一个 AI,
而是 8 个岗位接力

把系统想成一间视频工厂:前台接单,分析员看原片,配音师做声音,素材员找画面,数字演员对口型,剪辑师拼成片,质检员找问题,店长最后放行。

横向滑动看完整流程 →

接单台把要求钉死

参考链接、标题、主播、补充要求和预算。

分析与写稿弄懂原片

拆结构、辨真假信息、改成品牌主播能说的话。

配音与时钟先有声音

复用已绑定音色配音,并给每个字标出准确时间。

画面导演找 B-roll

把口播翻成画面需求,再查安全素材库。

数字演员嘴跟声音走

只处理主播出镜段,生成新的口型画面。

剪辑台拼成一条片

把主播、素材、字幕、标题和声音放回时间线。

质检室机器找错

目标是分四段检查 24 项;当前尚未生产启用。

店长与门卫人看完再放行

人确认业务内容,服务器核对文件版本后开放下载。

每一站都能看见
输入、动作和出口

下面不是技术架构介绍,而是一套排障格式。左边是岗位,右边从上到下依次回答:它拿到什么、里面做什么、交出什么、坏了怎么看、想变好改哪里。

STATION 01

接单台
先把任务钉死

后面所有人都只认这里冻结的要求。它像一张不能偷偷改字的工单。

吃进去参考视频链接、标题、主播、补充要求
吐出来一条有编号、有预算、有当前状态的任务
盒子里面做 3 件事
  1. 验证链接不是危险地址,避免服务器被引到内网。
  2. 把主播形象和对应音色绑定,防止人脸和声音串人。
  3. 写入任务账本,并规定由云端还是本机领取。
坏了会看到

任务提交失败、一直排队、被错误机器领取,或同一条被重复生产。

怎么查 / 怎么优化

先看任务卡的“状态、当前步骤、错误、费用、日志”。优化重点是表单默认值、任务去重和需求写清楚。

技术原名Store Workbench(Next.js)+ Supabase 任务表 + runner target + 稳定 claim ID
STATION 02

分析员与编剧
先听懂,再改写

不是把原片逐字照抄,而是保留有效结构,换成品牌主播真实、顺口、可负责的话。

吃进去参考视频 + 已冻结的标题和要求
吐出来原片转写、结构拆解、最终口播稿
盒子里面做 3 件事
  1. 下载并转写原片,分清主播画面和说明画面。
  2. 提取清单、数字、因果关系和镜头节奏。
  3. 按“替业主把关的顾问”人设重写,并检查长短与句子负担。
坏了会看到

意思跑偏、漏掉关键点、主播身份一会儿像业主一会儿像反派,或文稿太长导致后面都变快。

怎么查 / 怎么优化

并排看“原片转写 → 结构拆解 → 最终稿”。优化先改信息取舍和句子长度,不要等配音后靠加速补救。

技术原名Whisper 只负责听写参考片;云端 AI 制作代理按 douyin-replica 规则改稿;script_guard 做长度和结构检查
STATION 03

配音师与时钟
让每个字有位置

先把文字变成声音,再测出每一句、每个字真正说到哪里。后面切画面和放字幕都靠这只“时钟”。

吃进去通过长度检查的口播稿 + 已绑定音色
吐出来配音文件 + 逐字时间表
盒子里面做 3 件事
  1. 预算先算一遍,超过单条 6 美元就停止重规划。
  2. n8n 代替制作工人向 fal 提交 MiniMax 配音,并记录唯一付费单号。
  3. 用已知文稿强制对齐声音,得到逐字时间,而不是重新猜一遍说了什么。
坏了会看到

声音生硬、停顿奇怪、语速过快、错音,或者字幕和换镜节奏从这里开始整体漂移。

怎么查 / 怎么优化

先听纯配音,再看逐字时间表。优化顺序是改文稿标点与句长 → 调语速 → 必要时重做配音;不要先动剪辑。

技术原名fal · MiniMax Speech-02-HD + n8n 付费防重账本 + FunASR 强制对齐
STATION 04

画面导演
把“说的话”翻成“看得见的东西”

B-roll 最容易形成黑箱。真正决定质量的不是搜素材,而是搜索前有没有把抽象口播翻成具体画面。

吃进去逐句口播 + 每句的开始和结束时间
吐出来每句话对应的安全镜头 + 完整分镜表
盒子里面做 3 件事
  1. 判断这句话需不需要画面,并写成具体可见的搜索描述。
  2. 用“意思相近”检索安全素材,打散同源和重复镜头。
  3. 返回前三名、存疑或明确“没有”;选定后复制进任务目录并竖屏裁切。
坏了会看到

画面不对题、同一客厅反复出现、陌生人脸、竞品标志、素材短到看不清,或源片画面被偷偷复用。

怎么查 / 怎么优化

按“口播原句 → 画面翻译 → Top-3 → 实际选中”四栏检查。优化先改画面翻译与素材库存,再调相似度门槛。

技术原名broll-plan + SQLite broll.db + BGE 中文向量检索 + 安全过滤 + gap-log / match_experience
STATION 05

数字演员
只让主播的嘴跟上声音

它不重新生成人,也不碰 B-roll。它只拿真人主播底片和新配音,重做需要出镜的嘴部运动。

吃进去主播真人底片 + 新配音 + 真实时长
吐出来已经说出新文稿的主播片段
盒子里面做 3 件事
  1. 把底片和音频放到只有短时权限的私有地址。
  2. n8n 用唯一单号把任务交给 fal 的口型模型,断线后继续原任务而不是重复付费。
  3. 下载结果并立即删除临时地址文件,只保留任务产物和费用证据。
坏了会看到

嘴慢半拍、某个字嘴型错、下半张脸扭曲、牙齿糊掉,或任务重复扣费。

怎么查 / 怎么优化

先定位具体坏段和具体秒数,只重跑那一小段。优化底片正脸清晰度、嘴部尺寸和片段长度,不要盲目整条重做。

技术原名私有 R2 短时 URL → n8n → fal sync-lipsync v2(lipsync-2)→ Store operation ledger
STATION 06

剪辑台
把所有零件装回时间线

这一步不决定“说什么”,而是决定画面、声音、字幕和标题是否在同一时刻出现。

吃进去主播片段、B-roll、配音、逐字时间、样式
吐出来1080 × 1920 的 30 帧竖屏成片
盒子里面做 3 件事
  1. 按累计帧数切片,避免每段取整把误差越积越大。
  2. 把主播和 B-roll 放进分镜,再叠加字幕、标题卡、文档卡和音效。
  3. 统一编码、帧率和音轨,写出最终组成清单。
坏了会看到

字幕提前或落后、切镜露出上一帧、黑屏、闪一下、声音和画面总时长不一致。

怎么查 / 怎么优化

对照逐字时间表和最终组成清单,在出错秒数看是哪一个组件。优化帧边界、字幕排版和镜头时长,不要回头重做配音。

技术原名FFmpeg 负责切片、拼接和编码;Pillow 负责把文字画成透明图;OpenCV 负责部分画面分析
STATION 07

独立质检室
不做片,只找错

它应该和制作工人分开:看得到冻结产物,但拿不到制作和发布权限,避免自己给自己打满分。

吃进去当前阶段被冻结的文件 + 上游已通过证据
吐出来绑定当前版本的 PASS / WARN / FAIL / 未执行报告
盒子里面做 3 件事
  1. 先重新计算文件指纹,确认收到的就是提交审核的那一版。
  2. 按文稿、素材、口型、成片四段运行固定清单,共 24 项。
  3. 任何失败、未执行或必检跳过都退回当前阶段;通过才打开下一站。
坏了会看到

报告写通过但文件后来变了、检查没跑却像通过、制作工人能改审核代码,或换素材后旧报告仍有效。

怎么查 / 怎么优化

看“报告对应的文件指纹、检查清单、未执行项、审核员身份”。优化检查覆盖率和误报,不允许绕过未执行项。

技术原名独立 Fly Reviewer + Whisper / Qwen 语义检查 + YuNet / SyncNet / WeSpeaker + SHA-256 证据链;当前未部署
STATION 08

店长与门卫
最后一关仍然是人

机器能抓结构和技术问题,但不知道这家店的价格、服务范围和真实业务承诺是否还能对外说。

吃进去可预览成片 + 检查结果 + 当前业务事实
吐出来可下载成片,或一条明确返工意见
盒子里面做 3 件事
  1. 播放器必须真的从头播到结束,不用“我大概看了”代替。
  2. 人工确认:人物声音自然、材料正确、价格正确、地区联系方式正确、没有客户隐私。
  3. 服务器再算一遍成片指纹和仓库版本,完全一致才发短时下载票。
坏了会看到

无法勾选、无法批准、下载按钮被挡住,或明明刚审过但换版后又要求重审。

怎么查 / 怎么优化

看完整播放记录、5 项人工清单、当前文件指纹和放行回执。优化人工表述和返工定位,不应取消这道关。

技术原名浏览器 ended 回执 + 人工五项检查 + Store 服务端 ETag / SHA-256 复验 + 短时下载票据

素材库不是“搜一下”,
而是一条会学习的闭环

B-roll 是主播说话时插入的说明画面。最关键的纪律有两条:只从安全放行的段里找;没有合格镜头时必须说“没有”,不能拿最像的一条硬填。

4,842正式素材目录里的段总数
4,550安全放行且已有“意思坐标”的段
110真实选用或淘汰经验,会影响下次排序
148 月 5 日核对后新增、尚未进入当时 R2 清单的片段

横向滑动看完整 B-roll 闭环 →

口播分句

先知道这句话从第几秒说到第几秒。

判断要不要画面

章节总起句可以不配,不能每句话都硬塞素材。

翻成画面话

把“要注意防水”写成镜头里真正能看见的动作和物件。

按意思检索

不是只搜相同词,而是比较句子和素材描述的意思距离。

安全与重复过滤

挡住陌生正脸、水印、黑名单、同源扎堆和已删除窗口。

人选 + 裁切

打开前三名看画面,选中后复制进任务并做竖屏构图。

结果回流

用得好、淘汰、缺货都记账,让下次排序和补货更准。

有合格镜头 · OK

仍要打开画面确认;“机器说像”不等于“人看着能用”。

勉强相关 · 存疑

优先改画面描述;仍然弱就补货或回到主播画面。

没有镜头 · NO MATCH

进入缺货本。正确答案是“没有”,不是把第一名强行塞进去。

为什么常常“搜到了却不对题”?

多数不是搜索模型太笨,而是输入仍是抽象口播。例如“装修别被坑”没有可见画面;必须翻成“工人用水平尺检查墙砖平整度”这种具体镜头。

为什么“库里有”不等于“成片能用”?

还要同时满足安全、相关、可竖屏裁切、没有源片复用、时长够看清。当前 4,550 只代表通过安全与向量门,不代表每个题目都有好答案。

机器审核不是一句“看起来没问题”,
而是 24 个明确问题

完整版的核心是“做一段、冻一段、审一段”。如果文稿已经错了,就不该继续花钱配音;如果口型坏了,就只退回口型阶段,不要整条重来。

制作工人完成本阶段Store 冻结文件并记指纹独立审核员逐项检查通过才打开下一阶段失败或未执行就原地返工

横向滑动看四阶段 24 项 →

01

文稿 · 4 项

问清楚“说得对不对”
  • 拿到的参考片真的是提交的那一条吗?
  • 文稿结构完整,没有缺项或空稿吗?
  • 参考片和任务要求里的关键事实都被覆盖了吗?
  • 标题、备注、主播身份等硬要求都满足了吗?
02

素材 · 5 项

问清楚“画面用得对不对”
  • 是不是反复用了同一个房间或同一构图?
  • 画面对题吗?有没有竞品标志或不该出现的文字?
  • 有没有偷用被复刻原片的画面?
  • B-roll 里有没有陌生人正脸?
  • 一个素材段内部有没有藏着突然切换的另一镜?
03

口型 · 7 项

问清楚“人和声音对不对”
  • 嘴部和下半张脸有没有被画坏?
  • 嘴和声音有没有前后错开?
  • 停顿有没有异常长或异常短?
  • 语速是不是超出正常范围?
  • 片段首尾有没有一闪而过的坏帧?
  • 实际音轨说的是已经通过的那版文稿吗?
  • 出镜的人和说话的声音都是指定主播吗?
04

成片 · 8 项

问清楚“交付的是不是那一版”
  • 成片文件指纹和提交记录一致吗?
  • 最终音轨语速正常吗?
  • 文件可完整解码,且真的是固定 30 帧吗?
  • 成片声音仍与已通过文稿一致吗?
  • 最终时间线真的由前三段已通过的零件组成吗?
  • 有没有原片或原主播残留?
  • 字幕、标题和说话时间对得上吗?
  • 最终人物和声音身份仍然正确吗?
PASS / 通过

这一项有证据支持,可以继续。

WARN / 需人判断

只有预先允许的灰区能出现,不能随意降级问题。

FAIL / 失败

已经发现明确问题,当前阶段退回返工。

NOT RUN / 未执行

检查没有真正跑起来,比失败更危险;必须阻断。

当前生产实况:这 24 项还没有独立审核员执行。

代码和检查清单已经存在,但 Reviewer 部署仍被 false && 锁住;目前简版任务的自动检查必须如实显示“未执行”,不能拿本地测试、CI 通过或页面能打开来代替生产审核。

先别猜技术原因,
先看你眼前的症状

下面把常见的“我看到什么”直接映射到“最可能坏在哪一站、先看什么证据、通常怎么修”。这样不会一有问题就整条重跑。

表格可横向滑动 →

你看到的症状最可能的环节第一眼看哪里常见修法
任务提交后一直不动01 接单 / 云端工人任务卡的状态、当前步骤、错误;云 worker 是否在线且领取 cloud 队列。先修部署或队列归属,不要重新提一条制造重复任务。
说漏了重点,或意思跑偏02 分析与写稿原片转写、结构拆解、最终稿三者并排比较。修事实提取和改稿规则;不用重做素材库。
整条太快、太挤、不像人说话02 写稿 / 03 配音稿件字数、最长句、纯配音、实际时长与目标时长。先删稿和拆句,再调配音速度;不要用剪辑硬加速。
画面和口播不搭04 B-roll口播原句、画面翻译、前三候选、实际选中镜头。先把抽象口播重写成具体画面话,再重新检索。
同一个房间反复出现04 B-roll候选是否来自同一源片、分镜里是否重复使用同一段。提高同源打散和跨镜重复检查;补不同场景库存。
出现陌生人脸、竞品标志或原片04 素材 / 07 审核素材安全字段、全帧画面检查、源片复用结果。直接换素材;同时把漏网镜头写入回归用例。
嘴很吓人,或某个字对不上05 数字演员原底片与口型结果同秒对比;查看坏段和报警秒数。只重跑坏段;改善底片角度、嘴部清晰度和片段长度。
字幕慢半拍,越到后面越偏03 时钟 / 06 剪辑逐字时间表、累计帧边界、字幕出现帧和画面切换帧。若从头就错,重做对齐;若越积越错,修帧取整算法。
预览正常但不能下载08 放行门卫是否完整播放、5 项是否全勾、当前文件指纹和仓库版本是否一致。补齐人工终审;若文件变化,必须针对新版本重新看。
改了一个镜头,旧审核突然失效07 版本证据链新旧文件指纹与受影响阶段。这是正常保护:从素材阶段向后重审,不必重审未变化的文稿。
统一排障顺序:先保留现场 → 记下任务编号和出错秒数 → 找到这一站的输入、输出与文件指纹 → 只重做最小坏段 → 重新审核受影响的当前阶段和下游。

“视频更好”太笼统,
要先说想让什么变好

画面更准、人物更自然、生产更快、成本更低、系统更稳,分别对应不同环节。先选目标,再动对应旋钮,才不会修了 A 却把 B 弄坏。

01

画面更对题

先看
04 B-roll:画面翻译、候选排序、缺货本。
先改
把口播改写成具体物件、动作、空间和镜头远近;补高频缺货。
别先改
不要一上来换搜索模型。输入含糊时,换模型通常只是更自信地搜错。
02

主播更自然

先看
02 文稿、03 配音、05 口型的分段结果。
先改
缩短长句,调整停顿和语速,选择正脸清晰、嘴部足够大的底片。
别先改
不要整条重做。先确定是“说话不自然”还是“嘴型不自然”。
03

生产更快、更便宜

先看
各阶段耗时、fal 付费记录、重跑原因、真人出镜总秒数。
先改
付费前把稿和分镜定稳;复用已有音色;只重跑坏段;复用已完成的 operation。
别先改
不要用跳过审核、降低画质或重复提单换速度。
04

系统更稳定

先看
01 队列、07 版本证据、08 下载放行和云端部署记录。
先改
失败可恢复、同一单号防重、每次交接绑定文件指纹、错误说清具体阶段。
别先改
不要把“页面 200”或“进程还在”当作一条任务真的跑通。
最重要的优化原则:问题在哪一站产生,就尽量在哪一站发现并修掉。越晚才发现,重做范围越大,成本也越高。

你不需要背这些词,
只要知道它们各自负责什么

排障时可以直接说人话,再把右边的技术原名交给技术人员。例如:“B-roll 找到的画面不对题,请查画面翻译和 broll-retrieve。”

Store Workbench总控制台

收任务、记状态、看进度、做人工终审和最后放行。

Workflow生产说明书

放着复刻规则、制作脚本、审核清单和每次修改记录。

Cloud Producer云端制作工人

在 Fly 服务器接单,按说明书从拆解一直做到成片。

n8n自动接力器兼付费账本

替制作工人调用付费模型,并确保断线重试不会重复花钱。

fal云端模型商场

实际提供 MiniMax 配音和 sync-lipsync 口型服务。

R2私有文件仓库

保存素材和成片;外部只拿短时访问票,不暴露永久公开地址。

broll.db素材目录

记录每个素材段是什么、是否安全、在哪里、它的“意思坐标”是什么。

BGE embedding意思坐标

把画面描述变成一串数字,用来找“意思相近”而不只是“字面相同”。

FFmpeg自动剪辑工具箱

切片、拼接、换尺寸、对齐帧率、处理音轨并输出成片。

Reviewer独立机器质检员

只读冻结文件并出报告,不能制作,也不能发布。

SHA-256文件指纹

文件只要改一个字节,指纹就会变;用来证明审的是哪一版。

ETag仓库版本号

证明文件仓库里的对象没有在审核后被替换。

先达到“可监督试生产”,
再达到“可稳定规模化”

两种“能用”必须分开。简版路线跑通后,可以由人全程盯着试生产;只有独立审核员和四阶段证据链也真实跑通,才接近稳定规模化。

已完成
总控制台与私有任务账本

线上 Store 已部署当前主干;任务、预算、人工终审和受控下载逻辑已经存在。

Store main a1256ec · deploy success
验真失败
云端制作工人部署当前版本

代码已经部署到新机器,但机器 5 分钟内始终没有发布就绪信号,当前版本没有获得“可接单”认证。

Workflow 853da6a · run 31070288870 failed
位置:runtime SHA / readiness verification
症状:缺 /run/video-worker-ready
未验收
跑一条新的真实云任务

必须实际经过下载原片、改稿、MiniMax 配音、口型、B-roll、合成、私有上传、人工五项和下载。

不能用 CI、dry-run 或旧任务代替
仍锁门
部署独立机器审核员

Reviewer 仍被 false && 关闭;角色隔离、模型、密钥和线上预检还没有生产验收。

deploy-video-reviewer.yml skipped
未执行
四阶段 24 项完整闭环

需要真实证明文稿 → 素材 → 口型 → 成片每段都能冻结、审核、失败返工、通过推进,最后再由人放行。

目标是生产 E2E,不是测试报告