流程演示 · Pipeline Demo · 2026-07-10

视频解构流水线
一条抖音视频 → 能照着重拍的文字稿

贴一条抖音链接进来,几分钟后拿到两样东西:分镜文字稿(每个镜头拍什么、怎么拍、几秒)和解说词文字稿(带时间戳的口播全文)。整套流程已经在真实视频上端到端跑通,下面所有截图和数据都来自实测,不是设计稿。

00:0000:1500:3000:4501:0001:32
92 秒
测试视频时长(灿哥聊装修·真人口播类)
≈8 分钟
单条全流程耗时·默认档(要抠表格小字开 --ocr-server,约 45 分钟)
¥ 0
单条 API 花费——转写和识字全在本机跑
34 镜
产出分镜稿精确到 0.1 秒(TransNetV2 物理边界)
0 处
质检结果:盲写复刻脚本与原片矛盾数

OVERVIEW整体框架:六步流水线

核心思路一句话:一条视频里的信息分三种——画面、文字、声音,各派一个「专门工种」去榨取,最后由 Claude 汇总成稿,再用「盲测」验收。下面每一步都标了输入 → 输出,和它用的工具。

STEP 1

取片:链接变成干净视频

工具:自家 dewm 去水印服务
抖音链接 / 分享口令→ 无水印 mp4 文件

把抖音链接(或一批链接)交给团队已有的去水印工具,自动下载出无水印视频。这一步是现成的,7 月初刚批量用过。

STEP 2

切镜头 + 抽帧:把视频变成一沓「剧照」

工具:TransNetV2 切镜头模型 + ffmpeg 抽帧
mp4→ 34 个镜头边界 + 带时间戳的关键帧

用专门训练过的切镜头模型(TransNetV2,公开测试准确率 87%)逐帧找剪辑切点,再在每个切点截图。92 秒的测试视频检出 34 个物理镜头——比最初用的 ffmpeg 土办法多找回 2 个漏掉的镜头、纠正了 8 处边界时间(质量审查后 7/10 晚换装)。下面是其中 6 张真实抽帧:

00:00 封面帧:新房开工大字报
t=00:00 封面
00:03 口播:红色安全帽主讲人
t=00:03 口播
00:04 密码盒特写
t=00:04 特写
00:14 前置过滤器安装
t=00:14 实拍
00:39 地漏芯原理图卡
t=00:39 图卡
01:24 建材清单表格
t=01:24 表格

从这 6 张就能看出视频骨架:封面 → 口播 → 实拍佐证 → 产品图卡 → 引流表格。

STEP 3

拿文字·双保险:一个「看字幕」+ 一个「听声音」

工具:RapidOCR·PP-OCRv5 mobile 模型(识字,可升 server)+ SenseVoice(听音,阿里开源)
视频画面 + 音频→ 两份互相校对过的解说词

轨道 A「看字幕」:抖音视频几乎都有博主自己压上去的字幕——那就是作者亲手写的标准答案。我们把每帧画面的字幕区裁出来(如下图),用 OCR 识字,得到 79 条带时间戳的字幕:

字幕带裁剪示例:第一、改水电之前(红色高亮)

↑ 真实的字幕带裁剪图。OCR 从这里读出「第一、改水电之前」,连哪几个字是红色高亮都看得到。

轨道 B「听声音」:用阿里开源的 SenseVoice 在本机把音频转成文字(不用联网、不花钱)。选它是实测选出来的——同一条视频,两个模型的听错对比:

原文(真实台词)whisper-small 听成SenseVoice 听成
前置过滤器潜质过滤器 ✗前置过滤器 ✓
止逆阀纸捏法 ✗止逆阀 ✓
角阀、球阀脚伐球伐 ✗角阀球阀 ✓
纯铜加厚纯同加厚 ✗纯铜加厚 ✓
第二、瓦工进场之前把地漏准备好整句漏掉 ✗完整听出 ✓
全片合计听错 11 处听错 2 处

互校规则:两轨对不上时,以字幕为准(作者自己写的);字幕 OCR 偶尔认错字(比如把「真的闹心」认成「夏的闹心」),再用语音轨修回来。双保险跑完,解说词基本零错。

STEP 4

判运镜:把相邻两帧放一起「找不同」

工具:ffmpeg 每秒抽帧 + Claude 对比
每秒 1 帧的连续图→ 每个镜头的运镜标注

单看一张图判断不了镜头在怎么动,但把间隔 1 秒的两帧放一起就行:画面整体变大 = 镜头在推近;画面平移 = 在横摇;构图不变但从模糊变清晰 = 焦点在变。真实例子——脏滤芯镜头的相邻两帧:

00:19 滤芯特写:全画面虚焦
t=00:19 全虚焦
00:20 滤芯特写:焦点清晰
t=00:20 焦点实了

↑ 构图一模一样、一虚一实 → 判定为「焦点由虚到实」(专业叫 rack focus),这是全片唯一的技巧运镜,写进了分镜稿。整片判出 7 种运镜:三脚架固定、手持跟拍推进、手持微晃、固定俯拍、焦点变化、长图上滚等。

STEP 5

Claude 汇总出稿:四份产物

工具:Claude Code 看图 + 汇总(本会话内完成,不额外花钱)
36 帧 + 双轨文字 + 运镜标注→ 分镜稿 + 解说词 + 风格参数 + JSON

Claude 把所有素材汇总成四份东西。① 全片风格参数——复刻整体感用的(人设、节奏、字幕规矩、配音情绪);② 七要素分镜表——每镜一行,真实节选两行:

镜号时间景别运镜画面台词字幕样式
S0900:19.3-22.8大特写焦点由虚到实滤芯截留的泥沙污物泥沙、虫卵、铁锈这些大颗粒都给你过滤掉「泥沙、虫卵、铁锈」红字
S2200:54.9-56.9俯拍铺陈固定正俯角阀球阀开箱铺满地面(约9-10件)角阀、球阀都得提前准备好「角阀、球阀」红字高亮

③ 解说词终版(带时间戳,双轨互校后基本零错);④ pipeline_config.json——给以后「AI 重新生成视频」的环节直接读的机器格式,节选:

{ "id": "S09", "t": [19.3, 22.8], "type": "broll", "camera": "static_rack_focus_blur_to_sharp", "scene": "dirty_filter_sediment", "vo": "能把水里的泥沙、虫卵、铁锈这些大颗粒都给你过滤掉" }

机位、景别、时长都变成了固定字段——后面接文生图、图生视频的环节可以直接按参数干活,不用再猜。

STEP 6

质检:反向重建测试(盲测)

工具:一个「没看过原片」的 Claude 子 agent
只给文字稿→ 可开拍的重拍脚本 + 缺口清单

怎么知道文字稿够不够好?找一个从没看过原视频的 AI,只给它文字稿,让它写一份「照着能拍」的重拍脚本——它写不出来的地方、拿不准的地方,就是文字稿缺的信息,藏不住。

实测结果:盲测 agent 写出的 32 镜重拍脚本,与原片逐镜对照后零矛盾——结构、台词、时长、景别、运镜全部还原。它标出的 16 条「拿不准」,有 10 条我们回头用帧证据补上了(比如封面版式、主讲人外形、道具数量);剩下 6 条(字幕字体名、特效模板、BGM 有无这类)是画面里本来就没有的信息,任何工具都拿不到,复刻时按自己团队规范定即可。

这个盲测还立了一功:文字稿里有一段主动标注「S30 是否有捏阀门的实物演示,没拍到证据」——复查原片连续帧后确认是纯口播。宁可标「不知道」也不瞎编,是整套流程的质量底线。

TOOLS工具清单:每个环节用什么、花多少钱

所有工具都已在本机(夏夏这台 Windows)装好并实测通过。除了大模型汇总(走 Claude Code 会话本身),没有任何按次付费的 API

工具负责什么费用备注
dewm 去水印抖音链接 → 无水印 mp4自家服务已有,跑在团队 worker 上
ffmpeg切镜头检测、抽帧、提音频免费开源本机已装 8.1.2
claude-video 插件把「下载→抽帧→转写」打包成一条命令免费开源GitHub 5400+ 星;中文 Windows 要设 PYTHONUTF8=1(已踩坑并解决)
TransNetV2切镜头检测(找准每个镜头的起止点)免费开源专用深度模型,准确率 87%;92 秒视频 CPU 跑 1.5 分钟
RapidOCR + PP-OCRv5抠画面里的烧录字幕(轨道 A)免费开源mobile 模型默认(184 张 182 秒),小错靠语音轨互校修回、终稿残错 0;抠表格/小字才开 server 档(39 分钟)
SenseVoice音频转文字(轨道 B),中文错误率约为 whisper 的 1/5免费开源阿里出品,国内下载无障碍;92 秒音频 CPU 转 11 秒
Claude(本会话)看帧、判运镜、汇总出稿、盲测质检会话额度看一条 92 秒视频约几万 token,合几毛钱级别

调研阶段淘汰的方案:TwelveLabs(海外付费视频理解服务,杀鸡用牛刀)、whisper-small(听错太多,已被 SenseVoice 替换)、通义听悟(适合小时级长视频,短视频不划算)。备选待实验:Qwen3-VL / GLM-4.6V 整段吞视频(可能把六步压成一步,待 A/B 对比)。

RESULT效果展示:真实产物什么样

测试对象:灿哥聊装修《新房开工少备一样都停工》,92 秒口播+实拍混剪。三份产物文件都在仓库里,随时可看。

解说词文字稿(节选,双轨互校终版):

[00:13] 第一、改水电之前,提前准备一个前置过滤器。 [00:16] 这东西是全屋用水的第一道防线, [00:18] 能把水里的泥沙、虫卵、铁锈这些大颗粒都给你过滤掉。 [00:27] 第二、瓦工进场之前,把地漏准备好。 ← 这句语音漏了,靠字幕轨救回 [00:30] 那种不锈钢的地漏就别用了,用不了两三年就生锈了……

分镜文字稿:34 镜 × 七要素(时间/时长/景别/运镜/画面/台词/字幕样式,含 TransNetV2 找回的封面静帧和短口播两镜),加一张全片风格参数表(人设、平均 2.7 秒/镜的节奏、黄色=建议红色=警示的高亮规律、快语速警告式配音)。

产物文件

能力边界(直说):画面里有的信息基本都能拿到;画面里没有的拿不到——字幕用的字体名、特效是剪映哪款模板、BGM 具体是什么、评论区怎么承接引流,这四类要靠人工定或问原作者。另外运镜只能判到「固定/手持/推近/焦点变化」这一级,推拉的速度曲线判不了。

NEXT现状与下一步