调研报告 · 已定案 · 2026-07-10 · 夏夏 × Claude

视频解构工具调研
视频 → 分镜文字稿 + 解说词文字稿

调研起点是《ai 洗稿.pdf》的工具推荐;经过工具核实、本机实测、盲测验收三轮,方案已定案。本页回答一个问题:每个环节到底用什么、为什么,以及哪些查过但不用。全流程的动手演示(真实抽帧图、实测数据)在姊妹页:流水线全流程演示 →

00:0000:1500:3000:4501:00

定案最终方案:每个环节用什么(一张表说清)

总原则:不买重型 SaaS、不从零造轮子。解构 = 取片 → 抽帧 → 拿文字 → 判运镜 → 汇总 → 质检 六个环节,每个环节挑一个「便宜、本机能跑、对中文准」的现成积木,Claude 负责粘合与汇总。全流程已在真实视频上端到端跑通,单条约 3 分钟、API 花费 0 元。

环节定案工具费用淘汰/替补了谁
① 取片dewm 去水印(自家)已有不依赖 yt-dlp 对抖音的支持
② 切镜头抽帧TransNetV2 切镜头
+ ffmpeg 抽帧(7/10 晚换装)
免费替换 ffmpeg 场景检测:同片实测纠正 8+ 处边界、找回 2 个漏掉的镜头;淘汰 TwelveLabs(付费云索引)
③ 拿文字·字幕轨RapidOCR + PP-OCRv5 mobile 默认
(--ocr-server 按需升 server 档)
免费mobile 3 分钟出稿,形近字滑笔全被语音轨互校兜住 + 噪声词过滤;抠表格/小字才升 server(39 分钟)
③ 拿文字·语音轨SenseVoice(阿里开源)免费淘汰 whisper-small:同片实测 11 处听错 vs 2 处
④ 判运镜1fps 相邻帧对比 + Claude免费ShotVL 专项模型留作升级项(批量后不准再上)
⑤ 汇总出稿Claude 七要素模板 + JSON会话额度产出:风格参数 + 32 镜分镜表 + 解说词 + pipeline_config.json
⑥ 质检反向重建盲测会话额度没看过原片的 agent 盲写重拍脚本,缺口自动暴露

验收结论(2026-07-10 实测):92 秒真实视频跑完全流程,盲测重拍脚本与原片零矛盾;16 条信息缺口中 10 条用帧证据回填,剩 6 条属于画面外信息(字体名/特效模板/BGM),任何工具都拿不到。格式已定型,并已于 07-11 包成团队 skill douyin-deconstruct 上线。

对比逐环节候选对比:为什么当前选择是质量×性价比最优

「视频解构」= 把一条视频里三种信息(画面、文字、声音)各自榨干再合并,所以拆成六个环节。每个环节把调研过的候选摆在一起比——高亮行 = 当前选择。选型标准:质量优先,但为可忽略的质量差距付出数量级的成本不干。每一步的输入输出和真实产物截图见演示页

① 取片:链接 → 无水印 mp4

候选质量成本 · 速度判定
dewm(自家服务)✓无水印原片,7 月批量验证过0 元 · 秒级已有基建,直接用
yt-dlp对抖音支持时好时坏免费不依赖它,避免脆弱环节
第三方去水印 API不稳定付费,数据过第三方没必要

为什么最优:自家服务免费秒级且已被批量验证,没有比它更优的选项存在。

② 切镜头:找准每个镜头的起止点

候选质量(切分准确率)成本 · 速度判定
TransNetV2 ✓87%(公开基准最高);同片实测比 ffmpeg 多找回 2 镜、纠正 8+ 边界免费 · 92s 视频 CPU 1.5 分钟质量榜首恰好免费,直接选
PySceneDetect65.5%免费 · 更快准确率差一档
ffmpeg 场景阈值(v1 曾用)更粗(实测漏 2 镜、8 处边界偏移)免费 · 秒级已被实测淘汰,留作兜底
TwelveLabs(云端)好,但为检索场景设计$0.042/分钟起 + 视频出海付费买不到增量质量

为什么最优:这个环节质量第一名(TransNetV2)本身就是免费开源的小模型,质量和性价比不冲突,唯一代价是 1.5 分钟计算时间。漏镜头是解构最致命错误,这里值得用最好的。

③a 字幕轨:抠画面里的烧录字幕(口播稿的标准答案)

候选质量(同片 184 张实测)成本 · 速度判定
PP-OCRv5 mobile 全家桶 ✓ 默认装修专有名词全对;约 10 处形近字滑笔 + 1 行漏识,全部被语音轨互校修回,终稿残错 0;背景板杂词由噪声过滤器(形近变体聚类 + 出现率阈值)剔除免费 · 182 秒互校兜底后质量与 server 档终稿等同,快 13 倍
PP-OCRv5 server(--ocr-server 升级档)单轨即残错 0(修复旧默认全部 4 处硬伤)免费 · 39 分钟(此前按中途日志误报 13 分钟,已实测更正)抠表格/画面小字、无语音可互校时才开
混搭(mobile 检测 + server 认字,曾试)与金标准漏 96 行/多 97 行,直接崩免费 · 21 分钟实测淘汰:两模型框位不兼容
相邻帧哈希去重再 OCR(曾试)质量不变只省 16%(动态亮背景打穿哈希)实测无效,已从代码移除
RapidOCR 旧默认模型(v1 曾用)残错 4 处(夏的闹心/等于自装等)免费 · 1 分钟快但错,被实测替换
PP-OCRv6(2026-06 新出)比 v5 server 再 +5%免费 · 同框架换模型文件平滑升级项,稳定后一行配置切换
大模型逐帧 OCR(Qwen-VL 等)最强(含排版理解)按帧烧 token,一条视频几块钱为最后一点提升付百倍成本,不值

为什么最优:关键洞察是「OCR 单轨不需要做到满分」——它后面还有语音轨互校这道保险,mobile 档的形近字滑笔恰好是互校最擅长修的错型。同片 A/B 实测:mobile+互校的终稿和 server 档终稿完全等同,但只花 1/13 的时间。server 档保留为 --ocr-server 升级开关,专攻表格/画面小字这类语音兜不住的场景。

③b 语音轨:音频 → 带时间戳文字(与字幕轨互校)

候选质量(中文字错率 CER)成本 · 速度判定
SenseVoice ✓7.81%;同片实测仅 2 处小错,双轨互校后残错 0免费 · 92s 音频 CPU 11 秒互校后到顶,更强模型无边际收益
whisper-small(v1 曾用)~20%;实测 11 处听错免费被同片实测淘汰
FireRedASR-LLM 8.3B3.05%(开源榜首)免费但需 NVIDIA GPU / 17GB+ 内存,本机与 Mac Air 均跑不动质量王但跑不了;且互校后收益≈0
FireRedASR-AED 1.1B3.18%免费 · CPU 可跑但慢无字幕视频场景的第一预案
Qwen3-ASR / 通义听悟 API强(尤其中英混说)按量付费 · 国内直连无字幕视频批量时与 AED 版对决

为什么最优:关键在「双轨」——字幕轨已是作者手写的标准答案,语音轨只负责补缺和互校,7.81% 的 CER 在互校后残错已经是 0,换 3% 的模型买不到任何可见改善。真正的分水岭是无字幕视频(单轨裸奔),那是 AED 版和 API 的出场条件,已列入备选预案。

④ 判运镜:固定/手持/推近/焦点变化

候选质量成本 · 速度判定
相邻帧对比 + Claude ✓判 5 类运镜,盲测重建 0 矛盾会话额度内 · 即时行业天花板低,简单方法已够格
ShotVL-3B(专项模型)8 维镜头语言,但全行业该基准最高不到 60%免费 · 本机 CPU 慢到不实用生成端要焦段/光型参数时再上
光流法(RAFT 等)只擅长平移类运动工程量大投入产出不成比例

为什么最优:镜头语言识别全行业都不及格(最强模型 <60%),此时砸重工具买不来质量,简单方法+盲测验证反而是性价比顶点。免费微调空间还有:对比帧加密到 2fps。

⑤ 看图汇总:帧+文字 → 七要素分镜稿 + JSON

候选质量成本 · 速度判定
Claude(本会话)✓多模态第一梯队;盲测验证出稿可直接开拍会话额度内,零增量 API 费 · 粒度完全可控质量瓶颈在喂料密度不在模型
Qwen3-VL / GLM-4.6V 整段吞能力强,镜头切分粒度待验便宜 API · 国内直连批量时 A/B,赢了可把三步压一步
Gemini 2.5 视频理解同级需代理 + 新开 Google key国产可平替,不引入

为什么最优:汇总模型本身已是第一梯队,提质量的正确姿势是加钱调「喂料档位」(帧数 100→不设上限、分辨率 512→1024px,重点视频单条多花一两块),而不是换模型。

⑥ 质检:证明文字稿够「照着重拍」

候选质量成本 · 速度判定
反向重建盲测(单 agent)✓实测揪出 16 条信息缺口、验证 0 矛盾会话额度 · 每条约 3 分钟已证明有效;批量后按 1/10 抽样跑
多裁判盲测(2-3 独立互评)更稳3 倍会话成本重点对标视频才值得
纯人工对照最准最贵最慢抽样复核用,不做常规流程

为什么最优:质检的目的是防错不是追分。单 agent 盲测已证明能暴露缺口,批量后抽样跑住成本,重点视频再升多裁判——按风险分层花钱。

工具工具全景:采用 / 备选 / 淘汰

调研共覆盖 14 个工具/方案,按最终去向分三组。只想知道用什么的看上面定案表就够了,这一节是「为什么」的存档。

✓ 已采用

实测通过,进入流水线

7
TransNetV2(切镜头)开源深度模型 · ACM MM · 7/10 晚按「质量×性价比」审查后换装

专门做切镜头检测的模型,公开测试 87% 准确率(PySceneDetect 65.5%)。同片对比 ffmpeg 场景检测:检出 34 个物理镜头,纠正 8+ 处边界(三处有字幕帧佐证)、找回 2 个漏掉的镜头(0.1s 封面静帧、2.4s 短口播),还正确合并了两处被误拆的同机位口播。92 秒视频 CPU 跑 1.5 分钟,免费。

claude-videobradautomates · 开源 · GitHub 5400+ 星

把「下载→抽帧→转写」打包成一条命令的 Claude Code 插件,保留做流程骨架与抽帧执行;切镜头判定已由 TransNetV2 接管,转写走本地双轨(不用它内置的付费 API)。实测坑:中文 Windows 需设 PYTHONUTF8=1,否则调 ffmpeg 时 GBK 解码崩溃(已解决)。

RapidOCR + PP-OCRv5(硬字幕轨)开源 · 本机跑 · 7/11 定档:mobile 默认 + server 按需

把每帧画面的字幕区裁出来识字,实测 92 秒视频抽出 79 条带时间戳字幕,救回语音整句漏掉的「第二、瓦工进场之前把地漏准备好」。同片 A/B 后定档:mobile 模型默认(184 张 182 秒),形近字滑笔全靠语音轨互校修回,终稿残错 0;要精抠表格/画面小字再开 --ocr-server(残错 0 但 39 分钟)。

SenseVoice(语音轨)阿里 FunASR · 开源 · ModelScope 国内下载

中文字错率约 whisper 的 1/5。同片对决:whisper-small 听错 11 处专有名词(止逆阀→纸捏法),SenseVoice 只错 2 处;92 秒音频 CPU 转写 11 秒。模型 936MB 走国内镜像一分半下完。

ffmpeg + dewm + Claude基建三件套

ffmpeg 负责切镜头检测/抽帧/提音频(本机已装 8.1.2);dewm 是自家去水印下载服务(抖音链接→无水印 mp4);Claude 负责看帧判运镜、汇总七要素分镜稿、跑反向重建盲测。

🧪 备选实验

现在不缺,是三种未来场景的预案

3
Qwen3-VL / GLM-4.6V 整段吞视频阿里百炼 / 智谱 · 国内直连 API · 对应环节 ②④⑤

想替换谁:把「ffmpeg 抽帧 → Claude 看图判运镜 → Claude 汇总」三段压成一步 API(原生视频输入+时序定位;GLM-4.6V 输入 1 元/百万 token,Flash 版免费)。验证什么:同批 5 条不同类型视频直接出分镜稿,对比镜头切分漏不漏、时间戳准不准、运镜描述靠不靠谱,再算单条成本。触发时机:要批量跑(日几十条)时——三段式的维护成本才显出来;现在单条 3 分钟无痛点。

ShotVL(镜头语言专项模型)Vchitect 开源 · NeurIPS 2025 · 对应环节 ④

想升级谁:判运镜这一步。现在的「相邻帧找不同」能判固定/手持/推近/焦点变化,判不了焦段、光型、构图这些更细的导演参数;ShotVL 是唯一专训这 8 维的模型(但注意最强模型在该基准也不到 60% 准确率,全行业都难)。验证什么:抽 20-30 镜人工标注做标准答案,对比帧对比法 vs ShotVL 的标注准确率。触发时机:批量后抽查发现运镜标错率高,或下游生成环节真的要用焦段/光型参数。

Paraformer 热词版FunASR 家族 · 带时间戳+热词定制 · 对应环节 ③语音轨

是谁的备胎:SenseVoice。现在双轨互校基本零错的前提是视频有烧录字幕;碰到无字幕视频(纯实拍、口播不压字幕),语音变单轨裸奔,专有名词就可能错。验证什么:找一批无字幕视频,测 SenseVoice 单轨错误率还能不能接受;不行就换 Paraformer 并把「止逆阀」「前置过滤器」等词喂成热词再测。触发时机:无字幕视频类型占比变高时。

✗ 已淘汰

查过、想清楚了不用

5
TwelveLabsPDF 推荐 · 付费云服务 $0.042/分钟起

强项是「几千小时视频库里搜片段」;我们是少量视频出文字稿,为此新开海外付费供应商不值。

whisper-small 本地转写v1 曾用

中文同音字听错太多(11 处/92 秒),被 SenseVoice 同规格实测击败后替换。

Gemini 视频理解Google · 整段吞视频

能力同 Qwen3-VL 一类,但需代理+新开 Google key;国产两家可平替,不引入。

通义听悟阿里云 · 按时长付费

强在小时级长视频(课程/直播回放);对 1-2 分钟短视频太重。将来解构直播切片再考虑。

一键拆解 SaaS(易元AI 等)商用 · 贴链接出分镜表

黑盒、格式不可定制、数据过第三方。可注册试一条参考其输出格式,流水线不架在上面。

验证怎么确认方案靠谱:三轮验证都过了

实测产物(帧图、对比表、真实分镜节选)都在演示页;文件落在仓库 抖音去水印/2026-07-06_案例源视频/ 下(解构文字稿 v2 + 反向重建脚本)。

下一步自建判断与路线

SRC信息来源