调研报告 · 已定案 · 2026-07-10 · 夏夏 × Claude
调研起点是《ai 洗稿.pdf》的工具推荐;经过工具核实、本机实测、盲测验收三轮,方案已定案。本页回答一个问题:每个环节到底用什么、为什么,以及哪些查过但不用。全流程的动手演示(真实抽帧图、实测数据)在姊妹页:流水线全流程演示 →
总原则:不买重型 SaaS、不从零造轮子。解构 = 取片 → 抽帧 → 拿文字 → 判运镜 → 汇总 → 质检 六个环节,每个环节挑一个「便宜、本机能跑、对中文准」的现成积木,Claude 负责粘合与汇总。全流程已在真实视频上端到端跑通,单条约 3 分钟、API 花费 0 元。
| 环节 | 定案工具 | 费用 | 淘汰/替补了谁 |
|---|---|---|---|
| ① 取片 | dewm 去水印(自家) | 已有 | 不依赖 yt-dlp 对抖音的支持 |
| ② 切镜头抽帧 | TransNetV2 切镜头 + ffmpeg 抽帧(7/10 晚换装) | 免费 | 替换 ffmpeg 场景检测:同片实测纠正 8+ 处边界、找回 2 个漏掉的镜头;淘汰 TwelveLabs(付费云索引) |
| ③ 拿文字·字幕轨 | RapidOCR + PP-OCRv5 mobile 默认 (--ocr-server 按需升 server 档) | 免费 | mobile 3 分钟出稿,形近字滑笔全被语音轨互校兜住 + 噪声词过滤;抠表格/小字才升 server(39 分钟) |
| ③ 拿文字·语音轨 | SenseVoice(阿里开源) | 免费 | 淘汰 whisper-small:同片实测 11 处听错 vs 2 处 |
| ④ 判运镜 | 1fps 相邻帧对比 + Claude | 免费 | ShotVL 专项模型留作升级项(批量后不准再上) |
| ⑤ 汇总出稿 | Claude 七要素模板 + JSON | 会话额度 | 产出:风格参数 + 32 镜分镜表 + 解说词 + pipeline_config.json |
| ⑥ 质检 | 反向重建盲测 | 会话额度 | 没看过原片的 agent 盲写重拍脚本,缺口自动暴露 |
验收结论(2026-07-10 实测):92 秒真实视频跑完全流程,盲测重拍脚本与原片零矛盾;16 条信息缺口中 10 条用帧证据回填,剩 6 条属于画面外信息(字体名/特效模板/BGM),任何工具都拿不到。格式已定型,并已于 07-11 包成团队 skill douyin-deconstruct 上线。
「视频解构」= 把一条视频里三种信息(画面、文字、声音)各自榨干再合并,所以拆成六个环节。每个环节把调研过的候选摆在一起比——高亮行 = 当前选择。选型标准:质量优先,但为可忽略的质量差距付出数量级的成本不干。每一步的输入输出和真实产物截图见演示页。
| 候选 | 质量 | 成本 · 速度 | 判定 |
|---|---|---|---|
| dewm(自家服务)✓ | 无水印原片,7 月批量验证过 | 0 元 · 秒级 | 已有基建,直接用 |
| yt-dlp | 对抖音支持时好时坏 | 免费 | 不依赖它,避免脆弱环节 |
| 第三方去水印 API | 不稳定 | 付费,数据过第三方 | 没必要 |
为什么最优:自家服务免费秒级且已被批量验证,没有比它更优的选项存在。
| 候选 | 质量(切分准确率) | 成本 · 速度 | 判定 |
|---|---|---|---|
| TransNetV2 ✓ | 87%(公开基准最高);同片实测比 ffmpeg 多找回 2 镜、纠正 8+ 边界 | 免费 · 92s 视频 CPU 1.5 分钟 | 质量榜首恰好免费,直接选 |
| PySceneDetect | 65.5% | 免费 · 更快 | 准确率差一档 |
| ffmpeg 场景阈值(v1 曾用) | 更粗(实测漏 2 镜、8 处边界偏移) | 免费 · 秒级 | 已被实测淘汰,留作兜底 |
| TwelveLabs(云端) | 好,但为检索场景设计 | $0.042/分钟起 + 视频出海 | 付费买不到增量质量 |
为什么最优:这个环节质量第一名(TransNetV2)本身就是免费开源的小模型,质量和性价比不冲突,唯一代价是 1.5 分钟计算时间。漏镜头是解构最致命错误,这里值得用最好的。
| 候选 | 质量(同片 184 张实测) | 成本 · 速度 | 判定 |
|---|---|---|---|
| PP-OCRv5 mobile 全家桶 ✓ 默认 | 装修专有名词全对;约 10 处形近字滑笔 + 1 行漏识,全部被语音轨互校修回,终稿残错 0;背景板杂词由噪声过滤器(形近变体聚类 + 出现率阈值)剔除 | 免费 · 182 秒 | 互校兜底后质量与 server 档终稿等同,快 13 倍 |
| PP-OCRv5 server(--ocr-server 升级档) | 单轨即残错 0(修复旧默认全部 4 处硬伤) | 免费 · 39 分钟(此前按中途日志误报 13 分钟,已实测更正) | 抠表格/画面小字、无语音可互校时才开 |
| 混搭(mobile 检测 + server 认字,曾试) | 与金标准漏 96 行/多 97 行,直接崩 | 免费 · 21 分钟 | 实测淘汰:两模型框位不兼容 |
| 相邻帧哈希去重再 OCR(曾试) | 质量不变 | 只省 16%(动态亮背景打穿哈希) | 实测无效,已从代码移除 |
| RapidOCR 旧默认模型(v1 曾用) | 残错 4 处(夏的闹心/等于自装等) | 免费 · 1 分钟 | 快但错,被实测替换 |
| PP-OCRv6(2026-06 新出) | 比 v5 server 再 +5% | 免费 · 同框架换模型文件 | 平滑升级项,稳定后一行配置切换 |
| 大模型逐帧 OCR(Qwen-VL 等) | 最强(含排版理解) | 按帧烧 token,一条视频几块钱 | 为最后一点提升付百倍成本,不值 |
为什么最优:关键洞察是「OCR 单轨不需要做到满分」——它后面还有语音轨互校这道保险,mobile 档的形近字滑笔恰好是互校最擅长修的错型。同片 A/B 实测:mobile+互校的终稿和 server 档终稿完全等同,但只花 1/13 的时间。server 档保留为 --ocr-server 升级开关,专攻表格/画面小字这类语音兜不住的场景。
| 候选 | 质量(中文字错率 CER) | 成本 · 速度 | 判定 |
|---|---|---|---|
| SenseVoice ✓ | 7.81%;同片实测仅 2 处小错,双轨互校后残错 0 | 免费 · 92s 音频 CPU 11 秒 | 互校后到顶,更强模型无边际收益 |
| whisper-small(v1 曾用) | ~20%;实测 11 处听错 | 免费 | 被同片实测淘汰 |
| FireRedASR-LLM 8.3B | 3.05%(开源榜首) | 免费但需 NVIDIA GPU / 17GB+ 内存,本机与 Mac Air 均跑不动 | 质量王但跑不了;且互校后收益≈0 |
| FireRedASR-AED 1.1B | 3.18% | 免费 · CPU 可跑但慢 | 无字幕视频场景的第一预案 |
| Qwen3-ASR / 通义听悟 API | 强(尤其中英混说) | 按量付费 · 国内直连 | 无字幕视频批量时与 AED 版对决 |
为什么最优:关键在「双轨」——字幕轨已是作者手写的标准答案,语音轨只负责补缺和互校,7.81% 的 CER 在互校后残错已经是 0,换 3% 的模型买不到任何可见改善。真正的分水岭是无字幕视频(单轨裸奔),那是 AED 版和 API 的出场条件,已列入备选预案。
| 候选 | 质量 | 成本 · 速度 | 判定 |
|---|---|---|---|
| 相邻帧对比 + Claude ✓ | 判 5 类运镜,盲测重建 0 矛盾 | 会话额度内 · 即时 | 行业天花板低,简单方法已够格 |
| ShotVL-3B(专项模型) | 8 维镜头语言,但全行业该基准最高不到 60% | 免费 · 本机 CPU 慢到不实用 | 生成端要焦段/光型参数时再上 |
| 光流法(RAFT 等) | 只擅长平移类运动 | 工程量大 | 投入产出不成比例 |
为什么最优:镜头语言识别全行业都不及格(最强模型 <60%),此时砸重工具买不来质量,简单方法+盲测验证反而是性价比顶点。免费微调空间还有:对比帧加密到 2fps。
| 候选 | 质量 | 成本 · 速度 | 判定 |
|---|---|---|---|
| Claude(本会话)✓ | 多模态第一梯队;盲测验证出稿可直接开拍 | 会话额度内,零增量 API 费 · 粒度完全可控 | 质量瓶颈在喂料密度不在模型 |
| Qwen3-VL / GLM-4.6V 整段吞 | 能力强,镜头切分粒度待验 | 便宜 API · 国内直连 | 批量时 A/B,赢了可把三步压一步 |
| Gemini 2.5 视频理解 | 同级 | 需代理 + 新开 Google key | 国产可平替,不引入 |
为什么最优:汇总模型本身已是第一梯队,提质量的正确姿势是加钱调「喂料档位」(帧数 100→不设上限、分辨率 512→1024px,重点视频单条多花一两块),而不是换模型。
| 候选 | 质量 | 成本 · 速度 | 判定 |
|---|---|---|---|
| 反向重建盲测(单 agent)✓ | 实测揪出 16 条信息缺口、验证 0 矛盾 | 会话额度 · 每条约 3 分钟 | 已证明有效;批量后按 1/10 抽样跑 |
| 多裁判盲测(2-3 独立互评) | 更稳 | 3 倍会话成本 | 重点对标视频才值得 |
| 纯人工对照 | 最准 | 最贵最慢 | 抽样复核用,不做常规流程 |
为什么最优:质检的目的是防错不是追分。单 agent 盲测已证明能暴露缺口,批量后抽样跑住成本,重点视频再升多裁判——按风险分层花钱。
调研共覆盖 14 个工具/方案,按最终去向分三组。只想知道用什么的看上面定案表就够了,这一节是「为什么」的存档。
专门做切镜头检测的模型,公开测试 87% 准确率(PySceneDetect 65.5%)。同片对比 ffmpeg 场景检测:检出 34 个物理镜头,纠正 8+ 处边界(三处有字幕帧佐证)、找回 2 个漏掉的镜头(0.1s 封面静帧、2.4s 短口播),还正确合并了两处被误拆的同机位口播。92 秒视频 CPU 跑 1.5 分钟,免费。
把「下载→抽帧→转写」打包成一条命令的 Claude Code 插件,保留做流程骨架与抽帧执行;切镜头判定已由 TransNetV2 接管,转写走本地双轨(不用它内置的付费 API)。实测坑:中文 Windows 需设 PYTHONUTF8=1,否则调 ffmpeg 时 GBK 解码崩溃(已解决)。
把每帧画面的字幕区裁出来识字,实测 92 秒视频抽出 79 条带时间戳字幕,救回语音整句漏掉的「第二、瓦工进场之前把地漏准备好」。同片 A/B 后定档:mobile 模型默认(184 张 182 秒),形近字滑笔全靠语音轨互校修回,终稿残错 0;要精抠表格/画面小字再开 --ocr-server(残错 0 但 39 分钟)。
中文字错率约 whisper 的 1/5。同片对决:whisper-small 听错 11 处专有名词(止逆阀→纸捏法),SenseVoice 只错 2 处;92 秒音频 CPU 转写 11 秒。模型 936MB 走国内镜像一分半下完。
ffmpeg 负责切镜头检测/抽帧/提音频(本机已装 8.1.2);dewm 是自家去水印下载服务(抖音链接→无水印 mp4);Claude 负责看帧判运镜、汇总七要素分镜稿、跑反向重建盲测。
想替换谁:把「ffmpeg 抽帧 → Claude 看图判运镜 → Claude 汇总」三段压成一步 API(原生视频输入+时序定位;GLM-4.6V 输入 1 元/百万 token,Flash 版免费)。验证什么:同批 5 条不同类型视频直接出分镜稿,对比镜头切分漏不漏、时间戳准不准、运镜描述靠不靠谱,再算单条成本。触发时机:要批量跑(日几十条)时——三段式的维护成本才显出来;现在单条 3 分钟无痛点。
想升级谁:判运镜这一步。现在的「相邻帧找不同」能判固定/手持/推近/焦点变化,判不了焦段、光型、构图这些更细的导演参数;ShotVL 是唯一专训这 8 维的模型(但注意最强模型在该基准也不到 60% 准确率,全行业都难)。验证什么:抽 20-30 镜人工标注做标准答案,对比帧对比法 vs ShotVL 的标注准确率。触发时机:批量后抽查发现运镜标错率高,或下游生成环节真的要用焦段/光型参数。
是谁的备胎:SenseVoice。现在双轨互校基本零错的前提是视频有烧录字幕;碰到无字幕视频(纯实拍、口播不压字幕),语音变单轨裸奔,专有名词就可能错。验证什么:找一批无字幕视频,测 SenseVoice 单轨错误率还能不能接受;不行就换 Paraformer 并把「止逆阀」「前置过滤器」等词喂成热词再测。触发时机:无字幕视频类型占比变高时。
强项是「几千小时视频库里搜片段」;我们是少量视频出文字稿,为此新开海外付费供应商不值。
中文同音字听错太多(11 处/92 秒),被 SenseVoice 同规格实测击败后替换。
能力同 Qwen3-VL 一类,但需代理+新开 Google key;国产两家可平替,不引入。
强在小时级长视频(课程/直播回放);对 1-2 分钟短视频太重。将来解构直播切片再考虑。
黑盒、格式不可定制、数据过第三方。可注册试一条参考其输出格式,流水线不架在上面。
实测产物(帧图、对比表、真实分镜节选)都在演示页;文件落在仓库 抖音去水印/2026-07-06_案例源视频/ 下(解构文字稿 v2 + 反向重建脚本)。
douyin-deconstruct——对 Claude 说「解构这条视频 + 链接/本地路径」自动跑完六步出解构稿;默认档单条约 8 分钟(Mac 预计 3-5 分钟)、0 元 API。