流程演示 · Pipeline Demo · 2026-07-10
贴一条抖音链接进来,几分钟后拿到两样东西:分镜文字稿(每个镜头拍什么、怎么拍、几秒)和解说词文字稿(带时间戳的口播全文)。整套流程已经在真实视频上端到端跑通,下面所有截图和数据都来自实测,不是设计稿。
核心思路一句话:一条视频里的信息分三种——画面、文字、声音,各派一个「专门工种」去榨取,最后由 Claude 汇总成稿,再用「盲测」验收。下面每一步都标了输入 → 输出,和它用的工具。
把抖音链接(或一批链接)交给团队已有的去水印工具,自动下载出无水印视频。这一步是现成的,7 月初刚批量用过。
用专门训练过的切镜头模型(TransNetV2,公开测试准确率 87%)逐帧找剪辑切点,再在每个切点截图。92 秒的测试视频检出 34 个物理镜头——比最初用的 ffmpeg 土办法多找回 2 个漏掉的镜头、纠正了 8 处边界时间(质量审查后 7/10 晚换装)。下面是其中 6 张真实抽帧:
从这 6 张就能看出视频骨架:封面 → 口播 → 实拍佐证 → 产品图卡 → 引流表格。
轨道 A「看字幕」:抖音视频几乎都有博主自己压上去的字幕——那就是作者亲手写的标准答案。我们把每帧画面的字幕区裁出来(如下图),用 OCR 识字,得到 79 条带时间戳的字幕:
↑ 真实的字幕带裁剪图。OCR 从这里读出「第一、改水电之前」,连哪几个字是红色高亮都看得到。
轨道 B「听声音」:用阿里开源的 SenseVoice 在本机把音频转成文字(不用联网、不花钱)。选它是实测选出来的——同一条视频,两个模型的听错对比:
| 原文(真实台词) | whisper-small 听成 | SenseVoice 听成 |
|---|---|---|
| 前置过滤器 | 潜质过滤器 ✗ | 前置过滤器 ✓ |
| 止逆阀 | 纸捏法 ✗ | 止逆阀 ✓ |
| 角阀、球阀 | 脚伐球伐 ✗ | 角阀球阀 ✓ |
| 纯铜加厚 | 纯同加厚 ✗ | 纯铜加厚 ✓ |
| 第二、瓦工进场之前把地漏准备好 | 整句漏掉 ✗ | 完整听出 ✓ |
| 全片合计 | 听错 11 处 | 听错 2 处 |
互校规则:两轨对不上时,以字幕为准(作者自己写的);字幕 OCR 偶尔认错字(比如把「真的闹心」认成「夏的闹心」),再用语音轨修回来。双保险跑完,解说词基本零错。
单看一张图判断不了镜头在怎么动,但把间隔 1 秒的两帧放一起就行:画面整体变大 = 镜头在推近;画面平移 = 在横摇;构图不变但从模糊变清晰 = 焦点在变。真实例子——脏滤芯镜头的相邻两帧:
↑ 构图一模一样、一虚一实 → 判定为「焦点由虚到实」(专业叫 rack focus),这是全片唯一的技巧运镜,写进了分镜稿。整片判出 7 种运镜:三脚架固定、手持跟拍推进、手持微晃、固定俯拍、焦点变化、长图上滚等。
Claude 把所有素材汇总成四份东西。① 全片风格参数——复刻整体感用的(人设、节奏、字幕规矩、配音情绪);② 七要素分镜表——每镜一行,真实节选两行:
| 镜号 | 时间 | 景别 | 运镜 | 画面 | 台词 | 字幕样式 |
|---|---|---|---|---|---|---|
| S09 | 00:19.3-22.8 | 大特写 | 焦点由虚到实 | 滤芯截留的泥沙污物 | 泥沙、虫卵、铁锈这些大颗粒都给你过滤掉 | 「泥沙、虫卵、铁锈」红字 |
| S22 | 00:54.9-56.9 | 俯拍铺陈 | 固定正俯 | 角阀球阀开箱铺满地面(约9-10件) | 角阀、球阀都得提前准备好 | 「角阀、球阀」红字高亮 |
③ 解说词终版(带时间戳,双轨互校后基本零错);④ pipeline_config.json——给以后「AI 重新生成视频」的环节直接读的机器格式,节选:
机位、景别、时长都变成了固定字段——后面接文生图、图生视频的环节可以直接按参数干活,不用再猜。
怎么知道文字稿够不够好?找一个从没看过原视频的 AI,只给它文字稿,让它写一份「照着能拍」的重拍脚本——它写不出来的地方、拿不准的地方,就是文字稿缺的信息,藏不住。
这个盲测还立了一功:文字稿里有一段主动标注「S30 是否有捏阀门的实物演示,没拍到证据」——复查原片连续帧后确认是纯口播。宁可标「不知道」也不瞎编,是整套流程的质量底线。
所有工具都已在本机(夏夏这台 Windows)装好并实测通过。除了大模型汇总(走 Claude Code 会话本身),没有任何按次付费的 API。
| 工具 | 负责什么 | 费用 | 备注 |
|---|---|---|---|
| dewm 去水印 | 抖音链接 → 无水印 mp4 | 自家服务 | 已有,跑在团队 worker 上 |
| ffmpeg | 切镜头检测、抽帧、提音频 | 免费开源 | 本机已装 8.1.2 |
| claude-video 插件 | 把「下载→抽帧→转写」打包成一条命令 | 免费开源 | GitHub 5400+ 星;中文 Windows 要设 PYTHONUTF8=1(已踩坑并解决) |
| TransNetV2 | 切镜头检测(找准每个镜头的起止点) | 免费开源 | 专用深度模型,准确率 87%;92 秒视频 CPU 跑 1.5 分钟 |
| RapidOCR + PP-OCRv5 | 抠画面里的烧录字幕(轨道 A) | 免费开源 | mobile 模型默认(184 张 182 秒),小错靠语音轨互校修回、终稿残错 0;抠表格/小字才开 server 档(39 分钟) |
| SenseVoice | 音频转文字(轨道 B),中文错误率约为 whisper 的 1/5 | 免费开源 | 阿里出品,国内下载无障碍;92 秒音频 CPU 转 11 秒 |
| Claude(本会话) | 看帧、判运镜、汇总出稿、盲测质检 | 会话额度 | 看一条 92 秒视频约几万 token,合几毛钱级别 |
调研阶段淘汰的方案:TwelveLabs(海外付费视频理解服务,杀鸡用牛刀)、whisper-small(听错太多,已被 SenseVoice 替换)、通义听悟(适合小时级长视频,短视频不划算)。备选待实验:Qwen3-VL / GLM-4.6V 整段吞视频(可能把六步压成一步,待 A/B 对比)。
测试对象:灿哥聊装修《新房开工少备一样都停工》,92 秒口播+实拍混剪。三份产物文件都在仓库里,随时可看。
解说词文字稿(节选,双轨互校终版):
分镜文字稿:34 镜 × 七要素(时间/时长/景别/运镜/画面/台词/字幕样式,含 TransNetV2 找回的封面静帧和短口播两镜),加一张全片风格参数表(人设、平均 2.7 秒/镜的节奏、黄色=建议红色=警示的高亮规律、快语速警告式配音)。
产物文件:
01_灿哥聊装修_解构文字稿_v2.md —— 主产物:风格参数 + 分镜表 + 解说词 + JSON + 对照补遗01_灿哥聊装修_反向重建脚本.md —— 盲测产物:可开拍的重拍脚本(含拍摄准备清单)01_灿哥聊装修_解构文字稿.md —— v1 留档(对比用)douyin-deconstruct(对 Claude 说「解构这条视频 + 链接/本地路径」即可触发,端到端冒烟通过)。--ocr-server,约 45 分钟。