产品化调研 · 2026-07 · 内部评估脱敏版

一条 URL
到一条成片

把「抖音爆款复刻」与「AI 短剧」两条生成线做成网页产品:伙伴贴一个抖音链接、选一个主播,拿到 80% 完成度的粗剪成片——懂行人只做最后一道终审。

// 结论:可行 · 分四期约 6-9 周 · 真正的难点不在上云,在「人在环」的位置设计

DECONSTRUCT 解构 REPLICA 复刻 $1.8/条 SHORT-DRAMA 短剧 $7-15/条 CLAUDE AGENT SDK HITL 两级审片 FAL.AI · SEEDREAM · OMNIHUMAN ZERO GPU 依赖
SCROLL / 向下滚动
01
The Problem

两条线都能跑,但每条都拴着一个懂行人

复刻线(真人底片 + 音色克隆 + 唇形同步)和短剧线(Seedream 锚点图 + OmniHuman 音驱动)都已跑通、成本可控。问题是每条视频都要一个懂 Claude Code 的人全程操作 1-2 小时——解构看帧、改稿、逐步调 API、审片、合成,全在终端里手工串。

🎬

LINE A · 复刻爆款复刻线

对标爆款 → 解构分镜 → 换成自己品牌主播(真人底片 + 克隆音色 + 唇形同步)→ 重写口播 → 合成投放素材。稳态成本 ~$1.8/条。

解构 ≈ $0 · 生成 $1.8/条
🎭

LINE B · 短剧AI 短剧线

卖点 → 剧本分镜 → Seedream 锚点图(真人质感)→ OmniHuman 单步音驱动(口型+表情+身体一步到位)→ 合成。单条 $7-15。

锚点图 $0.03/张 · 成片 $7-15/条
真正的瓶颈

按周产 30 条算就是 ~45 人时/周,而且串行在一个人身上——单点瓶颈。产品化要消除的是「必须懂 Claude Code」这道墙,而不是消除人工判断:审片关卡恰恰是这两条线能出成绩的原因。

02
Pipeline Anatomy · Who Does What

逐步拆开:哪步是机器,哪步是模型,哪步是人

评估产品化可行性的第一步是把每条线摊开,给每一步标上「执行者」。青色=纯机器 · 紫色=本地脚本 · 蓝色=LLM 判断步 · 琥珀=人工

▍LINE A · 复刻线(现状)

API
取片
去水印服务解析抖音链接,拉无水印原片(冷启动 30-150s)
脚本
解构
TransNetV2 切镜头 + RapidOCR 抠字幕 + SenseVoice 转写,双轨互校 → 抽帧落盘(92s 视频约 5-8 分钟,全 CPU
LLM
看图出稿
逐镜看帧、成对看首末帧判运镜(固定/手持/推近/拉焦),裁决解说词,产出七要素分镜表
LLM
改稿+规划
重写口播稿(保要点、卡时长);划分真人出镜窗口 vs 插页窗口——只给出镜窗口买唇形,是核心省钱点
API
生成
音色克隆(复用已登记 voice_id)→ TTS → 唇形同步,逐段调云端 API
脚本
合成
ffmpeg 擦字幕(逐帧 inpaint)、切段、拼接、上字幕(Pillow 渲染)
人工
验收
亲自听配音、看嘴型全程——LLM 听不了音频,这一步无法自动化

▍LINE B · 短剧线(现状)

LLM
剧本分镜
从卖点写对白、规划多角色反打架构与镜头分割——目前纯手工创作,无固化 prompt
API
锚点图
Seedream 4.0 以真人照片为锚点扩景生图,$0.03/张,真人感 90% 在这一步决定
人工
批准
人工过目「像同一个人、有真人感」后才进全量生成
API
音驱动
TTS 配音 → OmniHuman 单步音驱动(口型+表情+身体),音频 ≤30s 分段,输出多 0.1-0.15s 需 trim
人工
排时间轴
画面/字幕切片锚到配音里被念到的真实时刻、TTS 慢 15-18% 逐镜迁就——这套对齐规则目前是人工手算,未脚本化
脚本
合成
ffmpeg concat 滤镜防漂移拼接 + 响度归一化 → 成片

// 关键观察:机械步早已全部脚本化,真正拴住懂行人的是蓝色(LLM 判断)和琥珀色(人工审)两类步骤——产品化的全部功课就在这两种颜色上。

03
Dependency Audit · Local → Cloud

本地依赖审计:上云比想象中容易

逐项核对了两条线的本地电脑依赖。最重要的发现:整条链路没有任何 GPU 依赖——重活全在云端 API,本地只有 CPU 计算。「摆脱本机」是这次产品化里最容易的部分。

本地依赖用途上云结论
ffmpeg / ffprobe抽帧、切段、拼接、音频时长校验、响度归一化容器内置 · 难度低
TransNetV2 + RapidOCR + SenseVoice解构端切镜/字幕 OCR/语音转写全 CPU · 模型烘进镜像 · 难度低
opencv inpaint逐帧擦烧录字幕纯 Python · 难度低
mlx-whisper复刻线转写取时间戳⚠ Apple 专用 → 换 faster-whisper · 难度中
Pillow + macOS 系统字体中文字幕/字卡渲染(字体路径硬编码)⚠ 换开源中文字体打包 · 难度中
Claude Code 交互会话所有 LLM 判断步 + 手工编排⚠ → Agent SDK headless · 需实验验证
Key Finding

唯一带不确定性的迁移是最后一行:LLM 判断步从「交互式会话(有人随时纠偏)」搬到「headless 无人值守」,质量保真是假设不是事实——所以路线图的第一步(M0)是保真实验,不是写代码。

04
Hard Blockers · Why "One Click" Is A Lie

「一键出片」骗不了的四个卡点

对抗性评审的结论:如果产品定义死抠「URL 进、成片出、全程无人」,这四个卡点会把它撞碎。产品必须绕它们设计,而不是假装它们不存在。

🧍

BLOCKER 01复刻线的输入不是 URL,是真人底片

铁律「真人底片打底,不 AI 生成人像」有实证支撑:纯 AI 换脸整片被抖音打 AI 角标+限流,互动只有真人版的 1/100 ~ 1/10000。URL 只能喂解构,造不出人。

对策 → 固定主播资产库,伙伴只选不传
👂

BLOCKER 02音频与真人感必须人在环

LLM 听不了音频——唇形同步、配音自然度只能人听人看;锚点图「像不像同一个人」是主观视觉判断。这些关卡是多轮审片教训沉淀的,删掉=系统性出废片。

对策 → 审片站:暂停-批准-继续,不是删关卡
🔗

BLOCKER 03不存在端到端编排层

现在「Claude Code 就是编排器」:分步 CLI 逐个手调、storyboard 手写、时间轴对齐手算。产品化=从零写一个后端 orchestrator,这是工作量的大头。

对策 → 任务状态机 + 对齐规则代码化
💳

BLOCKER 04外部账号是人工死结

生成 API 无余额查询接口,耗尽静默失败(曾整线锁死);克隆音色 7 天不用自动回收。密钥目前靠人从服务器上手工取。

对策 → key 收编服务端 + 余额哨兵 + 显式告警
05
Product Positioning · Four Decisions

四个定位决策,砍掉一半工作量

这四个决策把产品从「不可能的全自动 SaaS」收敛成「可落地的内部生产工具」。每一个都在换取工程量的数量级下降。

👥

DECISION 01内部伙伴 <10 人

不做注册/计费/防滥用整层。简单口令即可,复用现有部署体系。

✂️

DECISION 0280% 粗剪 + 懂行人终审

产品负责 0→80%(解构、生成、合成)全自动化,最后一道「能不能投」由终审者点批准。从「全程操作」退到「只点批准」,不追求完全退出。

🗂️

DECISION 03固定主播资产库

品牌主播底片 + 已克隆音色预先登记成资产库,伙伴只选不传。免去底片质量校验和音色克隆管理,新主播由管理员线下录入。

📊

DECISION 04周产 10-50 条

编排层值得做(人工跑早已超过一个人产能);生成按量付费 $100-750/周可控,暂不自建 GPU 降本。

角色变化 · 产品交付的核心效果

懂行人时间从 ~45 人时/周(全程操作、串行单点)降到 ~4 人时/周(伙伴分摊节点审,终审者只剩 ~1.5h)。这就是这个产品要买的东西。

06
Target Architecture

目标架构:一个编排服务,三种执行者

新建独立编排服务(与现有 n8n 体系平行、互不侵入)。设计原则一句话:确定性判断走代码,模糊判断走模型,人只审关键节点。

Frontend▲ 静态页

网页三件套

提交页 · 任务列表 · 审片站

选产线 + 贴抖音 URL + 选主播 + 填卖点,秒回任务号;全异步轮询,彻底绕开 webhook 30s / 代理 60s 超时坑。

零框架静态页 · 同服务托管
Orchestrator✦ 云端 VM

FastAPI + 任务队列

job 状态机 · 步骤编排 · 断点续跑

机械 worker(解构/生成 API/ffmpeg 合成)直接迁现有脚本;每 job 成本记账 + 超阈值自动暂停,防循环重生烧钱。

performance CPU · auto-stop 省钱 · 无 GPU
LLM Layer◈ Agent SDK

判断步 headless 化

看图出稿 · 改稿 · 分镜规划 · 帧质检

现有 skill 的 prompt 与看帧流程原样固化成 headless agent,输出全部结构化 JSON(schema 校验),机械层拿 JSON 驱动。

Claude Agent SDK · M0 实验先行
运维件

对象存储放中间产物与成片 · Lark 卡片驱动审片通知 · 余额哨兵定时试探生成 API(403 即红色告警)· 密钥全收编服务端,伙伴永远不碰 key。

07
Migration Map · Reuse Over Rewrite

迁移映射:能直接搬的绝不重写

逐步映射后的结论:大部分是直接迁,新写集中在三块——编排状态机、短剧时间轴对齐、审片站前端。

环节处理方式类型
取片去水印现有服务直连,失败显式报错(冷启动前端提示)直接迁
解构全套切镜/OCR/转写脚本容器化,模型烘进镜像免冷启动下载直接迁
擦字幕 / 生成 API 调用链现有脚本原样迁,音色从资产库表读直接迁
转写mlx-whisper → faster-whisper(接口一致)改造迁
合成器字体换开源中文字体打包;响度归一化内置(现为手工步骤)改造迁
看图出稿 / 改稿 / 分镜规划skill prompt 固化为 headless agent,JSON schema 输出Agent 化
短剧剧本 agent反打架构 / 提示词规范从经验库提炼固化——短剧线最重的 LLM 新写新写
短剧时间轴对齐TTS 慢 15-18% 迁就规则、镜头时长=max(分镜,配音+0.15s)——确定性计算,代码化,不留给 LLM新写
编排状态机job/steps/暂停恢复/打回重试映射,两线共用新写
审片站前端两级审核交互(见下节)新写
设计原则的一次落地

时间轴对齐现在是「LLM/人手算」,但它有确定性答案——所以产品化时归入代码而不是模型。凡是状态码能回答的,不让模型在 prompt 里抖 if-else。

08
Review Station · Human-In-The-Loop By Design

审片站:把「人在环」变成产品功能

审片不是产品化的敌人,是质量的来源。设计要点:关卡卡在烧钱步骤之前,打回越早越便宜;通知驱动,伙伴不用盯网页。

🖼️

节点审 · 伙伴自己做短剧线:锚点图关卡

网格图对照审「像不像同一个人、真人感够不够」,卡在全量视频生成之前——打回只烧 $0.03/张,放过去就是 $7/条。

🔊

节点审 · 伙伴自己做复刻线:唇形音频关卡

内嵌播放器听配音 + 唇形抽帧对照,卡在最终合成交付之前,打回重跑 TTS/唇形只要 $0.1-0.5。

↩️

打回机制结构化原因 → 预设重试

不写自由文本:选原因(不像同一个人 / 唇形对不上 / 手势被裁 / 语速怪)→ 每种原因映射预设重试策略(换 seed / 扩景别 / 调语速 / 换锚点)。同节点打回 2 次不收敛 → 自动转人工工单,Lark 红卡告警,不无限烧钱。

终审 · 懂行人成片页:能投 / 不能投

播放成片 + 本条成本小票 + 一键批准。批准后成片落正式存储、Lark 绿卡通知交付;不批准转工单。每到待审节点自动推 Lark 卡片(缩略图+链接),通知驱动而非盯网页

09
Roadmap · M0 Before Everything

四期路线:实验先行,每期都有可用交付

整个方案里唯一未被验证的假设是「LLM 判断步 headless 化后质量保真」——所以它排在一切代码之前,不达标就先调 prompt / 换模型,绝不带病开工。

M0
1-2 天
headless 保真实验(硬门槛):5 条已人工解构过的视频重跑「看图出稿」+ 1 条复刻重跑「改稿+分镜规划」,对照人工版打分。通过线=终审可修(≤2 处错/条且无结构性崩坏),顺带测更小模型能否胜任(LLM 费直接减半)
M1
1-2 周
骨架 + 解构页上线:FastAPI 任务队列 + 前端壳;URL → 七要素分镜稿下载,全自动零审片。最窄的楔子——先让伙伴用起来攒反馈
M2
2-4 周
复刻线全链:主播资产库 + 审片站两级审 + 余额哨兵/成本记账。出口标准:一条复刻端到端不碰终端
M3
2-3 周
短剧线:剧本 agent + 时间轴对齐代码化 + OmniHuman 编排。出口标准:一条短剧端到端

// 总计约 6-9 周,每期结束都有可独立使用的交付,不憋大招。

10
Cost Analysis · vs. Local Claude Code Production

成本对比:钱多花一点,时间省一个量级

按周产 30 条(两线各半)与本机 Claude Code 人工生产对比。生成 API 费用完全不变,变化在 LLM 计费方式、基础设施和人力。

成本项本机人工 → 产品化变化
生成 API 费~$130/周(复刻 $1.8×15 + 短剧 $7.5×15),两种方式调用完全相同不变
LLM 判断步订阅额度内边际 $0 → Agent SDK 走 API 计费,解构看几十张帧 ~$0.5-1.5/条↑ +$15-45/周
基础设施本机 $0 → 云 VM auto-stop + 对象存储↑ +$5-8/周
懂行人时间~45 人时/周(1.5h/条全程操作,串行单点)→ ~4 人时/周(节点审 5min + 终审 3min,伙伴分摊)↓ 省 ~40 人时/周
产能上限受一个人的时间硬封顶(周 20-30 条已是极限)→ 受 API 限流与审片吞吐封顶↑ 可到周 50+
一次性投入6-9 周开发期一次性
维护税抖音取片改版修复 / prompt 漂移 / 模型变更,估每月 2-4 小时持平偏增(显式化)
一句话总括:单条货币成本从 ~$4.7 升到 ~$5.5-6.5(+15~35%,主因 LLM 从订阅额度转 API 计费),换来每周 40 人时单点瓶颈的解除——新增货币成本约等于 1 人时的价格,账显然成立。真正要警惕的不是钱,而是 M0 实验不过关导致质量降级,所以它排在一切之前。