LINE A · 复刻爆款复刻线
对标爆款 → 解构分镜 → 换成自己品牌主播(真人底片 + 克隆音色 + 唇形同步)→ 重写口播 → 合成投放素材。稳态成本 ~$1.8/条。
解构 ≈ $0 · 生成 $1.8/条把「抖音爆款复刻」与「AI 短剧」两条生成线做成网页产品:伙伴贴一个抖音链接、选一个主播,拿到 80% 完成度的粗剪成片——懂行人只做最后一道终审。
// 结论:可行 · 分四期约 6-9 周 · 真正的难点不在上云,在「人在环」的位置设计
复刻线(真人底片 + 音色克隆 + 唇形同步)和短剧线(Seedream 锚点图 + OmniHuman 音驱动)都已跑通、成本可控。问题是每条视频都要一个懂 Claude Code 的人全程操作 1-2 小时——解构看帧、改稿、逐步调 API、审片、合成,全在终端里手工串。
对标爆款 → 解构分镜 → 换成自己品牌主播(真人底片 + 克隆音色 + 唇形同步)→ 重写口播 → 合成投放素材。稳态成本 ~$1.8/条。
解构 ≈ $0 · 生成 $1.8/条卖点 → 剧本分镜 → Seedream 锚点图(真人质感)→ OmniHuman 单步音驱动(口型+表情+身体一步到位)→ 合成。单条 $7-15。
锚点图 $0.03/张 · 成片 $7-15/条按周产 30 条算就是 ~45 人时/周,而且串行在一个人身上——单点瓶颈。产品化要消除的是「必须懂 Claude Code」这道墙,而不是消除人工判断:审片关卡恰恰是这两条线能出成绩的原因。
评估产品化可行性的第一步是把每条线摊开,给每一步标上「执行者」。青色=纯机器 · 紫色=本地脚本 · 蓝色=LLM 判断步 · 琥珀=人工。
▍LINE A · 复刻线(现状)
▍LINE B · 短剧线(现状)
// 关键观察:机械步早已全部脚本化,真正拴住懂行人的是蓝色(LLM 判断)和琥珀色(人工审)两类步骤——产品化的全部功课就在这两种颜色上。
逐项核对了两条线的本地电脑依赖。最重要的发现:整条链路没有任何 GPU 依赖——重活全在云端 API,本地只有 CPU 计算。「摆脱本机」是这次产品化里最容易的部分。
| 本地依赖 | 用途 | 上云结论 |
|---|---|---|
| ffmpeg / ffprobe | 抽帧、切段、拼接、音频时长校验、响度归一化 | 容器内置 · 难度低 |
| TransNetV2 + RapidOCR + SenseVoice | 解构端切镜/字幕 OCR/语音转写 | 全 CPU · 模型烘进镜像 · 难度低 |
| opencv inpaint | 逐帧擦烧录字幕 | 纯 Python · 难度低 |
| mlx-whisper | 复刻线转写取时间戳 | ⚠ Apple 专用 → 换 faster-whisper · 难度中 |
| Pillow + macOS 系统字体 | 中文字幕/字卡渲染(字体路径硬编码) | ⚠ 换开源中文字体打包 · 难度中 |
| Claude Code 交互会话 | 所有 LLM 判断步 + 手工编排 | ⚠ → Agent SDK headless · 需实验验证 |
唯一带不确定性的迁移是最后一行:LLM 判断步从「交互式会话(有人随时纠偏)」搬到「headless 无人值守」,质量保真是假设不是事实——所以路线图的第一步(M0)是保真实验,不是写代码。
对抗性评审的结论:如果产品定义死抠「URL 进、成片出、全程无人」,这四个卡点会把它撞碎。产品必须绕它们设计,而不是假装它们不存在。
铁律「真人底片打底,不 AI 生成人像」有实证支撑:纯 AI 换脸整片被抖音打 AI 角标+限流,互动只有真人版的 1/100 ~ 1/10000。URL 只能喂解构,造不出人。
对策 → 固定主播资产库,伙伴只选不传LLM 听不了音频——唇形同步、配音自然度只能人听人看;锚点图「像不像同一个人」是主观视觉判断。这些关卡是多轮审片教训沉淀的,删掉=系统性出废片。
对策 → 审片站:暂停-批准-继续,不是删关卡现在「Claude Code 就是编排器」:分步 CLI 逐个手调、storyboard 手写、时间轴对齐手算。产品化=从零写一个后端 orchestrator,这是工作量的大头。
对策 → 任务状态机 + 对齐规则代码化生成 API 无余额查询接口,耗尽静默失败(曾整线锁死);克隆音色 7 天不用自动回收。密钥目前靠人从服务器上手工取。
对策 → key 收编服务端 + 余额哨兵 + 显式告警这四个决策把产品从「不可能的全自动 SaaS」收敛成「可落地的内部生产工具」。每一个都在换取工程量的数量级下降。
不做注册/计费/防滥用整层。简单口令即可,复用现有部署体系。
产品负责 0→80%(解构、生成、合成)全自动化,最后一道「能不能投」由终审者点批准。从「全程操作」退到「只点批准」,不追求完全退出。
品牌主播底片 + 已克隆音色预先登记成资产库,伙伴只选不传。免去底片质量校验和音色克隆管理,新主播由管理员线下录入。
编排层值得做(人工跑早已超过一个人产能);生成按量付费 $100-750/周可控,暂不自建 GPU 降本。
懂行人时间从 ~45 人时/周(全程操作、串行单点)降到 ~4 人时/周(伙伴分摊节点审,终审者只剩 ~1.5h)。这就是这个产品要买的东西。
新建独立编排服务(与现有 n8n 体系平行、互不侵入)。设计原则一句话:确定性判断走代码,模糊判断走模型,人只审关键节点。
提交页 · 任务列表 · 审片站
选产线 + 贴抖音 URL + 选主播 + 填卖点,秒回任务号;全异步轮询,彻底绕开 webhook 30s / 代理 60s 超时坑。
job 状态机 · 步骤编排 · 断点续跑
机械 worker(解构/生成 API/ffmpeg 合成)直接迁现有脚本;每 job 成本记账 + 超阈值自动暂停,防循环重生烧钱。
看图出稿 · 改稿 · 分镜规划 · 帧质检
现有 skill 的 prompt 与看帧流程原样固化成 headless agent,输出全部结构化 JSON(schema 校验),机械层拿 JSON 驱动。
对象存储放中间产物与成片 · Lark 卡片驱动审片通知 · 余额哨兵定时试探生成 API(403 即红色告警)· 密钥全收编服务端,伙伴永远不碰 key。
逐步映射后的结论:大部分是直接迁,新写集中在三块——编排状态机、短剧时间轴对齐、审片站前端。
| 环节 | 处理方式 | 类型 |
|---|---|---|
| 取片去水印 | 现有服务直连,失败显式报错(冷启动前端提示) | 直接迁 |
| 解构全套 | 切镜/OCR/转写脚本容器化,模型烘进镜像免冷启动下载 | 直接迁 |
| 擦字幕 / 生成 API 调用链 | 现有脚本原样迁,音色从资产库表读 | 直接迁 |
| 转写 | mlx-whisper → faster-whisper(接口一致) | 改造迁 |
| 合成器 | 字体换开源中文字体打包;响度归一化内置(现为手工步骤) | 改造迁 |
| 看图出稿 / 改稿 / 分镜规划 | skill prompt 固化为 headless agent,JSON schema 输出 | Agent 化 |
| 短剧剧本 agent | 反打架构 / 提示词规范从经验库提炼固化——短剧线最重的 LLM 新写 | 新写 |
| 短剧时间轴对齐 | TTS 慢 15-18% 迁就规则、镜头时长=max(分镜,配音+0.15s)——确定性计算,代码化,不留给 LLM | 新写 |
| 编排状态机 | job/steps/暂停恢复/打回重试映射,两线共用 | 新写 |
| 审片站前端 | 两级审核交互(见下节) | 新写 |
时间轴对齐现在是「LLM/人手算」,但它有确定性答案——所以产品化时归入代码而不是模型。凡是状态码能回答的,不让模型在 prompt 里抖 if-else。
审片不是产品化的敌人,是质量的来源。设计要点:关卡卡在烧钱步骤之前,打回越早越便宜;通知驱动,伙伴不用盯网页。
网格图对照审「像不像同一个人、真人感够不够」,卡在全量视频生成之前——打回只烧 $0.03/张,放过去就是 $7/条。
内嵌播放器听配音 + 唇形抽帧对照,卡在最终合成交付之前,打回重跑 TTS/唇形只要 $0.1-0.5。
不写自由文本:选原因(不像同一个人 / 唇形对不上 / 手势被裁 / 语速怪)→ 每种原因映射预设重试策略(换 seed / 扩景别 / 调语速 / 换锚点)。同节点打回 2 次不收敛 → 自动转人工工单,Lark 红卡告警,不无限烧钱。
播放成片 + 本条成本小票 + 一键批准。批准后成片落正式存储、Lark 绿卡通知交付;不批准转工单。每到待审节点自动推 Lark 卡片(缩略图+链接),通知驱动而非盯网页。
整个方案里唯一未被验证的假设是「LLM 判断步 headless 化后质量保真」——所以它排在一切代码之前,不达标就先调 prompt / 换模型,绝不带病开工。
// 总计约 6-9 周,每期结束都有可独立使用的交付,不憋大招。
按周产 30 条(两线各半)与本机 Claude Code 人工生产对比。生成 API 费用完全不变,变化在 LLM 计费方式、基础设施和人力。
| 成本项 | 本机人工 → 产品化 | 变化 |
|---|---|---|
| 生成 API 费 | ~$130/周(复刻 $1.8×15 + 短剧 $7.5×15),两种方式调用完全相同 | 不变 |
| LLM 判断步 | 订阅额度内边际 $0 → Agent SDK 走 API 计费,解构看几十张帧 ~$0.5-1.5/条 | ↑ +$15-45/周 |
| 基础设施 | 本机 $0 → 云 VM auto-stop + 对象存储 | ↑ +$5-8/周 |
| 懂行人时间 | ~45 人时/周(1.5h/条全程操作,串行单点)→ ~4 人时/周(节点审 5min + 终审 3min,伙伴分摊) | ↓ 省 ~40 人时/周 |
| 产能上限 | 受一个人的时间硬封顶(周 20-30 条已是极限)→ 受 API 限流与审片吞吐封顶 | ↑ 可到周 50+ |
| 一次性投入 | 6-9 周开发期 | 一次性 |
| 维护税 | 抖音取片改版修复 / prompt 漂移 / 模型变更,估每月 2-4 小时 | 持平偏增(显式化) |