有大有小 × Akke · 技术方案蓝图 · 2026-07

获客四线
技术方案蓝图

同一条漏斗的工程口径:视频产线、投放承接、加微收口、企微 AI——每个子系统用什么架构、为什么这么选、机制怎么兜住风险。

// 与「四线实时进展与卡点」页配套 · 那页讲进度,这页讲设计

M1 图源对照实验 八工位视频产线 三生态承接链路 HARD-GATE 收口 云电脑 GUI + VL 读屏 LANGFUSE 全链路
SCROLL / 向下滚动
01
System Architecture · Brain / Ledger / Hands

总体架构:想在云端,手在终端

四条线共享一个架构根因:抖音和企微都对数据中心的直接操作严防死守——云端 IP 直发消息会被静默丢弃,官方 API 又被备案卡住。所以整套系统被设计成「想」和「做」分离的三层。

Brain▲ 云端大脑

判断与生成

Next.js on Vercel

意向打分、话术生成、人设管理、成本核算——所有需要智能的判断集中在这层。它从不直接触碰抖音或企微,只把「该做什么」写进数据库。

分通道 LLM 路由 · 60+ 确定性后置规则
Ledger◈ 事实源

状态机交接台

Supabase Postgres

每一棒先落库再交接:任务队列、会话状态、发送回执全部持久化。任何一层崩了都能从库里的状态捡起来重跑——不重发、不丢单,事后可逐条对账。

状态机 + 队列表 · 多租户行级隔离
Hands✦ 执行端

真实登录态发送

无影云电脑 · iPhone / 安卓真机

发送必须发生在带真实登录态的真实界面里:云电脑上的抖音 / 企业微信客户端、真机上的 App。国内云电脑连不上海外云,命令经东京中转层接力。

GUI 自动化 + VL 读屏 · Fly.io 中转
First Principle

模糊判断给模型,确定性动作给代码。什么算高意向、话术怎么说——交给 LLM;什么时候发号、发给谁、发送前校验什么——全部是代码写死的规则。这条原则会在下面每一条线里反复出现。

02
Video Pipeline · Experiment Before Investment

视频产线:一个实验设计 + 一条八工位流水线

视频方案的核心不是「选哪个模型」,而是先用最便宜的对照实验锁定病根,再决定往哪个方向做重投入。

Attribution Method · 归因方法论

「某某 API 效果不好」这类判断,必须先验证喂给它的输入——现产线一直是「AI 生图 → 图生视频」,视频引擎只是忠实地动了一张本来就假的图。不能用下游产出给上游定罪,真图路线从未被测试过,所以第一步是把「图源」这个变量单独隔离出来。

🔬

M1 实验设计单臂图源对照 + 盲评

5 个分镜场景 × 2 种图源(实拍真图 / 现产线 AI 图)= 10 条视频,同一引擎、同一运镜提示词,唯一变量是图。产出随机编号打乱后团队盲评五维打分(真实感 / 产品还原 / 运镜服从 / 画质 / AI 味),打完揭盲。历史产出摆旁路做参照,不进主对照。

预算 ¥10–40 · 零新增账号凭据
⚖️

判据前置go / no-go 写在实验前

结论怎么用在开跑前就定死:真图显著更好 → 归因成立,产线立即切真图路线;两者都一般 → 图源不是主因,启动下一层排查(模型参数档位 / 提示词)。方案经对抗性评审砍掉了多引擎对照——同引擎内隔离变量已经够回答问题,多买引擎是浪费。

01–03
LLM 工位
脚本 → 素材编目 → 分镜:钩子文案与逐镜脚本由 LLM 生成,输入可以直接用「解构产线」从真实爆款拆出来的分镜骨架——比让模型凭空想靠谱
04–06
生成工位
出画(图生视频)→ 配音(TTS)→ 口型:三个花钱的工位,每个都是统一接口的可插拔模块——M1 定了引擎,换供应商只动一个文件
07–08
合成工位
合成 → 变体矩阵:ffmpeg 拼片、字幕、BGM,同一素材出多版本投放变体;AIGC 标识在这一步写进元数据,发布时主动声明

// 架构:异步 job + 数据库状态机,逐工位写状态、可断点续跑。目前脚本与分镜两个工位接真实 LLM,其余占位——故意的:等 M1 定了引擎再接,避免在错的引擎上白做集成。

🎨

生图 + TTS 选型火山引擎全家桶

生图走即梦 Seedream(官方 API、低延迟),配音走豆包 TTS(授权音色库)——同账户体系、国内直连、可开发票,产线依赖收敛到最少的供应商。

🎬

出画选型无声档是成本关键

图生视频用无声档模式(配音在自己产线里做),单价只有有声档的三分之一左右;M1 实验用 DashScope Wan2.2 托管跑对照。目标成本 ¥50–120 / 条成片。

🏗️

自建口径修正省 2–5 倍,不是数量级

此前「自建便宜几十倍」拿错了对比档位。修正后:自建 GPU 相比商业 API 只省 2–5 倍;自建的真正价值是 LoRA 风格微调和更强控制——那是 M2 的事,M1 全走托管。

03
Ad Handoff Architecture · WeCom As Terminal

投放承接:按「承接链路形态」选生态

投放评估的硬约束是企业微信是唯一承接终端——所以三大生态的排序本质上不是比流量,是比「广告点击到躺进企微」这条链路的技术形态:跨几跳、掉多少人、能不能回传优化。

🥇

腾讯 · 同域承接点击即加微,零跨端

全网唯一不跨 App 的形态:广告点击直接拉起获客助手·获客链接——1 条链接给 500 个企微号分流、免扫码;加粉成功事件经 API 回传给投放端做 oCPM 优化,形成闭环。链路瓶颈不在广告,在企微号加人频控(新认证号前 30 天日加约 80 人)——所以承接侧要备 3–5 个号分流。

链路:广告 → 获客链接 → 企微(1 跳)
🥈

字节 · 跨端两跳落地页做桥

家装线索 2026 年已整体迁到巨量本地推。承接走官方链路:广告 → 橙子建站落地页 →「加微」按钮绑获客助手 DeepLink 拉起加粉,加粉事件同样可回传优化。抖音生态封闭、比腾讯多一跳,每一跳都是流失面。企微组件是行业白名单制,家装类目待确认。

链路:广告 → 落地页 → 企微(2 跳)
🥉

小红书 · 站内兜底组件封闭,加微后置

导流管控全行业最严且持续收紧(2026-07 起暗语彻底作废)。技术上只能走站内官方组件:私信企微名片 / 留资表单回捞,且名片组件有投放消耗门槛。架构选择:站内表单留资兜底,加微动作后置到外呼环节,不在站内硬导。

链路:内容 → 站内表单 → 外呼 → 企微
🎯

归因设计 · 投前埋点每个计划一个渠道码

归因必须投放前埋好:每个广告计划配独立渠道参数(获客链接的渠道标识 / mark_source),客户加进企微那一刻就知道来自哪个计划、哪条素材。算账口径统一为「到企微真实成本」= 线索成本 + 加微流失 + 加好友费——只看 CPL 会系统性低估。

🚫

为什么千川不用目标函数不匹配

巨量千川的优化目标是电商 GMV(卖货、定金券),投放算法围绕成交出价;「留资加微谈单」的目标事件是加好友,千川没有对应的优化闭环。工具选型跟着目标函数走,不跟着「抖音投放=千川」的直觉走。AI 素材合规另有两条硬线:AI 内容主动声明 + 不得用虚构人设做客户见证。

05
WeCom Automation · Plan A / Plan B

企微自动化:官方 API 被卡后的工程解

企微 AI 接待有两套方案:方案 A 走官方 API(正规军),方案 B 走界面自动化(游击队)。A 被备案卡住,B 是当前在生产上跑的——两套不是二选一,是先后关系。

方案 A · 官方客服 API(写完待解锁)

  • 回调验签、AES 解密、消息收发、知识库对接全部开发完毕
  • 优点:官方送达回执、稳定、真无人值守
  • 卡点:企微后台要求回调域名 ICP 备案主体 = 企业主体,通用托管域名一律被拒
  • 解锁:拿到甲方主体备案域名,解析一条记录即零改动复活

方案 B · 云电脑 GUI 自动化(生产在跑)

  • 云电脑挂登录好的企微客户端:截屏 → 视觉模型认字读消息(像素红点检测新消息)→ 定位输入框逐字打字发送
  • 无任何 API 依赖,绕开备案;缺官方回执 → 用发送后回读确认 + 数据库逐条对账兜底
  • 天花板:读屏判断本质不稳,到不了零故障无人值守——这是 A 的存在意义
云电脑
只做 I/O
本地 Python 循环只负责看和打字——不认人、不生成、不落库,让最脆的一层保持最薄
中转层
东京接力
国内云电脑连不上 Vercel → 消息经 Fly.io 东京中转进出,中转层无状态、可随时重启
云端大脑
全部智能
认人、带历史上下文、按销售人设生成回复,落库 + 成本核算都在这层——换模型只动一个环境变量(7 月已热切换过一次底层模型,可独立回滚)
回路
对账闭环
发送后回读屏幕确认真发出去了,GUI 记录与数据库逐条对账——「发了」由证据定义,不由代码返回值定义
🛡️

确定性护栏三道闸拦在生成之后

防自问自答、防误读联系人、发送前窗口校验——都是代码规则不是提示词。再加服务端「轮次铁律」:客户没说新话,AI 就不回,杜绝自嗨刷屏。

👁️

VL 只留语言任务位置判断收回给代码

实战教训:让视觉模型判断「哪条消息是最新的、在屏幕什么位置」不可靠——位置与几何类判断改用固定坐标和确定性规则,VL 只负责认字。

📈

灰度机制身份隔离 + 日限爬坡

每个销售身份独立配置、独立开关、DRY_RUN 预演模式;日限从 5 条起步爬坡。话术水平先用历史真实对话逐轮压测对齐金牌销售,再放真实客户。

06
Stack & Principles · One Table

一页看全选型与理由

子系统 / 槽位选型为什么
云端大脑Next.js · Vercel判断与生成集中层,从不直接触碰终端
事实源Supabase Postgres状态机 + 队列 + 对账,每一棒落库再交接
中转层Fly.io(东京)国内云电脑 ↔ 海外云的唯一通路,无状态可重启
执行端无影云电脑 · iPhone WDA · 安卓 ADB发送必须发生在真实登录态的真实界面里
对话 / 话术 LLMqwen3-235b-a22b-2507中文销售对话质价比,env 切换、可独立回滚
意向分析 LLMdeepseek-v4-flash高频短任务,便宜的干粗活
读屏视觉模型qwen3-vl-30b只做认字;位置判断已收回给确定性代码
生图即梦 Seedream(火山)官方 API 低延迟,与 TTS 同账户收敛供应商
图生视频DashScope Wan2.2(M1)· 可灵无声档无声档省 2/3 成本;引擎终选等 M1 盲评结论
配音豆包 TTS授权音色库,合规且成本低
合成ffmpeg on Fly拼片 / 字幕 / 变体 / AIGC 元数据标识一站完成
可观测Langfuse trace 全覆盖每次 LLM 调用可追溯,按人 / 按任务追账
🧭

原则一 · 先实验后投入最便宜的问题先问

视频线不急着换引擎,先花 ¥10–40 做图源盲评;投放不急着烧钱,先 2–4 周小额校准 CPL。每个重决策前面都放一个便宜的实验,让数据而不是直觉拍板。

⚙️

原则二 · 模糊给模型,确定给代码贯穿四条线

意向判断、话术生成给 LLM;发号时机、发送校验、轮次控制、归因埋点全是代码规则。能用状态码回答的问题,不让模型在提示词里抖机灵。

一句话总括:四个子系统共享同一套工程哲学——想在云端、手在终端、每一棒落库交接;模糊判断给模型、确定性动作给代码;先做最便宜的实验,再做最贵的投入。被合规卡住的路(官方 API、短信链接)全部保留「备案到位即零改动解锁」的形态,不推倒重来。