通道一 · 当前会话像素侦察
正在聊的会话来新消息不会出红点,只能盯着看。两次截屏做几何差分:没变化就不劳驾大模型,变了才把变化的小块喂给它——省钱且不会漏。
客户在企业微信上给销售发消息,几十秒后收到回复——回复其实来自 AI。它用哪位销售的身份就是哪位,记得客户说过的每个数字,聊 50 轮不忘事。这页讲清楚:一条消息进来,到回复发出去,中间经过哪几站。
// 对外讲解口径 · 只讲机制,不含运营数据
企业微信官方不给「好友单聊代发」的 API,所以整条链路是像人一样操作企微客户端:一台云电脑挂着登录好的企微,看屏幕、打字;真正「想怎么回」的全在云端。
阿里无影 · 桌面版企微常驻
截屏发现新消息 → 让视觉模型「读」出对话 → 把云端给的回复逐字打进输入框发出去。只做输入输出,一行业务逻辑都不放这。
国内云电脑连不上 Vercel
云电脑的出口访问不了海外部署的大脑,也访问不了大模型服务——所以两类请求都经东京的中转服务器转发,纯透传不落数据。
记忆 · 判断 · 生成 · 落库
收到「客户说了什么」,过五道闸、拼三层记忆、判话术阶段,让 LLM 以对应销售的身份写回复,全过程留痕可追账。
云电脑只做「看」和「打字」,所有判断都在云端——想改话术、换模型、调规则,改云端就行,云电脑一行代码不用动。
从「客户按下发送」到「客户收到回复」,七步。紫色在云电脑上发生,蓝色在云端大脑里发生。
// 关键设计:每一步都能安全地什么都不做——读不准、拿不稳、闸没过,宁可这轮跳过下轮再来,绝不硬发。
读屏是全链路最脆的一环——视觉模型会看走眼。解法不是换更强的模型,而是把容易看错的判断从模型手里拿走。
正在聊的会话来新消息不会出红点,只能盯着看。两次截屏做几何差分:没变化就不劳驾大模型,变了才把变化的小块喂给它——省钱且不会漏。
视觉模型只看左侧列表窄条找红色未读圆点,每轮最多开 3 个。带「@微信」标记的外部客户永不进抑制名单——客户消息零漏接。
沉默 7 天的好友,每天派一个新话题主动唤回,连推 7 天。派单节奏由云端定时任务控制,与被动回复共用同一双手、排队不抢窗口。
视觉模型只做它从不失败的事:抄字、判左右。「哪条最新」「是不是红点」「谁说的」这类容易看走眼的判断,全部交还给代码做几何计算——顺序按纵坐标排、身份按横坐标定、新旧按像素差分判。
生成回复只是最后一小步。前面先过闸、再回忆、再定话术阶段——大部分逻辑在决定「要不要回」和「以什么姿态回」。
客户没说新内容不回;自己的话术被读屏误认成客户消息时认出来不接;机器人和同事账号闭麦;已转人工的会话绝不抢答,客户冷静期后主动再来才自动接回。
客户话里露出「订金 / 到店 / 什么时候有空」这类决策信号就切临门话术;下一轮信号没了就退回日常培育口吻——只看客户说的话判断,不被自己的话术污染。
每位销售一个独立身份壳,AI 代回沿用该销售的名字与口吻;不同销售的客户即使同名也各自独立记忆,绝不串号、绝不穿帮。
剥掉模型偶尔泄漏的内部协议字节、舞台指示、「[图片]」占位标记——宁可短一点,也不能让客户看到一丝生成痕迹。配图三选一互斥,一轮只发一类。
最像机器人的从来不是文案,是节奏和失误方式。发送端所有护栏都不依赖视觉模型的判断——全是确定性代码。
25~70 秒随机醒一次;按文案长度停 5~20 秒再打字;回复最多切 3 段不刷屏;只在 9 点到 21 点干活;每客户、每天都有条数上限。
自己近期发过的话存一份指纹缓存,读屏偶尔把我方消息误判成客户消息时,模糊比对认出来直接丢弃——「自己跟自己聊起来」这种事故被焊死。
每个客户一本「已回复过什么」的台账,客户消息哪怕被拼进新一轮,也会逐行剔掉答过的部分——同一个问题绝不答两遍。
每打一段字前都校验企微还在前台,被人抢走窗口立刻停手、下轮重试;连续异常 3 次整个停机等人来看——出错时的姿态是「停」,不是「猛试」。
大模型一次只能看有限的上下文,聊久了会「失忆」——复读、重问、忘记报过的价。解法是三层记忆叠加,轮数从此没有上限。
每次回复后,后台由代码触发把客户说的面积、预算、城市、户型等 8 个硬字段抽进画像——不指望聊天模型「自觉记笔记」,实测它不会。
模型每轮只看最近 40 条;更早的对话按水位线增量压缩成一段 900 字内的摘要随行注入。报过的价格数字一字不差照抄,新信息压过旧信息。
认出「企微上这位就是抖音上聊过的那位」,把历史会话的画像事实合并过来——只搬结论不搬聊天原文,既省 token 又不串味。
「像个机器人」的最大投诉不是话术生硬,而是换个渠道就把您忘了。三层记忆的目标只有一个:客户说过一遍的事,永远不需要说第二遍。
实时回复链路之外,五个云端定时任务负责通知、召回和统计——不碰回复主链路,挂了也不影响回消息。
| 任务 | 频率 | 干什么 |
|---|---|---|
| 好友通过通知 | 每 15 分钟 | 新客户通过好友申请 → 推卡片到内部群,销售第一时间知道 |
| 加人日战报 | 每 30 分钟 | 某销售当日加人达到阈值 → 推战报(已通过 / 等通过 / 搜不到 / 死号) |
| 七天召回派单 | 每 2 小时 | 挑出沉默好友写入召回队列,云电脑按额度取走主动发话题 |
| 抖音↔企微搭桥 | 每天一次 | 从抖音私信里抽手机号建索引——企微加上人后能认出「就是抖音那位」 |
| 对话漏斗日报 | 每天一次 | 开口 → 聊满 3 句 → 6 句 → 进临门期 → 约到店,五档漏斗推群 |
视觉模型抄字判左右,语言模型写话术——顺序、身份、去重、限频这些有确定答案的判断,一律交给代码。看走眼的空间被压到最小。
读不准、拿不稳、闸没过——每一步都能安全地什么都不做,下轮再来。连续异常直接停机等人。错发一条的代价远大于晚回十分钟。
每一次模型调用都有 trace,每一分成本都能算到通道和任务头上;每条 AI 回复真发出去了才落库——统计里的每个数字都对应真实发生过的事。