AI
企微销售 · 红蓝对抗专题系统现状与下一步 · 2026-07-30
WECOM SALES · RED TEAM VS BLUE TEAM

企微销售的三段流程,
我们已经用红蓝对抗把它跑成了在线系统

企微销售拆成三段:机器人训练 → 聊天运营 → 插件中心。这一页按这三段, 逐段放上已经在生产环境跑起来的东西:一个自动生产演练的客户风洞、 一条只挑 100 条给你们标的标注链路、以及从抖音评论一路打到企微报价的两条真实客户全链路。

三句话看懂这一页
01
演练不用人写,标注只挑值得看的 红方 AI 演客户、蓝方是生产机器人本体,双裁判自动打分。只有裁判打了低分、或 AI 自己打太极的那些才送到你们面前 —— 首批筛出 100 条。
02
质检拿真单子当样本,不拿演示数据 两条真实全链路案例逐句拆开:燕子·高州(未成交,输给 400 公里)、板材客户 0729(还活着,走到 decision)。附 6 模块 GOOD/MID/BAD 评级。
03
能自动的已经自动,兜底点划得很清楚 报价能自己算、海报能自己配,但「按户型出定制清单」是硬天花板 —— 这一页把兜底点标在哪、为什么标在那儿,写清楚了。
4张客户人物卡(红方)
100条待标注话术(已就绪)
330企微真实会话
1362企微真实消息
67篇知识库文档
206条金牌话术样本
36条决策规则
15张官方海报

除人物卡外,以上数字均为 2026-07-30 直查生产库所得(品牌:有大有小)。

OVERVIEW

三段各要什么,现在跑到哪一步

三段之间不是并列关系:风洞造演练 → 标注台收正确说法 → 话术库回灌 → 真实对话再暴露新问题,是一个转起来的圈。

STAGE 01

机器人训练

这一段要什么 销售培训资料 · 冠军对话样本 · 模拟演练与标注 · 风格与规则
  • 红蓝对抗风洞:红方 AI 演完整客户人物、每轮自报信任分,蓝方是生产机器人本体,演练自动产出
  • 甲方标注台:三桶混选出 100 条「AI 拿不准 / 高频被问 / 裁判低分」,免登链接点开就标
  • 风格与规则:system prompt + 36 条决策规则已在生产运行,可改可回滚
下一步:100 条标注结果回灌 · 提示词开放边界已定(风格红线开放、路由阈值不开放)
STAGE 02

聊天运营

这一段要什么 真实对话质检(按成交意愿排序)· 高频问题聚合 · 人工修正闭环
  • 两条真实全链路案例:燕子·高州(抖音 9 + 企微 16 条)与板材客户 0729(抖音 7 + 企微 21 条),逐句拆,各附 6 模块 GOOD/MID/BAD 评级
  • 高频问题聚合:100 条待标注按话题自动分堆,价格 17 / 板材 14 / 设计 11 / 到店 7
  • 修正闭环:标注结果落台账 → 人工过一遍 → 才搬进话术库(刻意不自动生效)
下一步:两条案例形成「成 / 未成」对照面,质检排序从单例推到规律
STAGE 03

插件中心

这一段要什么 户型图+风格 · 自动报价方案 · 免费上门量房 · 风格选择题,外加「触发条件 → 自动动作 → 人工兜底」
  • 自动报价:按面积分档算,两次报价自洽,还会主动把隐性费用摆出来
  • 素材自动配发:15 张官方海报按触发词命中即发
  • 户型图 → 定制清单:这是真天花板,AI 发不出来。兜底点必须放这儿,下面详说
下一步:赠品/折扣口径做成硬拦截 · 户型清单能力补齐或改话术交给真人
01

机器人训练:把「标 100 组」从苦力活改成挑活

要标 100 组对话,最贵的不是标,是先得有 100 组值得标的对话。我们让 AI 自己造。

首次引导

谁打谁:红方造客户,蓝方是本体

REDBLUE

关键设计是:蓝方不是为测试特制的副本,就是生产环境那套 AI 销售「小夏 / 小文」。它查客户历史、选话术、配海报,目标是把人推到店。

是什么怎么跑
红方 合成客户。拿人物卡即兴演,每轮自报信任分 0–100 并说明为什么涨/跌 另一家的模型(glm-4.6,关掉思维链),刻意不与蓝方同门,避免自己跟自己串通
蓝方 生产销售 AI 本体,读 67 篇知识库 / 206 条话术样本 / 36 条决策规则 离线直打大脑,真机版则在云电脑上真实操作企业微信窗口,两轨都跑
裁判 双裁判交叉打分,5 个维度:人味 / 不踩红线 / 推进到店 / 说得准 / 接住需求 两个不同厂的模型各打一遍(glm-4.6 + deepseek-v4-flash),避免单一裁判的偏好

四张人物卡:从「一推就到店」到「问透才肯来」

到店门槛不是全局一个数,按性格分四档。这四张卡是离线风洞和云电脑真机对练共用的同一份,改一处两边都变。

人物档位什么条件下才答应到店
王磊
38 岁
激进 · 低门槛信任约 50 就答应,报价痛快就约
林静
34 岁
标准 · 中门槛信任 65+ 且要拿到一口价
陈教授
50 岁
保守 · 高门槛信任 80+ 且细节要问透
小周
28 岁
软到店 · 观望信任 70+ 且只吃「先来看看样板」这种软说法,硬约必崩

风洞要量的那件事就一句话:信任到几分,才推得动到店。四档正式阈值还在放量标定中,机制已跑通。

标注台怎么把 100 条挑出来

三桶混选

不是随机抽 100 条,是三种「值得看」混着挑,每条都带一句「为什么请你看这条」——不然甲方点开看到一句平平无奇的回复,不知道该看什么。

企微实盘对话(AI 打太极 / 高频问法)56
红蓝对抗回合(裁判低分)28
信任风洞回合(裁判低分)16
判据给你看到的那句话
裁判低分双裁判某一维平均 ≤ 2 分「裁判给这条打了低分(人味、推进到店、说得准),想请您给个正确说法」
AI 打太极回复里出现兜底措辞(「我帮您问下」「我让设计师」)= 它自己也拿不准「AI 这句在打太极(「让设计师」),说明它自己也拿不准」
高频问法同一类问法出现次数最多,每类只取 1 条代表(最高的问过 6 次)「这类问题客户问过 N 次」

裁判到底在挑什么刺

真实评语

这是待标注库里一条真实记录的两个裁判原话。这种评语不是泛泛的「不够好」,是能直接变成话术工单的具体缺陷。

同一句 AI 回复 · 两个裁判各打一遍
glm-4.6
「AI 腔重,算出总价却不引导到店,推进度为零,属于原地答题。」
人味 1推进到店 1说得准 2不踩红线 3接住需求 3
deepseek-v4-flash
「违反红线尝试发图(系统无发图能力),且出现未核实数字『抽屉每满 3 平还送 1 个』,同时缺乏推进到店动作。」
不踩红线 1推进到店 1说得准 2人味 3接住需求 3

两条都指向同一个病根:算得对,但不往前走。第二条还额外抓到「承诺了系统做不到的事」和「编了没核实的赠品数字」—— 这正是必须由你们拍板、不能让 AI 自己拿主意的地方。

需要你们做的第一件事:把这 100 条过一遍

判「回得好」点一下就存;判「要改」时编辑框里已经预填了 AI 的原话,你在上面改成自己会怎么说就行—— 从零写一段的门槛太高,会直接导致跳过。每条都标了「为什么请你看它」。

当前进度 0 / 100 · 链接 45 天有效 · 免登录,手机可直接打开
打开标注台 →

你们标完之后会发生什么(以及刻意不会发生什么)

1 · 落台账

你的判定 + 改后的话术 + 原因分类,逐条存下来,能导出成一份可读的清单。

2 · 人工过一遍

不自动进话术库。一句改错的话直接进样本,会污染线上所有回复——我们过一遍再搬。

3 · 回灌 + 溯源

搬进 206 条金牌话术库后回填来源,导出里会标「已搬进话术库」,将来能查每句话是谁定的。

顺带说清「提示词开放到什么程度」:我们的分工是风格与红线开放给你们改,路由与阈值不开放。 「信任够不够格推到店」这类判断走确定性代码闸,不靠 AI 自律——AI 自律在这种事上不可靠。

02

聊天运营:拿真单子当质检样本,不拿演示数据

质检不看示意数据,看真人真单——从抖音评论的四个字,到企微里 174 平的五房三卫;从一句「假的?」,到六分钟后交出的微信号。

每日任务

案例 1 · 燕子❤️:把话说全了,然后体面地输给了 400 公里

客户「再看看先」

选它当质检样本,正因为它没成——一单「几乎没做错事却还是没成」的对话,比顺利成交的更能量出系统的真实边界。 她还没交房,门是留着的,这条该转成有日程的长线跟进。

抖音
装修知识视频下留言「求一份」系统给这条评论打了 78 分意向
7m52s
破冰私信发出从她按下发送到我们的第一句话,7 分 52 秒
加微
抖音 9 条 → 转企业微信破冰 → 纠偏 → 加微 → 深聊
企微
16 条深聊,AI 每次回复 21 秒 – 1 分 31 秒问出 174 平五房三卫、预算、风格;两次报价都算对
109min
诚实报价:主动说出 3000 元远程费人在东莞,房子在高州,最近网点 400 公里外
结果
客户说「再看看先,麻烦你了」信任建到了「被拒绝时还会说谢谢」的程度;她还没交房,交房前一两个月该主动回访

看完整案例(25 条对话逐句拆)→

6 模块评级 · 好在哪坏在哪一眼看到

每条我方回复都带三层标注:这句的逻辑、AI 当时怎么决策的、以及可查证的调用链。所以评级不是印象分。

GOOD
时效性全链路无一处慢:抖音首触 7m52s,企微 AI 响应 21s–1m31s
MID
内容高光话术与漏答并存——把「说实话」做到了极限,却吞掉了客户一个产品提问
MID
账号信任度拒绝时客户仍说谢谢,但入口端资产(主页、朋友圈)仍是笔糊涂账
BAD
地区采集到的城市 ≠ 房子所在地,锚错了城市;400 公里是硬边界,话术再好也跨不过去
GOOD
价格两次报价自洽,且主动把最不好说的那笔远程费摆到台面上
BAD
信息流转AI 和人的分工是对的,但人接管时发的那几条没进数据库——决定结局的 3 条恰好缺失

案例 2 · 板材客户 0729:第一句是「假的?」,六分钟后他给了微信号

进行中 · decision

和燕子那单正好互补:这一单话术几乎都对、数据几乎全错。它是「成得了」那一侧的样本, 也是唯一一条把「我方消息被当成客户消息写回库」这个数据事故完整暴露出来的案例。

抖音
评论「碰见一模一样的户型了 求装修清单」系统打 78 分意向;昵称是不可见字符、city 为空,opener 喊不出名字也没有地域锚
7m04s
破冰私信发出从他按下发送到我们的第一句话,7 分 04 秒
48min
客户回来,第一句是「假的?」全案最关键的一句
9s
不辩解,只亮一个行业细节「见光板和封边这两项很多家是单收的,清单里我把它们拆开标了」——只有真做过报价的人才知道这事
6m01s
他给了微信号当晚进企微拿到清单和 568 元/㎡ 口径
次日
问板材/价格/付款/合同/门店,主动报出小区吉安市吉州区红星九颂三期;我方四问四答,含「吉安没有直营店」的实话
现状
球在客户手里,他刚拿到一份完整答案没回绝也没下一步动作;系统这侧画像还是空的,跟进只能靠人记得

看完整案例(28 条对话逐句拆)→

6 模块评级 · 话术几乎都对,数据几乎全错

同一套评级口径。和燕子那单对着看:燕子输在地理,这一单输在数据管道。

GOOD
时效性评论→首触 7m04s;接住「假的?」只用 9 秒;企微三次回复 23s/24s/29s
MID
内容用行业细节化解质疑是高光;但把「千年舟」说成「千年花」,根因是满分范例本身写错了
GOOD
账号信任度质疑 → 6 分钟给号 → 次日主动报住址;诚实说没店还把两条路都留给他
MID
地区city 为空反而躲开了「锚错城市」;但客户报的吉安地址没入库,远程费一个字没提
MID
价格两次异议都没松口降价、每个数字都能在库里对上;但全程没报总价
BAD
信息流转2 次我方消息被当成客户消息入库,其中一次真的触发了自动回复、一次把会话推到 decision

高频问题聚合:客户到底在反复问什么

这是那 100 条待标注按话题自动分堆的结果——等于一张「客户嘴里最常出现的问题」清单,也是你们标注时的优先级。

价格 / 报价17
板材 / 材料14
设计 / 效果图11
到店 / 量房7
做哪些范围5
比价 / 活动4
工期 / 多久3
环保 / 甲醛3
其他 / 杂问36

「其他」占 36 条不是分类失败,是这一批刻意把长尾也放进来了——长尾恰恰是最容易暴露 AI 硬编瞎答的地方。

03

插件中心:能自动的已经自动,兜底点画在这条线上

「触发条件 → 自动动作 → 人工兜底」这个拆法是对的。难点不在画三栏,在于诚实地承认哪一栏必须留给人。

自动能力

四个插件,逐个对现状

「已经能自动」的判据是:生产环境的真实对话里已经跑出来过,不是 demo 演过。

插件现状能自动到哪一步人工兜底点
B · 自动报价方案 已在跑 按面积分档算总价,两次报价自洽;会主动披露隐性费用(燕子那单的 3000 元远程费就是 AI 自己说的) 赠品、折扣、活动这类没核实过的数字一律不许自己编——裁判已经抓到过一次编赠品,这条要做成硬红线
C · 免费上门量房 已在跑 问出地址与预算,判断是否在服务半径内 「推不推到店」不交给 AI 判断,走确定性代码闸:信任分不到阈值就物理删掉「约到店」这个动作,AI 想约也约不了
素材 / 海报配发 已在跑 15 张官方海报,命中触发词即配发,内联发出 发图与诉求错位仍会发生(客户说了不要还发)——规则是客户没要就不发,正在收
A · 户型图 → 定制方案 硬天花板 能看懂户型描述、能问全信息,但出不了「按你家户型算的清单/参数报告」 必须落到真人:话术要转成「清单我让设计师整理好,您到店或线上会议我们当面过一遍」,而不是让 AI 空口承诺
D · 风格选择题 未做

它手上到底有多少料

「触发条件让运营看得懂」的前提是料本身是分好类的。这是生产库里现存的量(2026-07-30 直查)。

产品知识23
价格口径20
流程说明14
话术脚本5
常见问答5
条数作用
知识库文档67回答事实类问题的依据,分 5 类
金牌话术样本206决定「像不像人说的」,标注结果最终搬进这里
决策规则36什么情况该做什么,含红线
官方海报15命中触发词自动配发

那个天花板,是红蓝对抗逼出来的

最硬的一条

风洞里「林静」这张卡的人设是:只认白纸黑字的清单落地才动。蓝方把她完美地引导到了「只差一份定制明细单就成交」——

然后卡住了。AI 发不出按她家户型算的真实清单,系统只能发文字和固定海报。 「我让设计师给您拉个清单」在这种客户面前就是一张空头支票。这类客户会永远卡在这一步。

这就是我们做红蓝对抗最想拿到的东西:不是「AI 话术还能更好」这种没法落地的结论,而是一个具体的产品缺口。 要么补「按户型出清单图」的能力,要么把话术改成把她引到有真人能发清单的场景。两条路都要你们拍板。

顺带说明标注台为什么单设「AI 打太极」这一桶:「我让设计师给您拉个清单」正是那张空头支票的原型句。 AI 每次用兜底措辞,都是在说「这事我做不到但我不想承认」——这类句子集中起来看,就是一张产品缺口清单。

NEXT STEPS

下一步待做 —— 每条都写清楚谁来做

左边是问题、右边是要做的动作。带 需甲方配合 的,是 AI 和我们都替不了的判断, 得你们给一句话口径;其余是我们这边的工程活。只列已经定位到根因、知道怎么修的,没定位清楚的不拿来充篇幅。

待做 01 · 话术口径

那 100 条标注还没开始(0 / 100)

标注台是唯一能把「你们家该怎么说」灌进系统的入口——我们猜不出你们的口径。判「好」点一下即存,判「要改」在 AI 原话上改。

动作 需甲方配合

打开链接,把 100 条过一遍

免登录、手机可开、链接 45 天有效。标完落台账 → 我们人工过一遍 → 才搬进 206 条话术库。打开标注台 →

待做 02 · 口径定义

「到店」到底算什么,还没定

到店、上门量房、线上会议,哪些算推进成功?口径不定,四档信任阈值就没法标定,到店闸也就上不了线。

动作 需甲方配合

给一句话定义即可

你们把「算推进成功」的动作列出来,我们按这个口径重跑标定。影响面:到店闸能否上线。

待做 03 · 报价红线

哪些数字 AI 能自己说,还没划线

面积分档总价已经算得准;但赠品、折扣、活动、工期承诺这类,AI 编过——裁判抓到过「抽屉每满 3 平还送 1 个」这种没核实的数字。

动作 需甲方配合

列一张「可自主 / 必转人工」清单

列出来我们就能做成硬拦截,AI 想说也说不出口。影响面:能否消掉「编数字」这一整类风险。

待做 04 · 产品天花板

AI 发不出「按户型定制的清单 / 参数报告」

只能发文字和固定海报。认清单的客户会被完美引导到最后一步然后永远卡住(风洞里林静这张卡复现得很干净)。

动作 需甲方配合(方向)

补能力,还是改话术把人交给真人

两条路要你们选一条。在补上之前,我们先把话术转成「清单我让设计师整理好,您到店/线上会议当面过一遍」,不留空头承诺。

待做 05 · 到店闸未上线

四档到店阈值还没标定完

「信任到几分才推得动到店」四档阈值还在放量标定;在标定完之前,推到店的时机仍靠 AI 自己判断。

动作 · 我们做

标定完换成确定性代码闸

阈值路由不交给 AI:信任不到线就物理删掉「约到店」这个动作。机制已跑通,等口径(待做 02)+ 标定数据。

待做 06 · 数据管道

我方发的消息,系统认不出是自己人

燕子那单决定结局的 3 条是人手打的、没落库;板材那单更狠——我方消息被当成客户消息写回库 2 次,一次触发了真发给客户的自动回复,一次把会话推到了 decision。

动作 · 我们做

回声识别 + 人工消息回写

inbound 抓取先与我方近期已发消息比对,命中就不入库、不触发回复(只做这条即可立刻止损);人手打的气泡按几何位置识别后补记入库。企微侧已落地,抖音侧待补。

待做 07 · 地区锚错

采集到的城市 ≠ 房子所在地

燕子人在东莞、房子在高州,隔 400 公里;板材客户 city 干脆是空的,客户报出的吉安地址也没入库。系统按采集地判断服务半径就会判错。

动作 · 我们做

房子在哪提为独立必问项 + 服务点清单做硬校验

不再从抖音资料的城市推断;同时把 59 城服务点清单做成确定性校验——城市不在表里,就不许出现「服务过 / 能覆盖 / 有店」。

待做 08 · 品牌名说错

把「千年舟」说成了「千年花」

根因不在模型,在满分范例本身就写错了字——错的样本会一直教出错的回答,而且改口时 AI 没认错。

动作 · 我们做

改范例错字 + 品牌名白名单硬闸

范例库里的错字直接修掉;品牌名走白名单,不在表里的词一律拦下来,不让模型自由发挥。