企微销售拆成三段:机器人训练 → 聊天运营 → 插件中心。这一页按这三段, 逐段放上已经在生产环境跑起来的东西:一个自动生产演练的客户风洞、 一条只挑 100 条给你们标的标注链路、以及从抖音评论一路打到企微报价的两条真实客户全链路。
除人物卡外,以上数字均为 2026-07-30 直查生产库所得(品牌:有大有小)。
三段之间不是并列关系:风洞造演练 → 标注台收正确说法 → 话术库回灌 → 真实对话再暴露新问题,是一个转起来的圈。
要标 100 组对话,最贵的不是标,是先得有 100 组值得标的对话。我们让 AI 自己造。
关键设计是:蓝方不是为测试特制的副本,就是生产环境那套 AI 销售「小夏 / 小文」。它查客户历史、选话术、配海报,目标是把人推到店。
| 方 | 是什么 | 怎么跑 |
|---|---|---|
| 红方 | 合成客户。拿人物卡即兴演,每轮自报信任分 0–100 并说明为什么涨/跌 | 另一家的模型(glm-4.6,关掉思维链),刻意不与蓝方同门,避免自己跟自己串通 |
| 蓝方 | 生产销售 AI 本体,读 67 篇知识库 / 206 条话术样本 / 36 条决策规则 | 离线直打大脑,真机版则在云电脑上真实操作企业微信窗口,两轨都跑 |
| 裁判 | 双裁判交叉打分,5 个维度:人味 / 不踩红线 / 推进到店 / 说得准 / 接住需求 | 两个不同厂的模型各打一遍(glm-4.6 + deepseek-v4-flash),避免单一裁判的偏好 |
到店门槛不是全局一个数,按性格分四档。这四张卡是离线风洞和云电脑真机对练共用的同一份,改一处两边都变。
| 人物 | 档位 | 什么条件下才答应到店 |
|---|---|---|
| 王磊 38 岁 | 激进 · 低门槛 | 信任约 50 就答应,报价痛快就约 |
| 林静 34 岁 | 标准 · 中门槛 | 信任 65+ 且要拿到一口价 |
| 陈教授 50 岁 | 保守 · 高门槛 | 信任 80+ 且细节要问透 |
| 小周 28 岁 | 软到店 · 观望 | 信任 70+ 且只吃「先来看看样板」这种软说法,硬约必崩 |
风洞要量的那件事就一句话:信任到几分,才推得动到店。四档正式阈值还在放量标定中,机制已跑通。
不是随机抽 100 条,是三种「值得看」混着挑,每条都带一句「为什么请你看这条」——不然甲方点开看到一句平平无奇的回复,不知道该看什么。
| 桶 | 判据 | 给你看到的那句话 |
|---|---|---|
| 裁判低分 | 双裁判某一维平均 ≤ 2 分 | 「裁判给这条打了低分(人味、推进到店、说得准),想请您给个正确说法」 |
| AI 打太极 | 回复里出现兜底措辞(「我帮您问下」「我让设计师」)= 它自己也拿不准 | 「AI 这句在打太极(「让设计师」),说明它自己也拿不准」 |
| 高频问法 | 同一类问法出现次数最多,每类只取 1 条代表(最高的问过 6 次) | 「这类问题客户问过 N 次」 |
这是待标注库里一条真实记录的两个裁判原话。这种评语不是泛泛的「不够好」,是能直接变成话术工单的具体缺陷。
两条都指向同一个病根:算得对,但不往前走。第二条还额外抓到「承诺了系统做不到的事」和「编了没核实的赠品数字」—— 这正是必须由你们拍板、不能让 AI 自己拿主意的地方。
判「回得好」点一下就存;判「要改」时编辑框里已经预填了 AI 的原话,你在上面改成自己会怎么说就行—— 从零写一段的门槛太高,会直接导致跳过。每条都标了「为什么请你看它」。
你的判定 + 改后的话术 + 原因分类,逐条存下来,能导出成一份可读的清单。
不自动进话术库。一句改错的话直接进样本,会污染线上所有回复——我们过一遍再搬。
搬进 206 条金牌话术库后回填来源,导出里会标「已搬进话术库」,将来能查每句话是谁定的。
顺带说清「提示词开放到什么程度」:我们的分工是风格与红线开放给你们改,路由与阈值不开放。 「信任够不够格推到店」这类判断走确定性代码闸,不靠 AI 自律——AI 自律在这种事上不可靠。
质检不看示意数据,看真人真单——从抖音评论的四个字,到企微里 174 平的五房三卫;从一句「假的?」,到六分钟后交出的微信号。
选它当质检样本,正因为它没成——一单「几乎没做错事却还是没成」的对话,比顺利成交的更能量出系统的真实边界。 她还没交房,门是留着的,这条该转成有日程的长线跟进。
每条我方回复都带三层标注:这句的逻辑、AI 当时怎么决策的、以及可查证的调用链。所以评级不是印象分。
和燕子那单正好互补:这一单话术几乎都对、数据几乎全错。它是「成得了」那一侧的样本, 也是唯一一条把「我方消息被当成客户消息写回库」这个数据事故完整暴露出来的案例。
同一套评级口径。和燕子那单对着看:燕子输在地理,这一单输在数据管道。
这是那 100 条待标注按话题自动分堆的结果——等于一张「客户嘴里最常出现的问题」清单,也是你们标注时的优先级。
「其他」占 36 条不是分类失败,是这一批刻意把长尾也放进来了——长尾恰恰是最容易暴露 AI 硬编瞎答的地方。
「触发条件 → 自动动作 → 人工兜底」这个拆法是对的。难点不在画三栏,在于诚实地承认哪一栏必须留给人。
「已经能自动」的判据是:生产环境的真实对话里已经跑出来过,不是 demo 演过。
| 插件 | 现状 | 能自动到哪一步 | 人工兜底点 |
|---|---|---|---|
| B · 自动报价方案 | 已在跑 | 按面积分档算总价,两次报价自洽;会主动披露隐性费用(燕子那单的 3000 元远程费就是 AI 自己说的) | 赠品、折扣、活动这类没核实过的数字一律不许自己编——裁判已经抓到过一次编赠品,这条要做成硬红线 |
| C · 免费上门量房 | 已在跑 | 问出地址与预算,判断是否在服务半径内 | 「推不推到店」不交给 AI 判断,走确定性代码闸:信任分不到阈值就物理删掉「约到店」这个动作,AI 想约也约不了 |
| 素材 / 海报配发 | 已在跑 | 15 张官方海报,命中触发词即配发,内联发出 | 发图与诉求错位仍会发生(客户说了不要还发)——规则是客户没要就不发,正在收 |
| A · 户型图 → 定制方案 | 硬天花板 | 能看懂户型描述、能问全信息,但出不了「按你家户型算的清单/参数报告」 | 必须落到真人:话术要转成「清单我让设计师整理好,您到店或线上会议我们当面过一遍」,而不是让 AI 空口承诺 |
| D · 风格选择题 | 未做 | — | — |
「触发条件让运营看得懂」的前提是料本身是分好类的。这是生产库里现存的量(2026-07-30 直查)。
| 库 | 条数 | 作用 |
|---|---|---|
| 知识库文档 | 67 | 回答事实类问题的依据,分 5 类 |
| 金牌话术样本 | 206 | 决定「像不像人说的」,标注结果最终搬进这里 |
| 决策规则 | 36 | 什么情况该做什么,含红线 |
| 官方海报 | 15 | 命中触发词自动配发 |
风洞里「林静」这张卡的人设是:只认白纸黑字的清单落地才动。蓝方把她完美地引导到了「只差一份定制明细单就成交」——
然后卡住了。AI 发不出按她家户型算的真实清单,系统只能发文字和固定海报。 「我让设计师给您拉个清单」在这种客户面前就是一张空头支票。这类客户会永远卡在这一步。
这就是我们做红蓝对抗最想拿到的东西:不是「AI 话术还能更好」这种没法落地的结论,而是一个具体的产品缺口。 要么补「按户型出清单图」的能力,要么把话术改成把她引到有真人能发清单的场景。两条路都要你们拍板。
顺带说明标注台为什么单设「AI 打太极」这一桶:「我让设计师给您拉个清单」正是那张空头支票的原型句。 AI 每次用兜底措辞,都是在说「这事我做不到但我不想承认」——这类句子集中起来看,就是一张产品缺口清单。
左边是问题、右边是要做的动作。带 需甲方配合 的,是 AI 和我们都替不了的判断, 得你们给一句话口径;其余是我们这边的工程活。只列已经定位到根因、知道怎么修的,没定位清楚的不拿来充篇幅。
标注台是唯一能把「你们家该怎么说」灌进系统的入口——我们猜不出你们的口径。判「好」点一下即存,判「要改」在 AI 原话上改。
到店、上门量房、线上会议,哪些算推进成功?口径不定,四档信任阈值就没法标定,到店闸也就上不了线。
你们把「算推进成功」的动作列出来,我们按这个口径重跑标定。影响面:到店闸能否上线。
面积分档总价已经算得准;但赠品、折扣、活动、工期承诺这类,AI 编过——裁判抓到过「抽屉每满 3 平还送 1 个」这种没核实的数字。
列出来我们就能做成硬拦截,AI 想说也说不出口。影响面:能否消掉「编数字」这一整类风险。
只能发文字和固定海报。认清单的客户会被完美引导到最后一步然后永远卡住(风洞里林静这张卡复现得很干净)。
两条路要你们选一条。在补上之前,我们先把话术转成「清单我让设计师整理好,您到店/线上会议当面过一遍」,不留空头承诺。
「信任到几分才推得动到店」四档阈值还在放量标定;在标定完之前,推到店的时机仍靠 AI 自己判断。
阈值路由不交给 AI:信任不到线就物理删掉「约到店」这个动作。机制已跑通,等口径(待做 02)+ 标定数据。
燕子那单决定结局的 3 条是人手打的、没落库;板材那单更狠——我方消息被当成客户消息写回库 2 次,一次触发了真发给客户的自动回复,一次把会话推到了 decision。
inbound 抓取先与我方近期已发消息比对,命中就不入库、不触发回复(只做这条即可立刻止损);人手打的气泡按几何位置识别后补记入库。企微侧已落地,抖音侧待补。
燕子人在东莞、房子在高州,隔 400 公里;板材客户 city 干脆是空的,客户报出的吉安地址也没入库。系统按采集地判断服务半径就会判错。
不再从抖音资料的城市推断;同时把 59 城服务点清单做成确定性校验——城市不在表里,就不许出现「服务过 / 能覆盖 / 有店」。
根因不在模型,在满分范例本身就写错了字——错的样本会一直教出错的回答,而且改口时 AI 没认错。
范例库里的错字直接修掉;品牌名走白名单,不在表里的词一律拦下来,不让模型自由发挥。