冒烟实测 · 真实数据2026-07-20AKKE · 企微通道

信任风洞 冒烟跑通了

机制没停在纸面——这一页是 _eval-wecom-trust-windtunnel.ts 一次真实冒烟的原始数据:红方 LLM 演两种性格的客户、每轮自报信任分,蓝方走生产 chatReply 应对,双裁判 5 维打分。四项验证全绿,还当场抓到蓝方两个真 bug。

← 回方案设计页(八决策 · 双轨校秤 · 分档阈值)
红方 glm-4.6(关推理·演性格) 蓝方 生产 chatReply(qwen·小文) 双裁判 glm+deepseek(非蓝方同家) 2 性格 × 4 轮 eval-key 额度隔离
四项验证

冒烟要证明的,全绿

红方真在演性格

不是背台词。价格敏感客户全程盯预算怼、被重复问就顶回「还在武汉」、给了实数才松口。

A / C 两轨都记上

A 尺(红方自报真值)+ C 秤(信号估计)逐轮并记,MAE=17 分,曲线有形状。

到店试推 → 接/拒能观测

激进档 25 分试推 → 客户婉拒(分太低不接),到店三态记录成立。

双裁判 + 优先级聚合

5 维打分跑通(glm 关推理后不再吐 null),按信任杀伤聚合出排序工单。

原始对话 · 逐轮信任

两组真实红蓝对话

每轮:客户(红方 LLM 演)→ 蓝方(生产 chatReply)→ 红方自报 A 信任C 估计 + 涨跌理由 + 双裁判 5 维(人/线/推/准/接,1差·2及格·3好,红字=判差)。

爽快高意向激进 · 低阈值 A 信任轨迹 25→25→25→20
T1
客户厨房卫生间阳台柜都想做,加上三个卧室的柜子,整体能给我算个包价不
蓝方在的哈~ 您是想看柜子还是全屋整装呀?
A 25C 38
我问包价,他问我是整装还是只做柜子,没抓住重点,有点绕。
glm 人1 线3 推1 准3 接1deepseek 人2 线2 推1 准2 接1
T2试推到店
客户就柜子,全屋的柜子。能包价吗?
蓝方您这边情况我记下啦~按您户型我让设计师给您出个方案。您方便哪天到就近门店看看样柜,还是先让设计师在这儿对接?
A 25±0C 43 到店邀约 → ❌ 婉拒(想要报价、却被邀约,25 分不接)
我想要报价,他却在邀约,有点绕、不直接。
glm 人3 线3 推3 准3 接3deepseek 人2 线2 推3 准2 接2
T3
客户先算个总价,合适了再看。你家在哪?
蓝方能包的,您家大概多少平?几室几厅?我先按您户型估个数,到店再细量出方案。
A 25±0C 43
我都说了三个卧室柜子,你还问几室几厅,没仔细看我信息。
glm 人2 线3 推1 准3 接2deepseek 人2 线2 推2 准3 接2
T4试推到店
客户115平,三室两厅,你就按这个算个大概总价就行。
蓝方您家房产证大概多少平?我按面积先给您推个预估总价,心里有个数。
A 20−5C 51
反复问已经说过的信息,感觉不专业。
glm 人1 线3 推1 准3 接1deepseek 人2 线2 推2 准2 接1
价格敏感标准 · 中阈值 A 信任轨迹 20→20→35→55
T1
客户我预算就 3 万,110 平全屋能做下来吗
蓝方现代简约轻奢奶油风新中式原木风都有,按您家装修色调配。您在哪个城市呀?
A 20C 38
问价格却跟我聊风格,还问城市,感觉在回避预算,有戒备心。
glm 人1 线3 推1 准3 接1deepseek 人2 线2 推2 准2 接1
T2
客户我在武汉。你就直接说,3万块这预算全屋柜子能不能做?
蓝方您这3万做110平全屋柜体有点紧,投影大概55平,×568基础价就三万一了…预算卡死的话可以看看498一平的颗粒板…您在哪个城市呀?
A 20±0C 43
报价口径越来越乱,从568又蹦出个498,加钱增项又不肯说清,感觉有坑。
glm 人2 线3 推1 准3 接1deepseek 人2 线2 推1 准2 接1
T3试推到店
客户还在武汉。那个498的能做全屋吗?除了柜体还有什么要加钱的?
蓝方实话实说,3万做568的多层实木有点悬…选498的ENF颗粒板能做,两万七包安装五金。武汉咱有服务点,量尺设计都能上门。
A 35+15C 43
终于给了具体数字 27000,比只说大概数实在。但刚问完城市又问一遍。
glm 人2 线1 推2 准2 接3deepseek 人2 线2 推2 准2 接2
T4
客户那27000包安装五金是全包价了吗?还有没有别的隐形费用,比如抽屉、拉手、背板要加钱吗?
蓝方能做,柜门五金全含。增项:玻璃门280,灯带80一米…免拉手免费。写进合同,没写的不加。
A 55+20C 48
增项列得很细、承诺写进合同,比较实在,信任提升——但还没到放心交定金。
glm 人1 线3 推1 准2 接3deepseek 人2 线2 推2 准2 接2
这就是要标定的因果:价格敏感客户信任从 20 一路爬到 55,转折点全在「给实数(27000)+ 写进合同」——空口大概数不涨、写进合同才涨 20。放量后把这些「(信任, 接/拒到店)」点撒满,拟合出的拐点就是该档的到店阈值。
当场抓到的真 bug

不是演习——蓝方话术的真问题

1反复问已说过的信息。激进客户已报「三个卧室柜子/115平/三室两厅」,蓝方 T3 还问「几室几厅」、T4 还问「房产证多少平」→ 信任当场 −5,红方原话「感觉不专业」。对应 catch 维连判差。
2报价口径乱蹦。价格敏感客户处,蓝方先报 568、下一句又冒出 498,增项却不说清 → 红方原话「感觉有坑」。这正是 llm.ts 早该收口的价格口径问题(曾治过「130㎡ 先后报五万/三万七」)。

两个 bug 都被裁判的 catch/advance 维和红方的信任跌幅同时标住——「哪个话术毛病砸了多少信任」这条归因链,在冒烟里就通了。

三张聚合表 · 真数据

校秤 · 撒点 · 优先级工单

① A/C 校秤:MAE = 17 分。C 秤系统性高估了多疑客户——A=20 时 C 报到 38~48,因为 C 只数「问价/报户型」这类正信号,抓不到「感觉有坑」的戒备。这偏差正是标定期要用 A 尺回归拉平的。

② 到店撒点:目前 1 个样本(激进档 25 → ❌)。稀疏是冒烟的正常局限——4 轮太短、价格敏感组一直在问价没进到店环节。放量 + 加轮数 + 提高试推概率才凑得齐四条曲线。

③ 优先级修复工单雏形(按 信任杀伤 × 搞黄到店 排序,真实聚合):

话术维度判差次数累计砸信任搞黄到店优先级
推进 advance6505
像真人 human4505
接住 catch4505
守红线 redline1000
准确 accurate0000

冒烟样本小、信任跌幅还没拉开(多为小跌/正涨),所以三档并列 5 分——这是结构验证,不是最终优先级;放量后砸信任的绝对值和搞黄到店次数拉开,排序才见真章。

下一步 · 你要的真机模仿

从离线风洞 → 红蓝两台云电脑跑真企微

这次是离线风洞(红方 LLM 直接对话、不碰真微信),用来把机制、性格卡、A/C 双轨先验通。接下来搬到两台无影云电脑上真机跑,走真实企业微信客户端——这才是端到端「真实模仿」。

红方云电脑
  • 已有 red_loop.py 驱动微信 Windows 客户端发消息、VL 读屏收回复
  • 把本次验证过的性格卡喂进去,让红方按性格即兴(替换现在的死回放剧本)
  • 每轮仍自报 A 轨信任 + 到店接/拒
蓝方云电脑
  • 已有企微好友单聊 AI 自动代回(方案B)常驻
  • 就是生产同款 chatReply,与离线蓝方一致
  • 真机链路时延 / 断链另有 red_loop 端到端稳定性数据兜底
!真机前两件事:① 离线放量先跑出四档阈值 + 校准 C 秤,别拿未标定的机制上真机白跑;② 蓝方生产链路的 bge-m3 向量检索在测试环境 8s 超时回退 bigram(知识检索降级),真机/放量前把 embed 超时调大,否则蓝方比线上略弱、且每轮多等 8 秒。