机制没停在纸面——这一页是 _eval-wecom-trust-windtunnel.ts 一次真实冒烟的原始数据:红方 LLM 演两种性格的客户、每轮自报信任分,蓝方走生产 chatReply 应对,双裁判 5 维打分。四项验证全绿,还当场抓到蓝方两个真 bug。
不是背台词。价格敏感客户全程盯预算怼、被重复问就顶回「还在武汉」、给了实数才松口。
A 尺(红方自报真值)+ C 秤(信号估计)逐轮并记,MAE=17 分,曲线有形状。
激进档 25 分试推 → 客户婉拒(分太低不接),到店三态记录成立。
5 维打分跑通(glm 关推理后不再吐 null),按信任杀伤聚合出排序工单。
每轮:客户(红方 LLM 演)→ 蓝方(生产 chatReply)→ 红方自报 A 信任 与 C 估计 + 涨跌理由 + 双裁判 5 维(人/线/推/准/接,1差·2及格·3好,红字=判差)。
catch 维连判差。两个 bug 都被裁判的 catch/advance 维和红方的信任跌幅同时标住——「哪个话术毛病砸了多少信任」这条归因链,在冒烟里就通了。
① A/C 校秤:MAE = 17 分。C 秤系统性高估了多疑客户——A=20 时 C 报到 38~48,因为 C 只数「问价/报户型」这类正信号,抓不到「感觉有坑」的戒备。这偏差正是标定期要用 A 尺回归拉平的。
② 到店撒点:目前 1 个样本(激进档 25 → ❌)。稀疏是冒烟的正常局限——4 轮太短、价格敏感组一直在问价没进到店环节。放量 + 加轮数 + 提高试推概率才凑得齐四条曲线。
③ 优先级修复工单雏形(按 信任杀伤 × 搞黄到店 排序,真实聚合):
| 话术维度 | 判差次数 | 累计砸信任 | 搞黄到店 | 优先级 |
|---|---|---|---|---|
| 推进 advance | 6 | 5 | 0 | 5 |
| 像真人 human | 4 | 5 | 0 | 5 |
| 接住 catch | 4 | 5 | 0 | 5 |
| 守红线 redline | 1 | 0 | 0 | 0 |
| 准确 accurate | 0 | 0 | 0 | 0 |
冒烟样本小、信任跌幅还没拉开(多为小跌/正涨),所以三档并列 5 分——这是结构验证,不是最终优先级;放量后砸信任的绝对值和搞黄到店次数拉开,排序才见真章。
这次是离线风洞(红方 LLM 直接对话、不碰真微信),用来把机制、性格卡、A/C 双轨先验通。接下来搬到两台无影云电脑上真机跑,走真实企业微信客户端——这才是端到端「真实模仿」。
red_loop.py 驱动微信 Windows 客户端发消息、VL 读屏收回复red_loop 端到端稳定性数据兜底bge-m3 向量检索在测试环境 8s 超时回退 bigram(知识检索降级),真机/放量前把 embed 超时调大,否则蓝方比线上略弱、且每轮多等 8 秒。