Production field report · 2026.08.20

一台 MacBook Air,如何把个人微信接上企业大脑

从官方微信可见界面读消息,到 AI 生成、知识调用、GUI 真发、发送确认与复盘追踪:这是个人微信自动代回从 0→1 的首轮实战专题,也是下一阶段批量化前的真实底稿。

已跑通 官方客户端闭环已落库 对话 + 回复来源账已优化 不确定回复转人工持续完善 知识积木级追踪
01

首个真实场景验证:从连续咨询到稳定承接

客户围绕板材、环保、价格、面积和全屋方案进行了多轮连续咨询。系统既验证了企业知识问答能力,也通过真实互动持续优化上下文理解、回复节奏和人工协同。

关键对话切片

客户用什么板材
AI · 正常主推兔宝宝、莫干山、千年舟三大品牌的 ENF 级多层实木板……
客户是颗粒板吗
AI · 正常不是颗粒板,是三大品牌的 ENF 级多层实木板,结构更稳。
客户我怕有甲醛
早期回复 · 已优化不着急定哈,我发几张不同风格的效果图您先看看……
客户我在上海 100 平
早期回复 · 已优化这一轮较快进入到店引导;现在会优先承接客户关于面积与报价的当前问题。
客户我还没说要去店里,想先了解一下
AI · 修正承接回到板材与环保说明,不再强推到店。
客户全屋柜体
早期回复 · 已优化您所在城市是哪里?——这类已提供信息现在会通过上下文记忆继续承接。
客户是颗粒板吗
AI · 正常不是颗粒板,是三大品牌的 ENF 级多层实木板……
02

0→1 逻辑原理图:视觉执行器只管 I/O,大脑留在服务端

客户端不读微信数据库、不注入、不走协议。它只观察官方客户端可见画面、模拟用户操作;上下文、知识、规则、模型、成本与追踪全部留在正式服务端。

01 SIGNAL

发现待处理会话

每秒红点像素监听;红点优先进入持久公平队列,无红点时顺序巡检可见单聊。

群聊 / 服务号黑名单
02 READ

滚到底 + VL 读屏

核标题、单聊类型、最新气泡方向,合并客户连续消息;主 VL 超时切 30B 备用。

stale screen gate
03 GENERATE

调用正式回复端点

只传最新客户原文,并附最近 6 条本地可见历史、事实、意图与稳定会话身份。

channel=weixin
04 BRAIN

服务端组装上下文

加载 DB 历史、画像、品牌档案、知识文档、金牌范例、门店规则与 Langfuse prompt。

个人微信专属硬规
05 GUARD

报价 / 图片 / 语义护栏

短单气泡、最多一问;确定性报价与素材匹配;可疑正文不发,媒体有问题则只剥图。

fail closed
06 DELIVER

GUI 逐项发送

粘贴文本与最多 3 张可信域图片,并再次读屏确认右侧新气泡/图片出现。

视觉确认
07 CONFIRM

记账与下一轮记忆

发送成功才 confirm,落 AI 消息、图片去重标记与 trace;失败则排队补记。

闭环完成
设备层

MacBook Air + macOS 官方微信 + 屏幕录制 / 辅助功能权限

视觉层

红点像素、动态行中心、Qwen3-VL 235B / 30B fallback

会话层

稳定 conversationIdentity、DB 历史、客户端最近 6 条可见消息

回复层

Qwen3 235B、Langfuse v24/v25、确定性报价与媒体规则

可观测层

messages、llm_call_provenance、知识文档 / 范例 IDs、成本与延迟

03

首轮试运行数据:完整链路已经稳定运转

生产库快照截至 2026-08-20。数据严格区分系统验证会话与真实客户会话,本页展示 4 个真实会话的首轮运行结果。

4真实会话
总会话 38,测试 34
56真实消息
30 客户 / 26 AI
26正式 chatReply 调用
均有金牌范例
7.1sLLM 延迟 P50
均值 8.1s
$0.04326 次 chatReply 合计
约 $0.00165 / 次
0Prompt fallback
正式模型全程可用

回复上下文覆盖率

金牌销售范例
26/26
知识文档
16/26
品牌档案
26/26
知识积木 element_ids
0/26
当前已能追踪每次回复调用的知识文档、品牌档案和金牌范例;知识积木级追踪正在完善,完成后可以把回复依据进一步定位到具体知识点。

真实会话分布

29客户 A · 16 客户 / 13 AI
18客户 B · 9 客户 / 9 AI
7客户 C · 4 客户 / 3 AI
2客户 D · 1 客户 / 1 AI
当前数据用于验证连续对话、知识问答、自动发送和过程追踪能力。随着真实场景继续增加,系统将逐步形成更稳定的质量与效率基线。
04

典型场景与优化进展:每次真实反馈都进入系统能力

点击状态筛选。系统会把真实互动中出现的典型场景拆到读取、理解、生成、发送和记忆各环节,并用可验证的机制持续优化。

确保始终回应最新问题

已完成
场景
长对话中,微信窗口可能同时显示多轮历史内容。
优化方式
打开会话先滚到最新位置,并用已回复记录核验当前气泡。
当前进展
较早消息不会再次触发自动回复;不确定时暂停并转人工。

让每条已发送回复进入记忆

已完成
场景
微信界面已显示回复,但网络波动可能影响服务端同步。
优化方式
发送后进行视觉确认,并通过 confirm 完成服务端记账。
当前进展
同步失败会自动排队补记,保证下一轮能承接此前沟通。

文字与配图保持一致

已完成
场景
客户咨询环保、板材或效果时,需要发送与当前问题匹配的资料。
优化方式
增加媒体语义检查,并对正文中的“已发 / 未发”表述进行双向核验。
当前进展
图片不匹配时只保留准确文字,不影响客户获得当前问题的回答。

先解答,再自然推进下一步

持续优化
场景
客户提供城市和面积,可能只是希望先了解方案与预算。
优化方式
个人微信优先回答当前问题,再根据最近对话信号决定是否邀请到店。
当前进展
已加入节奏重写机制,正在通过更多真实场景持续校准。

连续记住城市、面积和需求

持续优化
场景
客户会分多轮补充城市、面积、风格和计划制作的空间。
优化方式
合并服务端历史、最近可见消息和结构化客户事实。
当前进展
已完成最近历史回填、发送补记、滚动摘要和画像提取。

持续缩短整体响应时间

持续优化
场景
完整流程包含视觉读取、企业大脑生成、GUI 发送与结果确认。
优化方式
红点检测本地化,备用视觉模型只在异常时启用,并减少不必要的重复读取。
当前进展
LLM 回复 P50 为 7.1 秒,下一步将进一步细分完整链路耗时。

把回复依据精确到知识积木

下一阶段
目标
从“调用了哪份企业资料”进一步细化到“调用了资料中的哪个知识点”。
优化方式
启用知识元素组装,并把实际使用的知识积木 ID 写入回复来源账。
预期效果
客户或管理者可以逐句查看回复依据,并直接进入对应知识积木维护。

形成更清晰的运营数据分层

下一阶段
目标
让真实客户、系统验证和人工接管拥有清晰独立的数据口径。
优化方式
为验证流量增加明确标识,统计默认展示真实客户,并提供专项筛选。
预期效果
运营看板可以直接用于评估真实服务质量与规模化进展。
05

下一步优化列表:先把可观测性做实,再扩大白名单

排序按“客户风险 × 是否阻断批量化”给出。目标不是更快地自动发,而是让每一条发出去的话都能解释、能复盘、能停止。

现在就做 · P0

P0.1打通知识积木级 provenance

element_ids 从 0 提升到可验证;页面逐句展示真正 fed 的积木、相关度和原始出处。

P0.2统一个人微信查看页

按 gerenweixin 过滤真实会话,看到全文、prompt 版本、replySource、sanitizerActions、文档/范例/积木。

P0.3真实 / 测试流量硬隔离

给线上回归打 evalRun 标志,不再依靠客户名正则剔除。

扩大前完成 · P1

P1.1端到端分段耗时

分别记录发现红点、打开会话、VL、generate、粘贴、确认、confirm,定位真正瓶颈。

P1.2记忆一致性审计

对“已知又问”自动标红,区分漏 confirm、画像未抽取、历史窗口缺失与模型忽略。

P1.3人工接管闭环

NEEDS_HUMAN 不只发告警,还要能认领、备注、恢复自动化,并留下责任人和时间。

规模化阶段 · P2

P2.1多联系人灰度扩容

从 1 人白名单到 5→20→全量,每个阶段持续观察准确承接率、连续记忆率和人工接管率。

P2.2建立真实质量基线

持续积累 100+ 真实客户、500+ 轮对话,形成稳定的质量、效率和服务体验指标。

P2.3设备与账号稳定性

监测锁屏、休眠、微信登录、窗口状态和系统权限,并保留一键暂停与人工恢复能力。

结论:我们已经完成个人微信 AI 自动代回的完整闭环,并正在通过更多真实场景稳步进入规模化验证。