「让 AI 回复更有精气神」是句非常真实的感受,但工程上没法直接改——你不能在 prompt 里写一句「请更有精气神」就指望它生效。这篇把这句话拆成五个能落地的维度:人设够不够立体、有没有客服腔、说话节奏对不对、有没有喂真实语料、会不会往前推进。每一维都配一篇开源研究或工程实践打底,并对照我们在企微 AI 代回里的真实做法——哪些已经在用,哪些是接下来可以加的。
先说清楚这篇文章要解决什么问题。企微/抖音上,AI 已经能自动接住客户的每一句话——报户型、答价格、约到店。回复对不对不难判断,但「像不像一个真的金牌销售在说话」是另一回事:同样答对了问题,有的回复让人觉得在跟一个懂行的朋友聊天,有的回复一读就是「机器人客服」。这种差别很真实,但很难量化——你没法给"精气神"打分,也没法在 prompt 里直接命令它出现。
好消息是,"拟人化对话"这个课题在学界和开源社区已经被拆解过很多次——从"AI 为什么天生一股客服腔"的根因研究,到"怎么给 LLM 造一个立体人设"的工程实践,到"销售场景里怎么让 AI 学会推进而不是被动接话"的专门框架。我们把这些研究和 Akke 企微 AI 代回的真实实现对照了一遍,发现已经做对的地方比想象中多,但也有明确能加的杠杆——尤其是其中一个杠杆,性价比远高于"调语气"。
最常见的人设写法是一句话:「你是一个热情的销售,名字叫小艳」。这种写法有个天花板——模型能模仿语气,但立不住人物,聊几轮就会滑回通用助手腔调。
微软开源的多智能体模拟框架 TinyTroupe 给出的解法很直接:拟真感来自人设描述的信息密度,而不是单句设定。它给每个虚拟角色装一整套具体细节——人口学背景、职业、大五人格倾向、偏好、信念价值观、行为习惯——细节越具体,模型演出来的行为越可信、越一致。
通过给每个 agent 装大量独特细节(人口统计、职业、大五人格、偏好、信念价值观、行为习惯)来产生拟真行为——拟人感来自 persona 规格的信息密度,而不是单句人设。
更进一步的学术工作 V-VAE 认为,光靠静态人设描述还不够精细,人设控制应该拆成三个独立可调的维度:说话风格(用词/句式/口头禅)、互动模式(怎么回应、怎么推进对话)、个人属性(身份/经历/立场)——三者分开控制,才能让人设在长对话里既稳定又不僵。
对照 Akke:企微 AI 代回没有用单一人设,而是维护了一组销售身份壳——男生女生各两个,每个都有独立的性别、语气倾向、口头禅习惯(比如有的爱说"咱们家",有的爱说"跟您说句实话"),每台云电脑绑定一个,同一客户从头到尾只会见到同一个"人"。这正好对应 TinyTroupe 的"细节密度"思路:不是一句"你是热情的销售",而是姓名+性别+说话习惯+身份背景一起给。
prompt 层面的人设终究是"提醒",模型仍可能在长对话里慢慢忘记。清华团队的 Character-LLM 走了另一条路:不靠 prompt,而是用合成的"角色经历"数据做微调,把人设直接写进模型参数——推理时不再需要人设 prompt,角色感是模型的一部分。它的数据生产流程叫"经历重构",五步走:构建人物档案 → 抽取场景 → 补全经历 → 生成保护性场景(防止越界)→ 转成训练格式。
销售场景里也有类似案例。一篇专门评测"LLM 卖货能力"的论文训练了一个专用的客户模拟模型 CustomerLM(SFT + DPO,8000+ 众包销售对话),专门用来解决一个具体毛病——「角色互换」:模拟的买家演着演着开始像卖家一样主动推销。用通用模型 GPT-4o 当客户模拟器,角色互换发生率是 17.44%;换成专门微调过的 CustomerLM,降到 8.8%——接近腰斩。
"we train a user model, CustomerLM, with SFT and DPO on 8,000+ crowdworker-involved sales conversations, reducing role inversion from 17.44% (GPT-4o) to 8.8%."
成本低、改动快,靠身份壳+语气规则撑起人物感。长对话里偶有滑回通用语气的风险,但可随时调整。
人设更稳定、不依赖 prompt 提醒,但需要专门的训练数据和迭代成本,适合人设已经稳定、要进一步压榨一致性时再上。
「客服腔」不是模型笨,是训练方式带来的系统性偏好。做 RLHF(人类反馈强化学习)时,标注者倾向给"听起来周全、专业、热情"的回答打高分——于是模型学会了堆砌铺垫句、正式用词、虚假热情,这是训练信号本身的产物,不是模型"不会"说人话。
AI 腔的根因是 RLHF——标注者奖励「听起来有用」的回复(啰嗦、正式、堆砌铺垫词和虚假热情),模型因此默认走这条"安全但油腻"的路线。
更进一步的研究 The Assistant Axis 指出:模型默认会收敛到一个稳定的"助手人格",即便你在 prompt 里换了人设,聊了几轮之后也会慢慢"漂"回那个默认助手腔——这也是为什么很多产品"人设 prompt 写得很好,但聊到第五轮又变回客服"的根本原因。
诊断有了,接下来是可执行的去味清单。Wikipedia 的编辑社区长期维护一份《AI 写作特征》,社区众包审校,覆盖度很高;开源项目 humanizer 把这份清单系统化成 24 类可检测特征,横跨四个层面:
这套清单最有意思的一点:它把"去客服腔"从一种主观感觉变成了可检查的负面清单。开源实现是一个纯 prompt 的三步流程——先按规则改写,再自问"哪里明显还是 AI 写的",最后产出一版真正润色过的文本。这个「生成后自审去味」的模式,可以直接套进任何销售话术的后处理层。
对照 Akke:企微场景本来就要求"用您、别用你"、多用"咱们家"这类软化口语词——方向是对的,但目前主要靠人工写规则清单,还没有系统性对照过上面这 24 类特征做逐条排查。这是一个成本很低、见效很快的补课项:拿这份清单去抽查线上真实回复,比继续手写零散的"别说这个"规则更系统。
一个常见误区:以为让 AI"更有精气神"就要让它说得更多更热情。真实的金牌销售恰恰相反——惜字如金,一次只说一两句,不会一条消息里塞满信息把人说懵。这不只是经验之谈,节奏本身是有研究支撑的工程维度。
一项针对对话式虚拟 agent 的受控实验(VR 场景,N=54)测试了不同延迟档位下用户的体验:在 4.0 秒和 6.5 秒的中/高延迟下,自然的思考填充语("嗯,我想想…")显著提升了用户对响应速度的感知评分;而人工的加载图标或提示音,没有带来同样的改善,讨论部分明确指出这类被动的视觉/听觉等待提示"不够有代入感,无法缓解延迟带来的负面体验"。
"Natural conversational fillers significantly improved participants' ratings on Response Time at Medium (4.0s) and High (6.5s) latency levels";人工等待提示"were not significantly different from the None condition"。
另一项研究把这个思路推进了一步:不是固定延迟,而是根据对话内容动态调节节奏。研究者从十段真实的人类"积极倾听"对话里提炼出五种节奏策略——反思式沉默、促进式沉默、共情式沉默、留白等待、即时响应——并在一个 50 人的对照实验(N=50, between-subjects)里验证:用"情境感知节奏"的 agent,在拟人度、流畅度、互动感三项上都显著高于固定节奏的对照组,还带来了更深的自我披露和更高的参与度。
"a between-subjects study (N=50)... the context-aware agent scored higher than static-pacing control on perceived human-likeness, smoothness, and interactivity."
另一个常被忽视的工程细节:真人发消息是分好几条短句发的,不是一次性把话说完。聊天机器人平台 Xenioo 的工程实践文档把这个模式讲得很直白——把一个完整答案拆成多个顺序发送的文本气泡,是让机器人"读起来像人在打字"而非"甩来一段客服公告"的关键实现细节。
对照 Akke:企微 AI 代回有一条明确的节奏规则——每个回合只发一条消息,控制在很短的篇幅内,不换行、不分点。这条规则最初是照着真实金牌销售的聊天记录反推出来的(真人平均一个回合就是一两句话),现在看正好和上面两篇论文的方向一致:惜字如金不是"偷懒",是被验证过更像真人的做法。目前还没做的是"情境感知节奏"这层——比如客户在纠结报价时慢一点回、客户明确表态时快一点接住,这是下一步可以试的方向。
前三节都是"怎么调",这一节是"往哪调最值"。一项系统评测多个主流大模型「拟人化行为」的研究给出了两个对这篇文章最关键的发现。
"major language models demonstrate similar patterns, particularly relationship-building (e.g., empathy and validation) and first-person pronoun use"——这是横跨主流大模型最普遍出现的两种拟人化行为。
"most behaviours emerging only after multiple conversational exchanges"——大多数拟人化行为不是在单条回复里出现的,而是要在多轮对话累积中才会显现。
把这两条放在一起看,结论很直接:"人味"这个东西,不是靠一条 system prompt 里的形容词能催生出来的,它是一种要在多轮对话里持续保持的行为模式——共情、认同、第一人称视角的自然使用,都得靠"看过很多轮真实对话长什么样"才学得会,光靠指令"请更有温度"起不到多大作用。
这也解释了为什么上一节提到的两条微调路线(Character-LLM 的角色经历数据、CustomerLM 的真实销售对话 SFT+DPO)都不是在写更好的人设句子,而是在喂更多真实对话样本。这不是巧合——多轮对话的自然感,本质上是一种"从大量真实范例里学到的分寸感",而不是"被告知该怎么表现"。
对照 Akke:这正是我们判断优先级最高的一块——企微/抖音回复的生成引擎已经支持注入两类真实语料:从真实成单对话里蒸馏出的决策招式(什么情况下该说什么),以及原汁原味的真实对话片段(作为少样本参考直接给模型看)。这条通路已经接好,两个渠道都能吃到——差的不是技术,是把足够多的真实金牌销售对话喂进去。这比继续在 prompt 里堆"要有温度""要有底气"这类形容词有效得多:模型学的不是被告知的语气,而是从范例里自己抽出来的分寸感,恰好呼应上面两篇论文的发现。
拟人化解决的是"像不像真人",但金牌销售还有一层"客服"完全不具备的能力:不是被动接话,而是主动往前推——会挖需求、能判断火候、知道什么时候该临门一脚。这一层有专门的方法论支撑。
销售方法论里最经典的挖需求框架是 SPIN——按顺序问四类问题:现状(Situation)、问题(Problem)、影响(Implication)、需求收益(Need-payoff)。它的核心不是"多问问题",而是让客户自己说出问题的严重性和解决后的收益,而不是销售单方面替客户下结论。这套框架天然适合改造成 AI 的挖需求提问模板:不是"您需要装修吗",而是顺着客户已经透露的信息,一步步问出"卡在哪、拖下去会怎样、解决了图什么"。
一篇专门研究「AI 销售话术注入」的论文 SalesAgent 给出了一个可控、可解释的实现方式——不是端到端一次性生成回复,而是拆成三个显式步骤依次推理:先识别客户话里的意图(哪怕是隐含的),再决定该用哪种销售策略应对,最后才生成具体话术。这个链条的价值在于"每一步都可检查"——出问题时能定位是意图判断错了,还是策略选错了,还是话术写得不好,而不是一个黑箱。
核心机制是先检测用户话语中隐含或明确的意图,一旦识别到,就顺势把闲聊话题引导到相关的销售/任务话题上——而不是假设用户一开始就带着明确目的。
怎么知道客户"现在到了该推一把的时刻"?一篇讲"如何在 AI 对话里检测购买意向"的工程文章给出一个很实用的分层思路:把意向当成一个连续区间而不是 yes/no 开关,识别流程按成本从低到高分层——先用便宜的关键词/规则做粗筛,命中"问预算""问具体型号对比"这类近成交语言的再往下走,只有落在边界上、拿不准的情况才交给小而快的模型做精细判断。这个"便宜的先扛流量、贵的只用在刀刃上"的思路,是任何要规模化跑的意向识别系统都该学的分层原则。
具体识别什么信号?一份汇总销售通用「购买信号」的清单列得很实用:主动问落地/交付方式、细问合同条款或付款方式、反复比价追问优惠、主动问工期、主动要联系方式——每一种都能映射到漏斗的具体位置,识别到之后该怎么接、要不要往前推,也各不相同。
对照 Akke:企微/抖音 AI 已经有一套结构类似的机制——一个专门的信号检测器识别"客户是否表现出决策意向"(主动问到店/量尺、细问合同付款、反复比价、问工期、主动要联系方式——和上面的清单高度重合),配合一台三阶段的对话状态机(暖场 → 培育 → 决策),不同阶段用不同的推进话术:暖场阶段克制、不逼单,培育阶段每条回复收尾都带一个自然的推进钩子,决策阶段专门处理临门一脚的异议。这套设计思路和 SPIN + SalesAgent + 分层意向识别三篇讲的是同一件事:推进力不是靠"更热情"营造出来的,是靠"在正确的阶段做正确的事"这套结构撑起来的。
这一节偏"值得关注"而非"已有定论"。一篇研究说服式对话的论文提出了一个多 agent 协作框架:不是一个 LLM 独自扛全场,而是一个主说服 agent 负责跟用户直接对话,背后配四个辅助 agent 分别专职做信息检索、话术效果分析、说服策略制定、事实核查——分工之后,整体说服效果显著超过单 agent 独自处理。
主 agent 通过说服性对话直接与用户交互,辅助 agent 分别执行信息检索、话术效果分析、说服策略制定与事实核查——这种协作方式显著提升了 LLM 的说服力,在保险/银行/零售三类购买决策场景中验证。
这个思路对高价值决策场景(比如全屋定制这种客单价高、决策周期长的品类)尤其有启发:回复生成、策略判断、事实核查这几件事,未必要挤在同一次模型调用里做完。目前 Akke 是单次生成——一次调用里同时决定"说什么"和"怎么说"。要不要拆分成专职环节,是一个值得持续观察、但不必急着下结论的方向,尤其要先看清楚拆分带来的响应延迟增加是否划算。
把五个维度和依据、现状放到一起看:
| 维度 | 开源 / 研究依据 | Akke 现状 | 状态 |
|---|---|---|---|
| 人设密度 | TinyTroupe 细节密度理论、V-VAE 三维分解 | 多身份壳(性别/语气/口头禅各异)而非单句设定 | 已在用 |
| 去客服腔 | RLHF 根因、24 类 AI 腔特征清单 | 已有软化用词规则,未系统对照特征清单排查 | 可补课 |
| 消息节奏 | 延迟/填充语实验(N=54)、情境感知节奏(N=50) | 一条/短句/不换行的节奏铁律,方向与研究一致 | 已在用 |
| 真实语料喂养 | 多轮涌现研究、Character-LLM/CustomerLM 微调证据 | 决策招式+真实对话片段注入通路已打通,待灌数据 | 最高优先级 |
| 销售推进框架 | SPIN、SalesAgent 三步推理、分层意向识别 | 决策信号检测 + 三阶段状态机(暖场/培育/决策) | 已在用 |
| 多 agent 分工 | 说服式多 agent 协作框架 | 目前单次生成,尚未拆分 | 观察方向 |