大白话版,写给团队看:今天把企微 AI 的底层模型换了、给它加了"对话记忆",为什么换、怎么测出来的、记忆增强到底做了啥——一页说清。
用真实对话逐句压测(132 轮)+ 反复复跑,把企微 AI 在长对话里的毛病都翻了出来:
根因是"对话一长、历史全塞给模型 → 模型被撑晕"。记忆增强就是把这条从根上治掉。
企微原来用 GLM-4.6(2026-07-02 一次严谨评测选出来的)。这次同规格复评(8 模型 × 28 探针[含超长尾] × 3 采样 × 双裁判 grok-4.3+deepseek-v3.2,含新测的 kimi-k2.6)重新比了一遍。