要做资料上传和状态展示的界面,先得说清三件事:大脑里现在装了哪几类料、一份料传进去之后会经历什么、以及它什么时候真的被用上。这页把这三件事按运营能看懂的说法讲清楚,并给出一份能直接照着做的界面结构建议。
这五类东西性质完全不同——有的是"我们家的事实",有的是"该怎么说话",有的是"行业常识"。界面上不该把它们混成一个「知识库」列表,因为上传方式、审核要求、被调用的时机都不一样。
brand_profile · 全量注入,不做筛选knowledge_documents · 最短 6 字,最长 1081 字conversation_examples · 全量载入,按【质量分+相关度×5】取前 3decision_rules · 每条含「建议怎么做」+「千万别怎么做」kb_entries(362)+ kb_chunks(2987)· 向量模型 bge-small-zh-v1.5,自建在 Fly worker 上 · 文件本体在 R2这是界面最需要展示的东西——传完一份资料,它不是立刻就能被 AI 用上的。而且不同格式走的路完全不一样:文字类当场生效,PDF 要先抽字,图片则根本没有正式通路。
| 传的是什么 | 现在会发生什么 | AI 能用吗 | 能发给客户吗 |
|---|---|---|---|
| 直接打的字 产品知识、问答、规则 | 体检 → 入库,当场生效 | 能 下一次对话就用上 | AI 会用自己的话讲出来 |
| PDF 装修资料、攻略 | 抽正文 → 切块 → 向量化。抽不出字(扫描件、图多字少)就只剩一句话摘要 | 能 前提是正文抽出来了 | 不能 抖音发不了文件,企微只能发图 |
| Word 验收标准、施工规范 | 同 PDF:抽正文 → 切块 → 向量化 | 能 | 不能 同上 |
| Excel 验收表、配置清单 | 按行切块读进正文(表格没有段落,按字数硬切会把一行拦腰截断) | 能 | 不能 同上 |
| 图片 效果图、实拍、长图 | 尚无通路 库里预留了挂图片的位置,暂未启用 —— 现在企微能发的图,靠人工排版 + 工程在代码里配触发词 | 不能 AI 读不了图 | 能 但只有代码里配过的那 60 份 |
现在有三个入口,都只收文字:后台网页直接写(产品知识、金牌问答);上传一段真实成交对话让 AI 自动拆(案例蒸馏);运营在标注界面点赞的回复直接搬进话术库。
文件和图片没有任何网页入口——PDF/Excel/Word 靠工程在本机跑脚本灌,图片则连脚本都没有。
入库前自动查一遍有没有违反公司硬口径。比如有人写了「定金全额无息退你」——公司根本没这个政策,直接拦下,还会在企微群里 @ 相关人说清该改成什么。
已接三条路:后台改知识、后台改示例、案例蒸馏审核通过。脚本直接灌库那条路没接。
文字类资料到这一步就算齐活了——下一次对话就能用上,不需要等。
PDF 里的字要先抽出来,再按 400 字一段切开(段与段之间留 80 字重叠,防止把一句话切断)。抽不出来的(扫描件、图多字少、加密)会被跳过,只留一句话摘要。
这一步决定资料到底能不能用:走完的,AI 能引用里面的具体内容;没走完的只留一句话摘要,客户问到时 AI 只能回"这份文件里有",等于没答。目前 PDF 和 Word 都能读进来,Excel 还不行(表格按字数硬切效果差,要另做按行/按表的切分),另有少量 PDF 是扫描件没有文字层。
每一段文字转成 512 个数字,代表它的意思。客户问问题时也转一遍,然后找坐标最接近的几段。目前 362 份 + 2987 段全部有坐标,100% 覆盖。
资料就位。文字类资料每次对话都会被扫一遍按相关度排队;文件类资料要客户问到足够像的问题才会被捞出来。
系统其实记录了每次 AI 回复到底翻了哪几份资料(每条调用都留了资料 id)。但这个数据现在没有任何界面展示——运营不知道自己传的那份资料到底有没有被用过、被用了多少次。
同一批资料,被 9 个地方共用。这意味着:改一条报价口径,抖音和企微两条通道会同时变——这是好事(口径统一),但也意味着改错了是同时错两处。
看懂这张表的两个要点:① 前四个架子是「开口就要看」的,任何一次生成都在用;② 行业素材只在"客户回了话"之后才查(首触是我们主动发的,客户还没说话,无从检索)。
| 什么时候 | 哪条通道 | 品牌 档案 | 产品 知识 | 金牌 问答 | 决策 规则 | 行业 素材 | 发图 给客户 |
|---|---|---|---|---|---|---|---|
| 给新客户发第一条私信前,提前把开场白写好 | 抖音 DM · 首触 | ✅ | ✅ | ✅ | ✅ | — | — |
| 云电脑派单时现起开场白 | 云电脑 · 派单 | ✅ | ✅ | ✅ | ✅ | — | — |
| 把没发过的老库存补进队列 | 云电脑 · 补单 | ✅ | ✅ | ✅ | ✅ | — | — |
| 客户回消息了,生成回复草稿 | 抖音 DM · 自动回复 | ✅ | ✅ | ✅ | ✅ | ✅ | — |
| 定时批量生成回复,过关就发、不过转人工 | 抖音 DM · 批量回复 | ✅ | ✅ | ✅ | ✅ | ✅ | — |
| 运营在后台点「让 AI 出一条」 | 后台 · 人工触发 | ✅ | ✅ | ✅ | ✅ | ✅ | — |
| 后台消息列表里生成消息 | 后台 · 消息侧 | ✅ | ✅ | ✅ | ✅ | ✅ | — |
| 企微好友单聊,AI 代回 | 企微 · 代回复 | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ |
| 沉默 7 天的客户召回 | 企微 · 召回 | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ |
这是最容易被忽略的一环 —— 数据库里存的只是"目录卡片"(标题、摘要、链接),文件本身全在 Cloudflare R2 上。做上传界面必然要跟它打交道。
362 份资料的原件(PDF/Excel/Word)、企微能发的全部图片(长图 / 案例实拍 / 风格图 / 配置清单)、库里给资料挂附件的字段,指向的都是同一个 R2 桶。
数据库里那一列叫 file_url,362 份全部有值。
① 建索引时——从 R2 下载 PDF 抽正文;
② 发资料给客户时——企微把 R2 图片链接发出去;
③ 人点开看时——链接是公网可访问的。
日常 AI 回复不读 R2 —— 回答用的是已经切好存进数据库的文字块,不会临时去下载文件。
发企微的那台云电脑是国内出口,直连 R2 图床超时(实测拉一张图 21 秒超时),所以中间加了一层 Fly 东京中转。
出过事故:中转没做之前把发图功能关了止损,结果客户收到的话术写着"这份配置清单您先看看",却没有图。做界面时"预览发送效果"要走真实通路,不能只在本机看图能不能打开。
这是理解「库里明明有这条,AI 为什么不知道」的关键:库存 ≠ 喂给 AI 的量,每一类都有硬上限,超了就截断。
67 条全部载入排队,从最相关的开始塞,塞到 1500 字为止。排在后面的这次就看不到。
2987 段里只捞 4 段,还要够像。宁可一段不给,也不塞不相干的把语气冲淡。
206 条全量参选,按【质量分+跟客户这句话有多像】挑出 3 条放进 prompt。不设配额,任何一条都有机会被选中。
现有 35 条启用,全部够载。再往里加就要开始挤了。
这一段可以当成界面首页的原型——运营打开资料中心,第一屏就该看到这些。每行三件事:现在怎么样、为什么这样、点一下能做什么。光有状态没有动作,运营看完还是不知道该干嘛。
| 资料架 | 状态 | 说明(把话说到运营能懂) | 该给的操作按钮 |
|---|---|---|---|
| 品牌档案 1 份 | 正常 | 24 品类 / 13 卖点 / 8 常见问答齐全。AI 每次开口都会先看它。 | 编辑 · 查看改动历史 |
| 产品知识 67 条 | 正常 | 最近一次改动 7-30(498 国产板材档)。每次对话按相关度排队,塞满 1500 字为止。 | 新增 · 编辑 · ✓ 已可看「近 7 天用了几次」 |
| 金牌问答 206 条 | 正常 | 206 条全量参与竞争,每次选最贴题的 3 条进 prompt。不设配额,任何一条都有机会被选中。 | 新增 · 调质量分 · ✓ 已可看入选次数(长期 0 次的该清理) |
| 决策规则 36 条 | 水位偏高 | 35 条启用,载入上限 40 —— 快满了。再加规则要么挤掉别的,要么得先关掉几条旧的。 | 新增 · 启用/停用 · 水位提醒 |
| 行业素材 362 份 | 正常 | 362 份切成 2987 段,向量 100% 覆盖。203 份已读进完整正文(110 万字);剩 111 份只有摘要,主要是刻意不读的别家报价单(72 份)和扫描件 PDF(21 份)。 | ✓ 已可按「已读进正文 / 仅有摘要」筛选 · 重新抽取 · 删除 |
| 可发给客户的图 约 60 份 | 工程维护 | 企微能发的长图,触发词由工程在代码里维护(每次改动过一遍人工 review)。运营目前看不到也改不了,加新图要排期。 | 上传图 · 配触发词 · 送审 · 预览发送效果 |
| 自动补资料 0 条产出 | 待启用 | 「客户要的库里没有 → 自动生成一份」。代码与定时任务已就位,按上线闸要求暂未开启——前置条件是上游私信记录能完整抓取。 | 开启开关 · 抽检 AI 生成的资料 |
| 缺口清单 待启用 | 待启用 | 客户问过、但库里没有的东西 —— 这是决定「下一份该传什么」的唯一依据。数据会随上面那条链路一起产出。 | 按提问次数排序 · 一键建资料 |
| 另外 3 个客户 0 资料 | 未启用 | 大麦植发 / 皮皮考研 / 景区导游都是空壳,AI 只能靠代码里的兜底话术说话。 | 新客户开户向导(把整套流程走一遍) |
把前面几段的结论翻译成具体的界面元素,按价值排序。每一条都对应一个现在看不见、但运营真的需要知道的事实。
| 要展示什么 | 为什么必须有 | 数据现在在哪 |
|---|---|---|
| ① 每份资料的处理状态 已上线 已读进正文 / 仅有摘要 / 无内容 | 列表上每份看着都一样,但只有走完正文抽取的那些 AI 才真能引用。没有这一列,运营会以为传进去就等于 AI 学会了。 | 已用数据库聚合实时算出 |
| ② 这份资料被用过几次 已上线 近 7 天用了几次 | 运营现在完全不知道自己整理的资料有没有用。「从没被调用过」的资料要么该删,要么该改标题(可能是因为写法太偏检索不到)。 | 已接上界面(口径是「被喂进 prompt」,非「LLM 真正引用」) |
| ③ 资料能不能发给客户 可发长图 / 仅供 AI 参考 / 不可外发 | 库里 362 份中能直接发给客户的约 60 份,其余只作 AI 答题依据(第三方版权资料、别家公司的报价单发出去有风险)。不标出来,运营会以为传了就能发。 | 需要新增一个字段 |
| ④ 口径体检结果 哪句话违规、该改成什么 | 红线闸已经在拦了(比如「定金全额退」这种公司没有的政策),但拦下来的原因目前只在日志里,运营看不到。 | 逻辑已就绪,接上界面即可 |
| ⑤ 客户问了但库里没有 缺口清单 | 这是决定下一份该传什么的唯一依据 —— 有了它,补资料就从"凭感觉"变成"照单补"。 | 产出逻辑已建好,随自动建档链路一起启用 |
| ⑥ 上传口本身 文件与图片的网页上传 | 目前文件类资料由工程跑脚本灌,图片则要工程逐张配置。这是让运营能自助的第一步。 | 需要新建 |
| ⑦ 各架子的容量水位 如「决策规则 35/40」 | 有硬上限的架子接近上限时提醒一声,免得新加的进不去还没人知道。 | 上限在代码里,读出来即可 |
按运营真实的使用顺序排,不按数据表结构排。
进来就看到第四部分那张表:每个资料架一行,状态 + 一句人话 + 操作按钮。红黄绿一眼扫完,知道今天要不要管。
顶部再压两个数字:「本周被 AI 用掉 N 次」和「客户问了但没有的 N 条」——前者证明大脑在干活,后者告诉你下一步干什么。
每行必须有的四列:标题 · 处理状态 · 被用过几次 · 能不能发给客户。
重点是筛选器要能筛出「空壳」和「僵尸」——仅有摘要 和 从没被用过 这两个筛选条件,直接对应本次核查最难发现的两个问题。
按格式分流(见第二部分那张表):文字当场生效;PDF / Word 传完显示抽取进度;Excel 明确告知"暂时只能当索引用";图片走单独的「配触发词 + 送审」流程。
口径体检不通过时,把违规的那句话高亮出来并说清该改成什么,而不是只报一个"提交失败"。