辰焰科技 · 企业知识中枢

给 AI 用的
企业上下文层

让 AI 回答业务问题时说得出出处,且不把过期数字当成现在的数字。

// 面向企业决策者与渠道合作伙伴 · 数据口径 2026-08-31
// 本文为公开版,具体标识已替换为占位符,凭据剔除类计数已移除

本地向量 · 1024 维 向量 + 全文 RRF 融合 数字不进索引 · 现查端点 每日 07:30 增量重建 9 类凭据正则准入 溯源强制 · 无出处不进库
0
块已索引知识100% 带向量 · 242.3 MB
0
类数据源覆盖 6 个代码仓
0
维向量本地生成 · 不出企业
0
类凭据正则入库前逐行剔除
SCROLL / 向下滚动
01
The Real Problem

企业里 AI 答不好的两件事

不是答不出来,是答了没法核——说不出出处,或把上次重建时的数字当成现在的数字。

两个失效方向与目标区
定位示意 · 非评测数据
答案无出处 每条可溯源 数字现查 · 实时 数字来自旧快照 新 · 但说不清 可核实 · 且实时 既说不清 · 也不新 有出处 · 数字过期 企业上下文层

// 横轴 = 出处可核 · 纵轴 = 数字时效

Problem 01说不出出处

答案读着通顺,却回不到原文核对,业务上不敢直接采信。

Problem 02把过期数字当现在

余额、成本、进度这类数字一进索引,就冻结在重建那一刻。

02
Cold / Hot Split

冷热分腿 · 数字不进索引

静态知识走索引,随时会变的数字每次现查真实端点——两条腿分开走,互不污染。

一次提问的两条取数路径
架构示意 · 2026-08-31
ASK 员工或 Agent 提问 QUESTION CTX 企业上下文层 CONTEXT LAYER IDX 静态知识 · 走索引 INDEX LEG LIVE 实时数字 · 现查端点 LIVE LEG ANS 带出处的答案 WITH SOURCE 静态知识 实时数字

// 青 = 索引腿 · 蓝 = 现查腿

为什么必须分腿

数字一旦写进索引,就冻在重建那一刻;下次重建之前,所有人看到的都是旧值——而这类问题恰恰最常被拿去做决策。

03
Indexing Pipeline

一份资料怎么进大脑

六步落库,每步可独立重跑;内容没变就跳过,不重复计算。

01
抽取
5 类数据源取出文档、协作记录、经验沉淀与代码定位卡
02
凭据闸
文件级黑名单 + 9 类凭据正则逐行剔除,导出数据与个人信息一并排除
03
切块
按语义边界切成可检索的知识块,每块必须带出处 URL,没有出处不进库
04
哈希增量
内容哈希比对,命中即跳过——上轮新增 0 / 更新 1 / 跳过 30,789
05
向量化
本地模型生成 1024 维向量,语料与向量都不出企业
06
落库
向量与全文索引一并落库,当前 30,790 块 · 100% 带向量

// 实测吞吐 6.7–8.1 块/秒 · 单次增量重建 34–78 秒 · 每天 07:30 自动跑

04
Corpus Composition

30,790 块知识从哪来

当前 5 类数据源在库,全部是团队自身产出的知识资产。

各来源已索引块数
块 · 数据口径 2026-08-31
文档16,863
协作记录6,863
代码定位卡3,696
经验沉淀3,322
全局规则46

// 条长按最大类归一 · 合计 30,790

代码只进「定位卡」

只索引位置与用途,不收函数体;检索结果强制附「须回源码复核」。

库体量与覆盖面

242.3 MB,覆盖 5 类数据源与 6 个代码仓,100% 块带向量。

05
Hybrid Retrieval

两路检索,一次融合

向量找语义相近,全文找关键词精确;加权 RRF 合成一份排序,两路各留保底。

检索融合路径
机制示意 · 2026-08-31
一个问题 QUERY 向量检索 · 点积 本地向量 · 1024 维 全文检索 · BM25 关键词精确命中 加权 RRF 融合 RRF_K = 60 每条结果带四件事 出处 / 相关度 / 命中方式 / 索引时间 权重 1.0 权重 0.6

// 实线 = 向量路 · 虚线 = 全文路 · 两路 top1 无条件保底

06
Ingestion Gates

三道闸,凭据进不来

凭据、导出数据与个人信息在入库前被剔除——不进索引,自然也检索不到。

0
道准入闸文件 · 行 · 字段
0
类凭据正则逐行匹配
0
个人工放行环节三闸全自动
准入三闸执行顺序
入库前 · 全自动
Gate 01 · File文件级黑名单凭据文件整份不入库
Gate 02 · Line行级正则9 类凭据正则逐行剔除
Gate 03 · Field导出与个人信息排除数据导出与个人信息不进索引

// 三闸全自动执行,无人工放行环节

07
Anti-Hallucination

四条硬规则

不是靠提示词劝模型别乱说,是靠入库与检索的规则把话说死。

Rule 01溯源强制

每条记录必须带出处 URL,没有出处不进库

Rule 02数字不进索引

余额、成本、进度这类数字每次现查真实端点

Rule 03代码只进定位卡

不收函数体,检索结果强制附须回源码复核

Rule 04结果附索引时间

每行结果标出处、相关度、命中方式与索引时间

这四条解决的是什么

让 AI 的每一句话都能被人当场验证:出处点得开、数字是刚查的、代码要回源、时效写在脸上。

08
Roadmap & Scope

实施路线与当前边界

当前语料为团队自身知识资产;业务系统语料接入属于实施阶段工作

三期实施路线
交付边界 · 口径 2026-08-31
Phase 01 · 已建成知识资产接入文档、协作记录、经验沉淀与代码定位卡
Phase 02 · 实施阶段业务系统语料工单、客服、CRM 等按需逐个接入
Phase 03 · 规划中Agent 深度集成接进企业自有 AI 助手与业务流程

// 青 = 已建成 · 琥珀 = 需实施投入 · 灰 = 未启动

Scope

当前索引的 30,790 块不含任何客户业务语料。工单、客服记录、CRM 等业务系统的接入需要在实施阶段逐个对接,工作量随源系统数量与数据规范程度变化——这一节写在这里,是为了让交付边界在签约前就是清楚的。

09
Partnership

合作形态与对接流程

本页不含报价;合作形态与实施范围按语料规模与接入方式另行商定。

Model A企业直接合作

由我方完成语料接入、上线与交付,企业侧只需指派对接人。

Model B渠道代理

代理方负责客户对接与商务,我方承担实施与技术支持。

Model C联合实施

与客户 IT 团队共建,我方提供架构、准入规范与培训。

对接流程
四步 · 从接触到交付
Step 01需求对接明确使用场景与提问类型
Step 02语料盘点清点可接入的系统与文档范围
Step 03试点接入选一个部门先跑通索引与检索
Step 04交付与培训交付准入规范并培训对接人

// 琥珀 = 需人参与 · 青 = 系统自动完成

一句话总括:辰焰科技交付的不是又一个搜索框,而是一层给 AI 用的企业上下文——静态知识走索引、实时数字现查端点,每条答案都说得出出处、标得出索引时间
说明

本页所列合作形态与对接流程为拟定框架,用于说明协作方式,不构成服务承诺;具体范围、责任与交付标准以双方合同约定为准。