先说结论
RAG 前脱敏不只是隐私处理,而是知识库入库控制:决定哪些文档内容可以被检索、召回、总结或被内部 AI 助手重复使用。
可执行流程应包括 AI 辅助识别、规则校验、人工复核、干净副本生成、权限控制、检索边界和审计证据。
先定义范围
在处理文件前,先明确知识库允许回答什么、不应接触什么。
索引干净副本
原始文件保留在受控空间,RAG 一般只索引经过批准的干净副本。
保留人工复核
上下文、披露边界、例外判断和最终批准仍需要人工复核。
为什么 RAG 会改变脱敏问题
RAG 会让文档内容更容易被搜索、召回、总结和复用。过去藏在文件里的个人信息、客户账号、内部备注或交易条款,可能进入提示词上下文、检索结果、日志或下游 AI 回答。
因此,团队会关注去除个人信息后再进入 RAG、企业知识库数据脱敏、内部 AI 助手文档准备、向量数据库前敏感数据处理等问题。答案不是一个模型开关,而是一套可审计的文档流程。
入库前应先分类哪些内容
| 类别 | 示例 | 常见处理方式 |
|---|---|---|
| 个人标识 | 证件号、姓名、地址、电话、签名 | 根据 AI 任务需要决定脱敏、限制或保留。 |
| 客户与账户数据 | 账号、交易记录、开户资料 | 按角色和知识库目的移除或限制访问。 |
| 商业条款 | 价格、交易条款、交易对手、授信条件 | 进入知识库前升级给业务人员复核。 |
| 内部备注 | 风险意见、委员会意见、审阅批注 | 通常排除或限制给特定复核角色。 |
| 凭证或密钥 | Key、Token、密码、系统细节 | 不应进入 RAG,并应回查源头控制。 |
推荐流程
1. 定义语料和用途
先明确业务目的、目标用户、允许回答范围和文档类型。
2. 分类敏感字段
把个人、客户、财务、合同、内部和项目敏感信息映射到移除、保留、限制或升级规则。
3. 识别候选内容
结合 AI 脱敏、规则、OCR 和模式识别,在向量数据库前敏感数据处理阶段发现候选字段。
4. 复核并批准
授权复核人员处理例外,并批准哪些版本可以用于企业知识库数据治理。
5. 生成干净副本
分离原始文件、候选脱敏文件、已复核文件、导出文件和 AI 可用文件。只索引经过批准的干净副本。
6. 控制检索和证据
为内部 AI 助手文档准备设置检索边界、权限、日志、导出控制和审计证据。
AI、规则、复核和权限如何配合
| 控制方式 | 在 RAG 准备中的作用 | 边界 |
|---|---|---|
| AI 脱敏 | 在多种文档格式中识别候选敏感信息。 | 不应单独做最终披露决定。 |
| 规则和词典 | 捕捉确定性的账号、编号、名称和项目词。 | 可能遗漏上下文和复杂版式。 |
| 人工复核 | 批准例外、干净副本和知识库范围。 | 需要清晰流程和证据链。 |
| 权限控制 | 限制原始文件、干净副本、检索结果和导出的访问范围。 | 不能替代不应入库内容的脱敏处理。 |
企业检查清单
- 哪些文件、扫描件、表格、邮件和附件在范围内?
- 哪些敏感类别必须在 RAG 前 AI 脱敏?
- 谁可以批准例外和 AI 可用版本?
- 向量数据库会保存原文、干净副本、摘要还是切片内容?
- 检索权限如何映射到项目角色?
- 哪些日志可以证明上传、识别、复核、批准、入库、检索、导出和撤销?
- 存储、AI 处理和索引是否与所选区域一致?
bestCoffer 可以放在哪个环节
bestCoffer 面向受控文档流程,把脱敏、权限、复核、审计日志和 AI 数据准备放在同一工作区中管理。对于 RAG 项目,团队可以结合 AI 脱敏和 VDR 权限控制,在知识库入库前减少敏感数据暴露,同时保留原始资料的治理边界。
数据留在所选区域,AI 在数据所在处运行。这个原则适用于机密文档进入内部 AI 助手、RAG 流程、翻译或外部协作前的准备工作。
相关页面包括 RAG 前 AI 数据准备、面向 AI 工作流的敏感数据控制、AI 脱敏准确率评估、RAG 与 AI Agent 前脱敏 FAQ 和 RAG 前脱敏框架。
常见问题
RAG 入库前是否应该移除所有敏感数据?
不一定。团队应根据知识库目的、用户权限、内部政策和复核风险,决定哪些内容需要移除、保留、限制访问或升级处理。
AI 脱敏能否替代知识库入库前的人工复核?
不能。AI 脱敏适合批量识别候选敏感字段,但上下文、例外、披露边界和最终批准仍需要人工复核。
脱敏本身是否足以保障 RAG 系统安全?
不够。脱敏需要与权限、检索边界、版本分离、日志、导出控制和下游 AI 系统治理结合使用。
原始文件和脱敏文件都应该被索引吗?
通常不建议。原始文件应保留在受控资料库中,RAG 或内部 AI 助手一般只索引经过批准的干净副本,除非有明确的权限绑定场景。