检索前置权限过滤机制 - 软盟-软盟

检索前置权限过滤机制

话题来源: 企业AI知识库上线后治理:从检索质量评测到权限与引用溯源

检索前置权限过滤,是企业知识库安全边界中最关键的一道控制,不应被视为回答阶段的附加规则。其核心原则是:系统在检索内容之前,先依据当前用户的身份、组织、岗位、业务角色、地域、项目关系及临时授权,计算可访问的知识范围;只有通过权限判断的文档或内容片段,才允许进入召回、排序和生成环节。

为什么必须在检索之前过滤

如果敏感内容已经被召回并放入模型上下文,后续再要求模型“不要泄露”,本质上属于事后约束。模型可能在直接回答、摘要、改写、追问或引用中暴露受限信息,甚至仅通过文档标题、项目名称和拒答理由泄露内容存在性。因此,权限控制不能依赖提示词,也不能只在最终答案上做脱敏。

前置过滤还要与文档生命周期和元数据结合。文档至少应明确所属部门、适用组织、角色范围、密级、审核状态、生效与失效时间以及版本关系。检索“当前采购流程”时,系统不仅要判断用户能否访问,还要排除已失效、未审核或不适用当前组织范围的内容。权限正确并不等于内容适用,二者必须同时成立。

权限模型如何落地

权限映射应明确回答三个问题:用户是谁,用户被授予什么范围,当前文档允许哪些主体访问。仅按普通员工和管理员划分通常过于粗糙,财务、人事、法务、研发项目和客户资料等场景往往需要叠加部门、地域、项目、数据密级与业务关系。

实践中可采用分层控制:文档层决定能否访问整份内容;片段层处理同一文档中章节、附件或字段的差异;回答层处理权限不完整、高风险或需要人工确认的问题。层级越细,治理成本越高,因此应优先保护高敏感内容,而不是盲目追求所有信息都做到字段级授权。

权限过滤必须可测试、可审计。评测集应覆盖有权访问、无权访问、跨部门访问、转岗、离职、临时授权、改写提问和连续追问等情况,同时检查拒答是否泄露文档名称、项目范围或关键结论。每次组织关系、授权规则、文档版本或检索策略发生变化,都应进行回归验证。

真正可靠的机制不是“模型知道什么不能说”,而是“模型根本看不到无权使用的内容”。只有把身份映射、内容标记、检索过滤、拒答策略和审计记录连成闭环,知识库才具备可控、可追溯的权限边界。