评估企业AI知识库的业务场景,首要判断不是模型能力或文档数量,而是知识能否在具体工作流中被准确调用、验证并形成可执行结果。不同岗位提出的问题看似都属于“问答”,背后需要的知识结构、检索条件、权限边界和风险等级却差异明显。客服查询退换货规则,关注来源清晰与响应速度;技术支持排查设备故障,通常还要结合型号、版本和历史工单;管理者检索制度,则更在意时效、权限和审计记录。如果忽略这些差异,仅把知识库当作一个统一对话入口,很容易出现“能回答但不适用”或“回答正确但越权”的情况。
场景评估应从真实提问路径反推,至少覆盖五个维度:谁在什么场景下提问、问题属于事实查询还是流程指导或故障诊断、答案依赖哪些知识源、是否存在客户隐私或财务合规等风险、回答之后是否需要触发工单或调用业务系统。这五个维度决定了后续的检索策略、文档切分方式、权限过滤强度和输出要求,因此应在选型之前逐项明确。用场景清单代替文档总量,评估才不会被“知识很多”的表象掩盖掉治理成本。
优先级判断也来自场景本身。首批应用应选择高频、边界清晰、知识生命周期相对稳定的场景,例如内部制度问答、产品参数查询、标准售后流程和技术故障排查。这类场景问题明确,标准答案容易审核,上线后便于衡量是一次解决还是仍需人工转接。开放式战略分析、跨部门方案生成等问题,知识边界模糊,评估成本高,通常不适合作为最小可行场景。
场景验证不能只靠演示,而要用真实历史问题建立测试集,覆盖常见问法、相似表达、错别字、跨文档矛盾、无答案和越权提问等情况。评测需要分层:检索未命中属于召回问题,检索命中但答案依据不充分属于排序或生成问题,答案正确但引用错误则是可信度问题。场景是否成立,最终要看回答准确率、一次解决率、人工转接率和知识复用率等业务指标,而不是模型调用次数。
因此,评估企业AI知识库的业务场景,本质是判断一个明确业务问题能否在权限可靠、依据可溯、输出可执行的前提下被稳定解决。只有场景问题清晰、知识来源可控、验证指标可观察,AI知识库才可能进入真实工作流,而不是停留在一个会对话但难以信任的入口。
