智能体上线后,仪表盘上的数字变好,并不必然意味着业务变好。处理时长缩短,可能伴随错误增加;采纳率上升,也可能只是员工被要求使用。指标一旦成为考核目标,就可能诱发绕开难题、压低问题记录等行为。避免评估失真,关键不是增加指标数量,而是让指标口径、对照方式和决策用途经得起追问。
首先要在上线前定义基线、目标和统计边界。任务处理时长应说明是否包含人工复核与返工;一次办结率要明确什么算办结;质量抽检则需说明样本如何选取、由谁判定。若上线前后业务量、任务难度或用户群体发生变化,直接比较总体均值容易把结构变化误当成智能体效果。评估应尽量在相近场景和口径下比较,并标出无法排除的干扰因素。
其次,不能用单一指标代表整体表现。效率、质量、风险和运营成本需要成组观察:时长下降时,同时检查错误、返工和人工复核负担;采纳率提高时,核实输出是否真正解决问题;业务收益提升时,也要确认是否增加了越权、关键错误或异常处置成本。对高影响任务,风险底线应独立于平均收益,不能用效率改善抵消不可接受的风险。
最后,指标必须连接到可复核的证据和行动。抽检结果、审计记录、用户反馈与业务数据应能互相印证;异常变化要进一步拆分到任务类型、部门或输入条件,判断问题来自权限、流程、资料、模型表现还是人工操作。评估发现若没有责任人、复核路径和后续调整,只会形成漂亮的报表。
可靠的评估不是证明智能体“表现不错”,而是尽可能识别它在哪些条件下有效、代价是什么、何时不该使用。把口径写清、收益与风险并看,并让异常触发复核,指标才更接近真实的业务价值。
