企业如何量化模型幻觉率? - 软盟-软盟

企业如何量化模型幻觉率?

话题来源: 实战指南:大模型选型对比完整步骤手册

企业量化模型幻觉率,关键不是统计“回答错了多少次”,而是先定义什么算错、错在哪里,以及不同错误对业务造成多大影响。若定义含糊,最终得到的只是一个看似精确、却无法用于决策的数字。

先统一幻觉的判定口径

对事实型问题,应把模型输出与标准答案、业务文档或可核验事实逐条比对。模型在依据不足时编造不存在的事实、引用错误信息、曲解原文,或用确定语气回答无法确认的问题,都可纳入幻觉判定。单纯的表达差异不应直接算作幻觉,否则会把语言风格问题误判为事实错误。

最基础的答案级幻觉率可按以下方式计算:

幻觉率 = 被判定为存在事实性错误的回答数 ÷ 有效评测回答总数 × 100%

但答案级指标仍然较粗。一条回答包含多个事实主张时,只要其中一处错误就会被整体判错,无法反映错误严重程度。因此,企业还应统计主张级幻觉率,即逐条拆分回答中的事实主张,再核验每一条是否有依据。对于客服、知识库问答等场景,主张级指标通常更适合定位问题来源。

测试集必须贴近业务

测试集不宜只采用公开题目,而应从历史工单、真实咨询和业务文档中抽取,并覆盖正常问题、边界问题与对抗问题。原文资料建议构建包含真实业务题、模糊指令、超长输入、多轮上下文和提示注入等类型的私有测试集,规模可参考三百至五百条。

每道题都应提前标注标准答案或评分要点,并由至少两名业务专家独立评审。若专家意见不一致,应记录争议,而不是强行归类。评测时还要保留模型原始输出、上下文、检索材料和版本信息,避免只保存最终分数,导致后续无法复盘。

不要只看一个百分比

企业至少应同时观察三类指标:总体幻觉率、按业务场景拆分的幻觉率,以及按严重程度加权的风险率。把“措辞不严谨”和“虚构政策、金额或专业结论”视为同等错误,会掩盖真正的业务风险。对高风险场景,还应单独统计严重错误,并设置上线红线;一旦触发,不能用其他低风险题目的高分抵消。

上线后,评测不能停止。灰度阶段应持续抽样核验真实回答,记录问题类型、影响范围和修复结果,并在模型更新、知识库调整或提示模板变化后重新评估。幻觉率只有绑定明确口径、真实测试集、人工复核和持续监测,才会从一个宣传指标变成可用于模型选型与风险控制的管理指标。