先找最后一个正确产物。
RAG 排障约 2 分钟
一条答案错了,先沿链路找“最后一个正确产物”和“第一个错误产物”,再决定改哪里。
原文的构造问题是:v2 管理员能一次导出 200 条记录吗?参考资料允许管理员导出非归档记录,但单次最多 100 条。如果进入上下文的片段保留了“最多 100 条”,答案却写成“可以导出 200 条”,这次偏离发生在生成环节;把召回数量调大,未必能解决它。
如果“最多 100 条”在更早的上下文装配中已经被删掉,就要回到那次转换。逐步对照问题约束、过滤条件、候选片段、最终上下文与答案,先定位条件在哪一步失去,再做一次只改变该因素的验证。
适用边界这需要可靠的参考依据和可查看的中间产物。只看到最终答案时,可以提出排查假设,但还不能确定根因;修好当前题,也要再看相邻版本、角色和数量的反例。
平均分旁边,留一个分母。
评估算例约 2 分钟
有效评分的均值,描述的是拿到评分的那部分样本。它必须和覆盖率、缺失原因一起读。
原文有四条构造记录:A 的评分为 0.2,B 为 0.8,C 评估超时,D 材料缺失。有效均值是(0.2 + 0.8)÷ 2 = 0.50,有效覆盖却只有 2 / 4。单看 0.50,读者不知道另外两条发生了什么。
把 C、D 的缺失质量分直接填成 0,会得到 0.25,却混入了评估过程的问题。更合适的表达是“有效均值 0.50,覆盖 50%,另有一条超时、一条材料缺失”,然后判断该补什么证据。两次评估的均值变高时,也要先检查有效样本集合是否变了。
适用边界这里讨论的是有明确取值范围的质量评分。执行成功、有效评分和业务通过属于不同维度;覆盖达到多少才够、什么错误必须阻断,要按具体目标事先约定。