先动手,
再下一个判断。
同一个问题,改一项条件,结果会怎样?
在这个小工作台上,把手记里的判断试一遍。

缺失记录,应该放进分母吗?
四条计划记录中,A、B 有有效评分,C 超时,D 缺少材料。修改它们,观察均值和覆盖率怎样一起变化。
构造数据 · 在浏览器中运行 · 评分范围 0–1,越高表示本项表现越好
修改四条记录
成功记录必须有合法评分;0 是有效评分。超时或缺材料时,质量分暂时不可编辑。
同时看三件事
- 有效评分的均值
- 0.50
- 把缺失质量分填零的均值
- 0.25
- 有效评分覆盖
- 2 / 4 · 50%
同一组有效评分,两个均值相差 0.25。差别来自分母,不能把它当作质量变化。
有效均值只描述 A、B;C、D 尚未得到质量结论。均值旁边保留覆盖率,才能看见这部分缺口。
沿着产物,找第一次偏离。
用户问:v2 管理员能否一次导出 200 条非归档记录为 CSV?页面回答“可以”,并引用了 B。点开每一步,找出限制条件最早在哪儿丢了。
构造数据 · 在浏览器中运行 · 原规则 B:v2 管理员可导出非归档记录为 CSV,单次最多 100 条
改写与过滤
- 输入
- 原问题:v2 / 管理员 / 非归档记录 / CSV / 单次 200 条。
- 本步产物
- 检索文本:记录批量导出与单次上限。结构化条件保留 v2;权限过滤使用已认证身份。
- 下一步核对
- 核对检索文本和实际过滤参数,不只看改写句子。
正在检查第 1 步。先比较这一阶段的输入与产物,再作判断。
保持查询、候选和顺序不变,只把 B 的数量上限放回去。对照展示预期产物,没有重新调用模型。
这次对照可以说明什么?
完整上下文仍保留“单次最多 100 条”。预期回答因此是“200 条不能一次完成”。这说明应首先验证上下文丢失这个假设;真实系统是否恢复正确,仍需要同输入复测。
候选更多,适用的证据呢?
同样问 v2 欧洲区管理员能否一次导出 200 条。候选里混着其他版本、其他地域和旧规则。扩大预算,再切换适用条件,看看最终送去回答的证据。
构造数据 · 在浏览器中运行 · 候选排名、过滤和选取规则均为本页预设
调整候选池
筛选后先取最高排名的能力说明与额度说明,各一条。凑齐两种说明,不代表它们适用于同一个问题。
真正送入回答的证据
召回 4 条 · 筛后 2 条 · 最终 1 条
- 表面证据组覆盖
- 1 / 2
- 当前问题可用覆盖
- 1 / 2
有能力说明,但缺少当前欧洲区的单次额度。不能确认 200 条能否一次完成。
展开本轮候选,逐条核对适用条件
这个列表保留召回顺序;“送入回答”表示成为最终证据。权威性检查以本页明示的版本、地域与修订为准。