AIL-546 · Evidence-backed study

Before / After
Eval Lab

把“修改后看起来更好”变成可以回放、可以定位、可以反驳的证据:同一组候选输入,运行 PR #89 的真实 scorer 与当前工作树。

建议保留当前最小修改

`irs-v2` 修复了时间语义与不可靠 evidence 的错误确认;但 100% 是诊断集结果,不是生产准确率。下一步先补齐可执行 gold,不继续调权重。

变化发生在哪里

8 条有 target、4 条要求 abstain;其中一条同时属于两类。分母始终展示,避免把小样本 100% 误读为稳定线上指标。

Top-1
37.5% → 100%
+62.5 pp
3/8 → 8/8;5 条时间语义 case 被纠正
Abstain accuracy
50% → 100%
+50 pp
2/4 → 4/4;弱推断不再促成 strong
False strong
2 → 0
关闭 2 个风险样例
协作≠任职;rumor≠current fact
Recall@3
100% → 100%
无变化
候选由 replay 预置;没有测 Provider retrieval
解释边界:这是针对已知失败机制构造的 11 条合成候选回放。它证明 scorer 规则变化,不估算生产 lift、线上 Recall、LLM routing 或 current-role freshness。

74 条输入,0 条可直接算线上 ranking

“有案例描述”不等于“有可执行 gold”。页面把原始目录、诊断 replay 和机器结果分层展示,避免 provenance 在汇总时消失。

公开人物目录

50

45 条人物 + 5 条 routing;缺冻结 candidate snapshot,scorer-ready 0。

sha256 354a6ba4…d0d08fc

真实任务目录

24

9 条可做路由/安全标签,6 条 strong gold candidate,8 条待裁决,1 条 baseline-only。

sha256 9842e275…53f3c5

可执行诊断 replay

11

只测试 scorer 拥有的 ranking、时间语义、可靠性和 abstention。

sha256 00b7e14c…08dd1
抽样风险:Dashboard 泄漏 51 条窗口外任务;70 条人物候选中有 30 条 bundle 不可读(42.9%)。未处理时间窗与 missingness 前,真实目录不是无偏 production sample。

逐 Case 可追溯结果

筛选后点击“查看证据”,检查实际 top ref、分数、match level 及 matched / unknown signals。完整结构保存在机器 JSON。

Case / 来源维度BeforeAfter变化Trace

方法与证明边界

真实 before / after

  • Before 直接读取 Git revision `2530f17` 的 scorer 源码。
  • After 从当前工作树导入 `irs-v2`。
  • 两边使用同一 fixture;连续运行两次检查确定性。
  • 保存 revision、source hash、fixture hash 和逐 case 解释。

明确不能证明

  • 没有调用 Provider,因此不证明 live retrieval Recall。
  • 没有运行 LLM,因此不证明 no-search / ask routing。
  • 没有写 Contact,因此不证明 correction/revocation 生命周期。
  • 没有冻结网页 snapshot,因此不证明当前职位时效。

下一步:更多证据,不是更多组件

P0 · Eval-case compiler

冻结 observed_at、input clues、candidate snapshot/hash、gold target、expected action、source tier、adjudication 与 privacy check。

P0 · 五条 Eval lane

routing、retrieval、ranking、temporal、mutation safety 分开计分;禁止用一个总体准确率掩盖跨层失败。

P1 · Clue provenance

当前 candidate 有 reliability,但 clue 没有。真实 gold 足够后再最小增加 source kind、observed_at 和 reliability。

P1 · Correction state

用户纠正应撤销错误 claim 并保留来源,不是追加 note,也不属于 search scorer 的副作用。

P1 · Sampling hygiene

compiler 二次校验严格时间窗;为 unreadable bundle 记录 taxonomy,并报告 missingness 分层。

暂不做

不加 LLM reranker、向量库或新 Provider;不因 11 条全过调整阈值;不把名人目录包装成线上 benchmark。

证据索引

Case trace