变化发生在哪里
8 条有 target、4 条要求 abstain;其中一条同时属于两类。分母始终展示,避免把小样本 100% 误读为稳定线上指标。
74 条输入,0 条可直接算线上 ranking
“有案例描述”不等于“有可执行 gold”。页面把原始目录、诊断 replay 和机器结果分层展示,避免 provenance 在汇总时消失。
公开人物目录
45 条人物 + 5 条 routing;缺冻结 candidate snapshot,scorer-ready 0。
sha256 354a6ba4…d0d08fc
真实任务目录
9 条可做路由/安全标签,6 条 strong gold candidate,8 条待裁决,1 条 baseline-only。
sha256 9842e275…53f3c5
可执行诊断 replay
只测试 scorer 拥有的 ranking、时间语义、可靠性和 abstention。
sha256 00b7e14c…08dd1
逐 Case 可追溯结果
筛选后点击“查看证据”,检查实际 top ref、分数、match level 及 matched / unknown signals。完整结构保存在机器 JSON。
| Case / 来源 | 维度 | Before | After | 变化 | Trace |
|---|
方法与证明边界
真实 before / after
- Before 直接读取 Git revision `2530f17` 的 scorer 源码。
- After 从当前工作树导入 `irs-v2`。
- 两边使用同一 fixture;连续运行两次检查确定性。
- 保存 revision、source hash、fixture hash 和逐 case 解释。
明确不能证明
- 没有调用 Provider,因此不证明 live retrieval Recall。
- 没有运行 LLM,因此不证明 no-search / ask routing。
- 没有写 Contact,因此不证明 correction/revocation 生命周期。
- 没有冻结网页 snapshot,因此不证明当前职位时效。
下一步:更多证据,不是更多组件
P0 · Eval-case compiler
冻结 observed_at、input clues、candidate snapshot/hash、gold target、expected action、source tier、adjudication 与 privacy check。
P0 · 五条 Eval lane
routing、retrieval、ranking、temporal、mutation safety 分开计分;禁止用一个总体准确率掩盖跨层失败。
P1 · Clue provenance
当前 candidate 有 reliability,但 clue 没有。真实 gold 足够后再最小增加 source kind、observed_at 和 reliability。
P1 · Correction state
用户纠正应撤销错误 claim 并保留来源,不是追加 note,也不属于 search scorer 的副作用。
P1 · Sampling hygiene
compiler 二次校验严格时间窗;为 unreadable bundle 记录 taxonomy,并报告 missingness 分层。
暂不做
不加 LLM reranker、向量库或新 Provider;不因 11 条全过调整阈值;不把名人目录包装成线上 benchmark。