discipline/06-evidence.md
📑 本页目录
06 · 证据标准与评估协议
继承 AppTrends harness 纪律,并升级为学科级标准。
1. 文献证据金字塔
| 等级 | 含义 | 示例 |
|---|---|---|
| S 强实证 | 多项独立研究一致 + 公开数据可复现 | 组合优于单模型;proper scoring 的必要性 |
| M 中等 | 方向一致、样本有限或单一情境 | 时序基础模型零样本优于统计基线(数据集相关) |
| W 弱/混合 | 结论依赖情境 | 预测市场 vs 专家(选举/疫情结果不一) |
| X 推测/新兴 | 机制合理但证据不足 | LLM 合成需求数据的普遍可用性 |
规则:X 级结论必须标注,不得作为学科定论引用;引用时带等级后缀。
2. 预测注册纪律(先注册后计分)
- 任何预测性声明(点/分布/排序)先写入注册表:对象、范围、horizon、预测分布、 方法版本、时间戳。
- 注册后不可修改;事后由真实值计分;失败记录保留并用于理论修正。
- 禁止「事后归因冒充事前预测」(继承自 ADDO 的核心纪律)。
3. 评估协议(默认交付)
| 预测类型 | 必须报告 |
|---|---|
| 点预测 | MASE 或相对误差(vs 基准);禁止只报 MAPE 绝对值 |
| 分布预测 | CRPS(或特定分位的 pinball)+ PIT/可靠性图 |
| 区间预测 | Winkler 分数 + 覆盖率 |
| 分类/事件概率 | Brier 分数 + 校准曲线 |
| 排序预测 | 约束一致率 / tau / hit@k(Case 0 采用) |
4. 基准纪律
- 每次评估至少对照:naive/snaive、强统计基线(ETS/组合)、已有最佳版本。
- 报告相对提升时必须注明:基准、样本外协议(滚动/扩展窗口)、显著性 (Diebold-Mariano 或等价检验)。
- 分布预测必须用 proper scoring rules 比较(CRPS/pinball),禁止只用点误差下结论。
5. 可复现标准
- 知识(参数/打分/事实)与代码同库版本化;同一版本 → 同一结果。
- 数据集登记:来源、版本、licence、预处理;禁止静默修改数据。
- 实验记录与结论分离:实验文件只记录事实,结论进轮次记录。
6. 代理登记表(模板)
| 字段 | 内容 |
|---|---|
| 代理名 | 如「App Store 畅销榜名次」 |
| 目标构念 | 某品类消费者需求 |
| 偏差方向 | 高估/低估/未知 + 理由 |
| 滞后 | 领先/同步/滞后 |
| 覆盖 | 人群/地域/时间 |
| 操纵风险 | 刷榜、付费推广、机器人流量 |
| 效度证据 | 与参考量的相关、收敛效度结果 |
| 状态 | active / deprecated |
7. 假设注册(模板)
## H-XX 表述
- 表述:(可证伪的一句话)
- 可证伪方式:(什么数据、什么阈值判否)
- 检验设计:(协议、基准、样本外方式)
- 状态:proposed / in_progress / supported / rejected
8. 案例标准(Case 模板)
每个案例(含 Case 0:ADDO)应记录:对象与范围定义、所用代理及偏差、方法组合、 评估协议与结果、对公理/方法的反馈。案例库是学科「实践层」的证据来源。