第 2 章:核心概念总览
第 2 章:核心概念总览
本文整理自 Datawhale 开源项目 datawhalechina/jev-cookbook(CC BY-NC-SA 4.0),源文件:main/02_核心概念/README.md。
第一章看到了一次类型化判断;本章把它拆成完整的数据流:state → question 与答案空间 → 概率分布 → 置信度与不确定性 → 策略 → 动作。
五册路线
| 册 | 核心问题 | Notebook 中的实验 |
|---|---|---|
| 01 System One | 一个请求如何绑定 state 和多个问题? | 退款三问、答案 ID 对照 |
| 02 状态 | 哪些证据应该进入判断? | 固定事实改变表达形式、再逐步补充事实、字段白名单 |
| 03 原语 | 是不是、选哪项、程度多少分别怎么表示? | 同一工单上的 Noul、Choice、Score |
| 04 置信度 | 概率分布如何转成可用的不确定性信号? | 分布形状、三路分流、风险阈值、分类层级 |
| 05 应用构建 | 怎样把判断嵌入受代码控制的流程? | 客服分支、上下文引用和决策组合 |
本教程把 System One 当作一种任务与接口设计来教:把答案空间明确的判断表示成类型化问题,再由程序组合结果。除非某个实现文档明确说明,否则不要把这个名字解读成对服务端“恰好一次前向”、问题间完全独立或固定延迟的承诺。
flowchart LR S[State:允许使用的证据] --> Q[问题与答案空间] Q --> P[概率分布] P --> C[Confidence:接口摘要] P --> R[对照标签得到正确性] R --> K[跨样本检查校准] P --> T[应用策略与阈值] K --> T T --> A[动作或人工复核]
从“选哪个”到“概率分布怎样”
对一个有 K 个选项的问题,模型给出 p=(p_1, …, p_K),其中每项表示对相应结果分配的概率质量;合法分布满足每项非负且总和为 1。只看 argmax(p) 会丢掉分布形状:[0.51, 0.49] 与 [0.99, 0.01] 选中同一类别,却表达了不同程度的不确定性。
多类 Brier score 的一种常见写法是
其中 y_i 是已知标签。它同时惩罚错误类别与概率分配偏差;它不是“单独的校准分数”。校准图把预测分到若干区间,比较每个区间的平均置信度与实际正确率;区间样本太少时,图上的偏差也会很不稳定。
下面是一个校准分桶的玩具例子:
| 预测置信度区间 | 样本数 | 正确数 | 经验正确率 | 读法 |
|---|---|---|---|---|
| 约 0.80 | 50 | 40 | 0.80 | 这一组的平均把握与命中比例接近 |
| 约 0.95 | 50 | 38 | 0.76 | 这一组明显过度自信 |
全体准确率是 78%,但只报它会掩盖第二组的概率问题。反过来,第一组校准良好也不表示其中 50 条都正确;校准只描述分组后的频率。
先理解三个概念边界
State 是本次判断可见的证据集合,不等于提示词全文。 设计 state 时同时考虑信息充分性、无关信息干扰和信息边界:只提供作决定时合法且必要的字段;不要包含未来结果、标签、答案或权限不允许读取的数据。可把它理解为应用侧的特征设计与访问边界。
原语刻画答案空间。
| 原语 | 常见数学直觉 | 适合问的问题 | 解释边界 |
|---|---|---|---|
| Noul | 二元事件,报告 P(true) | 是否发生、是否符合 | 本 API 直接暴露的字段以 Notebook / SDK 版本为准 |
| Choice | 类别分布 P(y = k) | 属于哪一类、该走哪条路 | 选项定义要互斥且覆盖合理 |
| Score | 有序等级上的概率质量 | 程度、严重度、强弱 | 等级编码与间距要有业务含义;期望分数可能落在等级之间 |
概率、置信度、正确性与校准不是同一件事。
- 概率是模型分配给某个结果的质量。
- 置信度是接口提供的分布摘要;它不等于“这条答案正确的概率”。置信度的具体公式若未公开,就不应自行推断。当前接口对 Noul 可能直接提供 P(true),而不提供额外 confidence 字段。
- 正确性要用带标签的样本判断。
- 校准是群体性质:长期看,报 0.8 的预测中约有 80% 事件发生。单个 0.8 预测仍可能错。
概率质量的理论与指标
严格适当评分规则满足:当真实结果分布为 q 时,若按期望得分衡量,报告 q 是最优选择。它让概率分布而非只让 argmax 类别参与训练或比较;它不能保证标签真实、数据代表线上分布或模型天然校准。Gneiting 与 Raftery 的综述系统介绍了这类规则。
- NLL / Log loss:重视真实类别分到的概率;对过度自信且错误的预测惩罚较大。
- Brier score:评估概率预测与结果的平方误差,是整体概率评分,不是单独的 calibration 指标。经典分解还涉及 reliability、resolution 和事件基准不确定性;见 Murphy (1973)。
- Reliability diagram / ECE:按概率分桶比较置信度与经验正确率。ECE 会受分桶、样本数和类别定义影响,需连同样本规模解释,不能只报一个数。
- Temperature scaling:在独立 calibration split 上拟合的后处理方法,不能在 test 集上挑温度。经典入门见 Guo 等 (2017)。
本章 Notebook 的 Brier 计算用于理解概率分布。要报告模型结论,还需要足够的标注样本、预先固定的划分、多个指标和适当的不确定区间。第十章会把 proper scoring rule 与 RLCD 的训练目标连接起来。
练习与边界
- 保持 state 不变,只改一个 criteria 词语,再比较分布;区分观察到的变化与对所有任务的推断。
- 检查 state 白名单:哪些字段是依据、哪些字段可能泄漏标签、哪些字段不该提供给模型?
- 按标注集画 reliability diagram,并同时报告准确率、NLL、Brier 与 ECE;不要把一次预测是否正确称为“校准”。
按 01 → 02 → 03 → 04 → 05 阅读。官方概念页的中文材料见翻译站。