第 2 章

第 2 章:核心概念总览

第 2 章:核心概念总览

本文整理自 Datawhale 开源项目 datawhalechina/jev-cookbook(CC BY-NC-SA 4.0),源文件:main/02_核心概念/README.md。

第一章看到了一次类型化判断;本章把它拆成完整的数据流:state → question 与答案空间 → 概率分布 → 置信度与不确定性 → 策略 → 动作。

五册路线

册 核心问题 Notebook 中的实验
01 System One 一个请求如何绑定 state 和多个问题? 退款三问、答案 ID 对照
02 状态 哪些证据应该进入判断? 固定事实改变表达形式、再逐步补充事实、字段白名单
03 原语 是不是、选哪项、程度多少分别怎么表示? 同一工单上的 Noul、Choice、Score
04 置信度 概率分布如何转成可用的不确定性信号? 分布形状、三路分流、风险阈值、分类层级
05 应用构建 怎样把判断嵌入受代码控制的流程? 客服分支、上下文引用和决策组合

本教程把 System One 当作一种任务与接口设计来教:把答案空间明确的判断表示成类型化问题,再由程序组合结果。除非某个实现文档明确说明,否则不要把这个名字解读成对服务端“恰好一次前向”、问题间完全独立或固定延迟的承诺。

flowchart LR
  S[State:允许使用的证据] --> Q[问题与答案空间]
  Q --> P[概率分布]
  P --> C[Confidence:接口摘要]
  P --> R[对照标签得到正确性]
  R --> K[跨样本检查校准]
  P --> T[应用策略与阈值]
  K --> T
  T --> A[动作或人工复核]

从“选哪个”到“概率分布怎样”

对一个有 K 个选项的问题,模型给出 p=(p_1, …, p_K),其中每项表示对相应结果分配的概率质量;合法分布满足每项非负且总和为 1。只看 argmax(p) 会丢掉分布形状:[0.51, 0.49] 与 [0.99, 0.01] 选中同一类别,却表达了不同程度的不确定性。

多类 Brier score 的一种常见写法是

BS=1n∑i=1n∑k=1K(pik−1[yi=k])2,\mathrm{BS}=\frac{1}{n}\sum_{i=1}^{n}\sum_{k=1}^{K}(p_{ik}-\mathbf{1}[y_i=k])^2,

其中 y_i 是已知标签。它同时惩罚错误类别与概率分配偏差;它不是“单独的校准分数”。校准图把预测分到若干区间,比较每个区间的平均置信度与实际正确率;区间样本太少时,图上的偏差也会很不稳定。

下面是一个校准分桶的玩具例子:

预测置信度区间 样本数 正确数 经验正确率 读法
约 0.80 50 40 0.80 这一组的平均把握与命中比例接近
约 0.95 50 38 0.76 这一组明显过度自信

全体准确率是 78%,但只报它会掩盖第二组的概率问题。反过来,第一组校准良好也不表示其中 50 条都正确;校准只描述分组后的频率。

先理解三个概念边界

State 是本次判断可见的证据集合,不等于提示词全文。 设计 state 时同时考虑信息充分性、无关信息干扰和信息边界:只提供作决定时合法且必要的字段;不要包含未来结果、标签、答案或权限不允许读取的数据。可把它理解为应用侧的特征设计与访问边界。

原语刻画答案空间。

原语 常见数学直觉 适合问的问题 解释边界
Noul 二元事件,报告 P(true) 是否发生、是否符合 本 API 直接暴露的字段以 Notebook / SDK 版本为准
Choice 类别分布 P(y = k) 属于哪一类、该走哪条路 选项定义要互斥且覆盖合理
Score 有序等级上的概率质量 程度、严重度、强弱 等级编码与间距要有业务含义;期望分数可能落在等级之间

概率、置信度、正确性与校准不是同一件事。

  • 概率是模型分配给某个结果的质量。
  • 置信度是接口提供的分布摘要;它不等于“这条答案正确的概率”。置信度的具体公式若未公开,就不应自行推断。当前接口对 Noul 可能直接提供 P(true),而不提供额外 confidence 字段。
  • 正确性要用带标签的样本判断。
  • 校准是群体性质:长期看,报 0.8 的预测中约有 80% 事件发生。单个 0.8 预测仍可能错。

概率质量的理论与指标

严格适当评分规则满足:当真实结果分布为 q 时,若按期望得分衡量,报告 q 是最优选择。它让概率分布而非只让 argmax 类别参与训练或比较;它不能保证标签真实、数据代表线上分布或模型天然校准。Gneiting 与 Raftery 的综述系统介绍了这类规则。

  • NLL / Log loss:重视真实类别分到的概率;对过度自信且错误的预测惩罚较大。
  • Brier score:评估概率预测与结果的平方误差,是整体概率评分,不是单独的 calibration 指标。经典分解还涉及 reliability、resolution 和事件基准不确定性;见 Murphy (1973)。
  • Reliability diagram / ECE:按概率分桶比较置信度与经验正确率。ECE 会受分桶、样本数和类别定义影响,需连同样本规模解释,不能只报一个数。
  • Temperature scaling:在独立 calibration split 上拟合的后处理方法,不能在 test 集上挑温度。经典入门见 Guo 等 (2017)。

本章 Notebook 的 Brier 计算用于理解概率分布。要报告模型结论,还需要足够的标注样本、预先固定的划分、多个指标和适当的不确定区间。第十章会把 proper scoring rule 与 RLCD 的训练目标连接起来。

练习与边界

  1. 保持 state 不变,只改一个 criteria 词语,再比较分布;区分观察到的变化与对所有任务的推断。
  2. 检查 state 白名单:哪些字段是依据、哪些字段可能泄漏标签、哪些字段不该提供给模型?
  3. 按标注集画 reliability diagram,并同时报告准确率、NLL、Brier 与 ECE;不要把一次预测是否正确称为“校准”。

按 01 → 02 → 03 → 04 → 05 阅读。官方概念页的中文材料见翻译站。

📑 Jev Cookbook:System One 判断模型实战教程

1 第 1 章:认识 Jev:模型、上手与场景 2 第 2 章:核心概念总览 3 第 3 章:System One:判断的核心心智模型 4 第 4 章:状态:让判断连续可追溯 5 第 5 章:原语:Choice、Score 与 Noul 6 第 6 章:置信度:让概率可信 7 第 7 章:应用构建:从原语到完整系统 8 第 8 章:架构模式 9 第 9 章:实战指南总览 10 第 10 章:自一致性 · Noul 11 第 11 章:自一致性 · Choice 12 第 12 章:并行提问 13 第 13 章:重排序 14 第 14 章:逐行语义搜索 15 第 15 章:结构恢复 16 第 16 章:函数调用 17 第 17 章:技能推荐 18 第 18 章:实体对齐 19 第 19 章:RAG 段落分类 20 第 20 章:引用核查 21 第 21 章:LLM 防护栏 22 第 22 章:SDE 级联 23 第 23 章:日期抽取 24 第 24 章:预解析值抽取 25 第 25 章:层级分类 26 第 26 章:自动研究特征发现 27 第 27 章:基于置信度的分类 28 第 28 章:智能家居实验 29 第 29 章:模型评测总览 30 第 30 章:模型评测实验 31 第 31 章:Laya vs Jev 对比基准 32 第 32 章:JevBench:LLM 评测体系 33 第 33 章:智能家居应用实战 34 第 34 章:Jev-Mem 研究总览 35 第 35 章:Jev-Mem 缩放实验 36 第 36 章:Jev-Mem 完整走查 37 第 37 章:Agent 集成总览 38 第 38 章:Pi 集成实验 39 第 39 章:DSH 决策协作 40 第 40 章:本地模型总览 41 第 41 章:本地模型介绍与对比 42 第 42 章:中文数据集构建方案 43 第 43 章:微调指南 44 第 44 章:RLCD 原理与实验优化 45 第 45 章:中文数据集构建实验 46 第 46 章:中文 Head 微调实验 47 第 47 章:全量 v2 微调实验 48 第 48 章:知识库
← 返回本书大纲