第 48 章

第 48 章:知识库

第 48 章:知识库

本文整理自 Datawhale 开源项目 datawhalechina/jev-cookbook(CC BY-NC-SA 4.0),源文件:main/11_知识库/README.md。

这是教程的证据索引:用来找到数字、代码和观点从哪里来,收录时使用了哪个版本,以及哪些许可和限制需要保留。

快照范围

本章含从上游 jev-cookbook 导出的 21 个资料板块和 Laya 示例,另收录 9 篇外部文章(23 Clef 决策模型,Cloudflare Blog;24 Jev 工程实战,@polydao;25 Gero-4B RL 训练平台,@TheVixhal;26 Jev 评审实战,@akshay_pachaar;27 本地自制 Jev,@_avichawla;28 pg-jev 上手,「AI工程化」;29 StartLux 决策模型报道,机器之心;30 Jev 质疑实测,「数字生命情酱」;31 选项顺序不变性训练笔记,@neural_avb)。目录重排和收录范围见来源清单,该清单记录了 2026-09-23 打包时各上游 commit、文件数量、未收录内容和许可。快照日期不代表资料仍是上游最新版本。

flowchart LR
  C[教程中的结论或数字] --> S[来源文件与原始链接]
  S --> V[版本、commit 与日期]
  V --> R[记录数据、模型、基线和指标]
  R --> B[注明证据类型与适用边界]
  B --> L[核对许可与传播限制]
  L --> U[需要更新时保留旧版并记差异]

查数字时可按证据链倒着走:先找到 README 中的结论,再核对来源文件 / 论文版本、数据切分、运行配置与原始结果。官方接口文档能支持“接口这样定义”,论文能支持“作者在该设置下报告了结果”,本地日志能支持“本仓库这次运行观察到结果”;三者不能互相替代。若缺少原始数据、标签或运行条件,应把说法降为案例观察或待验证假设。

把一个实验数字记成可追溯的记录

claim: "这里写希望引用的结论,不把它改写成更强的主张"
source: "论文 / 上游页面 / 本地报告路径"
version_or_commit: "tag、commit、论文版本"
dataset_and_split: "数据集、样本数、切分、是否有人审标签"
model_and_run: "模型、参数、日期、硬件、重试与成本口径"
metric_and_baseline: "指标定义、对照组、区间或重复次数"
evidence_type: "接口文档 / 作者报告 / 本仓库实测 / 离线示例"
limitations: "哪些范围尚不能从这条记录推出"
license: "代码、数据或文章的再使用条件"

任何一个字段缺失,都应限制对应结论的强度:例如只保存了 Notebook 输出截图、没有原始数据和运行配置,就不宜称为“可复现基准”。

按用途查找

资料 可查内容 阅读时注意
官方文档中译 System One、state、原语和官方配方的中文材料 非官方社区翻译;接口变动时核对官方文档
NanoJev 小型应用的确定性引擎与判断接口模式 示例不等于生产级模型基准
JevBench v1.2 系列冻结题集、计分方法和结果 比较前确认 v1.2.3 的计分、价格和延迟调整
Rerank 研究文章 80 条 SciFact 上的重排序对照 单一数据集、候选集与基线上的报告
Fast Jev Compaction Claude Code 上下文压缩示例 上游版本与许可见 SOURCES
Eve 与研究报告 决策模型横向讨论 区分二手分析与原始实验
Clef 发布文译文 Cloudflare 决策模型 Clef 的完整评测数字(Jev Decision Index、延迟表)与 RL 微调服务介绍 厂商自报数据;对照 JevBench 的独立复测再引用
Jev 工程实战译文 把智能体里的小决策迁到 Jev 的完整方法:四桶分拣、问题写法、置信度路由、Kimi K3 兜底与成本账 个人从业者实战总结;数字为作者自报口径,无样本细节处按案例看待
Gero-4B 训练平台译文 用 MLX 在 MacBook 上把 Qwen3-4B 训成 Jev 式决策模型的完整代码路径:奖励塑形、校准分组、结果复现 个人复现教程;结果为作者单机自报,未见第三方复测
Jev 评审实战译文 用 Jev 替代 LLM-as-judge 评估智能体:依据性/行动核实等有界判断、与 Opik 集成的完整代码 实操教程;示例数据与结论为作者自报,规模与基线未附
本地自制 Jev 译文 不重训练、用 next-token 打分把开源 LLM 变成本地决策引擎:受约束选项、概率分布、SGLang 部署与延迟实测 教育博主教程;benchmark 为作者单机自报口径
pg-jev 上手 · 项目 README 中译 把 Jev 包装成 SQL 函数的 PostgreSQL 扩展:自然语言 WHERE/排序/分类,含性能实测与四条部署注意 中文原创上手文 + README 非官方中译;实测数字为公众号作者自报口径
StartLux 决策模型报道 中国开源决策模型 StartLux-Decision 在 Decision Index 0.2.1 登顶:五档参数、基准数字、架构与本地部署路线 媒体报道;评测数字来自厂商/榜单口径,引用前回 Decision Index 与模型卡复核
Jev 质疑实测 拆解马里奥/Minecraft 刷屏视频:作者实跑 30 局、547 次请求的对照实验,指出部分项目默认未调用 Jev、仪表数字为写死 独立质疑视角;单作者自测口径,可与 11 号 mario 复现 的上游 bug 记录互相印证
选项顺序不变性训练笔记 训练 System One 模型的实战研究:位置偏差的成因与消解,276K 样本数据集与 0.4B 模型的训练记录 个人研究笔记;自述含半成品想法,结论以附推文与模型演示为准
Laya 资料 架构、开源发布、榜单报道、本地接口 参数、排行榜和下载信息都要回到当前模型卡复核
其他板块 trader、技能、SDK、飞书研究与公众号文章 私有文档或受版权保护的内容不能因被收录就自由再分发

给实验结论标注证据

引用数字时,至少写清:

  • 出处与版本:上游链接、commit 或 benchmark tag。
  • 时间与范围:运行日期、数据集、样本数量和切分。
  • 运行条件:模型版本、参数、端点、机器、并发、成本口径。
  • 证据类型:接口文档、可复现测量、离线演示、研究论文或二手报道。
  • 适用边界:基线、置信区间、选择偏差、隐私与许可限制。

例如,JevBench 的榜单结论应链接到固定的 v1.2.3 结果,而不是只引用网页上会继续更新的排名;重排序数字要同时标明 SciFact 和候选集。没有样本和标注支持的观察,应称为案例或假设,不能写成普遍性能。

使用与更新

查目录来源、commit、未收录范围和许可证,先看 SOURCES.md。引用或再分发公众号、飞书文档、上游未附许可的代码前,遵守来源清单中的限制。私有 wiki 的快照尤其不能因保存在仓库里而对外传播。

更新快照时保留旧版本可追溯性,并记录新的来源、commit、日期、差异与许可变化;对教程中受影响的数字同步更新对应章节说明。模型权重和数据集未随此知识库完整收录,按各自来源页面申请或下载。

📑 Jev Cookbook:System One 判断模型实战教程

1 第 1 章:认识 Jev:模型、上手与场景 2 第 2 章:核心概念总览 3 第 3 章:System One:判断的核心心智模型 4 第 4 章:状态:让判断连续可追溯 5 第 5 章:原语:Choice、Score 与 Noul 6 第 6 章:置信度:让概率可信 7 第 7 章:应用构建:从原语到完整系统 8 第 8 章:架构模式 9 第 9 章:实战指南总览 10 第 10 章:自一致性 · Noul 11 第 11 章:自一致性 · Choice 12 第 12 章:并行提问 13 第 13 章:重排序 14 第 14 章:逐行语义搜索 15 第 15 章:结构恢复 16 第 16 章:函数调用 17 第 17 章:技能推荐 18 第 18 章:实体对齐 19 第 19 章:RAG 段落分类 20 第 20 章:引用核查 21 第 21 章:LLM 防护栏 22 第 22 章:SDE 级联 23 第 23 章:日期抽取 24 第 24 章:预解析值抽取 25 第 25 章:层级分类 26 第 26 章:自动研究特征发现 27 第 27 章:基于置信度的分类 28 第 28 章:智能家居实验 29 第 29 章:模型评测总览 30 第 30 章:模型评测实验 31 第 31 章:Laya vs Jev 对比基准 32 第 32 章:JevBench:LLM 评测体系 33 第 33 章:智能家居应用实战 34 第 34 章:Jev-Mem 研究总览 35 第 35 章:Jev-Mem 缩放实验 36 第 36 章:Jev-Mem 完整走查 37 第 37 章:Agent 集成总览 38 第 38 章:Pi 集成实验 39 第 39 章:DSH 决策协作 40 第 40 章:本地模型总览 41 第 41 章:本地模型介绍与对比 42 第 42 章:中文数据集构建方案 43 第 43 章:微调指南 44 第 44 章:RLCD 原理与实验优化 45 第 45 章:中文数据集构建实验 46 第 46 章:中文 Head 微调实验 47 第 47 章:全量 v2 微调实验 48 第 48 章:知识库
← 返回本书大纲