第 34 章

第 34 章:Jev-Mem 研究总览

第 34 章:Jev-Mem 研究总览

本文整理自 Datawhale 开源项目 datawhalechina/jev-cookbook(CC BY-NC-SA 4.0),源文件:main/08_前沿研究/README.md。

本章把本地复现实验与 2026 年 9 月的早期研究快照放在一起。除注明的本地 Notebook 外,以下新论文均为预印本;数字是作者报告的结果,尚不能当成独立复现或通用能力保证。

研究阅读卡片

读每个项目时记下:

  1. 它要解决什么问题,原假设是什么?
  2. state、判断原语和后续动作分别是什么?
  3. 使用哪些数据集、基线和模型版本?
  4. 指标如何计算,是否有对照、消融或重复实验?
  5. 哪些结论只适用于当前样本?哪些尚未验证?
flowchart TD
  Q[研究问题] --> M[方法与系统设计]
  M --> D[数据集、基线与运行条件]
  D --> E[指标与实验结果]
  E --> L[限制、混杂因素与未验证假设]
  L --> C[可复现结论边界]
  M --> A[Agent 级联与工具控制]
  M --> B[长期记忆]
  M --> G[游戏与长短程规划]
  M --> R[医疗与其他领域评估]
  M --> S[安全与提示注入]

每篇研究先把“作者报告了什么”与“实验实际支持什么”分开记。抽象摘要适合定位问题,方法与附录确定任务、数据和基线,运行日志与统计分析决定证据强度;消融和多次独立重复可以帮助识别收益来自哪里。预印本的数字应保留论文版本和发布日期,并标成作者报告值,不能写成本教程已验证的事实。

把一句研究结论拆成可核对字段

以 REFLEX 报告“强模型调用减少 72.7%”为例,读者可以把它拆成:

对照组:只用哪个强模型?每个任务允许调用几次?
实验组:Jev 什么时候接管、什么时候回退?
分母:100 项任务里哪些任务计入调用数?失败任务是否保留?
指标:减少的是请求次数、token 数,还是费用?
质量约束:任务成功率是否同时报告,和什么基线比较?
边界:这是不是论文作者的报告值?仓库有没有独立复现?

拆成这些字段后,百分比才有可解释的分母和对照条件;若论文未提供某一项,就把它记为未知,不根据摘要猜测。

Jev-Mem:用判断模型辅助记忆读写

Jev-Mem 上游项目与论文 arXiv:2609.23986探索用类型化问题辅助决定存储、分类、检索和冲突处理。可以把它拆成两类问题:记忆管线对哪些事实作判断,以及代码如何把这些判断组合成读写动作。

本仓库的 Notebook 记录了 2026-09-25 的特定运行,包括一个 16 轮中文对话的四路对照、48–384 轮的上下文长度练习,以及一个 419 轮 LoCoMo 样本上的实验。文档中的准确率与 token 数是该次设置的观察值,不是整套 LoCoMo 或所有长对话的保证。使用其结果前,先检查对应 Notebook 的模型、问题集、基线、评分过程和样本范围。

入口:实验讲解 · 长程缩放 · 项目说明。

实验效果图:短对话、规模增长与真实样本

下图直接整理自两个 Notebook 的已保存实验输出。短对话与 48–384 轮缩放使用 DeepSeek 生成和评审、Jev-Mem 使用真 Jev 决策;LoCoMo 图展示样本 0 的 10 题对照。每项均为单轮实验均值或小样本观察,不能视为完整基准复现。

16 轮中文对话按问题类型的四路评分对比

16 轮实验中,全上下文的加权均分最高(0.96),Jev-Mem 为 0.84;但对比朴素 RAG,Jev-Mem 的提升集中在时间题(0.00→0.50),总分从 0.72 到 0.84。这个结果提示:短对话且上下文装得下时,直接给模型完整记录通常足够;判断路由的价值更可能出现在时间关系检索等具体题型,而不是每类问题都一起涨分。

48 至 384 轮对话中的质量、输入 token 与查询延迟变化

缩放实验把这个取舍展现得更清楚:384 轮时,全上下文每题约 9,778 token,Jev-Mem 约 120 token,相差 81.5 倍;同期评审分为 0.88 与 0.90。全上下文在 48–192 轮仍保持 0.98,不能把记忆系统说成始终更准确。此组设置里 Jev-Mem 查询延迟更高(1.41–1.66 秒),另有一次性建图耗时,因此读图时要把质量、重复查询的输入成本和响应时间分开权衡。

LoCoMo 样本 0 的全上下文与 Jev-Mem 质量、token 和延迟对比

在 419 轮 LoCoMo 样本 0 的 10 道题上,Jev-Mem 得分 0.98,全上下文 0.60;每题输入 token 约少 25 倍。不过查询耗时是 3.83 秒对 0.60 秒,且建图需 494 秒。这组观察支持“质量和输入成本可能改善”的进一步验证,不支持“查询更快”;题量较小,Notebook 还记录了本轮 judge 的 F1 为 57.3%,因此不应将分数外推到完整数据集。

图表数据快照、生成脚本与逐项实验口径保存在 Jev-Mem 图表目录 和 Jev-Mem 研究笔记。

JevHarness:开发与执行分开

JevHarness 项目分析讨论由强模型在开发阶段生成或修改 Harness,再由显式控制流、特征和判断节点完成在线任务。阅读时区分上游项目的主张与本仓库的分析;它不是本章完成的受控性能对照。

这种开发时离线迭代、执行时显式授权的分工,可与第七章的确定性游戏引擎和第九章的 Agent 工具门控对照。若执行链仍在线调用 Jev,减少的可能是强生成模型的调用,不代表系统不再依赖推理服务。

最近的研究方向:Agent、游戏控制、医疗评估与安全

研究 研究问题 该怎样读结果
REFLEX with Jev for Efficient Selective Control in LLM Agents 低置信或需要生成时再回退到强 LLM,研究类型化判断能否减少强模型调用 作者在冻结的 100 项任务上报告 95% 成功率、强模型调用减少 72.7%;也报告收益受动作集合、授权边界候选与回退基线影响。不是本仓库复现,先查任务定义和对照。
JEV-Star: Fast, Low-Cost StarCraft II Control with Language-Model Planning 将短时动作选择交给 Jev,将较长时程规划交给 GPT-6 作者报告组合控制器完成多场完整对局;论文同时指出对照系统之间的界面改动未被完全隔离,因此不能把全部差异归因于规划器。适合研究“局部判断 + 长程计划”的接口。
Can Jev Judge Radiology Reports? 用双向、逐陈述支持性判断比较放射科报告 作者报告与专家错误计数的相关结果,并做受控错误实验;指标受报告长度和错误定义影响。报告相似性判断不等于临床安全性或诊断能力。
Calibrated Decision Models for Autonomous Penetration-Testing Harnesses 探索在自动化渗透测试中用 Jev / Laya 判定发现、严重度和 Agent 路由 论文描述的是一个 13 个漏洞目标上的探索性对照;作者明确指出单次比较不足以建立统计显著性。只把它当作工作流假设与评测设计参考。
Decision Hijacking 测量恶意 state 内容怎样改变类型化动作概率 510 个重建案例用于研究注入影响,不代表线上发生率;schema 限制输出空间,但不构成权限边界。接着看第九章安全补充。

这些论文对应五种不同问题:级联效率、游戏控制、报告评估、安全自动化和提示注入。它们使用的数据、任务成功定义与基线不同,不能把结果排成同一条性能榜。需要引用具体百分比时,应引用论文版本和日期,并复核论文是否有更新。

阅读顺序与下一步

建议先读第二章原语,再看第六章评测方法,然后逐个核对本章数据与基线。涉及长期记忆、工具权限或现实动作的系统,还应明确删除/写入权限、状态更新规则、失败恢复和人工复核路径。

📑 Jev Cookbook:System One 判断模型实战教程

1 第 1 章:认识 Jev:模型、上手与场景 2 第 2 章:核心概念总览 3 第 3 章:System One:判断的核心心智模型 4 第 4 章:状态:让判断连续可追溯 5 第 5 章:原语:Choice、Score 与 Noul 6 第 6 章:置信度:让概率可信 7 第 7 章:应用构建:从原语到完整系统 8 第 8 章:架构模式 9 第 9 章:实战指南总览 10 第 10 章:自一致性 · Noul 11 第 11 章:自一致性 · Choice 12 第 12 章:并行提问 13 第 13 章:重排序 14 第 14 章:逐行语义搜索 15 第 15 章:结构恢复 16 第 16 章:函数调用 17 第 17 章:技能推荐 18 第 18 章:实体对齐 19 第 19 章:RAG 段落分类 20 第 20 章:引用核查 21 第 21 章:LLM 防护栏 22 第 22 章:SDE 级联 23 第 23 章:日期抽取 24 第 24 章:预解析值抽取 25 第 25 章:层级分类 26 第 26 章:自动研究特征发现 27 第 27 章:基于置信度的分类 28 第 28 章:智能家居实验 29 第 29 章:模型评测总览 30 第 30 章:模型评测实验 31 第 31 章:Laya vs Jev 对比基准 32 第 32 章:JevBench:LLM 评测体系 33 第 33 章:智能家居应用实战 34 第 34 章:Jev-Mem 研究总览 35 第 35 章:Jev-Mem 缩放实验 36 第 36 章:Jev-Mem 完整走查 37 第 37 章:Agent 集成总览 38 第 38 章:Pi 集成实验 39 第 39 章:DSH 决策协作 40 第 40 章:本地模型总览 41 第 41 章:本地模型介绍与对比 42 第 42 章:中文数据集构建方案 43 第 43 章:微调指南 44 第 44 章:RLCD 原理与实验优化 45 第 45 章:中文数据集构建实验 46 第 46 章:中文 Head 微调实验 47 第 47 章:全量 v2 微调实验 48 第 48 章:知识库
← 返回本书大纲