Jev 能成为更好的 Agent 评估器吗?LangChain 用 LangSmith 做的实测翻译
Jev 能成为更好的 Agent 评估器吗?LangChain 用 LangSmith 做的实测翻译
这篇是 LangChain 官方博客的全文翻译,配了上下文解读。
昨天我们刚拆过 System One 模型 JEV 的架构,今天 LangChain 就发了一篇用它做 Agent 评估器的实测。结论很有意思:Jev 在连续评分上的一致性比 GPT-5.6 Luna、Terra 和 Claude Sonnet 4.6 好一到两个数量级,而且最快最便宜——平均 0.44 秒、每次调用 0.00035 美元,整个实验花了 0.34 美元,而 Claude 要 28.17 美元。
这篇翻译忠实保留了原文的全部数据、实验设计和结论,文末附我的几点解读。
本文提纲
- 核心要点(Key Takeaways)
- 为什么 Jev 可能是个好的 Agent 评估器
- Jev 是什么:三种问题类型
- 实验设计:怎么公平地比较评估器
- 实验结果:准确率、精度、成本与延迟
- 新的评估类型:在线评估解锁
- 复现信息
- 翻译后的几点解读
核心要点
- Jev 是一种根本不同的评估器。 它直接返回类型化答案,而不是像 LLM judge 那样生成文本。
- Jev 在连续评分上的一致性显著更好。 它的质量分方差比 GPT-5.6 Luna、Terra 和 Claude Sonnet 4.6 低 92–913 倍。
- Jev 也是最快、最便宜的。 平均 0.44 秒、每次调用 0.00035 美元(总计 0.34 美元,而 Claude 要 28.17 美元)。
- 结果有前景,但还早。 尽管这是一次范围很窄的测试,Jev 的表现指向了 Agent 评估的一个有说服力的新方向。
为什么 Jev 可能是个好的 Agent 评估器
如今的 Agent 评估有两种形态:基于代码(code-based)和 LLM 当裁判(LLM-as-a-judge)。两者各有局限:基于代码的评估器只能用于输入固定的一小类问题,而 LLM judge 是天然非确定性的系统——作为测试基础设施,这不是一个稳固的基础。
看到 TypeSafe AI 的 Jev 后,我们想知道这个 "System One" 模型是否会成为 Agent 评估的第三种形态,以及它可能对 Agent 工程产生什么影响。
Jev 是什么:三种问题类型
Jev 是 TypeSafe AI 发布的新模型。它其实不是传统 LLM——它不生成文本。TypeSafe 团队称之为 "System One" 模型:
System One 模型是一类为快速、结构化决策而构建的 AI 模型,软件可以直接使用其结果。System One 模型评估一个状态(state),返回类型化答案和概率。
根据 TypeSafe 的说法,这让 Jev 比 LLM 更快更便宜——在分类任务上,推理速度最高快 200 倍、成本最高低 400 倍。
Jev 支持三种类型的问题:
| 类型 | 说明 | 示例 |
|---|---|---|
| Choice(选择) | 从选项中选一个,返回概率和置信度 | "哪个搜索结果最能描述这次运行?" 返回 searched_appropriately / searched_unnecessarily / failed_to_search 之一,附概率和置信度 |
| Score(评分) | 按有序量规给答案打分,返回概率和置信度 | "这个答案有多有用?" 返回从 unhelpful 到 highly useful 的量规分,附概率和置信度 |
| Noul(是非) | 返回一个是非判断为真的概率 | "最终答案是否基于检索到的证据?" 返回 0.0 到 1.0 的浮点数,1.0 表示完全基于证据 |
多个原子问题可以针对同一个状态并行评估。
实验设计:怎么公平地比较评估器
比较评估器很困难——因为 Agent 的行为、检索到的数据或 trace 上下文在不同运行之间会变化。Deep Agents 和 LangSmith 让我们可以把单次 Agent 运行捕获成数据集,然后对每个模型重放。
为了测试 Jev,我们需要一个 Agent 来打分。我们用开源 Agent harness Deep Agents 构建了一个目标 Agent(天气 Agent),然后把测试集定义成 LangSmith 数据集,让每个评估器都能评估相同的内容。
对数据集中的每个示例,我们捕获天气 Agent 的响应,把完整输出作为固定示例存进 LangSmith。每个 judge 用两个信号评估捕获的五次运行:quality 和 does_pass。
为了把正确性(accuracy)和可重复性(repeatability)分开测量,我们让人类评审员按同一量规给每个固定响应打分。用人类评审的标签作为 oracle 分数,可以更深入地分析——准确率衡量的是与人类 oracle 的一致程度,方差衡量的是 judge 在完全相同的 Agent 行为上是否总能得出相同的判断。方差低不自动意味着准确率高,但低方差让准确率在生产中更可靠。
我们把 Jev 与 GPT-5.6 Luna、GPT-5.6 Terra 和 Claude Sonnet 4.6 对比,每种模型对 100 次重复计算逐例方差,并计算与人类 oracle 的一致程度。
实验结果:准确率、精度、成本与延迟
准确率(Accuracy)
用人类评审的标签作为本次对比的 oracle,我们计算了二进制 pass/fail 决策的准确率。
对于二进制的 does_pass 评分,Jev 在全部 500 次重复决策中都与 oracle 一致。Terra 在 99.8% 的决策上一致,Luna 96.4%,Claude 80.0%。
精度(Precision)
准确率告诉我们 judge 是否与人类 oracle 一致。精度问的是:当 Agent 行为不变时,它是否产出相同的质量分。我们用观测到的逐例方差来测量精度。
Jev 的观测平均逐例方差最低:0.0000149。Luna 高出 433 倍,Terra 高出 913 倍,Claude 高出 92 倍。
这个实验无法告诉我们为什么 Jev 的分数变化更小。一个假设是这些模型针对不同种类的输出做了优化——TypeSafe 把 Jev 描述为一个训练为返回校准后概率的决策模型。
成本与延迟
低成本意味着大规模运行 Agent 评估变得可行。当评估器调用昂贵时,团队不得不在覆盖率和预算之间做选择。
Jev 在本次实验中的调用成本为 0.00035 美元/次。作为对照,Claude judge 的总成本是 28.17 美元。
在线评估规模化解锁
对于一个每天产生 10,000 条 trace 的生产 Agent,观测到的单次调用成本会转化为有意义的运营差异。
为了判断一次低成本调用是否有用,我们定义 信号价值(signal value) = 二进制 oracle 一致性 × 二进制可重复性。可重复性指对同一条 trace 的两次独立调用返回相同判定结果的机会。这个指标奖励既准确又可重复的 judge。
像 Jev 这样高信号、低成本的 judge,可以在在线评估中解锁更好的价值:团队可以对更多生产 trace 生成反馈、更早发现质量变化、在质量下降时设置告警。
新的评估类型:在线评估解锁
今天,每一次 Agent 评估都带着权衡:多评估一些 Agent 运行、多评估一些维度、或多测试一些改动,测试成本就会增长。这迫使团队减少他们本应做的评估。
在我们的实验中,一次 Jev 判定成本 0.00035 美元。除了低成本,Jev 还提供了高准确率和低方差——意味着 judge 的结果可靠、高信号。一个高质量、低成本的 judge 意味着你可以更频繁地评估,让更多反馈进入开发循环。这对构建优秀 Agent 至关重要,因为它需要大量的测试和监控。
我们还需要看这次实验的结果能否推广到其他 Agent 和生产工作流。此外,低成本会放大错误——一个持续判错的评估器,可能低成本地产生大量错误反馈。
System One 风格的新模型,可能让高质量评估变得"充裕"。这能加速整个 Agent 开发生命周期:Agent 工程师可以把更多 trace 变成反馈、更早发现回归、更有信心地迭代。
复现信息
这个项目的 GitHub 仓库在这里。
我们通过 LangSmith Gateway 运行 LLM judge:GPT-5.6 Luna、GPT-5.6 Terra 和 Claude Sonnet 4.6。Jev 通过 langchain-typesafe==0.0.1a2 访问。
为复现,本次运行使用:Deep Agents 0.7.15、LangChain OpenAI 1.6.2、LangSmith 0.12.6、Tavily Python 0.8.3。我们没有给 LLM judge 设置 temperature、top-p、seed 或 max tokens,所以每次调用的输出可能有差异。
翻译后的几点解读
几个值得单独说的点:
这是 Jev 生态的一次重要背书。 LangChain 是最主流的 Agent 框架之一,LangSmith 是最主流的评估平台之一。他们用官方实验验证 Jev 作为评估器,说明 System One 模型在"决策类任务"上确实有立足之地——不只是我们之前聊的分类/路由,连"给 Agent 打分"这种评估任务也是它的主场。
"低成本会放大错误"这句要划重点。 原文作者很清醒:Jev 便宜到可以大规模跑评估,但如果它系统性判错,你会低成本地积累大量错误反馈。所以它不会取代 LLM judge 和人工评审,而是互补——Jev 适合大规模初筛、LLM judge 适合复杂推理判断、人工评审做最终 oracle。
这是单个窄实验。 原文反复强调"结果有前景但还早":一个天气 Agent、5 次捕获运行、4 个 judge。Jev 的 0.44 秒/0.00035 美元和低方差数据很漂亮,但要推广到其他 Agent 和生产工作流,还需要更多验证。复现代码已开源,想复现的可以直接跑。
想深入了解用 Jev 构建 Agent,LangChain 与 TypeSafe 团队在 9 月 22 日办了一场直播(Building a Harness with Jev)。
参考链接
- 原文:Can Jev Be a Better Agent Evaluator?(LangChain 博客) - Daniel Shea & Seán Roche,2026-09-20
- 复现代码:github.com/danielgshea/jev-as-a-judge - 本次实验的完整实现
- TypeSafe AI:Introducing System One Models and Jev - Jev 官方发布博客
- TypeSafe Docs:State 概念 - System One 模型输入的状态定义
- LangChain 直播:Building a Harness with Jev - 用 Jev 构建 Agent 的官方直播
- 我的 System One 拆解文章 - JEV、kev、laya 的架构与对比
你会把 Jev 这类决策模型接进评估链路吗?评论区聊聊你的看法,觉得有用点个赞让更多人看到。
作者: itech001 来源: 公众号:AI人工智能时代(the-ai-era) 网站: https://www.theaiera.top/ 关注每日最新AI新闻和技术博客,主页有更多的文章的AI 技术参考:https://www.theaiera.top
本文首发于 AI人工智能时代,转载请注明出处。