返回博客列表

Jev 能成为更好的 Agent 评估器吗?LangChain 用 LangSmith 做的实测翻译

2026-09-24T16:30:00+08:00
JevLangChainLangSmithAgentEval评测System One

Jev 能成为更好的 Agent 评估器吗?LangChain 用 LangSmith 做的实测翻译

这篇是 LangChain 官方博客的全文翻译,配了上下文解读。

昨天我们刚拆过 System One 模型 JEV 的架构,今天 LangChain 就发了一篇用它做 Agent 评估器的实测。结论很有意思:Jev 在连续评分上的一致性比 GPT-5.6 Luna、Terra 和 Claude Sonnet 4.6 好一到两个数量级,而且最快最便宜——平均 0.44 秒、每次调用 0.00035 美元,整个实验花了 0.34 美元,而 Claude 要 28.17 美元。

这篇翻译忠实保留了原文的全部数据、实验设计和结论,文末附我的几点解读。

本文提纲

  1. 核心要点(Key Takeaways)
  2. 为什么 Jev 可能是个好的 Agent 评估器
  3. Jev 是什么:三种问题类型
  4. 实验设计:怎么公平地比较评估器
  5. 实验结果:准确率、精度、成本与延迟
  6. 新的评估类型:在线评估解锁
  7. 复现信息
  8. 翻译后的几点解读

核心要点

  • Jev 是一种根本不同的评估器。 它直接返回类型化答案,而不是像 LLM judge 那样生成文本。
  • Jev 在连续评分上的一致性显著更好。 它的质量分方差比 GPT-5.6 Luna、Terra 和 Claude Sonnet 4.6 低 92–913 倍。
  • Jev 也是最快、最便宜的。 平均 0.44 秒、每次调用 0.00035 美元(总计 0.34 美元,而 Claude 要 28.17 美元)。
  • 结果有前景,但还早。 尽管这是一次范围很窄的测试,Jev 的表现指向了 Agent 评估的一个有说服力的新方向。

为什么 Jev 可能是个好的 Agent 评估器

如今的 Agent 评估有两种形态:基于代码(code-based)和 LLM 当裁判(LLM-as-a-judge)。两者各有局限:基于代码的评估器只能用于输入固定的一小类问题,而 LLM judge 是天然非确定性的系统——作为测试基础设施,这不是一个稳固的基础。

看到 TypeSafe AI 的 Jev 后,我们想知道这个 "System One" 模型是否会成为 Agent 评估的第三种形态,以及它可能对 Agent 工程产生什么影响。

Jev 是什么:三种问题类型

Jev 是 TypeSafe AI 发布的新模型。它其实不是传统 LLM——它不生成文本。TypeSafe 团队称之为 "System One" 模型:

System One 模型是一类为快速、结构化决策而构建的 AI 模型,软件可以直接使用其结果。System One 模型评估一个状态(state),返回类型化答案和概率。

根据 TypeSafe 的说法,这让 Jev 比 LLM 更快更便宜——在分类任务上,推理速度最高快 200 倍、成本最高低 400 倍。

Jev 支持三种类型的问题:

类型 说明 示例
Choice(选择) 从选项中选一个,返回概率和置信度 "哪个搜索结果最能描述这次运行?" 返回 searched_appropriately / searched_unnecessarily / failed_to_search 之一,附概率和置信度
Score(评分) 按有序量规给答案打分,返回概率和置信度 "这个答案有多有用?" 返回从 unhelpful 到 highly useful 的量规分,附概率和置信度
Noul(是非) 返回一个是非判断为真的概率 "最终答案是否基于检索到的证据?" 返回 0.0 到 1.0 的浮点数,1.0 表示完全基于证据

多个原子问题可以针对同一个状态并行评估。

实验设计:怎么公平地比较评估器

比较评估器很困难——因为 Agent 的行为、检索到的数据或 trace 上下文在不同运行之间会变化。Deep Agents 和 LangSmith 让我们可以把单次 Agent 运行捕获成数据集,然后对每个模型重放。

为了测试 Jev,我们需要一个 Agent 来打分。我们用开源 Agent harness Deep Agents 构建了一个目标 Agent(天气 Agent),然后把测试集定义成 LangSmith 数据集,让每个评估器都能评估相同的内容。

对数据集中的每个示例,我们捕获天气 Agent 的响应,把完整输出作为固定示例存进 LangSmith。每个 judge 用两个信号评估捕获的五次运行:quality 和 does_pass。

为了把正确性(accuracy)和可重复性(repeatability)分开测量,我们让人类评审员按同一量规给每个固定响应打分。用人类评审的标签作为 oracle 分数,可以更深入地分析——准确率衡量的是与人类 oracle 的一致程度,方差衡量的是 judge 在完全相同的 Agent 行为上是否总能得出相同的判断。方差低不自动意味着准确率高,但低方差让准确率在生产中更可靠。

我们把 Jev 与 GPT-5.6 Luna、GPT-5.6 Terra 和 Claude Sonnet 4.6 对比,每种模型对 100 次重复计算逐例方差,并计算与人类 oracle 的一致程度。

实验结果:准确率、精度、成本与延迟

准确率(Accuracy)

用人类评审的标签作为本次对比的 oracle,我们计算了二进制 pass/fail 决策的准确率。

对于二进制的 does_pass 评分,Jev 在全部 500 次重复决策中都与 oracle 一致。Terra 在 99.8% 的决策上一致,Luna 96.4%,Claude 80.0%。

精度(Precision)

准确率告诉我们 judge 是否与人类 oracle 一致。精度问的是:当 Agent 行为不变时,它是否产出相同的质量分。我们用观测到的逐例方差来测量精度。

Jev 的观测平均逐例方差最低:0.0000149。Luna 高出 433 倍,Terra 高出 913 倍,Claude 高出 92 倍。

这个实验无法告诉我们为什么 Jev 的分数变化更小。一个假设是这些模型针对不同种类的输出做了优化——TypeSafe 把 Jev 描述为一个训练为返回校准后概率的决策模型。

成本与延迟

低成本意味着大规模运行 Agent 评估变得可行。当评估器调用昂贵时,团队不得不在覆盖率和预算之间做选择。

Jev 在本次实验中的调用成本为 0.00035 美元/次。作为对照,Claude judge 的总成本是 28.17 美元。

在线评估规模化解锁

对于一个每天产生 10,000 条 trace 的生产 Agent,观测到的单次调用成本会转化为有意义的运营差异。

为了判断一次低成本调用是否有用,我们定义 信号价值(signal value) = 二进制 oracle 一致性 × 二进制可重复性。可重复性指对同一条 trace 的两次独立调用返回相同判定结果的机会。这个指标奖励既准确又可重复的 judge。

像 Jev 这样高信号、低成本的 judge,可以在在线评估中解锁更好的价值:团队可以对更多生产 trace 生成反馈、更早发现质量变化、在质量下降时设置告警。

新的评估类型:在线评估解锁

今天,每一次 Agent 评估都带着权衡:多评估一些 Agent 运行、多评估一些维度、或多测试一些改动,测试成本就会增长。这迫使团队减少他们本应做的评估。

在我们的实验中,一次 Jev 判定成本 0.00035 美元。除了低成本,Jev 还提供了高准确率和低方差——意味着 judge 的结果可靠、高信号。一个高质量、低成本的 judge 意味着你可以更频繁地评估,让更多反馈进入开发循环。这对构建优秀 Agent 至关重要,因为它需要大量的测试和监控。

我们还需要看这次实验的结果能否推广到其他 Agent 和生产工作流。此外,低成本会放大错误——一个持续判错的评估器,可能低成本地产生大量错误反馈。

System One 风格的新模型,可能让高质量评估变得"充裕"。这能加速整个 Agent 开发生命周期:Agent 工程师可以把更多 trace 变成反馈、更早发现回归、更有信心地迭代。

复现信息

这个项目的 GitHub 仓库在这里。

我们通过 LangSmith Gateway 运行 LLM judge:GPT-5.6 Luna、GPT-5.6 Terra 和 Claude Sonnet 4.6。Jev 通过 langchain-typesafe==0.0.1a2 访问。

为复现,本次运行使用:Deep Agents 0.7.15、LangChain OpenAI 1.6.2、LangSmith 0.12.6、Tavily Python 0.8.3。我们没有给 LLM judge 设置 temperature、top-p、seed 或 max tokens,所以每次调用的输出可能有差异。

翻译后的几点解读

几个值得单独说的点:

这是 Jev 生态的一次重要背书。 LangChain 是最主流的 Agent 框架之一,LangSmith 是最主流的评估平台之一。他们用官方实验验证 Jev 作为评估器,说明 System One 模型在"决策类任务"上确实有立足之地——不只是我们之前聊的分类/路由,连"给 Agent 打分"这种评估任务也是它的主场。

"低成本会放大错误"这句要划重点。 原文作者很清醒:Jev 便宜到可以大规模跑评估,但如果它系统性判错,你会低成本地积累大量错误反馈。所以它不会取代 LLM judge 和人工评审,而是互补——Jev 适合大规模初筛、LLM judge 适合复杂推理判断、人工评审做最终 oracle。

这是单个窄实验。 原文反复强调"结果有前景但还早":一个天气 Agent、5 次捕获运行、4 个 judge。Jev 的 0.44 秒/0.00035 美元和低方差数据很漂亮,但要推广到其他 Agent 和生产工作流,还需要更多验证。复现代码已开源,想复现的可以直接跑。

想深入了解用 Jev 构建 Agent,LangChain 与 TypeSafe 团队在 9 月 22 日办了一场直播(Building a Harness with Jev)。

参考链接

你会把 Jev 这类决策模型接进评估链路吗?评论区聊聊你的看法,觉得有用点个赞让更多人看到。


作者: itech001 来源: 公众号:AI人工智能时代(the-ai-era) 网站: https://www.theaiera.top/ 关注每日最新AI新闻和技术博客,主页有更多的文章的AI 技术参考:https://www.theaiera.top

本文首发于 AI人工智能时代,转载请注明出处。

分享给朋友