Opik:Comet 开源的 LLM 可观测性与评测平台,2.2 万星,Agent 追踪 + 评测 + 优化一体
做 LLM 应用的人迟早需要一个"观测 + 评测"平台——看 Agent 每一步干了什么、评估输出好不好、上线后监控质量。这个赛道有 Langfuse、LangSmith、LangWatch,而 Comet 的开源方案 Opik 是其中发展最快的之一:2.2 万星、Apache-2.0 全量开源、2.2.71 版本(本周刚更新)。
仓库地址:https://github.com/comet-ml/opik
我此前写过它和 Langfuse 的对比(逐行核对 Comet 官方对比页),那篇是从"选型"角度。这篇正面介绍 Opik 本身:它是什么、能做什么、怎么用、以及它和竞品的差异。
本文 outline
- Opik 是什么:LLM 观测、评测与 Agent 追踪一体
- 快速上手:5 行代码开始追踪
- 核心能力:追踪、评测、Prompt 管理、监控
- 独有档:Agent Optimizer(自动优化)
- 独有档:Ollie、Guardrails、Test Suites
- 生态集成与部署
- 与 Langfuse / LangSmith 的差异
- 适用场景与选型建议
1. Opik 是什么:LLM 观测、评测与 Agent 追踪一体
Opik 是 Comet(老牌 MLOps 公司)开源的 LLM 可观测性与评测平台,官方定位:"Open-Source LLM Observability, Evaluation & AI Agent Tracing"——AI Agent 追踪、LLM 评测、Prompt 管理、生产监控。
硬数据:
| 指标 | 值 |
|---|---|
| GitHub 星 | 22,157(2026-09-20) |
| 许可证 | Apache-2.0(全量开源) |
| 主语言 | Python(SDK),Java 后端 |
| 创建时间 | 2023-05 |
| 最新版本 | 2.2.71(2026-09-19) |
| 定位 | Agent 追踪 + 评测 + Prompt 管理 + 生产监控 |
它的核心主张和 Langfuse 一样是"开源 + 可自托管",但有几个独有功能(Agent Optimizer、Ollie、Guardrails)让它差异化——下面细讲。
2. 快速上手:5 行代码开始追踪
Opik 的上手路径极简,@track 装饰器是核心:
pip install opik
opik configure # 配置(云或本地)
from opik import track
@track
def my_llm_function(user_question: str) -> str:
# 你的 LLM 代码
return "Hello"每次调用 my_llm_function 都被记录到 Opik——输入、输出、耗时、错误。本地模式更简单:
import opik
opik.configure(use_local=True) # 本地跑,连本地 server
@opik.track
def my_llm_function(user_question: str) -> str:
return "Hello"@track 可以和任意集成组合,也能追踪嵌套函数调用(一个函数调另一个,形成 span 树)。OpenAI SDK 有 drop-in wrapper(from opik.openai import openai),跟 Langfuse 一样一行替换。
3. 核心能力:追踪、评测、Prompt 管理、监控
追踪(Tracing):记录每次 LLM 调用、工具调用、Agent 步骤,形成 trace/span 树。支持 OpenAI SDK wrapper、框架集成(LangChain、LlamaIndex、CrewAI、Haystack、DSPy 等 60+)、OpenTelemetry。
评测(Evaluation):这是 Opik 的强项。Datasets + Experiments 结构,支持两类指标:
- 启发式指标:21 个内置(Equals、Contains、RegexMatch、IsJson、Levenshtein 等)
- LLM-as-a-Judge:22 个内置(Hallucination、Moderation、AnswerRelevance、ContextRecall、ContextPrecision 等 RAG 指标)
Prompt 管理:版本化、可回滚、可测试。
生产监控:可扩展看板、在线评测规则(自动化规则在 trace/span/thread 级别跑 LLM-judge 和自定义 Python 指标)。
CI/CD 评测:PyTest 集成,每次 commit 跑 LLM 管线测试——把评测放进开发流程。
4. 独有档:Agent Optimizer(自动优化)
这是 Opik 区别于 Langfuse/LangSmith 的最实质功能(我在对比文章里详细写过):自动优化 Prompt 和 Agent 的 SDK(opik-optimizer),六种算法统一在一个 optimize_prompt() API 下:
- GEPA:遗传-帕累托反射式优化(官方推荐默认起点)
- HRPO:层级反射优化,对失败案例做根因分析后改写 Prompt
- Few-shot Bayesian:基于 Optuna 挑选最优 few-shot 示例
- Evolutionary:遗传算法,多目标 + LLM 变异交叉
- MetaPrompt:LLM 自我批评式迭代,还能优化 MCP 工具签名
- Parameter:贝叶斯搜索调 temperature/top_p
用你自己的数据集和指标当适应度函数,让算法自动搜索更好的 Prompt 变体,没有人在环。这不只是"评测平台",而是"从发现问题到自动改进"的闭环。
5. 独有档:Ollie、Guardrails、Test Suites
Ollie(AI 诊断助手):内嵌的对话式 AI 助手,读取 span 树、诊断根因、对比失败/成功运行。配 opik connect CLI 可以读源码文件、提议 diff(用户批准后应用)、用原始 trace 输入重跑 Agent、把失败 trace 转成回归测试——"调试 → 修复 → 验证"闭环。
Guardrails:独立模块,用于实现安全负责任的 AI 实践——策略、自定义护栏、prompt 注入检测、生产网关护栏(含匿名化/PII)。
Test Suites:单元测试风格的 pass/fail 断言,自动创建数据集和单个 LLM 评测指标。
线程级评测(Thread-level evaluation):evaluate_threads 评测多轮对话,含会话级指标(ConversationalCoherence、UserFrustration 等)。
6. 生态集成与部署
SDK:Python(pip install opik)、TypeScript/JavaScript,加 OpenTelemetry 端点。
框架集成(60+):LangChain、LangGraph、LlamaIndex、CrewAI、OpenAI(含 Agents SDK)、Anthropic、Google ADK、Gemini、Bedrock、LiteLLM、Haystack、DSPy、Pydantic AI、Ragas、Dify、n8n、Flowise 等。
Coding Agent 接入:一条命令让 Claude Code、Cursor、VS Code Copilot、Codex、opencode 读取 trace、给输出打分、从聊天里跑评测——Agent 开发过程本身可观测。
部署:
- 自托管:
./opik.sh脚本(Linux/Mac)或opik.ps1(Windows)一键起 Docker Compose,K8s 有 Helm chart。全平台免费、Apache-2.0 - Comet Cloud:免费档(无需信用卡)+ 企业版(SOC 2、SSO、VPC/on-prem)
7. 与 Langfuse / LangSmith 的差异
结合我之前写的两篇对比,三家定位差异:
| 维度 | Opik | Langfuse | LangSmith |
|---|---|---|---|
| 开源 | Apache-2.0 全量 | MIT 核心 + 企业目录 | 闭源(SDK 开源) |
| 自托管 | 免费全功能 | 免费全功能 | 企业版才有 |
| Agent Optimizer | ✅ 独有 | ❌ | ❌ |
| Ollie AI 诊断 | ✅ 独有 | ❌ | ❌(Engine 近似) |
| Guardrails | ✅ 独有 | ❌ | ❌ |
| 评测指标 | 21 启发 + 22 LLM-judge | 有 | 有 |
| 生态 | 框架无关(60+) | 框架无关(100+) | LangChain 深度 |
一句话:LangSmith 深度绑定 LangChain 生态;Langfuse 社区最大、集成最广;Opik 的差异点在"自动化"——Agent Optimizer 自动优化 Prompt、Ollie 自动诊断、Guardrails 安全护栏。如果你想要的不只是"看"和"评",而是"自动改进",Opik 是三者里唯一提供完整闭环的。
8. 适用场景与选型建议
适合 Opik 的团队:
- 想要全量开源、数据完全自控(Apache-2.0 无企业功能围墙)
- 想要自动 Prompt 优化(Agent Optimizer 独此一家)
- 想要安全护栏 + AI 诊断(Guardrails + Ollie)
- 用 Claude Code/Codex 做开发,想让开发过程本身可观测
- 需要框架无关(不绑定 LangChain)
选型建议:
- 快速开始、要开源自托管 → Opik 或 Langfuse(Opik 优化/护栏更强,Langfuse 社区更大)
- 深度 LangChain 生态 → LangSmith
- 想要自动优化闭环 → Opik 是唯一选择
一个提醒:Opik 的更新节奏极快(一个月多个 release),功能面持续扩张,生产使用建议锁定版本。但这也是它的优势——它是这个赛道迭代最快的开源方案之一。
参考
- comet-ml/opik GitHub — 2.2 万星,Apache-2.0,2.2.71
- Opik 文档 — 快速上手、评测、Agent Optimizer、Ollie
- 前篇:Langfuse vs Opik 对比 — 逐行核对 Comet 官方对比页
- 前篇:Langfuse 和 LangSmith 对比 — 三家生态全景
- 前篇:Langflow LLM Tracing — Opik 作为 Langflow 集成之一
作者: itech001 来源: 公众号:AI人工智能时代(the-ai-era) 网站: https://www.theaiera.top/ 关注每日最新AI新闻和技术博客,主页有更多的文章的AI 技术参考:https://www.theaiera.top
关注公众号,获取更多 AI 技术干货!