可观测性AI 评测LLMOpsAI 应用人工智能【免费下载链接】phoenixAI Observability Evaluation项目地址https://gitcode.com/gh_mirrors/phoenix13/phoenix点击查看免费下载Phoenix 是 Arize 开源的一个 AI 可观测性与评估平台用于对 LLM 应用进行实验、评测与故障排查。本指南以仓库根目录的 README.md 为主体结合 pyproject.toml、CLI 入口实现 与 serve 命令源码 等仓库证据系统讲解 Phoenix 的本地启动、应用追踪、数据集与实验、部署方式、包体系与生态集成帮助读者在本地或生产环境把 Phoenix 完整跑起来并融入 LLM 应用的开发与迭代流程。什么是 Arize PhoenixPhoenix 是一个开源、可自托管的 AI 可观测性平台围绕实验—评估—排查三个环节设计。它的工作方式是把应用运行时的详细日志trace发送到 Phoenix再通过评估测试对输出打分从而识别失败与回归同时支持基于真实生产样例迭代 Prompt并通过实验在相同输入上对比改动前后的效果。官方产品介绍见 docs/phoenix.mdx其中把这一闭环概括为从检查单次运行到基于证据改进质量。从仓库的 pyproject.toml 可以看到平台核心包名为arize-phoenix依赖了opentelemetry-sdk、opentelemetry-exporter-otlp、openinference-semantic-conventions、openinference-instrumentation等组件——这印证了 Phoenix 建立在 OpenTelemetry 之上、由 OpenInference 语义约定与插桩体系驱动的事实。Phoenix 提供以下核心能力Tracing追踪基于 OpenTelemetry 插桩追踪 LLM 应用的运行时行为详见 docs/phoenix/tracing/llm-traces.mdx。Evaluation评估借助 LLM 作为裁判对响应质量、检索相关性等进行基准评测详见 docs/phoenix/evaluation/evals.mdx。Datasets数据集创建带版本管理的示例数据集用于实验、评估与微调详见 docs/phoenix/datasets-and-experiments/overview-datasets.mdx。Experiments实验在相同输入上追踪并评估 Prompt、LLM 与检索链路的变化效果。PlaygroundPrompt 游乐场优化 Prompt、对比模型、调整参数、回放已追踪的 LLM 调用详见 docs/phoenix/prompt-engineering/overview-prompts.mdx。Prompt ManagementPrompt 管理通过版本控制、标签与实验系统化地管理和测试 Prompt 变更。PXIPhoenix Intelligence内置于 Phoenix 的 AI 工程 Agent用于调试 trace、迭代 Prompt 与操作产品详见 docs/phoenix/pxi.mdx。Remote MCP Server让 Claude Code、Cursor 等 MCP 客户端直接连接 Phoenix 实例的/mcp端点查询 trace、数据集、实验等详见 docs/phoenix/integrations/remote-mcp.mdx。README 特别强调Phoenix 与厂商和语言无关开箱即用地支持 OpenAI Agents SDK、Claude Agent SDK、LangGraph、Vercel AI SDK、Mastra、CrewAI、LlamaIndex、DSPy 等主流框架以及 OpenAI、Anthropic、Google GenAI、Google ADK、AWS Bedrock、OpenRouter、LiteLLM 等 LLM 提供商。自动插桩细节由 OpenInference 项目承载。本地运行三行命令启动完整平台README 给出的最小启动方式是安装arize-phoenix后直接运行phoenix servepip install arize-phoenix phoenix serve如果不想安装也可以用uvx免安装直接运行uvx arize-phoenix serve从 pyproject.toml 可以看到安装前提requires-python 3.10, 3.15即支持 Python 3.10 至 3.14。包的[project.scripts]段声明了两个命令入口都指向 src/phoenix/server/main.py 中的main()[project.scripts] arize-phoenix phoenix.server.main:main phoenix phoenix.server.main:main也就是说phoenix serve与arize-phoenix serve是等价的。CLI 子命令结构src/phoenix/server/main.py 使用argparse注册了三个子命令serve启动 Phoenix 服务默认命令db数据库相关操作datagen数据生成相关操作。在 serve 命令实现 中serve子命令还支持若干参数例如--host、--port、--grpc-port、--read-only只读模式、--debug、--dev开发模式配合前端 Vite 端口、--no-ui不提供 Web UI、--with-trace-fixtures预载示例 trace 数据集逗号分隔、--with-projects、--force-fixture-ingestion与--scaffold-datasets等。默认端口与端点从 src/phoenix/config.py 可以看到服务默认配置配置项默认值说明HOST0.0.0.0监听地址PORT6006Web UI / HTTP 服务端口HOST_ROOT_PATH部署根路径前缀GRPC_PORT4317OTLP gRPC 采集端口在 serve.py 的启动逻辑中服务启动时会输出以下关键地址Web UIhttp://localhost:6006REST APIhttp://localhost:6006/v1GraphQL APIhttp://localhost:6006/graphqlOTLP HTTP 采集端点http://localhost:6006/v1/tracesOTLP gRPC 采集端点http://localhost:4317MCP 端点http://localhost:6006/mcp默认挂载可用环境变量关闭如果通过 Kubernetes 部署时遇到PHOENIX_PORT被自动注入为tcp://IP:PORT形式导致启动报错config.py 会在校验时给出明确提示要求显式设置为整数。在 Notebook 中启动除了 CLIPhoenix 也面向 Jupyter/Colab 等 Notebook 环境提供了 Python API。在 src/phoenix/init.py 中导出了launch_app、active_session、close_app、delete_all、load_example_traces、TraceDataset等符号。其中Session类见 src/phoenix/session/session.py维护与 Phoenix App 的一对一共享状态支持view()在 Notebook 内嵌 iframe 展示 UI并自动识别 Colab、SageMaker、Databricks 等 Notebook 环境NotebookEnvironment枚举。load_example_traces可用于加载内置示例 trace 快速体验。让应用上报 Trace从自动化插桩开始README 推荐的最快上手方式是利用编码 AgentClaude Code、Codex、Cursor 等自动完成插桩。在项目目录中执行npx arizeai/phoenix-cli setup # 或已安装 Phoenix 时px setupsetup会检测你的框架与 LLM 提供商安装对应的 OpenInference 插桩并配置好 trace 导出。该 CLI 对应的 TypeScript 包位于 js/packages/phoenix-cli其职责是获取 traces、datasets 和 experiments 供 Claude Code、Cursor 等编码 Agent 使用。如果偏好手写代码接入可参考 docs/phoenix/get-started/get-started-tracing.mdxPython与 docs/phoenix/get-started/ts-get-started-tracing.mdxTypeScript。仓库还提供了大量可直接运行的示例例如examples/agentstau_bench 与 traject_bench 基准上的 LangGraph / OpenAI Agents 多 Agent 示例examples/rag_agentRAG Agent 的追踪与评估示例examples/code_gen_agent、examples/computer_use_agent代码生成与电脑操作类 Agent 示例tutorials/tracing覆盖 LangChain、LlamaIndex、OpenAI、Anthropic、DSPy、CrewAI、Autogen、Smolagents 等框架的 Notebook 教程。这些示例展示了 Phoenix 与各类框架组合的完整接入形态适合作为二次开发的起点。用 Evaluations 度量输出质量追踪解决了运行时发生了什么评估则回答输出是否正确。Phoenix 支持基于 LLM 的评估运行预置或自定义评估器对数据打分预置指标见 docs/phoenix/evaluation/pre-built-metrics.mdx数据集评估器将评估器挂到数据集上使其在实验时自动运行第三方评估器集成可接入 Ragas、Deepeval、Cleanlab 等生态人工标注直接在 UI 中为 trace 附加 ground truth 标签。对应的 Python 评估工具库是arize-phoenix-evals源码位于 packages/phoenix-evalsTypeScript 版本为arizeai/phoenix-evals见 js/packages/phoenix-evals。仓库还内置了大量分类评估器的 Prompt 配置模板见 prompts/classification_evaluator_configs涵盖完整度、简洁度、正确性、文档相关性、事实一致性、幻觉、PII 检测、拒绝回答、检索相关性、工具调用、工具响应处理、工具选择、毒性、用户摩擦等维度可直接用于配置 LLM-as-a-judge 评估。此外Phoenix 还支持在托管沙箱如 E2B、Daytona、Vercel Sandbox、Modal中运行代码评估器code evaluators以获得内核级隔离与运行时依赖安装能力详见 docs/phoenix/evaluation/server-evals。数据集与实验用相同输入对比改动数据集与实验是 Phoenix 中基于证据改进的关键环节。整体工作流见 docs/phoenix/get-started.mdx为追踪 → 评估 → Prompt 迭代 → 实验对比。创建数据集将 trace 分组为数据集或从代码 / CSV 上传见 docs/phoenix/datasets-and-experiments/overview-datasets.mdx。运行实验把同一份输入跑在不同版本的应用上再对比评估结果确认改动是否真正提升了性能见 docs/phoenix/datasets-and-experiments/how-to-experiments.mdx。Prompt 管理对 Prompt 做版本控制、打标签并通过实验系统性测试变更。仓库中 tutorials/experiments 提供了数据集与实验快速上手、自建评估 harness、合成数据集生成、带重复次数的实验等 Notebook可以直接照着跑。生产部署Docker、Kubernetes 与云平台Phoenix 可以在本地、容器化环境或云端运行README 给出了多种部署路径完整说明见 docs/phoenix/self-hosting.mdx 与 docs/phoenix/environments.mdx。Docker 与 Docker Compose仓库根目录提供 Dockerfile 与 docker-compose.yml官方镜像发布在 Docker Hub 的arizephoenix/phoenix。镜像相关启动片段也沉淀在文档片段 docs/snippets/launch-phoenix-docker.mdx 与 docs/snippets/launch-phoenix-self-host.mdx 中。Kubernetes 与 Helm仓库提供了完整的 Helm Charthelm/Chart.yaml、helm/values.yaml 与 helm/templates以及 Kustomize 清单kustomize/base/phoenix.yaml、kustomize/base/postgres.yaml支持在 Kubernetes 上以 PostgreSQL 为后端存储进行部署。云平台一键部署README 提供了 Railway、Render、Google Cloud Run、Azure 与 AWS 的一键部署入口。其中两个注意事项需要特别说明Google Cloud 按钮是在 Cloud Shell 中从源码构建 Phoenix而非直接部署预构建的 Docker Hub 镜像Azure 模板仅提供明文 HTTPAzure Container Instances 不终止 TLS生产环境需在前面加 TLS 代理如 Application Gateway。关键配置数据库与工作目录config.py 中定义了PHOENIX_SQL_DATABASE_URL环境变量控制 trace 与评估数据的存储后端SQLitesqlite:///path/to/database.db默认使用存放在工作目录中。README 建议若用 SQLite 应使用持久化卷并把PHOENIX_WORKING_DIR指向该卷PostgreSQLpostgresql://user:passwordhost/dbname。此外还支持PHOENIX_SQL_DATABASE_READ_REPLICA_URL配置 PostgreSQL 只读副本当设置后只读查询dataloader、query resolver、只读 REST 端点会路由到副本SQLite 部署下该配置会被忽略见 serve.py 中_create_db_session_factory的实现逻辑。其他常用环境变量包括PHOENIX_HOST、PHOENIX_PORT、PHOENIX_GRPC_PORT、PHOENIX_HOST_ROOT_PATH、PHOENIX_PROJECT_NAME、PHOENIX_WORKING_DIR、PHOENIX_COLLECTOR_ENDPOINT远程实例必须设置指定 trace 和评估的上报端点等完整定义见 src/phoenix/config.py。包体系完整平台 轻量子包arize-phoenix包含完整的 Phoenix 平台。如果你已经部署了平台还可以搭配以下轻量级子包使用Python 子包包说明arize-phoenix-otel对 OpenTelemetry 原语做轻量封装内置 Phoenix 友好的默认配置arize-phoenix-client通过 OpenAPI REST 接口与 Phoenix 服务交互的轻量客户端arize-phoenix-evals评估工具库包含 RAG 相关性、答案相关性等预置评估TypeScript 子包包说明arizeai/phoenix-otelOpenTelemetry 原语封装TypeScriptarizeai/phoenix-clientArize Phoenix API 客户端arizeai/phoenix-evalsLLM 应用评估库alpha 版本arizeai/phoenix-mcp独立 stdio MCP 服务器面向旧版 Phoenix维护模式已被内置的 Remote MCP Server 取代arizeai/phoenix-cli拉取 traces、datasets 与 experiments 的 CLI供 Claude Code、Cursor 等编码 Agent 使用生态集成从框架到平台Phoenix 基于 OpenTelemetry因此天然具备厂商、语言、框架无关的特性。README 列出了一张庞大的集成清单核心是各语言的 OpenInference 插桩包Python 集成覆盖 OpenAI、OpenAI Agents、LlamaIndex、DSPy、AWS Bedrock、LangChain、LangGraph、MistralAI、Cohere、Together AI、Ollama、Google GenAI、Google ADK、CrewAI、LiteLLM、Anthropic、Pydantic AI、Claude Agent SDK 等数十个框架与提供商JavaScript 集成OpenAI、OpenAI Agents、LangChain.js、Vercel AI SDK、Mastra、MCP、Claude Agent SDK 等Java 集成LangChain4j、SpringAI、Google ADK 等Go 集成OpenAI 与 Anthropic 的插桩包Span Processorsopeninference-instrumentation-openlit与openinference-instrumentation-openllmetry用于把 OpenLIT 与 OpenLLMetryTraceloop的 trace 归一化转换为 OpenInference 数据平台集成BeeAI、Dify、Envoy AI Gateway、LangFlow、LiteLLM Proxy、Flowise、Prompt Flow、NVIDIA NeMo、Graphite 等见 docs/phoenix/integrations.mdx。这些插桩与评估集成的示例代码与 Notebook 在 examples 与 tutorials 目录中均有落地可作为理解各框架接入方式的参考。面向人与编码 Agent 的三类接口Phoenix 的定位是既给人用也给 AI 编码 Agent 用README 归纳了三类接口CLInpx arizeai/phoenix-cli可拉取 traces、datasets、experiments并通过setup为应用插桩让 Agent 能在终端获取上下文并行动Skills以技能包形式把如何用 Phoenix 调试、评估、追踪的工作流封装起来供 Claude Code 等 Agent 使用。本仓库在 plugins/claude/arize-phoenix 与 plugins/codex/arize-phoenix 中提供了面向 Claude 与 Codex 的插件/技能定义Remote MCP Server任何 MCP 客户端都可以连接 Phoenix 实例的/mcp端点直接查询 Phoenix说明见 docs/phoenix/integrations/remote-mcp.mdx。从 config.py 可以看到内置 MCP 服务器默认挂载在/mcpPHOENIX_ENABLE_MCP_SERVER默认 True并复用 Phoenix 已有的 bearer token 认证PHOENIX_ENABLE_MCP_CODE_MODE控制是否以 FastMCP 的 code-mode 形式暴露工具默认 True此时客户端会看到搜索、取 schema、标签、工具列表等元工具外加一个在沙箱中执行 LLM 编写 Python 代码的execute工具。安全、隐私与遥测README 明确了两点数据安全是重点安全与隐私细节见 docs/phoenix/self-hosting/security遥测默认情况下 Phoenix 会收集基础的 Web 分析数据如页面浏览量、UI 交互但不会收集任何 trace 数据、评估结果或其他敏感信息。可通过设置环境变量关闭遥测PHOENIX_TELEMETRY_ENABLEDfalse从 config.py 的实现看PHOENIX_TELEMETRY_ENABLED是遥测像素FullStory 与 Scarf.sh的总开关置为 False 时两者都会关闭默认值为 True。此外PHOENIX_FULLSTORY_ORG与PHOENIX_SCARF_SH_PIXEL_ID分别控制两类分析的启用。迁移、许可与后续阅读破坏性变更升级前请查阅 MIGRATION.md 中的迁移指南许可证本项目采用 Elastic License 2.0ELv2版权归 Arize AI 所有部分代码受美国专利保护详见 LICENSE 与 IP_NOTICE更多阅读仓库的 docs/phoenix 目录包含追踪、评估、Prompt 工程、数据集与实验、自托管、SDK API 参考等全套文档tutorials 与 examples 提供了可运行的 Notebook 与示例应用docs/phoenix/cookbook.mdx 整理了各类实战配方Agent 工作流模式、评估、Guardrails、追踪等。整体来看Phoenix 提供了一条从看清运行过程到度量输出质量再到用实验验证改动的完整链路本地用两条命令即可启动通过phoenix serve暴露 Web UI、OTLP 采集、GraphQL/REST API 与 MCP 端点生产环境则可基于 Docker、Helm/Kubernetes 与 PostgreSQL 做可扩展部署配套的 Python 与 TypeScript 子包、庞大的 OpenInference 插桩生态以及面向编码 Agent 的 CLI/Skills/MCP 三类接口使其可以融入从个人开发到企业级 Agent 应用的全生命周期。赞分享可观测性AI 评测LLMOpsAI 应用人工智能【免费下载链接】phoenixAI Observability Evaluation项目地址https://gitcode.com/gh_mirrors/phoenix13/phoenix点击查看免费下载相关推荐Phoenix AI 可观测性平台实战指南基于 OpenTelemetry 的 LLM 追踪、评估与生产监控AI-Research-SKILLsPhoenix AI 可观测性平台实战指南基于 OpenTelemetry 的 LLM 追踪、评估与生产监控AI Research SKILLs PhoeAI 技能人工智能大模型深度学习10个必学的Python AI应用从实验追踪到生产部署的完整指南10个必学的Python AI应用从实验追踪到生产部署的完整指南 GitHub推荐项目精选aw/awesome python applications是一文档知识库Phoenix Client 实验ExperimentsAPI 完整指南从任务运行到评估的实践与源码解析Phoenix Client 实验ExperimentsAPI 完整指南从任务运行到评估的实践与源码解析 本文围绕 Phoenix 的 Python 客户可观测性AI 评测LLMOpsAI 应用人工智能上一篇4个免费专利API盘点零成本搭建知识产权查询系统完整指南下一篇从真人舞步到虚拟偶像OpenMMD如何用AI技术重塑3D动画创作创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
