尧图网络科技YAOTU DIGITAL 获取报价
获取报价
首页 / 资讯中心 / 文章详情

Xinference Grafana 监控面板完全指南:6 大子面板、DCGM Exporter 与 Prometheus 部署实战

发布时间:2026/9/17 8:57:41

资讯中心
01
ARTICLE

Xinference Grafana 监控面板完全指南:6 大子面板、DCGM Exporter 与 Prometheus 部署实战

Xinference Grafana 监控面板完全指南:6 大子面板、DCGM Exporter 与 Prometheus 部署实战
Xinference Grafana 监控面板完全指南6 大子面板、DCGM Exporter 与 Prometheus 部署实战【免费下载链接】inferenceSwap GPT for any LLM by changing a single line of code. Xinference lets you run open-source, speech, and multimodal models on cloud, on-prem, or your laptop — all through one unified, production-ready inference API.项目地址: https://gitcode.com/GitHub_Trending/in/inferenceXinference 在monitor/dashboard/目录下提供了预构建的 Grafana 监控面板Dashboard用于对 Xinference 推理集群进行生产级可观测性监控。本文以仓库中实际提供的 README_zh-CN.md 为骨架结合面板 JSON、DCGM Exporter 配置与 metrics.py 中的指标定义源码完整讲解 6 个子面板的用途与关键指标、面板导入的两种方式、DCGM Exporter 与 Prometheus 的部署步骤以及 Monitoring V2.1 新增的 Token Router Dashboard。读完本文你将掌握在一套 Grafana Prometheus node_exporter DCGM Exporter 技术栈上从零搭建 Xinference 集群监控体系并读懂每个面板背后指标的完整能力。一、监控面板概览按受众组织的 6 个聚焦子面板Xinference 的监控面板不是单一巨型 Dashboard而是按受众与使用场景拆分为 6 个聚焦子面板分别面向 SRE/平台、ML Ops/算力运维、业务与 SecOps 等不同角色。这避免了一个面板什么都放、谁都不好读的问题每个面板只回答一类核心问题。面板UID文件名模式主要受众集群概览xinference-overviewxinference-grafana-dashboard-overview-{lang}.jsonSRE / 平台模型负载xinference-model-loadxinference-grafana-dashboard-model-load-{lang}.jsonML Ops / 算力运维LLM 推理 SLOxinference-llm-sloxinference-grafana-dashboard-llm-slo-{lang}.jsonML Ops / 业务GPU 资源xinference-gpu-resourcesxinference-grafana-dashboard-gpu-resources-{lang}.jsonSRE / 算力运维主机资源xinference-host-resourcesxinference-grafana-dashboard-host-resources-{lang}.jsonSRE安全审计xinference-security-auditxinference-grafana-dashboard-security-audit-{lang}.jsonSecOps每个子面板均提供 4 种语言版本en、ja、ko、zh-CNToken Router Dashboard 的简体中文版文件名为...-zh.json对应仓库目录结构如下monitor/dashboard/overview/monitor/dashboard/model-load/monitor/dashboard/llm-slo/monitor/dashboard/gpu-resources/monitor/dashboard/host-resources/monitor/dashboard/security-audit/monitor/dashboard/token-router/除 24 个面板 JSON 文件6 面板 × 4 语言外该目录还包含两个配套文件文件说明dcgm-custom-metrics.csv自定义 DCGM Exporter 指标配置含简体中文注释版 dcgm-custom-metrics.zh-CN.csvdcgm-exporter.ymlDCGM Exporter 的 Docker Compose 服务定义二、快速开始把面板导入 Grafana2.1 手动导入手动导入适合单机验证或不想动 Grafana 配置文件的场景打开 Grafana → Dashboards → Import上传或粘贴面板文件内容例如 xinference-grafana-dashboard-overview-zh-CN.json选择你的 Prometheus 数据源点击 Import对 6 个子面板重复以上步骤。2.2 自动 Provisioning推荐生产环境推荐使用 Grafana Provisioning 机制自动管理面板。创建provisioning/dashboards/xinference.yml内容如下与 README 中给出的配置一致apiVersion: 1 providers: - name: xinference orgId: 1 folder: Xinference type: file disableDeletion: false updateIntervalSeconds: 30 options: path: /path/to/monitor/dashboard foldersFromFilesStructure: false将所有面板 JSON 文件放在options.path配置的路径下Grafana 会按updateIntervalSeconds: 30的间隔自动扫描目录自动导入并持续同步更新——后续升级面板 JSON 文件后无需手动重新导入。三、部署 DCGM ExporterGPU 硬件监控GPU 硬件层面的指标温度、功耗、PCIe 错误、时钟等需要 NVIDIA 官方 DCGM Exporter 采集。仓库在 dcgm-exporter.yml 中提供了开箱即用的 Docker Compose 定义。3.1 部署步骤在每个 GPU Worker 节点上执行docker compose -f dcgm-exporter.yml up -d这将部署nvidia/dcgm-exporter容器使用 dcgm-custom-metrics.csv 中定义的自定义指标集并在宿主机端口9400暴露 Prometheus 指标。3.2 前置条件已安装 NVIDIA GPU 驱动Docker 已配置 NVIDIA Container Toolkitnvidia-docker2或 CDI需要存在名为xinference的 Docker 网络若不存在先执行docker network create xinference。3.3 Compose 文件关键点解读从 dcgm-exporter.yml 源码可以看到几个关键设计runtime: nvidia与deploy.resources.reservations.devices以 NVIDIA runtime 启动并预留全部 GPUcount: all、capabilities: [gpu]使 Exporter 能直接读取每个 GPU 的 DCGM 数据cap_add: [SYS_ADMIN]DCGM 读取部分硬件状态如 PCIe、时钟需要提升容器权限DCGM_EXPORTER_LISTEN:9400指定 Exporter 监听端口与下方ports: 9400:9400对应DCGM_EXPORTER_KUBERNETESfalse当前为裸机/Docker Compose 部署模式不启用 Kubernetes 模式DCGM_EXPORTER_COLLECTORS/etc/dcgm-exporter/customized.csv通过 volume 将dcgm-custom-metrics.csv挂载为自定义指标定义文件覆盖默认指标集networks: xinference (external: true)加入外部创建的xinference网络便于与其他服务如 Prometheus 容器互通。3.4 验证部署后访问http://worker-host:9400/metrics应能看到DCGM_FI_DEV_GPU_UTIL、DCGM_FI_DEV_GPU_TEMP等指标。四、配置 Prometheus 抓取目标Grafana 面板的数据来自 Prometheus需要在 Prometheus 配置中为以下三类 exporter 添加抓取目标抓取目标端点用途Xinference Supervisor/WorkerXinference metrics 端点见下集群、模型、请求级指标DCGM Exporterworker-host:9400GPU 硬件指标GPU 资源面板node_exporterhost:9100主机 CPU/内存/磁盘/网络指标主机资源面板Xinference metrics 端点的端口说明集群中存在两类 Xinference metrics exporter详见 metrics.rstSupervisor metrics exporter位于endpoint/metrics例如http://127.0.0.1:9997/metricsWorker metrics exporter位于每个 worker 节点主机与端口可通过xinference-local或xinference-worker命令的--metrics-exporter-host与--metrics-exporter-port选项设置。面板若需要跨 Worker/Supervisor 做 PromQL 关联见下文标签对齐必须保证 Worker 与 Supervisor 指标被同一个 Prometheus 实例抓取。五、面板详情6 个子面板逐一拆解5.1 集群概览xinference-overview面向 SRE/平台的全局视图回答集群整体健康吗。面板关键指标Supervisor 运行时间supervisor_uptime_seconds在线 Worker 数workers_total按类型统计模型models_loaded_total模型异常终止model_unexpected_terminationAPI QPS / 错误supervisor_http_requests_total当前告警Alertmanager 集成这些指标全部有源码依据在 metrics.py 中定义了xinference:supervisor_uptime_seconds、xinference:workers_total、xinference:models_loaded_total、xinference:model_unexpected_termination等 Supervisor 侧 gauge。其中model_unexpected_termination的含义是由于 Worker 故障而下线的副本值为 1重新部署后清零metrics.py用于在面板上快速识别异常的模型实例底层通过update_cluster_metrics()周期性从 Supervisor 内存中的集群数据刷新这些 gauge并在副本消失时自动清理旧时间序列metrics.py。5.2 模型负载xinference-model-load以模型为中心的每模型/每副本视图覆盖所有模型类型LLM、embedding、rerank、image、audio、video将请求负载与显存占用统一展示是 ML Ops 日常排障的核心面板。面板关键指标每类型 QPS / P95 / 错误率model_request_total、model_request_duration_seconds每类型总显存model_gpu_memory_used_bytes每模型总览表QPS、错误率、P95、并发、显存、GPU 绑定每副本明细表每 (model, worker) 的 QPS、并发、显存趋势图QPS、并发率、显存、P95、错误率随时间变化这些指标定义于 metrics.py 的Worker-side model service quality metrics (all model types)区块属于 Worker 侧指标model_request_total、model_request_errors_total、model_request_duration_secondsHistogram桶边界覆盖 10ms 到 120s、model_serve_count当前正在服务的请求数、model_request_limit模型最大并发限制。每模型显存model_gpu_memory_used_bytes与 GPU 绑定model_gpu_binding由 Supervisor 侧维护标签含model_uid、model_name、model_type、worker_address、gpu_index、replica_indexmetrics.py。标签对齐重要Worker 侧和 Supervisor 侧指标现在都使用统一的标签集model_uid、worker_address、model_type和replica_index。这允许在面板内直接进行 PromQL 关联例如* on (model_uid, replica_index, worker_address)而不再需要 Grafana Transform 转换。此方式要求 Worker 和 Supervisor 指标位于同一 Prometheus 实例中允许分属不同job标签。这一设计在 metrics.py 的 Supervisor-only / Worker-only 指标分离逻辑中得以实现Supervisor 注册表启动时移除 Worker 侧指标、Worker 注册表启动时移除 Supervisor 侧指标metrics.py保证两边/metrics端点只暴露自己的时间序列而面板侧通过统一标签即可跨job关联。5.3 LLM 推理 SLOxinference-llm-sloLLM 专属质量指标面板仅统计model_typeLLM的模型每模型明细已迁移到模型负载面板本面板专注聚合质量。面板关键指标TTFT P50/P95/P99time_to_first_token_seconds_bucket请求延迟 P50/P95/P99model_request_duration_seconds_bucketToken 吞吐generate_tokens_total、input_tokens_total_counter、output_tokens_total_counterToken 放大比输出 / 输入 TokenTTFT首 Token 延迟的直方图桶定义于 metrics.py(0.05, 0.1, 0.25, 0.5, 1, 2.5, 5, 10, 30, Inf)秒覆盖从毫秒级交互到 30s 以上的重负载场景。Token 吞吐指标generate_tokens_total等是 Worker 侧 LLM-only 计数器metrics.py。结合time_to_first_token_seconds_bucket与model_request_duration_seconds_bucket可用histogram_quantile(0.99, ...)计算 P99 分位作为业务侧 SLO 的核心依据。5.4 GPU 资源xinference-gpu-resourcesWorker 级 GPU 利用率与 DCGM 硬件健康面板模型级 GPU 视图已迁移到模型负载面板。面板关键指标GPU 利用率worker_gpu_utilization_percent或DCGM_FI_DEV_GPU_UTILGPU 显存worker_gpu_memory_used_bytes各 Worker 活跃请求数model_serve_countDCGM温度、功耗、PCIe 错误、时钟、健康状态DCGM Exporter 指标这里呈现了两套 GPU 数据源Xinference 自身的 Worker gaugeworker_gpu_utilization_percent、worker_gpu_memory_used_bytes定义于 metrics.py标签含worker_address、gpu_index、gpu_name负责算力维度模型占用多少 GPUDCGM Exporter 指标负责硬件健康维度GPU 本身是否过热、PCIe 是否报错、时钟是否被限流。5.5 主机资源xinference-host-resourcesSupervisor 和 Worker 主机级指标面板同时展示 Xinference 原生 gauge 和 node_exporter 指标可对照观察进程视角与OS 视角的差异。面板关键指标CPU 利用率worker_cpu_utilizationXinferencenode_cpu_seconds_totalnode_exporter内存worker_memory_used_bytes/worker_memory_total_bytesXinferencenode_memory_*node_exporter磁盘、Swap、网络、I/Onode_exporter 指标Xinference 侧主机指标定义于 metrics.pyworker_cpu_utilization0-1、worker_memory_used_bytes、worker_memory_total_bytes由update_cluster_metrics()从 Worker 上报的 ResourceStatus 中刷新metrics.py。node_exporter 侧则提供node_cpu_seconds_total、node_memory_*等标准指标用于交叉验证与补充磁盘/网络视图。5.6 安全审计xinference-security-auditAPI Key 与封禁统计面板。仅在XINFERENCE_AUTH_ADVANCEDtrue时可用面向 SecOps。面板关键指标活跃 / 过期 API Keyapi_keys_active_total、api_keys_expired_total封禁 IP / (IP, Key) 对banned_ips_total、banned_keys_totalAPI Key 请求 QPS / 延迟api_key_requests_total、api_key_request_duration_secondsTop 用户 / Top 模型按 API Key 请求量排序指标定义于 metrics.py属于 Supervisor 侧 API Key 审计指标api_key_requests_totalCounter、api_key_request_duration_secondsHistogram、api_keys_active_total/api_keys_expired_totalGauge以及封禁计数banned_ips_total/banned_keys_total。其中 Key 计数与封禁计数由update_security_gauges()周期性从认证服务的数据库list_api_keys()与限流器_ip_records/_key_records刷新metrics.py保证即使没有事件发生gauge 也始终有值。该面板对多租户/多 API Key 的团队审计调用方行为谁在调、调了多少、有没有被限流封禁非常有价值。六、DCGM 自定义指标详解dcgm-custom-metrics.csv 是 DCGM Exporter 的指标白名单按基础指标 增强指标组织每行格式为DCGM_FI_FIELD_NAME, type, descriptiontype 为gauge或counter。6.1 基础指标默认集指标类型含义DCGM_FI_DEV_SM_CLOCK/DCGM_FI_DEV_MEM_CLOCKgaugeSM / 显存时钟频率MHzDCGM_FI_DEV_MEMORY_TEMP/DCGM_FI_DEV_GPU_TEMPgauge显存 / GPU 温度°CDCGM_FI_DEV_POWER_USAGEgauge实时功耗WDCGM_FI_DEV_TOTAL_ENERGY_CONSUMPTIONcounter累计能耗mJDCGM_FI_DEV_PCIE_REPLAY_COUNTERcounterPCIe 重试次数链路稳定性DCGM_FI_DEV_GPU_UTIL/DCGM_FI_DEV_MEM_COPY_UTILgaugeGPU 利用率 / 显存拷贝利用率%DCGM_FI_DEV_ENC_UTIL/DCGM_FI_DEV_DEC_UTILgauge视频编码 / 解码器利用率%DCGM_FI_DEV_FB_FREE/DCGM_FI_DEV_FB_USED/DCGM_FI_DEV_FB_RESERVEDgauge显存空闲 / 已用 / 预留MiBDCGM_FI_DEV_UNCORRECTABLE_REMAPPED_ROWS/DCGM_FI_DEV_CORRECTABLE_REMAPPED_ROWScounter不可纠正 / 可纠正行的重映射计数显存健康DCGM_FI_DEV_ROW_REMAP_FAILUREgauge行重映射是否失败DCGM_FI_DEV_VGPU_LICENSE_STATUSgaugevGPU 许可状态6.2 增强指标额外追加功耗与散热DCGM_FI_DEV_ENFORCED_POWER_LIMIT生效功耗上限W、DCGM_FI_DEV_FAN_SPEED风扇转速 0-100%硬件故障与 XIDDCGM_FI_DEV_XID_ERRORS最近一次 XID 错误号非零即异常性能状态与限流DCGM_FI_DEV_PSTATE性能状态0最高、15空闲、DCGM_FI_DEV_MAX_SM_CLOCK/DCGM_FI_DEV_MAX_MEM_CLOCK最大 SM / 显存时钟用于对比是否被限流PCIe 带宽DCGM_FI_DEV_PCIE_TX_THROUGHPUT/DCGM_FI_DEV_PCIE_RX_THROUGHPUTKB/s性能分析仅 Volta 架构DCGM_FI_PROF_SM_ACTIVESM 活跃比 0.0-1.0、DCGM_FI_PROF_SM_OCCUPANCY驻留 warp 与理论最大值之比、DCGM_FI_PROF_DRAM_ACTIVEDRAM 活跃周期比、DCGM_FI_PROF_PIPE_TENSOR_ACTIVETensor 流水线活跃比。注意DCGM_FI_PROF_*系列指标依赖性能分析能力仅 Volta 及更新架构V100/T4/A100/H100 等支持老架构上这些指标会缺失属正常现象。七、环境要求汇总组件要求说明Grafana 9.0低于该版本可能无法正确解析面板 JSON 中的新版特性Prometheus 数据源Worker 和 Supervisor 指标须在同一实例中标签对齐后的 PromQL 关联on (model_uid, ...)依赖这一点Xinference已启用 metricsSupervisor/Worker 需开启并暴露 metrics 端点DCGM Exporter按需部署仅 GPU 硬件面板GPU 资源需要node_exporter按需部署仅主机资源面板需要安全审计面板XINFERENCE_AUTH_ADVANCEDtrue未开启高级认证时该面板无数据八、Monitoring V2.1Token Router DashboardMonitoring V2.1 在 monitor/dashboard/token-router/ 下新增四语言 Dashboard统一使用 UIDxinference-token-router文件名为xinference-grafana-dashboard-token-router-{lang}.json其中简体中文为-zh.json。该 Dashboard 覆盖逻辑 Router 可用性xinference:token_router_status、token_router_desired_replicas/token_router_effective_ready_replicas/token_router_controllable_ready_replicas等汇总 gaugeRouter Agent 主机资源token_router_agent_host_cpu_utilization、token_router_agent_host_memory_used_bytes等Assignment 状态token_router_assignment_*系列desired/observed state、generation、config revision、runtime ready/current/controllableRuntime 控制面与进程资源token_router_runtime_*系列online、heartbeat age、status one-hot、effective ready、expected/acked revision、config synced请求/后端延迟和错误Runtime 侧 Counter由每个 Runtime 自己的/metrics端点暴露并发池、Tokenization 以及 Tokenizer 资产绑定token_router_tokenizer_binding_*系列。这一整套指标在 metrics.py 中集中定义属于 Supervisor metrics 进程持有的 Token Router 控制面快照而 Runtime 请求计数器仍保留在各自 Runtime 的/metrics端点因此Prometheus 必须同时抓取 Supervisor 指标和动态发现的 Runtime 指标。Runtime target 请使用 monitor/metrics/prometheus-token-router-http-sd.yml 中的 HTTP-SD 示例配置关键点如下scrape_configs: - job_name: xinference-token-router-runtime metrics_path: /metrics scheme: http http_sd_configs: - url: http://xinference-supervisor:9997/v1/monitor/prometheus/http-sd/token-router-runtimes refresh_interval: 15s authorization: type: Bearer credentials: REPLACE_WITH_MONITOR_TOKEN relabel_configs: - source_labels: [__address__] target_label: instance该配置通过 HTTP Service Discoveryhttp_sd_configs从 Supervisor 的.../http-sd/token-router-runtimes端点动态获取 Runtime 实例列表refresh_interval: 15s控制刷新频率。两个注意点一是该端点需要携带具有routers:read权限的 Bearer Token将REPLACE_WITH_MONITOR_TOKEN替换为实际监控 Token二是relabel_configs保留发现元数据的同时让 Prometheus 将instance设为实际目标地址。九、指标体系小结与最佳实践综合 metrics.rst 与 metrics.py 源码Xinference 的指标体系可按数据产生位置分为三层Supervisor 侧_SUPERVISOR_ONLY_METRICSmetrics.py集群级 gauge——uptime、worker 数、按类型加载的模型数、每模型显存与 GPU 绑定、模型生命周期状态、异常终止副本、API Key 审计与封禁计数以及 Token Router 控制面快照。由update_cluster_metrics()/update_security_gauges()周期刷新。Worker 侧_WORKER_ONLY_METRICSmetrics.py请求质量指标——model_request_total、model_request_errors_total、model_request_duration_secondsHistogram、model_serve_count、model_request_limit以及 LLM 专属的time_to_first_token_seconds、generate_tokens_total、input_tokens_total_counter、output_tokens_total_counter。Exporter 侧DCGM ExporterGPU 硬件、node_exporter主机 OS 视角。生产落地时的实践建议统一采集实例按 README 要求将 Supervisor 与 Worker 指标交给同一 Prometheus 实例否则模型负载面板的跨 job PromQL 关联会失效面板版本升级使用 Provisioning 方式导入后直接替换 JSON 文件即可自动热更新注意disableDeletion: false允许 Grafana 同步删除已移除的面板告警联动集群概览面板预留了 Alertmanager 集成建议将model_unexpected_termination、banned_*等关键 gauge 配置为告警规则仓库 monitor/alert/rules.yml 提供了多语言告警规则模板验证指标链路部署完成后先逐个访问/metrics端点确认指标存在如curl http://127.0.0.1:9997/metrics、curl http://worker-host:9400/metrics再在 Grafana Explore 中查询xinference:model_request_total、DCGM_FI_DEV_GPU_UTIL等核心指标最后确认 6 个子面板全部有数据。十、相关资源导航面板与配置文件目录monitor/dashboard/DCGM Exporter Composedcgm-exporter.yml自定义指标定义dcgm-custom-metrics.csv中文注释版 dcgm-custom-metrics.zh-CN.csvToken Router HTTP-SD 示例monitor/metrics/prometheus-token-router-http-sd.yml指标导出说明doc/source/user_guide/metrics.rst指标实现源码xinference/core/metrics.py告警规则模板monitor/alert/rules.yml另有多语言版本rules-zh-CN.yml、rules-ja.yml、rules-ko.yml【免费下载链接】inferenceSwap GPT for any LLM by changing a single line of code. Xinference lets you run open-source, speech, and multimodal models on cloud, on-prem, or your laptop — all through one unified, production-ready inference API.项目地址: https://gitcode.com/GitHub_Trending/in/inference创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
02
RELATED NEWS

相关资讯

更多网站建设与数字化升级内容

03
WHY YAOTU

想打造同款高转化官网?

懂行业、懂生意,从建站到增长一站式陪跑

场景化定制

不做模板站,围绕你的业务场景量身设计,小众不撞款。

营销型架构

以转化目标组织内容与路径,让官网真正带来询盘。

全周期服务

设计、开发、运营、运维一体,上线只是开始。

免费获取你的建站方案

留下需求,专属顾问 24 小时内为你输出方案建议。