You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

咨询:在Kubernetes中通过Prometheus采集TorchServe硬件指标

可以通过Prometheus采集日志中的硬件指标,同时更推荐优先通过TorchServe本身配置暴露硬件指标

方案一:直接配置TorchServe暴露硬件指标(最优)

TorchServe本身支持采集并暴露硬件指标到8082端口的metrics端点,默认可能未开启。你可以通过以下步骤配置:

  • 修改TorchServe的config.properties文件,添加或启用以下配置项:
    metrics_enable=true
    metrics_hardware=true
    
  • 重启TorchServe Pod,之后访问8082端口的/metrics路径,就能看到CPU、GPU、磁盘等硬件指标,直接用Prometheus的PodMonitor或ServiceMonitor抓取即可。

方案二:从Pod日志中提取硬件指标(当方案一不可行时)

如果无法修改TorchServe配置,可通过日志解析的方式采集:

  1. 确认日志格式:确保TorchServe输出的硬件指标日志包含数值,例如完整格式为:
    [INFO ] pool-3-thread-2 TS_METRICS - CPUUtilization.Percent: 65.2
    [INFO ] pool-3-thread-2 TS_METRICS - DiskAvailable.Gigabytes: 120.5
    [INFO ] pool-3-thread-2 TS_METRICS - GPUMemoryUtilization.Percent: 70.0
    
  2. 部署日志解析工具:使用Fluentd或Filebeat抓取TorchServe Pod的日志,配置过滤规则匹配TS_METRICS开头的日志行,解析出指标名称和数值。
  3. 转换为Prometheus格式:将解析后的指标转换为Prometheus兼容的格式,例如:
    ts_cpu_utilization_percent 65.2
    ts_disk_available_gigabytes 120.5
    ts_gpu_memory_utilization_percent 70.0
    
  4. 暴露给Prometheus:可以将转换后的指标发送到Prometheus Pushgateway,或者让日志工具将指标暴露为HTTP端点,再配置Prometheus抓取该端点。

注意:从日志采集指标的可靠性低于直接从metrics端点采集,因为日志可能丢失或格式变化,优先推荐方案一。

内容的提问来源于stack exchange,提问作者Prosciutt0

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.23 06:22:52