如何获取Hugging Face推理端点使用数据及按请求统计使用时长
Hugging Face推理端点定价与使用数据问题解答
一、是否可按单个请求统计使用时长
- 目前小时费率模式下,不支持按单个请求的实际使用时长计费,该模式是按端点部署后的持续运行时间收费,只要端点处于活跃状态,不管有没有请求都会按小时扣费。
- 若需要精细化计费,建议切换到按需(On-Demand)定价模式,该模式按处理请求的实际计算时长(通常精确到毫秒)收费,端点空闲时不会产生费用,更适合请求量波动大或非持续运行的场景。
二、如何获取推理端点的使用数据
- Hub界面直接查看:
登录Hugging Face账号后进入你的推理端点详情页,在「Metrics」或「Usage」标签下,可查看请求次数、响应时间、CPU/GPU利用率等核心指标,还能按时间范围筛选数据。 - 通过API获取结构化数据:
使用huggingface_hub库调用接口获取,需先配置好API token。示例代码如下:
这种方式适合将数据集成到自有系统或做进一步分析。from huggingface_hub import HfApi api = HfApi(token="你的API令牌") metrics = api.get_endpoint_metrics(endpoint_name="你的端点名称") print(metrics) - 查看账单明细:
在账号的「Billing」页面,可查看端点的计费明细,包括各时间段的费用、对应资源使用情况,能清晰对应小时费率的扣费记录。
内容的提问来源于stack exchange,提问作者pangea
相关产品推荐
相关产品推荐

