You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何使用Tensorflow Object Detection API保存10-15个及更多检查点?

调整TensorFlow Object Detection API检查点保存数量的解决方案

你修改后仅能保存5个检查点,是因为除了trainer.py中的max_to_keep参数,还有另外两个配置项会共同限制检查点的保存数量,按以下步骤调整即可:

1. 调整训练配置的保存间隔

首先确认你的检查点保存步数间隔设置,避免因间隔过大导致总保存数量不足。打开你的训练pipeline配置文件,找到train_config字段,调整save_checkpoints_steps参数:

train_config {
...

示例:每1000步保存一次检查点,15000步训练总共产出15个检查点

save_checkpoints_steps: 1000
...
}
如果你的save_checkpoints_steps设为3000,15000步训练最多只能生成5个检查点,这就是你修改源码后仍只能保存5个的核心原因。

2. 修改检查点最大保留数量参数

该参数有三处可配置,优先级从高到低为:启动命令参数 > pipeline配置 > 源码默认值,优先修改配置即可,无需动源码:

  • 方案一:直接在训练启动命令中添加参数,示例如下:
    python model_main.py --pipeline_config_path=你的配置文件路径 --model_dir=模型保存路径 --max_checkpoints_to_keep=15 --num_train_steps=15000
  • 方案二:修改pipeline配置文件的train_config字段,添加对应参数:

train_config {
...
max_checkpoints_to_keep: 15
save_checkpoints_steps: 1000
...
}

  • 方案三:如果仍使用legacy版本的训练脚本,再确认trainer.py中的两处配置:
    • 你已经修改的max_to_keep设为目标保留数量
    • 同步调大keep_checkpoint_every_n_hours参数值,避免因训练速度快、每小时生成检查点过多触发自动删除规则,可根据训练总时长调整为5~20之间的数值

3. 生效验证

启动训练后,打开模型保存目录下的checkpoint文本文件,里面会按顺序记录所有已保存的检查点名称,当保存数量达到你设置的阈值后,最早的检查点没有被自动删除,即代表配置生效。

内容的提问来源于stack exchange,提问作者zahin178

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.10.06 14:45:03