排序图像与掩码路径触发ValueError,求问题排查与解决方法
问题原因分析
- 触发
ValueError: invalid literal for int() with base 10: ''的核心原因:你用硬编码的切片长度BASE_LEN:-END_IMG_LEN截取路径时,得到了空字符串,无法转换为整数。 - 硬编码切片长度的方式完全依赖固定的路径字符串长度,一旦路径前缀/后缀长度有变化(比如不同路径的目录层级不同、文件名长度不一致),就会出现截取内容为空或错误的情况。
解决方案
1. 先确认路径格式
先打印几个路径样本,明确图像和掩码路径的对应关系:
print("示例图像路径:", df_imgs["path"].iloc[0]) print("示例掩码路径:", df_masks["path"].iloc[0])
假设输出为类似格式:
示例图像路径: /data/dataset/img_001.jpg 示例掩码路径: /data/dataset/img_001_mask.png
说明图像和掩码通过文件名里的数字ID(比如001)一一对应。
2. 用正则提取ID来排序&匹配
用正则表达式提取路径中的数字ID,避免硬编码切片的局限性,保证能准确获取用于匹配的标识:
import re import pandas as pd import numpy as np # 提取路径中的数字ID def extract_id(path): # 匹配路径中的连续数字,可根据实际格式调整正则规则 match = re.search(r'(\d+)', path) if match: return int(match.group(1)) return None # 为图像和掩码数据添加ID列 df_imgs['id'] = df_imgs['path'].apply(extract_id) df_masks['id'] = df_masks['path'].apply(extract_id) # 按ID排序 df_imgs_sorted = df_imgs.sort_values('id').reset_index(drop=True) df_masks_sorted = df_masks.sort_values('id').reset_index(drop=True) # 合并成包含图像和对应掩码的DataFrame if len(df_imgs_sorted) == len(df_masks_sorted): final_df = pd.DataFrame({ 'image_path': df_imgs_sorted['path'], 'mask_path': df_masks_sorted['path'], 'id': df_imgs_sorted['id'] }) print("最终DataFrame预览:") print(final_df.head()) else: print("警告:图像和掩码数量不匹配,请检查数据!")
3. 额外验证(可选)
如果担心存在ID不匹配的情况,可添加检查步骤:
img_ids = set(df_imgs['id'].dropna()) mask_ids = set(df_masks['id'].dropna()) missing_mask_ids = img_ids - mask_ids if missing_mask_ids: print(f"以下图像ID无对应掩码: {missing_mask_ids}") missing_img_ids = mask_ids - img_ids if missing_img_ids: print(f"以下掩码ID无对应图像: {missing_img_ids}")
正则规则调整说明
如果你的路径中ID格式特殊(比如带固定前缀img_),可以修改正则表达式,比如用r'img_(\d+)'来精准匹配img_001中的数字部分。
内容的提问来源于stack exchange,提问作者Sanju
相关产品推荐
相关产品推荐

