如何根据DataFrame图像列拼接绝对路径加载图片并解决Series报错
错误原因
- 报错核心原因:代码里写的
{df["images"]}是尝试将整个pandas Series(也就是DataFrame的整列对象)存入Python集合,而Series是可变类型,不支持哈希操作,因此触发TypeError: unhashable type: 'Series'。 - 逻辑顺序错误:原代码先遍历目录下全部7000张原始图像,再尝试匹配文件名,既不符合「仅加载DataFrame中记录的3000张目标图像」的需求,还做了大量无效遍历,效率极低。
- 路径拼接不规范:直接用
+拼接字符串容易出现路径斜杠遗漏的问题,跨环境运行容易出错。
正确实现方案
直接遍历DataFrame中存储的目标文件名,拼接路径后校验、加载即可,不需要遍历全量图像目录。
import os import pandas as pd from PIL import Image # 可根据自身需求替换为OpenCV等其他图像读取库 # 图像存储根目录 base_path = "/content/drive/MyDrive/IU-Xray/images/images_normalized" # 提前提取目标文件名列表,避免循环中重复访问DataFrame target_img_list = df["images"].tolist() # 存储加载完成的图像,格式为(文件名, 图像对象) loaded_dataset = [] for img_name in target_img_list: # 自动拼接路径,兼容不同操作系统的路径分隔符 img_full_path = os.path.join(base_path, img_name) # 校验文件存在、格式符合要求再读取,避免运行报错 if os.path.isfile(img_full_path) and img_name.lower().endswith((".png", ".jpg", ".jpeg")): img = Image.open(img_full_path) loaded_dataset.append( (img_name, img) ) else: print(f"跳过无效文件:{img_full_path}")
可选优化
如果不需要立刻加载图像,仅需生成所有目标图像的完整路径,可以直接给DataFrame新增列存储路径,无需手写循环:
df["full_path"] = df["images"].apply(lambda x: os.path.join(base_path, x))
内容的提问来源于stack exchange,提问作者albert
相关产品推荐
相关产品推荐

