如何从DataFrame的URL列中去除子文件夹路径与文件扩展名
Pandas处理DataFrame id列的实现方法
你可以从以下两种常用方案中选择:
- 方案1:使用os路径处理库实现(跨平台兼容性强,路径分隔符变化也能正常运行)
import os import pandas as pd df['id'] = df['id'].apply(lambda x: os.path.splitext(os.path.basename(x))[0])
- 方案2:仅使用pandas字符串处理方法,无需额外导入依赖
# 方法2.1 拆分路径后移除后缀 df['id'] = df['id'].str.split('/').str[-1].str[:-4] # 方法2.2 正则匹配直接提取目标字符串 df['id'] = df['id'].str.replace(r'^.*/([^/]+)\.jpg$', r'\1', regex=True)
处理完成后,id列就会保留你需要的纯哈希字符串内容。
内容的提问来源于stack exchange,提问作者charliec
相关产品推荐
相关产品推荐

