使用glob查找文件夹及子文件夹CSV文件返回空列表的问题排查
批量导入子文件夹CSV到DataFrame:glob返回空列表的问题
我的目标是把E:\Grad School\Research\Pearl_River\Data_Collection\Previous_work\CRMS_Data目录下所有子文件夹里的CSV文件导入Jupyter Notebook的DataFrame,但卡在获取符合条件的文件名环节——需要忽略非CSV文件,可glob始终返回空列表。
目录结构(加粗为目标CSV文件):
- Full_Accretion
- Full_Accretion\Full_Accretion.csv
- Full_Accretion\RESTORE_disclaimer.txt
- Full_Discrete_Hydrographic
- Full_Discrete_Hydrographic\Full_Accretion.csv
- Full_Discrete_Hydrographic\RESTORE_disclaimer.txt
- Full_Marsh_Vegetation
- Full_Marsh_Vegetation\Full_Accretion.csv
- Full_Marsh_Vegetation\RESTORE_disclaimer.txt
(还有更多类似子文件夹)
我已验证文件存在、路径拼写正确,试过字符串字面量、转义字符等写法,但均无效。尝试过的代码包括:
- 直接glob根目录CSV(返回空列表):
import os from glob import glob import pandas as pd dfs = [] fdir = r'E:\Grad School\Research\Pearl_River\Data_Collection\Previous_work\CRMS_Data' all_files = [os.path.basename(i) for i in glob(r'E:\Grad School\Research\Pearl_River\Data_Collection\Previous_work\CRMS_Data\*.csv')] print(all_files) # 输出空列表
- 切换工作目录后用错误的glob规则(返回空列表):
os.chdir(r'E:\Grad School\Research\Pearl_River\Data_Collection\Previous_work\CRMS_Data') all_files = [f for file in glob('*/.csv', recursive=True)] # 规则错误 # 或 all_files = [f for file in glob(r'*\.csv', recursive=True)] # 规则错误
- os.walk能拿到所有文件,但无法筛选CSV:
all_files = [] for path, subdir, files in os.walk(fdir): for file in files: all_files.append(file) # 拿到所有文件,但包含txt
问题原因
你之前的glob规则存在错误:
- 直接写
根目录\*.csv只会查找根目录下的CSV,不会遍历子文件夹 */.csv和*\.csv都是错误的递归匹配规则,正确的子文件夹递归匹配CSV的规则是**/*.csv
解决方案
提供三种可行的实现方法:
方法1:使用glob的recursive参数(推荐)
import glob import pandas as pd fdir = r'E:\Grad School\Research\Pearl_River\Data_Collection\Previous_work\CRMS_Data' # 用**匹配任意子目录,recursive=True开启递归遍历 all_csv_files = glob.glob(f"{fdir}/**/*.csv", recursive=True) # 导入所有CSV并合并为一个DataFrame dfs = [pd.read_csv(file, index_col=None) for file in all_csv_files] combined_df = pd.concat(dfs, ignore_index=True) print(combined_df.head())
方法2:用os.walk结合文件名筛选
import os import pandas as pd fdir = r'E:\Grad School\Research\Pearl_River\Data_Collection\Previous_work\CRMS_Data' all_csv_files = [] for root, dirs, files in os.walk(fdir): for file in files: # 筛选后缀为.csv的文件 if file.endswith('.csv'): all_csv_files.append(os.path.join(root, file)) # 合并数据 dfs = [pd.read_csv(file, index_col=None) for file in all_csv_files] combined_df = pd.concat(dfs, ignore_index=True)
方法3:使用pathlib(简洁的路径处理)
from pathlib import Path import pandas as pd fdir = Path(r'E:\Grad School\Research\Pearl_River\Data_Collection\Previous_work\CRMS_Data') # rglob方法递归查找所有csv文件 all_csv_files = list(fdir.rglob('*.csv')) dfs = [pd.read_csv(file, index_col=None) for file in all_csv_files] combined_df = pd.concat(dfs, ignore_index=True)
内容的提问来源于stack exchange,提问作者Liraell
相关产品推荐
相关产品推荐

