You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

使用glob查找文件夹及子文件夹CSV文件返回空列表的问题排查

批量导入子文件夹CSV到DataFrame:glob返回空列表的问题

我的目标是把E:\Grad School\Research\Pearl_River\Data_Collection\Previous_work\CRMS_Data目录下所有子文件夹里的CSV文件导入Jupyter Notebook的DataFrame,但卡在获取符合条件的文件名环节——需要忽略非CSV文件,可glob始终返回空列表。

目录结构(加粗为目标CSV文件):

  • Full_Accretion
    • Full_Accretion\Full_Accretion.csv
    • Full_Accretion\RESTORE_disclaimer.txt
  • Full_Discrete_Hydrographic
    • Full_Discrete_Hydrographic\Full_Accretion.csv
    • Full_Discrete_Hydrographic\RESTORE_disclaimer.txt
  • Full_Marsh_Vegetation
    • Full_Marsh_Vegetation\Full_Accretion.csv
    • Full_Marsh_Vegetation\RESTORE_disclaimer.txt
      (还有更多类似子文件夹)

我已验证文件存在、路径拼写正确,试过字符串字面量、转义字符等写法,但均无效。尝试过的代码包括:

  1. 直接glob根目录CSV(返回空列表):
import os
from glob import glob
import pandas as pd

dfs = []
fdir = r'E:\Grad School\Research\Pearl_River\Data_Collection\Previous_work\CRMS_Data'
all_files = [os.path.basename(i) for i in glob(r'E:\Grad School\Research\Pearl_River\Data_Collection\Previous_work\CRMS_Data\*.csv')]
print(all_files)  # 输出空列表
  1. 切换工作目录后用错误的glob规则(返回空列表):
os.chdir(r'E:\Grad School\Research\Pearl_River\Data_Collection\Previous_work\CRMS_Data')
all_files = [f for file in glob('*/.csv', recursive=True)]  # 规则错误
# 或
all_files = [f for file in glob(r'*\.csv', recursive=True)]  # 规则错误
  1. os.walk能拿到所有文件,但无法筛选CSV:
all_files = []
for path, subdir, files in os.walk(fdir):
    for file in files:
        all_files.append(file)  # 拿到所有文件,但包含txt

问题原因

你之前的glob规则存在错误:

  • 直接写根目录\*.csv只会查找根目录下的CSV,不会遍历子文件夹
  • */.csv和*\.csv都是错误的递归匹配规则,正确的子文件夹递归匹配CSV的规则是**/*.csv

解决方案

提供三种可行的实现方法:

方法1:使用glob的recursive参数(推荐)

import glob
import pandas as pd

fdir = r'E:\Grad School\Research\Pearl_River\Data_Collection\Previous_work\CRMS_Data'
# 用**匹配任意子目录,recursive=True开启递归遍历
all_csv_files = glob.glob(f"{fdir}/**/*.csv", recursive=True)

# 导入所有CSV并合并为一个DataFrame
dfs = [pd.read_csv(file, index_col=None) for file in all_csv_files]
combined_df = pd.concat(dfs, ignore_index=True)
print(combined_df.head())

方法2:用os.walk结合文件名筛选

import os
import pandas as pd

fdir = r'E:\Grad School\Research\Pearl_River\Data_Collection\Previous_work\CRMS_Data'
all_csv_files = []

for root, dirs, files in os.walk(fdir):
    for file in files:
        # 筛选后缀为.csv的文件
        if file.endswith('.csv'):
            all_csv_files.append(os.path.join(root, file))

# 合并数据
dfs = [pd.read_csv(file, index_col=None) for file in all_csv_files]
combined_df = pd.concat(dfs, ignore_index=True)

方法3:使用pathlib(简洁的路径处理)

from pathlib import Path
import pandas as pd

fdir = Path(r'E:\Grad School\Research\Pearl_River\Data_Collection\Previous_work\CRMS_Data')
# rglob方法递归查找所有csv文件
all_csv_files = list(fdir.rglob('*.csv'))

dfs = [pd.read_csv(file, index_col=None) for file in all_csv_files]
combined_df = pd.concat(dfs, ignore_index=True)

内容的提问来源于stack exchange,提问作者Liraell

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.01 19:40:11