pathlib递归遍历目录慢于os.walk?求最优用法及两者差异解析
关于pathlib与os目录遍历的性能及最优写法解答
为什么os.walk性能更优?
- os.walk底层由C语言实现,执行效率本身高于纯Python逻辑的pathlib相关操作。
- os.walk遍历目录时,一次系统调用就能获取当前目录的子目录与文件列表,无需额外接口判断条目类型;而你当前的pathlib写法中,
rglob("*")会遍历所有路径条目,之后还要对每个条目调用is_file()——这会触发额外的系统调用(stat),每判断一个文件就多一次开销,累积起来性能差距明显。 - os.walk默认不跟进符号链接(除非设置
followlinks=True),且返回的fnames本身就是当前目录的文件列表,无需再做类型判断,进一步减少了操作步骤。
pathlib遍历目录的最优写法
你当前的写法并非最优,核心问题是rglob("*")会遍历所有类型的路径(文件、目录、链接等),再逐个判断是否为文件,产生大量额外系统调用。如果要使用pathlib实现高效文件遍历,可尝试以下两种方式:
方式1:递归使用iterdir()提前过滤
手动递归遍历目录,只处理文件,避免遍历所有条目后再判断:
def traverse_pathlib(path): path_obj = pathlib.Path(path) count = 0 with open("filelist_Pathlib_opt", "w+") as file: for entry in path_obj.iterdir(): if entry.is_file(): count += 1 file.write(entry.name + '\n') elif entry.is_dir(): # 递归处理子目录 sub_count = traverse_pathlib(entry) count += sub_count return count
这种写法相比rglob减少了不必要的遍历,但仍需调用is_file()和is_dir(),不过比rglob("*")遍历所有条目后再判断更高效。
方式2:结合os.scandir(推荐,兼顾便捷性与性能)
os.scandir返回的DirEntry对象缓存了stat信息,调用is_file()时不会重复发起系统调用,性能接近os.walk,同时可将DirEntry转为pathlib.Path对象使用其便捷方法:
def traverse_scandir_pathlib(path): path_obj = pathlib.Path(path) count = 0 with open("filelist_Pathlib_scandir", "w+") as file: for entry in os.scandir(path_obj): if entry.is_file(): count += 1 file.write(entry.name + '\n') elif entry.is_dir(): sub_count = traverse_scandir_pathlib(entry.path) count += sub_count return count
这种方式既利用了os.scandir的高性能,又能通过entry.path转为pathlib.Path使用路径操作的便捷方法,符合你提到的混合使用思路。
总结
os与pathlib是互补关系:os模块工具偏向底层、高性能,适合对效率要求高的场景;pathlib提供面向对象的路径操作,代码可读性与便捷性更强,适合路径处理逻辑复杂的场景。根据需求选择合适工具或混合使用,能兼顾性能与开发效率。
内容的提问来源于stack exchange,提问作者Skegg
相关产品推荐
相关产品推荐

