如何高效计算指定目录下所有子文件夹与文件的大小?
高效计算目录及子目录大小的优化方案
问题分析
你的代码中Section 2采用反向遍历文件并通过字符串拆分判断所属目录的方式,时间复杂度为O(N*M)(N为目录数,M为文件数),导致运行效率极低。同时为了处理空目录,单独存储父文件夹路径的方式进一步增加了不必要的开销。
优化后的代码
import os import time from collections import defaultdict def folder_size(directory): directory = os.path.abspath(directory) file_size = {} dir_size = defaultdict(int) dirs_set = set() # 记录所有目录路径,包括空目录 t0 = time.time() # 单次遍历完成文件大小记录与目录大小累加 for root, dirs, files in os.walk(directory): root_abspath = os.path.abspath(root) dirs_set.add(root_abspath) current_dir_file_sum = 0 # 记录当前目录下所有文件的大小 for f in files: file_path = os.path.join(root_abspath, f) size = os.path.getsize(file_path) file_size[file_path] = size current_dir_file_sum += size # 当前目录的初始大小为自身文件总和 dir_size[root_abspath] += current_dir_file_sum # 将当前目录的大小向上累加到所有父目录中 parent_dir = os.path.dirname(root_abspath) while True: if parent_dir in dirs_set: dir_size[parent_dir] += current_dir_file_sum # 终止条件:到达根目录或父目录与当前目录相同(如Windows盘符) next_parent = os.path.dirname(parent_dir) if next_parent == parent_dir: break parent_dir = next_parent t1 = time.time() print(f'total execution time: {round(t1-t0, 2)} s') # 确保空目录被纳入统计,大小设为0 for dir_path in dirs_set: dir_size.setdefault(dir_path, 0) return file_size, dir_size
优化说明
- 合并遍历流程:将原代码的两次遍历合并为一次,在
os.walk遍历过程中同时完成文件大小记录和目录大小的向上累加,彻底消除原Section 2的高复杂度开销。 - 替代字符串拆分判断:使用
os.path.dirname逐级获取父目录,直接进行大小累加,避免了字符串拆分的低效操作,同时避免了parent in filename可能导致的判断错误。 - 空目录处理:通过
dirs_set记录所有遍历到的目录,最后确保空目录也会被加入结果字典,大小设为0,满足统计需求。
测试验证
使用你提供的测试目录生成代码创建的结构(3000个子目录+6000个文件),优化后的代码总运行时间与原Section 1耗时相当(约0.5秒),相比原Section 2的30+秒有数量级的性能提升。
内容的提问来源于stack exchange,提问作者Simon1
相关产品推荐
相关产品推荐

