如何获取模拟真实文件系统的大批量dummy测试样本文件
适配压缩软件测试的真实结构文件集获取/搭建方案
你可以按下面几个方向找现成资源或者自己快速搭建符合要求的测试集,不用找零散的公开资源凑:
- 压缩测试领域通用的标准基础文件集
行业里做压缩算法、存储性能测试通用的Calgary、Canterbury、Silesia三类标准测试语料库,已经覆盖了纯文本、源码、可执行程序、位图图片、压缩包、办公文档片段等绝大多数常见文件类型,单包体积从几MB到几百MB不等,你可以把这些基础文件作为不同类型文件的种子,搭配目录结构生成工具做扩容,快速堆到你需要的测试体量。 - 用定制化生成工具直接生成符合要求的dummy文件系统
不用找现成的固定数据集,用开源的文件系统生成命令行工具就可以高度自定义测试集结构:你可以自己配置参数,包括目录最大嵌套深度、单目录下文件/子文件夹数量范围、不同类型文件的占比(比如按真实个人电脑的分布,配置15%系统二进制文件、20%文本/办公文档、30%图片、15%视频、10%压缩包/安装包、10%缓存/临时文件/空文件/软链接这类特殊文件),还能模拟真实场景下的文件大小重尾分布(即绝大多数是几KB到几MB的小文件,少量是几GB的大体积媒体/镜像文件),要多大体量就能生成多大体量,灵活度远高于固定的公开数据集。
如果你要高度还原带OS、预装程序的真实系统结构,可以先在虚拟机里安装一个全新的干净版本桌面系统(Windows或者常用Linux发行版都可以),导出系统盘的完整目录结构清单,把这个清单导入生成工具,让工具按照真实系统的路径规则填充对应类型的dummy文件,还原度比随机生成的目录结构高很多,也不会带任何敏感数据。 - 脱敏真实用户文件系统分布样本
很多存储厂商、高校做存储相关研究时会公开脱敏后的个人设备文件系统统计样本,这类样本已经完全抹除了用户敏感内容,只保留真实的目录层级逻辑、文件类型占比、文件大小分布特征,你可以直接参考这类样本的分布参数调整生成工具的配置,做出来的测试集比随机设置参数生成的集合更贴近真实用户使用场景,测出来的压缩率、压缩/解压速度、异常容错表现参考价值更高。
测试注意事项:建议把生成好的标准测试集做一份只读备份,每轮验证前用备份重置测试目录,保证每轮测试的输入完全一致,结果可复现;所有测试操作都在隔离的测试分区/测试目录下开展,不要直接操作本机的真实生产文件,避免误操作导致数据损坏。
内容的提问来源于stack exchange,提问作者Elephant88
相关产品推荐
相关产品推荐

