仅能读取并存储一行数据时,如何排序大型换行分隔文本文件?
超大型文本文件排序解决方案
当文件大到无法全部装入内存,且仅能在内存中存储一行数据时,采用外部排序的分治思路即可解决,核心分为两步:生成有序临时段、二路归并(受内存限制适配的归并方式)。
1. 生成有序临时文件(初始归并段)
逐行读取原文件,生成多个递增有序的临时小文件:
- 读取第一行,写入临时文件
temp_0.txt - 读取下一行,读取
temp_0.txt的最后一行到内存,将当前行与该行比较:- 若当前行更大,直接追加到
temp_0.txt - 若当前行更小,关闭
temp_0.txt,新建temp_1.txt并写入当前行
- 若当前行更大,直接追加到
- 重复上述逻辑,直到原文件读取完毕。此时每个临时文件内的内容都是递增有序的。
2. 二路归并所有临时文件
将多个有序临时文件逐步合并为一个最终的有序文件:
- 取两个临时文件(如
temp_0.txt和temp_1.txt),分别读取第一行到内存 - 比较两行内容,将较小的一行写入结果文件
result.txt,然后从对应临时文件读取下一行 - 重复比较-写入-读行的操作,直到其中一个临时文件读取完毕,再将另一个文件的剩余内容全部追加到
result.txt - 将
result.txt作为新的待归并文件,与下一个临时文件重复上述归并过程,直到所有临时文件都完成归并
额外优化提示
- 临时文件按序号递增命名,方便批量处理
- 归并完成后删除所有临时文件,释放存储空间
内容的提问来源于stack exchange,提问作者meraki_1
相关产品推荐
相关产品推荐

