You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

PHP Glob处理大文件目录时内存耗尽问题求助

解决大文件目录搜索的内存耗尽问题

你当前的代码核心问题是一次性将整个目录下的超大文件全部读入内存,哪怕单个文件就有9.52GB,这种方式直接把内存撑爆,和glob本身无关。下面是具体的优化方案,完全不需要调高内存限制:

核心优化思路

  • 逐个处理文件,不一次性加载所有内容
  • 逐行读取文件并匹配目标字符串,仅在内存中保留单行内容
  • 复用glob结果,避免重复调用浪费资源

修改后的代码

<?php
ini_set('memory_limit', '128M'); // 大幅降低内存限制,完全够用
error_reporting(E_ERROR | E_PARSE);

$searchfor = $_GET['q'] ?? '';
$searchfor = trim($searchfor);

if(empty($searchfor)) {
    echo "<h2>Enter something.</h2>";
    exit;
}

// 仅调用一次glob获取文件列表
$files = glob(__DIR__ . "/db/*");
$matches = [];
// 简化正则表达式,逐行匹配无需复杂前缀后缀
$pattern = '/' . preg_quote($searchfor, '/') . '/';

foreach ($files as $file) {
    // 打开文件句柄,逐行读取
    $handle = fopen($file, 'r');
    if (!$handle) continue; // 跳过无法打开的文件

    while (($line = fgets($handle)) !== false) {
        // 检查当前行是否匹配目标字符串
        if (preg_match($pattern, $line)) {
            $matches[] = $line;
        }
    }

    fclose($handle);
}

if (!empty($matches)) {
    echo '<h2><center>Matches found!</center></h2>';
    echo "<pre>";
    echo implode('', $matches);
    echo "</pre>";
} else {
    echo "<center><h2>No matches found.</h2></center>";
}
?>

关键优化点说明

  • 内存占用骤降:用fgets逐行读取,每次内存仅保留一行内容,占用量和文件总大小完全无关。
  • 减少冗余操作:只调用一次glob获取文件列表,避免原代码中两次调用的无效IO。
  • 简化正则逻辑:逐行匹配时无需完整行匹配的复杂正则,直接匹配目标字符串即可,降低正则引擎负担。
  • 增加容错性:跳过无法打开的文件,避免单个文件异常导致整个脚本崩溃。

额外高效方案

如果需要处理大量文件或追求更高搜索效率,可以:

  • 调用系统级工具:Windows用findstr、Linux用grep,通过exec执行命令,系统工具处理大文件的效率远高于PHP脚本。
  • 建立文件索引:将文件内容导入SQLite/MySQL等数据库,后续直接通过数据库查询,搜索速度会大幅提升。

内容的提问来源于stack exchange,提问作者Koen Kre

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.12 23:15:22