You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何用正则表达式提取HTML配对注释间的字符串?

如何用正则提取HTML配对注释间的内容并整理为指定数组格式

嘿,我来帮你搞定这个需求!要提取<!--Q{N}-->和<!--Q{N}END-->这类配对注释之间的内容,然后整理成你指定格式的数组,咱们可以用PHP来实现,具体步骤如下:

1. 设计匹配配对注释的正则表达式

核心是利用反向引用确保注释的编号完全对应,正则表达式如下:

/<!--Q(\d+)-->(.*?)<!--Q\1END-->/s

各部分解释:

  • <!--Q(\d+)-->:匹配开头注释,(\d+)捕获数字编号作为分组1,用来对应结尾注释的编号
  • (.*?):非贪婪模式匹配注释间的所有内容,避免匹配到其他注释
  • <!--Q\1END-->:通过\1反向引用分组1的编号,确保和开头注释是同一组配对
  • s修饰符:让.能匹配包括换行在内的所有字符,保留内容里的换行和HTML标签

2. PHP代码实现示例

用PHP的preg_match_all函数提取内容,再整理成目标数组:

<?php
// 示例输入的HTML内容
$html = '
<!--Q1-->フレンチブルドックと遊んでるとき<!--Q1END-->
<!--Q2-->表参道、新宿、銀座<!--Q2END-->
<!--Q3-->ヒューマンドラマ全般が好きです。<BR>
<BR>
好きなアーティスト サザンオールスターズ<!--Q3END-->
';

// 执行正则匹配,捕获所有配对的注释内容
preg_match_all('/<!--Q(\d+)-->(.*?)<!--Q\1END-->/s', $html, $matches);

// 整理成指定格式的数组
$data = [];
if (!empty($matches[1]) && !empty($matches[2])) {
    foreach ($matches[1] as $index => $key) {
        // 可选:去除内容前后的空白,不需要的话可以删掉trim()
        $content = trim($matches[2][$index]);
        $data[(int)$key] = $content;
    }
}

// 输出格式化后的结果
echo '<pre><code>$data = ' . var_export($data, true) . ';</code></pre>';
?>

3. 最终输出结果

运行代码后,会得到你想要的数组格式:

$data = array (
  1 => 'フレンチブルドックと遊んでるとき',
  2 => '表参道、新宿、銀座',
  3 => 'ヒューマンドラマ全般が好きです。<BR>
<BR>
好きなアーティスト サザンオールスターズ',
);

注意事项

  • 这个方案仅适用于无嵌套、配对正确的注释,如果存在嵌套注释的情况,正则无法正确处理(正则不擅长解析嵌套结构,这种场景建议使用专业的HTML解析库)
  • 如果需要保留内容前后的空白字符,直接去掉代码中的trim()函数即可

内容的提问来源于stack exchange,提问作者tarikul05

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.29 08:06:10