You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何使用Regex提取HTML标签内文本?WebHarvy采集求指导

使用正则表达式从HTML中提取文本(含WebHarvy实操指导)

针对你列出的6种HTML文本提取场景,我会逐个给出适配的正则表达式,同时结合WebHarvy的功能给你实操建议:

一、各场景的正则提取方案

下面是对应每个任务的正则写法,我会标注清楚匹配逻辑:

任务1:提取<div>标签内的文本

原始HTML:

<div>Want to extract this text</div>

正则表达式:

<div>(.*?)</div>

说明:.*?是非贪婪匹配,会精准捕获<div>和</div>之间的所有内容,避免匹配到多余的标签。

任务2:提取<span>标签内的普通文本

原始HTML:

<span>want to extract this text</span>

正则表达式:

<span>(.*?)</span>

说明:和任务1逻辑一致,非贪婪匹配<span>标签对之间的内容。

任务3:提取<span>标签内的电话号码

原始HTML:

<span>+91 11 3989 0000</span>

如果只想匹配电话号码(而非所有<span>内容),可以用更精准的正则:

<span>(\+?\d+\s?\d+\s?\d+\s?\d+)</span>

说明:\+?匹配可选的加号,\d+匹配数字,\s?匹配可选的空格,能精准捕获这类带空格的电话号码格式。当然如果只需要提取<span>内的内容,用任务2的正则也完全可行。

任务4:提取带class的<p>标签内的地址

原始HTML:

<p class="location"><i class="fa fa-map-marker"></i> No 40 york street Hongkong </p>

正则表达式:

<p class="location"><i class="fa fa-map-marker"></i>\s*(.*?)\s*</p>

说明:\s*匹配前后的空白字符,确保捕获到干净的地址文本No 40 york street Hongkong。

任务5:提取<a>标签内的显示网址

原始HTML:

<p class="location"><i class="fa fa-link"></i> <a href="http://www.website.com" target="_blank">www.website.com</a></p>

如果要提取<a>标签的显示文本(即www.website.com):

<a href=".*?" target="_blank">(.*?)</a>

如果要提取href属性里的链接,用:

<a href="(.*?)" target="_blank">

说明:前者捕获标签内的显示文本,后者捕获属性值,根据需求选择。

任务6:提取带class的<p>标签内的邮箱

原始HTML:

<p class="location"><i class="fa fa-envelope"></i> emailaddress@yahoo.com</p>

正则表达式:

<p class="location"><i class="fa fa-envelope"></i>\s*(.*?)\s*</p>

或者如果想精准匹配邮箱格式(避免其他内容),可以用:

<p class="location"><i class="fa fa-envelope"></i>\s*([a-zA-Z0-9._%+-]+@[a-zA-Z0-9.-]+\.[a-zA-Z]{2,})\s*</p>

说明:后者的邮箱正则是行业通用的格式匹配,能确保只捕获符合邮箱规则的内容。

二、WebHarvy的相关使用指导

WebHarvy本身是可视化的网页采集工具,不过也完全支持正则提取,还有内置转换器帮你处理数据:

  • 正则提取的操作步骤:
    在WebHarvy中选中你要提取的元素后,选择「Extract using Regular Expression」选项,把上面对应的正则表达式粘贴进去,工具会自动匹配并提取内容。
  • 内置转换器的使用:
    WebHarvy有「Remove HTML Tags」转换器,如果你只是想提取元素内的纯文本,甚至不需要写正则——直接选中元素后添加这个转换器,就能自动剥离所有HTML标签,得到干净的文本内容。针对邮箱、电话号码这类特定格式,WebHarvy也有对应的「Extract Email」「Extract Phone Number」内置工具,比写正则更省心,直接调用即可。

小提示:正则处理HTML虽然灵活,但如果网页结构复杂,优先用WebHarvy的可视化选择器+内置转换器,稳定性更高;只有当结构特殊时,再用正则补充。

内容的提问来源于stack exchange,提问作者kavidu coolplus

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.28 07:05:37