如何用正则表达式匹配文本并跳过HTML标签(QuickBase场景)
解决QuickBase Pipelines中剥离HTML标签提取纯文本的正则问题
两种可行方案:
方案1:直接替换HTML标签(更简便)
你已经写出了匹配HTML标签的正则 <[^>]*>,直接利用QuickBase Pipelines Text工具的Replace功能即可完成需求:
- 匹配规则:使用正则
<[^>]*>(无需开头结尾的/,工具会自动识别) - 替换内容:留空(即删除所有匹配到的HTML标签)
以你的示例输入为例:
<p>just a small <a href="#"> example</a> link</p><p>to a webpage</p>
替换后会得到:just a small example link to a webpage(若存在多余换行/空格,可做进一步优化)
优化多余空白:
如果需要清理连续空格、换行,可再添加一次Replace操作:
- 匹配规则:
\s+ - 替换内容:单个空格
最后再用一次Replace去掉首尾空格: - 匹配规则:
^\s+|\s+$ - 替换内容:留空
方案2:匹配非标签文本的正则(用于Extract操作)
如果必须通过匹配非标签文本的方式提取内容,可使用以下正则:
[^<]+(?=(<|$))
该正则会匹配所有不在<>标签范围内的文本片段,直到遇到下一个HTML标签或文本结尾。开启全局匹配(g修饰符)后,可提取所有纯文本片段,拼接后即可得到完整纯文本内容。
注意事项
QuickBase Pipelines的正则语法兼容Python风格,无需用/包裹正则表达式,直接输入内容即可生效。
内容的提问来源于stack exchange,提问作者urig
相关产品推荐
相关产品推荐

