You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

在Spark中移除Stack Exchange数据里<pre><code>标签内的内容

在Spark中用正则移除Stack Exchange数据里的代码块内容

完全可以用正则表达式实现,结合Spark的UDF就能高效处理批量数据,以下是具体方案:

核心思路

用正则精准匹配<pre><code>与</code></pre>包裹的整个区块(包括标签本身),直接替换为空字符串。考虑到实际数据中标签可能存在空格、大小写差异,正则要兼容这些场景。

Python实现代码

from pyspark.sql import SparkSession
from pyspark.sql.functions import udf, col
import re

# 初始化Spark会话
spark = SparkSession.builder.appName("StackExchangeCodeCleanup").getOrCreate()

# 正则规则:匹配带任意空格、忽略大小写的<pre><code>到</code></pre>区块
code_regex = re.compile(r'<pre\s*><code\s*>.*?</code\s*></pre\s*>', re.DOTALL | re.IGNORECASE)

# 定义清理函数
def strip_code_blocks(content):
    if not content:
        return content
    return code_regex.sub('', content)

# 注册UDF
strip_code_udf = udf(strip_code_blocks)

# 读取数据并处理
raw_df = spark.read.format("json").load("your/stackexchange/dump/path")
cleaned_df = raw_df.withColumn("cleaned_body", strip_code_udf(col("body")))

# 验证结果或保存
cleaned_df.select("body", "cleaned_body").show(truncate=100)

可选调整

如果只想移除代码块内的文本,保留空的<pre><code></code></pre>标签,把正则改成:

code_regex = re.compile(r'(?<=<pre\s*><code\s*>).*?(?=</code\s*></pre\s*>)', re.DOTALL | re.IGNORECASE)

关键说明

  • re.DOTALL让正则的.匹配换行符,覆盖代码块内的多行内容。
  • re.IGNORECASE处理标签大小写不统一的情况(比如<PRE><CODE>)。
  • Spark UDF会分布式执行,适合处理大规模的Stack Exchange数据转储。

内容的提问来源于stack exchange,提问作者Katy

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.24 15:45:00