You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何修改正则表达式以移除DataFrame中Description列的特殊字符行

方案1:直接修改正则表达式,仅捕获不含特殊字符的内容

你可以把需要排除的特殊字符补充到捕获组的否定字符集里,修改后的代码如下:

df["Description"].str.extract(r"Localisation\s*:.*\n([^*_'\"\n]*)\n").value_counts()

这里的否定字符集[^*_'\"\n]会匹配不包含星号、下划线、单引号、双引号、换行符的字符,确保捕获到的内容完全不含你要排除的特殊字符,你可以根据实际需要往这个字符集里追加其他需要排除的特殊符号。


方案2:提取后再过滤特殊字符行

如果你需要保留原始提取结果另行使用,也可以在提取后单独做过滤:

# 先提取内容
extracted = df["Description"].str.extract(r"Localisation\s*:.*\n([^\n]*)\n", expand=False)
# 过滤掉包含特殊字符的行
filtered = extracted[~extracted.str.contains(r"[*_'\"']", na=False)]
# 统计频次
filtered.value_counts()

这个方案灵活性更高,后续如果需要调整排除的特殊字符,只需要修改contains里的字符集即可。

内容的提问来源于stack exchange,提问作者grinim

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.28 09:39:01