使用pandas处理字符串时如何保留非括号内数字并删除括号及百分号

你原来的代码存在的问题是正则规则写得过宽,[0-9()%]会匹配所有的数字、括号、百分号字符,不管数字的位置在哪都会被删除,不符合保留括号外数字的要求。
你只需要匹配两类要删除的内容即可:成对括号及内部所有内容、百分号,其余内容全部保留,正确实现代码如下:
df1['company_etrim'] = df1['company_trim'].str.replace(r'\([^)]*\)|%', '', regex=True)
如果需要处理替换后产生的多余连续空格、首尾空格,可以用优化版本:
df1['company_etrim'] = df1['company_trim'].str.replace(r'\([^)]*\)|%', '', regex=True)\ .str.replace(r'\s+', ' ', regex=True)\ .str.strip()
正则规则说明:
\([^)]*\):匹配完整的成对括号及内部所有内容,其中[^)]*代表匹配任意数量的非右括号字符,避免正则贪婪匹配跨多对括号的问题|:正则或运算符,代表匹配括号规则或是后面的百分号规则%:匹配所有百分号字符
内容的提问来源于stack exchange,提问作者Achillies
相关产品推荐
相关产品推荐

