如何在Java/Scala中用正则表达式替换DataFrame列字符串
使用正则表达式替换DataFrame中PID列的数字部分
要实现将PID后面的正负数字统一替换为999999999,你可以结合Pandas的str.replace()方法和针对性的正则表达式来完成,具体步骤如下:
1. 核心正则表达式与替换逻辑
我们需要匹配PID后紧跟的可选负号和连续数字序列,正则模式为:r'PID(-?\d+)'
PID:精确匹配字符串中的固定前缀-?:匹配可选的负号(-),表示数字可能是负数或正数\d+:匹配一个或多个数字字符- 替换目标为
PID999999999,直接覆盖原有的数字部分
2. 完整代码示例
假设你的DataFrame名为df,执行以下代码即可完成替换:
import pandas as pd # 模拟原始DataFrame data = {'PID': [ 'abc.PID-12345.cdf', 'abc.PID-12345678.xyz', 'abc.PID123456789.abc', 'xy.PID12345.def', 'ak.PID21.ab' ]} df = pd.DataFrame(data) # 执行替换操作 df['PID'] = df['PID'].str.replace(r'PID(-?\d+)', 'PID999999999', regex=True) print(df)
3. 输出验证
运行上述代码后,你会得到期望的结果:
PID 0 abc.PID999999999.cdf 1 abc.PID999999999.xyz 2 abc.PID999999999.abc 3 xy.PID999999999.def 4 ak.PID999999999.ab
这个正则表达式能精准覆盖你提供的所有正负数字场景,确保只替换PID后的数字部分,不会影响字符串中的其他内容。
内容的提问来源于stack exchange,提问作者wleng
相关产品推荐
相关产品推荐

