使用Pandas替换DataFrame中host字段开头指定文本的问题求助
问题
我用Pandas从CSV文件创建了带host字段的DataFrame,想要移除该字段以指定文本开头的内容(普通replace会删除所有匹配到的文本,不符合我的需求),编写了如下代码但无法生效:
df['host'] = df['host'].str.replace('^(BBC-)', '') df['host'] = df['host'].str.replace('^(ITV-)', '') df['host'] = df['host'].str.replace('^(CHANNEL5-)', '')
解决方案
问题根源在于Pandas的str.replace()默认将第一个参数视为普通字符串而非正则表达式,你代码里用了^(匹配字符串开头)这种正则锚点,但没开启正则模式,所以根本匹配不到目标内容。
优化写法1:合并正则,一次替换(推荐)
把所有需要匹配的前缀用|合并成一个正则表达式,开启正则模式即可:
df['host'] = df['host'].str.replace('^(BBC-|ITV-|CHANNEL5-)', '', regex=True)
优化写法2:保留分步逻辑,添加正则参数
如果想保留原有的分步替换逻辑,只需要给每一次str.replace()加上regex=True参数:
df['host'] = df['host'].str.replace('^(BBC-)', '', regex=True) df['host'] = df['host'].str.replace('^(ITV-)', '', regex=True) df['host'] = df['host'].str.replace('^(CHANNEL5-)', '', regex=True)
额外提示
如果host字段存在空值或非字符串类型,建议先做类型转换避免报错:
df['host'] = df['host'].astype(str).str.replace('^(BBC-|ITV-|CHANNEL5-)', '', regex=True)
内容的提问来源于stack exchange,提问作者Joao Beca
相关产品推荐
相关产品推荐

