如何在R中提取字符串,删除dataframe指定列首个单词及后续下划线前缀
Pandas DataFrame 字符串列处理方案
直接使用pandas内置的正则替换方法即可完成需求,核心逻辑是匹配字符串开头到第一个下划线的所有内容,将其替换为空。
完整代码示例
import pandas as pd # 此处替换为你自己的DataFrame读取代码,比如pd.read_excel/ pd.read_csv # df = pd.read_csv("your_file_path.csv") # 对Column A执行处理,若要保留原列内容,可将左侧改为自定义新列名,比如df["processed_ColumnA"] df["Column A"] = df["Column A"].str.replace(r"^[^_]+_", "", regex=True)
正则逻辑说明
^匹配字符串的起始位置[^_]+匹配所有非下划线的字符,直到遇到第一个下划线为止_匹配紧跟的第一个下划线- 整体匹配到的内容会被替换为空,剩余部分就是你需要的结果
效果验证
拿你给出的示例数据测试,处理后Column A的结果为:
RED_Pglasses_Vision JAM_Pots_Jammie
完全符合预期,千行级数据处理效率无压力。如果列中存在不含下划线的字符串,代码会自动保留原内容,无需额外适配。
内容的提问来源于stack exchange,提问作者Master_T
相关产品推荐
相关产品推荐

