You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何在Python/Pandas中从DataFrame的data1列提取姓名并新增data2列?

从DataFrame的data1列提取姓名到data2列的解决方案

你需要从格式固定的字符串里精准提取姓名部分,这里有两种实用方法,结合你的示例数据来具体说明:

方法一:正则表达式(通用适配型)

正则表达式能灵活应对不同的后续内容格式,不管姓名后面的城市是1个还是多个单词,都能准确提取姓名:

先构造示例DataFrame:

import pandas as pd

df = pd.DataFrame({
    'data1': [
        'info name: Michael Jackson New York',
        'info 12 name: Michael Jordan III Los Angeles'
    ]
})

接着用str.extract配合正则实现提取:

# 正则逻辑:匹配"name: "后的内容,直到遇到结尾处的大写开头单词序列(即城市部分)
df['data2'] = df['data1'].str.extract(r'name: (.*?)(?=\s+(?:[A-Z][a-z]+\s*)+$)')

执行后就能得到目标结果:

data1data2
0info name: Michael Jackson New YorkMichael Jackson
1info 12 name: Michael Jordan III Los AngelesMichael Jordan III

方法二:字符串分割(场景专属型)

如果你的数据里,姓名后面的城市始终是2个单词,用字符串分割会更简洁直观:

# 先按"name: "分割取后半段内容,再从右侧分割2次,取第一部分即为姓名
df['data2'] = df['data1'].str.split('name: ').str[1].str.rsplit(' ', 2).str[0]

小提示

  • 如果你的数据存在特殊格式(比如城市是单个单词、姓名后跟着非城市的大写内容),优先选正则表达式的方法,适配性更强;
  • 处理前可以先检查data1列的空值情况,避免出现报错。

内容的提问来源于stack exchange,提问作者mrichman

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.12 04:37:17