You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何从DataFrame的Visit列提取C#D#格式子串至新DataFrame?

从Pandas的Visit列提取特定格式子串的解决方案

你完全可以用str.extract来实现这个需求,这是Pandas里处理字符串提取的高效方法。核心是写对匹配规则的正则表达式,就能精准捕获你要的子串。

实现代码

import pandas as pd

# 假设你的输入数据是这样的(可替换成实际的df_input)
df_input = pd.DataFrame({
    'Visit': ['C1D1', 'C1D1', '无匹配内容', 'C1D1', 'C1D12', 'C2D9']
})

# 初始化输出DataFrame并提取目标子串
df_output = pd.DataFrame()
df_output['VISIT'] = df_input['Visit'].str.extract(r'(C\d+D\d{1,2})')

# 查看结果
print(df_output)

正则规则解释

正则表达式r'(C\d+D\d{1,2})'的每个部分对应你的需求:

  • C\d+:匹配字母C后面跟任意位数的数字(如果C后只能是1位数字,可改成C\d{1})
  • D\d{1,2}:匹配字母D后面跟1到2位数字,正好覆盖你提到的D1、D12、D9这类变体
  • 括号()是捕获组,str.extract会只返回这个组匹配到的内容,没有匹配项的单元格会自动填充NaN(也就是你要的空值)

示例输出

运行上面的代码后,输出的df_output会是:

VISIT
0    C1D1
1    C1D1
2     NaN
3    C1D1
4   C1D12
5     C2D9

完全符合你期望的结果,包含空值和各种变体的正确提取。

内容的提问来源于stack exchange,提问作者A-Simone

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.15 00:31:03