You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何用str.split()为DataFrame部分行提取count值并设置列?

提取DataFrame字符串中的count值并生成新列

示例输入

id some_string  
1  blah,count=1,blah
2  blah,blah
3  blah,count=4,blah
4  blah,blah
5  blah,count=4,blah
6  blah,count=3,blah

期望输出

id some_string        count
1  blah,count=1,blah   1
2  blah,blah           0
3  blah,count=4,blah   4
4  blah,blah           0 
5  blah,count=4,blah   4
6  blah,count=3,blah   3

问题分析

你尝试用split方法提取时出现报错:

Length of values (4) does not match length of index (6)

原因是部分行没有count=字段,split后生成的列数不一致,无法和原DataFrame的索引对齐,导致长度不匹配。

解决方案(无需遍历行)

使用pandas的str.extract方法,通过正则表达式精准捕获count=后的数字,再填充默认值即可:

import pandas as pd

# 构造示例DataFrame(实际使用时替换为你的数据)
df = pd.DataFrame({
    'id': [1,2,3,4,5,6],
    'some_string': [
        'blah,count=1,blah',
        'blah,blah',
        'blah,count=4,blah',
        'blah,blah',
        'blah,count=4,blah',
        'blah,count=3,blah'
    ]
})

# 提取count值,无匹配则填充0并转为整数
df['count'] = df['some_string'].str.extract(r'count=(\d+)', expand=False).fillna(0).astype(int)

print(df)

代码说明

  • r'count=(\d+)':正则表达式,匹配count=后面的连续数字,括号用于捕获目标数字;
  • str.extract:提取匹配到的内容,未匹配到的行返回NaN;
  • fillna(0):将NaN替换为0;
  • astype(int):将结果转为整数类型,符合需求格式。

内容的提问来源于stack exchange,提问作者abinitio

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.23 10:05:29