You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何在循环中使用pandas str.contains?及DataFrame列元素计数实现

嘿,我来帮你搞定这两个pandas的问题~

1. 如何在循环中使用pandas的str.contains方法?

首先得说,str.contains本身是向量化操作,通常不需要循环就能处理批量数据,但如果你的场景确实需要在循环里用(比如遍历多个关键词,给每个关键词生成一个标记列),可以这么做:

示例1:遍历关键词列表,生成多个标记列

比如我们有一个文本DataFrame,要检查每行是否包含不同的关键词:

import pandas as pd

df = pd.DataFrame({'text': ['I love dogs', 'Cats are cute', 'Birds sing', 'Dogs and cats']})
keywords = ['dog', 'cat', 'bird']

# 循环每个关键词,创建对应列标记是否包含
for keyword in keywords:
    # case=False 忽略大小写,避免漏匹配
    df[f'has_{keyword}'] = df['text'].str.contains(keyword, case=False)

运行后你会得到新列has_dog、has_cat、has_bird,每行对应布尔值表示是否包含该关键词。

示例2:遍历每行检查(不推荐,效率低)

如果非要逐行处理(大数据量千万别这么干,向量化操作快得多),可以用iterrows():

matches = []
for idx, row in df.iterrows():
    # 手动检查当前行文本是否包含关键词
    is_match = 'dog' in row['text'].lower()
    matches.append(is_match)
df['has_dog'] = matches

👉 小提示:优先用向量化的str.contains,循环尽量只在必要的时候用,不然大数据量下会很慢!

2. 统计每行指定元素的出现次数

针对你说的场景:A列是逗号分隔的字符串,要统计('dog', 'bird', 'cat')这些元素在每行的出现次数,生成B列。这里有两种实用方法:

方法1:用apply自定义函数(易读性高)

import pandas as pd

# 构造你的示例DataFrame
df = pd.DataFrame({
    'A': ['dog, bird', 'cat, bird', 'dog, snake', 'cat, bird, snake', 'dog, bird, cat, snake']
})
# 把目标元素转成集合,成员检查更快
target_elements = {'dog', 'bird', 'cat'}

def count_target_matches(s):
    # 按逗号分割字符串,去掉每个元素的空格,转成集合
    row_elements = set(item.strip() for item in s.split(','))
    # 计算和目标集合的交集大小,就是出现的不同目标元素数量
    return len(row_elements & target_elements)

# 把函数应用到A列的每一行,生成B列
df['B'] = df['A'].apply(count_target_matches)

运行后就能得到你想要的结果:

A  B
0          dog, bird  2
1          cat, bird  2
2          dog, snake  1
3   cat, bird, snake  2
4  dog, bird, cat, snake  3

方法2:向量化操作(效率更高,适合大数据量)

如果你的数据量很大,apply可能不够快,可以用纯向量化的方式:

df['B'] = df['A'].str.split(',', expand=True)\
                 .apply(lambda x: x.str.strip().isin(target_elements))\
                 .sum(axis=1)

解释一下:

  1. str.split(',', expand=True)把每个字符串拆成多列;
  2. x.str.strip()去掉每个元素的空格,isin(target_elements)检查是否是目标元素;
  3. sum(axis=1)统计每行的True数量,就是目标元素的出现次数。

内容的提问来源于stack exchange,提问作者sne89

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.27 04:22:35