You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何为DataFrame的companies列生成按序计数的occurrences列

为DataFrame生成按公司出现顺序的计数列解决方案

首先得说,你手动写循环的时候确实踩了几个典型的坑,我先帮你梳理下现有代码的问题:

  • 无限循环风险:while str(companies[i]) == str(companies[i+1]) 会在同公司连续出现时一直跑,而且当i到最后一行时,i+1直接索引越界,这肯定会出问题
  • 逻辑混乱:嵌套的if语句和companies.str.count(companies[i])会返回整列的计数,而不是当前行的累计序号,完全不符合你要的按出现顺序计数的需求
  • 变量问题:函数名和内部列表都叫occurrences,容易搞混;最后返回的round_number根本没定义,这代码跑起来肯定报错

其实pandas早就帮我们封装好了这种需求的工具,完全不用写这么复杂的循环,给你两种靠谱的方案:

方法一:用pandas内置的groupby+cumcount(推荐)

这是最简洁高效的方式,一行代码搞定:

import pandas as pd

# 假设你的DataFrame名为df
df['occurrences'] = df.groupby('companies').cumcount() + 1

原理说明:

  • groupby('companies') 把数据按公司名称分组
  • cumcount() 会对每个分组内的行从0开始依次计数,加1之后就得到了你要的从1开始的连续序号
  • 这种方式完全利用pandas的向量化操作,比手动循环快得多,尤其适合大数据量的场景

方法二:手动实现(适合理解底层逻辑)

如果你想搞清楚底层怎么实现的,也可以用字典来记录每个公司的当前计数,避免依赖相邻行比较的错误逻辑:

def add_occurrences(df):
    company_counts = {}
    occurrences_list = []
    for company in df['companies']:
        # 公司第一次出现,初始化为1;否则计数加1
        if company not in company_counts:
            company_counts[company] = 1
        else:
            company_counts[company] += 1
        occurrences_list.append(company_counts[company])
    df['occurrences'] = occurrences_list
    return df

# 调用函数生成新列
df = add_occurrences(df)

这个方法逻辑清晰,不会出现索引越界或者无限循环的问题,每一步都能看到计数是怎么累计的。

最终效果验证

不管用哪种方法,你都会得到期望的结果:

companiesoccurrences
company 11
company 12
company 13
company 21
company 22
company 31
company 41
company 42
company 51
company 52
company 53
company 54

内容的提问来源于stack exchange,提问作者tawny_burrito

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.14 08:20:30