You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

统计DataFrame含分隔符列中各文本的出现次数

统计DataFrame中分号分隔的编程语言出现次数

方法1:拆分展开后直接统计

这种方法逻辑直观,把每行的多语言拆成单独行再计数:

# 将分号分隔的字符串拆成列表,再展开为单行单语言
language_series = df['LanguageHaveWorkedWith'].str.split(';').explode()
# 统计每种语言的出现次数
language_counts = language_series.value_counts()
# 查看结果
print(language_counts)

方法2:基于独热编码求和

你已经用到了get_dummies,只需要对生成的矩阵按列求和就行——因为独热编码里的1代表对应用户使用过该语言,求和就是该语言的总出现次数:

# 生成独热编码矩阵
dummies_df = df['LanguageHaveWorkedWith'].str.get_dummies(sep=';')
# 按列求和得到每种语言的次数,可选按次数降序排序
language_counts = dummies_df.sum().sort_values(ascending=False)
# 查看结果
print(language_counts)

两种方法最终结果一致,按需选择即可。

内容的提问来源于stack exchange,提问作者Akshaj

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.08 05:12:04