统计DataFrame含分隔符列中各文本的出现次数
统计DataFrame中分号分隔的编程语言出现次数
方法1:拆分展开后直接统计
这种方法逻辑直观,把每行的多语言拆成单独行再计数:
# 将分号分隔的字符串拆成列表,再展开为单行单语言 language_series = df['LanguageHaveWorkedWith'].str.split(';').explode() # 统计每种语言的出现次数 language_counts = language_series.value_counts() # 查看结果 print(language_counts)
方法2:基于独热编码求和
你已经用到了get_dummies,只需要对生成的矩阵按列求和就行——因为独热编码里的1代表对应用户使用过该语言,求和就是该语言的总出现次数:
# 生成独热编码矩阵 dummies_df = df['LanguageHaveWorkedWith'].str.get_dummies(sep=';') # 按列求和得到每种语言的次数,可选按次数降序排序 language_counts = dummies_df.sum().sort_values(ascending=False) # 查看结果 print(language_counts)
两种方法最终结果一致,按需选择即可。
内容的提问来源于stack exchange,提问作者Akshaj
相关产品推荐
相关产品推荐

