如何在pandas中通过向量化操作为词频矩阵新增行词数统计列
实现方案
完全可以通过pandas内置的向量化操作实现,仅需一行代码即可完成需求,执行效率远高于手动逐行遍历,尤其适合大规模词频矩阵场景。
核心代码
# 直接按行求和新增count列 df['count'] = df.sum(axis=1)
参数说明:axis=1指定计算维度为行,pandas内置的sum方法底层为优化后的向量化实现,无需手动写循环遍历逻辑。
兼容场景补充
如果你的DataFrame中除了词频数值列外,还包含其他非数值类型的辅助列,可以先筛选所有数值列再求和,避免计算异常:
# 仅对数值类型列按行求和 df['count'] = df.select_dtypes(include='number').sum(axis=1)
以上代码的计算结果和你给出的预期效果完全一致,例如索引为1的行Merkwürdig列值1加Error列值2,最终count列结果为3。
内容的提问来源于stack exchange,提问作者Roland
相关产品推荐
相关产品推荐

