如何统计DataFrame格式存储的文本数据集的总字符数量
统计总字符数的实现方法
你现有的词数统计逻辑是将每行文本按空格拆分得到词列表后统计列表长度,再汇总全表的总词数。要统计字符数只需直接计算每个文本字符串的长度后求和即可。
1. 包含空格、标点的全字符统计
两种写法均可,第二种是Pandas原生向量化操作,执行效率更高:
# 写法1:沿用apply的逻辑修改 dt['text'].apply(lambda x: len(x)).sum() # 写法2:更高效的向量化写法 dt['text'].str.len().sum()
2. 排除空格的纯文本字符统计
如果不需要把空格计入总字符数,可以先替换掉空格再统计:
dt['text'].str.replace(' ', '').str.len().sum()
内容的提问来源于stack exchange,提问作者user16796049
相关产品推荐
相关产品推荐

