如何在Pandas中统计不含空格的token数量
你之前使用的str.len()是统计整个字符串的总长度,会包含空格、标点等所有字符,不符合你统计不含空格相关数值的需求,你可以根据实际需求选择以下两种实现方案:
方案1:统计以空格分隔的token总个数(每个token天然不含空格)
用str.split()按空格分割字符串为token列表后直接统计列表长度即可,str.split()默认会自动忽略首尾空格、连续空格,不会生成无效空token:nlp_df['count_of_tokens'] = nlp_df['headline_text'].str.split().str.len()拿你给出的第一条数据
aba decides against community broadcasting计算,返回结果为5。方案2:统计所有非空格字符的总个数
先把字符串中所有空格替换为空,再统计总长度即可:nlp_df['count_of_tokens'] = nlp_df['headline_text'].str.replace(' ', '').str.len()拿你给出的第一条数据
aba decides against community broadcasting计算,返回结果为38。
内容的提问来源于stack exchange,提问作者Neil
相关产品推荐
相关产品推荐

