如何拆分DataFrame字符串列为独立单词并去点以统计词频
实现逻辑
以下为Python+pandas环境下的处理方案,假设你的DataFrame命名为df,存储文献摘要的列名为abstract:
方法1:循环实现(逻辑直观,适合新手)
- 第一步:遍历每一条摘要内容,先删除所有句点
- 第二步:按空格拆分单条摘要为单词列表
- 第三步:把所有单词合并到总列表中
代码示例:
import pandas as pd # 构造示例DataFrame,实际使用时替换为你自己的df即可 df = pd.DataFrame({ 'abstract': [ 'Word embeddings are an active topic in the NLP', 'We propose a new shared task for tactical data', 'We evaluate a semantic parser based on a character' ] }) abstractwords = [] for text in df['abstract']: # 先删句点,再拆分单词,追加到总列表 clean_words = text.replace('.', '').split() abstractwords.extend(clean_words) print(abstractwords)
方法2:pandas向量化实现(效率更高,适合大数据量场景)
直接调用pandas内置字符串处理函数,一行完成处理:
abstractwords = df['abstract'].str.replace('.', '', regex=False).str.split().explode().tolist()
注意:如果需要统一单词大小写,可以在替换句点后追加
.str.lower()操作即可,按需调整。
内容的提问来源于stack exchange,提问作者Paul Engelbert
相关产品推荐
相关产品推荐

