You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何拆分DataFrame字符串列为独立单词并去点以统计词频

实现逻辑

以下为Python+pandas环境下的处理方案,假设你的DataFrame命名为df,存储文献摘要的列名为abstract:

方法1:循环实现(逻辑直观,适合新手)

  • 第一步:遍历每一条摘要内容,先删除所有句点
  • 第二步:按空格拆分单条摘要为单词列表
  • 第三步:把所有单词合并到总列表中
    代码示例:
import pandas as pd

# 构造示例DataFrame,实际使用时替换为你自己的df即可
df = pd.DataFrame({
    'abstract': [
        'Word embeddings are an active topic in the NLP', 
        'We propose a new shared task for tactical data', 
        'We evaluate a semantic parser based on a character'
    ]
})

abstractwords = []
for text in df['abstract']:
    # 先删句点,再拆分单词,追加到总列表
    clean_words = text.replace('.', '').split()
    abstractwords.extend(clean_words)

print(abstractwords)

方法2:pandas向量化实现(效率更高,适合大数据量场景)

直接调用pandas内置字符串处理函数,一行完成处理:

abstractwords = df['abstract'].str.replace('.', '', regex=False).str.split().explode().tolist()

注意:如果需要统一单词大小写,可以在替换句点后追加.str.lower()操作即可,按需调整。


内容的提问来源于stack exchange,提问作者Paul Engelbert

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.23 23:15:02