You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何高效将Pandas DataFrame中列的句子转换为列表?

解决方案:DataFrame中文文本分词转换为词语列表

要实现把DataFrame中指定列的文本拆分为词语列表的需求,最高效的方式是结合pandas的列处理能力和中文分词库jieba,具体步骤如下:

  1. 安装jieba(如果未安装):
pip install jieba
  1. 编写处理代码:
import pandas as pd
import jieba

# 构造原始DataFrame
df = pd.DataFrame({
    "表头A": ["第一行", "第二行"],
    "另一表头": ["我喜欢苹果", "Alex和Jack是朋友"]
})

# 对"另一表头"列进行分词,转换为词语列表
df["另一表头"] = df["另一表头"].apply(lambda text: list(jieba.cut(text)))

# 查看结果
print(df)

运行后会得到你期望的结果:

表头A另一表头
第一行['我', '喜欢', '苹果']
第二行['Alex', '和', 'Jack', '是', '朋友']

补充说明

  • jieba.cut()会返回一个分词生成器,转成列表正好匹配需求格式,它能自动识别中英文混合文本里的英文单词(比如Alex、Jack),不会拆分这类词汇。
  • apply()是pandas中批量处理列数据的高效方法,适配大规模DataFrame的处理场景。
  • 如果有特定专业词汇需要精准分词,可以通过jieba.load_userdict()加载自定义词典,避免专业词被错误拆分。

内容的提问来源于stack exchange,提问作者nerd

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.12 20:50:28