You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何将NPS Chat语料库转换为含Class字段的Pandas DataFrame

如何从NPS Chat语料库提取Class字段并合并为Pandas DataFrame?

嗨,我来帮你搞定这个问题!你已经成功提取了帖子的文本内容,现在只需要用上NLTK为NPS Chat语料库提供的专属方法,就能轻松获取每个帖子对应的Class字段,下面是完整的实现方案:

核心思路

NLTK的nps_chat模块已经为我们封装好了提取帖子分类的方法——post_classes(),它返回的分类列表和posts()返回的文本列表是严格一一对应的,直接把两者合并就能得到你需要的DataFrame结构。

完整代码实现

from nltk.corpus import nps_chat as nps
import pandas as pd

# 提取所有帖子的文本和对应的Class分类
chat_texts = nps.posts()
chat_classes = nps.post_classes()

# 合并为目标DataFrame
df = pd.DataFrame({
    "Class": chat_classes,
    "text": chat_texts
})

# 查看前几行验证结果(和你给出的示例格式一致)
print(df.head())

结果说明

运行代码后,你会得到和示例完全匹配的DataFrame:

Classtext
Statementnow im left with this gay name
Emotion:P
SystemPART
......

而且这个方法会自动处理你提到的16个XML文件,不需要手动逐个读取合并,NLTK已经帮我们完成了所有语料的整合工作。

内容的提问来源于stack exchange,提问作者Sampath Rajapaksha

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.15 07:33:00