情感分析DataFrame中混合的标签与评论内容拆分提取方法咨询
实现方案
假设你的原始数据集存储在df对象中,包含标签和评论的混合内容列名称为text,可通过pandas内置的字符串拆分方法一步完成需求:
import pandas as pd # 按反斜杠仅拆分1次,防止评论内容中存在反斜杠导致异常 df[['Label', 'text']] = df['text'].str.split(pat='\\\\', n=1, expand=True) # 转换标签列格式为整数,适配后续情感分析建模 df['Label'] = df['Label'].astype(int)
注意事项
- 匹配规则写
\\\\是因为Python字符串和正则语法都需要对反斜杠转义,最终会匹配到文本中的单个反斜杠分隔符 - 若原始文本列存在空值,可添加
na_action='ignore'参数避免报错:
df[['Label', 'text']] = df['text'].str.split(pat='\\\\', n=1, expand=True, na_action='ignore')
执行完成后,原有文本列会自动清除前缀的标签内容,仅保留评论文本,新增的Label列会存储对应的0/1分类标签。
内容的提问来源于stack exchange,提问作者mahdi rafiei
相关产品推荐
相关产品推荐

