如何删除含特定值的元组行并拆分数据集?解决代码无效问题
解决方法
1. 筛除包含"tolak"的行
你之前的代码没起作用,核心原因是它只判断stemming列的元素是否完全等于('tolak'),但你的数据里都是列表(比如[go, tolak, experience]),只要列表里包含"tolak"就该被排除,得换个判断逻辑:
# 提取不包含"tolak"的行到新数据集 df_new = df[~df['stemming'].apply(lambda x: 'tolak' in x)]
lambda x: 'tolak' in x:逐个检查每个列表里是否存在"tolak"~:取反操作,最终保留所有不包含"tolak"的行
2. 删除空列表的行
完成第一步后,再移除包含空列表[]的行:
# 移除空列表行 df_clean = df_new[df_new['stemming'].apply(lambda x: len(x) > 0)]
或者更简洁的写法:
df_clean = df_new[df_new['stemming'] != []]
示例运行结果
用你给出的测试数据执行后,df_new会保留第2、3行的数据;如果原数据存在空列表行,df_clean会自动剔除这些行。
内容的提问来源于stack exchange,提问作者Dewani
相关产品推荐
相关产品推荐

