Pandas将列中单元素单词列表转为字符串的报错解决
问题根源
你之前的写法全部存在逻辑错误,和列表转字符串的方法本身无关:
- 前两种for循环遍历单元格的写法:遍历得到的
cell是单元格值的临时副本,给临时变量赋值不会同步修改原DataFrame中存储的数值,因此执行完原数据没有任何变化。 - 第三种写法报错原因:
''.join()要求传入的可迭代对象内所有元素都是字符串,你直接传入整列countdf['stem']时,迭代得到的每个元素是列表类型,因此触发类型错误。 - 第四种写法触发内存错误:你在遍历DataFrame的循环中反复对整列做拼接赋值,相当于无限制叠加字符串生成,属于逻辑错误,和操作本身的内存消耗无关。
正确实现方案
你的stem列每个单元格都是仅存1个词干字符串的单元素列表,不需要写显式循环,用pandas原生操作效率最高:
# 最适配当前场景的写法:直接取每个单元素列表的第0位即可 countdf['stem'] = countdf['stem'].str[0]
如果要兼容可能存在的空列表边界情况,避免索引越界报错,可以用apply加判断兜底:
# 空列表会被转换为空字符串,不会报错 countdf['stem'] = countdf['stem'].apply(lambda x: x[0] if len(x) > 0 else '')
如果后续遇到列表内存多个词干需要拼接为单个字符串的场景,再使用join逻辑即可:
# 多元素列表拼接为字符串的通用写法,当前单元素场景也可使用但没有必要 countdf['stem'] = countdf['stem'].apply(lambda x: ''.join(x))
执行完成后可以打印print(countdf['stem'].dtype)确认类型为object(pandas中字符串默认存储为object类型),打印列值会直接输出word格式,不再是带方括号的列表形式。
内容的提问来源于stack exchange,提问作者BearlyThinking
相关产品推荐
相关产品推荐

