DataFrame中字符串列表列与整数列表列对应重复的实现问题
解决DataFrame中按对应次数重复列表元素的问题
我来帮你搞定这个需求!你想要的是把word列里的每个字符串,按照mentioned列对应位置的整数次数重复,生成新的word列对吧?之前用multiply或者普通for循环没成功,主要是因为没处理好逐元素配对重复的逻辑,下面给你两种可行的方法:
方法一:自定义函数+apply
先构造你的示例DataFrame,然后用apply逐行处理,把每个单词和对应的次数配对后展开:
import pandas as pd # 初始化你的数据 df = pd.DataFrame({ 'url': ['newspaperarticle.com', 'articleUSA.com'], 'date': ['2018-12-22', '2018-12-23'], 'word': [['canada','house','micheal'], ['new york','murder','angry']], 'mentioned': [[2,2,1], [2,3,1]] }) # 定义处理每行的函数 def expand_words(row): repeated_list = [] # 遍历配对的单词和次数 for word, count in zip(row['word'], row['mentioned']): # 把当前单词重复count次,添加到结果列表 repeated_list.extend([word] * count) return repeated_list # 应用函数更新word列 df['word'] = df.apply(expand_words, axis=1) print(df)
运行后就能得到你期望的结果:
url date word mentioned 0 newspaperarticle.com 2018-12-22 [canada, canada, house, house, micheal] [2, 2, 1] 1 articleUSA.com 2018-12-23 [new york, new york, murder, murder, murder, angry] [2, 3, 1]
方法二:更简洁的lambda表达式
如果想少写几行代码,可以用嵌套列表推导式把逻辑压缩到apply里:
df['word'] = df.apply( lambda row: [word for word, cnt in zip(row['word'], row['mentioned']) for _ in range(cnt)], axis=1 )
这个写法和方法一逻辑完全一致,只是更紧凑。
为什么之前的方法失败?
- 用
multiply列运算:df['word'] * df['mentioned']这种操作是把整个word列表重复mentioned列表对应的次数(但因为是列表和列表相乘,pandas会报错或者不符合预期),而不是每个元素对应次数重复,所以达不到效果。 - 普通for循环越界:如果你的循环是直接按索引遍历,比如
for i in range(len(df)): for j in range(len(df['word'][i])):,可能因为某行的word和mentioned长度不匹配(或者索引处理错误)导致越界,而用zip配对的话会自动按最短的列表截断,更安全。
内容的提问来源于stack exchange,提问作者nastan
相关产品推荐
相关产品推荐

