You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

DataFrame中字符串列表列与整数列表列对应重复的实现问题

解决DataFrame中按对应次数重复列表元素的问题

我来帮你搞定这个需求!你想要的是把word列里的每个字符串,按照mentioned列对应位置的整数次数重复,生成新的word列对吧?之前用multiply或者普通for循环没成功,主要是因为没处理好逐元素配对重复的逻辑,下面给你两种可行的方法:

方法一:自定义函数+apply

先构造你的示例DataFrame,然后用apply逐行处理,把每个单词和对应的次数配对后展开:

import pandas as pd

# 初始化你的数据
df = pd.DataFrame({
    'url': ['newspaperarticle.com', 'articleUSA.com'],
    'date': ['2018-12-22', '2018-12-23'],
    'word': [['canada','house','micheal'], ['new york','murder','angry']],
    'mentioned': [[2,2,1], [2,3,1]]
})

# 定义处理每行的函数
def expand_words(row):
    repeated_list = []
    # 遍历配对的单词和次数
    for word, count in zip(row['word'], row['mentioned']):
        # 把当前单词重复count次,添加到结果列表
        repeated_list.extend([word] * count)
    return repeated_list

# 应用函数更新word列
df['word'] = df.apply(expand_words, axis=1)

print(df)

运行后就能得到你期望的结果:

url        date                                              word mentioned
0  newspaperarticle.com  2018-12-22           [canada, canada, house, house, micheal]   [2, 2, 1]
1        articleUSA.com  2018-12-23  [new york, new york, murder, murder, murder, angry]   [2, 3, 1]

方法二:更简洁的lambda表达式

如果想少写几行代码,可以用嵌套列表推导式把逻辑压缩到apply里:

df['word'] = df.apply(
    lambda row: [word for word, cnt in zip(row['word'], row['mentioned']) for _ in range(cnt)],
    axis=1
)

这个写法和方法一逻辑完全一致,只是更紧凑。

为什么之前的方法失败?

  • 用multiply列运算:df['word'] * df['mentioned']这种操作是把整个word列表重复mentioned列表对应的次数(但因为是列表和列表相乘,pandas会报错或者不符合预期),而不是每个元素对应次数重复,所以达不到效果。
  • 普通for循环越界:如果你的循环是直接按索引遍历,比如for i in range(len(df)): for j in range(len(df['word'][i])):,可能因为某行的word和mentioned长度不匹配(或者索引处理错误)导致越界,而用zip配对的话会自动按最短的列表截断,更安全。

内容的提问来源于stack exchange,提问作者nastan

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.07 12:07:30