在Jupyter中为行数不同的两个DataFrame按Id匹配填充Price列
高效实现DataFrame按Id匹配填充Price列
你的嵌套循环写法不仅效率极低(1000行×30行会做3万次判断),还存在语法错误——for i in nop遍历的是DataFrame的列名而非行索引,实际运行会报错。用pandas内置的向量化操作能轻松解决这个问题,推荐两种简便高效的方法:
方法一:merge合并(直观易读)
先删除nop中原有空Price列,再按Id列做左连接,保留nop所有行的同时匹配对应Price值:
# 删除原有空Price列 nop.drop('Price', axis=1, inplace=True) # 按Id左连接,仅关联pricing的Id和Price列 nop = nop.merge(pricing[['Id', 'Price']], on='Id', how='left') # 对匹配不到的Id,将Price填充为空字符串(按需调整) nop['Price'] = nop['Price'].fillna('')
方法二:map字典映射(简洁高效)
先把pricing转换成Id到Price的映射字典,再用map方法快速填充:
# 构建Id与Price的映射字典 price_map = pricing.set_index('Id')['Price'].to_dict() # 批量填充nop的Price列 nop['Price'] = nop['Id'].map(price_map) # 匹配不到的Id填充空字符串 nop['Price'] = nop['Price'].fillna('')
这两种方法都是pandas原生的向量化操作,比嵌套循环效率高几十倍以上,数据量越大优势越明显。
内容的提问来源于stack exchange,提问作者marky
相关产品推荐
相关产品推荐

