如何用dplyr为数据框按国家添加对应顶级商品列?
解决方法:为分组DataFrame批量填充国家顶级商品
嘿,这个问题我熟!你现在的问题是ifelse只做了单行判断,没利用分组的特性来给同一国家的所有行统一填充顶级商品。其实用dplyr的分组内操作就能轻松搞定,而且完全可以嵌入你的管道里:
直接利用现有分组的解决方案
因为你的df已经是按country分组的grouped_df,所以直接在mutate里提取组内CommodRank == 1对应的Main_Commod即可:
df %>% mutate(topcommod = first(Main_Commod[CommodRank == 1]))
原理说明
- 在分组后的DataFrame中,
mutate的操作会逐组执行:对每个国家的组,Main_Commod[CommodRank == 1]会筛选出该国家所有顶级商品(即CommodRank为1的商品名称); first()函数用来取筛选结果的第一个值(因为同一国家的顶级商品应该是一致的,比如埃塞俄比亚的顶级商品都是Gold),这样整个国家组的所有行都会填充这个值。
如果DataFrame未预先分组的情况
如果你的DataFrame还没按country分组,只需要先加上group_by(country)即可:
df %>% group_by(country) %>% mutate(topcommod = first(Main_Commod[CommodRank == 1])) %>% ungroup() # 可选:如果后续不需要保留分组状态
效果验证
执行完代码后,埃塞俄比亚第3行的topcommod就会显示Gold,而不是之前的unknown,同一国家的所有行都会统一显示该国的顶级商品。
内容的提问来源于stack exchange,提问作者dad
相关产品推荐
相关产品推荐

