R语言使用dplyr的summarize统计分组后样本出现次数
代码修改方案
你要统计每支球队作为主队的参赛场次,直接调用dplyr的n()函数即可,该函数会返回每个分组的行数,刚好对应球队的分组参赛场数。注意带空格的字段名需要用反引号包裹,才能被R识别为合法变量名。
修改后的主队统计代码如下:
new_df <- df %>% group_by(home_team_name) %>% summarize( stat1 = mean(stat1), `games played` = n() )
如果要统计球队作为客队的参赛场次,只需修改分组字段即可:
away_df <- df %>% group_by(away_team_name) %>% summarize( stat1 = mean(stat1), `games played` = n() )
如果需要同时汇总单支球队的主客场总数据,可以先把数据转为长格式再分组统计,代码示例如下:
library(tidyr) total_df <- df %>% pivot_longer(cols = c(home_team_name, away_team_name), names_to = "home_away", values_to = "team_name") %>% group_by(team_name, home_away) %>% summarize( stat1 = mean(stat1), `games played` = n(), .groups = "drop" )
内容的提问来源于stack exchange,提问作者jprice
相关产品推荐
相关产品推荐

