如何在R语言中从航班数据集找出最繁忙的航线?
用R找出最繁忙的航线
首先确保你安装并加载了dplyr包(R中常用的数据处理工具):
# 未安装则执行此句 install.packages("dplyr") # 加载包 library(dplyr)
核心实现代码
假设你的数据集存储在名为flights_data的数据框中,执行以下代码即可生成需求的汇总结果:
busy_routes <- flights_data %>% # 按出发地、目的地分组(航线定义为 origin -> dest 单向) group_by(origin, dest) %>% # 统计每组航班数量 summarise(total_flights = n(), .groups = "drop") %>% # 生成格式为「出发地->目的地」的Route列 mutate(Route = paste(origin, dest, sep = "->")) %>% # 按航班数降序排序,最繁忙航线排在最前 arrange(desc(total_flights)) %>% # 保留需要的两列 select(Route, total_flights)
额外场景处理
如果需要将A->B和B->A视为同一条双向航线,可调整代码统一航线顺序:
busy_routes_bidirectional <- flights_data %>% # 统一航线两端的排序,确保往返航线被归为一组 mutate( route_start = pmin(origin, dest), route_end = pmax(origin, dest) ) %>% group_by(route_start, route_end) %>% summarise(total_flights = n(), .groups = "drop") %>% mutate(Route = paste(route_start, route_end, sep = "<->")) %>% arrange(desc(total_flights)) %>% select(Route, total_flights)
基础R替代方案
如果不想使用dplyr,也可以用基础R函数实现:
# 统计所有单向航线的航班数 route_counts <- table(paste(flights_data$origin, flights_data$dest, sep = "->")) # 转换为数据框并排序 busy_routes_base <- data.frame( Route = names(route_counts), total_flights = as.numeric(route_counts) ) %>% arrange(desc(total_flights))
内容的提问来源于stack exchange,提问作者Jay
相关产品推荐
相关产品推荐

