R语言处理芝加哥Divvy骑行数据:排序热门站点遇缓存类报错求助
解决思路与正确代码
首先你代码的核心逻辑错了:你现在是对站点名称按字母降序取前10,这根本不是找「热门站点」(热门指的是骑行次数最多的站点)。
正确的步骤应该是先统计每个站点的骑行次数,再按次数排序取前10,同时精准处理缺失值:
top_ten <- all_trips %>% # 只过滤站点名称为空的行,避免na.omit误删其他列有缺失但站点有效的数据 filter(!is.na(start_station_name)) %>% # 按站点名称分组 group_by(start_station_name) %>% # 统计每个站点的骑行次数,命名为trip_count summarise(trip_count = n()) %>% # 按骑行次数降序排序 arrange(desc(trip_count)) %>% # 取前10个热门站点 head(10)
你之前遇到的错误大概率是RStudio的缓存异常导致的,修正代码逻辑后,建议重启RStudio、清空环境(点右上角垃圾桶图标),重新加载数据再运行代码。如果还有问题,可以检查下all_trips数据的结构,用str(all_trips)看看start_station_name列的类型是否正常。
内容的提问来源于stack exchange,提问作者Gustivan Pangestu
相关产品推荐
相关产品推荐

