使用R语言抓取JFK机场航班时刻表网页的技术咨询
用rvest抓取JFK机场离港航班的XPath提取指南
嘿,看你正在用rvest处理JFK机场的离港航班数据,先帮你理清楚当前的推进方向和实操步骤:
你现在的思路很稳妥——先定位单个航班字段的XPath,验证输出没问题再开发完整代码,这能避免后续踩很多坑。你的现有代码已经迈出了第一步:
library(rvest) Departure_url <- read_html('http://www.flightview.com/airport/JFK-New_York-NY-(Kennedy)/departures') Departures <- Depart...
接下来可以这么推进:
- 获取目标字段的XPath:打开浏览器的开发者工具(按F12),找到你想提取的字段(比如航班号、目的地、起飞时间),右键点击对应元素选择复制XPath,把这个路径记下来
- 测试单个字段提取:把复制好的XPath代入代码,测试能否正确抓取内容,比如提取航班号的示例代码:
# 替换成你复制的航班号XPath flight_numbers <- Departure_url %>% html_nodes(xpath = "//div[contains(@class, 'flight-number')]") %>% html_text() # 查看输出结果,确认是否符合预期 print(flight_numbers)
- 逐步扩展到多字段:等单个字段验证成功后,再依次添加其他需要的字段(比如预计起飞时间、实际状态、航站楼信息等),最后把所有字段整合成一个数据框,方便后续处理
提醒一句:网站的HTML结构可能会不定期更新,每次抓取前最好确认下XPath是否还能匹配到目标元素,避免出现抓取空值的情况。
内容的提问来源于stack exchange,提问作者Shardul Pendharkar
相关产品推荐
相关产品推荐

