You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

使用R语言抓取JFK机场航班时刻表网页的技术咨询

用rvest抓取JFK机场离港航班的XPath提取指南

嘿,看你正在用rvest处理JFK机场的离港航班数据,先帮你理清楚当前的推进方向和实操步骤:

你现在的思路很稳妥——先定位单个航班字段的XPath,验证输出没问题再开发完整代码,这能避免后续踩很多坑。你的现有代码已经迈出了第一步:

library(rvest)
Departure_url <- read_html('http://www.flightview.com/airport/JFK-New_York-NY-(Kennedy)/departures')
Departures <- Depart...

接下来可以这么推进:

  • 获取目标字段的XPath:打开浏览器的开发者工具(按F12),找到你想提取的字段(比如航班号、目的地、起飞时间),右键点击对应元素选择复制XPath,把这个路径记下来
  • 测试单个字段提取:把复制好的XPath代入代码,测试能否正确抓取内容,比如提取航班号的示例代码:
# 替换成你复制的航班号XPath
flight_numbers <- Departure_url %>% 
  html_nodes(xpath = "//div[contains(@class, 'flight-number')]") %>% 
  html_text()

# 查看输出结果,确认是否符合预期
print(flight_numbers)
  • 逐步扩展到多字段:等单个字段验证成功后,再依次添加其他需要的字段(比如预计起飞时间、实际状态、航站楼信息等),最后把所有字段整合成一个数据框,方便后续处理

提醒一句:网站的HTML结构可能会不定期更新,每次抓取前最好确认下XPath是否还能匹配到目标元素,避免出现抓取空值的情况。

内容的提问来源于stack exchange,提问作者Shardul Pendharkar

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.25 06:51:47