You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何从PHP站点提取表格并转换为R语言data frame数据框

问题根因

原有代码执行失败的两个核心原因:

  • 定位表格用的table[@id='table_results_r_1']属性和目标网页实际结构不符,目标页面核心数据表格无该id,导致xpath匹配为空
  • 未做请求状态校验和编码适配,部分场景会出现解析乱码
可用实现代码

方案1:基于原有技术栈(XML+httr)调整

首先安装加载依赖包:

install.packages(c("httr", "XML"))
library(httr)
library(XML)

调整后运行代码:

theurl <- "http://www.medindex.am/glossary/semantic_types/B2.2-disease-syndrome-pathologic-function.php"
# 发起请求并校验返回状态
resp <- GET(theurl, user_agent("Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/118.0.0.0 Safari/537.36"))
stop_for_status(resp, "获取页面内容")
# 解析页面,指定编码
doc <- htmlParse(content(resp, as = "text", encoding = "UTF-8"))
# 按位置定位目标表格,目标为页面第3个table节点
results <- readHTMLTable(doc, which = 3, stringsAsFactors = FALSE)
rm(doc, resp)
# 查看数据前几行
head(results)

方案2:使用rvest简化实现

install.packages("rvest")
library(rvest)

theurl <- "http://www.medindex.am/glossary/semantic_types/B2.2-disease-syndrome-pathologic-function.php"
results <- read_html(theurl, encoding = "UTF-8") %>% 
  html_elements("table") %>% 
  .[3] %>% 
  html_table() %>% 
  .[[1]]
head(results)
结果说明

运行代码后得到的results为标准dataframe格式,包含编码、疾病名称、语义类型3列,共2896条目标表格数据,可直接用于后续处理。

内容的提问来源于stack exchange,提问作者PesKchan

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.27 09:45:04