R语言rvest网页抓取代码中`[[`(6)的含义是什么?
问题解答
一、代码中[[(6)的含义
你这段爬虫代码里,html_nodes("table")执行后会返回一个类列表的xml_nodeset对象,其中的每个元素对应维基百科页面上解析到的一个<table>标签节点。
R中[[是专门用来提取列表/向量单个元素的操作符,你这里是配合管道符的函数式写法:%>% [[(6)等价于在html_nodes("table")的返回结果上执行[[6]],作用就是提取列表中第6个位置的元素,也就是页面上的第6个表格节点。这里把[[用反引号包裹是因为[是R里的特殊操作符,要作为函数在管道后调用的话,需要用反引号括起来才能正常识别。
这里用[[而不是[的原因是:[6]返回的是长度为1的「子列表」,而[[6]]直接返回列表第6位存储的表格节点对象,只有拿到这个节点对象才能正常调用html_table()把表格内容解析为数据框。
二、文档说明的解释
你查到的这段说明指的是[[作用在向量、矩阵这类结构上的特殊表现,和你代码里用在列表上的常见场景有差异,具体拆解如下:
- 丢弃属性:比如你有一个带命名的向量
vec <- c(苹果=3, 香蕉=5, 橙子=2)- 用
[2]提取时,返回结果会保留名称属性:香蕉 5 - 用
[[2]]提取时,会丢弃名称属性,仅返回元素本身的值:5
矩阵场景同理,用[[取单个元素时会丢弃行名、列名等属性,直接返回纯数值。
- 用
- 字符索引部分匹配:如果用字符作为索引取值,
[[支持模糊匹配:vec <- c(apple=1, banana=2, cherry=3) # [[支持部分匹配,exact=FALSE时可以匹配到前缀对应的键 vec[["app", exact=FALSE]] # 返回1 # [默认精确匹配,找不到对应键就返回NA vec["app"] # 返回NA
这类向量、矩阵场景下[[确实用的比较少,日常爬虫场景里[[最常用的功能就是提取列表的单个元素。
内容的提问来源于stack exchange,提问作者Sachin
相关产品推荐
相关产品推荐

