R语言爬虫爬取IMDB电影数据时缺失票房自动插入NA的方法问询
R语言爬取IMDB票房缺失值自动填充NA方案
你原有代码存在两个问题:
- 全局匹配票房节点时会自动跳过无票房字段的电影,得到的向量长度和总电影数不匹配,无法对应位置插入NA
- 存在变量名笔误:你将匹配到的节点赋值给了
gross,后续提取文本时调用了未定义的gross_data变量,运行会直接报错
正确实现方案如下:
library(rvest) # 加载目标页面 webpage <- read_html('https://www.imdb.com/search/title/?count=100&release_date=2019,2019&title_type=feature') # 定位每部电影的独立父容器 movie_items <- html_nodes(webpage, '.lister-item.mode-advanced') # 遍历每个电影容器提取票房,无票房则自动填充NA gross <- sapply(movie_items, function(item) { # 仅在当前电影容器内匹配票房节点,匹配不到返回空节点 gross_node <- html_node(item, '.ghost ~ .text-muted + span') # 节点存在则返回文本,否则返回NA ifelse(length(gross_node) > 0, html_text(gross_node), NA_character_) })
逻辑说明
- 采用父容器遍历的方式提取字段,最终得到的
gross向量长度和爬取的总电影数完全一致,缺失票房的电影对应位置自动插入NA,顺序和页面展示的电影顺序完全匹配 - 用
html_node()而非html_nodes()做单节点匹配,匹配不到时会返回空节点,方便做存在性判断 - 若后续需要做数值计算,可以对
gross向量做文本清洗,去除$、M等符号后转为数值格式,NA会自动保留
内容的提问来源于stack exchange,提问作者Empowered
相关产品推荐
相关产品推荐

