You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

R语言爬虫爬取IMDB电影数据时缺失票房自动插入NA的方法问询

R语言爬取IMDB票房缺失值自动填充NA方案

你原有代码存在两个问题:

  1. 全局匹配票房节点时会自动跳过无票房字段的电影,得到的向量长度和总电影数不匹配,无法对应位置插入NA
  2. 存在变量名笔误:你将匹配到的节点赋值给了gross,后续提取文本时调用了未定义的gross_data变量,运行会直接报错

正确实现方案如下:

library(rvest)
# 加载目标页面
webpage <- read_html('https://www.imdb.com/search/title/?count=100&release_date=2019,2019&title_type=feature')
# 定位每部电影的独立父容器
movie_items <- html_nodes(webpage, '.lister-item.mode-advanced')
# 遍历每个电影容器提取票房,无票房则自动填充NA
gross <- sapply(movie_items, function(item) {
  # 仅在当前电影容器内匹配票房节点,匹配不到返回空节点
  gross_node <- html_node(item, '.ghost ~ .text-muted + span')
  # 节点存在则返回文本,否则返回NA
  ifelse(length(gross_node) > 0, html_text(gross_node), NA_character_)
})

逻辑说明

  • 采用父容器遍历的方式提取字段,最终得到的gross向量长度和爬取的总电影数完全一致,缺失票房的电影对应位置自动插入NA,顺序和页面展示的电影顺序完全匹配
  • 用html_node()而非html_nodes()做单节点匹配,匹配不到时会返回空节点,方便做存在性判断
  • 若后续需要做数值计算,可以对gross向量做文本清洗,去除$、M等符号后转为数值格式,NA会自动保留

内容的提问来源于stack exchange,提问作者Empowered

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.29 10:57:05