Python网络爬虫无法抓取目标网站最新资讯问题求助
问题解决:evofenedex.nl新闻爬虫抓取旧内容的修复
问题分析
当前爬虫抓取https://www.evofenedex.nl/actualiteiten/时,获取的是第二页的旧内容,核心原因:
- 元素选择逻辑未精准锁定第一页的最新新闻条目,误抓取了分页区域的内容
- 链接提取依赖正则解析字符串,容易匹配到非目标区域的链接,导致数据错位
修复方案
1. 精准定位新闻容器
该网站最新新闻列表位于div.block--actualiteiten下的div.list容器内,调整选择器可直接锁定第一页的所有最新新闻条目,避免干扰。
2. 直接从标签提取信息
放弃正则解析字符串的不可靠方式,直接从新闻条目的标签中提取标题、日期和链接,保证数据对应准确。
修复后的evofenedex爬虫代码片段
# evofenedex if index == 0: # Parse the HTML content soup = BeautifulSoup(response.text, 'html.parser') # 精准定位第一页新闻列表容器 news_container = soup.find('div', class_='block--actualiteiten').find('div', class_='list') news_items = news_container.find_all('div', class_='list__item') titles = [] dates = [] links = [] for item in news_items: # 提取标题 title_tag = item.find('p', class_='list__title') titles.append(title_tag.text.strip()) # 提取日期 date_tag = item.find('p', class_='list__subtitle') dates.append(date_tag.text.strip()) # 提取链接(直接从a标签获取href) link_tag = title_tag.find('a') links.append(f"https://www.evofenedex.nl{link_tag['href']}") title_element = titles date_element = dates
3. 整体逻辑优化说明
- 移除原代码中循环匹配
title属性找链接的冗余逻辑,直接从单条新闻条目内提取所有信息,避免数据错位 - 确保
title_element、date_element、links三者的索引完全对应,保证Excel写入的内容准确匹配
验证效果
修复后重新运行爬虫,抓取的第一条数据将对应网站首页展示的最新新闻,而非第二页的旧内容。
内容的提问来源于stack exchange,提问作者Marco Geertsma
相关产品推荐
相关产品推荐

