You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Python网络爬虫无法抓取目标网站最新资讯问题求助

问题解决:evofenedex.nl新闻爬虫抓取旧内容的修复

问题分析

当前爬虫抓取https://www.evofenedex.nl/actualiteiten/时,获取的是第二页的旧内容,核心原因:

  • 元素选择逻辑未精准锁定第一页的最新新闻条目,误抓取了分页区域的内容
  • 链接提取依赖正则解析字符串,容易匹配到非目标区域的链接,导致数据错位

修复方案

1. 精准定位新闻容器

该网站最新新闻列表位于div.block--actualiteiten下的div.list容器内,调整选择器可直接锁定第一页的所有最新新闻条目,避免干扰。

2. 直接从标签提取信息

放弃正则解析字符串的不可靠方式,直接从新闻条目的标签中提取标题、日期和链接,保证数据对应准确。

修复后的evofenedex爬虫代码片段

# evofenedex    
if index == 0:
    # Parse the HTML content
    soup = BeautifulSoup(response.text, 'html.parser')
    
    # 精准定位第一页新闻列表容器
    news_container = soup.find('div', class_='block--actualiteiten').find('div', class_='list')
    news_items = news_container.find_all('div', class_='list__item')
    
    titles = []
    dates = []
    links = []
    
    for item in news_items:
        # 提取标题
        title_tag = item.find('p', class_='list__title')
        titles.append(title_tag.text.strip())
        # 提取日期
        date_tag = item.find('p', class_='list__subtitle')
        dates.append(date_tag.text.strip())
        # 提取链接(直接从a标签获取href)
        link_tag = title_tag.find('a')
        links.append(f"https://www.evofenedex.nl{link_tag['href']}")
    
    title_element = titles
    date_element = dates

3. 整体逻辑优化说明

  • 移除原代码中循环匹配title属性找链接的冗余逻辑,直接从单条新闻条目内提取所有信息,避免数据错位
  • 确保title_element、date_element、links三者的索引完全对应,保证Excel写入的内容准确匹配

验证效果

修复后重新运行爬虫,抓取的第一条数据将对应网站首页展示的最新新闻,而非第二页的旧内容。

内容的提问来源于stack exchange,提问作者Marco Geertsma

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.02 02:54:53