You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何用Python Scrapy正确爬取阿里巴巴动态生成表格的公司信息

阿里巴巴公司概览信息抓取解决方案

问题根因

  • 公司概览板块为懒加载模式,普通请求返回的初始页面源码里没有对应DOM结构,就算启动Selenium如果没有触发模块加载也无法抓取到数据
  • 你使用的Xpath路径与当前阿里巴巴页面更新后的结构不匹配,所以返回空数组

方案1:直接解析页面内置JSON数据(推荐,无需Selenium)

阿里巴巴产品详情页的所有数据(含公司概览信息)都直接嵌在页面源码的window.__INITIAL_STATE__全局JS变量中,不需要等待前端渲染,直接提取解析即可,速度快、稳定性高。
你只需修改crawl_mainpage方法即可:

import scrapy
import csv
import os
import json
import re
from selectorlib import Extractor

class Spider(scrapy.Spider):
    # 其他原有代码保持不变
    def crawl_mainpage(self, response):
        # 提取页面内置的初始状态数据
        init_state_raw = re.search(r'window\.__INITIAL_STATE__ = (.*?);</script>', response.text, re.S).group(1)
        init_state = json.loads(init_state_raw)
        # 定位公司核心信息节点
        company_core_info = init_state.get('detail', {}).get('company', {}).get('coreInfo', {})
        yield {
            'product_name': response.xpath("//h1[@class='module-pdp-title']/text()").extract_first().strip(),
            'company_name': response.xpath("//a[@class='company-name company-name-lite-vb']/text()").extract_first().strip(),
            'year_of_establishment': company_core_info.get('establishYear', ''),
            'registered_capital': company_core_info.get('regCapital', ''),
            'employee_scale': company_core_info.get('employeeScale', ''),
            'business_type': company_core_info.get('businessType', '')
        }

修改完成后直接用原有scrapy crawl命令运行即可,不需要启用Selenium。


方案2:Selenium适配方案

如果必须使用渲染后的DOM抓取,需要做两处修改:

  1. 首先在settings.py中补充正确的Selenium配置:
SELENIUM_DRIVER_NAME = 'chrome'
SELENIUM_DRIVER_EXECUTABLE_PATH = '你的chromedriver本地路径'
SELENIUM_DRIVER_ARGUMENTS=['--headless=new'] # 无头模式可根据需求调整
DOWNLOADER_MIDDLEWARES = {
    'scrapy_selenium.SeleniumMiddleware': 800
}
  1. 修改爬虫代码,触发懒加载+增加元素等待逻辑:
import scrapy
import csv
from scrapy_selenium import SeleniumRequest
import os
from selectorlib import Extractor
from selenium.webdriver.common.by import By
from selenium.webdriver.support.ui import WebDriverWait
from selenium.webdriver.support import expected_conditions as EC

class Spider(scrapy.Spider):
    # 其他原有代码保持不变
    def parse(self, response):
        data = self.link_extractor.extract(response.text, base_url=response.url)
        for product in data['products']:
            parsed_url=product["link"]
            # 启用Selenium请求,注释普通请求
            yield SeleniumRequest(url=parsed_url, callback=self.crawl_mainpage)
    
    def crawl_mainpage(self, response):
        driver = response.meta['driver']
        # 滚动到公司名称区域,触发下方公司概览模块懒加载
        company_ele = driver.find_element(By.CLASS_NAME, 'company-name-lite-vb')
        driver.execute_script("arguments[0].scrollIntoView();", company_ele)
        # 等待元素加载,最长等待10秒
        wait = WebDriverWait(driver, 10)
        year_ele = wait.until(EC.presence_of_element_located((By.XPATH, "//div[contains(text(),'成立年份')]/following-sibling::div")))
        yield {
            'product_name': driver.find_element(By.CLASS_NAME, 'module-pdp-title').text.strip(),
            'year_of_establishment': year_ele.text.strip()
        }

注意:爬取阿里巴巴站点时请遵守robots协议规则,合理控制请求频率,避免触发反爬机制。

内容的提问来源于stack exchange,提问作者TheGoldBerg

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.29 22:36:06