Scrapy Playwright无法提取div全部子元素问题求助
问题分析与解决方法
核心问题
你遇到的情况是页面DOM未完全渲染就被抓取,或者获取的HTML并非Playwright渲染后的完整内容,导致BeautifulSoup只能解析到初始的空壳节点,无法拿到实际加载的子元素。
具体修复步骤
1. 改用Playwright页面获取完整渲染后的HTML
不要使用response.text,而是通过Playwright的page.content()获取JS渲染后的完整页面源码——response.text通常只是服务器返回的初始HTML,不包含动态加载的内容。
修改parse函数:
async def parse(self, response, main_url, page_number): # 从meta中获取Playwright页面实例 page = response.meta["playwright_page"] # 获取完全渲染后的页面HTML page_html = await page.content() soup = BeautifulSoup(page_html, 'html.parser') product_containers = soup.find_all('div', class_='_1E5b _2I59 _1wkJ _3YFw igxN _7Zx6 Eb4X _390_') for product_container in product_containers: # 增加容错判断,避免找不到元素时报错 name_elem = product_container.find(class_='_1DGZ') price_elem = product_container.find(class_='_1-UB _1Evs') if name_elem and price_elem: price = re.sub(r"[\n\t\s]*", "", price_elem.get_text()) yield { 'productName': name_elem.get_text().strip(), 'price': price } # 关闭页面释放资源 await page.close()
2. 优化等待逻辑,确保子节点完全加载
原有的等待选择器仅判断父容器存在,未确保子元素加载完成,可改为等待产品的核心内容节点:
"playwright_page_methods": [ PageMethod("evaluate", scrolling_script), # 等待第一个产品的价格节点出现,确认内容已渲染 PageMethod("wait_for_selector", "div._1E5b._2I59._1wkJ._3YFw.igxN._7Zx6.Eb4X._390_ div._1-UB._1Evs"), # 可选:增加等待时间,确保懒加载内容全部加载完成 PageMethod("wait_for_timeout", 5000) ],
原有的:nth-child(60)选择器可能因父节点计数规则不符导致等待失效,建议直接移除。
3. 检查滚动脚本有效性
如果滚动脚本未正确触发页面滚动,懒加载的产品内容不会加载。确保你的scrolling_script能正确滚动到页面底部,比如:
window.scrollTo(0, document.body.scrollHeight);
也可以改用Playwright自带的滚动方法替代自定义脚本:
PageMethod("mouse.wheel", 0, 10000), # 模拟鼠标滚轮滚动到底部
4. 排查请求拦截规则
如果should_abort_request函数拦截了产品数据相关的JS请求或API接口,会导致页面无法渲染产品内容。检查该函数,确保仅拦截图片、广告等非必要请求,不要阻断核心数据请求。
内容的提问来源于stack exchange,提问作者BountyHunter
相关产品推荐
相关产品推荐

