You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

为何使用Python的requests_html库无法获取网页的完整内容?

问题原因及修复方案

1. 代码现有错误

  • 字符串处理逻辑错误:p = prod[0].replace(' ','%20') 中 prod[0] 仅取了传入商品名的第一个字符,导致实际搜索的关键词错误,无法返回预期搜索结果
  • XPath选择器错误:你写的XPath是指向商品图片节点,且使用了极易失效的绝对路径,同时你需要提取的是详情页链接而非图片元素
  • 缺少反爬适配:站点有基础反爬校验,未携带正常请求头会被拦截,返回的页面本身无有效内容

2. 修正后可运行代码

from requests_html import HTMLSession

session = HTMLSession()
# 添加正常浏览器请求头,避免反爬拦截
session.headers = {
    "User-Agent": "Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/120.0.0.0 Safari/537.36",
    "Accept-Language": "pl-PL,pl;q=0.9,en-US;q=0.8,en;q=0.7"
}

def get_prod_link(prod):
    # 直接用params传参,不需要手动处理空格编码,requests会自动适配
    url = f'https://aptekazawiszy.pl/strony/wyszukiwanie.html'
    params = {
        "name": prod,
        "pf-size": 32,
        "pf-page": 1
    }
    r = session.get(url, params=params)
    # 渲染等待时间加长到3秒,保证JS加载完全
    r.html.render(sleep=3, keep_page=True, scrolldown=2)
    # 使用稳定的相对XPath,直接定位商品卡片的详情链接,提取href属性
    xpath = '//article[contains(@class, "product")]/figure/a/@href'
    elem_list = r.html.xpath(xpath) 
    # 有结果返回第一个详情链接,无结果返回空
    return elem_list[0] if elem_list else None

if __name__ == '__main__':
    product = "mydlo z olejem konopnym"
    print(get_prod_link(product))

3. 额外说明

  • 如果仍出现空结果,可以适当加长render的sleep时间,部分资源加载慢的环境需要更长等待时间
  • 后续爬取详情页时,同样需要携带上述请求头,避免被反爬拦截

内容的提问来源于stack exchange,提问作者Hellmick

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.10.01 00:39:03