为何使用Python的requests_html库无法获取网页的完整内容?
问题原因及修复方案
1. 代码现有错误
- 字符串处理逻辑错误:
p = prod[0].replace(' ','%20')中prod[0]仅取了传入商品名的第一个字符,导致实际搜索的关键词错误,无法返回预期搜索结果 - XPath选择器错误:你写的XPath是指向商品图片节点,且使用了极易失效的绝对路径,同时你需要提取的是详情页链接而非图片元素
- 缺少反爬适配:站点有基础反爬校验,未携带正常请求头会被拦截,返回的页面本身无有效内容
2. 修正后可运行代码
from requests_html import HTMLSession session = HTMLSession() # 添加正常浏览器请求头,避免反爬拦截 session.headers = { "User-Agent": "Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/120.0.0.0 Safari/537.36", "Accept-Language": "pl-PL,pl;q=0.9,en-US;q=0.8,en;q=0.7" } def get_prod_link(prod): # 直接用params传参,不需要手动处理空格编码,requests会自动适配 url = f'https://aptekazawiszy.pl/strony/wyszukiwanie.html' params = { "name": prod, "pf-size": 32, "pf-page": 1 } r = session.get(url, params=params) # 渲染等待时间加长到3秒,保证JS加载完全 r.html.render(sleep=3, keep_page=True, scrolldown=2) # 使用稳定的相对XPath,直接定位商品卡片的详情链接,提取href属性 xpath = '//article[contains(@class, "product")]/figure/a/@href' elem_list = r.html.xpath(xpath) # 有结果返回第一个详情链接,无结果返回空 return elem_list[0] if elem_list else None if __name__ == '__main__': product = "mydlo z olejem konopnym" print(get_prod_link(product))
3. 额外说明
- 如果仍出现空结果,可以适当加长
render的sleep时间,部分资源加载慢的环境需要更长等待时间 - 后续爬取详情页时,同样需要携带上述请求头,避免被反爬拦截
内容的提问来源于stack exchange,提问作者Hellmick
相关产品推荐
相关产品推荐

