使用BeautifulSoup与Requests爬取ASOS商品价格返回None求助
问题原因与解决办法
核心问题
你看到的a0j7k类名是前端框架动态生成的(大概率是React这类框架的产物),爬虫直接请求到的原始HTML里根本不存在这个标签——浏览器开发者工具看到的是JS渲染后的最终DOM,和requests拿到的静态HTML不是一回事,所以soup.find会返回None。
解决方法:解析页面预加载的JSON数据
ASOS会把商品的核心数据(包括价格)放在页面的script标签里,以window.__PRELOADED_STATE__的形式存储,直接提取这个数据比找动态生成的标签靠谱得多:
import requests import bs4 import json headers = { "user-agent": "Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/93.0.4577.63 Safari/537.36" } url = "https://www.asos.com/the-north-face/the-north-face-norm-cotton-cap-in-black/prd/204512287?clr=black&colourWayId=204512317&cid=50056" page = requests.get(url, headers=headers) soup = bs4.BeautifulSoup(page.text, "lxml") # 找到存储预加载数据的script标签 script_tag = soup.find('script', text=lambda t: t and 'window.__PRELOADED_STATE__' in t) if script_tag: # 提取JSON部分 json_str = script_tag.text.split('window.__PRELOADED_STATE__ = ')[1].split(';')[0] data = json.loads(json_str) # 从数据结构里提取价格(路径可能随页面更新,需要自己核对) product_id = url.split('prd/')[1].split('?')[0] price = data['product']['productMap'][product_id]['price']['current']['text'] print(price) # 会输出£13.50
额外提示
- 动态生成的类名(比如这种短乱码类名)随时可能变,不要依赖它们做爬虫定位
- 如果后续这个JSON结构也变了,打开页面源码搜索
price或者current关键词,就能找到新的提取路径
内容的提问来源于stack exchange,提问作者Mirana
相关产品推荐
相关产品推荐

