You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

爬取页面分数遇阻:分数被::before/::after包裹,Selenium等工具无效

解决伪元素包裹的分数爬取问题

你遇到的核心问题是:伪元素(::before/::after)的内容并不存在于DOM结构中,所以BeautifulSoup无法解析,Selenium直接获取元素文本也拿不到有效内容。你当前的代码仅获取了WebElement对象,并未提取伪元素里的实际值。

解决方案

要获取伪元素的内容,必须通过JavaScript读取元素的计算样式(computedStyle),具体步骤如下:

  1. 等待目标元素加载完成(避免页面未渲染完全导致元素找不到)
  2. 使用driver.execute_script()执行JS代码,提取伪元素的content属性值

修正后的代码

from selenium import webdriver
from selenium.webdriver.common.by import By
from selenium.webdriver.support.ui import WebDriverWait
from selenium.webdriver.support import expected_conditions as EC

PATH = "C:\Program Files (x86)\chromedriver.exe"
driver = webdriver.Chrome(PATH)
URL = "https://coolcatsnft.com/user/0x10eb84abd429fa4df8dcabbc7c2803822a5b82d9"

driver.get(URL)

try:
    # 等待元素加载,超时10秒
    target_element = WebDriverWait(driver, 10).until(
        EC.presence_of_element_located((By.CLASS_NAME, "sc-8ce97ff6-2.cgjlQk"))
    )
    # 获取::before伪元素的content值
    before_content = driver.execute_script(
        'return window.getComputedStyle(arguments[0], ":before").content;', 
        target_element
    )
    # 获取::after伪元素的content值
    after_content = driver.execute_script(
        'return window.getComputedStyle(arguments[0], ":after").content;', 
        target_element
    )
    
    # 去除content值自带的引号,输出有效内容
    print("::before内容:", before_content.strip('"'))
    print("::after内容:", after_content.strip('"'))
finally:
    driver.quit()

关键注意点

  • 你用的sc-8ce97ff6-2.cgjlQk是CSS Modules生成的动态类名,网站更新后可能失效,建议改用更稳定的定位方式(比如父元素固定类名、元素的role属性等)
  • 伪元素的content值默认带引号,需要用strip('"')去除才能得到纯文本分数
  • 确保ChromeDriver版本与本地Chrome浏览器版本一致,避免兼容性报错

内容的提问来源于stack exchange,提问作者brokecontroller

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.01 15:40:38