You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

使用Python无法抓取Birdeye.so表格数据?求助原因及解决方法

问题排查与解决

存在无法直接抓取的网页,核心原因如下:

  • 动态数据加载:该页面的表格数据并非随初始HTML同步返回,而是页面加载完成后通过JavaScript异步调用后端接口获取并渲染的,直接抓取初始页面源码自然拿不到数据。
  • 反爬机制拦截:网站可能识别出Selenium的自动化特征(比如ChromeDriver的特定标识),限制了数据返回。
  • URL错误:你代码中使用的URL末尾多了一个斜杠(https://birdeye.so/find-gems?chain=solana/),可能导致页面跳转或加载异常。

修正后的代码示例

from selenium import webdriver
from selenium.webdriver.chrome.options import Options
from selenium.webdriver.support.ui import WebDriverWait
from selenium.webdriver.support import expected_conditions as EC
from selenium.webdriver.common.by import By
from bs4 import BeautifulSoup

# 配置Chrome选项,模拟正常浏览器行为
chrome_options = Options()
chrome_options.add_argument("user-agent=Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/118.0.0.0 Safari/537.36")
# 禁用Selenium自动化特征,规避反爬
chrome_options.add_argument("--disable-blink-features=AutomationControlled")
chrome_options.add_experimental_option("excludeSwitches", ["enable-automation"])
chrome_options.add_experimental_option('useAutomationExtension', False)

driver = webdriver.Chrome(options=chrome_options)
driver.maximize_window()
# 修正URL,去掉末尾多余斜杠
driver.get("https://birdeye.so/find-gems?chain=solana")

# 等待表格数据加载完成,最多等待10秒
try:
    # 等待表格行元素出现,确认数据已渲染
    WebDriverWait(driver, 10).until(
        EC.presence_of_element_located((By.CSS_SELECTOR, "tbody tr"))
    )
except Exception as e:
    print("数据加载超时或未找到目标数据:", e)

# 获取加载完成后的完整页面源码
html = driver.page_source
soup = BeautifulSoup(html, "html.parser")
# 提取并打印表格内容
table = soup.find("table")
print(table)

driver.quit()

额外注意事项

  • 登录验证:如果网站需要登录才能查看完整数据,需在代码中添加登录流程(输入账号密码、处理验证码等)。
  • 请求频率限制:避免短时间内频繁请求,可添加随机延迟,防止IP被封禁。
  • 接口直接调用:可以通过浏览器开发者工具(F12)抓包找到数据接口,直接用requests调用接口获取数据,比模拟浏览器更高效。

内容的提问来源于stack exchange,提问作者BorangeOrange1337

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.12 09:43:21