如何从嵌入Tableau的马萨诸塞州海滩水质网站程序化提取数据?
程序化提取数据的变通方案
针对嵌入的Tableau仪表板数据提取
- 直接抓取Tableau底层API接口:打开浏览器开发者工具(F12)切换到Network面板,筛选XHR/fetch类型请求,找到与数据加载相关的请求(通常路径包含
vizql、data等关键词)。复制这些请求的Cookie、请求头(如X-Tableau-Auth、User-Agent),用Python的requests库模拟发送请求,解析返回的JSON数据即可获取原始数据集。 - 使用专用Tableau抓取库:用
tableau-scraperPython库简化流程,它会自动处理Tableau的会话验证和接口请求,示例代码:
from tableau_scraper import TableauScraper as TS ts = TS() ts.load("https://www.mass.gov/info-details/interactive-beach-water-quality-dashboard") workbook = ts.get_workbook() # 遍历所有工作表并输出数据 for worksheet in workbook.worksheets: print(f"工作表名称: {worksheet.name}") print(worksheet.data)
针对动态生成的Excel下载链接
- 无头浏览器模拟下载:用Playwright这类工具完整模拟用户点击下载的操作,自动处理Token和动态文件名,示例代码:
from playwright.sync_api import sync_playwright with sync_playwright() as p: browser = p.chromium.launch(headless=True) page = browser.new_page() page.goto("https://www.mass.gov/doc/beach-dashboard-data/download") # 等待下载触发并捕获文件 with page.expect_download() as download_ctx: page.click("a[href='/doc/beach-dashboard-data/download']") download = download_ctx.value download.save_as("beach_water_quality_data.xlsx") browser.close()
- 抓取实际下载接口:点击下载时在Network面板中捕获真实的下载请求URL(带有临时Token),复制该URL及对应的请求头、Cookie,用
requests直接请求并保存文件:
import requests headers = { # 从开发者工具复制实际请求头 "User-Agent": "你的浏览器User-Agent", "Cookie": "页面的Cookie内容" } download_url = "捕获到的带Token的下载URL" response = requests.get(download_url, headers=headers, allow_redirects=True) with open("beach_data.xlsx", "wb") as f: f.write(response.content)
内容的提问来源于stack exchange,提问作者AaronB
相关产品推荐
相关产品推荐

