You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

求助:无法找到网页抓取下载CSV文件的URL(Colab/Python环境)

抓取网页表格生成CSV文件方案

目标网站没有提供直接的CSV下载接口,你可以通过Python在Colab中抓取页面表格数据,手动生成CSV文件,具体步骤如下:

1. 安装并导入依赖库

在Colab单元格中执行以下命令:

!pip install requests beautifulsoup4 pandas

导入所需库:

import requests
from bs4 import BeautifulSoup
import pandas as pd

2. 抓取并解析网页表格

发送请求获取页面内容,提取目标表格:

url = "https://stockmarketmba.com/listofreits.php"
# 设置请求头模拟浏览器,避免被拦截
headers = {
    "User-Agent": "Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/118.0.0.0 Safari/537.36"
}
response = requests.get(url, headers=headers)
soup = BeautifulSoup(response.text, "html.parser")

# 定位页面中的表格(若页面有多个表格,可通过class/id进一步筛选)
target_table = soup.find("table")

# 将表格转换为DataFrame
df = pd.read_html(str(target_table))[0]

3. 生成并下载CSV文件

将解析后的数据保存为CSV,支持下载到本地:

# 保存到Colab本地
df.to_csv("reits_list.csv", index=False, encoding="utf-8")

# 下载到本地电脑
from google.colab import files
files.download("reits_list.csv")

注意事项

  • 若网站结构更新,需调整find("table")的筛选条件,比如通过find("table", class_="xxx")定位特定表格
  • 不要频繁发送请求,避免触发网站反爬机制
  • 确保遵守网站的robots协议

内容的提问来源于stack exchange,提问作者user2946746

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.26 00:12:38