如何从NSE印度涨跌榜网页提取两个表格至独立DataFrame?
读取NSE印度股市涨跌榜表格并存入独立DataFrame
要实现这个需求,我们可以用Python的pandas结合requests库完成——NSE官网有反爬机制,直接用pandas.read_html()请求可能拿不到数据,所以需要模拟浏览器请求头。
步骤1:安装依赖库
如果还没安装相关库,先执行以下命令:
pip install pandas requests
步骤2:编写代码实现
import pandas as pd import requests # 模拟浏览器请求头,避免被反爬拦截 headers = { 'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/114.0.0.0 Safari/537.36' } # 目标网页地址 target_url = 'https://www.nseindia.com/market-data/top-gainers-losers' # 发送请求获取网页内容 try: response = requests.get(target_url, headers=headers) response.raise_for_status() # 请求失败直接抛出异常 except Exception as e: print(f"请求网页失败:{e}") exit() # 解析网页中的所有HTML表格 all_tables = pd.read_html(response.text) # 提取涨幅榜和跌幅榜的DataFrame # 网页中第一个表格是Top Gainers,第二个是Top Losers gainers_df = all_tables[0] losers_df = all_tables[1] # 验证数据(可选) print("=== Top Gainers 数据样例 ===") print(gainers_df.head()) print("\n=== Top Losers 数据样例 ===") print(losers_df.head())
注意事项
- 网页的表格顺序可能随网站更新变化,如果后续代码获取的表格不对,可以先打印
len(all_tables)查看总表格数,再逐个打印表格列名(比如print(all_tables[i].columns))确认目标表格的索引。 - 请求头中的
User-Agent可以根据自己浏览器的实际信息调整,避免被网站拦截。
内容的提问来源于stack exchange,提问作者Tanmoy
相关产品推荐
相关产品推荐

