如何用Python Pandas从URL读取表格为DataFrame并处理日期与星期列
在Jupyter Notebook中用Pandas处理肯尼亚2022年假期表格
以下是完成需求的具体代码和步骤:
1. 读取网页表格为DataFrame
先导入Pandas库,用read_html直接抓取网页中的表格。该方法会返回表格列表,取第一个表格即可:
import pandas as pd # 读取目标网页表格 url = "https://www.timeanddate.com/holidays/kenya/2022" df_list = pd.read_html(url) df = df_list[0] # 查看初始数据结构 print(df.head())
此时表格列名包含Date、Unnamed: 1(对应星期值)、Name、Type、Notes。
2. 将Date列格式转为01.01.2022
原Date列是"1 Jan"这类格式,先用pd.to_datetime解析日期(指定年份为2022),再用strftime格式化目标样式:
# 解析日期并转换格式 df['Date'] = pd.to_datetime(df['Date'] + ' 2022', format='%d %b %Y').dt.strftime('%d.%m.%Y')
3. 提取星期值创建Day列
Date和Name之间的Unnamed: 1列就是星期值,直接重命名该列为Day即可:
# 重命名星期列 df.rename(columns={'Unnamed: 1': 'Day'}, inplace=True) # 保留指定列(按需选择,若只需要Date、Day、Name三列) df = df[['Date', 'Day', 'Name']] # 查看最终结果 print(df.head())
最终得到的DataFrame会包含Date(dd.mm.yyyy格式)、Day(星期值)、Name(假期名称)三列。
内容的提问来源于stack exchange,提问作者dingaro
相关产品推荐
相关产品推荐

