You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

在R中循环从指定网站批量下载年度S2数据并聚合特定年龄段人口

数据下载与聚合操作指南

一、下载指定学期的数据文件

  • 打开目标页面后,找到数据文件列表区域
  • 筛选文件名包含「S2/年份」格式的文件(例如「S2/2022」「S2/2023」)
  • 点击对应文件的下载按钮,保存所有符合条件的年度第二学期数据文件

二、按年份聚合15-74岁人口数据

方法1:使用Excel手动处理

  • 打开单个年份的S2数据文件,定位到年龄分组列(通常标注为「Age」或当地语言对应字段)和人口数值列
  • 使用「筛选」功能,选中年龄范围在15到74岁之间的所有行
  • 对筛选后的人口数值列进行求和计算,记录该年份的汇总结果
  • 重复上述步骤处理所有年份的文件,最后将各年份的汇总数据整理到统一表格中

方法2:使用Python(Pandas库)批量处理

  1. 先确保安装Pandas库:pip install pandas
  2. 编写脚本批量处理:
import pandas as pd
import os

# 存放下载文件的文件夹路径
data_folder = "./s2_data"
yearly_results = {}

# 遍历文件夹中的所有S2文件
for filename in os.listdir(data_folder):
    if "S2/" in filename:
        # 提取年份(假设文件名格式含S2/YYYY结构)
        year = filename.split("S2/")[1][:4]
        # 读取数据文件(根据实际格式调整为csv/xlsx)
        df = pd.read_csv(os.path.join(data_folder, filename))
        # 筛选15-74岁人口(根据实际列名调整字段)
        filtered = df[(df['Age'] >= 15) & (df['Age'] <= 74)]
        # 计算该年份的总人口
        total = filtered['Population'].sum()
        yearly_results[year] = total

# 将结果转为表格并保存
result_df = pd.DataFrame.from_dict(yearly_results, orient='index', columns=['Total Population (15-74)'])
result_df.to_csv("yearly_15-74_population.csv")
  • 注意:请根据实际文件的列名、格式(csv/xlsx)调整代码中的字段名和读取方式

内容的提问来源于stack exchange,提问作者Maria

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.21 15:53:08