You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

基于多URL与BeautifulSoup构建含州信息的Pandas DataFrame

解决方案

核心处理逻辑

遍历每个州页面时,先抓取页面的H1标题(即州名),接着给当前州的表格数据新增一列,把州名批量填充到这一列的每一行,最后再将处理好的单州数据合并到总DataFrame里。

代码修改示例

假设你当前的基础代码框架如下,直接按下面的方式修改即可:

import requests
from bs4 import BeautifulSoup
import pandas as pd

# 替换成你实际的州/特区slug列表
state_slugs = ['alabama', 'alaska', 'arizona', 'washington-dc']
final_df = pd.DataFrame()

for slug in state_slugs:
    url = f'https://namecensus.com/zipcodes/{slug}'
    resp = requests.get(url)
    soup = BeautifulSoup(resp.text, 'html.parser')
    
    # 解析页面表格为DataFrame
    target_table = soup.find('table')
    state_df = pd.read_html(str(target_table))[0]
    
    # 提取H1里的州名(比用slug更准确,比如华盛顿特区会拿到"Washington, D.C.")
    state_name = soup.find('h1').get_text(strip=True)
    # 给当前州的所有数据行添加州名字段
    state_df['state'] = state_name
    
    # 合并到总数据,ignore_index避免索引冲突
    final_df = pd.concat([final_df, state_df], ignore_index=True)

避坑提示

  • 防止H1获取失败:如果部分页面H1结构异常,加个异常处理兜底:
    try:
        state_name = soup.find('h1').get_text(strip=True)
    except AttributeError:
        # 用slug转换为可读性名称,或者根据需求跳过该页
        state_name = slug.replace('-', ' ').title()
    
  • 确认表格索引:如果页面有多个表格,要调整pd.read_html的索引(比如[1]取第二个表格),避免拿到错误数据。
  • 内存优化:如果州数量多,建议先把每个处理好的state_df存入列表,最后一次性concat,比循环concat更高效:
    df_list = []
    for slug in state_slugs:
        # 前面的解析、加州名逻辑不变
        df_list.append(state_df)
    final_df = pd.concat(df_list, ignore_index=True)
    

内容的提问来源于stack exchange,提问作者Alison810

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.20 23:57:28