基于多URL与BeautifulSoup构建含州信息的Pandas DataFrame
解决方案
核心处理逻辑
遍历每个州页面时,先抓取页面的H1标题(即州名),接着给当前州的表格数据新增一列,把州名批量填充到这一列的每一行,最后再将处理好的单州数据合并到总DataFrame里。
代码修改示例
假设你当前的基础代码框架如下,直接按下面的方式修改即可:
import requests from bs4 import BeautifulSoup import pandas as pd # 替换成你实际的州/特区slug列表 state_slugs = ['alabama', 'alaska', 'arizona', 'washington-dc'] final_df = pd.DataFrame() for slug in state_slugs: url = f'https://namecensus.com/zipcodes/{slug}' resp = requests.get(url) soup = BeautifulSoup(resp.text, 'html.parser') # 解析页面表格为DataFrame target_table = soup.find('table') state_df = pd.read_html(str(target_table))[0] # 提取H1里的州名(比用slug更准确,比如华盛顿特区会拿到"Washington, D.C.") state_name = soup.find('h1').get_text(strip=True) # 给当前州的所有数据行添加州名字段 state_df['state'] = state_name # 合并到总数据,ignore_index避免索引冲突 final_df = pd.concat([final_df, state_df], ignore_index=True)
避坑提示
- 防止H1获取失败:如果部分页面H1结构异常,加个异常处理兜底:
try: state_name = soup.find('h1').get_text(strip=True) except AttributeError: # 用slug转换为可读性名称,或者根据需求跳过该页 state_name = slug.replace('-', ' ').title() - 确认表格索引:如果页面有多个表格,要调整
pd.read_html的索引(比如[1]取第二个表格),避免拿到错误数据。 - 内存优化:如果州数量多,建议先把每个处理好的state_df存入列表,最后一次性concat,比循环concat更高效:
df_list = [] for slug in state_slugs: # 前面的解析、加州名逻辑不变 df_list.append(state_df) final_df = pd.concat(df_list, ignore_index=True)
内容的提问来源于stack exchange,提问作者Alison810
相关产品推荐
相关产品推荐

