pandas拆分point列触发Columns must be same length as key错误如何解决
问题解决方法
报错原因
该报错的核心诱因是point列存在None值:你设置的逻辑是地址解析失败时,point直接赋值为None。当你把point列转为列表构造DataFrame时,None无法被拆分为长度为3的lat/lon/altitude序列,导致生成的DataFrame列数和你要赋值的3个列长度不匹配,最终触发报错。
修复方案
调整point列的生成逻辑,确保每一行的point值都是长度为3的元组,解析失败的位置用None填充三个维度即可,修改后的完整代码如下:
import tabula import pandas as pd import re import numpy as np # 补充缺失的geopy初始化代码 from geopy.geocoders import Nominatim geolocator = Nominatim(user_agent="condo_geo_parse") # user_agent可自定义 ### 数据爬取与清洗 dsf = tabula.read_pdf('/content/drive/MyDrive/Topcondoimage 11-22-2021.pdf', pages='all',lattice=True) df = dsf[0] df.columns = df.iloc[0] df = df.drop(df.index[0]) df = df.iloc[: , 1:] df = df.replace(np.nan, 'Not Available', regex=True) df['geo_Address'] = df['Building / Address / City'] df['geo_Address'] = df['geo_Address'].map(lambda x: re.sub(r'\r', ' ', x)) df['loc'] = df['geo_Address'].apply(geolocator.geocode, timeout=10) # 调整point生成逻辑,确保每个值都是长度为3的元组 df['point'] = df['loc'].apply(lambda loc: tuple(loc.point) if loc else (None, None, None)) df = df.rename(columns={'Building / Address / City': 'building_address_city','Days on\rMarket':'days_on_market','Price /\rSq. Ft.':'price_per_sqft'}) df.reset_index(drop=True, inplace=True) # 此时生成的DataFrame列数固定为3,不会再报长度不匹配错误 df[['lat','lon','altitude']] = pd.DataFrame(df['point'].to_list(),index=df.index)
补充说明
后续如果不需要地址解析失败的行,可以直接用df = df.dropna(subset=['lat'])过滤掉无效数据即可。
内容的提问来源于stack exchange,提问作者Adam
相关产品推荐
相关产品推荐

