基于两个DataFrame计算网格内客户数据的TypeError问题求助
解决方案:客户集中度分析的数据叠加问题
错误原因分析
- 使用
math模块的函数(如math.sin、math.cos):这些函数仅支持单个浮点值,无法直接处理Pandas Series,这是触发TypeError的核心原因。 - 函数逻辑与调用错误:
in250m直接引用全局的portfolioSeries而非单个坐标值,同时apply的用法未正确关联网格坐标,导致计算逻辑混乱。
高效实现方案
采用Numpy向量化运算替代循环,结合Pandas广播特性,既能解决类型错误,又能避免嵌套循环的性能损耗,适配21000个实体+441个网格的规模。
完整代码实现
import pandas as pd import numpy as np # 示例数据 portfolio = pd.DataFrame({ 'name': ['a', 'b', 'c'], 'value': [10000, 100000, 1000000], 'convertedlat': [80.9090170235, 80.9266727742, 80.9050586168], 'convertedlong': [-0.11894069786, -0.19952254942, -0.04219158933] }) Grid_ref = pd.DataFrame({ 'Lat': [0.898991160550, 0.899145218644, 0.898943139573], 'Long': [-0.001359632426, -0.002279714596, -0.000511374166], 'count': [0, 0, 0], 'value': [0, 0, 0] }) max_dist = 0.250 # 250米转换为公里(匹配地球半径单位) # 提取坐标为numpy数组,支持广播计算 port_lat = portfolio['convertedlat'].to_numpy() port_lon = portfolio['convertedlong'].to_numpy() port_val = portfolio['value'].to_numpy() grid_lat = Grid_ref['Lat'].to_numpy() grid_lon = Grid_ref['Long'].to_numpy() # 广播计算所有网格与客户的距离矩阵(形状:网格数 × 客户数) lat_diff = port_lat[np.newaxis, :] - grid_lat[:, np.newaxis] lon_diff = port_lon[np.newaxis, :] - grid_lon[:, np.newaxis] a = np.sin(lat_diff / 2) ** 2 b = np.cos(grid_lat[:, np.newaxis]) * np.cos(port_lat[np.newaxis, :]) * np.sin(lon_diff / 2) ** 2 distance = 2 * 6371 * np.sqrt(a + b) # 筛选250米内的客户 mask = distance <= max_dist # 批量统计每个网格的客户数与总价值 Grid_ref['count'] = mask.sum(axis=1) Grid_ref['value'] = np.dot(mask, port_val) print(Grid_ref)
核心优化点
- 向量化运算:通过numpy广播一次性计算所有网格与客户的距离,性能比嵌套循环提升数倍。
- 类型兼容性:用numpy三角函数替代math模块函数,直接支持Series/数组输入,解决类型错误。
- 高效聚合:用
sum(axis=1)统计客户数,np.dot计算总价值,均为批量优化操作,避免逐行遍历。
内容的提问来源于stack exchange,提问作者Fresh
相关产品推荐
相关产品推荐

