BigQuery结果转DataFrame本地报错 无法识别T_DATE字段类型
问题原因
- 核心触发原因是本地环境缺少
pyarrow依赖,或是pyarrow版本与当前安装的google-cloud-bigquery==2.28.1不兼容。to_dataframe()方法默认优先调用pyarrow完成BigQuery字段到DataFrame类型的映射,DATE这类非基础类型对pyarrow的依赖更强,当pyarrow异常时,代码无法识别T_DATE字段的对应类型,导致类型赋值为None,后续调用pyarrow.array()时就抛出了NoneType无array属性的报错。 - Google官方的JupyterLab环境默认预装了版本匹配的pyarrow、pandas、google-cloud-bigquery依赖,因此不会触发该问题。
解决方案
按优先级选择以下方案即可:
- 方案1:安装兼容版本的pyarrow依赖
当前环境的google-cloud-bigquery 2.28.1、pandas 1.3.4适配的pyarrow版本区间为3.0~7.0,执行以下命令安装即可:
pip install pyarrow==6.0.1
安装完成后重新运行原有代码即可解决问题。
- 方案2:不安装pyarrow,手动指定类型规避识别问题
如果不想新增pyarrow依赖,可以在调用to_dataframe()时强制关闭BQ存储客户端,同时手动指定字段类型,修改对应代码行为:
df = result.to_dataframe(create_bqstorage_client=False, dtypes={"T_DATE": "datetime64[ns]"})
- 方案3:升级全套依赖到兼容版本
如果可以接受依赖版本变动,直接升级全套相关依赖到最新稳定版:
pip install --upgrade google-cloud-bigquery pandas pyarrow
该方案可能存在其他API变更的兼容风险,优先选择前两种方案。
内容的提问来源于stack exchange,提问作者Sudhanshu Yadav
相关产品推荐
相关产品推荐

