如何使用Spark SQL向BigQuery写入数据并解决插入报错问题
问题根因
你创建BigQuery映射表时未配置写入必需的临时GCS存储路径参数,Spark会默认将该表识别为只读表,因此执行写入操作时会抛出不允许插入的报错。
纯Spark SQL写入BigQuery实现方案
完全可以通过纯Spark SQL实现BigQuery数据写入,操作步骤如下:
- 第一步:重新创建支持写入的BigQuery映射表,补充必填的临时GCS桶配置项
CREATE TABLE table_bq USING bigquery OPTIONS ( project '你的GCP项目ID', dataset '目标BigQuery数据集名称', table '目标BigQuery表名', temporaryGcsBucket '用于中转临时数据的GCS桶名称' );
- 第二步:执行对应写入操作,支持覆盖和追加两种写入模式
-- 全量覆盖写入目标表 INSERT OVERWRITE TABLE table_bq SELECT 字段1, 字段2, 字段3 FROM 源表 WHERE 过滤条件; -- 追加数据到目标表 INSERT INTO TABLE table_bq SELECT 字段1, 字段2, 字段3 FROM 源表 WHERE 过滤条件;
注意事项
- SELECT查询返回的字段顺序、数据类型必须和目标BigQuery表的Schema完全匹配,否则会触发写入报错
- Dataproc集群绑定的服务账号需要具备以下权限:BigQuery数据编辑权限、GCS临时桶的存储对象读写权限、BigQuery作业创建权限
- 如果目标表是BigQuery分区表,可以在创建映射表的OPTIONS中额外补充
partitionField、partitionType参数和目标表分区配置对齐,也可以直接按Spark SQL分区写入语法指定分区值写入:
INSERT OVERWRITE TABLE table_bq PARTITION (dt='2024-05-20') SELECT 字段1, 字段2, 字段3 FROM 源表 WHERE dt='2024-05-20';
内容的提问来源于stack exchange,提问作者Anant Furia
相关产品推荐
相关产品推荐

