如何获取GCP Dataproc对应的Docker镜像用于本地开发
GCP Dataproc 适配Docker镜像获取与使用说明
- Google官方直接提供和云端Dataproc环境完全对齐的Docker镜像,该镜像也是Dataproc Serverless服务的运行基础镜像,预装了对应版本的Spark、Hadoop、GCP服务相关组件以及Python依赖,和你在云端使用Dataproc集群的运行体验完全一致,没有适配问题。
- 你可以通过
gcloudCLI工具获取可用镜像列表并拉取:- 先完成gcloud的安装与身份认证
- 执行命令
gcloud artifacts docker images list us-docker.pkg.dev/cloud-dataproc/spark即可查看所有公开可用的镜像版本 - 根据你之前使用的云端Dataproc的Spark版本选择对应标签的镜像拉取即可,比如对应Spark 3.3版本的镜像可以直接选择带
3.3后缀的标签
- 本地调试时直接通过docker命令启动容器即可,内置的
pyspark、spark-submit等命令的运行逻辑和云端Dataproc完全一致,本地调试通过的代码无需额外修改就可以直接提交到云端Dataproc集群运行。 - 如果你有自定义依赖的需求,可以直接基于该官方镜像做二次构建,仅需要在Dockerfile中声明FROM对应版本的官方镜像,再安装你需要的额外依赖即可,能保证底层运行环境和云端Dataproc完全对齐。
- 建议你选择的镜像版本和后续计划使用的云端Dataproc集群版本保持一致,避免出现版本差异导致的兼容问题。
内容的提问来源于stack exchange,提问作者zorrrba
相关产品推荐
相关产品推荐

