You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

GCP使用DataFlow运行Apache Beam ETL提示找不到Pipelines模块错误

错误原因

使用DataflowRunner运行Apache Beam作业时,作业逻辑会被序列化后分发到GCP的Dataflow Worker节点执行,Worker节点默认没有你本地项目中的Pipelines自定义模块,反序列化时就会抛出找不到模块的错误。你本地直接运行pipelinestransform.py正常是因为用的是本地DirectRunner,能直接读取本地文件系统的模块代码。

解决方案

步骤1:完善根目录下的setup.py

这个文件用于将你的自定义代码打包成可安装的Python包,Dataflow会自动把这个包安装到所有Worker节点上,示例内容:

from setuptools import setup, find_packages

setup(
    name='my-text-etl',
    version='1.0.0',
    packages=find_packages(),
)

find_packages()会自动识别带有__init__.py的Pipelines目录为子包。

步骤2:添加SetupOptions配置

修改pipelinestransform.py中run_pipeline函数的PipelineOptions配置部分,指定setup.py的路径:

# 原有pipeline_options = PipelineOptions()之后新增下面两行
setup_options = pipeline_options.view_as(SetupOptions)
setup_options.setup_file = os.path.join(os.path.dirname(os.path.dirname(__file__)), "setup.py")

这里用相对路径定位根目录下的setup.py,避免硬编码路径的兼容性问题。

步骤3:正确执行启动命令

务必在项目根目录myproject下执行启动命令:

python main.py

不要进入Pipelines子目录执行,避免路径识别错误。


内容的提问来源于stack exchange,提问作者charlytag

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.28 01:18:02