PyArrow调用fs.HadoopFileSystem提示无法加载libhdfs.so问题咨询
问题根因
- 架构不匹配:你的Dockerfile中下载的Hadoop安装包为
hadoop-3.3.1-aarch64.tar.gz(ARM架构),但安装的Miniconda为Miniconda3-latest-Linux-x86_64.sh(x86架构),两者架构不一致,x86版本的PyArrow无法识别加载ARM架构的libhdfs.so动态库,哪怕文件路径完全正确也会抛出找不到文件的错误。 - 缺少系统动态库路径配置:就算架构匹配,
libhdfs.so运行依赖JDK中的libjvm.so,你没有将Hadoop原生库路径和JDK的原生库路径加入LD_LIBRARY_PATH环境变量,系统无法定位到依赖文件也会触发报错。 - 版本兼容性问题:PyArrow 4.0.1属于较老的版本,和Hadoop 3.3.1的适配存在已知缺陷,也可能引发加载异常。
修复方案
1. 统一运行架构
以x86架构运行环境为例,将Hadoop下载的代码行替换为x86版本的安装包:
RUN wget -nv https://dlcdn.apache.org/hadoop/common/hadoop-3.3.1/hadoop-3.3.1.tar.gz &&\ tar -xf hadoop-3.3.1.tar.gz
如果你的宿主机是ARM架构,就将Miniconda的下载链接替换为aarch64版本即可。
2. 新增动态库路径配置
在HADOOP_HOME环境变量配置后新增以下配置:
ENV LD_LIBRARY_PATH=${HADOOP_HOME}/lib/native:${JAVA_HOME}/lib/server:${LD_LIBRARY_PATH}
3. (可选)升级PyArrow版本
替换PyArrow安装命令,使用兼容性更好的高版本:
RUN conda install -c conda-forge pyarrow=12.0.1
验证方法
修改完成后重新构建镜像,运行容器后先执行ldd /hadoop-3.3.1/lib/native/libhdfs.so,确认所有依赖的动态库都没有not found提示,再运行测试代码即可正常初始化HadoopFileSystem实例。
内容的提问来源于stack exchange,提问作者cenrid
相关产品推荐
相关产品推荐

