You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Jupyter Notebook中如何通过InsecureClient读取HDFS的CSV文件到Python DataFrame

故障解决方案

第一个InsecureClient报错(InvalidSchema)

报错原因

InsecureClient是基于WebHDFS协议实现的,底层走HTTP请求,你传入的hdfs://开头的地址是HDFS原生RPC协议地址,requests库无法识别该协议,因此抛出连接适配器找不到的错误。

修复步骤

  1. 确认HDFS NameNode的WebHDFS端口:Hadoop 2.x版本默认是50070,Hadoop 3.x版本默认是9870
  2. 替换客户端初始化的地址前缀为http://,使用WebHDFS端口
  3. 读取的HDFS路径使用绝对路径,以/开头

修正后代码

from hdfs import InsecureClient
import pandas as pd

# 替换为你实际的NameNode主机地址、WebHDFS端口、用户名
client_hdfs = InsecureClient('http://你的主机名:WebHDFS端口', user='你的用户名')
# 替换为HDFS上CSV文件的绝对路径
with client_hdfs.read('/HDFS绝对路径/to/csv.csv', encoding='utf-8') as f:
    df = pd.read_csv(f)
print(df.head())

第二个Spark读取无返回问题

故障原因

绝大多数场景是网络连通性或配置缺失导致Spark无法正常访问HDFS服务,不会有报错只会无限等待重试。

排查修复步骤

  • 优先检查网络连通:在你运行Spark代码的机器上执行telnet 你的HDFS主机名 HDFS RPC端口(默认9000),如果连接失败,说明服务器防火墙/安全组未开放对应端口,或主机无法解析HDFS地址
  • 检查hosts映射:如果你的HDFS用主机名配置,需要在运行代码的机器的hosts文件中添加HDFS节点IP和主机名的映射规则,否则无法解析地址
  • 检查Spark配置:将Hadoop配置文件中的core-site.xml和hdfs-site.xml放到Spark安装目录的conf文件夹下,确保Spark可以读取到正确的HDFS配置
  • 验证权限:确认你运行Spark的用户对目标HDFS路径有读取权限,可在HDFS服务器上执行hdfs dfs -ls /目标路径验证
  • 前置验证:先在运行代码的机器上配置Hadoop客户端,执行hdfs dfs -cat hdfs://你的主机名:端口/path/to/textfile.txt,确认可以正常返回文件内容后再运行Spark代码

内容的提问来源于stack exchange,提问作者u29581058

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.27 16:15:00