PySpark无法连接MinIO读取JSON文件的问题求助
PySpark无法连接MinIO读取JSON文件的问题求助
我现在遇到一个棘手的问题:没办法用Spark连接到MinIO服务。
MinIO是运行在Kubernetes集群上的,我已经做了端口转发,用curl或者mc工具都能正常访问到它,所以问题肯定出在Spark代码或者spark-submit命令的配置里。
报错刚好发生在定义DataFrame的那一行,以下是我的相关代码、命令和报错信息:
我的PySpark代码
from pyspark import SparkContext from pyspark.sql import SparkSession spark = SparkSession.builder.getOrCreate() def load_config(sc: SparkContext): sc._jsc.hadoopConfiguration().set("fs.s3a.access.key", "minio") sc._jsc.hadoopConfiguration().set("fs.s3a.secret.key", "minio123") sc._jsc.hadoopConfiguration().set("spark.hadoop.fs.s3a.endpoint", "https://localhost:9000") sc._jsc.hadoopConfiguration().set("spark.hadoop.fs.s3a.impl", "org.apache.hadoop.fs.s3a.S3AFileSystem") sc._jsc.hadoopConfiguration().set("fs.s3a.path.style.access", "true") sc._jsc.hadoopConfiguration().set("fs.s3a.connection.ssl.enabled", "false") sc._jsc.hadoopConfiguration().set("fs.s3a.endpoint.https.enabled", "true") sc._jsc.hadoopConfiguration().set("fs.s3a.endpoint.https.disableSSLVerification", "true") load_config(spark.sparkContext) print("\n\n\n") dataframe = spark.read.json('s3a://orders/orders.json') average = dataframe.agg({'amount': 'avg'}) average.show()
我的spark-submit命令
spark-submit --packages org.apache.hadoop:hadoop-aws:3.3.4,com.amazonaws:aws-java-sdk-bundle:1.12.262 test.py
报错信息
24/12/31 00:48:35 INFO SharedState: Setting hive.metastore.warehouse.dir ('null') to the value of spark.sql.warehouse.dir. 24/12/31 00:48:35 INFO SharedState: Warehouse path is 'file:/home/master/minio-spark-jobs/spark-warehouse'. Traceback (most recent call last): File "/home/master/minio-spark-jobs/test.py", line 20, in <module> dataframe = spark.read.json('s3a://orders/orders.json') ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^ File "/usr/local/spark/python/lib/pyspark.zip/pyspark/sql/readwriter.py", line 425, in json File "/usr/local/spark/python/lib/py4j-0.10.9.7-src.zip/py4j/java_gateway.py", line 1322, in __call__ File "/usr/local/spark/python/lib/pyspark.zip/pyspark/errors/exceptions/captured.py", line 179, in deco File "/usr/local/spark/python/lib/py4j-0.10.9.7-src.zip/py4j/protocol.py", line 326, in get_return_value py4j.protocol.Py4JJavaError: An error occurred while calling o34.json. : java.lang.NoClassDefFoundError: org/apache/hadoop/fs/impl/prefetch/PrefetchingStatistics at java.base/java.lang.ClassLoader.defineClass1(Native Method) at java.base/java.lang.ClassLoader.defineClass(ClassLoader.java:1027) at java.base/java.security.SecureClassLoader.defineClass(SecureClassLoader.java:150) at java.base/jdk.internal.loader.BuiltinClassLoader.defineClass(BuiltinClassLoader.java:862) at java.base/jdk.internal.loader.BuiltinClassLoader.findClassOnClassPathOrNull(BuiltinClassLoader.java:760) at java.base/jdk.internal.loader.BuiltinClassLoader.loadClassOrNull(BuiltinClassLoader.java:681) at java.base/jdk.internal.loader.BuiltinClassLoader.loadClass(BuiltinClassLoader.java:639) at java.base/jdk.internal.loader.ClassLoaders$AppClassLoader.loadClass(ClassLoaders.java:188) at java.base/java.lang.ClassLoader.loadClass(ClassLoader.java:526) at org.apache.hadoop.fs.s3a.S3AFileSystem.initialize(S3AFileSystem.java:519) at org.apache.hadoop.fs.FileSystem.createFileSystem(FileSystem.java:3469) at org.apache.hadoop.fs.FileSystem.access$300(FileSystem.java:174) at org.apache.hadoop.fs.FileSystem$Cache.getInternal(FileSystem.java:3574) at org.apache.hadoop.fs.FileSystem$Cache.get(FileSystem.java:3521) at org.apache.hadoop.fs.FileSystem.get(FileSystem.java:540) at org.apache.hadoop.fs.Path.getFileSystem(Path.java:365) at org.apache.spark.sql.execution.streaming.FileStreamSink$.hasMetadata(FileStreamSink.scala:53) at org.apache.spark.sql.execution.datasources.DataSource.resolveRelation(DataSource.scala:366) at org.apache.spark.sql.DataFrameReader.loadV1Source(DataFrameReader.scala:229) at org.apache.spark.sql.DataFrameReader.$anonfun$load$2(DataFrameReader.scala:211) at scala.Option.getOrElse(Option.scala:189) at org.apache.spark.sql.DataFrameReader.load(DataFrameReader.scala:211) at org.apache.spark.sql.DataFrameReader.json(DataFrameReader.scala:362) at java.base/jdk.internal.reflect.NativeMethodAccessorImpl.invoke0(Native Method) at java.base/jdk.internal.reflect.NativeMethodAccessorImpl.invoke(NativeMethodAccessorImpl.java:75) at java.base/jdk.internal.reflect.DelegatingMethodAccessorImpl.invoke(DelegatingMethodAccessorImpl.java:52) at java.base/java.lang.reflect.Method.invoke(Method.java:580) at py4j.reflection.MethodInvoker.invoke(MethodInvoker.java:244) at py4j.reflection.ReflectionEngine.invoke(ReflectionEngine.java:374) at py4j.Gateway.invoke(Gateway.java:282) at py4j.commands.AbstractCommand.invokeMethod(AbstractCommand.java:132) at py4j.commands.CallCommand.execute(CallCommand.java:79) at py4j.ClientServerConnection.waitForCommands(ClientServerConnection.java:182) at py4j.ClientServerConnection.run(ClientServerConnection.java:106) at java.base/java.lang.Thread.run(Thread.java:1583) Caused by: java.lang.ClassNotFoundException: org.apache.hadoop.fs.impl.prefetch.PrefetchingStatistics at java.base/jdk.internal.loader.BuiltinClassLoader.loadClass(BuiltinClassLoader.java:641) at java.base/jdk.internal.loader.ClassLoaders$AppClassLoader.loadClass(ClassLoaders.java:188) at java.base/java.lang.ClassLoader.loadClass(ClassLoader.java:526) ... 35 more
我实在不知道该怎么解决这个问题了,我参考过Stack Overflow上类似的Hadoop和AWS版本匹配问题,调整过spark-submit命令的参数,但都没起作用。
备注:内容来源于stack exchange,提问作者dxr5
相关产品推荐
相关产品推荐

