PySpark列表转DataFrame报ValueError长度不匹配的解决方法
报错原因
你定义的schema仅包含1个FirstName字段,要求DataFrame的每一行只能有1个值。但代码中sc.parallelize([list1])生成的RDD仅包含1个元素,这个元素是长度为100的姓名列表,Spark尝试将这个长度100的列表映射到只有1个字段的schema上,长度不匹配,因此触发报错。
可行修复方案
- 方案1:直接基于Python列表生成DataFrame,无需提前并行化
from faker import Faker from pyspark.sql.types import * faker = Faker("en_GB") list1 = [faker.first_name() for _ in range(0, 100)] # 每个元素转为单元素元组,对应一行1个字段 data = [(name,) for name in list1] schema = StructType([ StructField('FirstName', StringType(), True) ]) df = spark.createDataFrame(data, schema) display(df)
- 方案2:调整RDD并行化逻辑,保证每个RDD元素长度和schema字段数匹配
from faker import Faker from pyspark.sql.types import * faker = Faker("en_GB") list1 = [faker.first_name() for _ in range(0, 100)] # 不将整个列表套入外层列表,每个姓名单独作为单元素元组存入RDD firstname = sc.parallelize([(name,) for name in list1]) schema = StructType([ StructField('FirstName', StringType(), True) ]) df = spark.createDataFrame(firstname, schema) display(df)
内容的提问来源于stack exchange,提问作者Carolina Karoullas
相关产品推荐
相关产品推荐

