You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

PySpark列表转DataFrame报ValueError长度不匹配的解决方法

报错原因

你定义的schema仅包含1个FirstName字段,要求DataFrame的每一行只能有1个值。但代码中sc.parallelize([list1])生成的RDD仅包含1个元素,这个元素是长度为100的姓名列表,Spark尝试将这个长度100的列表映射到只有1个字段的schema上,长度不匹配,因此触发报错。

可行修复方案
  • 方案1:直接基于Python列表生成DataFrame,无需提前并行化
from faker import Faker
from pyspark.sql.types import *

faker = Faker("en_GB")
list1 = [faker.first_name() for _ in range(0, 100)]
# 每个元素转为单元素元组,对应一行1个字段
data = [(name,) for name in list1]

schema = StructType([
    StructField('FirstName', StringType(), True)
])

df = spark.createDataFrame(data, schema)
display(df)
  • 方案2:调整RDD并行化逻辑,保证每个RDD元素长度和schema字段数匹配
from faker import Faker
from pyspark.sql.types import *

faker = Faker("en_GB")
list1 = [faker.first_name() for _ in range(0, 100)]
# 不将整个列表套入外层列表,每个姓名单独作为单元素元组存入RDD
firstname = sc.parallelize([(name,) for name in list1])

schema = StructType([
    StructField('FirstName', StringType(), True)
])

df = spark.createDataFrame(firstname, schema)
display(df)

内容的提问来源于stack exchange,提问作者Carolina Karoullas

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.25 09:57:01