Glue作业导入ArrayType报错及Glue4.0下类型错误求助
问题解决方案
第一个错误(ImportError)的原因及解决
ArrayType是Spark的数据类型类,不属于pyspark.sql.functions模块,正确的导入路径是pyspark.sql.types。无论使用哪个Glue版本,都需要修正导入语句:
from pyspark.sql.types import ArrayType, StringType
第二个错误(TypeError)的原因及解决
你在Glue4.0中仍错误地从pyspark.sql.functions导入ArrayType,该模块下不存在合法的ArrayType数据类型实现,从而导致初始化参数错误。
修正后的完整代码示例:
from pyspark.sql.types import ArrayType, StringType from pyspark.sql.functions import udf class JobBase(object): # 所有UDF必须先初始化 def __init__(self): print("Inside the constructor of Class phases ") self.winner_org_calculation_udf = udf(JobBase.winner_org_calculation, ArrayType(StringType()))
额外注意事项
- 确保
JobBase.winner_org_calculation函数的返回值确实是字符串数组类型,否则UDF运行时会抛出类型不匹配错误。 - 数据类型的导入路径
pyspark.sql.types是所有Spark版本通用的,无需随Glue版本调整。
内容的提问来源于stack exchange,提问作者pbh
相关产品推荐
相关产品推荐

