You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

使用Spark NLP的DocumentAssembler处理Array<String>时遇类型转换错误

问题分析与解决

你的错误源于构造DataFrame时,text列的类型是Array<Array>(三层嵌套数组),但Spark NLP的DocumentAssembler仅支持单层的String或Array<String>列,因此触发了类型转换错误。

修正后的代码示例

如果要处理单个字符串:

data = spark.createDataFrame([["Spark NLP is an open-source text processing library."]]).toDF("text")
documentAssembler = DocumentAssembler().setInputCol("text").setOutputCol("document")
result = documentAssembler.transform(data)
result.select("document").show(truncate=False)

如果确实需要处理Array<String>类型的列(多条文本):

data = spark.createDataFrame([[["First sentence", "Second sentence"]]]).toDF("text")
documentAssembler = DocumentAssembler().setInputCol("text").setOutputCol("document")
result = documentAssembler.transform(data)
result.select("document").show(truncate=False)

补充说明

当输入列是Array<String>时,DocumentAssembler会将数组中的每个字符串分别转换为独立的Document对象;如果输入是单个String,则生成一个对应Document。

内容的提问来源于stack exchange,提问作者Rory

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.21 07:23:17