Spark中JavaRDD<Row>转Dataset<Row>报错:ArrayList非法string类型
解决HBase RDD转Dataset时的类型不匹配问题
这个报错的核心原因很明确:你生成的Row结构和定义的schema完全不匹配。
问题出在哪?
看你的ResultFunction代码:
return RowFactory.create(values);
这里的values是一个ArrayList<String>,当你把这个集合直接传给RowFactory.create()时,Spark会把整个ArrayList当成Row的单个元素,而不是把List里的每个字符串作为Row的独立字段。但你的schema定义的是string类型的字段(不管是单个还是多个),自然会抛出ArrayList is not a valid external type for schema of string的错误——Spark期望拿到字符串,结果收到了一个集合。
之前你改成String[][]、String[]没用,大概率是因为你还是把它们作为单个元素传给了RowFactory.create(),本质问题没解决。
怎么修复?
你需要把List中的每个字符串拆成Row的独立元素,而不是把整个集合塞进去。只需要修改ResultFunction里的Row生成逻辑:
public static class ResultFunction implements Function<Result, Row> { public Row call(Result result) throws Exception { List<String> values = new ArrayList<String>(); for (Cell cell : result.rawCells()) { values.add(Bytes.toString(CellUtil.cloneValue(cell))); } // 把List转为字符串数组,让RowFactory把数组的每个元素作为Row的独立字段 return RowFactory.create(values.toArray(new String[values.size()])); } }
额外注意事项
- Schema要和Row的字段完全匹配:你的
schema定义的字段数量、顺序、类型,必须和HBase中取出的cell数量、顺序、类型一一对应。比如你从HBase每行取3个字符串类型的cell,那schema就要定义3个StringType的字段,顺序要和result.rawCells()返回的cell顺序一致。
举个schema的示例:
StructType schema = DataTypes.createStructType(Arrays.asList( DataTypes.createStructField("col1", DataTypes.StringType, true), DataTypes.createStructField("col2", DataTypes.StringType, true), DataTypes.createStructField("col3", DataTypes.StringType, true) ));
- 确认HBase cell的顺序:
result.rawCells()返回的cell顺序是由HBase的存储顺序决定的,如果你需要固定的字段顺序,最好在遍历cell时根据列名来筛选和排序,避免字段顺序混乱。
修改完之后再执行createDataFrame和show(),应该就能正常显示数据了。
内容的提问来源于stack exchange,提问作者Mahesha999
相关产品推荐
相关产品推荐

