C++读取Parquet二进制流解析RowGroupMetaData返回乱码问题
问题解答
核心错误原因
1. RowGroupMetaData构造逻辑错误
你调用parquet::RowGroupMetaData::Make的使用方式完全不符合API设计:
- 这个API接收的输入是序列化后的RowGroup元数据字节流,而你传入的是从文件中读取的RowGroup实际存储数据(包含所有列的压缩/编码后的Page数据,属于业务数据范畴,不是元数据),用业务数据反序列化为元数据结构必然返回乱码。
- 实际上你在解析完
FileMetaData之后,调用_metadata->RowGroup(x)得到的就是完整可用的RowGroupMetaData对象,所有属性可以直接读取,完全不需要自己重新构造。
2. 头部魔数到第一个RowGroup之间的字节说明
偏移量4~113的区域是Parquet规范允许的可选自定义填充区:
- 规范明确允许在头部魔数
PAR1之后、第一个RowGroup起始位置之前写入任意自定义二进制数据,通常用来做文件标识、对齐填充等用途,不需要解析,直接跳过即可。
正确的部分拉取Parquet文件流程
适配你从API拉取大Parquet文件部分内容的场景,正确流程如下:
- 第一步:先请求文件尾部的8字节,读取4字节的FileMetaData长度和尾部4字节魔数校验
- 第二步:根据拿到的长度,请求对应长度的FileMetaData字节,解析得到完整的FileMetaData对象
- 第三步:筛选你需要的RowGroup,根据
RowGroup(x)->file_offset()和RowGroup(x)->total_byte_size()请求对应的字节范围,拿到RowGroup的实际数据块 - 第四步:将拿到的RowGroup数据块,配合已经存在的
RowGroupMetaData对象,传入Parquet Reader接口即可解析出对应的行列数据,不需要额外做元数据反序列化。
代码优化点
- 存储元数据长度、文件偏移的变量建议统一用
int64_t类型,避免大文件场景下int溢出 - 不要将RowGroup的二进制数据转为字符串输出,该内容是压缩/编码后的二进制数据,输出乱码属于正常现象
内容的提问来源于stack exchange,提问作者David Baumgarten
相关产品推荐
相关产品推荐

