使用Petastorm构建行组索引后PyArrow无法读取大元数据Parquet数据集
问题根因
Petastorm的build_rowgroup_index接口会将生成的行组索引全部写入数据集根目录的_common_metadata公共元数据文件中。当数据集行组数量多、索引列基数较高时,该元数据文件体积会快速膨胀,超过PyArrow加载Parquet数据集时默认的Thrift反序列化大小上限,就会抛出对应的超限错误。
解决方案
方案一:不需要使用Petastorm行组索引的场景
直接删除数据集目录下的_common_metadata和_metadata文件即可,PyArrow加载时会自动扫描所有Parquet分片的元数据完成加载,不需要依赖公共元数据文件。方案二:需要保留行组索引的场景
加载数据集时手动调大Thrift消息大小限制,修改后的加载代码如下:
from pyarrow import parquet as pq dataset_path = "path/to/dataset/" # 此处设置阈值为2GB,可根据你的元数据实际大小调整 dataset = pq.ParquetDataset( path_or_paths=dataset_path, thrift_message_size_limit=2 * 1024 * 1024 * 1024 )
如果运行提示参数不存在,说明你使用的是低版本PyArrow,将参数名替换为thrift_size_limit即可。
- 方案三:从根源缩小元数据体积
如果索引列基数过高,会导致索引条目本身占用空间极大,你可以做如下优化:- 更换基数更低的字段作为索引列
- 生成原始数据集时调大行组大小,减少总行组数量,降低索引条目总数
- 拆分单一大数据集为多个小数据集分别构建索引
内容的提问来源于stack exchange,提问作者Marjan Albouye
相关产品推荐
相关产品推荐

