如何提升Koalas中head函数在大数据集下的执行速度?
快速获取Koalas数据集样本的解决方案
核心逻辑是避开原生koalas.head()要求全量拉取到Driver节点的限制,仅扫描少量分区即可得到样本数据,可选用以下几种可行方案:
- 方案1:配合Spark原生
limit()取数
Spark的limit()算子在取少量数据时会优先扫描就近分区直到凑够指定数量,不会触发全量数据拉取,性能远高于原生koalas.head(),示例代码:# 从Koalas DataFrame转Spark处理后再转回来,仅取100条样本 sample_kdf = your_kdf.to_spark().limit(100).to_koalas() - 方案2:采样部分分区后取数
如果需要跨分区的随机样本,可以先按比例采样部分分区再取数,避免扫描全量分区:# 先随机采样20%分区,再从中取100条样本,兼顾样本多样性和性能 sampled_kdf = ks.DataFrame(your_kdf.to_spark().sample(withReplacement=False, fraction=0.2).limit(100)) - 方案3:直接取单个分区的全量数据
如果只需要单分区样本,可以直接读取首个分区的所有数据,完全不需要扫描其他分区:# 仅提取索引为0的首个分区数据 first_partition_rdd = your_kdf.to_spark().rdd.mapPartitionsWithIndex( lambda idx, iter: list(iter) if idx == 0 else [] ) first_partition_kdf = ks.DataFrame(first_partition_rdd.toDF(your_kdf.columns))
以上方案均不会触发全量数据拉取到Driver的操作,仅扫描指定的少量分区,在TB级大型数据集上也可以在几秒内返回结果,完全满足快速预览、分析样本数据的需求。如果后续需要严格的全局前n行,再换回原生
koalas.head()即可。
内容的提问来源于stack exchange,提问作者Mohit Jain
相关产品推荐
相关产品推荐

