大数据场景下where与sort哪个效率更高?应该优先执行哪个?
大数据集下where与sort的执行顺序选择
优先选择先执行where过滤的写法1,执行效率远高于先排序的写法2
核心原因
- sort操作的时间复杂度为
O(n log n),执行耗时、内存占用都和待处理数据的规模直接正相关,数据量越大,排序的资源开销越高。 - 先执行where操作,可以提前把
count<=100的无效数据全部剔除,大幅缩小后续sort需要处理的数据集规模,直接降低排序环节的计算成本。 - 如果先执行sort再过滤,全量原始数据都要先参与排序,其中大量最终会被扔掉的无效数据也占用了计算资源,完全是无用开销,数据集体量越大,这种浪费就越夸张,严重时甚至会出现内存溢出导致任务运行失败的情况。
举个直观的对比:假设原始数据集有1亿条,where过滤后仅剩余10万条符合要求的数据,对10万条数据排序的耗时,仅为对1亿条数据排序的几十分之一,差距非常明显。
两种写法参考
推荐写法:
|where count>100 |sort count fruits
不推荐写法:
|sort count fruits |where count>100
补充说明
目前主流的大数据查询引擎自带的查询优化器,默认会做过滤条件下推优化,哪怕你写的是先排序后过滤的写法,优化器也会自动调整执行顺序为先过滤再排序。但手动写为优先过滤的写法是更稳妥的习惯,可以避免部分特殊场景下优化器失效带来的额外开销。
内容的提问来源于stack exchange,提问作者LindaMage
相关产品推荐
相关产品推荐

