You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

关于Polars中pl.concat()方法是否严格保留输入数据顺序的技术问询

关于Polars pl.concat() 顺序保留的问题

问题1:pl.concat([lazyframe1, lazyframe2]) 是否严格保留输入LazyFrame的顺序?

肯定会的!Polars的pl.concat()在处理LazyFrame列表时,严格按照你传入的列表顺序拼接数据。也就是说,lazyframe1的所有行会完整出现在结果的前半部分,紧接着才是lazyframe2的所有行,不会有任何顺序错乱。

你可以用简单的验证代码确认这一点:

import polars as pl

# 模拟两个带标识的LazyFrame
lazy1 = pl.scan_parquet("data1.parquet").with_columns(source=pl.lit("df1"))
lazy2 = pl.scan_parquet("data2.parquet").with_columns(source=pl.lit("df2"))

combined = pl.concat([lazy1, lazy2])
print(combined.collect())

输出里所有source为df1的行都会排在df2的前面,完全匹配输入顺序。


问题2:用pl.concat([pl.scan_csv(file) for file in ['file1.csv', 'file2.csv']])生成的LazyFrame,数据顺序是否与输入文件一致?查询优化器会不会打乱顺序?

放心,结果顺序和你传入的文件列表顺序完全一致,而且查询优化器不会擅自打乱这个顺序。

原因很明确:

  • pl.scan_csv()返回的LazyFrame对应单个文件的读取逻辑,pl.concat()会把这些读取逻辑按顺序串联起来——执行时会先完整读取file1.csv的所有行,再读取file2.csv的所有行,最后拼接。
  • Polars的查询优化器主要做逻辑优化(比如谓词下推、列裁剪)或物理优化(比如选择更高效的读取方式),但它不会修改用户显式定义的操作顺序——因为拼接顺序属于你明确指定的业务逻辑,优化器不会越界改动。

唯一需要注意的小细节:如果单个CSV文件内部的行本身是乱序的,那拼接后的对应部分也会保持文件内部的顺序,但这是文件本身的问题,和pl.concat()的行为无关。

实际验证示例:

import polars as pl

file_list = ["file1.csv", "file2.csv"]
combined_lazy = pl.concat([pl.scan_csv(f) for f in file_list])

# 收集结果后查看顺序
result = combined_lazy.collect()
# 假设file1.csv有行["a", 1], ["b",2],file2.csv有["c",3], ["d",4]
# 结果必然是["a",1], ["b",2], ["c",3], ["d",4],完全匹配文件列表顺序

内容的提问来源于stack exchange,提问作者DataWiz

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.04.27 15:44:06