Dask DataFrame聚合时自定义返回列名的实现及可行性咨询
Dask DataFrame groupby聚合自定义列名问题解答
无需rename的实现方法
存在不需要额外调用rename函数的实现方案,根据你使用的Dask版本选择对应写法即可:
- 如果你使用 Dask 2021.6.0及以上版本:可以直接使用示例中的Pandas风格关键字参数语法,该版本已经完成了和Pandas命名聚合语法的对齐,不会再抛出
unexpected keyword argument错误,示例代码如下:
import dask.dataframe as dd import pandas as pd data = {"x": [1, 1, 2], "y": [-1, 0, 0]} pd_df = pd.DataFrame(data) dask_df = dd.from_pandas(pd_df, npartitions=1) result = dask_df.groupby("x").agg(my_custom_name=("y", "mean"))
- 如果你使用的是更早的Dask版本:可以通过嵌套字典的方式实现自定义命名,格式为
{原聚合列名: {自定义列名: 聚合函数}},示例代码如下:
import dask.dataframe as dd import pandas as pd data = {"x": [1, 1, 2], "y": [-1, 0, 0]} pd_df = pd.DataFrame(data) dask_df = dd.from_pandas(pd_df, npartitions=1) result = dask_df.groupby("x").agg({"y": {"my_custom_name": "mean"}})
旧版本不支持Pandas原生语法的原因
不存在无法支持的底层架构限制,该语法缺失是版本迭代优先级导致的:
早期Dask的groupby聚合逻辑在参数解析层没有兼容Pandas的关键字参数命名聚合规则,agg方法最初只接受位置参数传入的聚合函数、单层级字典指定列和聚合方法,没有预留关键字参数动态解析为别名的逻辑。加上Dask作为分布式计算框架,早期开发优先级集中在保证核心聚合逻辑的分布式兼容性上,这类语法糖功能的对齐优先级较低,直到2021年的版本迭代中才补全了该特性。
内容的提问来源于stack exchange,提问作者David Bruce Borenstein
相关产品推荐
相关产品推荐

