You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Rust中Polars转换为Categorical类型的推荐实现方式

问题:Polars中Categorical类型的三种实例化方式哪种更推荐?

用户提供的Rust函数如下:

pub fn test_dataframe() -> PolarsResult<DataFrame> {
    let df = df! {
        "lo" => [...],
        "hi" => [...],
        "register" => [...],
    }?;
    df.lazy().select([
        col("lo")
            .map_many(
                decode_to_str,
                &[col("hi")],
                GetOutput::from_type(DataType::Utf8),
            )
            .cast(DataType::Categorical(None)) // <-- 此处实例化Categorical
            .alias("categorical_1"),
        col("register")
            .map(
                register_names_from_register_ids,
                GetOutput::from_type(DataType::Utf8),
            )
            .cast(DataType::Categorical(None)) // <-- 此处同样实例化Categorical
            .alias("categorical_2"),
    ]).collect()
}

在调用.cast()转换为Categorical类型时,有三种实例化DataType::Categorical的方式:

  • 方式1:使用DataType::Categorical(None),官方文档示例采用此方式;
  • 方式2:使用DataType::Categorical(Some(Arc::new(RevMapping::default())));
  • 方式3:预先实例化一个RevMapping,再克隆复用给不同列,示例代码如下:
    // ...
    let revmap = Arc::new(RevMapping::default());
    // ...
        .cast(DataType::Categorical(Some(revmap.clone())))
    // ...
        .cast(DataType::Categorical(Some(revmap.clone())))
    // ...
    

用户疑问:官方文档采用Categorical(None)的方式,但用户认为复用不同列的映射缓存没有弊端,不确定是否有误,且官方未给出明确推荐。另外用户尝试用df.estimated_size()对比三种方式的DataFrame预估大小,未发现差异。


解答

三种方式的适用场景和推荐优先级如下:

  1. 方式1:DataType::Categorical(None)
    这是最推荐的通用方案。当传入None时,Polars会自动为目标列创建独立的RevMapping,无需手动管理映射对象。这种方式简洁、低维护成本,适合绝大多数场景——尤其是当各列的分类值没有关联、不需要共享映射的情况。官方文档优先采用它,正是因为它的通用性和易用性。

  2. 方式3:复用同一个RevMapping实例
    仅在多列共享完全相同的分类值集合时推荐使用,比如两列都是表示"订单状态"(已支付/未支付/已取消)、"用户性别"(男/女/未知)这类有固定枚举值的列。复用映射可以避免内存中重复存储相同的分类值,在数据量较大时能体现出内存优势。你用estimated_size()没测出差异,可能是因为测试数据量小,或者Polars的预估逻辑未细化到共享映射的内存开销,但大数量级下这种优势会显现。

    注意:如果列之间的分类值无重叠或重叠极少,复用映射反而会导致映射中积累大量无关值,反而浪费内存,这种场景下不要用。

  3. 方式2:手动创建新的RevMapping传入
    这种方式几乎没有实用价值。手动实例化空的RevMapping和传入None的效果本质一致——Polars后续都会基于列数据填充映射。它只是多了一层不必要的手动操作,既没有带来额外收益,还增加了代码复杂度,完全不推荐使用。


内容的提问来源于stack exchange,提问作者sebastianfrelle

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.06 01:25:15