You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

在pandas中使用pyarrow.DictionaryArray替代Categorical时的类别管理及类型相关问题咨询

在pandas中使用pyarrow.DictionaryArray替代Categorical时的类别管理及类型相关问题咨询

我正在评估在数据流中使用基于Arrow的数据类型的可行性。

我们的数据流基于pandas,使用dtype_backend='pyarrow'看起来效果不错(这个选项在构造函数中优先使用Arrow类型)。不过我在使用pyarrow.DictionaryArray替代Categorical时遇到了一些问题。

举个例子:

import pyarrow as pa
import pandas as pd

def pyarrow_cat_dtype(vals):
    as_dict_vals = pa.array(vals).dictionary_encode()
    return pd.ArrowDtype(as_dict_vals.type)

vals = ['A', 'B', 'C']
ser = pd.Series(vals*2, dtype=pyarrow_cat_dtype(vals))

这个序列的类型是:

dictionary<values=string, indices=int32, ordered=0>[pyarrow]

在ETL过程中,这个序列会被修改,但我不清楚如何同时更新对应的类别。比如我们需要删除大部分值,或者合并来自多个数据源的类别。

使用Categorical类型时,可以通过访问.categories属性,或者在groupby中使用observed=True来实现这些操作,但我找不到DictionaryArray类似的管理方式。

请问这些值在pandas中是如何存储的?有没有办法检查这个数据类型并读取或管理底层的值和索引?

我还不太明白,比如为什么给pd.Categorical序列添加新值会抛出TypeError,但使用DictionaryArray时却不会出现这种情况。

备注:内容来源于stack exchange,提问作者Glauco

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.04.17 11:49:51