在pandas中使用pyarrow.DictionaryArray替代Categorical时的类别管理及类型相关问题咨询
在pandas中使用pyarrow.DictionaryArray替代Categorical时的类别管理及类型相关问题咨询
我正在评估在数据流中使用基于Arrow的数据类型的可行性。
我们的数据流基于pandas,使用dtype_backend='pyarrow'看起来效果不错(这个选项在构造函数中优先使用Arrow类型)。不过我在使用pyarrow.DictionaryArray替代Categorical时遇到了一些问题。
举个例子:
import pyarrow as pa import pandas as pd def pyarrow_cat_dtype(vals): as_dict_vals = pa.array(vals).dictionary_encode() return pd.ArrowDtype(as_dict_vals.type) vals = ['A', 'B', 'C'] ser = pd.Series(vals*2, dtype=pyarrow_cat_dtype(vals))
这个序列的类型是:
dictionary<values=string, indices=int32, ordered=0>[pyarrow]
在ETL过程中,这个序列会被修改,但我不清楚如何同时更新对应的类别。比如我们需要删除大部分值,或者合并来自多个数据源的类别。
使用Categorical类型时,可以通过访问.categories属性,或者在groupby中使用observed=True来实现这些操作,但我找不到DictionaryArray类似的管理方式。
请问这些值在pandas中是如何存储的?有没有办法检查这个数据类型并读取或管理底层的值和索引?
我还不太明白,比如为什么给pd.Categorical序列添加新值会抛出TypeError,但使用DictionaryArray时却不会出现这种情况。
备注:内容来源于stack exchange,提问作者Glauco
相关产品推荐
相关产品推荐

