sklearn OrdinalEncoder的categories='auto'默认类别排序规则是什么?
sklearn OrdinalEncoder categories='auto' 类别顺序规则
当设置categories='auto'时,OrdinalEncoder会基于训练数据集内的类别取值,按升序规则确定类别顺序:
- 针对字符串类型的类别,采用字典序排序;
- 针对数值类型的类别,采用数值大小的升序排序。
简单示例:
- 若训练列取值为
["cat", "dog", "apple", "cat"],排序后的类别序列为["apple", "cat", "dog"],对应编码依次是 0、1、2; - 若训练列是数值类别
[3,1,2,3],排序后的序列为[1,2,3],对应编码 0、1、2。
本质上,这等同于提取训练集里的唯一类别值后,执行默认的升序排序操作,和numpy.sort()处理唯一值的结果一致。
内容的提问来源于stack exchange,提问作者nivniv
相关产品推荐
相关产品推荐

