You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Python如何提取category类型数据集中的全部唯一特征值

问题描述

现有Python数据集代码如下:

dataset=['apple','orange','banana','grape','orange','apple','kiwi','apple']

该数据集的特征类型为category分类类型,需要识别出数据集中包含的所有特征值,在如下print命令的空缺处填写代码:

print('The feature values of the dataset:',<空缺待填内容>)

要求执行后输出结果为:The feature values of the dataset: 'apple','orange','banana','grape','kiwi'

解决方案

空缺处可填写如下代码:

','.join(f"'{val}'" for val in dict.fromkeys(dataset))

代码说明

  • 用dict.fromkeys(dataset)利用Python3.7+版本字典键保持首次插入顺序的特性,对列表按元素首次出现顺序去重,得到无重复的特征值序列
  • 用生成器表达式遍历去重后的元素,给每个元素前后拼接单引号
  • 用','作为分隔符将所有处理后的字符串拼接为符合输出格式要求的内容

如果你的Python版本低于3.7,也可以用collections模块的OrderedDict实现相同的有序去重效果,代码如下:

','.join(f"'{val}'" for val in OrderedDict.fromkeys(dataset))

注意使用OrderedDict前需要先导入:from collections import OrderedDict

内容的提问来源于stack exchange,提问作者Velaria Lim

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.10.03 01:48:03