如何从数据集提取信息并按濒危程度分类生成新数据集?
按濒危等级拆分数据集的解决方案
嘿,我来帮你搞定这个数据集拆分的需求!首先咱们先把初始加载代码的语法修正一下(原来的代码缺少换行和缩进,会导致运行报错),然后再一步步生成各个等级的独立数据集。
1. 修正后的数据集加载代码
先确保导入必要的库,并且代码格式正确:
import os import pandas as pd if os.path.isfile("data.csv"): filepath = "data.csv" df = pd.read_csv(filepath) df.head(300)
2. 按濒危等级筛选生成独立数据集
利用Pandas的布尔索引,就可以轻松筛选出对应等级的数据,同时保留所有列的信息:
# 筛选「脆弱(vulnerable)」等级的数据集 vulnerable_df = df[df['濒危程度'] == 'vulnerable'] # 筛选「确定濒危(definitely endangered)」等级的数据集 definitely_endangered_df = df[df['濒危程度'] == 'definitely endangered'] # 筛选「严重濒危(severely endangered)」等级的数据集 severely_endangered_df = df[df['濒危程度'] == 'severely endangered'] # 筛选「灭绝(extinct)」等级的数据集 extinct_df = df[df['濒危程度'] == 'extinct']
注意:如果你的数据集中“濒危程度”列的列名是英文(比如你提供的图片里显示的
Degree of endangerment),记得把代码里的'濒危程度'替换成对应的英文列名哦!
3. 验证筛选结果(可选)
可以通过打印每个数据集的行数,确认筛选是否准确:
print(f"脆弱等级数据量:{len(vulnerable_df)}") print(f"确定濒危等级数据量:{len(definitely_endangered_df)}") print(f"严重濒危等级数据量:{len(severely_endangered_df)}") print(f"灭绝等级数据量:{len(extinct_df)}")
内容的提问来源于stack exchange,提问作者Lola Love
相关产品推荐
相关产品推荐

