You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何利用labels自动化实现基于Python的聚类筛选流程?

自动化OPTICS聚类筛选与数据清理流程

直接用以下代码替换你的手动流程,一步完成标签匹配、数据清理和聚类筛选:

# 获取排序后的聚类标签,并关联到原数据框
df['cluster_label'] = optics_model.labels_[optics_model.ordering_]

# 执行数据清理(替换成你的实际清理规则,比如删缺失值、过滤异常值)
cleaned_df = df.dropna(subset=['需要检查的列']).query('数值列 <= 阈值')  # 示例规则

# 一键筛选指定聚类,比如标签为0的聚类
cluster_0 = cleaned_df[cleaned_df['cluster_label'] == 0]

步骤说明

  • 自动关联标签与数据:把OPTICS输出的排序后标签直接作为新列加入数据框,彻底省去手动匹配索引的环节,确保每个样本的标签和原始数据一一对应。
  • 嵌入式数据清理:在带标签的数据框上直接完成清理操作,无需导出数据再手动处理,避免索引错位问题。
  • 无需手动抄录索引:通过布尔索引直接筛选对应标签的行,完全替代手动整理索引列表的繁琐步骤。

扩展:批量处理所有聚类

如果需要一次性获取所有聚类的结果,可通过groupby实现:

# 按聚类标签分组,得到每个聚类的清理后数据
clusters = {label: group for label, group in cleaned_df.groupby('cluster_label')}

# 访问单个聚类,比如标签-1对应的噪声点
noise_cluster = clusters.get(-1, pd.DataFrame())

内容的提问来源于stack exchange,提问作者Adriel

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.09 07:25:25