如何基于百分比随机选择节点分配标签并构建网络数据集
解决方案:按比例随机保留节点标签并生成新数据集
核心思路
先在节点层面完成15%标签保留的随机筛选,再将处理后的标签关联到边数据集上,确保同一个节点的所有边对应的标签状态一致(要么保留原标签,要么设为NaN)。
代码实现(基于Pandas)
假设你已经用pd.read_csv()或其他方式读入了边数据集(命名为edges_df)和标签数据集(命名为labels_df),执行以下步骤:
- 导入依赖库
import pandas as pd import numpy as np
- 随机筛选15%的节点保留标签
# 获取所有唯一节点 unique_nodes = labels_df['Node'].unique() # 计算需保留的节点数量(取整) keep_count = int(len(unique_nodes) * 0.15) # 无放回随机抽样,确保每个节点只被选中一次 kept_nodes = np.random.choice(unique_nodes, size=keep_count, replace=False)
- 处理标签数据集,生成带保留标记的新标签列
# 标记哪些节点的标签需要保留 labels_df['is_kept'] = labels_df['Node'].isin(kept_nodes) # 生成新标签:保留节点用原Label,其余设为NaN labels_df['processed_label'] = np.where(labels_df['is_kept'], labels_df['Label'], np.nan)
- 关联边数据集与处理后的标签,生成最终结果
# 按First节点关联标签 result_df = edges_df.merge( labels_df[['Node', 'processed_label']], left_on='First', right_on='Node', how='left' ) # 整理列名并删除冗余列 result_df = result_df.rename(columns={'processed_label': 'Label'}).drop('Node', axis=1)
关键说明
- 必须先在节点维度做抽样,再关联到边数据:如果直接对边行做筛选,会导致同一个节点的不同边出现标签状态不一致的问题(比如某节点的一条边保留标签,另一条边设为NaN)。
replace=False确保无放回抽样,避免重复选中同一节点,保证15%比例的准确性。- 最终结果中,
Label列对应每条边的First节点标签,符合你给出的示例格式。
内容的提问来源于stack exchange,提问作者Math
相关产品推荐
相关产品推荐

