You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何基于百分比随机选择节点分配标签并构建网络数据集

解决方案:按比例随机保留节点标签并生成新数据集

核心思路

先在节点层面完成15%标签保留的随机筛选,再将处理后的标签关联到边数据集上,确保同一个节点的所有边对应的标签状态一致(要么保留原标签,要么设为NaN)。

代码实现(基于Pandas)

假设你已经用pd.read_csv()或其他方式读入了边数据集(命名为edges_df)和标签数据集(命名为labels_df),执行以下步骤:

  1. 导入依赖库
import pandas as pd
import numpy as np
  1. 随机筛选15%的节点保留标签
# 获取所有唯一节点
unique_nodes = labels_df['Node'].unique()
# 计算需保留的节点数量(取整)
keep_count = int(len(unique_nodes) * 0.15)
# 无放回随机抽样,确保每个节点只被选中一次
kept_nodes = np.random.choice(unique_nodes, size=keep_count, replace=False)
  1. 处理标签数据集,生成带保留标记的新标签列
# 标记哪些节点的标签需要保留
labels_df['is_kept'] = labels_df['Node'].isin(kept_nodes)
# 生成新标签:保留节点用原Label,其余设为NaN
labels_df['processed_label'] = np.where(labels_df['is_kept'], labels_df['Label'], np.nan)
  1. 关联边数据集与处理后的标签,生成最终结果
# 按First节点关联标签
result_df = edges_df.merge(
    labels_df[['Node', 'processed_label']],
    left_on='First',
    right_on='Node',
    how='left'
)
# 整理列名并删除冗余列
result_df = result_df.rename(columns={'processed_label': 'Label'}).drop('Node', axis=1)

关键说明

  • 必须先在节点维度做抽样,再关联到边数据:如果直接对边行做筛选,会导致同一个节点的不同边出现标签状态不一致的问题(比如某节点的一条边保留标签,另一条边设为NaN)。
  • replace=False确保无放回抽样,避免重复选中同一节点,保证15%比例的准确性。
  • 最终结果中,Label列对应每条边的First节点标签,符合你给出的示例格式。

内容的提问来源于stack exchange,提问作者Math

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.21 10:39:16