You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何为无缺失的DataFrame随机填充10%的NaN值?

为DataFrame随机填充10%的NaN值

核心思路

先计算DataFrame的总元素数量,确定需要替换为NaN的元素个数(总元素的10%),然后随机挑选这些位置并赋值为NaN。

实现代码(基于Pandas和NumPy)

首先导入所需库:

import pandas as pd
import numpy as np

假设你已有一个无缺失值的DataFrame,示例如下(可替换为你的实际数据):

df = pd.DataFrame({
    'A': range(100),
    'B': range(100, 200),
    'C': range(200, 300)
})

执行随机填充NaN的操作:

# 计算总元素数和需要替换的NaN数量
total_elements = df.size
missing_count = int(total_elements * 0.1)

# 随机选择不重复的位置索引
random_indices = np.random.choice(total_elements, missing_count, replace=False)

# 将选中位置设为NaN
df.values.flat[random_indices] = np.nan

关键说明

  • df.values.flat把二维DataFrame转为一维扁平数组,方便直接通过索引定位元素
  • replace=False确保同一个位置不会被重复选中,避免重复设置NaN
  • 若DataFrame包含整数类型列,设置NaN后该列会自动转为浮点类型(因NaN属于浮点类型),如需保留整数类型,可后续转为支持缺失值的Int64类型:
    df = df.astype('Int64')
    

内容的提问来源于stack exchange,提问作者sashx

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.09 06:28:12