You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何为数据集随机分配字符串至新列vaccinated_or_not?

给数据集添加随机填充的新列

用Python的pandas库就能搞定这个需求,具体步骤如下:

  • 导入所需库:pandas用来处理表格数据,numpy用来生成随机选择结果
import pandas as pd
import numpy as np
  • 加载你的数据集:如果是手动构造数据就用字典生成;如果是从文件读取,替换成对应读取方法
# 构造示例数据集
data = {
    'Name': ['Aaron', 'Steve', 'Richard'],
    'Age': [42, 44, 29]
}
df = pd.DataFrame(data)

# 如果是从空格分隔的文本文件读取,用这个:
# df = pd.read_fwf('你的数据文件名.txt')
  • 定义可选的填充值列表
status_options = ['Yes', 'No', 'Info Missing', 'Not Provided', 'In Progress']
  • 生成随机填充的新列
    用numpy的随机选择函数,给每一行随机分配一个状态值,添加为新列:
df['vaccinated_or_not'] = np.random.choice(status_options, size=len(df))
  • 查看最终结果
    打印数据框就能得到符合要求的结果(每次运行状态会随机变化):
print(df)

示例输出:

Name  Age vaccinated_or_not
0    Aaron   42                Yes
1    Steve   44       Info Missing
2  Richard   29                 No

内容的提问来源于stack exchange,提问作者Patrik

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.26 04:02:11