如何为数据集随机分配字符串至新列vaccinated_or_not?
给数据集添加随机填充的新列
用Python的pandas库就能搞定这个需求,具体步骤如下:
- 导入所需库:pandas用来处理表格数据,numpy用来生成随机选择结果
import pandas as pd import numpy as np
- 加载你的数据集:如果是手动构造数据就用字典生成;如果是从文件读取,替换成对应读取方法
# 构造示例数据集 data = { 'Name': ['Aaron', 'Steve', 'Richard'], 'Age': [42, 44, 29] } df = pd.DataFrame(data) # 如果是从空格分隔的文本文件读取,用这个: # df = pd.read_fwf('你的数据文件名.txt')
- 定义可选的填充值列表
status_options = ['Yes', 'No', 'Info Missing', 'Not Provided', 'In Progress']
- 生成随机填充的新列
用numpy的随机选择函数,给每一行随机分配一个状态值,添加为新列:
df['vaccinated_or_not'] = np.random.choice(status_options, size=len(df))
- 查看最终结果
打印数据框就能得到符合要求的结果(每次运行状态会随机变化):
print(df)
示例输出:
Name Age vaccinated_or_not 0 Aaron 42 Yes 1 Steve 44 Info Missing 2 Richard 29 No
内容的提问来源于stack exchange,提问作者Patrik
相关产品推荐
相关产品推荐

