如何在Python中随机选取数据集行并修改指定列的值?
在Python中随机选取数据集行并修改特定列值的实现方法
当然可以实现,最常用的工具是pandas库,以下是具体步骤和代码示例:
- 首先导入
pandas(未安装的话可通过pip install pandas完成安装):
import pandas as pd
- 读取你的数据集(以CSV格式为例,Excel格式可使用
pd.read_excel()):
df = pd.read_csv('your_dataset.csv')
- 随机选取600行的索引(默认无放回抽样,确保选中行不重复):
random_rows_idx = df.sample(n=600).index
- 修改特定列的值,假设目标列名为
target_column,这里以设置固定值new_value为例:
df.loc[random_rows_idx, 'target_column'] = 'new_value'
如果需要给选中行设置不同的随机值,比如生成0到100之间的随机整数,可配合numpy实现:
import numpy as np df.loc[random_rows_idx, 'target_column'] = np.random.randint(0, 101, size=600)
补充:若需要有放回抽样(允许同一行被多次选中),可在
sample方法中添加参数:df.sample(n=600, replace=True).index
内容的提问来源于stack exchange,提问作者Soumia Bibi
相关产品推荐
相关产品推荐

