如何将按病原体测试行存储的DataFrame转换为按被测个体行存储并新增阳性标识列?
解决方案
可以用Pandas的分组聚合和透视功能实现需求,以下是具体步骤和代码:
1. 核心逻辑
- 按
sampleID分组,判断每组内是否存在阳性检测结果,生成pathPresence二进制列 - 将每个样本的检测结果转换为单行格式(可选择仅保留样本标识与阳性状态,或同时保留所有病原体的检测结果)
2. 代码实现
假设原始DataFrame名为df,包含列:sampleID(样本标识)、pathogen_name(病原体名称)、result(检测结果,1代表阳性,0代表阴性)
方式一:仅保留样本ID与阳性状态
import pandas as pd # 按sampleID分组,取组内检测结果的最大值(存在阳性则为1,否则为0) summary_df = df.groupby('sampleID')['result'].max().reset_index() # 重命名列名为需求的pathPresence summary_df.rename(columns={'result': 'pathPresence'}, inplace=True)
方式二:保留所有病原体检测结果(宽列格式)+ 阳性状态
# 将长格式数据转为宽格式,每个病原体对应一列 wide_df = df.pivot(index='sampleID', columns='pathogen_name', values='result').reset_index() # 添加pathPresence列:判断当前样本是否有任意病原体呈阳性 wide_df['pathPresence'] = wide_df.drop('sampleID', axis=1).any(axis=1).astype(int)
3. 结果验证
处理后的DataFrame总计60行(对应60只啮齿动物),pathPresence列值为1表示该样本有至少一种病原体阳性,0表示全阴性,完全匹配需求。
内容的提问来源于stack exchange,提问作者Coen
相关产品推荐
相关产品推荐

