Python中如何基于Excel数据生成惩罚Cox回归所需的结构化数组
构造符合要求的生存分析结构化数组方法
假设你已经通过pandas读取Excel数据得到DataFrame对象(变量名设为df),其中事件列名为event、生存时间列名为time,可按照如下步骤实现转换:
依赖库导入
import numpy as np import pandas as pd
转换实现
你可以任选以下两种方法之一完成转换:
- 方法1:直接通过NumPy构造结构化数组
# 定义符合scikit-survival要求的字段类型 dtype_spec = [('event', '?'), ('time', '<f8')] # 合并两列数据并转换为结构化数组 survival_array = np.array( list(zip(df["event"].astype(bool), df["time"].astype(np.float64))), dtype=dtype_spec )
- 方法2:基于Pandas内置方法快速转换
# 先调整两列的数据类型,再导出为记录数组 survival_array = df[["event", "time"]]\ .astype({"event": bool, "time": np.float64})\ .to_records(index=False)
结果校验
转换完成后可以执行以下代码校验格式是否符合要求:
# 校验数据类型 print(survival_array.dtype) # 预期输出:dtype([('event', '?'), ('time', '<f8')]) # 打印前3条数据查看格式 print(survival_array[:3]) # 预期输出类似:[( True, 72.), ( True, 411.), ( True, 228.)]
注意事项
- 转换前请先清洗数据,确保事件列、时间列不存在缺失值或异常值
- 若你的原始事件列取值为0/1,
astype(bool)会自动将0映射为False、1映射为True,无需额外处理
内容的提问来源于stack exchange,提问作者Hatem Ali
相关产品推荐
相关产品推荐

