基于Synthea生成的COVID-19数据集,在Jupyter Notebook中用Python生成对比表格的技术求助
基于Synthea生成的COVID-19数据集,在Jupyter Notebook中用Python生成对比表格的技术求助
各位好,我现在在处理一个用Synthea生成的COVID-19数据集,遇到了点小麻烦想请教大家。
我想要生成两组对比表格:
- 第一组是死亡的COVID患者和存活的COVID患者各自的TOP 10关联疾病(需要排除COVID-19本身和疑似COVID-19的记录)
- 第二组是住院的COVID患者和转入ICU的COVID患者对应的
covid_patient_conditions里的TOP 10关联疾病
我自己写了一个基础的统计函数,但输出的结果总是不符合预期,没法得到清晰的对比表格。下面是我目前写的代码:
def condition_frequencies(patient_ids, conditions, exclude_diseases): filtered_conditions = conditions[~conditions['DESCRIPTION'].isin(exclude_diseases)] filtered_conditions = filtered_conditions[filtered_conditions['PATIENT'].isin(patient_ids)] disease_counts = filtered_conditions.groupby(['CODE', 'DESCRIPTION']).size().reset_index(name='count') ranked_diseases = disease_counts.sort_values(by='count', ascending=False).reset_index(drop=True) top_10_diseases = ranked_diseases.head(10) return top_10_diseases exclude_diseases = ["COVID-19", "Suspected COVID-19"]
有没有大佬能帮我看看问题出在哪,或者给我一些优化建议,让我能生成想要的对比表格呀?
备注:内容来源于stack exchange,提问作者SSB
相关产品推荐
相关产品推荐

