You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

基于Synthea生成的COVID-19数据集,在Jupyter Notebook中用Python生成对比表格的技术求助

基于Synthea生成的COVID-19数据集,在Jupyter Notebook中用Python生成对比表格的技术求助

各位好,我现在在处理一个用Synthea生成的COVID-19数据集,遇到了点小麻烦想请教大家。

我想要生成两组对比表格:

  • 第一组是死亡的COVID患者和存活的COVID患者各自的TOP 10关联疾病(需要排除COVID-19本身和疑似COVID-19的记录)
  • 第二组是住院的COVID患者和转入ICU的COVID患者对应的covid_patient_conditions里的TOP 10关联疾病

我自己写了一个基础的统计函数,但输出的结果总是不符合预期,没法得到清晰的对比表格。下面是我目前写的代码:

def condition_frequencies(patient_ids, conditions, exclude_diseases):
    filtered_conditions = conditions[~conditions['DESCRIPTION'].isin(exclude_diseases)]
    filtered_conditions = filtered_conditions[filtered_conditions['PATIENT'].isin(patient_ids)]
    disease_counts = filtered_conditions.groupby(['CODE', 'DESCRIPTION']).size().reset_index(name='count')
    ranked_diseases = disease_counts.sort_values(by='count', ascending=False).reset_index(drop=True)
    top_10_diseases = ranked_diseases.head(10)
    return top_10_diseases

exclude_diseases = ["COVID-19", "Suspected COVID-19"]

有没有大佬能帮我看看问题出在哪,或者给我一些优化建议,让我能生成想要的对比表格呀?

备注:内容来源于stack exchange,提问作者SSB

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.04.14 15:00:28