You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

使用PyDESeq2做RNA差异分析:应输入原始计数还是归一化计数?

PyDESeq2 RNA差异分析常见疑问解答

关于输入计数的要求

  • PyDESeq2 必须使用原始整数计数作为输入,绝对不能用TPM、RPKM或其他预归一化后的表达值。原因是PyDESeq2的核心统计模型基于原始计数的负二项分布特性,它会自行通过size factor校正来处理样本间测序深度的差异,预归一化后的数值会打破模型的统计假设,直接导致分析结果失真。

关于baseMean的含义

  • baseMean不是所有样本原始计数的简单平均值。它是经过size factor校正后的样本计数均值:先对每个样本的基因计数用对应的size factor做校正(消除测序深度差异),再计算所有校正后数值的平均值,以此反映基因在所有样本中的整体表达水平。

用原始计数分析结果未达预期的排查方向

如果已经严格使用原始整数计数输入,那输入方式没有问题。结果不符合预期可以从这些方向排查:

  • 实验设计是否准确:分组标签是否对应正确,是否存在未纳入模型的混杂变量(比如批次效应)
  • 样本量是否充足:小样本量会导致统计效力不足,难以检测到真实的差异表达基因
  • 低表达基因过滤是否缺失:建议先过滤掉在多数样本中表达极低的基因(比如至少在一半样本中计数≥10),这类基因的统计结果可靠性极低,还会干扰整体分析
  • 参数设置是否正确:对比组是否设置错误,协变量是否正确纳入模型

内容的提问来源于stack exchange,提问作者Zach

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.06.16 00:39:52