You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

RNA-seq绘制log2FC-mean图出现异常点,求复现论文图的优化方案

RNA-seq差异分析异常火山图问题排查与解决建议

异常分布的可能成因

  • 计数数据类型错误:recount3提供的默认计数可能不是DESeq2要求的整数型原始测序计数(比如是经过标准化的浮点型数据),直接输入DESeq2会导致统计模型计算异常,出现线状点。
  • 未过滤低表达基因:大量低表达基因(counts极低)的统计显著性不可靠,会在火山图中形成集中的线状/点状集群,干扰整体分布。
  • 分组信息错误:样本分组(type列)可能存在混淆(如对照组与处理组颠倒)、样本数不平衡或混入离群样本,导致差异趋势与论文不符。
  • lfcShrink参数使用不当:未明确指定对比项(coef参数),导致收缩方向或对象错误,无法有效修正异常点。

针对性解决方法

  1. 校验并转换计数数据
    确认ha_4uM_30min_data是否为整数型原始计数:

    # 检查数据类型
    str(ha_4uM_30min_data)
    # 若为recount3的标准化数据,转换为原始计数(参考recount3官方流程)
    library(recount3)
    rse <- create_rse(...) # 重新从recount3构建RSE对象
    counts(rse) <- recount3::scale_counts(rse, by="auc") # 转换为原始计数
    ha_4uM_30min_data <- counts(rse)
    
  2. 过滤低表达基因
    在构建DESeqDataSet前过滤低表达基因,保留至少在N个样本中counts≥10的基因(N根据每组样本数调整,如每组3个样本则设为3):

    keep <- rowSums(ha_4uM_30min_data >= 10) >= 3
    ha_4uM_30min_data_filtered <- ha_4uM_30min_data[keep, ]
    # 重新构建DESeq对象
    dds_4uM_30min <- DESeqDataSetFromMatrix(countData = ha_4uM_30min_data_filtered, 
                                            colData = ha_4uM_30min_meta, 
                                            design = ~ type)
    
  3. 验证分组与样本质量

    • 检查ha_4uM_30min_meta$type的分组标签是否与论文一致,确认样本数平衡。
    • 绘制PCA图验证样本聚类:
      rld <- rlog(dds_4uM_30min)
      plotPCA(rld, intgroup="type")
      
      若存在离群样本,考虑剔除后重新分析。
  4. 正确使用lfcShrink
    明确指定对比项的系数名称(可通过resultsNames(dds2_4uM_30min)查看),选择合适的收缩方法:

    # 查看可用的结果名称
    resultsNames(dds2_4uM_30min)
    # 比如系数为"type_treated_vs_control"
    res_shrink <- lfcShrink(dds2_4uM_30min, 
                            coef = "type_treated_vs_control", 
                            type = "ashr")
    

RNA-seq数据后续处理建议

  • 预处理阶段
    • 严格遵循数据来源的处理流程:recount3数据需按官方文档转换为原始计数,避免直接使用标准化数据进行差异分析。
    • 低表达基因过滤是必备步骤,可有效减少噪声,提升结果可靠性。
    • 先做样本质量评估(PCA、样本相关性热图),确认分组合理性,剔除离群样本。
  • 差异分析阶段
    • 若存在批次效应,需在设计矩阵中加入批次变量(如~ batch + type),消除批次干扰。
    • 查看离散度估计图(plotDispEsts(dds2_4uM_30min)),确认模型拟合是否合理。
    • 绘制火山图时,设置合理的显著性阈值(如padj < 0.05且|log2FC| > 1),对显著基因上色,突出核心差异。
  • 结果验证
    • 对比论文中的差异基因数量、上调/下调趋势,若差异过大,需检查是否与论文使用了相同的比对、计数或过滤策略。

内容的提问来源于stack exchange,提问作者Cindy Chen

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.09 16:25:23