SCTransform

关注
义项:单细胞数据标准化方法

SCTransform 是处理单细胞 RNA 测序计数数据的标准化与方差稳定方法,由 R 语言包 sctransform 实现。它以正则化负二项回归刻画每个基因的计数分布,把原始计数转换为 Pearson 残差,从而校正测序深度差异、去除技术噪声并稳定基因表达方差 [1][2]。该方法由 Christoph Hafemeister 与 Rahul Satija 于 2019 年提出,发表于 Genome Biology [3]。2022 年发布的 v2 版本改善了运行速度与参数估计的稳定性,并被 Seurat v5 设为默认设置 [4][5]。

百科 图文
目录
  1. 定义
  2. 背景
  3. 内容
  4. 影响与争议
  5. 参见

定义

SCTransform 把单细胞 UMI 计数视为负二项分布的抽样结果,以细胞的测序深度作为协变量,为每个基因拟合一个广义线性模型,再把拟合结果换算成 Pearson 残差 [6][7]。负二项 Pearson 残差可写作 $Z_{cg} = \frac{X_{cg}-\hat\mu_{cg}}{\sqrt{\hat\mu_{cg}+\hat\mu_{cg}^{2}/\theta}}$,其中观测计数与模型期望值之差被其标准差归一化,θ 为过度离散参数 [6]。

SCTransform 的输出不是对数变换后的表达矩阵,而是不含零值的密集残差矩阵 [6]。这些残差被直接用于高变基因选择、降维和聚类 [1]。在 Seurat 中调用 SCTransform 后,结果存入 SCT 测定(assay)并成为默认测定,后续命令即基于标准化后的数据运行 [5]。

背景

单细胞 RNA 测序实验中,不同细胞捕获到的 UMI 总数相差很大,计数数据同时包含生物学差异与实验过程引入的技术变异 [8]。这类矩阵通常十分稀疏,例如在外周血单个核细胞数据集中约 95% 的元素为零 [6]。

此前的常规做法是 LogNormalize 流程:先按每个细胞的文库大小缩放各基因计数,再做 log1p 变换,最后缩放到单位方差和零均值 [9][10]。这一流程对每个细胞独立执行三步变换,并不显式建模计数方差随表达均值变化的关系 [10]。

启发式缩放加对数转换难以应对单细胞数据的稀疏性与噪声,低表达基因的方差容易被过度压缩,测序深度带来的变异也可能残留在降维结果中 [1][2]。SCTransform 改用统计模型,把测序深度校正、技术噪声去除与方差稳定合并为一步处理 [1][2]。

内容

SCTransform 为每个基因拟合负二项回归,并通过对数链接把期望值表示为测序深度的函数 [6]。由于许多基因表达量很低,逐基因估计的过度离散参数并不稳定,方法对参数施加正则化,让过度离散随基因平均表达水平变化,而不完全依赖单个基因自身的拟合结果 [8][11]。

拟合完成后,观测计数被转换为 Pearson 残差,用于 高变基因选择、主成分分析与聚类 [6][1]。在 Seurat 流程中,一次 SCTransform 调用即可完成标准化、方差稳定与高变基因选择,默认返回 3000 个高变基因,多于早期流程的 2000 个 [5]。分析时还可把线粒体基因读数比例、细胞周期评分等作为协变量一并回归,以降低这些因素对结果的干扰 [12][13]。

2022 年 1 月发布的 sctransform 0.3.3 增加了 vst.flavor 参数,用于启用 v2 正则化 [4]。v2 参考了 59 个覆盖不同技术、体系和测序深度的数据集,把广义线性模型的斜率固定为 ln(10),改进了低表达基因的参数估计,并为基因水平标准差设置下界,以免只检测到 1 至 2 个 UMI 的基因产生过大残差 [14]。该版本除残差外还能给出校正计数,供下游差异表达分析使用 [15][16]。

影响与争议

在具体研究中,SCTransform 被用于整合不同研究条件的数据集,例如比较治疗前后的样本并开展差异表达分析 [17]。若干基准测试给出了较为正面的结果:一项评估显示,它在某个数据集上的平均轮廓宽度比 scran 高出 40% [18];另一项批次整合比较中,SCTransform 的整合效果最好,但耗时明显长于 Harmony 等方法,同一任务为 45 秒,而后者为 7 秒 [19]。

2021 年,Lause 等人在 Genome Biology 提出,SCTransform 所用的回归模型参数过多,导致参数估计带有噪声,原始论文因此需要额外的平滑步骤;他们认为基因特异的过度离散估计存在明显偏差,UMI 数据的技术变异可以用所有基因共用的过度离散参数描述,并据此给出更简约的 offset 模型与可解析计算的 Pearson 残差 [6][7]。

Satija 实验室回应称,不认同该模型过度参数化的判断,指出 offset 模型虽然更简约,却会让核糖体蛋白等高表达管家基因获得更高的残差变异与下游权重;同时表示把斜率固定为 ln(10) 等建议已被 v2 采纳 [11][14]。此外,残差矩阵为密集矩阵,在大规模数据上占用内存较多,通常需要先做基因筛选再计算 [6]。

参见

  • Seurat —— 集成 sctransform 的单细胞分析工具包,SCTransform 是其标准化函数。

  • 单细胞RNA测序 —— SCTransform 所处理的数据类型。

  • 负二项回归 —— SCTransform 建模所依据的统计模型。

  • Pearson残差 —— SCTransform 的主要输出形式。

  • 高变基因 —— SCTransform 为下游降维与聚类筛选的特征。

  • 批次效应 —— SCTransform 常被用于整合不同批次或条件下的数据。

参考资料

  1. Supplementary Document . springer.com [引用日期2026-09-27]
  2. 40779_2024_Article_526(PDF) . nih.gov [引用日期2026-09-27]
  3. sctransform . r-project.org [引用日期2026-09-27]
  4. News . r-project.org [引用日期2026-09-27]
  5. Using sctransform in Seurat . satijalab.org [引用日期2026-09-27]
  6. nih.gov 上的网页 . nih.gov [引用日期2026-09-27]
  7. s13059-021-02451-7(PDF) . biomedcentral.com [引用日期2026-09-27]
  8. Lause_Thesis_Processing-scRNAseq-data(PDF) . uni-tuebingen.de [引用日期2026-09-27]
  9. 13059_2025_3576_MOESM6_ESM . springer.com [引用日期2026-09-27]
  10. normalization-and-features . RCAC bioinformatics [引用日期2026-09-27]
  11. sctransform_offset(PDF) . satijalab.org [引用日期2026-09-27]
  12. S1534-5807(22)00493-2 . cell.com [引用日期2026-09-27]
  13. S1934-5909(22)00343-5 . cell.com [引用日期2026-09-27]
  14. Introduction to SCTransform, v2 regularization . satijalab.org [引用日期2026-09-27]
  15. 13059_2021_2584_MOESM2_ESM . springer.com [引用日期2026-09-27]
  16. articlerender . europepmc.org [引用日期2026-09-27]
  17. s41467-025-67850-x_reference(PDF) . nature.com [引用日期2026-09-27]
  18. 13059_2019_1874_MOESM4_ESM . springer.com [引用日期2026-09-27]
  19. s41598-022-26434-1(PDF) . nature.com [引用日期2026-09-27]
词条评价
词条统计

浏览次数:0 次

阅读量:0 次 · 阅读完成量:0 次

最近更新:2026-09-27T15:03:38Z

历史版本

完成率 = 阅读完成量 ÷ 阅读量,分母是阅读量不是浏览次数 —— 关了 JS 的、秒退的都在浏览次数里、不在阅读量里。 详细口径在后台的「数据统计」页。

本条目引用的词条
Seurat 高变基因 主成分分析 Seurat 单细胞RNA测序 负二项回归 Pearson残差 高变基因 批次效应
红色的还不存在。红链不是错误——它标出"这个概念被引用了但还没人写"。