一、项目基本信息
二、生物信息分析流程
2.1分析流程
首先我们从公共数据库或实验平台获取单细胞测序数据,经过严格的质量控制、标准化处理和批次效应校正,确保数据可靠性。接着进行特征选择与降维,筛选高变基因并通过 PCA、t-SNE 或 UMAP 等方法将高维数据投影到低维空间。基于降维结果进行细胞聚类与分群,利用 Louvain 等算法将相似细胞划分为不同簇。随后通过细胞注释与标记基因识别,结合已知标记基因和参考数据库确定各簇的细胞类型,并识别特异性标记基因。在此基础上开展富集分析,探索差异表达基因的生物学功能和信号通路。为揭示细胞动态变化,进行拟时序分析重建细胞发育轨迹,细胞通讯分析解析细胞间信号网络,并在肿瘤研究中应用 inferCNV 分析推断染色体拷贝数变异。整个流程从数据到知识,系统揭示细胞异质性、功能状态和互作关
系,为理解组织微环境、发育过程和疾病机制提供多维度视角。
2.2 分析内容


三、项目分析结果
3.1 可视化 QC 指标
我们一般使用这些指标来过滤细胞:过滤具有 UMI 计数超过 2500 或小于 200 的细胞;
过滤具有>5%线粒体的细胞。
各个指标质控小提琴图
注:nFeature_RNA 代表检测到的基因数;nCount_RNA 为总 UMI 计数;percent.mt 线粒体基因百分比。每一个点代表一个个体细胞数据,identity 表示样本。
3.2 筛选高可变辑因
我们计算数据集中显示高变异的特征子集(即,它们在某些细胞中表达强烈,在另一些单元格中表达得很低)。在下游分析中关注这些基因有助于突出单细胞数据集中的生物信号。默认情况下,我们使用每个数据集的 2000 个基因。这些将用于下游分析,如 PCA。
高变基因筛选图
注:左图为全部基因分布,黑点代表非高变基因,红点为高变基因。右图为高变基因突出显示,红点代表高变基因,标注为重要高变基因名称。
3.3 可视化 PCA
3.3.1 PCA
Seurat 提供了几个有用的方法来可视化定义 PCA 的单元格和功能,包括[DimPlot()],[DimHeatmap()]等。
PCA
3.3.2 不同 PC 展示
我们通常选择包含前两个 PC 在内的一系列重要 PC(10-20)用于进一步下游分析。
不同 PC 展示
3.4 确定数据集的“主成分个数”
Seurat 根据 PCA 分数对单元单元进行聚类,每个 PC 基本上代表一个“元结构”,该
“元结构”将信息组合在相关功能集中。我们随机排列数据的子集(默认情况下为 1%)并
重新运行 PCA,构建功能分数的“空分布”,并重复此过程。我们确定“重要”PC。
QQ Plot 和肘部图
注:每个 PC 的 p 值分布与统一分布(虚线)进行比较。“重要”PC 将显示在虚线上方。另一种方法生成“肘部图”:根据每个(函数)解释的方差百分比对原则组件进行排名。在此示例中,我们可以观察到 PC 9-10 周围的“肘部”,表明大多数真实信号在前 10 个 PC 中被捕获。
3.5 细胞聚类及可视化
Seurat 采用基于图形的聚类方法,简言之,这些方法将细胞嵌入到图形结构中,例如 K最近的邻(KNN)图,在具有类似特征表达模式的单元之间绘制边缘,然后尝试将此图划分
为高度互连的“集团”或“社区”。与表象一样,我们首先根据 PCA 空间中的欧几里德距离构建 KNN 图,并根据当地社区的共享重叠(Jaccard 相似性)优化任意两个细胞之间的边缘权重。接下来将 Louvain 算法(默认值)或 SLM 等模块化优化技术应用于迭代组细胞,以优化标准模块化功能。该函数实现此
过程,并包含一个分辨率参数,该参数设置下游聚类的“数量”,增加值导致更多群集。我们发现,将此参数设置在 0.4-1.2 之间通常会为大约 3K 细胞的单细胞数据集提供良好的结果。
对于较大的数据集,最佳分辨率通常会增加。Seurat 提供了多种非线性降维技术,如 tSNE 和 UMAP,以可视化和探索这些数据集。
UMAP 降维散点图
注:9 个簇(Cluster 0-8),对应 9 种细胞类型;每个点代表一个单细胞。UMAP_1 和 UMAP_2 代表细胞类型分离维度
3.6 查找不同表达的 marker
默认情况下,FindAllMarkers()与所有其他细胞相比,可识别单个群集的 marker。
单个群集的 marker 热图
注:每一列的 cluster 代表了不同的细胞类群,每一行代表不同的基因。这里基因是取每个 cluster 的 top10 进行展示(可以进行调整)。
3.7 Dotplot
dotplot 图
注:点的大小代表在某个细胞类型中表达该基因的细胞比例,点的颜色代表该基因在表达细胞中的平均表达水平。
3.8 细胞注释
细胞注释后的 UMAP 图
注:通过 SingleR 包、cellmaker2.0 或者是根据已知的细胞标记基因和参考数据库,对聚类得到的细胞簇进行注释,确定细胞类型,替换之前的 Cluster 名称。
3.9 差异分析

多组火山图
3.10 富集分析
出图同转录组。
3.11 拟时序分析
3.11.1 细胞轨迹分析
拟时序分析(Pseudotime Analysis),又称细胞轨迹分析(Cell Trajectory Analysis),是一种在单细胞转录组学中常用的方法,通过对细胞在特定生物过程中的转录组数据进行排序,推断其发展或变化的时间顺序。尽管单细胞数据通常是静态的(在一个时间点采集),拟时序分析通过基因表达的变化模式来重建细胞的发育轨迹或动态过程,从而模拟细胞随时间推移的变化,揭示细胞在不同状态下的演变路径和关键转折点。
细胞轨迹图
注:图中 123 是分叉点,不代表特别意义,也不代表时间先后。这张图按照 sudotime,时间先后是从左往右,左边是起点(root)。起点的设置可以使用 orderCells 的 root_state 参数,将右侧设置为起点。
3.11.2 基因拟时序点图
注:横轴表示拟时序(Pseudotime),反映了细胞在发育或状态转换中的相对顺序。数值越大,表示细胞处于发育或分化的更晚阶段。纵轴表示基因的相对表达水平。采用对数尺度(Log-scale),更好地展示基因表达的动态范围(等同于 logFC),尤其是低表达和高表达的差异。不同的基因有不同的表达水平范围,从 1 到 100 或更高,显示了基因在不同阶段的活跃程度。点的颜色代表不同的细胞类型。通过点的颜色,可以区分不同细胞类型中基因的表达情况,观察基因在不同细胞类型中的变化模式。黑色曲线表示基因表达随拟时序变化的平滑趋势线,展示基因在细胞发育过程中的整体表达趋势。
注:该热图显示的是同一时间点两个谱系的变化,热图的列是伪时间的点,行是基因。这张图最上面的条条,灰色的代表分叉前,左边红色代表左边这个 cell fate,右边蓝色代表右边这个 cell fate,从热图中间往右读,是伪时间的一个谱系,往左是另一个谱系。
3.12 细胞通讯分析
3.12.1 细胞通讯分析
细胞通讯分析(Cell Communication Analysis)是一种用于研究不同细胞类型之间通过细胞间信号传导和分子互作进行通讯的生物学方法。该分析帮助理解细胞如何通过分泌的信号分子(如细胞因子、趋化因子、配体-受体对等)来协调其功能、调控免疫反应、维持组织稳态或参与疾病过程。

细胞互作关系
注:左图:外周各种颜色圆圈的大小表示细胞的数量,圈越大,细胞数越多。发出箭头的细胞表达配体,箭头指向的细胞表达受体。配体-受体对越多,线越粗。右图:互作的概率/强度值(强度就是概率值相加)。
3.12.2 每种细胞发出的信号

number of interaction 图
注:展示每个细胞如何跟别的细胞互作。
3.12.3 单个信号通路或配体-受体介导的细胞互作可视化(层次图、网络图、和弦图、热图)
层次图和热图
注:层次图:在层次图中,实体圆和空心圆分别表示源和目标。圆的大小与每个细胞组的细胞数成比例。线越粗,互作信号越强。左侧中间的 target 是我们选定的靶细胞,右图是选中的靶细胞之外的另外一组放在中间看互作(vertex.receiver =c(1,2,4,6) 定义一个数字向量(淋系细胞),将细胞类型的索引作为目标)。两图的实心为我们定义的细胞类型(即定义的vertex.receiver)的自分泌和旁分泌信号。
热图:单个信号通路的细胞互作热图。纵轴是发出信号的细胞,横轴是接收信号的细胞,热图颜色深浅代表信号强度。上侧和右侧的柱子是纵轴和横轴强度的累积。
3.12.4 配体-受体层级的可视化(计算各个 ligand-receptor pair 对信号通路的贡献)

信号通路条形图和层次图
注:左图计算配体受体对选定信号通路的贡献值(在这里就是查看哪条信号通路对 TGFb 贡献最大);右图为层次图:提取对这个通路贡献最大的配体受体对来展示(也可以选择其他的配体受体对)。3.13 inferCNV 分析
InferCNV 用于分析肿瘤单细胞 RNA 测序数据,通过比较肿瘤细胞与参考"正常"细胞的基因表达强度,识别体细胞大规模染色体拷贝数变异的证据(如整条染色体或大片段染色体的扩增或缺失)。该方法可生成展示肿瘤基因组各染色体区域相对表达强度的热图,相较于正常细胞,肿瘤基因组中过度富集或缺失的区域通常会直观显现。
注:图中的红色部分是 References(Cells),也就是我们自行定义的对照(正常)细胞。这些对照细胞可以是相对于肿瘤细胞的正常细胞(癌与非癌),也可选用免疫细胞进行对照。蓝色部分是 Observations(Cells),也就是我们想要重点分析的细胞。灰色部分是细胞的图注,上边的色块代表了对照细胞的情况,该图研究者纳入了 Microglia/Macrophage 和Oligodendrocytes(non-malignant) 作为对照细胞,恶性细胞作为观察细胞。