常见组学技术笔记:从 DNA 基因组学到 Multi-omics

发布时间:2026/10/7 7:55:29
常见组学技术笔记:从 DNA 基因组学到 Multi-omics
1. 前言组学Omics技术——从 DNA、RNA、蛋白质乃至表观遗传等多个层面全面揭示生命活动的分子机制。内容系统梳理 DNA 基因组学、Chromatin、RNA 转录组学、蛋白质组学以及 Multi-omics 五大方向的核心概念、技术手段与应用场景。7类RNA技术比较技术测什么空间位置分辨率基因范围典型输出Bulk RNA-seqRNA❌整块组织全转录组gene × samplescRNA-seqRNA❌单细胞全转录组gene × cellsnRNA-seq核RNA❌单核全转录组gene × nucleusVisium类 STRNA✅spot/近细胞级全转录组gene × spatial spotVisium HD等RNA✅μm级bin全转录组gene × spatial binXenium/MERFISHRNA✅单分子/单细胞通常靶向paneltranscript坐标scATAC-seq开放染色质❌单细胞核全基因组peak × cellNotes“空间分辨率高”≠“检测基因多”≠“检测灵敏度高”。例如Xenium可以知道某一个 RNA 分子 ↓ 是什么基因 ↓ 位于哪个 x,y 坐标 ↓ 属于哪个细胞但它通常不是传统意义上无偏的全转录组检测。而Visium可以做更广泛的转录组检测但传统 Visium 一个 spot 可能覆盖多个细胞。10x 官方目前也明确把 Chromium、Visium 和 Xenium分别定位为 single-cell、whole-transcriptome spatial 和 targeted in-situ spatialXenium目前可针对最高约数千基因进行检测。2. DNA 基因组学DNA 基因组学Genomics是研究生物体全部遗传信息即基因组的结构、功能与进化的学科。其核心目标是获取并解析物种的完整 DNA 序列进而定位基因、注释功能、发现变异。主要技术手段全基因组测序WGS对个体全部 DNA 进行测序用于变异检测与遗传病研究。全外显子组测序WES聚焦蛋白编码区成本更低适合大规模人群筛查。单核苷酸多态性SNP芯片用于群体遗传学与关联分析。应用场景涵盖肿瘤基因组学、罕见病诊断、农业育种以及微生物组研究等。3. Chromatin组学Chromatin染色质是 DNA 与组蛋白等蛋白质结合形成的复合结构是表观遗传调控的核心载体。Chromatin 研究关注 DNA 的包装状态、可及性以及组蛋白修饰如何影响基因表达。关键技术包括ATAC-seq检测染色质开放区域定位调控元件。ChIP-seq鉴定特定转录因子或组蛋白修饰在全基因组上的结合位点。Hi-C解析染色质三维空间结构揭示远距离调控关系。这些技术帮助研究者理解细胞分化、发育以及疾病发生过程中的基因调控网络。4. RNA 转录组学RNA 转录组学Transcriptomics研究细胞或组织在特定状态下全部 RNA 的种类、结构与表达水平是连接基因组与蛋白质组的桥梁。常用方法RNA-seq基于高通量测序定量基因表达发现差异表达基因与可变剪接事件。单细胞 RNA-seqscRNA-seq在单细胞分辨率下解析转录异质性绘制细胞图谱。空间转录组学将基因表达信息映射到组织空间位置揭示细胞微环境。转录组学广泛应用于疾病标志物筛选、药物响应预测以及发育生物学研究。4.1. Bulk RNA-seq/ scRNA-seq/snRNA-seq单细胞 RNA 测序scRNA-seq是一种研究样本中每个独立细胞全转录组基因表达谱的方法。如果将批量读取比作眺望整片森林那么单细胞读取就如同看清每一棵树。细胞或细胞核通过微流控通道并在 Chromium X 系列仪器中生成 GEM 的示意图这是单细胞实验工作流程的一部分用于生成可供测序的基因表达文库。4.1.1. 批量RNA测序/bulk作用差异基因表达分析识别和表征新转录本批量数据可用于注释异构体、非编码 RNA、可变剪接事件和基因融合。发现用于疾病诊断、预后或分层的 RNA 生物标志物和分子特征研究基因集通路和网络在各种生物条件下如何整体变化优缺点成本更低的全转录组分析选择侧重于群体水平的洞察。较低的测序深度要求进一步降低了成本。此外更简单的样本制备要求以及更低的数据复杂度和分辨率使其成为更易上手的工作流程分析也更加直接。由于 bulk RNA-seq 提供的是样本中所有细胞基因表达的平均读数它无法区分基因表达读数的细胞来源。如果某一基因或独特转录本主要由一种或少数几种细胞类型产生这一点就会被掩盖。无法揭示样本的细胞异质性因此对于高度异质性的组织而言不太理想。相比之下单细胞测序可以揭示这种异质性甚至能够发现可能驱动独特基因表达谱的稀有、低丰度细胞类型。比较 bulk RNA-seq 和单细胞 RNA-seq 基因表达读取的分辨率。左侧图表展示了样本转录景观的 bulk 视图显示了 6 个基因的平均表达水平。右侧图表代表单细胞基因表达数据揭示了样本真实的细胞异质性以及从平均视图所见的表达模式的细胞来源。链接https://www.10xgenomics.com/cn/blog/bulk-vs-single-cell-RNA-seq-experimental-differences-and-advantages-of-single-cell-resolution4.1.2. 单细胞 RNA 测序 / scRNA-seq原理单细胞 RNA 测序single-cell RNA sequencing, scRNA-seq通过微流控技术将单个细胞与带有条形码的凝胶珠Gel Bead-in-Emulsion, GEM包裹实现单细胞水平的 mRNA 捕获、反转录和文库构建。每个细胞的转录本被赋予独特细胞条形码cell barcode测序后按 barcode 拆分获得gene × cell的表达矩阵。核心流程以 10x Genomics Chromium 为例单细胞悬液制备 → 微流控生成 GEM → 细胞裂解、mRNA 捕获 → 反转录带 barcode→ 文库构建 → Illumina 测序 → 数据拆分与定量与 bulk RNA-seq 的关键差异维度bulk RNA-seqscRNA-seq分辨率组织/群体平均单细胞异质性完全丢失完整保留数据稀疏性低基因覆盖完整高dropout 事件多成本低高每个细胞需独立建库分析复杂度简单DESeq2/edgeR复杂降维、聚类、轨迹推断主要优势发现稀有细胞类型如肿瘤微环境中的耗竭 T 细胞、癌症干细胞刻画细胞状态连续谱如分化轨迹、应激响应梯度解析细胞间通讯通过配体-受体基因共表达预测细胞互作主要局限问题原因应对策略解离偏好酶消化导致某些细胞类型易死亡或丢失优化酶方案改用 snRNA-seq应激基因诱导解离过程激活即刻早期基因如Fos,Jun快速操作使用冷冻样本做 snRNA-seq双细胞doublets两个细胞被同一个 GEM 捕获计算预测Scrublet/DoubletFinder降低上样浓度mRNA 捕获效率~10-30%低表达基因易漏检增加测序深度使用高灵敏度平台典型应用场景肿瘤免疫微环境区分恶性细胞、T/B 细胞、髓系细胞、成纤维细胞亚群发育生物学构建胚胎发育的细胞分化图谱如小鼠 gastrulation药物筛选追踪药物处理后不同细胞群体的特异性响应4.1.3. 单细胞核 RNA 测序 / snRNA-seq原理snRNA-seqsingle-nucleus RNA sequencing直接对分离的细胞核进行 RNA 捕获和测序。细胞核膜完整内含 pre-mRNA、lncRNA 及少量成熟 mRNA。通过机械研磨或细胞裂解液破坏细胞膜释放完整细胞核后续流程与 scRNA-seq 类似。与 scRNA-seq 的核心对比对比项scRNA-seqsnRNA-seq起始材料活细胞悬液细胞核新鲜或冷冻组织捕获 RNA 类型主要是成熟细胞质 mRNA核内 pre-mRNA 成熟 mRNA含 intron解离步骤需要酶消化/机械不需要直接裂解细胞膜样本类型新鲜组织为主兼容冷冻样本、FFPE、难消化组织应激基因高解离诱导低细胞质基因丢失无部分如线粒体基因高比例丢失检测灵敏度较高mRNA 丰富略低核 RNA 总量少核/质比例基因偏差无有需校正 intron/exon 比例关键优势解决 scRNA-seq 的硬骨头难消化组织 珍贵冷冻样本 ↓ ↓ 脂肪组织、心肌、 临床样本库biobank 神经组织神经元大 手术剩余组织、穿刺样本 且易损、骨组织 ↓ ↓ 【snRNA-seq 直接可用】 【scRNA-seq 解离困难或 细胞死亡率高】 ↓ 【snRNA-seq 绕过解离 直接提核】数据分析的特殊考量注意点说明处理方法intron 富集核 RNA 含大量未剪接 pre-mRNA定量时纳入 intronic reads或使用velocyto/scVelo做 RNA 速率分析线粒体基因比例低线粒体位于细胞质不能直接用 %MT 作为质控指标改用核内基因数、双细胞率核包被完整性核膜破裂导致 RNA 流失流式或显微镜质检PI 染色排除破损核何时选择 snRNA-seq 而非 scRNA-seq场景理由样本已冷冻无法新鲜制备无需活细胞组织解离后特定细胞类型大量丢失避免解离偏好研究目标基因主要在核内调控如转录因子、lncRNA核 RNA 信息更丰富需要同时做 scATAC-seq 或 Multiome共用细胞核样本实现RNA 染色质可及性联合大样本队列研究冷冻样本便于批量处理和标准化10x Genomics MultiomesnRNA-seq scATAC-seq 联合同一细胞核 → 同时捕获 ├── 转录组gene expression, snRNA-seq └── 染色质可及性chromatin accessibility, scATAC-seq → 直接关联某基因的启动子开放程度 ↔ 该基因表达水平 → 揭示调控机制enhancer → 靶基因 → 细胞状态scRNA-seq vs snRNA-seq新鲜样本 活细胞易得 追求最高灵敏度 ↓ 【scRNA-seq】 冷冻样本 / 难消化组织 / 需联合 ATAC / 避免解离应激 ↓ 【snRNA-seq】两者在分析层面降维聚类、注释、轨迹高度互通主要差异在于实验前置条件和质控指标可根据样本实际情况灵活选择。4.2. Spatial RNA4.2.1. 捕获 NGS空转10x Visium / Visuim HD / Slide-seq4.2.2. 原位读取型Xenium / CosMx / MERFISH/ seqFISH / ISS传统空间转录组组织中的RNA → 捕获→ 拿出来→ 建库→Illumina测序原位方法RNA还在组织里→直接在组织里识别即in situ4.2.2.1. Xenium⭐亚细胞级分辨率目标 RNA 转录本检测空间定位数据格式每个 transcript 是一个空间点。→ 细胞分割 → 转录本transcript → 分配到细胞gene x cell的格式Gene X Y NPHS1 124.2 815.3 NPHS1 125.1 817.4 COL1A1 500.3 231.4 PECAM1 319.4 624.1 ...示例图片背景三阳性HER2/ER/PR乳腺癌的预后趋势中等偏好预后在乳腺癌各亚型中的预后排序从好到差Luminal A (ER/PR/HER2-) 最好Luminal B (ER/PR/HER2-Ki67高)Luminal B 型ER/PR/HER2-Ki67 高 较好三阳性 (ER/PR/HER2) 中等偏好 ← 这个位置HER2过表达型 (ER-/PR-/HER2) 中等偏差三阴性 (ER-/PR-/HER2-) 最差三阳性 vs 其他亚型的具体数据怎么解读查看Xenium 空间图中 ESR1、ERBB2 和 PGR 的表达情况后发现所分析的组织切片中大部分同时表达 ERBB2 和 ESR1 转录本HER2/ER 双阳性或仅表达 ERBB2 转录本HER2 阳性。特点“亚细胞级”看清RNA在细胞内部的精确位置50nm传统Visium分辨率大约55μm的单位——包含多个细胞但是是全转录组“目标RNA转录本检测”看【已知的】重要基因适合什么情况组织区域比较三阳性本身不是坏趋势——相比纯HER2阳性或三阴性它的预后反而更好但它也不是好趋势——不如Luminal A型。原文的核心价值在于发现同一肿瘤内部藏着不同分子特征的区域这种空间异质性才是理解肿瘤进展的关键。和HE标注结果的关键区别检测层面结果覆盖范围HE 传统病理基于蛋白质的免疫组化IHCHER2/ER/PR-整个组织切片的整体评估Xenium基于RNA的原位检测大部分区域 HER2/ER/PR-但小区域HER2/ER/PR单细胞/亚细胞分辨率的空间图谱HE 看到的整体平均 ┌─────────────────────────────┐ │ 整个样本 HER2/ER/PR- │ └─────────────────────────────┘ Xenium 看到的空间分辨 ┌─────────────────────────────┐ │ ████████████████████████ │ ← 90% 区域HER2/ER/PR-与HE一致 │ ████████████████████████ │ │ ▓▓▓ │ ← 10% 小区域HER2/ER/PR新发现 │ ▓▓▓ │ ~0.1 mm² / 总面积 42 mm² └─────────────────────────────┘为什么需要考虑HE 能看出大概只是不够精细。Xenium 在相同组织上发现了 HE 无法捕捉的微小异质性区域。为什么 HE 没发现 PR 区域原因解释区域太小仅 ~0.1 mm²占总面积 0.2%HE 是整体判读病理医生对整张切片做综合评估微小区域被平均掉了RNA vs 蛋白检测差异Xenium 检测 RNA 转录本灵敏度更高IHC 检测蛋白PR 蛋白表达可能低于检测阈值空间信息丢失传统方法没有这个基因在哪个位置表达的信息4.2.2.2.CosMxCosMx Spatial Molecular Imager 是 Bruker Spatial Biology原 NanoString 的成像型、原位空间组学平台.可以回答这个细胞是什么细胞、表达什么基因而且它原来就在组织的什么位置。对比项CosMx SMIBruker/NanoStringXenium10x GenomicsMERFISHVizgen等实现公司/体系Bruker/NanoString10x GenomicsVizgen等实现类型原位成像原位成像原位成像是否 Illumina NGS否否否基本单位transcript转录本transcript转录本transcript转录本空间尺度单细胞/亚细胞单细胞/亚细胞单细胞/亚细胞RNA panel高plex targeted高通量靶向高plex targeted高通量靶向高plex targeted高通量靶向输出RNA坐标cellRNA坐标cellRNA坐标cell组织形态保留保留保留最大基因panel最多 6000 基因最多 5000 基因依方案最高可上万FFPE支持支持相应工作流依方案冷冻样本最优FFPE难度更高主要优势RNA蛋白/组织环境能力强10x生态成熟RNA灵敏度高原位编码体系经典基因通量上限高三者都属于原位成像读取型空间转录组不依赖 Illumina NGS直接检测单条转录本、保留组织形态输出带空间坐标的单细胞基因表达CosMx同切片 RNA 蛋白联合检测能力突出适配病理 FFPE、TMAXenium10x 多组学生态配套完善低丰度 RNA 检测灵敏度好MERFISH经典纠错编码方案冷冻组织可实现超高基因 panel。这三类和Visium/Slide-seq捕获 NGS 型本质区分后者需要提取 RNA 上机 NGS 测序这三者不做 NGS直接在组织切片原位成像解码。4.2.2.3.MERFISHMERFISHMultiplexed Error-Robust Fluorescence In Situ Hybridization多重纠错荧光原位杂交由哈佛大学庄小威团队开发是基于组合式纠错编码的原位成像技术。核心原理每个 RNA 分子 → 分配唯一二进制条形码如 16-bit ↓ 多轮杂交成像每轮用两种颜色ON1, OFF0读取 1 个 bit ↓ 16 轮成像 → 16-bit 二进制码 → 解码基因身份 ↓ 纠错设计Hamming 距离 ≥ 4可纠正单 bit 错误、检测双 bit 错误技术特点维度详情分辨率单分子 / 单细胞 / 亚细胞~20 nm 定位精度基因通量经典方案 140 基因扩展方案可达10,000 基因检测方式多轮循环杂交 成像非酶促扩增样本类型冷冻切片最优FFPE 需优化读出平台宽场荧光显微镜 高灵敏相机与 Xenium/CosMx 的关键差异对比项MERFISHXeniumCosMx编码体系组合式二进制纠错编码挂锁探针 酶促滚环扩增RCA光切割条形码 原位测序信号放大无单分子直接成像RCA 扩增RCA 扩增多轮循环机制杂交-成像-剥离重复探针连续杂交酶切步进连续成像光切割释放基因上限最高理论无上限已验证 10,000~5,000官方 panel~6,000官方 panelRNA 灵敏度中等无扩增低丰度 RNA 可能漏检高RCA 放大信号高成像速度较慢多轮完整剥离较快连续步进中等生态配套需自建分析流程Vizgen 提供商业化方案10x 生态完整Cell Ranger, LoupeBruker/NanoString 配套独特优势超高基因通量唯一实现10,000 基因 panel的原位技术适合全转录组级空间图谱无扩增偏差单分子直接计数定量更线性经典编码理论Hamming 纠错编码降低误检率即使某轮成像失败仍可正确解码主要局限问题解释低丰度 RNA 检测受限无信号放大单拷贝基因可能低于信噪比阈值多轮循环耗时长16-20 轮杂交 × 每轮数十分钟 → 总耗时数小时至一天组织穿透深度厚样本10 μm探针渗透不均通常限于薄切片FFPE 兼容性差交联严重干扰探针结合需特殊修复方案典型应用全转录组空间图谱如小鼠皮层 10,000 基因 MERFISH 图谱揭示细胞类型空间排布规律复杂组织三维重建连续切片 配准构建 mm 级三维空间表达模型验证性研究用高 panel 验证 scRNA-seq 发现的 marker 基因空间分布4.2.2.4. seqFISHseqFISHsequential FISH序贯荧光原位杂交由加州理工学院蔡龙团队开发与 MERFISH 并列为早期经典原位编码技术但采用不同的条形码设计和成像策略。核心原理超参数条形码每个基因分配一组初级探针20 条每条带独特读出序列 ↓ 多轮杂交每轮用荧光标记的读出探针识别特定读出序列 ↓ 伪彩色编码通过不同轮次、不同颜色的组合区分基因 ↓ 示例基因 A 轮1-绿色 轮3-红色 轮5-黄色 基因 B 轮1-红色 轮2-绿色 轮4-蓝色技术演进版本特点通量seqFISH原始版本伪彩色编码~30-100 基因seqFISH引入纠错编码 信号放大~10,000 基因seqFISH v2优化探针设计提升 FFPE 兼容性~10,000 基因与 MERFISH 的核心对比对比项seqFISH/seqFISHMERFISH编码逻辑超参数空间编码多探针 × 多轮颜色组合组合式二进制纠错编码探针设计每个基因 20 条初级探针各带独立读出序列每个基因 1 套二进制编码探针组信号放大原始无seqFISH 引入 branched DNA 放大始终无扩增纠错能力seqFISH 引入有限纠错强纠错Hamming 距离设计基因通量seqFISH 可达 10,00010,000商业化学术方案为主部分公司授权提供试剂Vizgen 商业化成熟独特技术特征内参校正seqFISH 在每个细胞中同时检测housekeeping 基因作为内参校正样本间、批次间信号差异亚细胞定位精度高利用多点定位20 条探针分散结合可实现10 nm的精确定位用于研究 RNA 在细胞器层面的分布兼容活细胞成像部分方案可在活细胞中进行有限轮次成像追踪 RNA 动态局限问题说明探针设计复杂度高20 条初级探针/基因 × 验证特异性设计工作量大原始 seqFISH 无纠错早期版本误检率较高依赖 seqFISH 改进商业化程度低主要依赖学术实验室自建标准化流程较少4.2.2.5. ISSISSIn Situ Sequencing原位测序由瑞典皇家理工学院 Mats Nilsson 团队开发是**唯一真正实现在组织内直接进行酶促测序**的原位技术与其他成像编码技术有本质区别。核心原理滚环扩增 测序-by-合成目标 RNA → 反转录为 cDNA → 挂锁探针padlock probe环化 cDNA ↓ 滚环扩增RCAΦ29 聚合酶以环化 cDNA 为模板生成长单链 DNA 纳米球 ↓ 测序-by-合成Sequencing-by-Synthesis, SBS 逐轮加入 ├── 荧光标记的寡核苷酸探针与 RCA 产物互补杂交 → 成像 → 剥离 └── 或连接测序SOLiD 风格荧光标记探针连接 ↓ 多轮循环 → 逐个碱基读取序列 → 识别基因身份技术分支方案测序化学读长特点ISS原始连接测序ligation-based4-5 bp短读长高准确率ISS-PLA邻近连接扩增-检测蛋白-RNA 互作ExSeq / STARmap杂交测序hybridization-based较长提升通量简化流程ISS 结合 IlluminaSBS 化学可达 30 bp读长增加解码能力增强与其他原位技术的本质区别维度ISSMERFISH/seqFISH/Xenium/CosMx信息读取方式真正测序读取实际核苷酸序列编码杂交预设探针-颜色对应表发现能力可检测未知突变、融合、SNV仅检测预设 panel 中的基因序列验证有实际读取序列无依赖探针特异性读长限制短通常 30 bp无探针结合即检测酶促步骤多RCA、聚合酶/连接酶反应少或无组织损伤风险较高多轮酶反应较低关键优势序列验证级特异性实际读取 RNA 序列非预设探针杂交可区分高度同源基因、剪接变体发现未知变异短读长范围内可检测点突变、融合断点如BCR-ABL灵活靶向无需预先合成大量编码探针通过通用测序引物即可靶向任意基因主要局限问题解释读长短4-30 bp 难以覆盖全转录本复杂区域重复序列解码困难酶促损伤多轮 RCA 测序反应导致组织形态破坏、RNA 降解通量低每轮成像区域小大视野拼接耗时基因 panel 通常 100技术复杂度高需优化 RCA 效率、测序反应均匀性重复性挑战大商业化困难流程难以标准化目前以学术研究为主典型应用场景 1验证基因融合 → 设计靶向融合断点的挂锁探针 → ISS 读取断点两侧序列 → 单细胞水平确认 *EML4-ALK* 等融合事件的空间分布 场景 2区分高度同源基因家族 → 如 Hox 基因簇序列相似度 90% → 短读长测序可识别 SNP 差异位点 → 杂交编码技术难以设计特异性探针 场景 3神经科学与 ExSeq 结合 → 膨胀显微镜Expansion Microscopy预先将组织物理放大 → ISS 在膨胀后的水凝胶中测序 → 实现超分辨率20 nm空间转录组三种技术快速对比总结对比项MERFISHseqFISHISS核心创新纠错编码理论超参数探针设计原位酶促测序本质成像编码成像编码真正测序基因通量10,00010,000seqFISH100通常RNA 灵敏度中中seqFISH 有放大中依赖 RCA 效率序列验证无无有发现未知变异否否可检测短读长范围内突变/融合组织完整性较好较好较差多轮酶反应商业化程度Vizgen 成熟低低最佳场景超高通量空间图谱亚细胞精确定位、活细胞融合/突变验证、同源基因区分5. 蛋白质组学蛋白质组学Proteomics是对生物体或细胞中全部蛋白质进行大规模鉴定与定量分析的学科。蛋白质是功能的直接执行者因此蛋白质组学能更真实地反映生物学状态。核心技术质谱分析Mass Spectrometry蛋白质组学的基石用于蛋白鉴定与定量。双向电泳2D-PAGE经典分离方法按等电点与分子量分离蛋白。蛋白质互作网络分析结合亲和纯化与质谱绘制蛋白-蛋白相互作用图谱。蛋白质组学在生物标志物发现、药物靶点验证以及精准医学中发挥关键作用。6. Multi-omicsMulti-omics多组学是指在同一生物学样本上整合基因组、表观基因组、转录组、蛋白质组乃至代谢组等多层次数据进行系统性关联分析的研究范式。核心价值互补验证不同组学数据相互印证降低单一组学的假阳性。机制解析从 DNA 变异 → 转录变化 → 蛋白表达 → 代谢表型的完整链条揭示因果机制。精准分层在肿瘤、复杂疾病中实现更精细的分子分型与个体化治疗。常用整合策略多组学关联分析、网络建模以及基于机器学习的多模态融合。