分析中最常见的挑战之一是比较不同条件、重复实验或分析方法下的CRISPR 筛选结果,以识别始终富集或缺失的靶点。当您从一次筛选中获得20 个候选蛋白 ,并需要将其与另一次筛选的结果进行比较时,维恩图的交集 可以直观地定量可视化重叠和独特的靶点。
本指南将带您了解完整的 CRISPR 数据分析工作流程——从原始测序读段到 MAGeCK RRA 分析、候选基因选择和基于 Venn 图的交集比较——以便您可以自信地识别高置信度目标。
核心目标:从数百万的阅读量到寥寥几个目标受众
典型的CRISPR混合筛选会产生数百万条测序读段。每条读段代表筛选群体中特定细胞的sgRNA条形码。CRISPR数据分析的目标是:
1. 统计每个样本中每个sgRNA出现的次数
2. 比较实验组和对照组中sgRNA的丰度
3. 将sgRNA水平的变化汇总为基因水平的评分
4. 根据统计显著性和效应大小对基因进行排序
5. 选择候选基因进行后续验证
最终输出结果通常是一个基因排名列表——通常是前 20 到 50 个候选蛋白质 ——这些蛋白质在你的实验条件下显示出显著的富集(阳性筛选)或缺失(阴性筛选)。
为什么数据分析是 CRISPR 筛选的瓶颈
虽然文库设计和细胞筛选技术已经相当成熟,但数据分析仍然是最容易出错且变异性最大的环节。常见的挑战包括:
•测序深度不足导致sgRNA计数出现噪声
•重复实验相关性低,难以区分真实命中结果和噪声。
•筛选标准不明确(RRA排名 vs. LFC + p值阈值)
•难以比较不同屏幕的结果,从而确定一致的目标
这些挑战恰恰体现了维恩图交叉分析的价值所在——它提供了一种可视化和定量的跨屏比较方法。
步骤 1:测序质量控制 (QC)
原始测序数据(FASTQ 文件)必须经过过滤,以去除接头序列和低质量碱基。关键的质量控制指标包括:
Metric
Threshold
Purpose
Q20
>90%
Base call accuracy ≥ 99%
Q30
>85%
Base call accuracy ≥ 99.9%
Adapter contamination
<5%
Ensure clean reads for mapping
工具:FastQC、Trimmomatic、Cutadapt
步骤 2:读取比对和 sgRNA 计数
将高质量测序数据比对到sgRNA参考文库,以确定有多少reads比对到每个sgRNA。比对率(与文库匹配的reads百分比)在此步骤中计算。【重要提示:即使比对率较低,只要比对上的reads绝对数量保持足够的测序深度(每个sgRNA≥200×) ,也不会影响结果的可靠性。所需数据量可估算如下:所需数据量 = 测序深度 × 文库覆盖率 × sgRNA 数量 / 比对率】
对于深度为 200×、覆盖度为 500× 的人类全基因组敲除文库(~77,000 个 sgRNA),每个样本大约需要 10 Gb 的测序数据。
工具:MAGeCK 计数,bowtie2
步骤 3:标准化和质量评估
原始sgRNA计数需要进行标准化处理,以消除样本间测序深度差异的影响。常用的标准化方法包括:
•中位数归一化(MAGeCK 默认设置):调整计数,使所有样本的 sgRNA 计数中位数相等
•对照sgRNA标准化:使用非靶向或安全靶向sgRNA作为参考
此阶段的质量评估包括:
•生物学重复实验之间的皮尔逊相关性(目标:r > 0.8)
•使用主成分分析 (PCA)检查样本聚类情况
•通过读取计数分布(箱线图)识别异常值
步骤 4:使用 MAGeCK RRA 进行差异分析
MAGeCK RRA(稳健排序聚合)算法是目前应用最广泛的比较两种条件下sgRNA丰度的方法。它:
1. 计算每个sgRNA的对数倍数变化(LFC)
2. 按LFC对sgRNA进行排名
3. 使用 RRA 算法将 sgRNA 水平排名汇总为基因水平评分
4. 输出基因水平的p值和FDR(错误发现率)
MAGeCK RRA 的主要输出列:
Column
Meanin
Gene
>pos.score
neg
>pos.pvalue
neg
>pos.fdr
neg
>pos.lfc
neg
>pos.rank
示例 1:RRA 分析 — mageck测试
bash
mageck count -l library.txt \
-n my_screen \
--sample-label day0,day14 \
--fastq day0_R1.fastq,day14_R1.fastq
mageck test -k my_screen.count.txt \
-t day14 \
-c day0 \
-n my_screen_results
示例 2:最大似然估计分析 — mageck mle
bash
mageck count -l library.txt \
-n my_screen \
--sample-label day0,day14 \
--fastq day0_R1.fastq,day14_R1.fastq
mageck mle -k my_screen.count.txt \
-d design_matrix.txt \
-n my_screen_mle
已复制到剪贴板
步骤 5:候选基因选择(前 20 名方法)
MAGeCK分析之后,需要选择候选基因进行验证。两种常用策略:
策略A:基于RRA排名的选择
• 根据RRA排名选择前20-30个基因
• 优势:全面整合多种sgRNA信号
例如:Wang等人通过从RRA分析中选择排名靠前的基因,确定Cop1为靶基因。
策略 B:LFC + p 值阈值
• 设定明确的阈值,例如,p 值 < 0.01 且 |LFC| > 1
• 优势:透明、可重复的标准
• 例如:Guo 等人使用 p < 0.01 和 LFC ≤ -2 鉴定出 CDC7。
推荐方法 :首先使用 RRA 排名作为主要筛选方法,然后结合 LFC 和 p 值阈值进行二次筛选。从每次筛选中选择约 20 个候选蛋白,可以得到一个便于后续 Venn 图比较和实验验证的数据集。【具体的前N值阈值( 10、20或30 )应根据文库类型进行调整:全基因组文库可以使用较大的N值,而靶向文库则可以使用较小的N值。这是一种实践惯例,而非统计学推导的规则。】
为什么维恩图在 CRISPR 筛选分析中很重要
当您进行多次 CRISPR 筛选时——无论是在不同的细胞系、处理条件、时间点还是分析方法中——您都需要回答一个关键问题:哪些候选基因在筛选中始终被识别出来?
维恩图通过直观地表示以下信息来解决这个问题:
•交集(重叠) :在多个筛选中鉴定出的基因——高置信度靶标
•独特匹配 :仅在一次筛查中发现的基因——可能具有条件特异性或为假阳性
•联合体 :所有筛选结果中的所有候选基因
前 20 个蛋白质时 ,这一点尤其有价值,因为交集代表了下游验证中最可靠的候选者。
场景:比较多个筛选条件下排名前 20 的蛋白质
考虑一个典型的研究场景:
1.筛选 A :在细胞系 A 中进行 CRISPR 基因敲除筛选 → 鉴定出前 20 个候选蛋白
2.筛选 B :在细胞系 B 中进行 CRISPR 基因敲除筛选 → 鉴定出前 20 个候选蛋白
3.筛选C :不同处理条件下的CRISPR基因敲除筛选 → 鉴定出前20个候选蛋白
这三个集合的交集维恩图显示:
• 三种筛选方法共有的基因(置信度最高的共同靶点)
• 两个筛选中共有的基因(条件依赖性靶标)
• 每个筛选环节特有的基因(特定情境靶标)
这种交叉分析方法广泛应用于已发表的 CRISPR 筛选研究中。例如:
• Daniloski 等人 (2020) 使用维恩图比较了 33°C 和 37°C 下 SARS-CoV-2 宿主因子筛选结果,识别出了共同的和温度特异性的宿主依赖性因子。
• Abe等人(2023) 使用维恩图比较了来自两个独立CRISPR筛选(DDX11-KO和ESCO2-mut)的结果,揭示了包括PAXIP1-PAGR1在内的合成致死基因。
• Chen 等人 (2024) 利用维恩图将 CRISPR 筛选数据与差异表达基因和生存相关基因进行交集分析,从而在乳头状肾细胞癌中鉴定出 41 个关键基因。
用于从 CRISPR 筛选结果生成维恩图的工具
Tool
Platform
Best For
Max Sets
BioVenn
Web (biovenn.nl)
Quick 2–3 set comparison
3
VennDiagram (R)
R package
Publication-quality diagrams
5
matplotlib-venn (Python)
Python library
Automated pipelines
3
MAGeCK-VISPR
Web interface
Integrated CRISPR analysis
Multiple
caRpools (R)
R package
Built-in CRISPR screen Venn
3
ggVennDiagram (R)
R package
Modern, customizable visualization
6
InteractiVenn
Web
2–6 set comparison
6
重叠部分告诉你什么
交集区域(即多个筛选结果集重叠的区域)代表无论实验条件如何,始终被识别为命中基因的基因。这些基因是您最有把握的候选靶点,原因有以下几点:
1.可重复性 :在多次独立筛选中发现的基因不太可能是假阳性。
2.稳健性 :在不同条件下均观察到一致的结果,表明其具有基本的生物学功能,而非特定条件下的人为因素。
3.统计功效 :交叉分析有效地整合了来自多个实验的证据,提高了置信度。
比较每次筛选得到的20 种蛋白质时 ,10-15 个基因的交集通常表明筛选结果具有良好的一致性。少于 5 个基因的交集可能提示:
• 不同条件下生物变异性较高
• 一个或多个筛选环节的选择压力不足
• 屏幕执行中的技术问题
非重叠命中意味着什么
仅在一次筛查中发现的基因(唯一匹配项)并不一定是假阳性。它们可能代表:
•条件特异性依赖性 :仅在特定细胞环境下必需的基因
•合成致死相互作用 :基因敲除仅在特定遗传背景下才会导致致死。
•技术噪声 : sgRNA 表达的随机变化
为了区分真正的特定条件命中和噪声,通过独立的基因敲除实验分别验证独特的命中。
交叉路口分析中的常见陷阱
Pitfall
Consequence
Solution
Using different hit selection criteria across screens
Biased comparison
Standardize thresholds (e.g., always top 20 by RRA rank)
Comparing screens with vastly different quality
False intersections
Ensure all screens pass QC (mapping rate, depth, replicate correlation)
Ignoring screen direction (positive vs. negative)
Meaningless overlap
Separate enrichment and depletion hits before comparison
Over-interpreting small overlaps
False confidence
Use permutation testing to assess statistical significance of overlap
Not accounting for library size differences
Inflated/deflated overlap
Normalize to comparable gene lists before intersection
✅ MAGeCK(RRA 和 MLE)
MAGeCK (基于模型的全基因组 CRISPR-Cas9 敲除分析)是 CRISPR 筛选数据分析的行业标准。它提供两种互补的算法:
• RRA(稳健排序聚合) :用于成对比较(一个处理组与一个对照组)。根据 sgRNA 丰度变化对基因进行排序。RRA得分越低,排名越高,则该基因越有可能是靶基因。
•最大似然估计 (MLE) :用于多条件建模。能够对多种实验条件进行联合分析,并提高统计功效。
✅ MAGeCK-VISPR
MAGeCK-VISPR 通过集成可视化框架扩展了 MAGeCK 的功能。它提供:
• 交互式质量控制图
• 自动生成维恩图以进行交叉比较
• 基因必需性的Beta评分计算
• 面向非编程用户的基于 Web 的界面
✅ caRpools
caRpools 是一个专门用于 CRISPR 基因编辑池分析的 R 包。它包括:
• 内置支持 MAGeCK、DESeq2 和 Wilcoxon 检验
• 自动生成维恩图,比较不同方法的命中结果
• 集成可视化工具
✅ DrugZ
DrugZ尤其适用于分析药物处理条件下的CRISPR筛选结果。它采用改进的z评分方法来识别富集和缺失的sgRNA,并且通常与MAGeCK结合使用进行交叉验证。
工具对比表
Feature
MAGeCK RRA
MAGeCK MLE
MAGeCK-VISPR
caRpools
DrugZ
Comparison type
Pairwise
Multi-condition
Both
Both
Pairwise
Statistical method
RRA
MLE
RRA + MLE
Multiple
Z-score
Venn diagram
No
No
Yes (built-in)
Yes (built-in)
No
Visualization
Limited
Limited
Rich (web)
Moderate
Limited
Ease of use
Command line
Command line
Web + CLI
R
Command line
Best for
Standard screens
Complex designs
Integrated analysis
Method comparison
Drug screens
RRA 评分与 LFC + p 值:应该使用哪个?
RRA算法 将多个sgRNA水平的指标整合到一个综合的基因水平评分中,从而提供全面的排名。相比之下,结合LFC和p值阈值虽然提供了明确的阈值,但可能包含更多的假阳性结果。
建议 :以基于 RRA 排名的选择作为主要策略。同时参考 LFC 和 p 值进行二次筛选。这两种方法在已发表的文献中均有广泛应用,结合使用可提供互补的见解。
生物学重复实验的处理
当有多个生物学重复样本时:
•高重复性(Pearson r > 0.8) :对所有重复样本进行合并分析,以最大程度地提高统计功效。
•重复性低(Pearson r < 0.8) :进行成对比较,然后使用维恩图交集来识别重复实验中始终重叠的命中结果。
当屏幕间变异性较高时,特别推荐使用维恩图方法进行重复比较,因为它侧重于最稳健、可重复的目标。
管理误报和漏报
•减少误报:要求匹配结果出现在至少两种独立筛选或分析方法的交叉点上
•减少漏报:在初始筛选时使用放宽阈值(例如,前 50 个而不是前 20 个),然后通过交叉分析缩小范围。
•基于流式细胞术的筛选:务必格外谨慎——单轮富集筛选的假阳性/假阴性率较高。尽可能增加初始细胞数量并进行多轮分选。
每个样本的测序深度应至少达到 200 倍。对于人类全基因组敲除文库(约 77,000 个 sgRNA),这意味着每个样本大约需要 10 Gb 的测序数据。计算公式为:所需数据量 = 测序深度 × 文库覆盖率 × sgRNA 数量 / 比对率。
维恩图的交集显示了在多种筛选、条件或分析方法中均被一致鉴定为有效靶点的基因(或蛋白质)。这些重叠基因代表了您最有把握的候选靶点,因为它们在独立实验中均可重复验证。
从每个筛选结果中选出前20个候选基因(使用RRA排名或LFC+p值标准),然后使用诸如Python的matplotlib-venn、R的VennDiagram或ggVennDiagram等工具,或BioVenn等网络工具生成维恩图。交集区域揭示了共同靶点;独特区域则显示了条件特异性靶点。
低比对率本身并不影响可靠性,因为下游分析仅使用比对上的reads。然而,比对上的reads绝对数量必须保持足够的测序深度(每个sgRNA≥200×)。真正的问题在于数据量不足,而非比对率低。
对于简单的成对比较(例如,一个处理组与一个对照组),使用RRA 方法。当需要对多个实验条件进行联合建模时,使用MLE 方法。MLE 方法能够为复杂的实验设计提供更高的统计功效,但需要更复杂的设置。
基因编辑效率取决于sgRNA序列特性、染色质可及性和脱靶效应。某些sgRNA可能几乎没有活性。为每个基因设计至少3-4个sgRNA可以降低这种差异性,并确保获得更可靠的基因水平编辑结果。
在文库中加入经过充分验证的阳性对照基因。如果这些对照基因在预期方向上显著富集(或减少),则说明筛选条件有效。如果没有阳性对照,则评估细胞反应(细胞杀伤/存活),并检查生物信息学输出结果,例如 LFC 分布和重复相关性。
常用的选项包括: BioVenn (基于网络,最多 3 组)、 VennDiagram和ggVennDiagram (R 包,最多 5-6 组)、 matplotlib-venn (Python,最多 3 组)、 MAGeCK-VISPR (集成分析平台)和caRpools (带有内置 CRISPR 筛选 Venn 图支持的 R 包)。
基因富集不显著通常是由于选择压力不足而非统计分析误差造成的。尝试增加选择压力和/或延长筛选时间以提高信噪比。
如果重复实验间的相关性较高(Pearson r > 0.8),则将所有重复实验合并进行单一分析。如果相关性较低,则进行两两比较,并使用维恩图交集分析来识别各实验中始终重叠的候选基因。
是的。跨方法维恩图对于评估结果的稳健性非常有价值。被多种方法识别出的基因是高置信度的结果。caRpools R 包内置了生成维恩图的功能,用于比较 MAGeCK、DESeq2 和 Wilcoxon 检验的结果。
阴性筛选利用较弱的选择压力来识别那些敲除后会导致细胞死亡或活力降低(sgRNA耗竭)的基因。阳性筛选利用较强的选择压力来识别那些敲除后会赋予抗性或生存优势(sgRNA富集)的基因。
CRISPR筛选数据分析是一个多步骤过程,它将原始测序数据转化为可操作的生物学信息。关键步骤包括质量控制、序列比对、标准化、使用MAGeCK RRA进行差异分析以及候选基因筛选,每个步骤都对确保结果的可靠性起着至关重要的作用。
在比较多种条件下的CRISPR 筛选结果时,对排名前 20 的候选蛋白进行Venn 图交集分析,是一种识别高置信度、可重复靶点的有效方法。交集代表了在独立筛选中均被一致鉴定的基因,使其成为后续验证的最佳候选基因。
1. 每个sgRNA的测序深度保持≥200×
2. 使用 MAGeCK RRA 作为主要分析工具
3. 根据RRA排名筛选出前20-30个候选基因
4. 使用维恩图比较不同屏幕的结果
5. 优先考虑交叉基因进行实验验证
6. 逐一验证独特的命中结果,以确定特定条件下的靶点
7. 对所有比较的屏幕使用标准化的选择标准
1. Li, W. et al. MAGeCK enables robust identification of essential genes from genome-scale CRISPR/Cas9 knockout screens. *Genome Biol.* 15, 554 (2014).
2. Li, W. et al. Quality control, modeling, and visualization of CRISPR screens with MAGeCK-VISPR. *Genome Biol.* 16, 281 (2015).
3. Wang, X. et al. In vivo CRISPR screens identify the E3 ligase Cop1 as a modulator of macrophage infiltration and cancer immunotherapy target. *Cell* 184, 5357–5374 (2021).
4. Deng, L. et al. Identifying CDC7 as a synergistic target of chemotherapy in resistant small-cell lung cancer via CRISPR/Cas9 screening. *Cell Death Discov.* 9, 40 (2023).
5. Daniloski, Z. et al. Functional interrogation of a SARS-CoV-2 host protein interactome identifies unique and shared coronavirus host factors. *bioRxiv* (2020).
6. Abe, T. et al. CRISPR screens in sister chromatid cohesion defective cells reveal PAXIP1-PAGR1 as regulator of chromatin association of cohesin. *Nat. Commun.* (2023).
7. Hulsen, T. et al. BioVenn—a web application for the comparison and visualization of biological lists using area-proportional Venn diagrams. *BMC Genomics* 9, 488 (2008).
8. Kolde, R. et al. Robust rank aggregation for gene list integration and meta-analysis. *Bioinformatics* 28, 573–580 (2012).
9. Guo, L. et al. CRISPR Screen Identifies the RNA-Binding Protein Eef1a1 as a Key Regulator of Myogenesis. *Int. J. Mol. Sci.* 25, 4816 (2024).
10. Doench, J.G. et al. Optimized sgRNA design to maximize activity and minimize off-target effects of CRISPR-Cas9. *Nat. Biotechnol.* 34, 184–191 (2016).