泛基因组是指某一物种(或特定分类群)内所有个体的基因总和。传统的单一参考基因组(如“明星株”)往往存在“参考基因组偏倚”,无法涵盖物种内的全部遗传多样性。开展泛基因组研究可以捕捉到单一参考基因组中丢失的存在/缺失变异(PAVs)、结构变异(SVs)以及新基因,对于研究物种进化、环境适应性及挖掘特异性状基因至关重要。
样本量取决于物种类型和研究目的。样本应最大程度覆盖该物种的地理分布、表型多样性和进化分支。
细菌/真菌:由于基因组较小且变异剧烈,通常需要几十到几百个菌株。
植物/动物(动植物泛基因组):通常精选 10–50个 具有代表性的高质量近原生态、野生种和栽培品种/品系进行全基因组 de novo 组装。
建遵循“少而精”与“代表性广”相结合的原则:
a. 优先选择系统发育树中处于关键进化节点的代表。
b. 涵盖不同的生态型、地理起源和极端表型。
c. 优先选择杂合度低、重复序列少、易于获得高质量组装的样本。
主要从以下几个指标进行评估:
Contig/Scaffold N50:评估组装的连续性。
BUSCO 整度评估:确保保守的同源基因没有在组装中丢失。
Mapping Rate:将原始测序数据比对回组装基因组,看比对率是否达标。
基底基因组的一致性:如果是图形泛基因组,需要评估各个路径的共线性。
在泛基因组中,基因通常根据在群体中的出现频率被分为三类:
核心基因:在所有(或 >95%–99%,容忍部分组装缺失)个体中都存在的基因,通常维持基本生命活动。
可变/软核基因:在部分个体中存在的基因,通常与环境适应性、抗逆性或特定表型相关。
特有基因:仅在某一个体中存在的基因。
传统泛基因组:多采用“基于序列非冗余合并(Iterative Assembly/Map-to-reference)”的方式。将未比对上的序列拼起来作为“新序列”挂在参考基因组后面。缺点是丢失了变异发生的具体基因组位置(坐标)。
图形泛基因组:将所有个体的基因组序列比对成一个“非线性的网络图(Graph)”。相同的序列合并为“节点(Node)”,变异则形成不同的“分支(Edge)”。它不仅包含了所有序列,还保留了复杂的倒位、易位等大片段结构变异(SV)的空间信息。