Q1: 目前主流的测序组合是什么?需要多少测序数据?
目前基因组 de novo 的标准配置通常是:长读长测序 (PacBio HiFi 或 Nanopore) + 染色体构象捕获 (Hi-C) + 短读长测序 (Illumina)。
长读长 (Contig 组装): 通常推荐 30× 到 50× 的覆盖度。如果是高杂合或多倍体,建议提高到 50×-100×。
Hi-C (挂载染色体): 推荐 100× 左右的覆盖度,用于提供三维基因组交互信息,将碎片化的序列组装成染色体级别。
Illumina (Survey与纠错): 约 50×,主要用于前期评估基因组大小和杂合度,并在组装后期进行碱基纠错。
Q2: 测序前一定要做 Genome Survey(基因组调查)吗?
非常必要。通过 K-mer 分析少量的 Illumina 短测序数据,可以提前预估基因组的大小、杂合度比例和重复序列比例。这决定了后续需要采用何种组装算法,以及是否需要增加测序深度。
Q3: 用 Hi-C 数据挂载染色体时,热图 (Heatmap) 上出现异常的“十字星”或不在对角线上的强信号,代表什么?
这通常意味着组装错误。如果在非对角线区域出现强烈的交互信号,说明有两段原本在三维空间中相距甚远(甚至不在同一条染色体上)的序列被错误地拼接在了一起。
解决办法是使用人工纠错工具(如 Juicerbox),结合 Hi-C 互作矩阵,手动打断错误的连接 (Break)、反转方向 (Invert) 或重新移动位置 (Move),直到互作信号集中在主对角线上。
Q4: 组装质量如何评估?
连续性 (Continuity): 看 Contig N50 和 Scaffold N50。目前高质量基因组的 Contig N50 通常要求达到 MB(兆碱基)级别,Scaffold N50 应接近该物种染色体的平均长度。
完整性 (Completeness): 核心指标是 BUSCO 评估。它通过搜索单拷贝直系同源基因库,判断基因组是否完整包含了该类群应有的基础基因。通常要求 BUSCO 完整度 > 95%。
准确性 (Accuracy): 评估碱基错误率,通常用 QV 值表示(如 QV40 代表准确率 99.99%)。可以通过将高质量的 Illumina 测序数据比对回组装基因组来计算。
Q5: 基因组拼得很好(N50 和 BUSCO 都很高),但在注释结果里就是找不到要研究的某个关键基因,是哪里出了问题?
纯粹基于从头预测 (ab initio) 的注释往往不准确,容易漏掉基因或错误划分内含子/外显子边界。须提供多组织、多发育时期的 转录组数据 (RNA-seq),最好包含全长转录组 (Iso-Seq) 作为直接证据。转录组数据能真实地反映基因结构,引导注释软件准确判定基因区域。