Q1:做群体进化分析,一般需要多少个样本?
样本量取决于您的研究目的。如果只是粗略了解群体结构(系统发育树、PCA),每个亚群 10-15 个样本即可。如果要进行选择消除分析(Selective Sweep)挖掘受选择基因,建议每个亚群(如野生型 vs 栽培型)至少 15-20 个样本,整体项目通常在 100 个样本左右效果较好。
Q2:群体进化分析的标准流程包含哪些关键步骤?
核心流程通常分为四步:
变异检测: 原始数据质控 比对参考基因组 SNP/InDel Calling 与严格过滤(如 GATK 流程)。
群体结构分析: 系统发育树(Phylogenetic tree)、主成分分析(PCA)和群体遗传结构分析(Admixture/Structure)。
群体动态与基因交流: 计算有效群体大小历史动态(PSMC/SMC++)、推断群体分化历史与基因流(Treemix, F-statistics)。
选择消除分析: 计算群体间的遗传分化指数()、核苷酸多样性()、Tajima's D 等指标,挖掘受选择区域。
Q3:如何寻找“受选择基因”或“驯化基因”?
通常采用多指标联合分析。最经典的方法是比较两个亚群(如野生群体与栽培群体)。通过计算全基因组滑窗内的 以及核苷酸多样性比值()。取这两种指标的极端值区域(例如 Top 5%),取交集作为候选受选择区域(Selective sweeps),然后再对该区域内的基因进行功能注释(GO/KEGG 等)。
Q4:什么是 PSMC 分析?它能解决什么问题?
PSMC(Pairwise Sequentially Markovian Coalescent)是一种利用单个个体的高深度二倍体基因组数据,推断该物种在过去几万年到几百万年间有效群体大小()历史动态变化的方法。它常用于回答冰河时期等古气候变化对物种群体扩张或收缩造成的深远影响。
Q5:为什么有时候进化树与PCA 和 Admixture 结果看起来不一致?
这种现象在自然群体中很常见。进化树基于强烈的二叉分枝假设,适合描述没有基因交流的演化关系。如果在群体演化过程中存在频繁的基因杂交、渐渗(Introgression)或不完全谱系分选(ILS),真实的进化关系是网状而非树状的。此时,PCA 和 Admixture 能更好地反映出个体的混合血统。