在线客服
在线QQ

Q1:做 GWAS 项目,一般需要多少个样本?

动植物育种/农艺性状: 建议200-300 个样本。如果性状受微效多基因控制(如产量、株高),建议样本量扩大至 500 个以上。

样本量越小,只能检测到效应值极大的变异位点;样本量越大,越能捕捉到微效多基因位点。


Q2:如果预算有限只能做低深度 WGS 测序(例如3x-5x)可行吗?

可行,但强烈依赖于基因型填补技术需要物种已经有一个高深度的单体型参考面板。通过低深度测序获得骨架 SNP,再利用算法推断缺失的基因型。这在人类和主流模式生物中非常成熟,但在研究较少的物种中风险较高。


Q3:变异数据(VCF文件)进入 GWAS 模型前,需要做哪些过滤?

严格的质控是防止假阳性的核心。常见标准包括:

次等位基因频率(MAF): 通常过滤掉 MAF < 0.05(或 0.01)的稀有变异。因为在有限样本量下,稀有变异的统计误差极大。

缺失率(Missing Rate): 过滤掉缺失率 > 10% 20% SNP 和个体。

哈迪-温伯格平衡(HWE): 过滤掉严重偏离 HWE 的位点(通常 ),这往往意味着测序或比对错误(针对自然随机交配群体,自交系群体不适用此项)。


Q4:显著性阈值(P-value cut-off)到底该怎么定?

Bonferroni 校正(最严苛): 阈值设为 为有效 SNP 数量)。例如有 100 万个独立 SNP,阈值就是

FDR(错误发现率): 如果 Bonferroni 过滤后剩余SNP很少,可以尝试稍微宽松的 FDR 校正(如 q-value < 0.05)。


Q5:在曼哈顿图上找到了显著信号峰(Lead SNP),怎么确定是哪个基因?

Lead SNP 通常并不在致病突变上,而是与真正的因果变异存在连锁不平衡(LD,Linkage Disequilibrium)

计算该区域的 LD 衰减距离(LD decay)。

Lead SNP 上下游一个 LD 衰减距离内的所有区域划定为“候选区间”。

提取区间内的所有基因,结合基因功能注释(GO/KEGG)、转录组表达量数据(RNA-seq)、同源基因功能,最终锁定 1-2 个最可能的候选基因进行后续实验验证(如基因敲除、过表达)。

若SNP在非编码条件元件中,可利用Capture Hi-C技术将此调控元件控制的靶基因鉴定出来(潜在的增强子-启动子互作)

微信公众号
©武汉臻阅生物有限公司 copyright网站建设:指引科技 鄂ICP备2022004681号-1