GWAS分析前后的SNP和Indel位点该如何处理?

我问Gemini:虽然理论上SNP和Indel的gwas结果高度吻合的,但是只用SNP做GWAS就行了,还是说用SNP+INDEL合并来做,抑或是额外再做一个indel gwas?

Gemini 说:

您的理论直觉非常准确!由于基因组中强大的连锁不平衡(Linkage Disequilibrium, LD),在同一个单倍型区块内,SNP 和 InDel 的遗传轨迹几乎是绑定的,因此它们跑出来的 GWAS 信号峰通常是高度重合的。

针对您的具体问题,直接给您最成熟的业界标准建议:在全基因组关联分析(GWAS)打定位点的阶段,只用 SNP 就足够了。 不建议合并做,也不建议单独用 InDel 做 GWAS,主要基于以下几个核心科学和实践原因:

  1. 数据质量差异导致模型噪音(最致命的问题)
    目前的二代测序(NGS)技术和变异检测软件(如 GATK, BCFtools)对 SNP 的 calling 准确率极高(通常 >99%)。但对 InDel 的检测准确率要低得多,尤其是在包含重复序列的区域,往往会产生大量的假阳性。
    如果将 InDel 和 SNP 合并丢给 rMVP,这些存在分型错误的 InDel 会悄悄污染您的 PCA(群体结构)和 Kinship(亲缘关系)矩阵。一旦底层的协变量矩阵被污染,整个模型的统计功效就会大打折扣。

  2. LD 标签效应(标记冗余)
    您已经过滤得到了 295 万个高质量 SNP,对于水稻(~380 Mb)来说,平均每 130 bp 就有一个标记。在这样极其饱和的密度下,任何一个真实存在的因果 InDel,它的旁边绝对会有多个与它呈现极强 LD(r
    2
    接近 1)的 SNP 标记。
    换句话说,SNP 完全可以作为 InDel 的完美“代理标签”,把那个区域的显著性峰给顶出来。

  3. 单独做 InDel GWAS 的局限性
    如果您单独提取 InDel 做 GWAS,由于 InDel 的整体数量远少于 SNP,且在基因组上分布极不均匀,不仅 GWAS 分辨率会大幅下降,曼哈顿图也会显得非常稀疏和难看,没有任何额外收益。

💡 现代植物育种的“黄金流程”(最佳实践)
虽然在全基因组扫描阶段不需要 InDel,但在寻找因果基因(Causal Gene)时,InDel 又是绝对不能丢弃的宝贝,因为导致表型变异的真正原因,往往就是编码区的移码突变(Frameshift InDel)或启动子区的 InDel。

目前顶刊(如 Nature Genetics, Molecular Plant 等)最标准的操作流程是这样的分步法:

宏观定位(全基因组阶段): 使用严格质控后的纯 SNP 数据运行 rMVP(就像您现在做的一样),拿到显著的 GWAS 峰,锁定候选区间(例如 Chr1: 1.2M - 1.5M)。

微观挖掘(候选区间阶段): 回到您最原始的未过滤 VCF 文件中,使用 bcftools 或 vcftools 专门把 Chr1: 1.2M - 1.5M 这个小区间内的 SNP 和 InDel 同时提取出来。

单倍型与功能分析: 将提取出的 SNP+InDel 结合基因注释文件(GFF),寻找哪些变异落在了外显子或启动子区域。往往您会发现,正是某个关键的 InDel 完美区分了不同表型的材料。

总结来说:GWAS 用 SNP 指路,找基因用 InDel 定音。 您现在安心用这 295 万个 SNP 往下跑就可以,完全不用担心漏掉信号。

在您现有的 14 个性状中,有没有那种遗传机制比较简单、表型差异极其明显的质量性状(比如某种特定的抗病性、或者特殊的颖壳颜色)?我们可以考虑先拿这种性状作为“阳性对照”来看看模型的灵敏度。制比较简单、表型差异极其明显的质量性状(比如某种特定的抗病性、或者特殊的颖壳颜色)?我们可以考虑先拿这种性状作为“阳性对照”来看看模型的灵敏度。

posted @ 2026-04-08 14:04  生物信息与育种  阅读(120)  评论(0)    收藏  举报