GATK HaplotypeCaller变异检测

GATK(Genome Analysis Toolkit)的HaplotypeCaller是一个用于检测单个核苷酸变异(SNV)和插入/缺失(Indel)的工具,它采用了一种称为基于概率的方法来提高变异检测的准确性。以下是使用GATK HaplotypeCaller进行变异检测的一般步骤:

  1. 数据准备: 准备好测序数据,通常是.bam格式的文件,其中包含对样本进行的全基因组或外显子组测序数据。

  2. 标准化和索引: 使用Picard工具对.bam文件进行标准化和索引,以确保数据格式的正确性和一致性。

  3. 引入GATK环境: 在命令行中启动GATK环境,这通常涉及到加载GATK的软件模块或激活GATK的虚拟环境。

  4. 变异检测: 运行GATK HaplotypeCaller工具进行变异检测。您可以使用以下命令:

    gatk HaplotypeCaller \ -R reference.fasta \ -I input.bam \ -O output.vcf

    其中,reference.fasta是参考基因组的FASTA文件,input.bam是输入的.bam文件,output.vcf是输出的VCF(Variant Call Format)文件,其中包含检测到的变异信息。

  5. 后续处理: 对生成的VCF文件进行后续处理,包括过滤、注释和注释。

  6. 结果解释: 解释VCF文件中的变异信息,包括单核苷酸变异(SNV)、插入和缺失(Indel)等。您可以使用基因组注释工具(如Ensembl Variant Effect Predictor)来注释变异的功能和影响。

请注意,使用GATK HaplotypeCaller进行变异检测需要一定的计算资源和时间,特别是针对大规模基因组数据。因此,建议在运行之前先查看GATK的官方文档和教程,以了解更多详细信息和最佳实践。

 

bam 文件的实例:

我想用NA12878 的基因信息比较千人基因组信息,生成SNP的VCF文件。

 

NA12878 是什么?

NA12878 是人类基因组中的一个参考样本,来自一个健康的女性志愿者。该样本在生物医学研究和基因组学研究中被广泛使用。

访问 NCBI SRA 网站(https://www.ncbi.nlm.nih.gov/sra)获得该数据的SRA文件:SRRXXXXX

在linux使用SRA数据

1.安装SRA Toolkit软件包

wget "http://ftp-trace.ncbi.nlm.nih.gov/sra/sdk/current/sratoolkit.current-centos_linux64.tar.gz"

2.解压缩

tar xzf sratoolkit.current-centos_linux64.tar.gz

3.在linux下载NA12878的数据

要cd到SRAtoolkit的bin目录下才能安装    ./prefetch SRR24847332

或者配置环境(未配置成功,没找到原因)

尝试配置:

echo 'export PATH=$PATH:$HOME/SRAToolkit/sratoolkit.2.10.9-ubuntu64/bin ' >> ~/.bashrc  
source ~/.bashrc
./vdb-config --interactive #会出现一个框架,按字母x键退出,然后就可以使用啦  #u不知道为什么一定要./

下载已发表文章原始数据之SRA Toolkit(Fastq转换bam) - 简书 (jianshu.com)

4.转换fastq  

要cd到bin  明天试试不cd(不行,环境没配置好?)

./sratoolkit.2.5.7-centos_linux64/bin/fastq-dump ./SRR24847332.sra

./ 的意思:告诉系统在当前目录中查找可执行文件并执行它。如果没有使用 ./ 前缀,系统会认为 m是在 PATH 中的某个目录下的可执行文件,而不是当前目录中的可执行文件。

在bin目录下 ./fastq-dump --gzip ./SRR24847332/SRR24847332.sra -O /media/dell/DATA/hanshuang_practive  输出到目标目录下的压缩的fastq文件。

5.转换bwa文件

将 FASTQ 文件转换为 BAM 文件需要先进行质量控制、比对和排序等步骤。一般来说,您可以使用以下步骤将 FASTQ 文件转换为 BAM 文件:

  1. 质量控制(Quality Control): 使用工具(例如FastQC)对原始 FASTQ 文件进行质量控制分析,检查测序数据的质量情况。

  2. 比对(Alignment): 使用比对工具(例如BWA、Bowtie2)将质控后的 FASTQ 文件比对到参考基因组上,生成 SAM 或 BAM 文件。

  3. 排序(Sorting): 使用排序工具(例如Samtools)对比对得到的 SAM 文件进行排序,生成排序后的 BAM 文件。

先下载BWA工具。网址:Burrows-Wheeler Aligner (sourceforge.net) 选SF download page,复制网址。或者 https://github.com/lh3/bwa?tab=readme-ov-file,选Availability里的download到达。

下载: wget -P  下载的目的目录 网址。tar.bz2

解压:cd 到下载的目的目录;tar -xvf bwa-0.7.17.tar.bz2

编译bwa:  cd 到bwa的文件夹: cd bwa-0.7.17

                 使用make进行编译: make

Linux 中,许多软件是以源代码的形式提供的,而不是预编译好的二进制文件。这意味着您需要先将源代码编译成可执行文件,然后才能在您的系统上运行。

添加环境变量:cd 到home目录

                        按下面链接操作

Linux下载安装bwa教程 - 知乎 (zhihu.com)

 

 

posted @ 2024-03-05 11:55  hananjojo  阅读(722)  评论(0)    收藏  举报