16S扩增子从fastq数据到ASV表零代码跑通 | 在线工具使用教程

16S在线工具可用于对扩增子测序数据进行分析,适用于16S、18S和ITS等扩增子测序项目。用户可以进入“云分析”或“宏基因组分析”页面,找到“扩增子测序分析(16S/18S/ITS)”工具并进入参数设置界面。

工具地址:https://henbio.com/tooldetail?id=294
一、准备样本描述文件
使用工具前,需要先准备样本描述文件。样本描述文件通常为制表符分隔的文本文件,建议使用Excel编辑后另存为制表符分隔的TXT文件,或者直接按照示例文件格式进行填写。文件中一般需要包含sampleID、forwardReads、reverseReads和Group四列。

sampleID用于填写样本名称,名称应具有唯一性,不能包含中文、空格或特殊字符。forwardReads用于填写正向测序数据文件名,通常对应R1文件。reverseReads用于填写反向测序数据文件名,通常对应R2文件。Group用于填写样本所属的分组信息,例如KO、OE、Treatment或Control等,分组名称同样建议使用英文、数字或下划线,不要使用中文、空格和特殊符号。
如果测序数据只有单端数据,需要根据平台要求填写相应文件信息,并确认工具是否支持单端数据分析。对于双端测序数据,必须同时准备正向测序文件和反向测序文件,且两个文件需要使用相同的样本名称进行对应。
二、整理测序数据文件
测序数据通常为FASTQ格式,常见文件扩展名为.fastq.gz。需要将所有样本的测序数据放入同一个文件目录中,并保证目录中的文件名与样本描述文件中的forwardReads和reverseReads内容完全一致。

上传前建议检查文件是否能够正常解压和读取,确认每个样本都同时包含R1和R2文件,避免出现样本名称不一致、文件缺失或文件重复等问题。文件名不要包含中文、中文字符、空格或特殊符号,也不要随意修改测序公司提供的原始文件名。
在工具页面中,点击“样本描述文件”右侧的“选择文件”按钮,上传已经准备好的样本描述文件。点击“测序数据文件目录”右侧的“选择目录”按钮,上传或选择存放测序数据的目录。页面中的“示例文件”按钮可以用于下载平台提供的模板,建议首次使用时先下载示例文件并按照示例格式修改。
三、设置Barcode、Primer长度
“左端样品标签(Barcode)长度”用于填写测序数据左端Barcode的长度。截图中的默认值为10,表示左端Barcode长度为10个碱基。如果实验设计中没有使用左端Barcode,可以填写0。具体数值应根据建库方案、引物设计和测序数据实际情况进行设置。
“右端样品标签(Barcode)长度”用于填写测序数据右端Barcode的长度,截图中的默认值为0。如果实验中没有使用右端Barcode,保持默认值0即可。如果使用了右端Barcode,则应根据实验设计填写实际长度。Barcode长度填写错误可能导致样本拆分失败或样本序列识别不准确。

“上游引物(Primer)长度”用于填写正向引物的长度,页面默认值为19。用户应根据实际使用的上游引物序列长度进行修改。如果未使用上游引物或不需要去除引物,可以填写0。
“下游引物(Primer)长度”用于填写反向引物的长度,页面默认值为18。该参数同样需要根据实际实验引物序列长度填写。如果未使用下游引物或不需要进行引物切除,可以填写0。
四、选择物种注释数据库
“物种注释数据库”用于对获得的代表性序列进行分类学注释。页面中可以选择silva或rdp等数据库。Silva数据库常用于16S、18S和ITS等核糖体相关序列的分类学注释,RDP数据库也可用于微生物分类注释。

选择数据库时,应结合研究对象、扩增区域和项目分析要求进行选择。如果没有特殊要求,可以使用平台默认推荐的数据库。数据库不同可能会导致物种注释结果和分类层级存在差异,因此不同批次或不同实验之间建议尽量使用相同的数据库和参数。
五、运行分析任务和下载分析结果
确认样本描述文件、测序数据目录、任务名称、Barcode长度、Primer长度和物种注释数据库均填写正确后,点击页面下方的“运行”按钮提交分析任务。系统提交任务后通常会返回任务提示,分析时间会根据样本数量、测序数据量和服务器运行情况有所不同。
提交任务后不要立即关闭项目或删除上传文件。用户可以进入“我的项目”或“项目结果”页面查看任务状态。任务状态一般包括排队中、运行中、已完成或失败等。如果任务失败,应重点检查样本描述文件格式、样本名称、数据文件名、数据目录和参数设置是否正确。
分析完成后,进入“我的项目”页面,在对应任务所在行查看分析进度和结果。任务完成后,可以点击“下载”按钮下载分析结果。部分页面会显示文件夹图标,点击后可以进入结果目录并查看具体文件。

结果目录通常包括denoise、diversity、evolution、taxonomy和seq_stat等文件夹或文件。denoise目录一般保存去噪和特征序列相关结果,diversity目录通常包含Alpha多样性和Beta多样性分析结果,evolution目录可用于查看群落进化或系统发育相关结果,taxonomy目录通常保存物种分类注释结果,seq_stat文件则用于记录序列数量和质控统计信息。
六、常见结果内容说明
序列统计结果通常会展示原始序列数、质控后序列数、拼接序列数、去除嵌合体后的序列数以及最终有效序列数。用户可以通过这些数据判断测序数据质量和分析流程中的序列保留情况。如果某些样本序列数量明显低于其他样本,需要结合原始测序质量、样本浓度和建库情况进行判断。

Alpha多样性结果用于反映单个样本内部的物种丰富度和多样性,常见指标包括Observed、Chao1、Shannon和Simpson等。柱状图、箱线图或稀释曲线可以帮助用户比较不同分组之间的群落多样性差异。

Beta多样性结果用于比较不同样本之间的群落组成差异,常见分析包括PCoA、NMDS、聚类分析和距离矩阵分析等。图中样本点之间的距离越近,说明群落组成越相似;不同分组样本如果明显分开,说明组间群落结构可能存在差异。

物种组成结果通常以门、纲、目、科、属或种等分类层级展示。工具可能提供堆叠柱状图、分类树、物种热图、优势物种图和分类组成表等结果。用户可以根据研究目的选择合适的分类层级,并结合统计检验分析不同组别之间的物种差异。

部分结果还会提供LEfSe分析、差异物种分析、PICRUSt2功能预测或其他扩展分析。此类结果可用于筛选组间显著差异的分类单元或预测潜在功能。


物种组成结果通常以门、纲、目、科、属或种等分类层级展示。工具可能提供堆叠柱状图、分类树、物种热图、优势物种图和分类组成表等结果。用户可以根据研究目的选择合适的分类层级,并结合统计检验分析不同组别之间的物种差异。
浙公网安备 33010602011771号