甲基化位点差异分析 | 在线工具使用教程

甲基化位点差异分析用于比较不同样本组之间DNA甲基化水平的变化,帮助研究者筛选显著差异甲基化位点。该工具面向甲基化芯片数据设计,只需准备甲基化数据矩阵和分组文件,即可在线完成数据质控、样本分布展示、差异位点筛选及结果可视化,并下载完整分析结果。
进入“甲基化位点差异分析(芯片数据)”工具。页面主要包括甲基化数据矩阵上传、分组文件上传、箱线图标签设置以及任务运行等功能。首次使用时,可以通过“示例文件”查看模板后再整理自己的数据。

工具地址:https://www.henbio.com/tooldetail?id=239
上传数据准备
甲基化数据矩阵应包含行名和列名,其中每一行对应一个甲基化芯片探针或CpG位点,每一列对应一个样本。矩阵第一列通常为位点ID,例如cg00050873、cg00021031等,第一行从第二列开始为样本名称,例如GSM1606966、GSM1606967和GSM1606968等。

甲基化矩阵中的数值应为甲基化水平,通常使用Beta值表示。Beta值一般介于0和1之间,数值越接近0表示该位点甲基化水平较低,数值越接近1表示该位点甲基化水平较高。上传前应检查数据表中样本名称是否唯一、位点ID是否规范,并尽量保证数据已完成基础质控和预处理。

分组文件同样需要包含列名。第一列为样本名称,第二列为样本所属分组。第一列的列名可以设置为Sample,第二列的列名可以设置为Group。分组名称可以根据研究设计填写,例如病例组和对照组可标记为T和C,也可以使用Case和Control。分组文件中的样本名称必须与甲基化数据矩阵中的列名完全一致,包括大小写、字符和顺序格式。
设置箱线图标签
在“甲基化差异位点热图是否添加标签”选项中,可以选择“添加”或“不添加”。选择“添加”后,生成的热图通常会显示样本或分组相关标签,便于直观观察各组样本的聚类关系和甲基化模式差异。若样本数量较多,标签可能较为密集,此时可以选择“不添加”,使图形整体更加简洁。
一般来说,当样本量较小且需要展示样本分组信息时,建议选择“添加”;当样本量较大或仅关注整体聚类趋势时,可选择“不添加”。任务提交后,可进入“我的项目”查看任务状态。
运行分析结果文件说明
分析完成后,平台通常会输出densityBetaPlot.pdf、dmpDiff.xls、heatmap.pdf、mdsPlot.pdf、normPlot.pdf和rawBox.pdf等结果文件。这些文件分别对应甲基化数据分布、差异位点统计结果、聚类热图、样本降维图和箱线图等内容。

rawBox.pdf用于展示原始甲基化数据的箱线图。箱线图能够反映不同样本甲基化Beta值的整体分布情况。正常情况下,各样本箱体的位置、中位数和分布范围应大致相近。如果某个样本的箱体明显偏高、偏低或分布范围明显异常,可能提示该样本存在批次效应、数据质量问题或特殊生物学差异,需要结合实验信息进一步判断。
normPlot.pdf通常展示标准化处理后的样本箱线图。与原始箱线图相比,标准化后的不同样本分布一般会更加接近。通过比较rawBox.pdf和normPlot.pdf,可以初步判断标准化处理是否改善了样本间的整体一致性。

densityBetaPlot.pdf用于展示各样本甲基化Beta值的密度分布。图中不同颜色代表不同样本或不同分组,横坐标为Beta值,纵坐标为密度。若各样本曲线形态相似且峰值位置较为接近,通常说明样本整体分布较一致;若部分样本曲线明显偏移或出现异常形状,则需要关注这些样本是否存在质量问题或显著批次差异。

mdsPlot.pdf为多维尺度分析图,也可理解为样本降维可视化结果。该图通常基于变异程度较高的一部分甲基化位点,将高维甲基化数据投影到二维平面中。图中每个点代表一个样本,点之间距离越近,说明样本整体甲基化特征越相似;距离越远,则说明样本差异越大。
如果同一分组的样本在MDS图中聚集,而不同分组之间存在一定分离趋势,说明分组可能具有较明显的甲基化差异。如果同组样本分散严重,或者不同组样本完全混合,则可能提示组内异质性较大、分组效应较弱,或存在批次因素影响。

dmpDiff.xls是差异甲基化位点分析的核心结果文件。该文件通常包括位点ID、统计量、P值和校正后的Q值等信息。位点ID通常为芯片探针编号,例如cg19229544。P值用于衡量不同分组间该位点甲基化水平差异的统计显著性,P值越小,说明差异由随机波动造成的可能性越低。
Q值通常是对多重检验进行校正后的结果,也可理解为FDR校正后的显著性指标。由于甲基化芯片往往同时检测数十万甚至更多位点,因此仅依据P值容易产生较多假阳性结果。在实际筛选中,通常优先使用Q值判断显著性,例如可将Q值小于0.05的位点作为显著差异甲基化位点候选集。研究者还可以结合甲基化差异方向、效应大小、基因注释和临床信息进行后续筛选。

heatmap.pdf为差异甲基化位点聚类热图。该图通常选取显著差异甲基化位点进行层次聚类展示,横坐标为样本,纵坐标为甲基化位点,颜色表示相对甲基化水平或标准化后的信号强度。红色和蓝色一般对应较高和较低的甲基化水平,但具体颜色含义应以图例为准。
热图上方和左侧的树状图分别表示样本聚类和位点聚类关系。如果不同组样本能够在热图中形成相对清晰的聚类分支,说明筛选出的差异位点具有一定分组区分能力。如果两组样本相互混杂,则说明差异信号可能较弱,或者个别样本的甲基化模式与所属组不一致。
结果解读建议
完成差异位点筛选后,若某些位点在病例组中表现为高甲基化,而这些位点位于基因启动子区域,则可能与对应基因表达下调有关;若位点位于基因体、增强子或非编码区域,其功能影响则需要结合更多注释信息判断。甲基化变化与基因表达之间并非始终呈简单的负相关关系,因此后续可结合转录组差异分析、功能富集分析、蛋白互作分析或临床表型分析进行验证。
在使用本工具时,建议优先确保输入数据质量和分组信息准确。对于样本量较小、组内差异较大或存在明显批次效应的数据,应谨慎解释结果,并尽可能结合独立队列、实验验证或公开数据库进行进一步确认。

只需准备甲基化数据矩阵和分组文件,即可在线完成数据质控、样本分布展示、差异位点筛选及结果可视化,并下载完整分析结果
浙公网安备 33010602011771号