Scooby的输入是什么? 这些输入在模型架构中是如何交互和被处理的? 输出具体是什么?
简单来说,Scooby 并不是在“序列”和“细胞信息”之间做二选一,而是将两者作为协同输入,通过一套巧妙的架构让它们“对话”。
以下是 Scooby 的输入、交互处理逻辑以及输出的详细拆解:
1. 核心输入:双重驱动
Scooby 的预测依赖于两类完全不同的数据输入:
DNA 序列 (DNA Sequence):输入一段长度为524kb的基因组 DNA 序列。这提供了基因调控的“硬代码”基础。
单细胞嵌入向量 (Cell Embeddings):这是一组反映细胞状态的低维向量(通常为14 维),由 Poisson-MultiVI 等工具从已有的单细胞多模态数据中提取。它代表了该细胞当前所处的“生理环境”。
2. 模型架构中的处理与交互
这两种输入在模型中并不是简单的相加,而是经历了一个“特征提取 -> 动态解码”的过程:
第一步:序列编码(Borzoi 骨架 + LoRA)
基础处理:524kb的 DNA 序列首先进入Borzoi预训练模型(包含卷积层和 Transformer 层)。
自适应微调:为了让模型适应单细胞数据的特有偏差(如 RNA 测序的 3' 端偏好),Scooby 引入了 LoRA(低秩自适应) 模块(秩为 8)对序列编码器进行微调。
产出:最终生成分辨率为32bp的序列嵌入(Sequence Embedding),这相当于一张描绘了该序列调控潜力的“高精地图”。
第二步:动态权重生成(核心交互点)
这是 Scooby 最聪明的地方。它没有为每个细胞设计死板的输出层,而是设计了一个细胞特异性解码器:
权重生成:单细胞嵌入向量被输入到一个轻量级的多层感知器(MLP)中。
交互逻辑:这个 MLP 的任务不是直接预测结果,而是预测出另一组神经网络的权重。
执行预测:MLP 生成的这些权重被用于一个1×1卷积层,该层直接作用于前面的“序列高精地图”。
3. 具体输出:单细胞分辨率的图谱
模型的输出是针对输入序列中心区域(约196kb)的预测结果:
-
scRNA-seq 覆盖度图谱:预测该序列在特定细胞中的转录本读取覆盖情况。
-
scATAC-seq 插入频率图谱:预测该序列在特定细胞中的染色质可及性(Tn5 酶插入点)。
分辨率:所有输出均为32bp的分箱(Bin)分辨率。

覆盖度图谱和Gene产量
scooby 输出的“覆盖度图谱(Coverage Profile)”比单纯的“基因产量(Counts)”包含更丰富的信息。
“基因产量”是一个总和数字,“覆盖度图谱”就是一张沿基因轴分布的详细地图 。
1. 覆盖度图谱 vs. 基因产量
在模型架构中,两者的关系是“过程”与“结果”:
-
输出内容(覆盖度图谱): scooby 的直接输出是一个连续的信号轨道(Track),分辨率为32bp 。它展示了在特定 DNA 序列上,RNA 读取段(Reads)具体分布在哪些位置 。
-
如何变成产量: 为了得到每个基因的产量,研究人员会将预测的覆盖度在 外显子(Exon)区域进行累加求和 。
2. 为什么要输出“图谱”而不是直接给个“产量”?
scooby 采用这种设计有三个核心优势:
-
捕捉测序偏差(如 3' 端偏好): 传统的 10x 单细胞测序通常会有严重的 3' 端覆盖偏差(即 Reads 集中在转录本末端) 。scooby 能够成功模拟这种真实的生物学和技术特征 。
-
无需注释信息: 传统的产量计算依赖于已知的基因注释,而 scooby 的覆盖度预测是无需注释(Annotation-free)的,它直接从序列预测整个区域的转录潜力 。
-
支持异构体(Isoform)分析: 因为它提供了沿基因轴的详细分布,理论上它可以用来预测不同外显子使用情况或可选剪接(Alternative Splicing),尽管受限于当前的 3' 测序协议,这一点的信号目前还比较有限 。
3. 具体输出示例
当你输入一段序列时,scooby 在 RNA 模态下的输出表现为:
-
中心区域约 的 6,144 个分箱(Bins) 。
-
每个分箱都有一个连续的数值,代表该位置的 RNA 覆盖强度 。
-
通过查看这些数值,你可以清晰地看到转录是从哪里开始,在哪里结束,以及哪些外显子区域的信号最强 。
如何通过这些图谱来解析遗传变异(eQTL)是如何通过破坏具体的结合位点来降低基因产量?
scooby 通过将深度学习预测能力与计算机模拟突变(in silico mutation)以及梯度解释法相结合,能够精准地解析遗传变异(eQTL)如何通过破坏特定转录因子(TF)的结合位点来影响基因产量。
其具体的解析流程如下:
1. 变异效应的量化预测
当给定一个遗传变异(如 eSNP)时,scooby 会并行进行两组预测:
- 参考预测(Reference): 输入包含原始碱基的 DNA 序列,预测该状态下的 RNA 覆盖度图谱和 ATAC 可及性图谱。
- 变异预测(Alternative): 仅改变该位点的碱基,再次输入序列进行预测。
计算差异: 模型通过计算两组图谱之间的log2倍数变化(log-fold change)来量化该变异对基因产量和染色质可及性的直接影响。
2. 识别被破坏的结合位点(机制解析)
为了弄清楚“为什么”产量会降低,scooby 使用了两种关键工具:
-
梯度权重分析: 使用基于梯度的模型解释方法,在变异位点周围生成梯度加权的位点权重矩阵(PWM)。这能显示哪些碱基对模型预测最重要,从而识别受影响的 TF 基序。
-
基序模拟突变: 专门针对预测到的 TF 结合位点进行模拟突变(将其替换为随机序列),观察这是否能复现该 eQTL 导致的表达下降。
3. 解析细胞类型特异性
scooby 的核心优势在于能解释为什么同一个变异在某些细胞中有害,而在另一些细胞中没有影响:
转录因子的“存在感”: 模型通过细胞特异性解码器,将序列变异与细胞内的 TF 表达状态联系起来。
典型案例(TES 基因): 变异rs143664050被预测会降低TES基因在单核细胞中的表达,但在成红细胞中几乎没有影响。
原因分析: 解释发现该变异破坏了SPI1转录因子的结合位点。
生物学验证: 由于 SPI1 仅在单核细胞等髓系细胞中表达,而在成红细胞中不表达,因此该位点被破坏仅在单核细胞中产生功能性后果。
- 预测结果的验证
scooby 的这种解析能力已在大型数据集上得到证实:
在OneK1K队列中,scooby 预测变异效应的方向(增加或减少产量)与实际观察到的细映射 eQTL 效应高度一致。
对于强效应预测(log2效应绝对值>0.05),其符号一致性(Sign Concordance)可达91.6%。

浙公网安备 33010602011771号