随笔分类 - 笔记
摘要:可能更好的阅读体验 Jeefy's Blog: FedProx 对于联邦学习,有一个非常重要的假设:No-IID 的数据分布。所以对于 FedAvg 其实不容易收敛(泛用性很差),直接平均可能震荡不收敛。所以提出了 FedProx,引入正则化参数,其基础还是 FedAvg 其中引入的两个放缩: \(
阅读全文
摘要:可能更好的阅读体验 Jeefy's Blog: PENS (Performance-Based Neighbor Selection) Decentralized federated learning of deep neural networks on non-iid data 依旧是建模起手 \
阅读全文
摘要:可能更好的阅读体验 Jeefy's Blog: LSTM GRU(Gate Recurrent Unit)是一种 RNN,LSTM 也是一种 RNN,这两者都是为了解决 RNN 长程问题中的记忆衰减问题。一般来说,GRU \(\approx\) LSTM,但是 GRU 的计算损耗更低,所以 GRU
阅读全文
摘要:可能更好的阅读体验 Jeefy's Blog: RNN RNN 也就是循环神经网络。 其核心公式也就两个: \[\begin{aligned} z_t &= W_h h_{t - 1} + W_x x_t + b_1 \\ h_t &= f_1(z_t) \\ o_t &= W_y h_t + b_
阅读全文
摘要:可能更好的阅读体验 Jeefy's Blog: FedAtt Learning Private Neural Language Modeling with Attentive Aggregation 问题背景 传统中心化方法需收集大量用户数据,存在隐私风险 联邦学习通过分布式训练保护用户隐私 现有F
阅读全文
摘要:可能更好的阅读体验 Jeefy's Blog: KD 基于高温 Softmax 的 Logits 模拟 对于 Softmax 函数,如果引入温度 \(T\),那么: \[q_i = \frac {\exp (z_i / T)}{\sum \exp (z_j / T)} \]会使得 \(q_i\) 间
阅读全文
摘要:可能更好的阅读体验 Jeefy's Blog: DFKD 知识蒸馏(Knowledge Distillation, KD)的核心论文按范式演进可分为基础软标签蒸馏、特征/关系对齐、自/互学习与在线蒸馏四大类,以下按类别列出里程碑工作。 1. 基础软标签蒸馏(Logits-Level) Hinton
阅读全文
摘要:可能更好的阅读体验 Jeefy's Blog: RDT (Reccurent Depth Transfomer) Universal Transformer 类似于 RNN 的思路,但是对于一般的 Transformer 引入循环,也就是重复思考: 特殊的设计有两点: Depth/Time PE 由
阅读全文
摘要:可能更好的阅读体验 Jeefy's Blog: 数据安全(SMC) \(\Delta\) 差分隐私 数据加入随机噪声,可以上传时加噪(本地保护),可以聚合时加噪(中心可信,暴露给第三方时保护)。 \(\Delta\) SMC 算法 Practical Secure Aggregation for p
阅读全文
摘要:可能更好的阅读体验 Jeefy's Blog: Hat-DFed TL;DR ^tldr 核心思想:把去中心化 FL 的动态拓扑选择问题建模为 MAB(MAB Tiger Machine),用 UTC 算法做无偏估计 + DCMU 用 loss 评估重要性做模型聚合,并把能耗(数据传输 + 计算 +
阅读全文
摘要:可能更好的阅读体验 Jeefy's Blog: D-PSGD 这篇文章在对比 C-PSGD 和 D-PSGD 有什么区别。文章采用的是静态的环链路。计算复杂度相同,但是通讯复杂度,C-PSGD 是 \(O(n)\),而 D-PSGD 是与图结构相关的复杂度。 贡献: 发现当 \(n\) 足够大时,由
阅读全文
摘要:可能更好的阅读体验 Jeefy's Blog: FedMD 提出关于模型异构型的解决方案,这是 FedMKT 的一个基础。 对于 No-IID 的数据,原有的解决方案有三: 贝叶斯方法:采用 变分推断(Variational Inference) 来建模模型参数的后验分布,通过概率建模捕捉数据分布的
阅读全文
摘要:可能更好的阅读体验 Jeefy's Blog: L-smooth & Lipschitz 连续性假设 根据神秘言论:L-Lipschitz smooth 和 Lipschitz 连续性 是凸优化与非凸优化理论中最基础、最常用的正则性假设之一。 定义(集合上的局部 Lipschitz):\(f\) 在
阅读全文
摘要:可能更好的阅读体验 Jeefy's Blog: FedMKT 这篇文章应该是 Co-PLMs 的直接前身,其结构十分相似: Client SLM 通过私有数据集进行 LoRA 微调 Server LLM 利用共有数据集吸收 SLM 的知识,达到类似集中微调的效果。 Server LLM 聚合后同样利
阅读全文
摘要:可能更好的阅读体验 Jeefy's Blog: FedCoLLM FedCoLLM 核心处理的就是多端协同的问题,旨在更高效的解决模型合并的问题。 具体来说,其框架如下: Server(LLM)\(f_\psi\) 和 K 个 Clients \(g_\phi\) 每一个 Client 拥有一个私有
阅读全文
摘要:可能更好的阅读体验 Jeefy's Blog: FedPETuning FedAP 其实就是 Adapter Tuning + FedAvg 的组合而已。 FedPF 其实就是 LoRA 中提到的 Prefix/Prompt Tuning + FedAvg。 FedLR 其实就是 LoRA + Fe
阅读全文
摘要:可能更好的阅读体验 Jeefy's Blog: Adapter Tuning 该方法的核心其实就是在适当的位置插入两个 Adapter 模块,这个模块的结构如下: flowchart TB in["x₁, x₂, ..., xₙ"] FDProj["FeedForward down-project"
阅读全文
posted @ 2026-04-05 22:59
jeefy
摘要:可能更好的阅读体验 Jeefy's Blog: FSE25 阅读 FatFuzz:利用插桩(在代码块中插入日志输出),构建每个输入的代码执行流程,利用一张表记录,利用表的哈希去重,分析覆盖率,并查 bug。 SandBoxFuzz: 在FatFuzz 的基础上,利用输入的钩子将占位的输入进行拦截并注
阅读全文
posted @ 2026-04-03 11:03
jeefy
摘要:可能更好的阅读体验 Jeefy's Blog: WWW26 A Structure-Agnostic Co-Tuning Framework for LLMs and SLMs in Cloud-Edge Systems 会议: WWW 2026 (The ACM Web Conference) 主
阅读全文
摘要:可能更好的阅读体验 Jeefy's Blog: KL 散度 KL 散度描述的是两个分布之间的差异,更具体一点,是一个分布相对另一个分布的差异。 \[D_{KL}(P || Q) = \sum_{x \in P} P(x) \log \frac {P(x)}{Q(x)} = {\mathbb E}_{
阅读全文

浙公网安备 33010602011771号