随笔分类 -  PyTorch 深度学习专题【左扬精讲】

摘要:PyTorch 2.x 深度学习专题【左扬精讲】—— 张量并行:列并行与行并行的前向/反向传播、MHA 子层切分与通信开销最小化 本篇深入剖析大模型训练中最重要的层内并行技术—— 张量并行(Tensor Parallelism, TP)。 当模型的单层参数(Transformer 单一层内部全部可学 阅读全文
posted @ 2026-08-08 17:59 左扬 阅读(23) 评论(0) 推荐(0)
摘要:PyTorch 2.x 深度学习专题【左扬精讲】—— PyTorch vs TensorFlow:面试复盘 前几天面试,面试官问了一道经典问题:"PyTorch 和 TensorFlow 有什么区别?为什么 PyTorch 在学术界更流行?" 当时我虽然能答上来一些,但不够系统全面。回来之后花了点时 阅读全文
posted @ 2026-08-07 17:16 左扬 阅读(14) 评论(0) 推荐(0)
摘要:PyTorch 2.x 深度学习专题【左扬精讲】—— 讲讲模型太大:超深、超宽与大数据量的显存挑战 本专题内容导航 训练深度学习模型时,"显存不够"是每个算法工程师都会遇到的典型问题。运行代码后屏幕弹出 CUDA out of memory 报错。 NVIDIA A100 单卡提供 80GB HBM 阅读全文
posted @ 2026-08-06 17:46 左扬 阅读(14) 评论(0) 推荐(0)
摘要:PyTorch 2.x 深度学习专题【左扬精讲】—— 大规模分布式训练核心要点:从并行策略到通信原语的理论知识 分布式训练 数据并行 模型并行 流水线并行 张量并行 通信原语 All-Reduce NCCL 学习重点提示 本文涵盖分布式训练的核心知识,内容深度依次递进。建议读者根据自身背景选择性深入 阅读全文
posted @ 2026-08-03 14:11 左扬 阅读(18) 评论(0) 推荐(0)
摘要:PyTorch 2.x 深度学习专题【左扬精讲】—— 计算大模型的参数量:从 Embedding 到 LM Head,以 GPT-3 175B 为例 大模型火了好几年,但 "这个模型有多少参数"这个问题,真正能从头推一遍的人少之又少。 本篇来补上这块硬功夫——把 GPT-3 175B 的参数量从 E 阅读全文
posted @ 2026-08-02 19:45 左扬 阅读(27) 评论(0) 推荐(0)
摘要:PyTorch 2.x 深度学习专题【左扬精讲】—— Attention 的两个补丁:Positional Encoding 与 Masked Self-Attention,从 Encoder 跨到 Decoder 上一篇把 Self-Attention 的四步公式 Softmax(Q K^T / 阅读全文
posted @ 2026-08-02 17:58 左扬 阅读(15) 评论(0) 推荐(0)
摘要:PyTorch 2.x 深度学习专题【左扬精讲】—— 注意力机制到底在做什么,Q/K/V 怎么来的?一文读懂 Attention 注意力机制 本文是 PyTorch 2.x 深度学习专题【左扬精讲】 系列:把 Transformer 里的 Self-Attention 一次性讲透——Scaled D 阅读全文
posted @ 2026-08-01 15:59 左扬 阅读(19) 评论(0) 推荐(0)
摘要:PyTorch 2.x 深度学习专题【左扬精讲】—— 词嵌入详解:从独热编码到上下文相关表示 在自然语言处理(NLP)领域,如何让机器 "理解" 人类语言是一个核心问题。 词嵌入(Word Embedding)作为将离散符号映射为连续稠密向量的关键技术,是现代 NLP 深度学习模型的基石。 本文将系 阅读全文
posted @ 2026-07-28 15:12 左扬 阅读(18) 评论(0) 推荐(0)
摘要:PyTorch 2.x 深度学习专题【左扬精讲】—— 位置编码:为什么 Transformer 需要知道词的顺序? 在前几篇文章中,我们讲了 Attention、多头注意力、残差连接。细心的小伙伴可能注意到了一个问题:Attention 的计算和位置无关。 什么意思呢?Attention 本质上是一 阅读全文
posted @ 2026-07-26 18:38 左扬 阅读(17) 评论(0) 推荐(0)
摘要:PyTorch 2.x 深度学习专题【左扬精讲】—— 残差连接:让信息直接"跳过"层传播 在之前的文章中,我们讲了 Self-Attention 和多头注意力。它们是 Transformer 的核心组件,能让序列中任意两个位置直接对话。但还有一个问题:如果把很多层 Attention 堆在一起,会发 阅读全文
posted @ 2026-07-26 18:27 左扬 阅读(23) 评论(0) 推荐(0)
摘要:PyTorch 2.x 深度学习专题【左扬精讲】—— 多头注意力机制:为什么一个头不够用? 上一篇文章我们讲了 Self-Attention(自注意力机制),它能让序列中任意两个位置直接"对话",不受距离限制。这已经很厉害了,但还有一个问题:如果只用单一注意力头,模型只能学习到一种类型的相关性。 举 阅读全文
posted @ 2026-07-26 16:25 左扬 阅读(18) 评论(0) 推荐(0)
摘要:PyTorch 2.x 深度学习专题【左扬精讲】—— Transformer架构在SRE中的深度应用:从Attention到自监督预训练 在上一篇文章中,我们探讨了 Seq2Seq 模型在 SRE 运维场景中的应用。Seq2Seq 通过编码器-解码器结构,能够将输入序列转换为输出序列,在日志异常检测 阅读全文
posted @ 2026-07-26 15:46 左扬 阅读(6) 评论(0) 推荐(0)
摘要:PyTorch 2.x 深度学习专题【左扬精讲】—— Seq2Seq模型在SRE运维场景中的应用:从原理到实战 随着微服务架构和云原生技术的普及,SRE(Site Reliability Engineering)团队面临着前所未有的运维挑战。海量的日志数据、实时告警、监控指标、以及错综复杂的微服务调 阅读全文
posted @ 2026-07-26 15:17 左扬 阅读(7) 评论(0) 推荐(0)
摘要:基于 PyTorch 2.x 的大模型开发与微调专题【左扬精讲】—— Transformer 三大核心:Self-Attention、Multi-Head Attention 与 Position Encoding Transformer 架构的核心,是把"序列里每一个 token 都能直接看见所有 阅读全文
posted @ 2026-07-25 07:41 左扬 阅读(19) 评论(0) 推荐(0)
摘要:PyTorch 2.x 深度学习专题【左扬精讲】—— BERT系列解析:掩码语言模型(MLM)与下一句预测(NSP)的预训练原理 BERT (2018) BERT: Pre-training of Deep Bidirectional Transformers for Language Unders 阅读全文
posted @ 2026-07-24 18:27 左扬 阅读(19) 评论(0) 推荐(0)
摘要:PyTorch 2.x 深度学习专题【左扬精讲】—— GPT系列演进:从GPT-1到GPT-4,自回归语言模型的设计哲学 GPT-1 (2018) Improving Language Understanding by Generative Pre-Training ← 预训练+微调范式开创者 GP 阅读全文
posted @ 2026-07-24 18:05 左扬 阅读(19) 评论(0) 推荐(0)
摘要:PyTorch 2.x 深度学习专题【左扬精讲】—— Flash Attention原理:分块计算与重计算,如何降低O(n^2)的显存占用 Flash Attention v1 (Tri Dao, 2022) ← 分块计算 + 在线softmax Flash Attention v2 (Tri Da 阅读全文
posted @ 2026-07-24 17:45 左扬 阅读(20) 评论(0) 推荐(0)
摘要:PyTorch 2.x 深度学习专题【左扬精讲】—— 位置编码详解:正弦位置编码、相对位置编码、旋转位置编码(RoPE) torch.nn.Embedding ← 可学习位置编码的底层实现 torch.nn.functional.scaled_dot_product_attention ← 现代 A 阅读全文
posted @ 2026-07-24 15:58 左扬 阅读(22) 评论(0) 推荐(0)
摘要:PyTorch 2.x 深度学习专题【左扬精讲】—— Attention机制:为什么需要注意力,如何计算 先说核心结论 Attention是序列建模中最核心的动态加权机制。它用三个角色(Query、Key、Value)描述了"我要查什么、查什么资料、查到什么"的完整流程,并将这种"软检索"转化为可微 阅读全文
posted @ 2026-07-23 21:56 左扬 阅读(30) 评论(0) 推荐(0)
摘要:PyTorch 2.x 深度学习专题【左扬精讲】—— Seq2Seq模型:编码器-解码器架构详解 先说核心结论 Seq2Seq是现代序列建模的起点。它用 "编码器-解码器" 架构解决了变长序列映射问题:编码器将任意长度的输入压缩为固定向量,解码器从向量生成变长输出。这个看似简单的设计,为注意力机制和 阅读全文
posted @ 2026-07-23 18:41 左扬 阅读(28) 评论(0) 推荐(0)