罗西的思考 - 博客园

2021年12月

[源码解析] PyTorch 分布式 Autograd (4) ---- 如何切入引擎

摘要：上文我们看到了AutogradMetadata，DistAutogradContainer 和 DistAutogradContext 等一系列基础类。我们知道了分布式autograd如何基于RPC进行传递，如何在节点之间交互，节点如何区分维护这些Session。本文继续分析，主要目的是看看反向传播如何切入到引擎之中。阅读全文

posted @ 2021-12-03 08:59 罗西的思考阅读(742) 评论(0) 推荐(1)

[源码解析] PyTorch 分布式 Autograd (3) ---- 上下文相关

摘要：我们已经知道 dist.autograd 如何发送和接受消息，本文再来看看如何其他支撑部分，就是如何把发送接受两个动作协调起来，如何确定每个发送/接受节点，如何确定每一个消息交互Session。阅读全文

posted @ 2021-12-01 21:08 罗西的思考阅读(801) 评论(0) 推荐(0)

2021年11月

[源码解析] PyTorch 分布式 Autograd (2) ---- RPC基础

摘要：前文我们给出了分布式autograd的设计思路，本文开始，我们进行具体源码分析。因为无论是前向传播还是反向传播，都需要依赖 RPC 来完成，所以我们先看看封装于 RPC 之上的一些基本功能，比如初始化，代理（RPC 相关功能都是基于代理完成），消息接受，发送等等。阅读全文

posted @ 2021-11-30 19:50 罗西的思考阅读(1340) 评论(0) 推荐(2)

[源码解析] PyTorch 分布式 Autograd (1) ---- 设计

摘要：本文以几篇PyTorch官方文档为基础来了解分布式 autograd 的设计和内部结构，在翻译时并没有逐字翻译，其中加入了自己的部分理解。分布式 autograd 后续文章的分析也会基于本文进行。阅读全文

posted @ 2021-11-29 20:18 罗西的思考阅读(2033) 评论(0) 推荐(2)

[源码解析] PyTorch 分布式(13) ----- DistributedDataParallel 之反向传播