会员
众包
新闻
博问
闪存
赞助商
HarmonyOS
Chat2DB
所有博客
当前博客
我的博客
我的园子
账号设置
会员中心
简洁模式
...
退出登录
注册
登录
罗西的思考
一手伸向技术,一手伸向生活
博客园
首页
新随笔
联系
订阅
管理
上一页
1
···
13
14
15
16
17
18
19
20
21
···
34
下一页
2021年8月
[源码解析] 机器学习参数服务器ps-lite(2) ----- 通信模块Van
摘要: 本文是参数服务器系列第二篇,介绍ps-lite的通信模块 Van。
阅读全文
posted @ 2021-08-02 20:11 罗西的思考
阅读(1105)
评论(0)
推荐(0)
2021年7月
[源码解析] 机器学习参数服务器ps-lite (1) ----- PostOffice
摘要: 参数服务器是机器学习训练一种范式,是为了解决分布式机器学习问题的一个编程框架。本文是参数服务器系列第一篇,介绍ps-lite的总体设计和基础模块 Postoffice。
阅读全文
posted @ 2021-07-30 15:40 罗西的思考
阅读(2340)
评论(0)
推荐(0)
[源码解析] 深度学习分布式训练框架 horovod (20) --- Elastic Training Operator
摘要: 本文是 horovod on k8s 的最后一篇,看看 MPI-Operator 可能被如何改进。
阅读全文
posted @ 2021-07-28 19:43 罗西的思考
阅读(969)
评论(0)
推荐(0)
[源码解析] 深度学习分布式训练框架 horovod (19) --- kubeflow MPI-operator
摘要: Horovod 是一款基于 AllReduce 的分布式训练框架。本文是 Horovod on k8s 第二篇,介绍MPI-Operator。
阅读全文
posted @ 2021-07-26 14:21 罗西的思考
阅读(2536)
评论(0)
推荐(0)
[源码解析] 深度学习分布式训练框架 horovod (18) --- kubeflow tf-operator
摘要: Horovod 是一款基于 AllReduce 的分布式训练框架。本文是 Horovod on k8s 第一篇,介绍kubeflow tf-operator。
阅读全文
posted @ 2021-07-23 17:02 罗西的思考
阅读(1821)
评论(0)
推荐(0)
[源码解析] 深度学习分布式训练框架 horovod (17) --- 弹性训练之容错
摘要: Horovod 是Uber于2017年发布的一个易于使用的高性能的分布式训练框架,在业界得到了广泛应用。本系列将通过源码分析来带领大家了解 Horovod。本文是系列第十七篇,看看horovod 的容错机制。
阅读全文
posted @ 2021-07-21 20:29 罗西的思考
阅读(1010)
评论(4)
推荐(0)
[源码解析] 深度学习分布式训练框架 horovod (16) --- 弹性训练之Worker生命周期
摘要: Horovod 是Uber于2017年发布的一个易于使用的高性能的分布式训练框架,在业界得到了广泛应用。本系列将通过源码分析来带领大家了解 Horovod。本文是第十六篇,看看 horovod **弹性训练**中 worker 的生命周期。
阅读全文
posted @ 2021-07-19 20:19 罗西的思考
阅读(738)
评论(2)
推荐(0)
[源码解析] 深度学习分布式训练框架 horovod (15) --- 广播 & 通知
摘要: Horovod 是Uber于2017年发布的一个易于使用的高性能的分布式训练框架,在业界得到了广泛应用。本系列将通过源码分析来带领大家了解 Horovod。本文是系列第十五篇,看看horovod 弹性训练如何广播和发送通知。
阅读全文
posted @ 2021-07-16 20:24 罗西的思考
阅读(904)
评论(0)
推荐(0)
[源码解析] 深度学习分布式训练框架 horovod (14) --- 弹性训练发现节点 & State
摘要: Horovod 是Uber于2017年发布的一个易于使用的高性能的分布式训练框架,在业界得到了广泛应用。本系列将通过源码分析来带领大家了解 Horovod。本文是系列第十四篇,看看horovod 如何动态发现节点 和 处理状态信息。
阅读全文
posted @ 2021-07-14 19:18 罗西的思考
阅读(840)
评论(1)
推荐(0)
[源码解析] 深度学习分布式训练框架 horovod (13) --- 弹性训练之 Driver
摘要: Horovod 是Uber于2017年发布的一个易于使用的高性能的分布式训练框架,在业界得到了广泛应用。本系列将通过源码分析来带领大家了解 Horovod。本文是系列第十三篇,看看 horovod 弹性实现中 的 Driver 角色。
阅读全文
posted @ 2021-07-12 19:43 罗西的思考
阅读(877)
评论(0)
推荐(0)
上一页
1
···
13
14
15
16
17
18
19
20
21
···
34
下一页
公告