摘要:
Horovod 是一款基于 AllReduce 的分布式训练框架。本文是 Horovod on k8s 第二篇,介绍MPI-Operator。 阅读全文
posted @ 2021-07-26 14:21
罗西的思考
阅读(2534)
评论(0)
推荐(0)
摘要:
Horovod 是一款基于 AllReduce 的分布式训练框架。本文是 Horovod on k8s 第一篇,介绍kubeflow tf-operator。 阅读全文
posted @ 2021-07-23 17:02
罗西的思考
阅读(1821)
评论(0)
推荐(0)
摘要:
Horovod 是Uber于2017年发布的一个易于使用的高性能的分布式训练框架,在业界得到了广泛应用。本系列将通过源码分析来带领大家了解 Horovod。本文是系列第十七篇,看看horovod 的容错机制。 阅读全文
posted @ 2021-07-21 20:29
罗西的思考
阅读(1010)
评论(4)
推荐(0)
摘要:
Horovod 是Uber于2017年发布的一个易于使用的高性能的分布式训练框架,在业界得到了广泛应用。本系列将通过源码分析来带领大家了解 Horovod。本文是第十六篇,看看 horovod **弹性训练**中 worker 的生命周期。 阅读全文
posted @ 2021-07-19 20:19
罗西的思考
阅读(735)
评论(2)
推荐(0)
摘要:
Horovod 是Uber于2017年发布的一个易于使用的高性能的分布式训练框架,在业界得到了广泛应用。本系列将通过源码分析来带领大家了解 Horovod。本文是系列第十五篇,看看horovod 弹性训练如何广播和发送通知。 阅读全文
posted @ 2021-07-16 20:24
罗西的思考
阅读(903)
评论(0)
推荐(0)
摘要:
Horovod 是Uber于2017年发布的一个易于使用的高性能的分布式训练框架,在业界得到了广泛应用。本系列将通过源码分析来带领大家了解 Horovod。本文是系列第十四篇,看看horovod 如何动态发现节点 和 处理状态信息。 阅读全文
posted @ 2021-07-14 19:18
罗西的思考
阅读(839)
评论(1)
推荐(0)
摘要:
Horovod 是Uber于2017年发布的一个易于使用的高性能的分布式训练框架,在业界得到了广泛应用。本系列将通过源码分析来带领大家了解 Horovod。本文是系列第十三篇,看看 horovod 弹性实现中 的 Driver 角色。 阅读全文
posted @ 2021-07-12 19:43
罗西的思考
阅读(877)
评论(0)
推荐(0)
摘要:
Horovod 是Uber于2017年发布的一个易于使用的高性能的分布式训练框架,在业界得到了广泛应用。本系列将通过源码分析来带领大家了解 Horovod。本文是系列第十二篇,看看horovod 如何实施弹性训练。 阅读全文
posted @ 2021-07-09 21:02
罗西的思考
阅读(1499)
评论(2)
推荐(0)
摘要:
Horovod 是Uber于2017年发布的一个易于使用的高性能的分布式训练框架,在业界得到了广泛应用。本系列将通过源码分析来带领大家了解 Horovod。本文是系列第十一篇,看看horovod 如何运行在 spark 之上(GLOO实现)。 阅读全文
posted @ 2021-07-07 19:22
罗西的思考
阅读(786)
评论(0)
推荐(0)
摘要:
Horovod 是Uber于2017年发布的一个易于使用的高性能的分布式训练框架,在业界得到了广泛应用。本文是系列第十篇,看看horovod 如何运行在 spark 之上。 阅读全文
posted @ 2021-07-05 06:25
罗西的思考
阅读(969)
评论(0)
推荐(0)
浙公网安备 33010602011771号