上一页 1 2 3 4 5 6 7 8 9 10 ··· 35 下一页
摘要: 从零开始解析Transformer,目标是:(1) 解析Transformer如何运作,以及为何如此运作,让新同学可以入门;(2) 力争融入一些比较新的或者有特色的论文或者理念,让老鸟也可以有所收获。 阅读全文
posted @ 2025-02-22 09:55 罗西的思考 阅读(3934) 评论(4) 推荐(1)
摘要: 从零开始解析Transformer,目标是:(1) 解析Transformer如何运作,以及为何如此运作,让新同学可以入门;(2) 力争融入一些比较新的或者有特色的论文或者理念,让老鸟也可以有所收获。 阅读全文
posted @ 2025-02-20 20:42 罗西的思考 阅读(5284) 评论(7) 推荐(1)
摘要: 从零开始解析Transformer,目标是:(1) 解析Transformer如何运作,以及为何如此运作,让新同学可以入门;(2) 力争融入一些比较新的或者有特色的论文或者理念,让老鸟也可以有所收获。 阅读全文
posted @ 2025-02-18 21:05 罗西的思考 阅读(2121) 评论(4) 推荐(0)
摘要: 从零开始解析Transformer,目标是:(1) 解析Transformer如何运作,以及为何如此运作,让新同学可以入门;(2) 力争融入一些比较新的或者有特色的论文或者理念,让老鸟也可以有所收获。 阅读全文
posted @ 2025-02-15 09:37 罗西的思考 阅读(5177) 评论(1) 推荐(13)
摘要: 探秘Transformer系列之(1):注意力机制 0x00 概述 因为各种事情,好久没有写博客了,之前写得一些草稿也没有时间整理(都没有时间登录博客和微信,导致最近才发现好多未读消息和私信,在这里和各位朋友说下万分抱歉)。现在恢复更新,是因为最近有些从非AI领域转过来的新同学来找我询问是否有比较好 阅读全文
posted @ 2025-02-09 11:17 罗西的思考 阅读(9723) 评论(13) 推荐(32)
摘要: 新书出版:《分布式机器学习——系统、工程与实战》 ## 0x01 广告 经过一年多的努力,我的书 《分布式机器学习——系统、工程与实战》终于上架了,在这里打个广告。 ![](https://img2023.cnblogs.com/blog/1850883/202307/1850883-20230719224442070-381968133.jpg) 阅读全文
posted @ 2023-07-21 23:50 罗西的思考 阅读(2572) 评论(7) 推荐(3)
摘要: 本文我们主要来看看ParameterServerStrategy如何分发计算,也就是ClusterCoordinator如何运作。这是TF分布式的最后一篇。 阅读全文
posted @ 2022-05-21 11:45 罗西的思考 阅读(672) 评论(0) 推荐(0)
摘要: 对于 ParameterServerStrategy V2,我们将从几个方面来研究:如何与集群建立连接,如何生成变量,如何获取数据,如何运行。其中,变量和作用域我们在前文已经研究过,运行在 MirroredStrategy 里面也介绍,所以本文主要看看如何使用,如何初始化。在下一篇之中会重点看看如何分发计算。 阅读全文
posted @ 2022-05-14 08:08 罗西的思考 阅读(1045) 评论(0) 推荐(1)
摘要: 本章我们看看 ParameterServerStrategy,就是第一版代码。研究这个是因为目前工业界还有很多公司在使用,而且其内部机制也比较清晰易懂,值得我们分析。 阅读全文
posted @ 2022-05-08 09:12 罗西的思考 阅读(838) 评论(0) 推荐(0)
摘要: 前一篇我们分析了MirroredStrategy 的基本架构和如何更新变量,本文我们来看看 MirroredStrategy 如何运行。具体希望了解的是,MirroredStrategy 通过什么方式在远端设备节点上运行训练方法(如何分发计算),MirroredStrategy 和我们之前分析的 TF 运行时怎么联系起来?和 master,worker 这些概念怎么联系起来? 阅读全文
posted @ 2022-04-26 08:03 罗西的思考 阅读(714) 评论(0) 推荐(1)
上一页 1 2 3 4 5 6 7 8 9 10 ··· 35 下一页