会员
周边
新闻
博问
闪存
赞助商
Chat2DB
所有博客
当前博客
我的博客
我的园子
账号设置
会员中心
简洁模式
...
退出登录
注册
登录
fangpin
博客园
首页
新随笔
联系
订阅
管理
2026年8月10日
6 高级 cuda 特性 —— 从矩阵乘法(gemm)说起
摘要: 本文以优化矩阵乘法 general matrix multiplication (gemm) 为切入点,介绍高级 cuda 特性在性能优化中的使用。 使用Roofline Model对矩阵乘法进行性能分析。 矩阵乘法 C = AB(其中 A, B, C 均为 n 行 n 列)的计算量是固定的,但访存
阅读全文
posted @ 2026-08-10 17:19 fangpin
阅读(28)
评论(0)
推荐(0)
2026年8月9日
5 GPU内存访问密集型高性能计算
摘要: 在并行计算和 GPU 优化中,我们通常会遇到两类主要瓶颈:计算限制(Compute-dominated)与访存限制(Memory-bound)。在之前的实验中,我们主要面对的是计算密集型任务。本章我们将视角转向到访存密集型工作负载。以波动方程模拟(Wave Simulation),其实不用理解其具体
阅读全文
posted @ 2026-08-09 19:23 fangpin
阅读(17)
评论(0)
推荐(0)
2026年8月8日
4 Roofline Model —— 性能优化方向的理论指导
摘要: Roofline Model 在优化 GPU 或 CPU 程序时,时常会有疑问: 为什么我的代码跑不快 是算法太复杂 还是显存带宽不够 我的优化到头了吗,我的代码还有多大的优化空间。 Roofline Model 提供了一个简洁的物理框架,将硬件的限制与软件的行为联系起来,帮助开发者确定优化的方向。
阅读全文
posted @ 2026-08-08 21:40 fangpin
阅读(32)
评论(0)
推荐(0)
2026年8月6日
GPU编程2: 并行策略
摘要: 并行策略 无论是 CPU 还是 GPU 从并行策略上都分为以下几类。理解不同并行方式有助于理解如何实现高性能计算。 指令并行 ILP (Instuction Level Parallel) 指令并行是指同一线程(同一程序流)中,在一个周期内同时发射多条无相互依赖的指令到cpu进行执行。 现代 CPU
阅读全文
posted @ 2026-08-06 21:18 fangpin
阅读(14)
评论(0)
推荐(0)
2026年5月30日
把 VS Code Remote 的体验带到 Neovim
摘要: 如果你长期使用 Neovim,又经常需要在远端机器、容器或 devcontainer 里开发,应该很熟悉这种割裂感: 本地 Neovim 顺手、配置完整、插件熟悉;但真正的代码、依赖、构建环境、测试数据却在远端。直接 SSH 上去跑 nvim 可以解决一部分问题,但远端配置很快会失控,插件和工具链也
阅读全文
posted @ 2026-05-30 23:33 fangpin
阅读(127)
评论(0)
推荐(0)
2026年5月29日
把云端或本地 Agent 接进飞书
摘要: 过去一年,很多工程团队已经把 Coding Agent 放进了日常开发流程:让它读代码、改代码、跑测试、解释报错、梳理方案。问题是,这些能力通常被锁在本地终端或 IDE 里。你需要坐在电脑前,切到对应目录,打开终端,输入 prompt,然后等它输出。 但真实的协作场景并不总发生在终端里。很多问题是在
阅读全文
posted @ 2026-05-29 23:19 fangpin
阅读(144)
评论(0)
推荐(0)
2025年12月7日
从0构建深度学习框架——揭秘深度学习框架的黑箱
摘要: 引言 你有没有好奇过,当你在 PyTorch 或 TensorFlow 中调用 .backward() 计算梯度时,框架到底在背后做了什么? 我们每天都在使用这些成熟的深度学习工具,但很少有人真正去探索它们的底层实现——自动微分的魔法、计算图的构建、张量运算的优化……这些隐藏在API背后的核心原理,
阅读全文
posted @ 2025-12-07 20:55 fangpin
阅读(76)
评论(0)
推荐(0)
2025年12月5日
AI Agent 设计原则与最佳实践
摘要: Agent 设计准则 三大准则: 透明:让用户感知 Agent 的存在,以及其行为 可控:用户可以设置 agent的偏好,并对 Agent 进行指令,以及监控其行为 一致性:Agent 行为保持一致,避免用户对 Agent 行为产生困惑 透明性设计 透明性要求 Agent 在交互过程中清晰表达其意图
阅读全文
posted @ 2025-12-05 19:26 fangpin
阅读(203)
评论(0)
推荐(0)
2025年11月18日
强化学习从入门到放弃 —— 跟着 OpenAI 学强化学习
摘要: 核心概念解析 简而言之,强化学习是关于智能体(agent)以及它们如何通过试错来学习的研究。它将这样一种理念形式化:对智能体的行为进行奖励或惩罚,会使它在未来更有可能重复或放弃该行为。 强化学习能做什么? 强化学习方法近年来在多个领域取得了广泛的成功。例如: 它被用于教计算机在模拟环境中控制机器。
阅读全文
posted @ 2025-11-18 22:41 fangpin
阅读(120)
评论(0)
推荐(0)
2025年11月17日
从零实现 REINFORCE/GRPO —— 大模型推理强化微调实践
摘要: 一文吃透:不依赖成熟 RL 库,如何实现 REINFORCE、REINFORCE-baseline 与 GRPO;数理推理模型的强化学习微调实践;训练/参考/采样模型的多卡调度。 引言 你是否也遇到过:模型“会思考”,但少数题正确,格式还常常不合规?我在 Qwen/Qwen2.5-Math-1.5B
阅读全文
posted @ 2025-11-17 22:56 fangpin
阅读(154)
评论(0)
推荐(0)
下一页
公告