会员
周边
新闻
博问
闪存
赞助商
Chat2DB
所有博客
当前博客
我的博客
我的园子
账号设置
会员中心
简洁模式
...
退出登录
注册
登录
fangpin
博客园
首页
新随笔
联系
订阅
管理
2026年8月6日
GPU编程2: 并行策略
摘要: 并行策略 无论是 CPU 还是 GPU 从并行策略上都分为以下几类。理解不同并行方式有助于理解如何实现高性能计算。 指令并行 ILP (Instuction Level Parallel) 指令并行是指同一线程(同一程序流)中,在一个周期内同时发射多条无相互依赖的指令到cpu进行执行。 现代 CPU
阅读全文
posted @ 2026-08-06 21:18 fangpin
阅读(1)
评论(0)
推荐(0)
2026年5月30日
把 VS Code Remote 的体验带到 Neovim
摘要: 如果你长期使用 Neovim,又经常需要在远端机器、容器或 devcontainer 里开发,应该很熟悉这种割裂感: 本地 Neovim 顺手、配置完整、插件熟悉;但真正的代码、依赖、构建环境、测试数据却在远端。直接 SSH 上去跑 nvim 可以解决一部分问题,但远端配置很快会失控,插件和工具链也
阅读全文
posted @ 2026-05-30 23:33 fangpin
阅读(68)
评论(0)
推荐(0)
2026年5月29日
把云端或本地 Agent 接进飞书
摘要: 过去一年,很多工程团队已经把 Coding Agent 放进了日常开发流程:让它读代码、改代码、跑测试、解释报错、梳理方案。问题是,这些能力通常被锁在本地终端或 IDE 里。你需要坐在电脑前,切到对应目录,打开终端,输入 prompt,然后等它输出。 但真实的协作场景并不总发生在终端里。很多问题是在
阅读全文
posted @ 2026-05-29 23:19 fangpin
阅读(91)
评论(0)
推荐(0)
2025年12月7日
从0构建深度学习框架——揭秘深度学习框架的黑箱
摘要: 引言 你有没有好奇过,当你在 PyTorch 或 TensorFlow 中调用 .backward() 计算梯度时,框架到底在背后做了什么? 我们每天都在使用这些成熟的深度学习工具,但很少有人真正去探索它们的底层实现——自动微分的魔法、计算图的构建、张量运算的优化……这些隐藏在API背后的核心原理,
阅读全文
posted @ 2025-12-07 20:55 fangpin
阅读(71)
评论(0)
推荐(0)
2025年12月5日
AI Agent 设计原则与最佳实践
摘要: Agent 设计准则 三大准则: 透明:让用户感知 Agent 的存在,以及其行为 可控:用户可以设置 agent的偏好,并对 Agent 进行指令,以及监控其行为 一致性:Agent 行为保持一致,避免用户对 Agent 行为产生困惑 透明性设计 透明性要求 Agent 在交互过程中清晰表达其意图
阅读全文
posted @ 2025-12-05 19:26 fangpin
阅读(184)
评论(0)
推荐(0)
2025年11月18日
强化学习从入门到放弃 —— 跟着 OpenAI 学强化学习
摘要: 核心概念解析 简而言之,强化学习是关于智能体(agent)以及它们如何通过试错来学习的研究。它将这样一种理念形式化:对智能体的行为进行奖励或惩罚,会使它在未来更有可能重复或放弃该行为。 强化学习能做什么? 强化学习方法近年来在多个领域取得了广泛的成功。例如: 它被用于教计算机在模拟环境中控制机器。
阅读全文
posted @ 2025-11-18 22:41 fangpin
阅读(93)
评论(0)
推荐(0)
2025年11月17日
从零实现 REINFORCE/GRPO —— 大模型推理强化微调实践
摘要: 一文吃透:不依赖成熟 RL 库,如何实现 REINFORCE、REINFORCE-baseline 与 GRPO;数理推理模型的强化学习微调实践;训练/参考/采样模型的多卡调度。 引言 你是否也遇到过:模型“会思考”,但少数题正确,格式还常常不合规?我在 Qwen/Qwen2.5-Math-1.5B
阅读全文
posted @ 2025-11-17 22:56 fangpin
阅读(146)
评论(0)
推荐(0)
手撸大模型的分布式训练:深刻理解大模型训练的“起飞”原理
摘要: 单卡不够?内存爆炸?训练太慢? 在大型语言模型(LLM)的训练过程中,单设备算力和内存往往成为性能瓶颈。如何高效地利用多GPU甚至多节点资源进行分布式训练,是每个LLM研究者和工程师必须面对的挑战。本文将深入剖析 llm-from-scratch 仓库中 parallel 目录的实现原理,揭秘如何从
阅读全文
posted @ 2025-11-17 22:51 fangpin
阅读(59)
评论(0)
推荐(0)
从0到1:揭秘LLM预训练前的海量数据清洗全流程
摘要: 读完这篇文章,你将用监督微调(SFT)把一个 1.5B 规模的数学模型在 GSM8K 上的零样本推理正确率从 1.56% → 62.9%,同时把输出格式遵循率从 18.9% → 100%。我们将完整走通数据集下载、Prompt 架构、训练配置和评估方法,所有代码均来自本仓库 alignment 文件
阅读全文
posted @ 2025-11-17 22:46 fangpin
阅读(55)
评论(0)
推荐(0)
深入解析:使用 Triton 实现 Flash Attention2 - 让大模型训练飞起来
摘要: 引言 你是否曾经在训练大型语言模型时,眼睁睁地看着 GPU 内存不断飙升,最终因为 OOM(Out of Memory)错误而前功尽弃?或者在处理长序列时,发现注意力机制的计算时间呈平方级增长,让人望而却步? 如果你有过这样的经历,那么今天这篇文章将为你带来一个革命性的解决方案:Flash Atte
阅读全文
posted @ 2025-11-17 22:34 fangpin
阅读(227)
评论(0)
推荐(0)
下一页
公告