2026年9月8日

kv-cache 的优化学习

摘要: 背景 多头注意力(Multi-Head Attention)的核心原因是:单头注意力一次只能形成一种“关注模式”,而真实序列中往往同时存在多种不同的关系需要捕捉。 1. 单头注意力的局限 在单头注意力中,对于同一个 Query,模型只会产生一个注意力权重分布: 这意味着它只能表达一种“平均”的注意力 阅读全文

posted @ 2026-09-08 17:16 zhangkele 阅读(5) 评论(0) 推荐(0)

2026年9月3日

深入理解FlashAttention之Softmax 再学习

摘要: 1 阅读全文

posted @ 2026-09-03 03:09 zhangkele 阅读(4) 评论(0) 推荐(0)

2026年9月1日

FlashAttention 学习理解巩固

摘要: 概念简单区分review: FlashAttention:优化的是注意力计算本身,通过分块计算避免存储完整的注意力矩阵,降低显存占用并加速计算。核心解决的是 O(N²) 显存和 HBM 带宽瓶颈。 PagedAttention:优化的是推理时的 KV cache 内存管理,灵感来自操作系统的虚拟内存 阅读全文

posted @ 2026-09-01 10:29 zhangkele 阅读(10) 评论(0) 推荐(0)

2026年8月31日

Colab可直接从github打开Jupyter notebooks

摘要: Colab可直接从github打开Jupyter notebooks,只需将“http:// github.com/”替换为“https://colab.research.google.com/github/”,就会直接加载到Colab中。 阅读全文

posted @ 2026-08-31 17:46 zhangkele 阅读(8) 评论(0) 推荐(0)

CUDA Graph 在大模型在线推理中的学习与应用

摘要: 一、为什么需要 CUDA Graph? 在大模型学习推理中,尤其是在线服务场景下,低延迟和高吞吐是关键指标。一个模型的前向计算通常会被分解成许多细粒度的 GPU 内核(kernel),例如矩阵乘法、激活函数、归一化等。 每个内核的启动都需要 CPU 向 GPU 发送一个命令,这个过程称为 CPU l 阅读全文

posted @ 2026-08-31 15:38 zhangkele 阅读(15) 评论(0) 推荐(0)

2026年8月26日

大模型在线推理优化方法学习

摘要: 在线推理(Online Serving)和离线推理不同,核心关注 TTFT(首 Token 延迟)、TPOT(每 Token 延迟)、吞吐、并发数、显存占用、SLO 达成率。 优化手段一般有下面几个层面 1. 模型层优化:让模型本身更“轻” 1.1 量化 权重量化:FP16 → INT8 / FP8 阅读全文

posted @ 2026-08-26 15:15 zhangkele 阅读(23) 评论(0) 推荐(0)

2026年8月25日

大模型GPU在线推理中重要的默认优化思路-算子融合

摘要: 如 QKV 线性层融合、Attention 中的 Softmax + 缩放 + Mask 融合、残差连接与 LayerNorm 融合; 为什么需要融合?做了些什么呢?怎么融合的呢? 为了彻底理解算子融合,不要把它当成抽象的概念,而是看成“减少 GPU 显存搬运次数”的优化手段。 GPU 的计算速度极 阅读全文

posted @ 2026-08-25 17:12 zhangkele 阅读(27) 评论(0) 推荐(0)

2026年3月10日

vLLM 批处理机制详解:静态批处理 vs 连续批处理

摘要: vLLM 批处理机制详解:静态批处理 vs 连续批处理 一、静态批处理(Static Batching) ┌─────────────────────────────────────────────────────────────────┐ │ 静态批处理流程 │ └──────────────── 阅读全文

posted @ 2026-03-10 11:07 zhangkele 阅读(259) 评论(0) 推荐(0)

2026年3月5日

连续批处理html展示其原理用浏览器打开

摘要: <!DOCTYPE html> <html lang="zh-CN"> <head> <meta charset="UTF-8"> <title>vLLM: 连续批处理 vs 静态批处理</title> <style> * { box-sizing: border-box; margin: 0; p 阅读全文

posted @ 2026-03-05 16:00 zhangkele 阅读(24) 评论(0) 推荐(0)

2026年1月26日

Self-Attention 学习

摘要: 深入剖析Self-Attention中最核心、最关键的数学操作:Q, K, V矩阵运算。现代所有大语言模型基础架构的基石。 核心比喻:信息检索系统 想象一个高度智能的图书馆: 你(Query):带着一个明确的问题走进图书馆,比如“我想找关于人工智能伦理的哲学论述”。 书籍的索引卡(Key):每本书都 阅读全文

posted @ 2026-01-26 16:21 zhangkele 阅读(99) 评论(0) 推荐(0)

导航