摘要:
本文已于 2026.04.11 发表于公众号和知乎 1. 权重加载要解决什么问题? 在阅读 vLLM 的权重加载实现之前,先理解它要解决的核心问题。 大模型的权重通常以 checkpoint 文件的形式存储在磁盘上。权重加载的任务就是:把这些文件中的张量,正确地填入模型(推理代码)的每一个参数中。这 阅读全文
posted @ 2026-04-11 17:35
-银光-
阅读(262)
评论(0)
推荐(0)
摘要:
本文已于 2026.02.23 发表于公众号和知乎 1. 背景 mini-sglang 不仅实现了大模型推理的核心功能,更在架构设计上体现出工业级推理引擎的关键特征 —— 多进程架构支撑、功能模块高内聚拆分、关键节点可扩展设计。基于这一架构叠加新功能时,效率和稳定性优势将非常显著。因此,mini-s 阅读全文
posted @ 2026-04-11 17:08
-银光-
阅读(240)
评论(0)
推荐(0)
摘要:
本文已于 2026.01.14 发表于公众号和知乎 1. 简介 面向对象设计(OOP)是传统后台开发领域非常主流的设计思想,但在大模型推理领域,极致的性能往往藏在 DOD(面向数据)的细节里。 本文通过对 mini-sglang 项目 _make_2d_indices 函数的迭代优化,展示了如何通过 阅读全文
posted @ 2026-04-11 16:56
-银光-
阅读(30)
评论(0)
推荐(0)
摘要:
本文已于 2026.01.12 发表于公众号和知乎 1. 背景 Overlap Scheduling 是大模型推理加速的重要手段。从应用视角来说:Overlap Scheduling 适用于有高 QPS 压力的场景,吞吐和 TTFT 通常会更好。如果是低 QPS 的场景,输入压力有限,Overlap 阅读全文
posted @ 2026-04-11 16:51
-银光-
阅读(107)
评论(0)
推荐(0)
浙公网安备 33010602011771号