• 博客园logo
  • 会员
  • 周边
  • 新闻
  • 博问
  • 闪存
  • 赞助商
  • Chat2DB
    • 搜索
      所有博客
    • 搜索
      当前博客
  • 写随笔 我的博客 短消息 简洁模式
    用户头像
    我的博客 我的园子 账号设置 会员中心 简洁模式 ... 退出登录
    注册 登录

security-hyacinth

  • 博客园
  • 联系
  • 订阅
  • 管理

公告

上一页 1 ··· 20 21 22 23 24 25 26 27 28 ··· 36 下一页

2026年1月25日

39. CPU/GPU 协同:vLLM的异构计算架构深度解析

摘要: 作者:HOS(安全风信子) 日期:2026-01-19 来源平台:GitHub 摘要: 本文深入剖析vLLM框架中CPU/GPU协同计算的核心机制,重点探讨异构计算架构、异步数据传输和Pinned内存优化三大关键技术。通过分析vLLM如何实现CPU预处理与GPU推理的高效协同、异步数据传输的设计与实 阅读全文

posted @ 2026-01-25 15:34 安全风信子 阅读(45) 评论(0) 推荐(0)

38. GPU 显存碎片问题如何解决:vLLM的碎片管理技术深度解析

摘要: 作者:HOS(安全风信子) 日期:2026-01-19 来源平台:GitHub 摘要: 本文深入剖析GPU显存碎片问题的成因、影响及解决方案,重点探讨vLLM框架中采用的显存碎片管理技术。通过分析cuMem监控工具的使用、H100环境下的碎片问题复盘以及预分配策略的实现,结合真实源码示例和性能数据, 阅读全文

posted @ 2026-01-25 15:33 安全风信子 阅读(42) 评论(0) 推荐(0)

37. Paged KVCache 内存模型:虚拟页映射与CUDA内存池深度解析

摘要: 作者:HOS(安全风信子) 日期:2026-01-19 来源平台:GitHub 摘要: 本文深入剖析vLLM中Paged KVCache内存模型的设计原理与实现细节,探讨虚拟页映射机制如何解决大模型推理中的显存瓶颈问题。通过分析CUDA内存池的实现、页故障处理机制和Hybrid Cache扩展,结合 阅读全文

posted @ 2026-01-25 15:33 安全风信子 阅读(55) 评论(0) 推荐(0)

36. Block Manager 设计:Paged KVCache 内存块管理深度解析

摘要: 作者:HOS(安全风信子) 日期:2026-01-19 来源平台:GitHub 摘要: 本文深入剖析vLLM中Block Manager的设计原理与实现细节,探讨其在Paged KVCache管理中的核心作用。通过分析块分配算法、LRU驱逐策略和碎片最小化技术,结合真实源码示例和性能数据,揭示Blo 阅读全文

posted @ 2026-01-25 15:32 安全风信子 阅读(33) 评论(0) 推荐(0)

Azure 中国(世纪互联版)注册与开通指南:从零到部署的完整路径

摘要: 作者:HOS(安全风信子) 日期:2026-01-25 来源平台:GitHub 摘要: 本文深入解析Azure中国(世纪互联运营)的注册与开通流程,揭示其与全球Azure的核心差异。通过详细的步骤分解、实际操作案例和常见问题解决方案,帮助读者快速完成Azure中国账号注册与订阅开通,并掌握后续的账号 阅读全文

posted @ 2026-01-25 15:19 安全风信子 阅读(587) 评论(0) 推荐(0)

2026年1月23日

35. Continuous Batching

摘要: 作者:HOS(安全风信子) 日期:2026-01-19 来源平台:GitHub 摘要: 2026年,Continuous Batching已成为大模型推理系统的核心优化技术。本文深入剖析vLLM中Continuous Batching的核心原理,包括非静态批次构建、动态Token生成、内存优化等。通 阅读全文

posted @ 2026-01-23 14:40 安全风信子 阅读(61) 评论(0) 推荐(0)

34. Token 级调度原理

摘要: 作者:HOS(安全风信子) 日期:2026-01-19 来源平台:GitHub 摘要: 2026年,Token级调度已成为大模型推理系统性能突破的关键技术。本文深入剖析vLLM中Token级调度的核心原理,包括动态Token插入机制、Block级分配策略、上下文切换优化等。通过Mermaid流程图、 阅读全文

posted @ 2026-01-23 14:39 安全风信子 阅读(49) 评论(0) 推荐(0)

33. Request 生命周期

摘要: 作者:HOS(安全风信子) 日期:2026-01-19 来源平台:GitHub 摘要: 2026年,vLLM的Request生命周期管理已成为大模型推理系统可靠性和性能的关键保障。本文深入剖析vLLM中Request的完整生命周期,包括接收、预处理、调度、执行、后处理和响应等核心阶段。通过Merma 阅读全文

posted @ 2026-01-23 14:38 安全风信子 阅读(25) 评论(0) 推荐(0)

32. Scheduler 设计思想

摘要: 作者:HOS(安全风信子) 日期:2026-01-19 来源平台:GitHub 摘要: 2026年,vLLM的Scheduler已成为大模型推理调度领域的标杆设计。本文深入剖析vLLM Scheduler的设计思想,包括分层调度架构、Continuous Batching核心算法、动态批大小调整和预 阅读全文

posted @ 2026-01-23 14:37 安全风信子 阅读(59) 评论(0) 推荐(0)

31. vLLM 总体架构图(Execution Engine)

摘要: 作者:HOS(安全风信子) 日期:2026-01-19 来源平台:GitHub 摘要: 2026年,vLLM已成为大模型推理领域的核心框架,其执行引擎(Execution Engine)是实现高性能推理的关键。本文深入剖析vLLM执行引擎的总体架构,包括核心组件、数据流、调度机制和最新优化。通过Me 阅读全文

posted @ 2026-01-23 14:36 安全风信子 阅读(115) 评论(0) 推荐(0)

上一页 1 ··· 20 21 22 23 24 25 26 27 28 ··· 36 下一页
 
博客园  ©  2004-2026
浙公网安备 33010602011771号 浙ICP备2021040463号-3