• 博客园logo
  • 会员
  • 周边
  • 新闻
  • 博问
  • 闪存
  • 赞助商
  • Chat2DB
    • 搜索
      所有博客
    • 搜索
      当前博客
  • 写随笔 我的博客 短消息 简洁模式
    用户头像
    我的博客 我的园子 账号设置 会员中心 简洁模式 ... 退出登录
    注册 登录

security-hyacinth

  • 博客园
  • 联系
  • 订阅
  • 管理

公告

上一页 1 ··· 23 24 25 26 27 28 29 30 31 ··· 36 下一页

2026年1月19日

11. 推理工程师职责:系统架构设计

摘要: 作者:HOS(安全风信子) 日期:2026-01-18 来源平台:GitHub 摘要: 2026年,系统架构设计是推理工程师的核心职责之一,直接影响到大模型推理系统的性能、可靠性和可扩展性。本文深入拆解了推理工程师在系统架构设计中的角色和职责,包括端到端架构规划、vLLM Scheduler定制、U 阅读全文

posted @ 2026-01-19 10:20 安全风信子 阅读(12) 评论(0) 推荐(0)

10. vLLM vs LMDeploy:部署差异与迁移指南

摘要: 作者:HOS(安全风信子) 日期:2026-01-17 来源平台:GitHub 摘要: 2026年,vLLM和LMDeploy成为推理框架领域的两大重要选择,分别代表了分布式支持和轻量部署两种不同的设计理念。本文深入剖析了vLLM与LMDeploy的部署差异,包括LMDeploy的轻量部署特点和vL 阅读全文

posted @ 2026-01-19 10:20 安全风信子 阅读(29) 评论(0) 推荐(0)

OpenBot 操作指南:从入门到二次开发的完整实践

摘要: 作者:HOS(安全风信子) 日期:2026-01-19 来源平台:GitHub 摘要: 本文详细介绍了OpenBot开源机器人项目的完整操作流程,从硬件准备、软件安装到部署调试,再到二次开发。OpenBot利用智能手机作为核心处理器和传感器系统,结合低成本小车底盘,实现物体跟踪、自主导航、避障等高级 阅读全文

posted @ 2026-01-19 10:07 安全风信子 阅读(226) 评论(0) 推荐(0)

2026年1月18日

手语智能识别方案设计:基于 RAG + MCP + YOLO + Agent 的小而美工程实践

摘要: 作者:HOS(安全风信子) 日期:2026-01-17 来源平台:GitHub 摘要: 在手语识别领域,端到端大模型方案因部署复杂、训练门槛高、扩展性差等问题难以落地。本文提出一种坚持"小而美"原则的模块化方案,基于RAG(检索增强生成)、MCP(模块控制平面)、YOLO(视觉检测)和Agent(智 阅读全文

posted @ 2026-01-18 08:40 安全风信子 阅读(91) 评论(0) 推荐(0)

9. vLLM vs SGLang:脚本化推理与生产级批处理的对决

摘要: 作者:HOS(安全风信子) 日期:2026-01-17 来源平台:GitHub 摘要: 2026年,vLLM和SGLang成为推理框架领域的两大新兴力量,分别代表了生产级批处理和脚本化推理两种不同的设计理念。本文深入对比了vLLM与SGLang的优劣,包括vLLM的生产级批处理优势和SGLang的脚 阅读全文

posted @ 2026-01-18 08:39 安全风信子 阅读(306) 评论(0) 推荐(0)

8. vLLM vs TensorRT-LLM

摘要: 作者:HOS(安全风信子) 日期:2026-01-17 来源平台:GitHub 摘要: 2026年,vLLM和TensorRT-LLM是NVIDIA生态中最主流的两大推理框架。本文深入对比了vLLM与TensorRT-LLM的优劣,包括vLLM的灵活调度优势和TensorRT-LLM的Kernel级 阅读全文

posted @ 2026-01-18 08:38 安全风信子 阅读(129) 评论(0) 推荐(0)

7. 为什么云厂商集体选择 vLLM

摘要: 作者:HOS(安全风信子) 日期:2026-01-17 来源平台:GitHub 摘要: 2026年,AWS、阿里云、字节跳动等全球顶级云厂商纷纷选择vLLM作为其大模型推理的核心框架。本文深入分析了云厂商集体选择vLLM的原因,包括高吞吐与低延迟的完美兼容、开源生态优势、自定义Kernel支持以及与 阅读全文

posted @ 2026-01-18 08:37 安全风信子 阅读(29) 评论(0) 推荐(0)

6. PagedAttention 的历史背景

摘要: 作者:HOS(安全风信子) 日期:2026-01-17 来源平台:GitHub 摘要: PagedAttention技术是vLLM的核心创新,它借鉴了操作系统中的虚拟内存分页管理思想,革命性地解决了大模型推理中的显存碎片化问题。本文追溯了PagedAttention的起源与演进,从2023年的初始版 阅读全文

posted @ 2026-01-18 08:36 安全风信子 阅读(50) 评论(0) 推荐(0)

5. vLLM 出现前的推理地狱

摘要: 作者:HOS(安全风信子) 日期:2026-01-17 来源平台:GitHub 摘要: 2023年vLLM出现之前,大模型推理面临着显存碎片化、低效调度和高延迟等诸多挑战,被称为"推理地狱"。本文通过回顾pre-vLLM时代的痛点,深入分析了静态批处理导致的延迟爆炸、早期Hugging Face推理 阅读全文

posted @ 2026-01-18 08:36 安全风信子 阅读(20) 评论(0) 推荐(0)

4. 为什么 Triton 不够了

摘要: 作者:HOS(安全风信子) 日期:2026-01-17 来源平台:GitHub 摘要: 2026年,随着大模型规模和复杂度的急剧增长,传统推理框架Triton Inference Server在处理现代推理场景时逐渐显现出局限性。本文深入剖析了Triton在动态批处理、MoE模型支持和分布式架构等方 阅读全文

posted @ 2026-01-18 08:35 安全风信子 阅读(60) 评论(0) 推荐(0)

上一页 1 ··· 23 24 25 26 27 28 29 30 31 ··· 36 下一页
 
博客园  ©  2004-2026
浙公网安备 33010602011771号 浙ICP备2021040463号-3