会员
周边
新闻
博问
闪存
赞助商
Chat2DB
所有博客
当前博客
我的博客
我的园子
账号设置
会员中心
简洁模式
...
退出登录
注册
登录
zhaojiew10学习记录
博客园
首页
新随笔
联系
订阅
管理
2026年7月15日
Understanding LoRA: Low-Rank Adaptation for Fine-Tuning
摘要: Refer from AI Engineering: Customizing LLMs for Business (Fine-Tuning LLMs with QLoRA & AWS),https://zerotomastery.io/courses/learn-fine-tuning-llms 1
阅读全文
posted @ 2026-07-15 11:34 zhaojie10
阅读(13)
评论(0)
推荐(0)
2026年7月12日
当一块24G显卡遇上470亿参数模型:QLoRA微调的思考
摘要: 假如我们想微调一个7B模型来做客服助手,而手头的机器是一块RTX 4090要如何做呢?首先考虑下这个这个模型有多大——470亿参数。按FP16格式存,光权重就要94GB,进行全参数微调?模型还没加载完,显存就爆了。 微调模型的三座大山 罗列一下微调模型过程中,可能面临的困境: 显存限制。微调一个7B
阅读全文
posted @ 2026-07-12 15:51 zhaojie10
阅读(18)
评论(0)
推荐(0)
2026年7月10日
将 OCAI 接入 Kubernetes MCP Server 的实践
摘要: 在之前的 OCManager 系列文章中,我们已经逐步构建了完整的 AI 运维体系: 第一阶段:OCManager 控制台提供基础的运维操作界面(命令助手、任务编排) 第二阶:引入 OCAI,让 AI 能够"咨询"——回答运维问题、提供诊断建议 第三阶段:启用 ops-mate,让 AI 能够"动手
阅读全文
posted @ 2026-07-10 20:06 zhaojie10
阅读(16)
评论(0)
推荐(0)
给 OCManager 加上容器级监控:从 CRI 采集到前端展示的全链路开发
摘要: 上一篇把 OCManager 从控制平面部署、Agent 通过 SSM 批量下发到 EKS 节点、再到接入 OCAI 大模型跑通了。跑起来之后盯着监控面板看了几天,一个问题越来越明显:面板上只有主机级指标——某个 EKS 节点 CPU 80%,我知道是这台机器忙,但到底是哪个 Pod、哪个容器在吃
阅读全文
posted @ 2026-07-10 12:01 zhaojie10
阅读(12)
评论(0)
推荐(0)
在 OCManager 中通过 OCAI 启用 ops-mate 打通 AI 诊断路径
摘要: 本文是《部署 OCManager 智能运维平台并集成 AI 服务实现 EKS 节点的监控和维护》的续篇。 前一篇我们完成了 OCManager 控制平面部署、ocm-agent 批量下发到 EKS 节点、以及 OCAI 的接入。但留下了一个遗憾:OCAI 只能"咨询",无法到节点上执行命令做诊断。本
阅读全文
posted @ 2026-07-10 11:09 zhaojie10
阅读(15)
评论(0)
推荐(0)
2026年7月9日
部署 OCManager 智能运维平台并集成 AI 服务实现EKS节点的监控和维护
摘要: 当你手上有几十上百台 Linux 服务器需要管理时,"逐台 SSH 登录、手动敲命令排查"很快就会变成灾难。OpenCloudOS 的 OCManager 正是为集中式运维而生的一套开源方案:一个 Web 控制台统管所有机器,每台被管主机上跑一个轻量 Agent 负责采集数据与执行指令,再叠加一个内
阅读全文
posted @ 2026-07-09 11:04 zhaojie10
阅读(30)
评论(0)
推荐(0)
在 AWS 中国区把 MLflow 模型端到端部署在 SageMaker
摘要: 机器学习项目里有一个反复出现的断层:模型在 notebook 里跑得好好的,一旦要"上线"提供推理服务,事情就复杂起来了。实验怎么管理、模型怎么版本化、训练好的工件放哪、推理服务又该怎么部署——每一环都有自己的工具和坑。MLflow + SageMaker 是解决这一断层的一套经典组合:MLflow
阅读全文
posted @ 2026-07-09 10:22 zhaojie10
阅读(7)
评论(0)
推荐(0)
2026年7月4日
自行实现 A2A 网关:从零理解 Agent 发现、路由与访问控制
摘要: 随着企业内部 AI Agent 数量的快速增长,一个新的工程难题浮出水面:这些 Agent 之间该如何通信?当你只有两三个 Agent 时,点对点直连似乎还能接受。但当 Agent 扩展到几十个,每新增一个都要处理独立的连接、独立的凭证、独立的路由逻辑时,复杂度就会爆炸。此外,访问控制分散在各处,安
阅读全文
posted @ 2026-07-04 02:37 zhaojie10
阅读(29)
评论(0)
推荐(0)
2026年6月28日
使用AWS Workload Credentials Provider在EKS中管理应用密钥的实践
摘要: 本文档完整记录了在中国区 EKS 集群上部署 AWS Workload Credentials Provider 的全过程。通过 Sidecar 模式,应用可以无感知地获取 AWS Secrets Manager 中的敏感配置,无需在代码中处理复杂的 AWS 认证逻辑。 在 Kubernetes 中
阅读全文
posted @ 2026-06-28 21:18 zhaojie10
阅读(18)
评论(0)
推荐(0)
在ParallelCluster 集群中通过 PyTorch DDP微调LLM模型的实践
摘要: 当大语言模型的训练从单张消费级显卡迈向企业级集群,我们进入了一个全新的技术维度。这不仅仅是硬件规模的扩张,更是架构思维的根本转变——如何在多台机器之间协调计算资源,如何在网络延迟与计算效率之间寻找平衡,如何在异构环境中保持代码的可移植性。本文记录的是一次完整的技术探索:在AWS中国区(cn-nort
阅读全文
posted @ 2026-06-28 14:39 zhaojie10
阅读(13)
评论(0)
推荐(0)
下一页
公告