会员
周边
新闻
博问
闪存
赞助商
Chat2DB
所有博客
当前博客
我的博客
我的园子
账号设置
会员中心
简洁模式
...
退出登录
注册
登录
moyubuhuang
博客园
首页
新随笔
联系
订阅
管理
2026年8月12日
从 FP32 到 INT4:基于 GPTQ 的大模型量化实战——以 Llama-2-7B 为例
摘要: 💡 本文完整记录一次真实的模型量化实验:从 28GB 显存需求压缩到 6GB 可运行,精度损失 < 2%。配套代码全部实测可跑,覆盖环境配置、量化执行、效果评测、推理部署全流程。 为什么需要模型量化 做大模型落地的人,迟早会撞上同一堵墙:显存不够。 精度 Llama-2-7B 参数量 理论显存
阅读全文
posted @ 2026-08-12 11:49 moyubuhuang
阅读(2)
评论(0)
推荐(0)
2026年8月11日
生产级实战:基于Redis Lua的分布式幂等框架设计与实现1
摘要: 一、痛点分析:为什么你的接口不安全? 在支付、下单、账务核心链路中,我们常遇到: 用户重复提交:前端防抖失效,用户连续点击“支付”按钮。 超时重试:HTTP/RPC 客户端设置了超时重试机制(如 Feign Retry)。 消息队列重复消费:Kafka 的 Rebalance 或 RocketM
阅读全文
posted @ 2026-08-11 19:17 moyubuhuang
阅读(2)
评论(0)
推荐(0)
公告