会员
周边
新闻
博问
闪存
赞助商
Chat2DB
所有博客
当前博客
我的博客
我的园子
账号设置
会员中心
简洁模式
...
退出登录
注册
登录
$\mathit{AlphaINF}$
跑得快,不一定赢;稳如老狗,才能长久。
博客园
首页
新随笔
联系
管理
1
2
3
4
5
···
14
下一页
2026年8月27日
海光K100_AI的VLLM十二倍提速小记(Qwen3.5架构)
摘要: 遇到了啥问题 笔者使用海光的镜像跑vllm(harbor.sourcefind.cn:5443/dcu/admin/base/vllm:0.18.1-ubuntu22.04-dtk26.04-py3.10),对应的模型是qwen3.5-27b和qwen3.5-4b,发现他们能跑,也有正确性保障,但是
阅读全文
posted @ 2026-08-27 14:21 AlphaInf
阅读(76)
评论(0)
推荐(2)
2026年8月22日
海光DCU计算卡适配小记
摘要: 写在前面 本文会记录一些适配海光DCU卡的一些坑,会写一些基础的掉卡分析,升级固件以及升级驱动的一些trick 本文仅在K100-AI上进行测试 关于掉卡的分析 海光卡的耐温比Nvidia的差劲的多,而且似乎没啥降频的保护,因此一旦温度高于80°就容易掉卡,需要确保后面的被动散热风扇提供足够的风量
阅读全文
posted @ 2026-08-22 17:51 AlphaInf
阅读(59)
评论(0)
推荐(2)
2026年3月23日
lxd以及内网穿透相关小记
摘要: 写在前面 本文会记录lxd安装后,如何配置虚拟机可以执行ssh,以及执行nat转发。 执行NAT转发 我们假设当前虚拟机在102.107这个IP上,然后我们需要虚拟化出十个IP,这十个IP是102.170到102.179,那么可以采用如下的方法进行配置。 1. 配置netplan,把宿主机设置成这样
阅读全文
posted @ 2026-03-23 16:46 AlphaInf
阅读(67)
评论(4)
推荐(4)
2026年1月16日
本地化文档工具Outline的部署和使用
摘要: 本地化OutLine部署小记 写在前面 最近在研究有什么好用的在线云文档工具,而且要能够本地化部署的。 经过了一系列的研究,最终选用了这个outline。 但是,官方的文档十分地不友好,需要做的配置项过多,包括但不限于: 官方的docker-compose没法直接拉起来用。 其本身并没有用户管理的系
阅读全文
posted @ 2026-01-16 18:51 AlphaInf
阅读(1352)
评论(1)
推荐(7)
2025年9月3日
关于磁盘对拷的一系列trick
摘要: 关于LVM分区 LVM分区有一大好处,可以随意地进行大小的扩大或减小,这对于大量使用磁盘对拷机的情形下十分有利(从一个小磁盘拷贝到一个大磁盘,然后再扩大物理磁盘的大小) 但是,LVM分区结构较为复杂,有若干层的虚拟,故设置起来比一般的分区要复杂。 如何缩小物理分区的大小 部分对拷机会跳过为空的扇区,
阅读全文
posted @ 2025-09-03 17:11 AlphaInf
阅读(93)
评论(0)
推荐(3)
2025年8月26日
关于大模型系统吞吐量计算的方法
摘要: 基本概念及计算公式 flops:指完成该任务所需的总和浮点计算次数 对于一个transformer架构的模型而言,使用改一个参数量为m的模型,计算n个token所需的算力flops通常可以近似为\(2 \times m \times n\)。其中常数2由一次乘法和一次加法分别贡献。 具体细节可见下文
阅读全文
posted @ 2025-08-26 19:31 AlphaInf
阅读(1463)
评论(0)
推荐(4)
2024年6月15日
git submodule小记
摘要: 这是一篇记录git submodule中存在的坑的文档 引用一个模块的命令 git submodule add http://your-submodule-url.com/ local/path 这个命令可以将一个子模块添加到当前的主仓库中(注意,这样添加的是最新版的) 运行该命令的路径,为主仓库的
阅读全文
posted @ 2024-06-15 21:07 AlphaInf
阅读(207)
评论(0)
推荐(3)
2024年6月2日
给vllm添加热添加lora的功能
摘要: 写在前面 原生vllm并不支持热添加lora,但是考虑到微调机微调后,需要在不停机的情况下传递lora,于是我们需要增加一个逻辑 修改VLLM包中的vllm/entrypoints/openai/api_server 1 from pydantic import Bas 2 3 class AddL
阅读全文
posted @ 2024-06-02 15:21 AlphaInf
阅读(1139)
评论(0)
推荐(10)
2024年2月2日
基于Deepspeed实现LLaMA-13B或70B模型的微调
摘要: 写在前面 事实证明,在部分情况下,依然有开启deepspeed的必要性 这是上一篇文章,讲述使用双卡/8卡3090微调llama2-70B/13B模型 - AlphaInf - 博客园 (cnblogs.com) 但这一篇文章,存在下面的几个问题: 如果训练的数据的seq_len过长,那么很有可能出
阅读全文
posted @ 2024-02-02 19:00 AlphaInf
阅读(8586)
评论(2)
推荐(84)
基于vllm 0.3.0部署 llama2-70B模型
摘要: 写在前面 VLLM框架升级了! 0.3.0版本,拥有更高的推理速度(实测解析input的速度+40%),支持S-LoRA(一个主模型外套多个LoRA模型),很值得升级。 本篇文章将会记录升级过程中遇到的坑爹事情 硬件环境 主板:PCIE 4.0 x16 GPU:8x 3090 内存: DDR4 76
阅读全文
posted @ 2024-02-02 01:30 AlphaInf
阅读(2352)
评论(0)
推荐(27)
2023年12月23日
基于TigerBot-13b训练其函数调用能力
摘要: 写在前面 原生的tigerbot似乎并不支持函数调用,于是我来支持一下 数据集 我在huggingface上找了个英文的数据集 https://huggingface.co/datasets/sadmoseby/sample-function-call 这里面包含了1k组的函数调用,这个数据集的特点
阅读全文
posted @ 2023-12-23 16:01 AlphaInf
阅读(242)
评论(0)
推荐(6)
2023年12月10日
使用双卡/8卡3090微调llama2-70B/13B模型
摘要: 写在前面 本篇博文将会教大家如何在消费级的设备(或者各种超级便宜的洋垃圾上)实现13B/70B等无法在单张消费级显卡上加载(但可以在一台机器上的多张卡上加载)的模型的微调。 由于绝大部分做实验,仅要求实现推理,或者在微调时没有资源上到全量/13B+级别的真·大模型的微调,没有涉及到将一个模型放在多张
阅读全文
posted @ 2023-12-10 14:26 AlphaInf
阅读(16574)
评论(4)
推荐(153)
2023年12月7日
8卡3090GPU云服务器上采用VLLM部署中文llama2-70b模型及OpenAI格式接口
摘要: TigerBot-70b-4k-v4 推理部署 模型本地部署(基于HuggingFace) 根据实际测试,加载模型需要约129G显存,最低需要6张3090显卡(流水线并行) 如果使用vllm进行加速推理(张量并行),考虑8张3090显卡或者4张A100-40G(模型分割要求) 模型下载 截至目前,模
阅读全文
posted @ 2023-12-07 21:44 AlphaInf
阅读(11246)
评论(3)
推荐(116)
2023年9月14日
Llama2模型预训练,推理与微调测试
摘要: 官方环境要求(推理、微调): 本次部署使用单卡A100-40G显卡。 部署 虚拟环境创建: conda create -n test python=3.10.9 conda activate test #启动虚拟环境 拉取 Llama2-Chinese git clone https://githu
阅读全文
posted @ 2023-09-14 18:07 AlphaInf
阅读(3127)
评论(0)
推荐(52)
GLM-130B 部署 - 8*3090-24G
摘要: 官方文档 镜像要求A100-40G-8卡 硬件配置: 软件配置: 1.准备 由于恒源云暂时缺少硬件资源,此次部署使用8*3090-24G配置(需要量化int8): 注意镜像选择,pytorch版本选择1.13,不要选择2.0,2.0会产生不兼容的情况。 同时需要注意扩容,否则模型存放不够空间 创建实
阅读全文
posted @ 2023-09-14 17:52 AlphaInf
阅读(747)
评论(0)
推荐(14)
OpenBuddy-LLaMA2-70B的三种部署方式
摘要: 根据实际测试,加载模型需要130G显存,最低需要4张A100*40G显卡。 1.基于Transformers库推理: 首先安装最新版本的transformers: git clone https://github.com/huggingface/transformers.git cd transfo
阅读全文
posted @ 2023-09-14 17:33 AlphaInf
阅读(4739)
评论(1)
推荐(50)
2023年6月11日
强化学习及过程监督学习笔记
摘要: 写在前面 笔者将在这篇文章中,写下有关过程监督,反馈对齐,奖励模型,和数据构造相关的论文的笔记。 论文主要来自Openai的论文。 问题坑 奖励模型是如何输出精确的标记的?在解决方案的每个标记后做出标量预测(具体细节?)。 预训练是怎么把知识注入进模型的,然后如何激活出这些知识 论文挖坑列表 基于过
阅读全文
posted @ 2023-06-11 23:31 AlphaInf
阅读(841)
评论(0)
推荐(12)
基于80C51单片机的出租车计费器设计
摘要: 写在前面 本文将详细讲解如何在Proteus中,使用80C51单片机,编写汇编程序,实现出租车计费器,实现实时速度显示,行使里程统计及费用统计,以及自动的清零。 该题包含两个输入和三个输出,其中一个输入是车轮转动的更新信号,每更新一次代表车轮转了一圈,另一个输入信号是费用计费/清零输入按钮。而输出是
阅读全文
posted @ 2023-06-11 12:31 AlphaInf
阅读(695)
评论(1)
推荐(16)
2023年5月6日
chatglm-6b云端微调
摘要: 下载依赖 pip install rouge_chinese nltk jieba datasets 下载训练数据集(示例) ADGEN 数据集任务为根据输入(content)生成一段广告词(summary)。 { "content": "类型#上衣*版型#宽松*版型#显瘦*图案#线条*衣样式#衬衫
阅读全文
posted @ 2023-05-06 10:05 AlphaInf
阅读(454)
评论(0)
推荐(10)
chatglm-6b法律名词数据训练
摘要: 整体流程于上一份微调文件基本一致,此份是详细备份及关键说明: 1.处理文件 处理好法律名词解释为json文件的格式,其中prompt column为 content,response column 为summary,如下: (如果KEY不是content-summary的形式,也可修改train.s
阅读全文
posted @ 2023-05-06 09:58 AlphaInf
阅读(1631)
评论(0)
推荐(22)
1
2
3
4
5
···
14
下一页
公告