摘要:
推理阶段是大模型「服务化」和「产品化」的关键环节,并且推理通常是实时的、在线的,对延迟、吞吐量和资源消耗有较高要求。大模型的部署和应用过程中,通常需要很高的计算成本,内存访问和存储占用成本,在资源受限的场景中,推理效率也会大幅降低(如延迟、吞吐量,功耗和存储等问题),以致于严重影响大模型服务的可用性 阅读全文
posted @ 2026-06-08 14:29
Adara
阅读(5)
评论(0)
推荐(0)
摘要:
微调: LoRA 与QLoRA:有何区别 LoRA(低秩自适应)和 QLoRA(量化低秩自适应)技术均可用于训练 AI 模型。更具体地说,它们都属于参数高效微调(PEFT),这种微调技术比训练大语言模型(LLM)所用的其他方法更节省资源,因此广受欢迎。 LoRA 的工作原理: LoRA 技术使用新参 阅读全文
posted @ 2026-06-08 14:20
Adara
阅读(7)
评论(0)
推荐(0)

浙公网安备 33010602011771号