摘要: LayerSkip: 使用自推测解码加速大模型推理 自推测解码是一种新颖的文本生成方法,它结合了推测解码 (Speculative Decoding) 的优势和大语言模型 (LLM) 的提前退出 (Early Exit) 机制。该方法出自论文 LayerSkip: Enabling Early-Exit Inference and Self-Spec 阅读全文
posted @ 2025-03-11 13:47 HuggingFace 阅读(357) 评论(0) 推荐(1)