摘要: 本教程基于llama.cpp实现大模型本地轻量化部署,适配RTX 5060 8GB显卡,选用轻量级的千问 2.5-1.5B 对话模型,通过 GPU 加速保证运行流畅,同时提供原生 Python 调用和LangChain 自定义封装调用两种方案,代码完全保留,仅优化部署说明与使用指引。 1.打开 Mo 阅读全文
posted @ 2026-04-30 13:34 lyshark 阅读(408) 评论(0) 推荐(0)