摘要:
本文基于 Ubuntu 22.04 服务器环境,依托 NVIDIA RTX 家用高性能显卡,手把手讲解 MiniMind 轻量大语言模型从零搭建、数据集部署、全流程训练、可视化Web服务搭建及GGUF格式量化的完整实操方案。全程摒弃复杂高阶封装,基于原生 PyTorch 实现,适配个人开发者、人工智能入门学习者低成本完成大模型训练全链路的需求,整套方案仅需极低算力与成本,3小时即可完成基础对话训练,完美适配新手入门大模型训练、模型私有化部署、及底层原理学习等场景,是一套低成本、可落地、可复现全流程实战教程。
阅读全文
posted @ 2026-08-31 22:11
lyshark
阅读(477)
推荐(0)
摘要:
大模型的网络文件是模型训练的核心参考。例如 MiniMind 项目中 `/model/model_minimind.py` 这份网络结构文件,它用来定义整套大模型的神经网络拓扑,包含配置参数、RMSNorm 归一化、GQA 注意力、RoPE 位置编码、Transformer 层、MoE 专家模块、因果语言模型输出头等全部网络组件。
在训练过程中,该文件会被训练脚本调用执行:完成输入 token 的前向计算、基础损失求取、MoE 路由辅助损失计算,输出 logits,结合标签计算交叉熵损失,为反向传播提供计算图,驱动模型权重参数更新,完成训练迭代。训练结束后,同一套网络代码可直接复用在推理阶段,加载训练完成的权重,实现文本续写与生成。
为快速验证网络实现是否存在代码缺陷、维度错误、模块兼容性问题,这里提供两个可独立运行的测试用例。执行测试用例能够对模型网络做基础完备性校验,自动输出模型运行状态报告,帮助开发者快速定位网络结构问题,可供用户参考与学习:
阅读全文
posted @ 2026-09-19 20:52
lyshark
阅读(6)
推荐(0)
摘要:
前文《基于 LlamaIndex 实现 RAG 向量检索入门》已完成本地大模型与 Embedding 向量检索的基础搭建,但仅支持临时向量存储,无法持久化复用。本文将在此基础上实现 RAG 持久化存储方案,借助 PostgreSQL + pgvector 向量插件对接 LlamaIndex。环境采用 CentOS Stream 10,演示数据库编译安装与插件配置,基于 VectorStoreRetriever 实现持久化向量检索,搭建可稳定复用的本地 RAG 服务。
阅读全文
posted @ 2026-09-18 15:20
lyshark
阅读(171)
推荐(0)
摘要:
本章将通过多个案例实现私有数据集检索功能,虽然 LangChain 也可以实现向量检索,但在企业级项目中,通常会选用 LlamaIndex 这类专门面向检索场景的框架。LlamaIndex 是 MIT 协议开源、以 RAG 为核心的大模型应用开发框架。它充当大模型与私有数据之间的中间层,能够接入 PDF、Word 等各类本地或内网文档,对原始数据构建索引,以此解决大模型无法读取私有资料、容易产生幻觉的问题,可用于搭建知识问答、AI 智能体等应用。
阅读全文
posted @ 2026-09-17 16:31
lyshark
阅读(140)
推荐(0)
摘要:
在大模型二次开发学习阶段,手写训练代码可以帮助我们吃透模型微调底层逻辑,做到知其然更知其所以然。但落地到企业生产环境,我们更追求标准化流程、高复用能力与稳定可靠的工程化方案。MS-Swift 作为阿里达摩院魔搭社区开源的一站式大模型开发框架,集成了模型训练、微调、推理、量化部署全链路能力,兼容数百款大主流模型与多种微调、对齐算法。本章我们就借助 MS-Swift 这类成熟工具,学习如何用标准化流程快速完成大模型二次训练,实现快速将模型能力深度集成进企业业务系统。
阅读全文
posted @ 2026-09-15 15:04
lyshark
阅读(167)
推荐(1)
摘要:
在大模型开发流程中,分词器(Tokenizers)是文本预处理的核心组件。神经网络无法直接理解人类的原始文本,分词器的核心作用,就是将自然语言转换为模型可用于计算的数值序列。Hugging Face Tokenizers 是底层由 Rust 编写的高性能开源分词库,原生支持 BPE、WordPiece、Unigram 等多种分词算法,内置批量处理、padding、truncate 等能力,可适配绝大多数开源大模型。本文将编写分词器训练脚本,基于高质量语料,参考 Qwen3 分词器的设计思路,从零训练一套自定义分词词典,为后续自研大模型的训练搭建词典基座。
阅读全文
posted @ 2026-09-12 14:35
lyshark
阅读(200)
推荐(1)
摘要:
企业内部私有环境部署大模型推理集群时,很容易遇到流量调度混乱、节点负载失衡、会话上下文丢失、接口缺少鉴权防护等一系列问题,单 vLLM 推理节点难以支撑并发请求。本文基于 Ubuntu 22.04 系统环境,搭建 Nginx + vLLM-Semantic-Router + vLLM-Router + vLLM Node 多层推理集群。全文从环境准备、模型拉取、组件分步部署、Nginx SSE 流式反向代理,一直到接口联调验证,完整记录一套可直接复现的落地方案。
阅读全文
posted @ 2026-09-11 10:56
lyshark
阅读(332)
推荐(1)
摘要:
LLaMA Factory 是一款开源、低代码、一站式大语言与多模态模型微调框架,用于降低大模型的微调落地门槛。框架兼容 Qwen、LLaMA、ChatGLM、LLaVA 等上百款主流开源模型,支持增量预训练、SFT 监督微调、DPO、KTO、ORPO 等多种训练对齐方案,原生集成 LoRA、QLoRA 量化微调技术,可在消费级显卡完成轻量级模型微调。框架支持可视化网页端和命令行双操作模式,完整覆盖模型训练、评估、权重合并、推理部署全流程,适配科研实验、行业轻量化模型定制等场景。
阅读全文
posted @ 2026-09-10 10:57
lyshark
阅读(236)
推荐(1)
摘要:
大模型微调是实现模型领域定制的核心方案,本文承接《千问大模型二次 LoRA‑SFT 指令微调指南》部分内容,聚焦 Qwen3.5‑Base 纯文本基座全参数微调,完整复现 ChatGPT 风格 RLHF 对齐工程链路,覆盖数据预处理、SFT 监督微调、RM 奖励模型训练、PPO 强化学习、DPO 直接偏好优化全实验流程,提供可直接运行的工程脚本,帮助开发者完成千问小模型的垂直领域轻量化定制,为后续模型推理、业务上线部署提供完整实践参考。
阅读全文
posted @ 2026-09-08 15:05
lyshark
阅读(191)
推荐(1)
摘要:
大模型微调是实现模型领域定制的核心方案。本文基于 Ubuntu 22.04 服务器环境,依托 NVIDIA RTX 家用高性能显卡,选用千问 Qwen3.5‑0.8B‑Instruct 指令模型,完整演示二次 LoRA‑SFT 微调全流程,包含环境搭建、模型选型、ChatML 数据集制作校验、LoRA 参数配置、SFT 训练、效果验证、权重合并,附带可直接运行的工程脚本,便于开发者快速实现千问模型轻量化定制与上线部署。
阅读全文
posted @ 2026-09-06 18:30
lyshark
阅读(152)
推荐(2)
摘要:
本文将教大家在Ubuntu系统中,从零完成Ollama本地大模型部署与Open-WebUI可视化网页配置,全程采用虚拟环境隔离依赖、配置系统自启服务,最终搭建可远程访问的本地AI交互网页,无需联网调用、运行稳定、适配CPU及GPU本地部署场景,新手可直接复刻操作。环境适配要求 Python 3.11~3.12(本次使用3.11版本),全程使用虚拟环境隔离依赖,不污染系统原生Python环境;支持CPU模式运行,无NVIDIA/AMD显卡也可正常部署使用,如果用户配置了NVIDIA驱动则该框架会自动识别无需手动配置。
阅读全文
posted @ 2026-09-05 10:04
lyshark
阅读(39)
推荐(0)
摘要:
Apache 是全球使用排名第一的 Web 服务器软件,具备极强的跨平台兼容性,可运行在几乎所有主流计算机平台,凭借出色的稳定性、安全性与高性能,成为目前最流行的 Web 服务端软件之一。本文基于 CentOS 系统,采用源码编译方式安装当前最新稳定版 Apache 2.4.68,适配系统新版依赖特性,可直接用于生产环境部署。
阅读全文
posted @ 2026-09-02 17:37
lyshark
阅读(35)
推荐(0)
摘要:
Nginx 是一款轻量级、高性能、高并发的开源Web服务器、反向代理与负载均衡软件,凭借低资源占用、高稳定性的核心优势,成为当下互联网行业主流的服务部署组件,广泛应用于各类网站及业务系统的Web服务、反向代理、负载均衡场景。其基于宽松的类BSD开源协议发布,可免费商用。本文将完整展示 Nginx 1.30.4 源码编译安装、环境配置、systemd服务管理、内核及配置高性能调优的全套流程,适配CentOS/RHEL 10系列系统,可直接落地应用于企业生产环境。
阅读全文
posted @ 2026-09-02 12:23
lyshark
阅读(395)
推荐(4)
摘要:
本文基于 Ubuntu 26.04 系统、纯CPU无CUDA硬件环境,完整演示基于 llama.cpp 实现 HF 原始模型转换 GGUF 格式与CPU量化的落地实操流程。以 Qwen2-0.5B-Instruct 中文对话模型为案例,循序渐进讲解Swap分区配置、系统依赖安装、llama.cpp源码编译、Python虚拟环境部署、原生HF模型下载、HF模型转GGUF格式封装、Q4_K_M等级量化的完整步骤。
阅读全文
posted @ 2026-08-27 17:51
lyshark
阅读(184)
推荐(0)
摘要:
LangChain 是目前大模型应用开发领域最主流、最成熟的开源框架之一,广泛应用于私有化部署、智能体开发、工具调用、流式交互等各类场景。本文基于 LangChain 最新稳定版接口,适配本地私有化 GGUF 模型部署环境,拆解框架四大核心基础能力,标准化消息机制、闭环工具调用链路、多场景流式传输、规范化结构化输出功能,这四个功能是学习后续框架的基础部分,也是必须要熟练掌握的重点。原生大模型接口存在纯文本传输无角色区分、多轮对话无标准化上下文、工具调用链路不闭环、输出格式自由混乱、长文本响应延迟过高,难以直接落地生产项目。而 LangChain 通过标准化封装,解决上述问题,屏蔽了不同大模型、不同部署方式、不同接口协议的差异化适配成本,让开发者可以聚焦业务逻辑开发。
阅读全文
posted @ 2026-08-26 18:33
lyshark
阅读(213)
推荐(0)
摘要:
本文以通义千问Qwen量化GGUF模型为案例,基于Llama.cpp框架展示本地大模型调用与功能开发的完整实现原理及流程。全文采用原生Python编写代码案例,无需依赖重型AI框架,依次实现模型元数据解析、本地接口单次对话调用、多轮对话持久化记忆、自定义工具调用拓展等功能实现逻辑,针对直接调用大模型上下文断裂、功能单一、拓展性不足等问题,通过轻量化对话记忆与工具解析执行框架完成优化实现,拆解本地对话交互运行原理,帮助开发者掌握大模型的基础调用原理。
阅读全文
posted @ 2026-08-25 16:56
lyshark
阅读(194)
推荐(1)
摘要:
本文讲解基于 LangGraph Server 服务搭建本地离线 AI Agent 的完整部署流程,适配 Windows 开发环境,全程无需调用公有大模型接口,实现纯本地化 AI 推理与工作流编排,帮助开发者快速搭建可调试、可复用的本地私有化 AI Agent 服务,适用于个人开发、本地功能调试、轻量化私有化 AI 场景落地。
阅读全文
posted @ 2026-08-24 18:29
lyshark
阅读(234)
推荐(0)
摘要:
Advanced‑RAG 是基于 Naive RAG 演化而来的高级检索增强生成方案,针对朴素RAG检索不准、上下文相关性差、召回噪声多等缺陷进行多层优化。该方案完全沿用朴素RAG的基础流水线模式、不改动核心架构,仅在各流程节点嵌入预处理、后处理增强模块,精细化优化检索环节。通过引入查询改写、重排序、上下文压缩、自我校验等多种增强策略,对召回的文档片段过滤去噪、重排优先级,精准筛选高价值上下文送入大模型,以此来提升提升知识库问答的精准度与稳定性,是目前工业级RAG落地的主流优化方案。
阅读全文
posted @ 2026-08-23 17:33
lyshark
阅读(277)
推荐(1)
摘要:
本文为DeepSeek Harness本地完整部署保姆级教程,适配Windows系统,全程零基础可上手。详细讲解Node.js26.7环境安装、DeepSeek官方仓库拉取、pnpm依赖安装、项目编译构建、Web服务启动,搭配LlamaCpp部署qwen2.5-1.5b本地量化模型,完成模型接口对接与可视化对话调试,手把手教你搭建私有化AI Agent工作台,无外网依赖、本地高效运行,适合个人本地AI开发、模型测试、智能体调试场景。
阅读全文
posted @ 2026-08-23 09:00
lyshark
阅读(1047)
推荐(0)
摘要:
向量检索增强生成(RAG,Retrieval‑Augmented Generation),是弥补大语言模型固有缺陷的关键技术。它可接入私有文档、内部笔记等外部数据源,有效缓解训练数据滞后、知识固化、回答幻觉等问题,输出更为精准可信的内容。Naive RAG 即朴素 RAG,是 RAG 体系中最基础原始的实现方式,也是各类进阶 RAG 技术的底层基石。该方案架构极简、落地门槛低,舍弃复杂优化手段,只保留检索加生成的核心能力。很适合新手学习实践,同时该方式也多用于搭建轻量化知识库问答服务,适配各类简单问答场景。当前主流 RAG 存在三种典型实现范式,分别为 Naive‑RAG、Advanced‑RAG、Agentic‑RAG。本章将以 Naive‑RAG 为例,介绍其功能实现逻辑,以及调用大模型完成 RAG 检索的完整流程。Naive‑RAG 在处理检索结果时,通常直接复用检索得到的文档片段,不会对召回内容做额外加工与二次处理。
阅读全文
posted @ 2026-08-22 18:09
lyshark
阅读(140)
推荐(1)
摘要:
本文基于LangGraph会话记忆管理相关内容,聚焦对话持久化存储方案,以LangChain官方推荐的PostgreSQL数据库为载体,拆解Checkpointer检查点存储与Store通用长期存储两大核心体系。通过对比两套存储机制的底层逻辑、差异特点与适用场景,结合可运行实战代码,实现会话重启续聊、跨线程记忆共享、语义检索、用户档案管理等核心能力,为LangGraph生产级智能体项目提供标准化持久化实现思路。LangGraph将记忆存储划分为两套独立体系,分别适配不同记忆场景,是企业级项目开发的核心基础能力。其中Checkpointer检查点存储主要用于单线程短期会话状态存储,Store通用外部存储主要用于跨线程全局长期用户记忆存储。两套机制相互独立、数据隔离、能力互补,共同构成LangGraph完整的智能体记忆存储体系。
阅读全文
posted @ 2026-08-20 18:16
lyshark
阅读(294)
推荐(1)
摘要:
为解决大模型外部工具调用、上下文传递标准不统一、适配混乱的痛点,本文基于 MCP 模型上下文协议,使用轻量化 FastMCP 构建 MCP 服务端,借助 langchain‑mcp‑adapters 完成与 LangChain 生态集成。文章介绍 Streamable HTTP 传输模式的适配场景,以天气查询作为实战案例,完成自定义工具、资源接口、提示词模板开发,并演示 LangChain 客户端加载工具、读取资源、解析提示词、多服务协同调用完整流程,附带可运行代码与依赖配置,提供一套轻量化标准化的大模型工具调用实践方案。本文将以天气查询、系统时间读取为实战案例,完整实现自定义工具开发、静态资源封装、通用提示词模板配置三大核心能力。同时逐层演示 LangChain 客户端加载工具、读取资源、渲染提示词、多服务协同调用的全流程,配套完整可运行代码与依赖环境配置,为开发者提供一套轻量化、标准化、可落地的大模型工具调用实践方案。
阅读全文
posted @ 2026-08-19 15:43
lyshark
阅读(279)
推荐(1)
摘要:
在 LangGraph 构建 Agent 应用时,会话记忆是核心能力,借助 Checkpointer 搭配 thread_id,可以自动保存每一轮对话轨迹与消息历史,实现多会话隔离。本文基于 InMemorySaver 内存存储,演示交互式会话切换、查看、清空等基础操作。讲解消息条数修剪、Token 阈值修剪、消息删除等处理方案;同时为避免直接丢弃历史造成信息丢失,实现对话历史摘要压缩方案,在控制上下文长度的同时保留关键对话信息,适合本地 GGUF 类大模型 Agent 开发学习参考。
阅读全文
posted @ 2026-08-18 14:57
lyshark
阅读(57)
推荐(0)
摘要:
本地大模型开发已经变得十分便捷,llama.cpp 作为轻量高效的 GGUF 模型推理引擎,可以在普通 PC 上运行 Qwen、Llama 系列量化模型。LangChain 作为大模型应用编排框架,除了对接云端 OpenAI,还能对接 llama‑server 的 OpenAI 兼容接口,不仅可以实现基础对话,还能开发具备工具调用能力的 Agent 智能代理。本文将依次演示LangChain框架的安装、基础对话调用、自定义工具 Agent 开发等功能实现。
阅读全文
posted @ 2026-08-17 16:52
lyshark
阅读(123)
推荐(0)
摘要:
在大模型落地场景中,本地轻量化部署因低延迟、高隐私性、无需依赖云端算力等优势,成为开发者与 AI 爱好者的热门需求。本文聚焦 Windows 环境,详细拆解 llama.cpp 工具的编译流程,并指导如何通过 modelscope 下载 GGUF 格式的模型,最终实现模型本地启动与 API 服务搭建。
阅读全文
posted @ 2026-08-17 14:17
lyshark
阅读(137)
推荐(0)
摘要:
GitHub 账号在长期使用过程中,通常会系统强制或主动要求开启两步验证(2FA)以提升账号安全性。目前主流的验证方式分为两种:一是使用微软官方 Authenticator 移动端验证器,操作便捷、适配手机日常使用;二是基于 TOTP 协议自行编写 Python 脚本,实现本地电脑动态验证码生成,适配桌面端使用场景。下文将详细演示 GitHub 两步验证的完整开启与配置流程。
阅读全文
posted @ 2026-07-26 17:44
lyshark
阅读(74)
推荐(0)
摘要:
前文已详细讲解泰坦引擎的编译生成方法,本章将进阶实操泰坦引擎应用开发,聚焦零基础实现C++调用泰坦引擎、进程附加分析核心能力。本文基于静态链接库模式编译生成的TitanEngine.lib库,搭配官方TitanEngine.h头文件完成环境配置,以打印PE节表信息为实战案例,手把手讲解C++接入泰坦引擎、实现简单进程附加分析的完整流程,补齐泰坦引擎从编译搭建到功能落地的实操教程,帮助开发者快速掌握引擎调用与基础逆向分析技巧。
阅读全文
posted @ 2026-06-30 13:10
lyshark
阅读(61)
推荐(0)
摘要:
TitanEngine是Windows平台下轻量化高性能开源调试引擎,由ReversingLabs团队开发,于2012年HITB阿姆斯特丹黑客大会正式开源发布,也是主流逆向调试工具x64dbg的核心底层引擎。该引擎深度封装优化了Windows原生调试API,支持32/64位程序调试、硬件断点、异常捕获、畸形PE解析等专业逆向能力,开源可二次开发,广泛用于恶意软件分析与漏洞挖掘。本章将通过Visual Studio 2013来编译该引擎,并生成成品,成品可以是LIB库也可以是DLL文件。
阅读全文
posted @ 2026-06-29 10:28
lyshark
阅读(373)
推荐(2)
摘要:
在 Windows 10 系统中,使用 AMD 经典老卡 RX580 运行 Ollama 大模型,无需复杂的 ROCm 或 CUDA 配置,借助 Ollama 内置的 Vulkan 跨平台推理后端,即可轻松实现 GPU 加速,大幅提升模型运行速度。本文以 RX580 为例,手把手教你完成配置、验证与问题排查。
阅读全文
posted @ 2026-06-17 09:55
lyshark
阅读(307)
推荐(0)
摘要:
受制于底层由统计规律与概率论驱动的技术本质,现有大语言模型并不具备真正意义上的自主思考能力,这是其固有属性带来的先天局限。这类模型依托已有海量数据完成参数拟合,一旦穷尽现有人类存量知识,便失去新增有效学习素材;后续所有内容生成与逻辑推演只能局限在概率分布框架内,性能与认知边界存在天然上限。机器看似是在思考,其实它也不知道自己在思考。
阅读全文
posted @ 2026-06-03 18:14
lyshark
阅读(62)
推荐(0)