Fork me on GitHub

大模型学习总览

01_基础认知

术语表

大模型术语速查表 | LLMGuide

模型_平台_推理引擎_API的区别

名称 作用 责任 示例
平台 平台是“把模型和推理能力包装成更容易使用的产品或运行环境”。 下载并管理模型,提供一定的参数配置能力 Ollama/Open WebUI
API API 是“调用接口”,负责让程序和模型服务通信。 接受请求,返回结构,链接前后端 OpenAI API、Responses API
推理引擎 推理引擎是“让模型跑起来的底层执行器”。 加载模型,调用GPU/CPU、优化速度/显存和吞吐 vLLM,llama.cpp
模型 模型是大脑本体 理解和生成 DeepSeek,GPT等

应用通过 API 调用模型服务;API 通常由平台或服务层对外提供;平台内部会封装或调用推理引擎;推理引擎负责加载并运行大模型。

云端模型_vs_本地模型部署

02_OpenAI_API基础

API_SDK_Endpoint

Chat_Completions与Responses_API

目前OpenAI推出了两版接口,一种是Chat Completions。新版的是Responses API,把原来聊天、工具、多模态、结构化输出这些需求放进一个更通用的框架里。

OpenAI官方推荐新模型或者GPT5.4及以上,采用Responses API进行。Open Ai Developers

若跟我一样是初学者,建议Chat Completions + 本地部署。因为Responses API目前仅支持GPT的云端模型。

Streaming

03_Prompt与角色系统

Prompt基础

Prompt思想

Few-Shot:少样本推理。测试阶段学习过大量的样本后,在测试阶段,针对新类别只需要少量的数据就可以快速学习。可以理解为给模型一个参考答案或示例,模型使用少量样本去快速泛化。

Zero-Shot:迁移学习。训练阶段不存在与测试阶段完全相同的类别,但模型可以通过之前的训练数据推广并集中到测试阶段的类别上。可以理解为零样本,基于属性和语义去迁移到新的类别。

 

Few-Shot:给模型少量示例,引导模型对齐结果。例如给一个测试用例demo,参考demo的测试用例结构去生成。

Zero-Shot:无提示,语言描述任务,借用知识库回答问题。

Prompt角色及优先级

  • system
      系统角色,用来规定模型的总体行为、规则、语气、边界
      例如:“你是一个专业的法律助手,回答时要简洁、严谨,不编造内容。”
  • developer
      开发者角色。用来设置应用级指令,定义某个应用场景下的产品规则和业务格式
      优先级通常低于 system,高于 user
      例如:“你是一个电商客服助手。回答时必须使用中文”
  • user
      用户角色。提出具体任务
      这是模型主要响应的对象
      例如:“帮我写一封请假邮件。”
  • assistant
      助手角色。表示模型之前给出的回答
      用于保持上下文连续性,让模型知道自己前面说过什么
      例如:“当然可以,以下是一封简洁的请假邮件模板……”
  • tool/function
      工具角色 / 函数角色。表示外部工具返回的结果,比如数据库查询、天气接口、搜索结果、代码执行结果等
      模型可以根据这些结果继续生成回答
      例如:“天气查询结果:北京今天多云,28℃。”

调用的顺序为:system->developer->user->assistant/user->user-..... ,一般禁止在同一次的对话中间进行system。

system,developer,user优先级。system是公司制度,developer是部门工作规范,user是个人需求。不太合适把user比做客户需求,因为工作场景中客户需求和部门工作规范冲突时,基本都是客户需求优先。

Prompt模板设计

Prompt_Injection

04_输入输出机制

Token

Context

Temperature

Structured_Output

JSON输出

Hallucination

Grounding

API / SDK

05_RAG与知识库

RAG基础

  • RAG:Retrieval-Augmented Generation(检索能力增强),说的是模型回答时要不要先去检索外部知识

Embedding

向量库

Chunking

Retrieval

Hybrid_Search

Rerank

知识库实践

06_工具调用与工作流

Tool_Calling

Function_Calling

Workflow

Agent

LangChain

模板标准化

Jira等系统接入

07_部署与工程化

本地部署_vs_云端调用

框架基础

如果把deepseek等大模型比作电影,软件平台就是播放大模型的放映设备。

个人端:

  • Ollama:本地模型运行/管理工具与服务平台
  • LM Studio:本地模型桌面应用/运行平台

企业端:

  • vLLM:大模型推理引擎/服务框架。高效加载模型,高吞吐推理,对外提供接口。
  • SGLang:推理/服务编排框架,面向 LLM 程序组织、推理优化、复杂工作流

Ollama

LM_Studio

vLLM

Transformers

SGLang

LMDeploy

DeepSpeed

并发_吞吐_延迟

08_评估与成本

Evaluation

RAG评估

延迟

吞吐

成本

缓存

09_安全与治理

数据安全

权限控制

审计日志

合规治理

10_模型选择及微调

posted @ 2026-07-28 22:14  张一默  阅读(5)  评论(0)    收藏  举报