大模型学习总览
01_基础认知
术语表
模型_平台_推理引擎_API的区别
| 名称 | 作用 | 责任 | 示例 |
| 平台 | 平台是“把模型和推理能力包装成更容易使用的产品或运行环境”。 | 下载并管理模型,提供一定的参数配置能力 | Ollama/Open WebUI |
| API | API 是“调用接口”,负责让程序和模型服务通信。 | 接受请求,返回结构,链接前后端 | OpenAI API、Responses API |
| 推理引擎 | 推理引擎是“让模型跑起来的底层执行器”。 | 加载模型,调用GPU/CPU、优化速度/显存和吞吐 | vLLM,llama.cpp |
| 模型 | 模型是大脑本体 | 理解和生成 | DeepSeek,GPT等 |
应用通过 API 调用模型服务;API 通常由平台或服务层对外提供;平台内部会封装或调用推理引擎;推理引擎负责加载并运行大模型。
云端模型_vs_本地模型部署
02_OpenAI_API基础
API_SDK_Endpoint
Chat_Completions与Responses_API
目前OpenAI推出了两版接口,一种是Chat Completions。新版的是Responses API,把原来聊天、工具、多模态、结构化输出这些需求放进一个更通用的框架里。
OpenAI官方推荐新模型或者GPT5.4及以上,采用Responses API进行。Open Ai Developers
若跟我一样是初学者,建议Chat Completions + 本地部署。因为Responses API目前仅支持GPT的云端模型。
Streaming
03_Prompt与角色系统
Prompt基础
Prompt思想
Few-Shot:少样本推理。测试阶段学习过大量的样本后,在测试阶段,针对新类别只需要少量的数据就可以快速学习。可以理解为给模型一个参考答案或示例,模型使用少量样本去快速泛化。
Zero-Shot:迁移学习。训练阶段不存在与测试阶段完全相同的类别,但模型可以通过之前的训练数据推广并集中到测试阶段的类别上。可以理解为零样本,基于属性和语义去迁移到新的类别。
Few-Shot:给模型少量示例,引导模型对齐结果。例如给一个测试用例demo,参考demo的测试用例结构去生成。
Zero-Shot:无提示,语言描述任务,借用知识库回答问题。
Prompt角色及优先级
- system
系统角色,用来规定模型的总体行为、规则、语气、边界
例如:“你是一个专业的法律助手,回答时要简洁、严谨,不编造内容。” - developer
开发者角色。用来设置应用级指令,定义某个应用场景下的产品规则和业务格式
优先级通常低于 system,高于 user
例如:“你是一个电商客服助手。回答时必须使用中文” - user
用户角色。提出具体任务
这是模型主要响应的对象
例如:“帮我写一封请假邮件。” - assistant
助手角色。表示模型之前给出的回答
用于保持上下文连续性,让模型知道自己前面说过什么
例如:“当然可以,以下是一封简洁的请假邮件模板……” - tool/function
工具角色 / 函数角色。表示外部工具返回的结果,比如数据库查询、天气接口、搜索结果、代码执行结果等
模型可以根据这些结果继续生成回答
例如:“天气查询结果:北京今天多云,28℃。”
调用的顺序为:system->developer->user->assistant/user->user-..... ,一般禁止在同一次的对话中间进行system。
system,developer,user优先级。system是公司制度,developer是部门工作规范,user是个人需求。不太合适把user比做客户需求,因为工作场景中客户需求和部门工作规范冲突时,基本都是客户需求优先。
Prompt模板设计
Prompt_Injection
04_输入输出机制
Token
Context
Temperature
Structured_Output
JSON输出
Hallucination
Grounding
API / SDK
05_RAG与知识库
RAG基础
- RAG:Retrieval-Augmented Generation(检索能力增强),说的是模型回答时要不要先去检索外部知识
Embedding
向量库
Chunking
Retrieval
Hybrid_Search
Rerank
知识库实践
06_工具调用与工作流
Tool_Calling
Function_Calling
Workflow
Agent
LangChain
模板标准化
Jira等系统接入
07_部署与工程化
本地部署_vs_云端调用
框架基础
如果把deepseek等大模型比作电影,软件平台就是播放大模型的放映设备。
个人端:
- Ollama:本地模型运行/管理工具与服务平台
- LM Studio:本地模型桌面应用/运行平台
企业端:
- vLLM:大模型推理引擎/服务框架。高效加载模型,高吞吐推理,对外提供接口。
-
SGLang:推理/服务编排框架,面向 LLM 程序组织、推理优化、复杂工作流
Ollama
LM_Studio
vLLM
Transformers
SGLang
LMDeploy
DeepSpeed
并发_吞吐_延迟
08_评估与成本
Evaluation
RAG评估
延迟
吞吐
成本
缓存
09_安全与治理
数据安全
权限控制
审计日志
合规治理
10_模型选择及微调
本文来自博客园,作者:{张一默},转载请注明原文链接:https://www.cnblogs.com/YiMo9929/p/21894924

浙公网安备 33010602011771号