AI人工智能的基础概念

一、 基础概念:大模型的核心基石

LLM(大语言模型, Large Language Model)

基于海量文本数据训练出的超大规模神经网络模型。它本质上是一个“超级文本接龙机器”,能够理解人类语言并根据上下文预测接下来的文本。

Token(文本元/标记)

大模型处理文本的基本单位。一句话会被切分成若干 Token,1 个 Token 大致相当于 0.75 个英文单词或 0.5-0.8 个汉字。大模型的计费和处理上限均以 Token 为单位。

Embedding(向量化/语义嵌入)

将高维的人类文字、图片或音频转化为一串高维数值向量(如 [0.12, -0.85, 0.43, ...])。通过计算向量之间的距离,大模型能够精准理解“苹果”和“水果”在语义上的相似度,而不是死板地匹配字面字符。

Context Window(上下文窗口)

大模型单次对话能够同时接收并处理的最大 Token 数量(包含输入的提示词与输出的回答)。一旦超出行数上限,模型就会“遗忘”最早的内容。

Temperature(采样温度)

控制模型输出随机性与创造力的参数(通常取值 0 到 1)。

  • Temperature 接近 0:输出非常确定、严谨,适合代码生成、计算或事实回答。
  • Temperature 接近 1:输出更具随机性和创造力,适合文案撰写或头脑风暴。

幻觉(Hallucination)

指大模型在缺乏事实依据的情况下,一本正经地编造错误或不存在的信息。这是大模型基于概率预测下一个 Token 的固有特性所导致的。

二、 核心架构:让 AI 落地生产力的三大模式

[ 用户提问 ] 
     │
     ├──► [ RAG ] ───► 查外部知识库/向量库 ────► 拼入上下文回答
     │
     ├──► [ Function Calling ] ──► 识别意图 ──► 调用外部 API/数据库
     │
     └──► [ Agent ] ──► 思路拆解 (ReAct) ──► 循环执行工具 ──► 交付最终结果

RAG(检索增强生成, Retrieval-Augmented Generation)

为了解决大模型“知识滞后”和“幻觉”问题,RAG 在模型回答前,先去外部企业知识库中检索相关文档,将检索到的内容作为背景补充送给大模型,让大模型“开卷考试”,大幅提升回答的准确性。

Function Calling(函数/工具调用)

让大模型从“纯聊天”走向“能干活”的关键能力。模型可以根据用户意图,自动识别出需要调用的外部 API 参数(如查询天气、订机票、执行 SQL),并输出结构化的 JSON 数据,交由后端程序执行。

Agent(智能体 / ReAct 模式)

具备自治能力的 AI 系统。它采用 ReAct(Reasoning + Acting,思考与行动) 模式:先思考下一步该做什么(Reasoning),接着调用工具执行操作(Acting),再根据工具返回的结果继续思考,直到完成复杂的跨步骤任务。

三、 工程组件与标准协议:构建现代 AI 应用的积木

向量数据库(Vector Database)

专门用于高效存储和快速检索高维向量数据的数据库。在 RAG 场景中,它是储存企业知识库向量的关键组件。

  • Milvus:高性能开源分布式向量数据库,适合千万级至亿级海量向量场景。
  • pgvector:PostgreSQL 的向量扩展插件,允许开发者在现有的关系型数据库中直接进行向量检索,极大地降低了中小项目的运维成本。
  • Pinecone:云原生全托管向量数据库,开箱即用,免去底层维护烦恼。

重排序(Reranker)

在 RAG 的粗检索阶段,向量数据库会快速选出相关度较高的前 20~50 篇文档。Reranker 模型则会对这些文档进行更精细的语义二次打分与排序,精简出最核心的 3~5 篇送给大模型,大幅提升上下文质量。

SSE / WebSocket 流式推送

大模型生成文本需要时间。为了避免用户长时间面对空白屏幕等待,前端通常采用 SSE(Server-Sent Events,服务器发送事件) 或 WebSocket,实现类似于打字机一样逐字实时显示回答的效果。

MCP(Model Context Protocol,模型上下文协议)

由 Anthropic 倡导提出的开源统一接口协议。类似于硬件领域的 USB 接口,它让各种外部数据源(如 Git、本地数据库)只需提供统一标准服务,任何支持 MCP 的 AI 客户端就能无缝插拔、安全地访问这些上下文。

四、 进阶模型与训练调优:让模型更懂业务与对齐人类

Fine-Tuning(微调 / SFT)

当通用大模型无法满足特定行业(如医疗、法律)的专业术语或严格格式要求时,使用特定数据集对开源模型进行二次训练,改变其行为模式。

LoRA / QLoRA(高效参数微调)

全量微调大模型成本极高。LoRA 通过在模型旁挂一些极小的低秩矩阵进行训练,大幅降低了微调所需的显卡算力和资金成本。

RLHF / DPO(基于人类反馈的强化学习 / 直接偏好优化)

训练大模型的核心对齐技术。让模型不仅“会说话”,还懂得“说人话”、不说有害言论、更符合人类的价值观和偏好。

五、 其他

成本控制(Token 节省)

大模型 API 按 Token 计费。在生产环境中,需要通过精简 Prompt、选择性价比更高的模型、压缩历史对话上下文等手段降低运营成本。

延迟优化(Latency Optimization)

通过流式传输(Streaming)、投机采样、优化模型尺寸以及使用支持并发量更高的推断引擎来降低首包延迟(TTFT)与生成时间。

结构化输出 / 约束解码(Structured Outputs / JSON Mode)

强制大模型严格按照你指定的 JSON Schema 输出,避免因模型多加标点符号导致后端解析崩溃。

提示词注入防御(Prompt Injection)

防范恶意用户在输入中嵌入篡改指令(如“忽视之前的提示词”),诱导大模型突破既定规则泄露机密。

语义缓存(Semantic Cache)

利用 Embedding 技术识别不同表达但含义相同的请求。如果命中缓存,直接返回历史回答,既省钱又提升响应速度。

Guardrails(安全护栏 / 内容审核)

在用户输入前和模型输出后加入的“安全网”,用来拦截色情、暴力、泄密等违规内容,或防止越狱攻击。

Evals(模型与应用评估)

编写自动化评估流水线,对 RAG 的召回率、Agent 的成功率、回答的准确性进行打分,充当 AI 的“单元测试”。

LLM Observability(大模型可观测性 / 链路追踪)

类似传统系统的 SkyWalking,用于可视化追踪复杂 Agent 或 RAG 链路中每一步的 Prompt、耗时与 Token 消耗。

posted on 2026-08-18 16:29  乐之者v  阅读(3)  评论(0)    收藏  举报

导航