AI质效

架构革新:
Transformer摒弃RNN序列结构,采用 全并行化设计,大幅提升训练效率与模型 可扩展性

突破依赖:
通过自注意力机制捕捉长距离语义关联,有效解决RNN在长文本中的梯度消失问题

取代旧模:
相比CNN局部感受野和RNN时序限制,Transformer实现全局动态权重分配,成为新标准
深入核心技术机制:自注意力(Self-Attention)的工作原理与优势:

image

构建时间轴图谱:从2017年Transformer诞生到2024年实时交互的重大节点

image

Cursor既便宜又稳定,Opus也贵也容易封号、Claude最好、贵还容易封账号,codex也贵

卷积神经网络CNN(Convolutional Neural Network),对于图片的处理、美颜、扫码、自动对焦、图像识别,输入一个图片,把图片抽成像素块,提取像素块典型的特征,跟之前训练的数据比对,从而识别出图片里的东西是什么内容。
卷积神经网络大概分为三层,卷积层、池化层、连接层。一个图片来了之后通过卷积层,把图片分成各个小区域之后,提取图片里的特征值;提取特征后通过池化层(加快计算速度),提取图片里最像的值、最亮的值,把图片里没有用的去掉了,提取图片里最像某些特征的像素,图片变小,但是图片里关键的特征还在;通过池化最终到连接层输出,特征拼到一块,跟之前训练的进行比对,输出是什么东西。
三个卷积层,两个池化层和一个全局连接层,先卷积、再池化,再卷积、再池化,再卷积,全局连接层输出。图像分类、目标定位、人脸识别、图像切割这些典型的场景用起来了。
卷积神经网络,通过提取局部特征,空间特征提取和权重共享,但是没有先后顺序,不知道谁依赖谁,比如输入我吃苹果,输出苹果吃我,也是四个字,通过。
最早的扫描照片和人脸是一样的,现在不行了,活体检测,通过算法判断是否是真人
循环神经网络RNN(Recurrent Neural Network)

核心思想
通过隐藏状态记忆历史输入,实现对序列前后依赖的建模;
结构特点
共享参数的循环连接使网络可处理任意长度序列数据;
信息流动
当前时刻输出由输入和上一时刻隐藏状态共同决定;
应用场景
适用于文本、语音等需捕捉时间动态特性的任务场景;

循环神经网络通过前面输入的内容,预测后面输入的内容,分为三层,输入层、隐藏层和输出层。输入层就是输入什么东西,就记什么东西,输入层不仅接收当前的数据是什么,并且把当前的数据传递给隐藏层,历史的输入都在隐藏层存着呢,隐藏层把输入的数据串起来了,我爱北京天安门,你呢。循环神经网络能捕捉数据之间的关联关系,从而供后面的输出层去做决策、做判断。RNN能理解上下文,弊端是串行,无法解决并行问题,无法解决长距离依赖问题,输入越长,理解越弱。
针对卷积神经网络和循环神经网络的问题,1997年谷歌提出了Transformer,Transformer架构是大模型的基础,Transformer架构解决了RNN和CNN共同存在的问题,我  爱   北京天安门  ,  你呢?,爱的关注权重。
Transformer架构图:

7cc186d5042b3331b4e65655cdeb9396

Multi-Head Attention:多头注意力,可以并行处理,多头理解这句话的重要信息,谁和谁有关系;
Feed-forward network(前馈神经网络):把词串起来,知道那个他是代表小明、小黑或小白
Embedding:向量化,把输入的文字转成向量,多个维度,最少维度是512,也有1024维度的

token(输入词)---embedding(向量+位置编码)---编码器【self-attention(前后都可以看)---ffn(Feed-forward network)---输入】---解码器【掩码自注意力(可以看前面,后面不能看,后面的是预测出来的)---self.attention---ffn---输出】,Transformer架构里编码器和解码器是成对出现的,输入汉字,转成英文,输出时英文转成汉字,向量化。

Q、K、V 是实现自注意力机制的三组向量;自注意力 = 通过 QKV 计算序列 token 之间相关性的整套算法
Q(Query 查询):我要找什么信息
K(Key 键):每条信息有什么标签
V(Value 值):信息本体内容

前馈网络FFN(Feed-Forward Network)
通俗比喻:
一段文本:我想吃苹果
Attention:“我” 去关联 “苹果”、“想吃”,建立词语之间联系;
FFN:拿到关联信息后,单独理解「我想吃苹果」这个语义,提炼含义;
一句话区分:Attention = 看别人;FFN = 自己消化思考;

512维---扩维 *4 2048维---从而挖掘隐藏的、更高阶的特征---提取筛选挖掘出来的高级特征/关键信息---降维 512维度
ffn:提炼 token 上下文无关特性(词根 词性),再结合位置编码,强化位置感知的局部信息
attention:token之间的相互关系,谁在听谁说   ffn:每个token 并行,独立思考,怎么去理解这个token
attention:决定看谁、决定信息能不能到达,建立整个token的序列结构  ffn:决定怎么看懂、决定的是信息能不能被理解,消化attention阶段汇总来的信息

llm---large language model,大预言模型,大是指参数多,生成式任务---解码器更合适,没有编码器,架构图只有右侧部分,因为大模型创造新文本,而不是分析现有文本,所以我们没有编码器文本,只有解码器文本,解码器记住用户输入的内容去预测生成后续内容,不需要编码器去转化一下,解码器既干理解又干生成部分,把用户已经生成好了的前文,后面只需要把生成好的内容汇总到一块,通过掩码自注意力、前馈网络不断的去预测下一个词,llm:输入词、编码层、输出层
小米 洗衣机 说明书 在哪 ?               解码器: 单向多头自注意力机制      洗衣机 只看到小米          说明书重点关注洗衣机


什么是上下文?

上下文:模型单次能处理的最大长度/token----模型单次能处理的最大 输入+输出 长度/最大token
输入:提示词----自己输入的部分+隐藏的部分(历史会话信息)+agent内置提示词
控制上下文长度方式(agent自己发起的,比如豆包,不是大模型发起的,大模型藏在后面):滑动窗口(前面的信息被丢掉)+压缩(提炼重要的信息,把一些)
最大上下文=输入+输出的最大大小

 

Token=大规模读取文本的最小处理单位,输入是一个一个token,输出也是一个一个token

 



 

 

 

 

 

 

 

posted @ 2026-07-28 17:01  laosun0204  阅读(3)  评论(0)    收藏  举报