摘要:
1. Decoder-only架构本质:因果自注意力(Causal Self-Attn),掩码屏蔽未来token,自回归生成;区别于BERT双向Encoder、T5 Encoder-Decoder。 2. 注意力优化方案 GQA分组查询注意力:多头拆分Q共享KV,在显存、速度、性能间折中,替代原 阅读全文
posted @ 2026-06-03 11:29
111阳
阅读(9)
评论(0)
推荐(0)
摘要:
二、核心架构:Transformer 1. 自注意力Self-Attention:抓取句子前后关联,看懂指代、逻辑; 2. Encoder:理解输入(BERT类只用编码器,侧重理解); 3. Decoder:生成文本(GPT类只用解码器,侧重续写); 4. 位置编码:让模型识别字词先后顺 阅读全文
posted @ 2026-06-03 11:28
111阳
阅读(4)
评论(0)
推荐(0)
摘要:
LLM(大语言模型):基于Transformer架构、海量文本预训练,靠上下文理解+概率生成文字的巨型神经网络,代表:GPT、LLaMA、文心一言、豆包。 核心:预测下一个字。 阅读全文
posted @ 2026-06-03 11:28
111阳
阅读(4)
评论(0)
推荐(0)

浙公网安备 33010602011771号