摘要:
读第二章时,我最大的感受是:Attention 不是一个神秘模块,而是把“谁该看谁、看多少”这件事显式写进了模型。RNN 依赖顺序传递信息,长依赖和并行性都不理想;Attention 则把序列里每个 token 之间的关系一次性算出来,再让模型按相关性取信息。这个变化看起来只是计算方式不同,实际上却 阅读全文
posted @ 2026-07-21 20:50
Hazy_star
阅读(0)
评论(0)
推荐(0)
摘要:
很多人第一次接触大模型时,都会把注意力直接放在 Transformer、Prompt、RAG 和 Agent 上。这样当然能很快看到结果,但一旦模型效果不稳定,或者检索、分词、上下文拼接出问题,就会发现自己缺的不是新概念,而是对 NLP 基础链路的理解。 这篇笔记记录我读 Happy-LLM 第一章 阅读全文
posted @ 2026-07-21 10:33
Hazy_star
阅读(7)
评论(0)
推荐(0)

浙公网安备 33010602011771号