摘要:
核心概念:Word2Vec 词向量模型 Word2Vec 是自然语言处理(NLP)领域的一项核心技术,用于获取词语的向量表示。这些向量基于“分布语义学”原理,通过词语周围的上下文来捕捉其语义信息。模型训练完成后,可用于寻找语义相似的词语,其生成的词嵌入(Embeddings)还可作为搜索引擎、文本分 阅读全文
posted @ 2026-08-26 16:16
立体风
阅读(10)
评论(0)
推荐(0)
摘要:
Word2vec 模型现在仍然存在,而且仍然可以使用。但是它在现代 NLP(自然语言处理)中的地位已经发生了变化: Word2vec 没有消失,它从“主流语言模型”退居为“基础词向量工具”。 现在它主要用于学习 Embedding、教学、一些传统 NLP 任务和资源受限场景。(维基百科) 1. Wo 阅读全文
posted @ 2026-08-26 16:15
立体风
阅读(13)
评论(0)
推荐(0)
摘要:
这是一个极其深刻且直指人工智能本质的问题。在探讨“方向代表意义”这一观点时,我们首先需要纠正一个极易产生的认知误区: 科学家并不是先在黑板上推导出“方向代表意义”,然后据此设计了 Embedding;而是在试图让机器处理语言的漫长挣扎中,偶然发现高维向量空间中自然涌现出了这种几何规律,从而总结出“语 阅读全文
posted @ 2026-08-26 16:07
立体风
阅读(5)
评论(0)
推荐(0)
摘要:
这是一份关于 TF-IDF(词频-逆文档频率) 的深度教学指南。在原有框架的基础上,我补充了工程实践中的关键细节、数学直觉的解析以及算法的局限性,力求使其成为一篇兼具理论深度与实战价值的技术文章。 深度解析 TF-IDF:从文本统计到机器理解的基石 在自然语言处理(NLP)和信息检索领域,计算机面临 阅读全文
posted @ 2026-08-26 16:01
立体风
阅读(5)
评论(0)
推荐(0)
摘要:
一、为什么神经网络需要“向量嵌入”(Embedding)? 计算机最擅长处理数字。 但是人类语言是: cat dog king queen apple 这些都是文字,计算机不能直接理解。 所以第一步: 把离散的符号(文字、图片、用户、商品等)转换成连续的数字向量。 这个过程叫: \[\textbf{ 阅读全文
posted @ 2026-08-26 13:16
立体风
阅读(7)
评论(0)
推荐(0)
摘要:
📜 1. 历史背景:LSP 的诞生与局限 LSP (Language Server Protocol) 本质上是编辑器与语言智能服务之间的通信标准,旨在解耦 IDE 与语言分析引擎。 传统模式:每个 IDE 需为每种语言重复开发解析器(如 VS 对 C#,IntelliJ 对 Java)。 LSP 阅读全文
posted @ 2026-08-26 06:29
立体风
阅读(13)
评论(0)
推荐(0)

浙公网安备 33010602011771号