随笔分类 - 架构设计类与算法
逻辑回归(Logistic Regression)
摘要:逻辑回归(Logistic Regression)是一种用于解决二分类问题的统计学习方法,其输出结果表示了某个事件发生的概率。以下是关于逻辑回归的详细解释: 定义与背景 定义:逻辑回归是一种广义的线性回归分析模型,用于估计二分类因变量的概率。它常用于数据挖掘、疾病自动诊断、经济预测等领域。 与线性回
阅读全文
皮尔逊相关系数(Pearson Correlation Coefficient)
摘要:皮尔逊相关系数(Pearson Correlation Coefficient)是用于度量两个变量之间线性关系强度和方向的统计量。其值域在-1到1之间,其中: 当皮尔逊相关系数为1时,表示两个变量完全正相关。 当皮尔逊相关系数为-1时,表示两个变量完全负相关。 当皮尔逊相关系数为0时,表示两个变量没
阅读全文
杰卡德相似度(Jaccard Similarity)
摘要:Jaccard相似度(Jaccard Similarity)是一种用于比较有限样本集之间相似性和多样性的统计度量。以下是关于Jaccard相似度的详细解释: 原理与定义 Jaccard相似度基于两个集合中交集的大小与并集大小的比值来评估两个集合的相似度。它不考虑集合中元素的顺序,只关注元素的存在性。
阅读全文
简单数学分支整理
摘要:前言 2024年阿里巴巴全球数赛火上了天。一位年仅17岁的中专生,打败了清华北大等全世界知名院校学生,在2024阿里巴巴全球数学竞赛公布决赛中,以93分的成绩荣获全球排名第12位。 这个例子给作者很大感触,作为数学业余爱好者也想为这个行出点力,由此写下这篇整理文章 。 数学常见分支 数学分支是指数学
阅读全文
线性回归(Linear Regression)
摘要:线性回归的起源 线性回归(Linear Regression)的起源可以追溯到19世纪,其名称来源于英国生物学家兼统计学家弗朗西斯·高尔顿(Francis Galton)在研究父辈和子辈身高的遗传关系时提出的一个直线方程。他在《遗传的身高向平均数方向的回归》一文中提出,子女的身高有向其父辈的平均身高
阅读全文
监督学习(Supervised Learning)
摘要:一、起源 监督学习(Supervised Learning)的概念可以追溯至20世纪50年代,当时人工智能刚刚起步。然而,真正的突破发生在20世纪80年代末和90年代初,当时深度学习的概念初次被提出。1992年,加拿大的计算科学家Geoffrey Hinton和他的学生Alex Krizhevsky
阅读全文
Matrix Factorization(矩阵分解)
摘要:Matrix Factorization(矩阵分解)是线性代数和数据科学中的一个核心概念,它在多个领域都扮演着重要的角色。以下是对Matrix Factorization的详细解释,包括定义、方法、应用场景和归纳: 定义 矩阵分解是指将一个矩阵(Matrix)分解成两个或多个较小矩阵的过程,这些较小
阅读全文
K近邻(K-Nearest Neighbors,简称KNN)算法
摘要:K近邻(K-Nearest Neighbors,简称KNN)算法是一种基本的机器学习算法,主要用于分类和回归问题。以下是对KNN算法的详细介绍: 1. 定义和原理 定义:如果一个样本在特征空间中的k个最相似(即特征空间中最邻近)的样本中的大多数属于某一个类别,则该样本也属于这个类别。原理:基于类比原
阅读全文
C语言版本链表详解
摘要:前言 链表(Linked List)是一种常见的数据结构,它允许我们动态地分配内存,并通过指针将元素链接在一起。在C语言中,链表通常通过结构体(struct)和指针来实现。下面,我将为你详细解释链表的基本概念以及如何在C语言中实现链表。 链表的基本概念 节点(Node):链表中的每一个元素都称为一个
阅读全文
Supervised 、Unsupervised、Semi-supervised、Reinforcement
摘要:定义 监督学习(Supervised Learning)监督学习是机器学习中最常见的一种学习方式。在这种学习方式中,我们有一组带有标签(label)的训练数据,比如一组图片和对应的分类标签(如“猫”、“狗”等)。算法的任务就是学习如何从输入数据中提取特征,并根据这些特征来预测标签。常见的监督学习算法
阅读全文
Tanimoto系数(Tanimoto Coefficient)
摘要:起源 Tanimoto系数,也被称为谷本系数或广义Jaccard相似系数,起源于化学信息学领域,用于比较分子和分子之间的相似度。其概念源于Jaccard系数,由Paul Jaccard在1901年首次提出,并在化学信息学中得到发展和应用。 原理 Tanimoto系数基于集合论的概念,用于量化两个集合
阅读全文
前馈神经网络(Feed-Forward Neural Network)
摘要:前馈神经网络(Feed-Forward Neural Network,简称FNN)是一种基本且广泛应用的人工神经网络结构。以下是关于前馈神经网络的详细解释: 1. 定义与结构 定义:前馈神经网络是最简单的一种神经网络,其各神经元分层排列,每个神经元只与前一层的神经元相连,接收前一层的输出,并输出给下
阅读全文
自适应梯度算法AdaGrad(Adaptive Gradient Algorithm)
摘要:起源: AdaGrad(Adaptive Gradient Algorithm)起源于对深度学习训练过程中学习率自适应调整的需求。传统的梯度下降方法使用固定的学习率,但在实际训练过程中,不同的参数可能需要不同的学习率来进行更新。AdaGrad就是为了解决这一问题而提出的。 定义: AdaGrad是一
阅读全文
梯度下降法Gradient Descent中如何选择合适的学习率
摘要:在梯度下降法中,学习率(learning rate)的选择对算法的性能和结果具有至关重要的影响。以下是选择合适学习率的一些建议和策略: 初始猜测: 通常会先从一个较小的学习率开始尝试,如0.01,然后根据迭代效果和收敛速度进行调整。另一种常见的方法是尝试一系列呈指数增长的学习率,例如0.001, 0
阅读全文
梯度下降法(Gradient Descent)
摘要:起源 梯度下降法(Gradient Descent)是一种优化算法,其起源可以追溯到微积分学中的梯度概念。在机器学习和深度学习领域,为了找到损失函数的最小值,研究者们提出了多种优化算法,其中梯度下降法是最基础和最常用的方法之一。 定义 梯度下降法是一种迭代优化算法,用于求解函数的局部最小值。它通过迭
阅读全文
随机搜索(Random Search)
摘要:起源 随机搜索的起源可以追溯到1963年,由Rastrigin在他的文章《The convergence of the random search method in the extremal control of a many parameter system》中首次提出。这篇文章对随机搜索进行了
阅读全文
推荐实验验证时如何设置合适的采样策略
摘要:实验验证时设置合适的采样策略,需要综合考虑数据集的特性和模型的需求。以下是一些具体的步骤和建议,以帮助你制定合适的采样策略: 1. 数据集分析 不平衡程度:首先分析数据集中各类别的样本数量比例,了解数据不平衡的程度。这可以通过统计各类别样本的数量来完成。样本分布:观察样本在特征空间中的分布,了解是否
阅读全文
推荐系统如何结合多种实时数据优化用户行为预测
摘要:结合多种实时数据优化用户行为预测是一个复杂但高效的过程,以下是一些建议的步骤和策略,旨在通过整合多种数据源来提高预测的准确性:1. 数据收集和整合来源广泛:从用户在网站上的浏览记录、购买记录、搜索记录,到社交媒体、移动应用等多个渠道收集数据。确保质量:在收集过程中,保证数据的质量和完整性,避免因为数
阅读全文
RAG与其他生成技术相比有何优势
摘要:RAG与其他生成技术相比,具有以下优势: 提高答案的准确性: RAG技术通过从外部知识库中检索相关信息,并将其与语言模型的生成能力结合,可以显著提升生成答案的准确性。这种准确性的提升尤其体现在知识密集型任务中,如专业领域的问答系统。相比于仅依赖语言模型进行生成的技术,RAG能够更好地结合事实和数据,
阅读全文
残差连接和层归一化如何提高GPT、文心一言等大模型的性能
摘要:残差连接(Residual Connections)和层归一化(Layer Normalization)在GPT等Transformer模型中起到了关键作用,它们显著提高了模型的性能和稳定性。以下是它们如何提升GPT性能的详细解释: 残差连接 1. 缓解梯度消失问题:在深度神经网络中,随着网络层数的
阅读全文
浙公网安备 33010602011771号