随笔分类 -  人工智能

摘要:神经网络中的“滤波器”(Filter),也常被称为“卷积核”(Kernel),是卷积神经网络(CNN)的核心组件。它的主要用途是从输入数据中提取特征,这是CNN在图像识别、语音处理等领域取得巨大成功的关键原因。 核心用途:特征提取 你可以把滤波器想象成一个“特征探测器”。它通过在输入数据上滑动并进行 阅读全文
posted @ 2025-11-13 18:20 姚春辉 阅读(112) 评论(0) 推荐(0)
摘要:我们来系统地梳理一下激活函数在神经网络中的作用。 核心作用:引入非线性 这是激活函数最根本、最重要的作用。 没有激活函数的神经网络是什么样的? 假设你有一个多层神经网络,但所有层都是线性的(即没有激活函数)。那么,无论你堆叠多少层,整个网络的最终输出都只是输入的一个线性组合。 例如: 第一层:out 阅读全文
posted @ 2025-11-12 16:46 姚春辉 阅读(264) 评论(0) 推荐(0)
摘要:将大模型与企业内部知识结合,构建适合本企业的“小模型”或增强型应用,核心目标是让通用大模型具备企业专属的知识、语言风格和业务逻辑,同时避免从零训练大模型的高成本和高门槛。以下是具体实现路径和关键步骤: 一、核心实现思路:两种主流路径 根据企业需求(成本、实时性、定制深度),主要分为“模型微调”和“检 阅读全文
posted @ 2025-11-12 15:09 姚春辉 阅读(226) 评论(0) 推荐(0)
摘要:“基础模型 + 场景微调”是目前性价比最高、最主流的企业级AI落地方式。它的核心思想是:站在巨人的肩膀上,不重复造轮子。 下面我将为你详细拆解这个过程,并结合一个具体的例子来说明。 核心概念解析 基础模型 (Foundation Model) 是什么? 这是指像 GPT-4、Llama 3、文心一言 阅读全文
posted @ 2025-11-12 15:09 姚春辉 阅读(128) 评论(0) 推荐(0)
摘要:卷积神经网络(CNN)的典型核心流程是“数据输入→特征提取→特征整合→预测输出”,分层围绕该流程展开,核心层包括输入层、卷积层、池化层、全连接层、输出层,部分场景会补充辅助层,整体结构清晰且各司其职。 一、典型核心流程(从数据到预测) 原始数据输入:通过输入层接收规范后的原始数据(如图像、序列)。 阅读全文
posted @ 2025-11-12 11:05 姚春辉 阅读(261) 评论(0) 推荐(0)
摘要:全连接层本身不固定属于输入层、输出层或隐藏层,它是一种“层的连接结构”,可作为隐藏层或输出层,输入层通常不称为全连接层。 核心定义 全连接层(Fully Connected Layer)的核心是“层内每个神经元与前一层所有神经元完全连接”,连接方式是关键,而非层在网络中的位置。 不同位置的应用 作为 阅读全文
posted @ 2025-11-12 10:58 姚春辉 阅读(95) 评论(0) 推荐(0)
摘要:卷积层的核心定位是隐藏层,仅特殊场景下可作为输出层的一部分,绝对不属于输入层。 核心结论 卷积层是深度学习(尤其CNN)中负责特征提取的核心层,本质是“带有局部连接、权值共享特性的计算层”,其功能和设计逻辑决定了它的主要角色是隐藏层。 不同位置的角色划分 作为隐藏层:这是最核心、最常见的用途。卷积层 阅读全文
posted @ 2025-11-12 10:50 姚春辉 阅读(44) 评论(0) 推荐(0)
摘要:这个问题问到了神经网络的核心设计逻辑!神经元设置偏置(bias)的核心作用是调整模型的“激活门槛”,让模型能更灵活地拟合数据规律。 核心结论 偏置是神经元的“偏移量”,用于控制激活函数被触发的难易程度,本质是为了让模型摆脱“必须通过原点”的限制,提升拟合能力。 关键理由 解决“零输入必零输出”的局限 阅读全文
posted @ 2025-11-12 10:37 姚春辉 阅读(148) 评论(0) 推荐(0)
摘要:核心结论是:标准化和归一化的核心目的是消除数据量纲差异、优化模型训练,二者适配不同数据场景和模型需求。 为什么需要标准化? 消除量纲影响,让不同单位的数据可对比。比如“身高(厘米)”和“体重(千克)”,标准化后能在同一尺度下参与计算。 避免模型受数据范围影响。像线性回归、SVM等依赖距离或梯度下降的 阅读全文
posted @ 2025-11-11 16:29 姚春辉 阅读(102) 评论(0) 推荐(0)
摘要:核心结论是:验证集用于模型调优与选择,测试集用于最终性能评估,二者用途完全分离,避免模型过拟合到测试数据。 核心定位与用途 验证集:服务于模型训练过程,用来调整超参数(如学习率、树深度)、选择模型结构(如神经网络层数)。 测试集:独立于训练流程,仅在所有调优完成后使用,评估模型在全新数据上的泛化能力 阅读全文
posted @ 2025-11-11 16:24 姚春辉 阅读(122) 评论(0) 推荐(0)
摘要:叶子张量(Leaf Tensor)和非叶子张量(Non-leaf Tensor)是 PyTorch 计算图中的两个核心概念,核心区别体现在创建方式、在计算图中的角色以及梯度存储行为上,具体差异如下: 1. 创建方式不同 叶子张量:通过直接初始化创建(如 torch.tensor()、torch.ze 阅读全文
posted @ 2025-11-11 14:05 姚春辉 阅读(56) 评论(0) 推荐(0)
摘要:张量相乘核心结论:需先明确乘法类型(元素积/矩阵积/点积),不同类型对应不同维度要求,结果维度由乘法规则决定,核心分三类常见运算。 一、元素积(Hadamard积):对应元素直接相乘 核心要求:张量维度必须完全一致(无需广播,广播仅适用于加减,不适用于元素积)。 运算逻辑:两个张量相同位置的元素逐一 阅读全文
posted @ 2025-11-11 11:14 姚春辉 阅读(167) 评论(0) 推荐(0)
摘要:张量相加的核心结论是:必须满足“广播兼容”(维度匹配或可扩展为相同维度),运算时对应位置元素逐一相加,结果维度与广播后的维度一致。 核心规则 维度匹配要求:要么张量维度完全相同(如2×3张量 + 2×3张量),要么满足广播条件(低维张量可扩展为高维张量的维度,如1×3张量 + 2×3张量)。 元素运 阅读全文
posted @ 2025-11-11 11:14 姚春辉 阅读(39) 评论(0) 推荐(0)
摘要:这个问题抓得很准,核心结论是:向量是张量的特殊形式(1维张量),张量是向量的“高维扩展”,二者是“特殊与一般”的关系,核心区别在于维度和数据承载能力。 1. 定义与维度差异 向量:严格来说是1维张量,只有“长度”一个维度,用有序数组表示(如[1,2,3])。 张量:可表示0维到N维的结构化数据,维度 阅读全文
posted @ 2025-11-10 18:07 姚春辉 阅读(256) 评论(0) 推荐(0)
摘要:这个区分很关键,核心结论是:线性特征是“数据规律呈直线/平面关系,可直接叠加”,非线性特征是“数据规律呈曲线/复杂关系,无法简单叠加”,深度学习的核心就是捕捉非线性特征。 1. 线性特征:简单直接的“比例关系” 核心特点:输入和输出满足“加性+比例性”,图形上是直线(2维)或平面(高维)。 生活例子 阅读全文
posted @ 2025-11-10 17:06 姚春辉 阅读(154) 评论(0) 推荐(0)
摘要:深度学习的核心,本质是 “通过可学习的参数化模型,从数据中自动学习多层非线性表征,再用梯度下降迭代优化,最终实现输入到输出的精准映射” —— 一句话拆解为3个不可分割的核心要素,贯穿所有深度学习任务(分类、生成、回归等): 1. 核心载体:多层非线性网络(建模“表征能力”) 深度学习的“深度”本质是 阅读全文
posted @ 2025-11-10 16:12 姚春辉 阅读(135) 评论(0) 推荐(0)
摘要:拟合其实就是让模型“模仿”数据规律的过程,像给一堆散落的点画一条最贴合的线(或曲线、曲面)。 通俗理解:“找规律”的过程 比如你手里有10组“身高-体重”数据,想通过身高猜体重: 拟合就是找一个公式(比如“体重=0.6×身高-20”),让这个公式算出的体重,和真实体重尽可能接近; 模型(这里的公式) 阅读全文
posted @ 2025-11-10 16:03 姚春辉 阅读(105) 评论(0) 推荐(0)
摘要:机器学习的核心是让模型从数据中学习输入与输出之间的映射规律(如特征与标签的关联、数据的内在结构、决策策略等),这些规律最终以模型参数的形式被存储和体现。而训练好的模型参数必须被保存,否则每次次次使用模型时都需要重新训练,这在实际应用中是不可行的。 一、机器学习到底在“学习”什么? 如前文所述,机器学 阅读全文
posted @ 2025-09-24 16:13 姚春辉 阅读(87) 评论(0) 推荐(0)
摘要:机器学习的核心是让计算机通过数据自动学习“规律”或“模式”,而非依赖人类手动编写的固定规则,最终实现“对未知情况的预测或决策”。这种“学习”本质上是模型通过数据调整自身参数,从而建立“输入数据”与“期望输出”之间的映射关系——既可以是显性的规律(如“图片中像素特征与‘猫’类别的关联”),也可以是隐性 阅读全文
posted @ 2025-09-24 13:57 姚春辉 阅读(106) 评论(0) 推荐(0)
摘要:Transformer和CNN(卷积神经网络)是深度学习中两种非常重要的网络架构,它们在很多方面存在差异,同时也各有优势,以下是详细介绍: 网络结构 Transformer 自注意力机制(Self - Attention):这是Transformer的核心组件。以自然语言处理为例,自注意力机制能够计 阅读全文
posted @ 2025-01-15 11:00 姚春辉 阅读(1447) 评论(0) 推荐(0)