👋 欢迎浏览我的技术博客,记录学习笔记 本人28届软工一枚

摘要: (一)基本概念 将原始的数据特征通过多步的特征转换得到的一种特征表示并输入到预测函数得到最终结果 流程如下 1.原始特征提取为底层特征 2.底层特征提取为中层特征 3.中层特征提取为高级特征 4.高级特征填到预测函数里进行预测 5.输出结果 其中2到3是表示学习,2到4是深度学习 (二)流程介绍: 阅读全文
posted @ 2026-07-24 08:42 气球飞起 阅读(2) 评论(0) 推荐(0)
摘要: 一.大数据要解决的三大问题 1.大量数据的存储 2.大量数据的计算 3.大量数据的资源调度 二.Hadoop的第一部分HDFS组件(分布式存储) 1.原因:单台服务器存储不下,分布式不仅解决存储问题,还能解决读写速度问题 2.架构模式:中心化模式(主从模式)和去中心化模式 主从:有一个服务器可以统筹 阅读全文
posted @ 2026-07-23 10:32 气球飞起 阅读(4) 评论(0) 推荐(0)
摘要: 一.基础概念: 无监督学习,无标签,仅依据样本相似度自动划分簇;同一簇样本相似度高,不同簇差异大 与分类的区别在于分类是带标签(事先定义好的类),聚类是不带标签仅根据样本的相似度进行分类 三要素: 相似度 / 距离度量 聚类准则(目标函数) 聚类算法(优化求解) 三原则: 同质性原则(同类很相似) 阅读全文
posted @ 2026-07-17 10:39 气球飞起 阅读(7) 评论(0) 推荐(0)
摘要: 一.计算目的: 支持向量(集合边缘的数据)到决策面(一个平面)的距离最大 二.线性可分(硬间隔SVM) 定义:存在一个线性函数将样本分开 使用超平面: 样本分类: 函数间隔(反映分类是否正确,正则正确,负则错误): 样本到超平面的距离: 完整计算流程: 判断SVM类型,若线性可分,则进入本分支(无松 阅读全文
posted @ 2026-07-13 08:02 气球飞起 阅读(5) 评论(0) 推荐(0)
摘要: 一.核心思想 多个弱学习器(简单模型:单层决策树、逻辑回归)组合成强学习器,整体效果优于单个模型。 二.主流框架 1.Begging a.原理:从原数据集有放回抽n份样本,每份独立训练一个弱分类器,预测时分类问题投票,回归问题取均值(并行独立训练) b.代表算法:随机森林 流程: (1)对原始数据集 阅读全文
posted @ 2026-07-12 08:16 气球飞起 阅读(3) 评论(0) 推荐(0)
摘要: 损失函数 决策树 id3 1.用途:用于评估拟合回归线; 2.目的:让误差最小(误差:预测值-真实值) 3.方法: a:Mae平均绝对误差 b:Mse均方误差 c:Rmse均方根误差 决策树 1.定义:非参数(无超参)的监督学习方法 2.特征:叶子节点是结果,非叶子节点是条件(规则) 3.优点:又快 阅读全文
posted @ 2026-07-11 08:38 气球飞起 阅读(2) 评论(0) 推荐(0)
摘要: 一。云平台及其服务介绍 1.云平台(云计算平台):一个远程平台聚合软硬件资源为用户提供服务(租网络资源) 2.云平台提供的服务: 1.laas服务:it的基础设施(ip带宽云服务器) 2.将平台作为一种服务 3.Saas:销售软件 二。云平台创建大数据集群的一般步骤: 1.创建云上虚拟局域网(VPC 阅读全文
posted @ 2026-07-10 14:25 气球飞起 阅读(3) 评论(0) 推荐(0)
摘要: 1.创建文件夹 2.解压缩JDK安装文件 3.配置JDK软链接 4.配置环境变量 5.生效环境变量 6.配置java执行程序软链接 7.执行验证 阅读全文
posted @ 2026-07-08 17:51 气球飞起 阅读(2) 评论(0) 推荐(0)
摘要: 1.集群内部关闭防火墙: 2.关闭SELinux(限制用户和程序相关权限,以实现系统的稳定) 修改时区: 1.安装ntp软件(网络时间协议,为解决时间错乱问题,解决数据过期等) 2.更新时区 3.同步时间 4.开启NTP服务并设置开机自启 阅读全文
posted @ 2026-07-08 17:50 气球飞起 阅读(1) 评论(0) 推荐(0)
摘要: 使用配置: 1.傻瓜式安装VMware 2.创建一台虚拟机 3.克隆多台虚拟机以实现集群 4.对每个虚拟机分配内存 5.修改主机名+配置ip: 6.配置主机名映射(修改host文件): 7.使用FinalShell(用于连接vmware,可复制粘贴命令) 主机填刚刚填的主机名: 8.配置SSH免密登 阅读全文
posted @ 2026-07-07 19:20 气球飞起 阅读(3) 评论(0) 推荐(0)