01 2021 档案

摘要:使用感知机,逻辑回归,支持向量机进行中文新闻主题分类 首先使用 sklearn 中的 datasets 模块生成一个随机的二分类数据集。 from sklearn import datasets random_samples = datasets.make_classification(n_samp 阅读全文
posted @ 2021-01-30 23:46 printf(); 阅读(146) 评论(0) 推荐(0)
摘要:点到平面的距离: 梯度下降法:求解无约束最优化问题的经典方法,机器学习和深度学习中应用最广泛的模型求解算法求解无约束最优化问题的经典方法,机器学习和深度学习中应用最广泛的模型求解算法如果实值函数g(w)在点α处可微且有定义,那么函数g(w)在点α处沿着梯度相反的方向-Vg(a)下降最快。 随机梯度下 阅读全文
posted @ 2021-01-29 20:14 printf(); 阅读(64) 评论(0) 推荐(0)
摘要:使用回归模型预测鲍鱼年龄 鲍鱼是一种贝类,在世界许多地方被认为是美味佳肴。是铁和泛酸的极好来源,也是澳大利亚、美洲和东亚的营养食品资源和农业。100克鲍鱼就能给人体提供超过 20% 上述每日摄入营养素。鲍鱼的经济价值与年龄正相关。因此,准确检测鲍鱼的年龄对养殖户和消费者确定鲍鱼的价格具有重要意义。 阅读全文
posted @ 2021-01-28 20:42 printf(); 阅读(248) 评论(0) 推荐(0)
摘要:第二讲:回归 numpy求矩阵的逆的函数 numpy.linalg模块包含线性代数的函数,可计算矩阵,求特征值,解线性方程组以及求解行列式等。 行列式:np.linalg.det(A) 计算逆矩阵:np.linalg.inv(A) import numpy as np#格式化numpy输出 np.s 阅读全文
posted @ 2021-01-27 21:20 printf(); 阅读(93) 评论(0) 推荐(0)
摘要:使用pagerunk对全球机场进行排序 import networkx as nx flights_network = nx.read_edgelist("./input/out.opsahl-openflights.csv",create_using=nx.DiGraph()) print("航班 阅读全文
posted @ 2021-01-26 22:50 printf(); 阅读(79) 评论(0) 推荐(0)
摘要:其他数学结构: Scikit-learn: python用于数据建模的第三方库 实现主要的及其学习,数据挖掘算法。 主要功能: 数据集预处理 数据集划分 构建模型 模型提升 模型评估 安装: 如果已安装anaconda则无需安装 手动安装pip install scikit-learn 建模流程: 阅读全文
posted @ 2021-01-24 18:50 printf(); 阅读(88) 评论(0) 推荐(0)
摘要:强化学习 数据的分类 训练集:用于训练模型的数据集 测试集:用预测是模型的数据集 模型:建立数据的输入x和输出y之间的映射关系y=f(x) 损失函数:L(yi,f(xi)) 机器学习的流程: 过拟合问题:参数过多,导致所选模型对已知数据预测的很好,但对未知数据预测很差 通过正则化解决,在错误函数上加 阅读全文
posted @ 2021-01-23 20:42 printf(); 阅读(83) 评论(0) 推荐(0)
摘要:Pandas高级处理 缺失值处理 数据离散化 合并 交叉表与透视表 分组与聚合 4.6 高级处理-缺失值处理 1)如何进行缺失值处理 两种思路: 1)删除含有缺失值的样本 2)替换/插补 4.6.1 如何处理nan 1)判断数据中是否存在NaN pd.isnull(df) pd.notnull(df 阅读全文
posted @ 2021-01-22 21:37 printf(); 阅读(85) 评论(0) 推荐(0)
摘要:4.3 DataFrame运算 算术运算 逻辑运算 逻辑运算符 布尔索引 逻辑运算函数 query() isin() 统计运算 min max mean median var std np.argmax() np.argmin() 自定义运算 apply(func, axis=0)True func 阅读全文
posted @ 2021-01-21 20:33 printf(); 阅读(78) 评论(0) 推荐(0)
摘要:Pandas 基础处理 Pandas是什么?为什么用? 核心数据结构 DataFrame Panel Series 基本操作 运算 画图 文件的读取与存储 高级处理 4.1Pandas介绍:基于numpy的一种工具,该工具是未解决数据分析任务而穿创建的,纳入了大量库和一些标准的数据模型,提供了高效的 阅读全文
posted @ 2021-01-20 20:49 printf(); 阅读(71) 评论(0) 推荐(0)
摘要:3.4 ndarray运算 逻辑运算 布尔索引 通用判断函数 np.all(布尔值) 只要有一个False就返回False,只有全是True才返回True np.any() 只要有一个True就返回True,只有全是False才返回False np.where(三元运算符) np.where(布尔值 阅读全文
posted @ 2021-01-19 20:50 printf(); 阅读(90) 评论(0) 推荐(0)
摘要:3.2 认识N维数组-ndarray属性 3.2.1 ndarray的属性 shape ndim size dtype itemsize 在创建ndarray的时候,如果没有指定类型 默认 整数 int64 浮点数 float64 3.2.2 ndarray的形状 [1, 2, 3, 4] [[1, 阅读全文
posted @ 2021-01-18 18:12 printf(); 阅读(75) 评论(0) 推荐(0)
摘要:Numpy 高效的运算工具Numpy的优势ndarray属性基本操作 ndarray.方法() numpy.函数名()ndarray运算 逻辑运算 统计运算 数组间运算合并、分割、IO操作、数据处理 3.1 Numpy优势 3.1.1 Numpy介绍 - 数值计算库,开源的数值计算扩展,可以用来存储 阅读全文
posted @ 2021-01-17 20:36 printf(); 阅读(83) 评论(0) 推荐(0)
摘要:2.3.1 常见图形种类及意义 折线图plot 散点图scatter 关系/规律 柱状图bar 统计/对比 直方图histogram 分布状况 饼图pie π 占比 2.3.2 散点图绘制 2.4 柱状图(bar) 2.4.1 柱状图绘制 2.5 直方图(histogram) 2.5.1 直方图介绍 阅读全文
posted @ 2021-01-16 20:28 printf(); 阅读(77) 评论(0) 推荐(0)
摘要:Matplotlib 2.1 Matplotlib之HelloWorld 2.1.1 什么是Matplotlib - 画二维图表的python库 mat - matrix 矩阵 二维数据 - 二维图表 plot - 画图 lib - library 库 matlab 矩阵实验室 mat - matr 阅读全文
posted @ 2021-01-15 20:37 printf(); 阅读(75) 评论(0) 推荐(0)
摘要:Jupyter notebook: Jupyter项目是一个非营利的开源项目,源于2014年的ipython项目,并逐渐发展为支持跨所有编程语言的交互式科学计算的工具 Jupyter Notebook,原名Ipython notebook,是ipython的网页加强版,一个开源的web应用程序 名字 阅读全文
posted @ 2021-01-14 18:59 printf(); 阅读(86) 评论(0) 推荐(0)
摘要:Pandas学习 Python数据分析常用库 Numpy:科学计算 Scipy:科学计算 Matplotlib:可视化 Pandas:数据分析 Scikit-learn:机器学习 奥运会数据分析举例: 1.数据的读取 1.1数据读写 从csv,xlsx,txt等文件格式中读取数据 import pa 阅读全文
posted @ 2021-01-13 21:30 printf(); 阅读(124) 评论(0) 推荐(0)
摘要:K近邻 当k值不同时结果也不相同 PageRank算法: Scikit-learn: Python用于数据建模的第三方库 实现主要的机器学习、数据挖掘算法 主要功能: 数据集预处理 数据集划分 构建模型 模型提升 模型评估 Anaconda自带scikit-learn 基本建模流程 常用函数: 主要 阅读全文
posted @ 2021-01-12 19:25 printf(); 阅读(94) 评论(0) 推荐(0)
摘要:学习内容:假期就安装了tensorflow和anaconda但是不太会使用,学习如何使用以及计算,老师的视频的tensorflow1.x但是我想学2.0还没有找到和老师提供视频内容差不多的视频,还在继续找。 学习时间:2h 博客量:2 遇到问题:由于老师的视频是1.0,自己安装的是2.0,在网上也搜 阅读全文
posted @ 2021-01-11 21:40 printf(); 阅读(71) 评论(0) 推荐(0)
摘要:文件的权限问题:windows系统下: 打开anaconda的share文件夹,右键jupyter属性,然后把权限打开,在重启jupyter linux系统下: chmod +777 jupyter 阅读全文
posted @ 2021-01-11 19:55 printf(); 阅读(823) 评论(0) 推荐(0)
摘要:有监督学习: 数据集中的样本带有标签 目标:找到样本到标签的最佳映射 应用场景:垃圾邮件分类,病理切片分类,客户流失预警,客户风险评估,房价预测等 典型方法: 回归模型:线性回归,岭回归,LASSO和回归样条等 分类模型:逻辑回归,K近邻,决策树,支持向量机等 无监督学习:根据数据本身的分布特点,挖 阅读全文
posted @ 2021-01-10 17:38 printf(); 阅读(81) 评论(0) 推荐(0)
摘要:机器学习的重要性: 大数据分析和人工智能已经成为整个社会发展最主要的基础推动力,两者的基础都是机器学习。 大数据分析火热的深刻原因: 数据源:非结构化数据(语音,视频,文本,网络数据) 模型和计算能力:深度学习、GPU、分布式系统 广泛的应用场景:营销,广告,金融,交通,医疗等 机器学习分类: 有监 阅读全文
posted @ 2021-01-08 21:41 printf(); 阅读(84) 评论(0) 推荐(0)
摘要:学习内容: 学习了scala的语法并且初步学习了tensorflow 学习时间:1h 代码量200 博客量1 遇到问题:由于之前学了但是忘了需要重新去看视频学习,但是进度比较快,但是视频时间比较长 阅读全文
posted @ 2021-01-07 22:55 printf(); 阅读(70) 评论(0) 推荐(0)
摘要:学习内容:了解了机器学习的概念,复习了scala 学习时间:1h 遇到问题:感觉数学有想不起来了,看视频一头雾水还要去看看数学 代码量:100 明天安排:由于之前安装了anaconda和tensorflow,但是没有具体深入学习,打算去深入学习,然后学习scala 阅读全文
posted @ 2021-01-05 21:16 printf(); 阅读(89) 评论(0) 推荐(0)
摘要:学习内容:由于要去学习spark,但是spark是基于scala语言的,所以在放假之前的时候学习了一点scala的基础语法,但是过了一个多月又忘的差不多了,所以又复习了一下scala的基础语法。主要看看视频和之前自己写的笔记 学习时间:3h 代码量:400 遇到问题:突然发现自己之前学的内容忘得差不 阅读全文
posted @ 2021-01-04 20:53 printf(); 阅读(84) 评论(0) 推荐(0)