06 2019 档案
摘要:可将hive-sql的数据类型分为两大类 : 基础数据类型 数据类型 tinyint samllint int bigint 二进制类型 bollean float double string binary timestamp decimal char varchar date samllint 复
阅读全文
摘要:特征工程:将特征转换成矩阵的数值 找到与问题有关的特征信息 收集数据特征的方法: 1.分布分析 2.对比分析 3.统计分析 4.贡献度分析(帕累托分析) 5.相关性分析 分布分析 用来解释数据的分布类型和分布特征,显示其分布情况 a.对定量的数据进行分布分析 步骤: 1.求极差 2.决定组距与组数
阅读全文
posted @ 2019-06-26 13:16
leims
摘要:1.anaconda 1.什么是 anaconda 便捷获取包,对包进行管理,对环境可以进行统一管理包含了 conda python 180多个科学包1.1什么是包python类、模块、包的区别1.1.1类 将数据和操作进行封装,以便将来的复用1.1.2模块 对应一个文件;创建一个脚本文件后,定义了
阅读全文
posted @ 2019-06-26 13:15
leims
摘要:PCA 主成分分析1.什么是主成分分析 即 什么是降维2.有什么作用 如何应用3.为什么进行主成分分析 即为什么降维 通过正交变换将一组可能存在相关性的变量 转成 一组线性不相关 的变量主成分分析 奇异值分解 why变量之间存在相关性,增加了问题分析的复杂性作用:减少分析的指标同时,尽量减少原指标包
阅读全文
posted @ 2019-06-26 11:39
leims
摘要:首先我们学习hadoop的时候,为了让我们不太会java语言但是对SQL很熟悉的工程师能够操作基本的mapreduce计算过程,Hive被设计出来了。 Hive就好比是hadoop在执行MR(mapreduce)程序的一个操作系统,可以用简单的SQL语句去代替复杂的MR程序,因为Hive可以将我们的
阅读全文
posted @ 2019-06-26 11:37
leims
摘要:向量空间模型 文本可用 字、词组、短语、甚至‘概念’等元素表示 用来表示文本的性质,称为文本的特征 区别文本的属性 特征选择就是要选择最能表征文本含义的词组元素 方法: 文档频率 信息增益 卡方检验 互信息 文档频率(DF) 某一词组出现在文档中的频率称为文档频率(DF) DF=出现词组的文本数/数
阅读全文
posted @ 2019-06-26 11:35
leims
摘要:词项权重计算 词项频率 如何才能对检索的文档进行评分和排序呢?一个合理的想法是,如果一篇文档包含的查询词的数目越多,那么这篇文档与查询相关的可能性就越高,就意味着更可能是用户所需要的文档。 【如果只考虑词频,那么长文本会更可能包含更多的查询词而获得评分优势; 需要消除文档长度对评分的影响,这也是向量
阅读全文
posted @ 2019-06-26 11:33
leims
摘要:移除重复数据 利用函数或映射进行数据转换 替换值 重命名轴索引 离散化和面元划分 检测和过滤异常值 排列和随机采样 计算指标/哑变量
阅读全文
posted @ 2019-06-26 11:32
leims
摘要:认知升级 完事只能靠自己 能力提升; 三份训练,七分认识 能力管理 布局能力 专业能力 自己独立做事情的能力 安身立命之本 使用能力 与人合作的能力 沟通 协作 表达呈现 团队管理;团队中每个人都有自己的优势 将自己分内的事情做好,又要求人们有团队合作的意识和能力 提升方向感 人生方向感 行业方向感
阅读全文
posted @ 2019-06-26 11:31
leims
摘要:sklearn.linear_model.logisticregression (penlty='l2',dual=false,tol=0.0001,C=1.0,fit_intercept=true,intercept_scaling=1,class_weight=none,random_state
阅读全文
posted @ 2019-06-26 11:29
leims
摘要:用于显示主要分类指标的文本报告,在报告中显示每个类的精确度,召回率,F1值等 主要参数: y_true:1维数组,或标签指示器数组/稀疏矩阵,目标值。 y_pred:1维数组,或标签指示器数组/稀疏矩阵,分类器返回的估计值。 labels:array,shape = [n_labels],报表中包含
阅读全文
posted @ 2019-06-26 11:28
leims
摘要:广义线性模型包括 logistic回归与多重线性回归,最大区别是因变量不同 logistic回归:二项分布 多重线性回归:连续变量 poisson回归:poisson分布 负二项回归:负二项分布 logistic回归的主要用途: 寻找危险因素 预测 判别 常规步骤 寻找h函数(hypothesis)
阅读全文
posted @ 2019-06-26 11:28
leims
摘要:由于各评价指标的性质不同,通常具有不同的量纲和数量级 直线方法(极值法、标准差法) 折线方法(三折线法) 曲线型法(半正态性分布) 不同的标准化方法,对系统的评价结果会产生不同的影响 常见的方法:min-max标准化、log函数转换、atan函数转换、z-score标准化、模糊量化发 数据的标准化,
阅读全文
posted @ 2019-06-26 11:27
leims
摘要:lateral view 把结果组合,产生一个支持别名表的虚拟表 select A,B from table_1 lateral view explode(B) mytable as B [1, 2] ['a', 'b', 'c'][3, 4] ['d', 'e', 'f'] 同时把第一列和第二列拆
阅读全文
posted @ 2019-06-26 11:25
leims
摘要:处理缺失数据: 根据各标签的值中 是否存在缺失数据对轴标签进行过滤,可通过阈值调节对缺失值的容忍程度 用指定值或插值方法(如ffill 或 bfill ) 填充缺失数据 返回一个含有布尔值的对象,这些布尔值表示哪些值是缺失值 NA ,该对象的类型与源类型一样 过滤缺失数据 可以通过pandas.is
阅读全文
摘要:根据已有模型学习python 首先用到panda 1.panda.read_excel() 读取excel表 2.panda.concat() 合并数据 合并数据集 merge函数 concat函数
阅读全文
posted @ 2019-06-26 11:22
leims
摘要:为了使计算机能够真正处理文本特征,必须对文本特征进行特征加权,将文本表示成计算机可以处理的数学向量 1.布尔模型--即命中模型 是基于特征项的严格匹配模型 可以看做向量模型的特例 根据特征是否在文档中出现 特征的权值只能取或 首先,建立一个二值变量的集合,这些变量对应于文本的特征项 文本用这些特征变
阅读全文
posted @ 2019-06-26 11:21
leims

浙公网安备 33010602011771号