Terry's blog

Focus on bigdata and cloud.

博客园 首页 新随笔 联系 订阅 管理
上一页 1 ··· 35 36 37 38 39 40 41 42 43 ··· 77 下一页

2007年7月25日 #

摘要: xml 导入 public static System.Data.DataTable GetXmlTable(string fileName) { System.Data.DataSet dataSetXml; System.Data.DataTable dataTableXml; ... 阅读全文
posted @ 2007-07-25 11:48 王晓成 阅读(2052) 评论(0) 推荐(0)

2007年7月24日 #

摘要: 创建型模式 1.单件模式 意图:保证一个类仅有一个实例,并提供一个访问它的全局访问点。 适用性: (1)当类只能有一个实例而且客户可以从一个众所周知的访问点访问它时。 (2)当这个唯一实例应该是通过子类化可扩展的,并且客户应该无需更改代码 就能使用一个扩展的实例时。 2.抽象工厂 动机:(1)一系列相互依赖... 阅读全文
posted @ 2007-07-24 11:58 王晓成 阅读(395) 评论(0) 推荐(0)

2018年10月28日 #

摘要: 1. Spark RDD 创建操作 1.1 数据集合 parallelize 可以创建一个能够并行操作的RDD。其函数定义如下: 由定义可见有两个参数,第一个参数指定数据集合,第二个参数指定数据分区。 实例:由普通数组创建RDD scala> val data=Array(1,2,3,4,5,6,7 阅读全文
posted @ 2018-10-28 21:56 王晓成 阅读(3026) 评论(0) 推荐(0)

2018年10月26日 #

摘要: 工作中处理数据时,发现某个表的数据达近亿条,所以要为表建索引提高查询性能,以下两篇文章总结的很好,记录一下,以备后用。 数据库建立索引常用的规则如下: 1、表的主键、外键必须有索引; 2、数据量超过300的表应该有索引; 3、经常与其他表进行连接的表,在连接字段上应该建立索引; 4、经常出现在Whe 阅读全文
posted @ 2018-10-26 11:46 王晓成 阅读(20501) 评论(3) 推荐(4)

摘要: 问题描述: 1. 使用spark sql处理数据逻辑,逻辑处理后使用 df.write.mode(saveMode).jdbc(url, tableName, connectionProperties)将数据写入mysql,创建的数据结构为: CREATE TABLE `userinfo` ( `u 阅读全文
posted @ 2018-10-26 11:29 王晓成 阅读(13354) 评论(0) 推荐(0)

2018年10月25日 #

摘要: 原文出处: 高广超译序本指南根据 Jakob Jenkov 最新博客翻译,请随时关注博客更新:http://tutorials.jenkov.com/java-util-concurrent/index.html。本指南已做成中英文对照阅读版的 pdf 文档,有兴趣的朋友可以去 Java并发工具包j 阅读全文
posted @ 2018-10-25 18:27 王晓成 阅读(806) 评论(0) 推荐(0)

2018年10月24日 #

摘要: 随着Web2.0的发展,如今已经进入了一个数据爆炸的时代。人们想要找到自己需要的信息也越来越难。 –因此有了Search,在用户对自己需求相对明确的时候,用Search能很快的找到自己需要的数据 –但很多情况下,用户其实并不明确自己的需要,或者他们需要更加符合他们个人口味和喜好的结果,因此出现了Re 阅读全文
posted @ 2018-10-24 19:03 王晓成 阅读(554) 评论(0) 推荐(0)

摘要: K-近邻算法(KNN)概述 KNN是通过测量不同特征值之间的距离进行分类。它的思路是:如果一个样本在特征空间中的k个最相似(即特征空间中最邻近)的样本中的大多数属于某一个类别,则该样本也属于这个类别,其中K通常是不大于20的整数。KNN算法中,所选择的邻居都是已经正确分类的对象。该方法在定类决策上只 阅读全文
posted @ 2018-10-24 16:09 王晓成 阅读(368) 评论(0) 推荐(0)

摘要: 贝叶斯法则 机器学习的任务:在给定训练数据A时,确定假设空间B中的最佳假设。 最佳假设:一种方法是把它定义为在给定数据A以及B中不同假设的先验概率的有关知识下的最可能假设 贝叶斯理论提供了一种计算假设概率的方法,基于假设的先验概率、给定假设下观察到不同数据的概率以及观察到的数据本身 先验概率和后验概 阅读全文
posted @ 2018-10-24 11:58 王晓成 阅读(968) 评论(0) 推荐(0)

2018年10月23日 #

摘要: 决策树学习是应用最广的归纳推理算法之一,是一种逼近离散值函数的方法,主要的算法有:ID3算法、C4.5算法及CART。 在机器学习中,决策树是一种预测模型,代表的是一种对象属性与对象值之间的一种映射关系,每一个节点代表某个对象,树中的每一个分叉路径代表某个可能的属性值,而每一个叶子节点则对应从根节点 阅读全文
posted @ 2018-10-23 18:15 王晓成 阅读(1091) 评论(0) 推荐(0)

上一页 1 ··· 35 36 37 38 39 40 41 42 43 ··· 77 下一页