随笔分类 -  大数据处理

1

数据标准化
摘要:1、z-score标准化(又叫z-normalize)方法适用于属性A的最大值和最小值未知的情况,或有超出取值范围的离群数据的情况。(ps:z-normlize一般是对同一个特征进行标准化,而不是对一个样例的不同特征进行标准化)。 2、标准化欧氏距离是针对简单欧氏距离的缺点而作的一种改进方案,就是先 阅读全文

posted @ 2017-12-10 18:15 WOTGL 阅读(302) 评论(0) 推荐(0)

本地连接远程Oracle数据库
摘要:由于项目开发测试,需要在本地连接远程的Oracle数据库 之前搭过环境,但是重装了系统,现在又重新装一遍 软件安装 连接远程Oracle需要两个软件: 一个Oracle客户端,instantclient-basic-win32-11.2.0.1.0.zip 一个PL/SQL开发环境 plsqldev 阅读全文

posted @ 2017-11-21 16:14 WOTGL 阅读(2630) 评论(0) 推荐(0)

Spark无法创建新线程
摘要:Spark提交程序报错,无法创建新的线程 原因是因为这台公用机器上跑的进程太多了,需要修改Linux参数,允许用户最大进程数 查看允许用户最大进程数配置 修改允许用户最大进程数配置 在文件后面追加一句,并使配置立即生效,设置太大也不好,Java内存不够用[囧] 阅读全文

posted @ 2017-11-13 17:14 WOTGL 阅读(403) 评论(0) 推荐(0)

Kafka命令
摘要:需求:用Spark给Kafka写数据,模拟线上环境。 需要先创建topic 后台启动Zookeeper 后台启动Kafka Spark往Kafka写数据 查看Kafka输出 阅读全文

posted @ 2017-11-13 13:33 WOTGL 阅读(203) 评论(0) 推荐(0)

Spark-SQL连接Hive
摘要:第一步:修个Hive的配置文件hive-site.xml 添加如下属性,取消本地元数据服务: 修改Hive元数据服务地址和端口: 然后把配置文件hive-site.xml拷贝到Spark的conf目录下 第二步:对于Hive元数据库使用Mysql的把mysql-connector-java-5.1. 阅读全文

posted @ 2017-09-24 17:52 WOTGL 阅读(12688) 评论(1) 推荐(1)

pyspark中使用累加器Accumulator统计指标
摘要:评价分类模型的性能时需要用到以下四个指标 最开始使用以下代码计算,发现代码需要跑近一个小时,而且这一个小时都花在这四行代码上 心想着理论上可以只扫描一遍数据就可以计算出这四个指标。 一开始在foreach函数中传递一个自定义评估函数,这个函数来统计上面四个指标,然后在函数里再使用全局变量TP,TN等 阅读全文

posted @ 2017-04-14 21:42 WOTGL 阅读(2240) 评论(0) 推荐(0)

Hive
摘要:Hive是基于HDFS的分布式数据仓库,可以说是Hadoop的一个插件工具,能够将HDFS结构化文件映射成数据库关系表 Hive最大的特点就是能够将类SQL语句转换成MapReduce,然后提交给Hadoop分布式执行。 使用Hive的使用跟MySQL有点类似,但是Hive不支持修改数据。 阅读全文

posted @ 2017-03-14 20:07 WOTGL 阅读(162) 评论(0) 推荐(0)

Linux上安装Squall
摘要:Squall是Storm之上的类SQL查询工具,能够将类SQL语句转换成topology,然后提交给Storm运行。 安装Squall前要先安装Java和sbt(simple build tool),通过这两个软件将Squall源码编译成squall-0.2.0.jar和squall-depende 阅读全文

posted @ 2016-09-20 19:28 WOTGL 阅读(307) 评论(0) 推荐(0)

Linux下librdkafka客户端的编译运行
摘要:Linux下librdkafka客户端的编译运行 librdkafka是一个开源的Kafka客户端C/C++实现,提供了Kafka生产者、消费者接口。 由于项目需要,我要将Kafka生产者接口封装起来给别人调用,所以先安装了librdkakfa,然后在demo上进行修改封装一个生产者接口。 [一] 阅读全文

posted @ 2016-09-09 11:26 WOTGL 阅读(10387) 评论(1) 推荐(0)

在eclipse中运行storm-starter
摘要:开源软件官网提供的demo无疑是学习开源软件的最好的最原始的样例。 在Storm官网里下载apache-storm-0.9.6.zip,里面\examples\storm-starter\src\jvm目录下有storm-starter demo。下面说一下如何在eclipse中运行这个demo。 阅读全文

posted @ 2016-09-07 20:22 WOTGL 阅读(2359) 评论(0) 推荐(0)

WebSocket实时异步通信
摘要:WebSocket实时异步通信 【一】WebSocket简介 WebSocket是HTML5推出一个协议规范,用来B/S模式中服务器端和客户端之间进行实时异步通信。 众所周知,传统的HTTP协议中,服务器端和客户端通信只能是在客户端发送一个请求之后,服务器端才能对其响应,也就是说服务器端是不能够主动 阅读全文

posted @ 2016-09-01 21:31 WOTGL 阅读(11952) 评论(0) 推荐(0)

消息系统Flume与Kafka的区别
摘要:首先Flume和Kafka都是消息系统,但是它俩也有着很多不同的地方,Flume更趋向于消息采集系统,而Kafka更趋向于消息缓存系统。 【一】设计上的不同 Flume是消息采集系统,它主要解决问题是消息的多元采集。因此Flume在实现上提供了多达十几种的Flume Source,以供用户根据不同的 阅读全文

posted @ 2016-08-31 21:19 WOTGL 阅读(5190) 评论(0) 推荐(0)

Flume连接Kafka的broker出错
摘要:在启动Flume的时候,出现下面的异常,但是程序照样能运行,Kafka也能够收到数据,只是偶尔会断点。 2016-08-25 15:32:54,561 (SinkRunner-PollingRunner-DefaultSinkProcessor) [INFO - kafka.utils.Loggin 阅读全文

posted @ 2016-08-30 19:42 WOTGL 阅读(1083) 评论(0) 推荐(0)

Flume简介与使用(三)——Kafka Sink消费数据之Kafka安装
摘要:前面已经介绍了如何利用Thrift Source生产数据,今天介绍如何用Kafka Sink消费数据。 其实之前已经在Flume配置文件里设置了用Kafka Sink消费数据 那么当Flume的channel收到数据的时候,会根据配置文件主动把数据event发送到Kafka的broker上,所以只要 阅读全文

posted @ 2016-08-30 00:31 WOTGL 阅读(6671) 评论(0) 推荐(0)

Flume OutOfMemoryError错误
摘要:Flume OutOfMemoryError错误 运行Flume没多久就报下面的异常: 2016-08-24 17:35:58,927 (Flume Thrift IPC Thread 8) [ERROR - org.apache.flume.channel.ChannelProcessor.pro 阅读全文

posted @ 2016-08-27 20:00 WOTGL 阅读(3334) 评论(0) 推荐(0)

Flume简介与使用(二)——Thrift Source采集数据
摘要:Flume简介与使用(二)——Thrift Source采集数据 继上一篇安装Flume后,本篇将介绍如何使用Thrift Source采集数据。 Thrift是Google开发的用于跨语言RPC通信,它拥有功能强大的软件堆栈和代码生成引擎,允许定义一个简单的IDL文件来生成不同语言的代码,服务器端 阅读全文

posted @ 2016-08-27 18:45 WOTGL 阅读(3689) 评论(0) 推荐(0)

Flume简介与使用(一)——Flume安装与配置
摘要:Flume简介与使用(一)——Flume安装与配置 Flume简介 Flume是一个分布式的、可靠的、实用的服务——从不同的数据源高效的采集、整合、移动海量数据。 分布式:可以多台机器同时运行采集数据,不同Agent的之前通过网络传输数据 可靠的:Flume会将采集的数据缓存在Channel里,当S 阅读全文

posted @ 2016-08-26 14:50 WOTGL 阅读(9432) 评论(0) 推荐(0)

Storm集群扩容——从单机模式拓展到集群模式,以此类推
摘要:Storm是分布式的实时流处理系统,单机模式肯本不能体现其强大特点,尤其是当需要处理的数据很大很快的 时候,Storm可以随时扩容,而且操作非常简单,编写的应用程序自动负载均衡。 前面已经介绍了如何安装Storm——单机模式,如果已经成功安装好了单机模式的Storm,那么扩容就非常简 单了。 1. 阅读全文

posted @ 2016-08-25 14:10 WOTGL 阅读(1089) 评论(0) 推荐(0)

如何在Linux上安装Storm
摘要:Storm是开源的分布式实时计算系统,能够让数据流处理变得简单、可靠,也因此在大数据领域有广泛的实际 应用。下面介绍一下如何在Linux系统上安装Storm。根据Storm官网介绍,安装Storm软件分五步: 一、Storm作为分布式系统,它的运行需要借助Zookeeper来进行协同。因此安装Sto 阅读全文

posted @ 2016-08-22 11:22 WOTGL 阅读(3937) 评论(0) 推荐(0)

Zookeeper简介与安装
摘要:Zookeeper:A Distributed Coordination Service for Distributed Applications. 一、Zookeeper简介 众所周知,协同服务是分布式应用首先要解决的一大难题,尤其是在存在资源竞争和死锁的情况。Zookeeper就是这样一个应用, 阅读全文

posted @ 2016-08-22 10:48 WOTGL 阅读(983) 评论(0) 推荐(0)

1

导航