随笔分类 -  我的大数据

摘要:一些分布式相关问题(分布式缓存、分布式锁、分布式session、分布式事务、分布式搜索、Dubbo与SpringCloud、分布式存储MongoDB、高并发系统架构的组成)分布式缓存项目中使用缓存可以做到:高性能(把复杂耗时操作结果缓存起来),高并发(高额的... 阅读全文
posted @ 2018-12-24 20:38 大竹薙子与豆子 阅读(449) 评论(0) 推荐(0)
摘要:一、Netty引言基于NIO一款异步通讯框架,因为在使用上相比较Mina较为简单,开发门槛低导致了Netty在互联网开发中受到绝大多数商用项目成功验证,导致了Netty成为NIO开发的首选框架。“快速”和“简单”并不用产生维护性或性能上的问题。Netty ... 阅读全文
posted @ 2018-12-21 21:54 大竹薙子与豆子 阅读(174) 评论(0) 推荐(0)
摘要:一、通道选择器通道注册:需要使用Selector管理通道,然后将就绪的通道封装成SelectionKey对象。设置通道为非阻塞 ServerSocketChannel/SocketChannel#configureBlocking(false)注册通道Ser... 阅读全文
posted @ 2018-12-21 21:51 大竹薙子与豆子 阅读(170) 评论(0) 推荐(0)
摘要:一、引言系统架构演变随着互联网的发展,网站应用的规模不断扩大,常规的垂直应用(MVC)架构已无法应对,分布式服务架构以及流动计算架构(伸缩性)势在必行,亟需一个治理系统确保架构有条不紊的演进。单一架构:例如早期servlet/jsp - ORM(对象关系映射... 阅读全文
posted @ 2018-12-21 21:47 大竹薙子与豆子 阅读(142) 评论(0) 推荐(0)
摘要:一、引言什么是消息?消息是系统间通信的载体,系统通讯(RPC)的介质,是分布式应用中不可或缺的一部分。目前系统间发送消息的方式有两种:①同步消息(即时消息),生产消费同时存在,必须建立会话;②异步消息(离线消息),生产不关心消费,不必建立会话,消费者自行消费... 阅读全文
posted @ 2018-12-12 23:52 大竹薙子与豆子 阅读(287) 评论(0) 推荐(0)
摘要:一、[root@CentOS ~]# /usr/zookeeper-3.4.6/bin/zkServer.sh start zoo.cfgJMX enabled by defaultUsing config: /usr/zookeeper-3.4.6/bin... 阅读全文
posted @ 2018-12-12 23:50 大竹薙子与豆子 阅读(130) 评论(0) 推荐(0)
摘要:一、SpringDataMongoDBSpringData家族成员之一,用于操作MongoDB的持久层框架,封装了底层的mongodb-driver导入依赖 org.springframework.boot spring-boot-starter... 阅读全文
posted @ 2018-12-12 23:47 大竹薙子与豆子 阅读(125) 评论(0) 推荐(0)
摘要:一、容器的创建与远程连接下载镜像(此步省略)docker pull elasticsearch:5.6.8创建容器docker run -di --name=tensquare_elasticsearch -p 9200:9200 -p 9300:9300 ... 阅读全文
posted @ 2018-12-12 12:43 大竹薙子与豆子 阅读(198) 评论(0) 推荐(0)
摘要:零、了解推荐算法推荐算法算法是什么?我们可以把它简化为一个函数。函数接受若干个参数,输出一个返回值。推荐算法是计算机专业中的一种算法,通过一些数学算法,推测出用户可能喜欢的东西,多用于电商项目中。所谓推荐算法就是利用用户的一些行为,通过一些数学算法,推测出用... 阅读全文
posted @ 2018-12-08 12:17 大竹薙子与豆子 阅读(168) 评论(0) 推荐(0)
摘要:一、MapReduce任务提交(前4步)(源码分析——前4步发生在client node 上)Job.java 从1292行 /** * Submit the job to the cluster and return immediately. *... 阅读全文
posted @ 2018-12-08 12:13 大竹薙子与豆子 阅读(217) 评论(0) 推荐(0)
摘要:零、回顾小TipsGoogle发表的一系列文章:GoogleFileSystem、MapReduce、BigTables、SpannerBigTables是Google设计的分布式数据存储系统,用来处理海量的数据的一种非关系型的数据库。Spanner(Spa... 阅读全文
posted @ 2018-12-08 12:11 大竹薙子与豆子 阅读(173) 评论(0) 推荐(0)
摘要:零、SSH密码认证流程一、HDFS架构简单了解HDFSHDFS借鉴了GFS的数据冗余度思想存在批量的硬盘;【DataNode 数据节点】HDFS默认冗余度为“3”,就是一份同样数据保存三份;利用“水平复制”提升上传效率;以“数据块”作为单位进行数据传输(1.... 阅读全文
posted @ 2018-12-05 18:50 大竹薙子与豆子 阅读(211) 评论(0) 推荐(0)
摘要:零、概述一、概述Hadoop衍生自Nutch(搜索引擎和web爬虫),面临的问题:海量数据存储和计算Big Data大数据,谈的不仅仅是数据量,其实包含了数据量(Volume)、时效性(Velocity)、多样性(Variety)、可疑性(Veracity)... 阅读全文
posted @ 2018-12-04 07:46 大竹薙子与豆子 阅读(240) 评论(0) 推荐(0)
摘要:一、MongoDB副本集概要什么是MongoDB副本集?副本集是一组mongodb进程,它维护了同样的数据集。副本集提供了信息冗余和高可用,是所有生产部署的基础。客户端,读写操作主节点,然后将数据复制到副节点中。节点Primary Node 主节点,一个副本... 阅读全文
posted @ 2018-12-02 22:37 大竹薙子与豆子 阅读(187) 评论(0) 推荐(0)