随笔分类 -  大数据

摘要:Kafka是什么? Kafka是一个分布式,有分区的,有副本的日志服务系统,由LinkedIn公司开发,并于2011年开源。从本质上来说,Kafka拥有一套可扩展的发布/订阅消息队列架构,并组成了一套分布式的日志系统,这套系统的创建,是为任何一家大公司搭建一套可处理实时数据的统一平台。 和许多其他消 阅读全文
posted @ 2020-04-09 14:55 全能程序猿 阅读(15656) 评论(1) 推荐(0)
摘要: 在分布式系统中,通常使用多个术语来标识主要副本和辅助副本。本指南通常使用“主”来引用队列的主要副本,而对于辅助副本则使用“镜像”。但是,你会发现“master”在这里和那里使用。这是因为RabbitMQ CLI工具历史上一直使用术语“master”来指代辅助。因此这两个术语目前可以互换使用,但我们希望最终摆脱传统的术语。 阅读全文
posted @ 2017-12-15 09:46 全能程序猿 阅读(3217) 评论(0) 推荐(0)
摘要: 以下仅限kafka版本0.9以上Consumer新版ap 阅读全文
posted @ 2017-12-15 09:46 全能程序猿 阅读(995) 评论(0) 推荐(0)
摘要: RabbitMQ有一个基本的吞吐量测试工具PerfTest(文档,源代码和版本),它基于Java客户端,可以配置为模拟基本工作负载。PerfTest有额外的工具可以生成输出的HTML图形。RabbitMQ集群可能受到很多因素的限制,从基础设施级限制(如网络带宽)到RabbitMQ配置和拓扑到发布和使用的应用程序。PerfTest可以演示节点或节点集群的基准性能。 阅读全文
posted @ 2017-12-15 09:45 全能程序猿 阅读(10353) 评论(4) 推荐(0)
摘要: 使用主机列表 可以将Address数组传递给newConnection()。的地址是简单地在一个方便的类com.rabbitmq.client包与主机 和端口组件。 阅读全文
posted @ 2017-12-15 09:44 全能程序猿 阅读(1441) 评论(0) 推荐(0)
摘要: 当可用磁盘空间低于配置的限制(默认为50MB)时,将触发警报,所有生产者将被阻止。目标是避免填满整个磁盘,这将导致节点上的所有写操作失败,并可能导致RabbitMQ终止。为了减少填满磁盘的风险,所有传入的消息都被阻止。在内存不足的情况下,瞬时消息仍然被分页到磁盘,并且会占用已经有限的磁盘空间。如果磁盘警报设置得太低,并且信息被快速转出,则可能会耗尽磁盘空间,并在磁盘空间检查(至少间隔10秒)之间崩溃RabbitMQ。 阅读全文
posted @ 2017-12-15 09:43 全能程序猿 阅读(3510) 评论(0) 推荐(0)
摘要: 客户端API严格按照AMQP 0-9-1协议规范进行建模,并提供了易于使用的附加抽象。 RabbitMQ Java客户端使用com.rabbitmq.client作为其顶层包。关键的类和接口是: - Channel - Connection - ConnectionFactory - Consumer 阅读全文
posted @ 2017-12-15 09:43 全能程序猿 阅读(2782) 评论(0) 推荐(0)
摘要: rabbitmqctl set_vhost_limits是用来定义虚拟主机限制的命令 阅读全文
posted @ 2017-12-15 09:42 全能程序猿 阅读(2466) 评论(0) 推荐(0)
摘要: RabbitMQ用户增删及权限控制 用户角色分类 阅读全文
posted @ 2017-12-01 11:03 全能程序猿 阅读(21543) 评论(0) 推荐(1)
摘要: CDN的全称是Content Delivery Network,即内容分发网络。 其基本思路是尽可能避开互联网上有可能影响数据传输速度和稳定性的瓶颈和环节,使内容传输的更快、更稳定。通过在网络各处放置节点服务器所构成的在现有的互联网基础之上的一层智能虚拟网络,CDN系统能够实时地根据网络流量和各节点的连接、负载状况以及到用户的距离和响应时间等综合信息将用户的请求重新导向离用户最近的服务节点上。 阅读全文
posted @ 2017-11-14 14:25 全能程序猿 阅读(12462) 评论(0) 推荐(0)
摘要: Apache Kafka是一个高度可扩展的消息传递系统,作为LinkedIn的中央数据管道起着至关重要的作用。 Kafka 是在2010年在LinkedIn开发的,它目前在1400多家经纪商处理超过1.4万亿条消息。Kafka 强大的耐用性和低延迟使我们能够使用Kafka为LinkedIn提供一些新的关键任务用例。其中包括用基于Kafka的复制,威尼斯替代Espresso中的 MySQL复制,并支持下一代Databus(正在开发中)。 阅读全文
posted @ 2017-11-14 14:18 全能程序猿 阅读(1019) 评论(0) 推荐(0)
摘要: 以下是Kafka 1.0.0发行版中解决的JIRA问题的摘要。有关该版本的完整文档,入门指南以及有关该项目的信息,请参阅Kafka项目网站。 有关升级的注意事项:在升级群集之前,请仔细阅读此版本的 升级文档。升级说明讨论关于不兼容的重要信息以及突破性变化,性能变化以及可能影响您的Kafka生产部署的任何其他变更。 阅读全文
posted @ 2017-11-14 14:14 全能程序猿 阅读(608) 评论(0) 推荐(0)
摘要: 自从0.10版本推出以来,Streams API已经在包括Pinterest,Rabobank,Zalando和The New York Times在内的Kafka用户中广受欢迎。在1.0中,API继续健康地发展。首先,构建器API已经得到改进(KIP-120)。已经添加了一个新的API来显示运行时活动任务的状态(KIP-130)。新的cogroup API使用代码更少的StateStores和更少的运动部件(KIP-150)来处理分区聚合更容易。通过增强print()和writeAsText()方法(KIP-160),可调试性变得更加容易。如果这还不够,请查看KIP-138和KIP-161。有关更多流,请查看Apache Kafka Streams 文档,包括一些有用的新教程视频。 阅读全文
posted @ 2017-11-14 14:11 全能程序猿 阅读(2049) 评论(0) 推荐(0)
摘要: Redis在很多方面与其他数据库解决方案不同:它使用内存提供主存储支持,而仅使用硬盘做持久性的存储;它的数据模型非常独特,用的是单线程。另一个大区别在于,你可以在开发环境中使用Redis的功能,但却不需要转到Redis。 转向Redis当然也是可取的,许多开发者从一开始就把Redis作为首选数据库;但设想如果你的开发环境已经搭建好,应用已经在上面运行了,那么更换数据库框架显然不那么容易。另外在一些需要大容量数据集的应用,Redis也并不适合,因为它的数据集不会超过系统可用的内存。所以如果你有大数据应用,而且主要是读取访问模式,那么Redis并不是正确的选择。 阅读全文
posted @ 2017-10-12 11:16 全能程序猿 阅读(3262) 评论(0) 推荐(0)
摘要: Sentinel(哨兵)是Redis 的高可用性解决方案:由一个或多个Sentinel 实例 组成的Sentinel 系统可以监视任意多个主服务器,以及这些主服务器属下的所有从服务器,并在被监视的主服务器进入下线状态时,自动将下线主服务器属下的某个从服务器升级为新的主服务器。 阅读全文
posted @ 2017-09-26 16:18 全能程序猿 阅读(357) 评论(0) 推荐(0)
摘要: Redis 通过 PUBLISH 、 SUBSCRIBE 等命令实现了订阅与发布模式, 这个功能提供两种信息机制, 分别是订阅/发布到频道和订阅/发布到模式, 下文先讨论订阅/发布到频道的实现, 再讨论订阅/发布到模式的实现。 阅读全文
posted @ 2017-09-21 10:46 全能程序猿 阅读(326) 评论(0) 推荐(1)
摘要: Redis 通过 MULTI 、 DISCARD 、 EXEC 和 WATCH 四个命令来实现事务功能, 本章首先讨论使用 MULTI 、 DISCARD 和 EXEC 三个命令实现的一般事务, 然后再来讨论带有 WATCH 的事务的实现。 因为事务的安全性也非常重要, 所以本章最后通过常见的 ACID 性质对 Redis 事务的安全性进行了说明。 阅读全文
posted @ 2017-09-20 17:09 全能程序猿 阅读(563) 评论(2) 推荐(2)
摘要: HBase是一个分布式的、面向列的开源数据库,该技术来源于 Fay Chang所撰写的Google论文“Bigtable:一个结构化数据的分布式存储系统”。就像Bigtable利用了Google文件系统(File System)所提供的分布式数据存储一样,HBase在Hadoop之上提供了类似于Bigtable的能力。HBase是Apache的Hadoop项目的子项目。HBase不同于一般的关系数据库,它是一个适合于非结构化数据存储的数据库。另一个不同的是HBase基于列的而不是基于行的模式。 阅读全文
posted @ 2017-08-11 15:25 全能程序猿 阅读(1132) 评论(2) 推荐(1)
摘要: Hbase集群监控 Hbase JMX集群监控,监控每个regionServer的总请求数,readRequestsCount,writeRequestCount,region分裂,region合并,Store 数据来源:/jmx?qry=Hadoop:service=HBase,name=RegionServer,sub=Server 阅读全文
posted @ 2017-08-10 14:13 全能程序猿 阅读(8997) 评论(4) 推荐(1)
摘要: kafka使用场景 Kafka被当作传统消息中间件的替代品。消息中间件的使用原因有多种(从数据生产者解耦处理,缓存未处理的消息等)。与大多数消息系统相比,Kafka具有更好的吞吐量,内置的分区,多副本和容错功能,这使其成为大规模消息处理应用程序的良好解决方案。 阅读全文
posted @ 2017-08-05 20:11 全能程序猿 阅读(1377) 评论(0) 推荐(0)