摘要:HBASE 安装启动 vim hbase-site.xml <configuration> 开启伪分布式 <property> <name>hbase.cluster.distributed</name> <value>true</value> </property> 设置HBASE 数据的存储地址
阅读全文
摘要:临时分区 临时分区是归属于某一分区表的。只有分区表可以创建临时分区。这块很核心只有分区表才会有临时分区。 规则: 临时分区的分区字段和正式分区一样 临时分区的名称必须不一样并且和正式分区也不一样 临时分区支持添加、删除、替换操作 临时分区的添加和正式分区的添加操作相似。临时分区的分区范围独立于正式分
阅读全文
摘要:概述 Doris现在支持Broker load/routine load/stream load/mini batch load等多种导入方式。 spark load主要用于解决初次迁移,大量数据迁移doris的场景,用于提升数据导入的速度。 导入方式 所有导入方式都支持 csv 数据格式。其中 B
阅读全文
摘要:Doris存储文件格式优化 GROUPING SETS 设计文档 GROUP BY GROUPING SETS 是对 GROUP BY 子句的扩展,它能够在一个 GROUP BY 子句中一次实现多个集合的分组。其结果等价于将多个相应 GROUP BY 子句进行 UNION 操作。 SELECT k1
阅读全文
摘要:审计日志插件 Doris 的审计日志插件是在 FE 的插件框架基础上开发的。是一个可选插件。用户可以在运行时安装或卸载这个插件。 该插件可以将 FE 的审计日志定期的导入到指定 Doris 集群中,以方便用户通过 SQL 对审计日志进行查看和分析。 Doris On ES Doris-On-ES将D
阅读全文
摘要:安装 下载安装包,进入目录 以下命令启动 ./bin/elasticsearch 。 如果这时报错"max virtual memory areas vm.maxmapcount [65530] is too low",要运行下面的命令。 sudo sysctl -w vm.max_map_coun
阅读全文
摘要:概述 安装 FE URL地址如下: http://hostname:8030/system?path=//frontends SHOW PROC '/backends'; SHOW PROC '/frontends'; 简单使用 Doris 采用 MySQL 协议进行通信,用户可通过 MySQL c
阅读全文
摘要:概述 hive要使用,最常设置的包括元数据存储到 MySQL。 启动 HiveMetaStore 服务 , 该服务的作用就是 元数据存储的中介, 所有元数据操作通过它去交互。这样只需要部署一个该服务,就可以扩展多个 hive client 进行访问。 启动方式如下: hive --service m
阅读全文
摘要:概述 为什么需要这种存储 ? 静态数据: 以 HDFS 引擎作为存储引擎,适用于高吞吐量的离线大数据分析场景。 这类存储的局限性是数据无法进行随 机的读写。 就是不支持按照行去检索, 不支持行级别的update 和 delete 动态数据:以 HBase、Cassandra 作为存储引擎,适用于大数
阅读全文
摘要:DS 安装 参考官网:https://dolphinscheduler.apache.org/en-us/docs/latest/user_doc/cluster-deployment.html 部署用户获取sudo权限; host配置,ssh免密,部署目录修改所属用户; 数据库初始化:修改conf
阅读全文
摘要:概述 为什么需要一个复杂的工作量调度器? 1、一个完整的数据分析系统通常都是由大量任务单元组成:shell脚本程序,java程序,mapreduce程序、 hive脚本等 2、各任务单元之间存在时间先后及前后依赖关系 3、为了很好地组织起这样的复杂执行计划,需要一个工作流调度系统来调度执行 Apac
阅读全文
摘要:集成外部组件 集成各种插件就是通过 AgentPlugin , 这样当请求到达对应的服务时,会进行拦截,权限有问题直接退回。 集成外部组件就需要用到 Ranger 的一个核心组件 AgentPlugin,即通过安装插件的方式去集成, Ambari 替我们安装好了插件,只需要启用插件即可。 集成分两种
阅读全文
摘要:各种安全组件对比 常见大数据权限方案: 1、Kerberos(开源常用方案,业界比较常用的方案) 2、Apache Sentry(Cloudera 选用的方案,CDH 版本中集成,CDP 中已经换成了Ranger) 3、Apache Ranger(Hortonworks 选用的方案,HDP 发行版中
阅读全文
摘要:概述 Apache Atlas 是 Hadoop 社区为解决 Hadoop 生态系统的元数据治理问题而产生的开源项目,它为 Hadoop 集群提供了包括 数据分类、集中策略引擎、数据血缘、安全和生命周期管理 在内的元数据治 理核心能力。 1、Atlas 支持各种 Hadoop 和非 Hadoop 元
阅读全文
摘要:前缀 常用数据收集和迁移: flume,canal,sqoop,datax,waterdrop等 常用任务调度: azkaban,oozie,dophinscheduler,airflow 常用部署运维: cloudera manager, ambari,SaltStack等 常用监控告警: Ale
阅读全文
摘要:RocketMQ vs. ActiveMQ vs. Kafka Messaging Product Client SDK Protocol and Specification Ordered Message Scheduled Message Batched Message BroadCast Me
阅读全文
摘要:前提 目前 mybatis 基本不直接使用, 而是使用 baomidou 进行增强,这个框架的背景图就是 红斗罗好基友的照片。简直就是mybatis 的孪生栾弟。 基本使用步骤如下: 通过 baomidou 自带的 CodeGenerator 生成器生成对应表的 dao 、do、service、ac
阅读全文
摘要:概述 单机事务依赖于关系型数据库非常容易就实现保证了,但是现在系统基本都是分布式的,RPC 调用等,需要保证跨网络的分布式事务一致性就没那么容易了。 本质上分布式系统中要减少耗时的事务操作,因为RT过长,事务堵塞必然导致 可用性降低,我们能做的事情就是大事务拆分成小事务, 通过消息队列延长事务到达一
阅读全文