上一页 1 ··· 233 234 235 236 237 238 239 240 241 ··· 273 下一页
摘要: 一、概述 一、概述 GridFS是基于mongodb存储引擎是实现的“分布式文件系统”,底层基于mongodb存储机制,和其他本地文件系统相比,它具备大数据存储的多个优点。GridFS适合存储超过16MB的大型文件,不过16M数据在当今互联网时代,已经不足为奇。我们可以使用GridFS构建大规模的“ 阅读全文
posted @ 2017-03-03 12:18 bonelee 阅读(13162) 评论(0) 推荐(2)
摘要: Query String Query The query language query allows humans to describe complex queries using a simple syntax. Terms Plain terms without any other synta 阅读全文
posted @ 2017-03-03 11:17 bonelee 阅读(617) 评论(0) 推荐(0)
摘要: UEBA and Machine Learning - Download Free Guide for CISOs‎ Adinfo.niara.com/UEBA/Guide-For-CISOs‎ Learn about machine learning based user and entity b 阅读全文
posted @ 2017-03-02 20:22 bonelee 阅读(6109) 评论(0) 推荐(0)
摘要: python berkeley 操作 先到http://www.oracle.com/technetwork/database/database-technologies/berkeleydb/downloads/index-082944.html 下载6.1版本的,6.2版本py目前的库不支持 安 阅读全文
posted @ 2017-03-02 17:15 bonelee 阅读(613) 评论(0) 推荐(0)
摘要: 介绍 我是NDPmedia公司的大数据OLAP的资深高级工程师, 专注于OLAP领域, 现将一个成熟的可靠的高性能的海量实时OLAP数据仓库介绍给大家: druid.io NDPmedia在2014年3月就开始使用, 见链接: http://blog.csdn.net/chenyi8888/arti 阅读全文
posted @ 2017-03-02 15:35 bonelee 阅读(2127) 评论(0) 推荐(0)
摘要: 五、Tindex 数果智能根据开源的方案自研了一套数据存储的解决方案,该方案的索引层通过改造Lucene实现,数据查询和索引写入框架通过扩展Druid实现。既保证了数据的实时性和指标自由定义的问题,又能满足大数据量秒级查询的需求,系统架构如下图,基本实现了文章开头提出的几个目标。 (点击放大图像) 阅读全文
posted @ 2017-03-02 15:07 bonelee 阅读(2270) 评论(0) 推荐(1)
摘要: 转自:http://www.infoq.com/cn/articles/trillion-log-and-data-storage-query-techniques?utm_source=infoq&utm_medium=popular_widget&utm_campaign=popular_con 阅读全文
posted @ 2017-03-02 15:05 bonelee 阅读(3941) 评论(0) 推荐(0)
摘要: 首先 dfs.replication这个参数是个client参数,即node level参数。需要在每台datanode上设置。 其实默认为3个副本已经够用了,设置太多也没什么用。 一个文件,上传到hdfs上时指定的是几个副本就是几个。以后你修改了副本数,对已经上传了的文件也不会起作用。可以再上传文 阅读全文
posted @ 2017-03-01 17:46 bonelee 阅读(10732) 评论(1) 推荐(0)
摘要: 《实时分析系统(HIVE/HBASE/IMPALA)浅析》《MPP DB 是 大数据实时分析系统 未来的选择吗?》《一套数据,多种引擎(impala/Hive/kylin)》《一套数据,多种引擎续 两种数据格式(Parquet/ORCfile)浅析》有兴趣可以看看。 阅读全文
posted @ 2017-03-01 17:14 bonelee 阅读(229) 评论(0) 推荐(0)
摘要: 转自:http://data.qq.com/article?id=817 三、Hermes设计概要 架构描述 系统核心进程均采用分散化设计,根据业务发展需求,可随意扩缩容机器; 周期性数据直接通过tdw处理落地到分布式文件系统; 实时数据加载采用先落地本地磁盘,最终落地到分布式文件系统,最终都由调度 阅读全文
posted @ 2017-03-01 16:57 bonelee 阅读(892) 评论(2) 推荐(0)
上一页 1 ··· 233 234 235 236 237 238 239 240 241 ··· 273 下一页