随笔分类 - 大数据
摘要:1、导入的原数据 103744;545479945;2017.05.17 06:41:08;sell;eurusd_;0.10;1.11080;1.11280;1.10880;1.11081;0.00;0.00; 2、建表语句。分号是hdfs中的特殊字符,需要把';'转成ascII码'\073' c
阅读全文
摘要:(摘自:https://www.ibm.com/developerworks/cn/web/1103_zhaoct_recommstudy1/index.html) 这文章写的太好了,个人认为入门级很好的文章, 分类: 1、大众行为的推荐引擎,对每个人都给出同样的推荐。 2、个性化推荐引擎,对不同的
阅读全文
摘要:实现原理: 1、读取hbase数据每页的数据时多取一条数据。如:分页是10条一页,第一次查询hbase时, 取10+1条数据,然后把第一条和最后一条rowkey数据保存在redis中,redis中的key为用户的token+URL。即token.set(token+url:list<String>)
阅读全文
摘要:由于 TiDB 本身兼容绝大多数的 MySQL 语法,所以对于绝大多数业务来说,最安全的切换数据库方式就是将 TiDB 作为现有数据库的从库接在主 MySQL 库的后方,这样对业务方实现完全没有侵入性下使用 TiDB 对现有的业务进行备份,应对未来数据量或者并发量增长带来的单点故障风险,如需上线 T
阅读全文
摘要:http://blog.csdn.net/antony9118/article/details/60470115
阅读全文
摘要:转自:https://my.oschina.net/Kenyon/blog/908370 一、环境 CentOS Linux release 7.3.1611 (Core)172.26.11.91 pd & tidb172.26.11.92 tikv172.26.11.93 tikv172.26.1
阅读全文
摘要:地址:https://github.com/pingcap/docs-cn/blob/master/op-guide/configuration.md#tidb TiDB --store 用来指定 TiDB 底层使用的存储引擎 默认: "goleveldb" 你可以选择 "memory", "gol
阅读全文
摘要:在开发完Spark作业之后,就该为作业配置合适的资源了。Spark的资源参数,基本都可以在spark-submit命令中作为参数设置。很多Spark初学者,通常不知道该设置哪些必要的参数,以及如何设置这些参数,最后就只能胡乱设置,甚至压根儿不设置。资源参数设置的不合理,可能会导致没有充分利用集群资源
阅读全文
摘要:spark-streaming读hdfs,统计文件中单词数量,并写入mysql
阅读全文
摘要:yarn logs -applicationId application_xxxx_xxx 可选(">exception")
阅读全文
摘要:对API的解释: 对API的解释: 1.1 transform l map(func):对调用map的RDD数据集中的每个element都使用func,然后返回一个新的RDD,这个返回的数据集是分布式的数据集 l filter(func) : 对调用filter的RDD数据集中的每个元素都使用fun
阅读全文
摘要:1、准备: eclipse4.5,hadoop2.6.1,hadoop-eclipse-plugin-2.6.0.jar。 2、eclipse配置 Location name :xxxx 名字随便取 Map/Reduce(V2)Master 下 Host:n1 hadoop主节点(master)机器
阅读全文

浙公网安备 33010602011771号