摘要:
通过MapReduce实现 TF-IDF值的统计 数据:文章ID 文件内容 结果数据: 在整个的处理过程中通过两步来完成 第一步主要生成三种格式的文件 1、使用分词工具将文章内容进行拆分成多个词条;并记录文章的总词条数 关于分词工具的使用请参考 TF-IDF第一步处理后结果: 2、记录词条在多少篇文
阅读全文
posted @ 2016-07-22 17:20
单行道|
阅读(1064)
推荐(0)
摘要:
生产上有文件被清空了,想查查是谁操作的? 通过history查看历史命令: 也可以通过文件查看历史命令: 只显示历史命令,像查一查谁登陆了系统执行了这些命令? 查看用户登陆系统信息 想查查命令的执行时间: 但是这种方式,设置HISTTIMEFORMAT以后的命令才会显示正确的时间,之前的命令并不会显
阅读全文
posted @ 2016-07-22 14:49
单行道|
阅读(3151)
推荐(0)
摘要:
TF-IDF是一种统计方法,用以评估一字词对于一个文件集或一个语料库中的其中一份文件的重要程度。字词的重要性随着它在文件中出现的次数成正比增加,但同时会随着它在语料库中出现的频率成反比下降。TF-IDF加权的各种形式常被搜索引擎应用,作为文件与用户查询之间相关程度的度量或评级。除了TF-IDF以外,
阅读全文
posted @ 2016-07-21 16:11
单行道|
阅读(1055)
推荐(0)
摘要:
HBase的配置 修改配置hue.ini的配置文件 Cluster Hue展现的名字 node1:9090 hbase启动的thrift主机及端口 需要启动hdfs和hbase,然后再启动thrift 重新启动Hue,访问Web
阅读全文
posted @ 2016-07-20 15:40
单行道|
阅读(1623)
推荐(0)
摘要:
HIVE配置 修改hue.ini配置文件 重启HUE build/env/bin/supervisor 启动hdfs和hiveserver2 $HIVE_HOME/bin/hiveserver2 登录Web 点击:Query Editors->Hive 然后就可以通过图形化操作Hive了!
阅读全文
posted @ 2016-07-20 12:29
单行道|
阅读(7822)
推荐(0)
摘要:
HDFS配置 参考文档:http://archive.cloudera.com/cdh5/cdh/5/hue-3.9.0-cdh5.5.0/manual.html Hadoop配置文件修改 hdfs-site.xml core-site.html HUE配置文件修改 [[hdfs_clusters]
阅读全文
posted @ 2016-07-20 01:27
单行道|
阅读(3920)
推荐(0)
摘要:
HUE: Hadoop User Experience 官网地址:http://gethue.com/ Hue官网无法下载,超时。 使用CDH版本安装。 下载地址: http://archive.cloudera.com/cdh5/cdh/5/ 说明文档: http://archive.cloude
阅读全文
posted @ 2016-07-19 22:54
单行道|
阅读(623)
推荐(0)
摘要:
一、准备工作 主机个数:n台 操作系统:CentOS 6.5 安装所需软件包: CM: cloudera-manager-el6-cm5.4.3_x86_64.tar.gz CDH parcel: CDH-5.4.0-1.cdh5.4.0.p0.27-el6.parcel CDH-5.4.0-1.c
阅读全文
posted @ 2016-07-18 16:19
单行道|
阅读(5718)
推荐(0)
摘要:
示例: 给出各个节点到相邻节点的距离,要求算出初始节点到各个节点的最短路径。 数据: A节点为初始节点,A到B的距离为10,A到D的距离为5。 B节点到C的距离为1,B到D的距离为2,其他类推。 MapReduce计算最短路径 Map阶段 如: A (B,10) (D,5) => A 0 (B,10
阅读全文
posted @ 2016-07-15 15:04
单行道|
阅读(3766)
推荐(0)
摘要:
PageRank 简单理解为网页排名,但是网页是根据什么排名的,接下来就简单介绍一下。 举例: 假设网页 A 的内容中有网页 B,C 和 D 的链接,并且 A 的 PageRank的值为0.25。 那接下里我们就可以计算在网页 A 中的其他网页的PageRank的值了。我们拿网页 B 来进行说明,
阅读全文
posted @ 2016-07-15 01:08
单行道|
阅读(2326)
推荐(0)