文章分类 -  数据挖掘

B-Tree(转)
摘要:B-treeB-treeB-tree(多路搜索树,并不是二叉的)是一种常见的数据结构。使用B-tree结构可以显著减少定位记录时所经历的中间过程,从而加快存取速度。按照翻译,B 通常认为是Balance的简称.这个数据结构一般用于数据库的索引,综合效率较高。结点B-tree中,每个结点包含:  1、本结点所含关键字的个数;  2、指向父结点的指针;  3、关键字;  4、指向子结点的指针;  对于一棵m阶B-tree,每个结点至多可以拥有m个子结点。各结点的关键字和可以拥有的子结点数都有限制,规定m阶B-tree中,根结点至少有2个子结点,除非根结点为叶子节点,相应的,根结点中关键字的个数为1 阅读全文
posted @ 2011-01-06 11:31 twelfthing 阅读(818) 评论(0) 推荐(0)
文本的相似度
摘要:中文的文本相似度的计算是基于分词来的余弦定理: 提取两段文本中所有词(事先需用空格分割好) 计算每个词在两段文本中分别出现的次数(用BSD tree.h里的RBTREE保存) 用词频做为A、B的分量 使用余弦公式计算AB夹角的余弦值jaccard: 大体差不多代码如下,分词用的是mmseg[代码] 阅读全文
posted @ 2010-12-23 15:01 twelfthing 阅读(1001) 评论(0) 推荐(1)