摘要:
这几天又把《数据挖掘概念与技术》这本书翻出来看了看,随便做了个演示程序实现了书中的K-Means算法。也算是一种复习和积累吧。最先这个算法完全是用C#来做的,数据样本点是用的类作为其数据结构,后来在测试中发现运行速度不太理想。就改为用C++实现算法本身,然后通过C#调用(P\Invoke)C++导出的函数来完成。最终的效果如下面的图所示 阅读全文
阅读排行榜
商业智能工具KNIME
2009-01-11 02:46 by Yin.P, 7340 阅读, 收藏,
摘要:
KNIME是基于Eclipse环境的开源商业智能工具。KNIME开发环境如图一. 从图中可以看出KNIME是通过工作流来控制数据的集成、清洗、转换、过滤,再到统计、数据挖掘,最后是数据的可视化。整个开发都在可视化的环境下进行,通过简单的拖曳和设置就可以完成一个流程的开发。通过KNIME的白皮书得知KNIME的全称是The Konstanz Information Miner。它的设计目的是用于教学、研究以及协同工作的平台。
阅读全文
一个简单的MDX案例及说明
2008-11-27 03:32 by Yin.P, 7035 阅读, 收藏,
摘要:
在关系数据库中使用SQL语言来查询、管理和操作数据库中的数据。在SQL Server中使用MDX语句来进行多维数据库的操作和管理,MDX不但可以用在SSAS中进行多维数据库的查询管理,也可使用在SSIS和SSRS中分别辅助处理ETL过程和报表开发过程。因为MDX语句没有标准化,不同的BI解决方案提供使用不同的多维数据查询技术,所以SQL Server中的MDX语言只能在SQL Server中使用,如果要进行其它数据库如ORACLE,Hyperion的查询,就要了解与其相对应的MDX,可能在语法或一些用法上不同于SQL Server中的MDX。本文针对的是SQL Server中的MDX。
阅读全文
对Weka中DBSCAN算法的分析以及在C#中的实现
2009-05-22 20:43 by Yin.P, 5258 阅读, 收藏,
摘要:
DBSCAN算法是常用的数据挖掘算法。所有的聚类方法分为若干类型,前面讨论过的KMEANS算法是基于划分的方法进行聚类,而这次提到的DBSCAN算法是基于密度的方法。当然其它的还有基于层次凝聚和分裂的方法、基于模型的方法等。我先对Weka中实现的DBSCAN算法进行一个介绍和分析,然后再给出我自己的实现方法。但是在这之前要解释几个概念,如果之前没有了解过这个算法的话,最好是先熟悉几个概念:epsilon-邻域、核心对象、(直接)密度可达、密度相连,这些概念可以在《数据挖掘概念与技术》一书中找到,了解这些概念对理解这个算法来说是很重要的。 阅读全文
维度层次的理解
2008-11-30 23:58 by Yin.P, 4981 阅读, 收藏,
摘要:
多维度数据库是按照多维数据模型的思想来建立的。而一个多维数据模型是由多个维度和实事组成。维度是多维数据模型中非常重要的概念,要进行多维分析、编写高效准确的MDX查询,首先要对维及其维度的概念分层有比较深刻的理解。
阅读全文
文本向量表示及TFIDF词汇权值
2009-05-14 23:16 by Yin.P, 4886 阅读, 收藏,
摘要:
文本相似计算是进行文本聚类的基础,和传统结构化数值数据的聚类方法类似,文本聚类是通过计算文本之间"距离"来表示文本之间的相似度并产生聚类。文本相似度的常用计算方法有余弦定理和Jaccard系数。但是文本数据与普通的数值数据或类属数据不同,文本数据是一种半结构化数据,在进行文本挖掘之前必须要对文本数据源进行处理,如分词、向量化表示等,其目的就是使用量化的数值来表达这些半结构化的文本数据。使其适用于分析计算。 阅读全文
聚类基本数学模型
2009-04-11 16:23 by Yin.P, 4365 阅读, 收藏,
摘要:
聚类方法是一类用途非常广泛的算法,聚类包含很多各式各样的算法。所有这些算法都有它的基本数学模型。本文就简单介绍一下聚类的基本数学模型。了解了基本数学模型就了解了聚类最本质的原理。无论是学习算法还是自己开发新的算法,学习基本数学模型都是很有帮助的。本文的目的一方面是介绍数学模型,另一方面也算是自己学习内容的一个记录吧。 阅读全文
用MDX进行同比及环比计算
2008-12-21 00:38 by Yin.P, 4147 阅读, 收藏,
摘要:
同比和环比计算是企业应用、电子商务应用中常用的计算方法,也是常用的数据分析手段。写这篇文章也是因为最近在学习MDX相关的一些计算方法的同时回想到原来我在项目中使用过的一些类似的,利用SQL来完成的统计计算,如前期和当期的差额,趋势等。比较之下,利用MDX来完成这些计算比用SQL来做要简单清晰得多,当然这是毫无疑问的。原来利用几十行甚至上百行SQL来完成的计算(有时还要借助程序代码来完成计算)现在用MDX只要十几行左右就可以完成。因此,MDX所带来的好处是很明显的。本文就主要介绍利用MDX进行同比和环比计算。
阅读全文
利用SSAS 2005进行数据挖掘
2008-11-28 22:43 by Yin.P, 3778 阅读, 收藏,
摘要:
在SSAS中一个挖掘结构可以包含多个挖掘模型,如果只有一个挖掘模型,那么SSAS会自动创建一个相应的挖掘结构。挖掘结构和挖掘模型的区别就在于挖掘结构中包含多个将要用于挖掘的属性列,这些列中有的是作为预测列,有的作为输入列,有的既是输入又是可预测列。我们可以利用挖掘结构中的若干列构造属于同一个挖掘结构的不同挖掘模型,这些挖掘模型可能使用了不同的数据挖掘算法。也就是说挖掘模型就是在挖掘结构中选择若干列并使用各种算法构造而成。
阅读全文
基于Lucene.NET的文件搜索工具
2009-06-16 00:34 by Yin.P, 3452 阅读, 收藏,
摘要:
本文要介绍的是利用Lucene.NET写的一个简单的文档搜索器。实现最基本的索引和搜索功能。编写这个小工具的初衷之一是因为我收集的专业资料文档越来越多,有时想要在计算机中找到自己想要的文档却不知道自己之前把那些资料放到了什么地方,而且现在的硬盘越来越大,目录结构也越来越复杂,常常要花很多时间去查找自己想要的资料。有了这个搜索工具,只要定期重新建立索引,就可以方便快速地找到自己想要的东西,其次是因为正好这段时间想花时间了解一下Lucene.NET这个开源库学习一下搜索引擎的原理 阅读全文
浙公网安备 33010602011771号