君子博学而日参省乎己 则知明而行无过矣

博客园 首页 新随笔 联系 订阅 管理
上一页 1 ··· 42 43 44 45 46 47 48 49 50 ··· 107 下一页

2013年3月7日 #

摘要: 为了让我们的应用程序不依赖于具体的解析器,让我们以统一的接口来访问XML文档,Sun公司开发了JAXP(Java API For XML Processing)API。 JAXP没有扩充解析器新的功能,它是对解析器的一个封装,使开发人员能够独立于具体的解析器,这样我们就可以在应用程序中任意更换解析器,而不用更改应用程序代码。现在主流的解析器都支持DOM和SAX,所以JAXP也都支持。JAXP现在的版本是1.3包含在JDK5.0之中。 javax.xml包及子包,org.w3c.dom包及子包,org.xml.sax包及子包。javax.xml包及子包主要是获取解析器的实例,获取到解析器实例后就 阅读全文
posted @ 2013-03-07 03:19 刺猬的温驯 阅读(2958) 评论(0) 推荐(1)

摘要: Spring总是惊喜不断,这次又提供了Spring Hadoop模块,方便开发人员使用hadoop不少Spring Hadoop 终于发布了 1.0 的正式版,该版本据首个里程碑发布到现在已经 1 年了。在这一年中我们处理了大量来自社区的反馈,不断进行完善和新功能增加。包括简化编程模型和提升一致性、以更小的体积启动并根据需要增加,可移植性的提升等等。详情请看发行说明。Spring for Apache Hadoop 提供了Spring框架用于创建和运行HadoopMapReduce、Hive和Pig作业的功能,包括HDFS和HBase。如果你需要简单的基于 Hadoop 进行作业调度,你可添加 阅读全文
posted @ 2013-03-07 02:46 刺猬的温驯 阅读(413) 评论(0) 推荐(0)

摘要: 项目介绍Tika是一个内容分析工具,自带全面的parser工具类,能解析基本所有常见格式的文件,得到文件的metadata,content等内容,返回格式化信息。总的来说可以作为一个通用的解析工具。特别对于搜索引擎的数据抓去和处理步骤有重要意义。Tika是一个目的明确,使用简单的apache的开源项目。下图是Tika诞生的一个历史过程。Tika项目之初来源于Nutch项目(大家应该都不陌生),现在是Lucene的子项目,所以也是来源于搜索引擎。其实Nutch这个项目的开发过程中,孕育了不少东西,应该都归功于Doug Cutting。我个人也是觉得这件事情很赞,要搞Nutch这样一个通用的搜索引 阅读全文
posted @ 2013-03-07 02:17 刺猬的温驯 阅读(4538) 评论(0) 推荐(2)

2013年3月4日 #

摘要: 保存各种信息对于应用程序来说非常平常,大多数时候它们是保存在关系数据库中。数据库处理规范数据类型十分在行,但是在处理如图像、文档等二进制数据时却不是那么得心应手。尽管可以用文件系统作为替代——而且它们还提供了更好的性能。但它们既没有提供用于搜索信息的查询语言,也没有提供表示关系或事务的概念。在很多情况下,允许第三方访问这些存储数据(随着应用程序的不断扩展,这成为一个典型的需求)是一个漫长而复杂的过程(它们不会在一夜之间完成)。内部存储结构很容易影响API架构,以及信息检索与遍历的方式。什么是JSR-170幸运的是,被称为Java内容仓库(Java Content Repository,JCR) 阅读全文
posted @ 2013-03-04 00:56 刺猬的温驯 阅读(574) 评论(0) 推荐(0)

2013年3月3日 #

摘要: 1. XML语法解析方式XML解析方法是理论知识,不止在java里是这样,换到其他语言下也是一样的。目前有三种: A. DOM(Document Object Model): DOM方法一次把XML的所有内容读入内存,按照xml的内容里面的node,attribute等生成一个树状结构。这就是一个对象模型了,完了我们就可以对这个树状结构进行操作。DOM的特点是编程简单,明了;缺点是要一次性读入所有内容 B. SAX(Simple API for XML): SAX是一种基于事件的解析方式,通过回调函数嵌入自己的代码。在解析前要定义好回调函数,在SAX开始解析后,一旦产生事件就会调用回调函数.. 阅读全文
posted @ 2013-03-03 22:54 刺猬的温驯 阅读(391) 评论(0) 推荐(0)

2013年3月2日 #

摘要: 转载 http://www.ibm.com/developerworks/cn/java/j-lo-jsouphtml/index.html简介:jsoup 是一款 Java 的 HTML 解析器,可直接解析某个 URL 地址、HTML 文本内容。它提供了一套非常省力的 API,可通过 DOM,CSS 以及类似于 jQuery 的操作方法来取出和操作数据。本文主要介绍如何使用 jsoup 来进行常用的 HTML 解析。jsoup 简介Java 程序在解析 HTML 文档时,相信大家都接触过 htmlparser 这个开源项目,我曾经在 IBM DW 上发表过两篇关于 htmlparser 的文 阅读全文
posted @ 2013-03-02 02:28 刺猬的温驯 阅读(280) 评论(0) 推荐(0)

2013年2月28日 #

摘要: 简介:任何企业应用程序都需要处理时间问题。应用程序需要知道当前的时间点和下一个时间点,有时它们还必须计算这两个时间点之间的路径。使用 JDK 完成这项任务将非常痛苦和繁琐。现在来看看 Joda Time,一个面向 Java™ 平台的易于使用的开源时间/日期库。正如您在本文中了解的那样,Joda-Time 轻松化解了处理日期和时间的痛苦和繁琐。在编写企业应用程序时,我常常需要处理日期。并且在我的最新项目中 — 保险行业 — 纠正日期计算尤其重要。使用java.util.Calendar让我有些不安。如果您也曾使用这个类处理过日期/时间值,那么您就知道它使用起来有多麻烦。因此当我接触到 Joda- 阅读全文
posted @ 2013-02-28 18:03 刺猬的温驯 阅读(361) 评论(0) 推荐(0)

2013年2月24日 #

摘要: 什么是属性编辑器,作用?* 自定义属性编辑器,spring配置文件中的字符串转换成相应的对象进行注入spring已经有内置的属性编辑器,我们可以根据需求自己定义属性编辑器* 如何定义属性编辑器?* 继承PropertyEditorSupport类,覆写setAsText()方法,参见:UtilDatePropertyEditor.java* 将属性编辑器注册到spring中,参见:applicationContext.xml比如:有一个类里面有一个Date属性Java代码publicclassBean1{privateDatedateValue;publicvoidsetDateValue(D 阅读全文
posted @ 2013-02-24 23:55 刺猬的温驯 阅读(5756) 评论(0) 推荐(1)

2013年2月17日 #

摘要: 插件工厂类PluginFactory.java/** * Constellio, Open Source Enterprise Search * Copyright (C) 2010 DocuLibre inc. * * This copyrighted material is made avail... 阅读全文
posted @ 2013-02-17 22:30 刺猬的温驯 阅读(562) 评论(0) 推荐(0)

摘要: 我们再看constellio系统实现索引功能的源码IndexingManager.java/** * Constellio, Open Source Enterprise Search * Copyright (C) 2010 DocuLibre inc. * * This copyrighted material is made available to anyone wishing to use, modify, * copy, or redistribute it subject to the terms and conditions of the GNU * Lesser Genera 阅读全文
posted @ 2013-02-17 03:12 刺猬的温驯 阅读(503) 评论(0) 推荐(0)

上一页 1 ··· 42 43 44 45 46 47 48 49 50 ··· 107 下一页