资讯正文提取之joyhtml-HTML教程-爱易网页

资讯正文提取之joyhtml

日期：2014-05-16　浏览次数：21178 次

新闻正文提取之joyhtml

? ? ? joyHTML的目的是解析HTML文本当中的链接和正文，利用超链接密度法为主要判断依据的标记窗算法，采用DOM树解析模式。

环境描述：

jdk1.6

joyhtml-0.2.2

提取新闻正文demo代码如下：

public static void main(String[] args) throws Exception {
	DOMParser parser = new DOMParser();
	String url = "http://finance.people.com.cn/n/2013/1011/c66323-23157265.html";
	parser.parse(new InputSource(new URL(url).openStream()));
	Document doc = parser.getDocument();
	TextExtractor extractor = new TextExtractor(doc);
	String str = extractor.extract();
	System.out.println(str);

}

依赖的lib参见附件

1 楼 he19920226he 2013-10-12

The element type "meta" must be terminated by the matching end-tag "</meta>". 楼主，这个错误怎么解决！！

2 楼小网客 2013-10-12

he19920226he 写道

The element type "meta" must be terminated by the matching end-tag "</meta>". 楼主，这个错误怎么解决！！

没有报这个错吧？
import org.cyberneko.html.parsers.DOMParser;
import org.joy.analyzer.html.TextExtractor;
import org.w3c.dom.Document;
import org.xml.sax.InputSource;