? joyHTML的目的是解析HTML文本当中的链接和正文,利用超链接密度法为主要判断依据的标记窗算法,采用DOM树解析模式。
环境描述:
jdk1.6
joyhtml-0.2.2
?
提取新闻正文demo代码如下:
import java.net.URL; import org.cyberneko.html.parsers.DOMParser; import org.joy.analyzer.html.TextExtractor; import org.w3c.dom.Document; import org.xml.sax.InputSource; public class Test { public static void main(String[] args) throws Exception { DOMParser parser = new DOMParser(); String url = "http://finance.people.com.cn/n/2013/1011/c66323-23157265.html"; parser.parse(new InputSource(new URL(url).openStream())); Document doc = parser.getDocument(); TextExtractor extractor = new TextExtractor(doc); String str = extractor.extract(); System.out.println(str); } }
?
? ?依赖的lib参见附件?
?