网页中本文提取之-joyhtml

2013-12-02

网页中正文提取之----joyhtmlimport java.net.URLimport org.cyberneko.html.parsers.DOMParserimport o

网页中正文提取之----joyhtml
import java.net.URL;import org.cyberneko.html.parsers.DOMParser;import org.joy.analyzer.html.TextExtractor;import org.w3c.dom.Document;import org.xml.sax.InputSource;public class Test {public static void main(String[] args) throws Exception {DOMParser parser = new DOMParser();String url = "http://finance.people.com.cn/n/2013/1011/c66323-23157265.html";parser.parse(new InputSource(new URL(url).openStream()));Document doc = parser.getDocument();TextExtractor extractor = new TextExtractor(doc);String str = extractor.extract();System.out.println(str);}}

? ?依赖的lib参见附件?

热点排行

html块级元素跟内联元素区别详解(转)
请各位师傅看看上面的代码是如何加密的
css怎么清除浮动
asp.net主页自适应分辨率浏览器
HTML 五搴旂敤寮?彂瀹炶返鎸囧崡
IE6弹出窗口中移动窗口滚动条时里面的下
用仿ActionScript的语法回编写html5——
CSS3 Media Queries在iPhone4跟iPad上的
如何实现文字自动过渡效果
css 兼容性有关问题

CSS

网页中本文提取之-joyhtml