应用 HttpClient 和 HtmlParser 实现简易爬-HTML教程-爱易网页

应用 HttpClient 和 HtmlParser 实现简易爬

日期：2014-05-17　浏览次数：20758 次

使用 HttpClient 和 HtmlParser 实现简易爬

使用 HttpClient 和 HtmlParser 实现简易爬虫

这篇文章介绍了 HtmlParser 开源包和 HttpClient 开源包的使用，在此基础上实现了一个简易的网络爬虫 (Crawler)，来说明如何使用 HtmlParser 根据需要处理 Internet 上的网页，以及如何使用 HttpClient 来简化 Get 和 Post 请求操作，构建强大的网络应用程序。

回页首

HttpClient 与 HtmlParser 简介

本小结简单的介绍一下 HttpClinet 和 HtmlParser 两个开源的项目，以及他们的网站和提供下载的地址。

HttpClient 简介

HTTP 协议是现在的因特网最重要的协议之一。除了 WEB 浏览器之外， WEB 服务，基于网络的应用程序以及日益增长的网络计算不断扩展着 HTTP 协议的角色，使得越来越多的应用程序需要 HTTP 协议的支持。虽然 JAVA 类库 .net 包提供了基本功能，来使用 HTTP 协议访问网络资源，但是其灵活性和功能远不能满足很多应用程序的需要。而 Jakarta Commons HttpClient 组件寻求提供更为灵活，更加高效的 HTTP 协议支持，简化基于 HTTP 协议的应用程序的创建。 HttpClient 提供了很多的特性，支持最新的 HTTP 标准，可以访问这里了解更多关于 HttpClinet 的详细信息。目前有很多的开源项目都用到了 HttpClient 提供的 HTTP功能，登陆网址可以查看这些项目。本文中使用 HttpClinet 提供的类库来访问和下载 Internet上面的网页，在后续部分会详细介绍到其提供的两种请求网络资源的方法： Get 请求和 Post 请求。Apatche 提供免费的 HTTPClien t源码和 JAR 包下载，可以登陆这里下载最新的HttpClient 组件。笔者使用的是 HttpClient3.1。

HtmlParser 简介

当今的 Internet 上面有数亿记的网页，越来越多应用程序将这些网页作为分析和处理的数据对象。这些网页多为半结构化的文本，有着大量的标签和嵌套的结构。当我们自己开发一些处理网页的应用程序时，会想到要开发一个单独的网页解析器，这一部分的工作必定需要付出相当的精力和时间。事实上，做为 JAVA 应用程序开发者， HtmlParser 为其提供了强大而灵活易用的开源类库，大大节省了写一个网页解析器的开销。 HtmlParser 是 http://sourceforge.net 上活跃的一个开源项目，它提供了线性和嵌套两种方式来解析网页，主要用于 html 网页的转换(Transformation) 以及网页内容的抽取 (Extraction)。HtmlParser 有如下一些易于使用的特性：过滤器 (Filters)，访问者模式 (Visitors)，处理自定义标签以及易于使用的 JavaBeans。正如 HtmlParser 首页所说：它是一个快速，健壮以及严格测试过的组件；以它设计的简洁，程序运行的速度以及处理 Internet 上真实网页的能力吸引着越来越多的开发者。本文中就是利用HtmlParser 里提取网页里的链接，实现简易爬虫里的关键部分。HtmlParser 最新的版本是HtmlParser1.6，可以登陆这里下载其源码、 API 参考文档以及 JAR 包。

回页首

开发环境的搭建

笔者所使用的开发环境是 Eclipse Europa，此开发工具可以在 www.eclipse.org 免费的下载；JDK是1.6，你也可以在 www.java.sun.com 站点下载，并且在操作系统中配置好环境变量。在 Eclipse 中创建一个 JAVA 工程，在工程的 Build Path 中导入下载的Commons-httpClient3.1.Jar，htmllexer.jar 以及 htmlparser.jar 文件。

图 1. 开发环境搭建

回页首

HttpClient 基本类库使用

HttpClinet 提供了几个类来支持 HTTP 访问。下面我们通过一些示例代码来熟悉和说明这些类的功能和使用。 HttpClient 提供的 HTTP 的访问主要是通过 GetMethod 类和 PostMethod 类来实现的，他们分别对应了 HTTP Get 请求与 Http Post 请求。

GetMethod

使用 GetMethod 来访问一个 URL 对应的网页，需要如下一些步骤。

生成一个 HttpClinet 对象并设置相应的参数。
生成一个 GetMethod 对象并设置响应的参数。
用 HttpClinet 生成的对象来执行 GetMethod 生成的 Get 方法。
处理响应状态码。
若响应正常，处理 HTTP 响应内容。
释放连接。

清单 1 的代码展示了这些步骤，其中的注释对代码进行了较详细的说明。

清单 1.

/* 1 生成 HttpClinet 对象并设置参数*/
  HttpClient httpClient=new HttpClient();
  //设置 Http 连接超时为5秒
httpClient.getHttpConnectionManager().getParams().setConnectionTimeout(5000);
  
  /*2 生成 GetMethod 对象并设置参数*/
  GetMethod getMethod=new GetMethod(url);	 
  //设置 get 请求超时为 5 秒
getMethod.getParams().setParameter(HttpMethodParams.SO_TIMEOUT,5000);
  //设置请求重试处理，用的是默认的重试处理：请求三次
getMethod.getParams().setParameter(HttpMethodParams.RETRY_HANDLER,
          new DefaultHttpMethodRetryHandler());
  
  /*3 执行 HTTP GET 请求*/
  try{ 
	  int statusCode = httpClient.executeMethod(getMethod);
	  /*4 判断访问的状态码*/
      if (statusCode != HttpStatus.SC_OK) 
      {
System.err.println("Method failed: "+ getMethod.getStatusLine());
      }
  
      /*5 处理 HTTP 响应内容*/
      //HTTP响应头部信息，这里简单打印
  Header[] headers=getMethod.getResponseHeaders();
      for(Header  h:  headers)
  	      System.out.println(h.getName()+" "+h.getValue());*/
      //读取 HTTP 响应内容，这里简单打印网页内容
      byte[] responseBody = getMethod.getResponseBody();//读取为字节数组
System.out.println(new 


                        
                    
                    
                        
                            上一篇： 说说标准系列目录 

                            下一篇： css 图片 局部 明晰(圆形 需要支持css3) 
                        
                    


                    
                        免责声明： 本文仅代表作者个人观点，与爱易网无关。其原创性以及文中陈述文字和内容未经本站证实，对本文以及其中全部或者部分内容、文字的真实性、完整性、及时性本站不作任何保证或承诺，请读者仅作参考，并请自行核实相关内容。
                    

                    


    
        相关资料更多>
    
    
        

            
                  
                      
                         普普通通HTML的input调用Ext js DatePicker的实现方法 
                   
                
                  
                      
                        HTML言语剖析（五）字体标志
                   
                
                  
                      
                         用selenium2\htmldriver仿照第三方登录（新浪微博、qq等），取cookie 
                   
                
                  
                      
                         请教链接变色(css)的有关问题 
                   
                
                  
                      
                        初探 HTML 组件 - 创建一个 HTC_HTML综合技巧_HtmlCss教程
                   
                
                  
                      
                         小弟我的页面上下2部分在不同分辨率的机器里高度不同 
                   
                
                  
                      
                         怎么实现这种分页 
                   
                
                  
                      
                         除了HTML标签 
                   
                
                  
                      
                         怎么让DIV中的两个TEXTBOX垂直居中 
                   
                
        
    



                

                
                    
                    

                    
                    
                    
                    

      
        推荐阅读更多>
      
      
          
        
                       
                             这个是啥意思啊该怎么处理 
                    
                       
                             ie10  不兼容解决方案 
                    
                       
                             Jawr：可调剂的 Javascript 及 CSS 打包方案 
                    
                       
                            网页减肥提速的9个技巧
                    
                       
                             绝对推荐，HTML5与JQuery组合的幻灯片 
                    
                       
                             想在页面中央弹出一个DIV 
                    
                       
                             HTML5 localStorage当地存储实际应用举例 
                    
                       
                             十分实用的动画样式 Animate.css 
                    
                       
                             请教innerHTML插入后ie下高度没有自适应的有关问题 
                    
                       
                             ie6不起作用，form表单提交后，相仿转发了一下，不其做用，请指点 
                    
                       
                             IE6、IE7、Firefox兼容CSS Hack小结 
                    
                       
                             新人求教"导航菜单上的颜色"设定?解决方案 
                    
                       
                             简介HTML5 DOMStorage的API与范例 
                    
                       
                             再见，小弟我的HTML!华丽转身 
                    
                       
                             CSS低级感悟1 
                    
                       
                            经过优化网页HTML代码提高网页访问速度
                    
                       
                             急JSP做的页面怎么让他固定大小？（~） 
                    
                       
                             一个form中只能有一个fieldset元素吗？解决方案 
                    
                       
                             java除去html格式，提取文字信息 
                    
                       
                            解密.htm.html.shtm.shtml的区别与联络
                    
            
      


                
            
            

            
    
友情链接：
    
      爱易网             
    
      云虚拟主机技术             
    
      云服务器技术             
    
      程序设计技术             
    
      开发网站             
    
      APP开发教程             
    





 

Copyright © 2013-2025 爱易网页 当前在线：501人　
        网站在59分15秒内访问总人数：19367人
    当前 17.46%
　粤ICP备18100884号-2