crawler4j 学习（一）

crawler4j是一个轻量级多线程网络爬虫，开发者可以调用相应的接口在短时间内创建一个多线程网络爬虫。

前期准备

使用maven

为了使用最近版本的crawler4j，请将下面的片段添加到你的pom.xml文件中。

<dependency>

    <groupId>edu.uci.ics</groupId>

    <artifactId>crawler4j</artifactId>

    <version>4.1</version>

</dependency>

不没有maven项目

crawler4j JARs 可以在发行的版本页面和Maven Central（应该是maven中心）找到。

如果你没有maven项目却想使用crawler4j，注意crawler4j jar文件有几个外部的依赖。在最近的版本中，你可以发现一个命名为crawler4j-X Y -with-dependencies.jar包含了所有的依赖的捆绑。你可以下载下来并且将它添加到你的classpath下获得所有的依赖。

过程

使用crawler4j需要创建一个继承Web Crawler的爬虫类。

public class MyCrawler extends WebCrawler {

    private final static Pattern FILTERS = Pattern.compile(".*(\\.(css|js|gif|jpg"

                                                           + "|png|mp3|mp3|zip|gz))$");

    /**

     * 这个方法有两个参数。第一个参数是我们发现的新的URL的页面并且第二个参数是新的URL。
　　　*　你应该实现这个方法去指定这个被给的URL是不是应该去爬取。在这个例子中，我们指导
　　　*  爬虫去忽视有CSS，JS，git等的URL并且知识获得了以“http://www.ics.uci.edu/”
     *  开头的URL。在这种情况下，我们不需要用参考页面这个参数来做决定。

     */

     @Override

     public boolean shouldVisit(Page referringPage, WebURL url) {

         String href = url.getURL().toLowerCase();

         return !FILTERS.matcher(href).matches()

                && href.startsWith("http://www.ics.uci.edu/");

     }

     /**

      *  这个功能是抓取准备被你的项目处理的页面

      */

     @Override

     public void visit(Page page) {

         String url = page.getWebURL().getURL();

         System.out.println("URL: " + url);

         if (page.getParseData() instanceof HtmlParseData) {

             HtmlParseData htmlParseData = (HtmlParseData) page.getParseData();

             String text = htmlParseData.getText();

             String html = htmlParseData.getHtml();

             Set<WebURL> links = htmlParseData.getOutgoingUrls();

             System.out.println("Text length: " + text.length());

             System.out.println("Html length: " + html.length());

             System.out.println("Number of outgoing links: " + links.size());

         }

    }

}

上面的例子覆盖了两个主要方法：

shouldVisit：这个方法决定了要抓取的URL及其内容，例子中只允许抓取“www.ics.uci.edu”这个域的页面，不允许.css、.js和多媒体等文件。
visit：当URL下载完成会调用这个方法。你可以轻松获取下载页面的url, 文本, 链接, html,和唯一id等内容。

补充：

search engines

参考页面：http://www.cnblogs.com/s1-myblog/p/6197426.html

crawler4j 学习的更多相关文章

crawler4j 学习（二）
crawler4j 学习(二) 实现控制器类以制定抓取的种子(seed).中间数据存储的文件夹.并发线程的数目: public class Controller { public static voi ...
Crawler4j学习笔记
Crawler4j概述 crawler4j是一款基于Java的轻量级单机开源爬虫框架,最大的一个特点就是简单.另外也支持多线程.支持代理.可以过滤重复URL 基本上从加载jar到工程里面通过修改示例 ...
龙威零式_团队项目例会记录_18 (Beta架构讨论)
例会照片任务更新姓名今日完成任务实际花费时间明日任务预计花费时间谢振威继续构思beta版本架构并且输出文档 2h #40数据库模块接口定义 2h 杨金键继续构思beta版本架构并且输 ...
crawler4j源码学习(2)：Ziroom租房网房源信息采集爬虫
crawler4j是用Java实现的开源网络爬虫.提供了简单易用的接口,可以在几分钟内创建一个多线程网络爬虫.下面实例结合jsoup解析网页,javacsv存储采集数据:采集自如ziroom租房网(h ...
crawler4j源码学习(1)：搜狐新闻网新闻标题采集爬虫
crawler4j是用Java实现的开源网络爬虫.提供了简单易用的接口,可以在几分钟内创建一个多线程网络爬虫.下面实例结合jsoup,采集搜狐新闻网(http://news.sohu.com/)新闻标 ...
Python学习日记（一）：拜见小主——Python
近日学习Python,特将学习过程及一点心得记录于此. 由于之前做过一个Java爬虫的项目,虽然很长时间没有碰过爬虫,但是小郭同学有一颗不死的爬虫心,哈哈.最近在互联网上找一些电影的时候,有很多电影只 ...
java爬虫框架webmagic学习（一）
1. 爬虫的分类:分布式和单机分布式主要就是apache的nutch框架,java实现,依赖hadoop运行,学习难度高,一般只用来做搜索引擎开发. java单机的框架有:webmagic和webc ...
JAVA学习资源整理
构建这里搜集了用来构建应用程序的工具. Apache Maven:Maven使用声明进行构建并进行依赖管理,偏向于使用约定而不是配置进行构建.Maven优于Apache Ant.后者采用了一种过程化 ...
Java开源爬虫框架crawler4j
花了两个小时把Java开源爬虫框架crawler4j文档翻译了一下,因为这几天一直在学习Java爬虫方面的知识,今天上课时突然感觉全英文可能会阻碍很多人学习的动力,刚好自己又正在接触这个爬虫框架,所以 ...

随机推荐

Android网络操作的几种方法
安卓开发软件:AndroidStudio 服务器软件:Myeclipse+Tomcat 首先无论是哪种方式,安卓手机软件要想联网,必须要申请联网权限(android.permission.INTERN ...
删除Tomcat服务及其它注意
使用sc delete Tomcat7(注意服务名是Tomcat7 不是Apache......Tomcat7.0). 绿色版无法启动的话,需要先ervice.bat install注册一下服务. 如 ...
C#常用类库(100多个)
http://download.csdn.net/download/dxf1213cs/8238153
局域网中共享Lantern上网
Lantern作为一款非常好用的上网软件,深受大家喜爱,但是由于目前没有ios版,所以iPhone用户上网很麻烦,这里介绍一下如何共享Lantern使局域网内的设备都能正常上网. 1.电脑端设置:右键 ...
[BZOJ3173][Tjoi2013]最长上升子序列
[BZOJ3173][Tjoi2013]最长上升子序列试题描述给定一个序列,初始为空.现在我们将1到N的数字插入到序列中,每次将一个数字插入到一个特定的位置.每插入一个数字,我们都想知道此时最长上 ...
jquery版小型婚礼（可动态添加祝福语）
前两天在网上不小心看到“js许愿墙”这几个字,我的神经就全部被调动了.然后就开始我的百度生涯,一直寻觅许愿墙背景图片和便利贴图片,觅了好久……一直没找到满意的……无意间看到祝福语和一些卡通婚礼图片.最 ...
Fedora中允许mysql远程访问的几种方式
Fedora中允许mysql远程访问,可以使用以下两种方式:a.改表. mysql>use mysql; mysql>update user set host = '%' where us ...
css pre标签
浏览器:firfox49.0.2 在使用<pre>标签输出格式化文本的时候,遇到了一个小问题. 要在页面的底部输出两行文本,但是最后一行的文字总是距离屏幕的底部太大.下面图中的样子: 相关 ...
sublime3侧边栏颜色修改，推荐主题
sublime侧边栏的颜色默认是灰白色的,下面方法可以手动定制颜色为深色: 需要修改的文件为: C:\program\Sublime\Packages\Theme - Default.sublime- ...
java20
1:递归(理解) (1)方法定义中调用方法本身的现象举例:老和尚给小和尚讲故事,我们学编程 (2)递归的注意事项: A:要有出口,否则就是死递归 B:次数不能过多,否则内存溢出 C:构造方法不能递归 ...

crawler4j 学习

crawler4j 学习（一）

crawler4j 学习的更多相关文章

随机推荐

热门专题