深入学习Heritrix---解析Frontier(链接工厂)（转）

深入学习Heritrix---解析Frontier(链接工厂)

Frontier是Heritrix最核心的组成部分之一,也是最复杂的组成部分.它主要功能是为处理链接的线程提供URL,并负责链接处理完成后的一些后续调度操作.并且为了提高效率,它在内部使用了Berkeley DB.本节将对它的内部机理进行详细解剖.

在Heritrix的官方文档上有一个Frontier的例子,虽然很简单,但是它却解释Frontier实现的基本原理.在这里就不讨论,有兴趣的读者可以参考相应文档.但是不得不提它的三个核心方法:
(1)next(int timeout):为处理线程提供一个链接.Heritrix的所有处理线程(ToeThread)都是通过调用该方法获取链接的.

(2)schedule(CandidateURI caURI):调度待处理的链接.

(3)finished(CrawlURI cURI):完成一个已处理的链接.

整体结构如下:

BdbMultipleWorkQueues:

它是对Berkeley DB的简单封装.在内部有一个Berkeley Database,存放所有待处理的链接.

package org.archive.crawler.frontier;

public class BdbMultipleWorkQueues 

{

//存放所有待处理的URL的数据库

    private Database pendingUrisDB = null;

 //由key获取一个链接

    public CrawlURI get(DatabaseEntry headKey)

    throws DatabaseException {

        DatabaseEntry result = new DatabaseEntry();

        

        // From Linda Lee of sleepycat:

        // "You want to check the status returned from Cursor.getSearchKeyRange

        // to make sure that you have OperationStatus.SUCCESS. In that case,

        // you have found a valid data record, and result.getData()

        // (called by internally by the binding code, in this case) will be

        // non-null. The other possible status return is

        // OperationStatus.NOTFOUND, in which case no data record matched

        // the criteria. "

        //由key获取相应的链接

        OperationStatus status = getNextNearestItem(headKey, result);

        CrawlURI retVal = null;

        if (status != OperationStatus.SUCCESS) {

            LOGGER.severe("See '1219854 NPE je-2.0 "

                    + "entryToObject'. OperationStatus "

                    + " was not SUCCESS: "

                    + status

                    + ", headKey "

                    + BdbWorkQueue.getPrefixClassKey(headKey.getData()));

            return null;

        }

        try {

            retVal = (CrawlURI)crawlUriBinding.entryToObject(result);

        } catch (RuntimeExceptionWrapper rw) {

            LOGGER.log(

                Level.SEVERE,

                "expected object missing in queue " +

                BdbWorkQueue.getPrefixClassKey(headKey.getData()),

                rw);

            return null; 

        }

        retVal.setHolderKey(headKey);

        return retVal;//返回链接

    }

    //从等处理列表获取一个链接

    protected OperationStatus getNextNearestItem(DatabaseEntry headKey,

            DatabaseEntry result) throws DatabaseException {

        Cursor cursor = null;

        OperationStatus status;

        try {

            //打开游标

            cursor = this.pendingUrisDB.openCursor(null, null);

            // get cap; headKey at this point should always point to 

            // a queue-beginning cap entry (zero-length value)

            status = cursor.getSearchKey(headKey, result, null);

            if(status!=OperationStatus.SUCCESS || result.getData().length > 0) {

                // cap missing

                throw new DatabaseException("bdb queue cap missing");

            }

            // get next item (real first item of queue)

            status = cursor.getNext(headKey,result,null);

        } finally { 

            if(cursor!=null) {

                cursor.close();

            }

        }

        return status;

    }

 /**

     * Put the given CrawlURI in at the appropriate place. 

     * 添加URL到数据库

     * @param curi

     * @throws DatabaseException

     */

    public void put(CrawlURI curi, boolean overwriteIfPresent) 

    throws DatabaseException {

        DatabaseEntry insertKey = (DatabaseEntry)curi.getHolderKey();

        if (insertKey == null) {

            insertKey = calculateInsertKey(curi);

            curi.setHolderKey(insertKey);

        }

        DatabaseEntry value = new DatabaseEntry();

        crawlUriBinding.objectToEntry(curi, value);

        // Output tally on avg. size if level is FINE or greater.

        if (LOGGER.isLoggable(Level.FINE)) {

            tallyAverageEntrySize(curi, value);

        }

        OperationStatus status; 

        if(overwriteIfPresent) {

            //添加

            status = pendingUrisDB.put(null, insertKey, value);

        } else {

            status = pendingUrisDB.putNoOverwrite(null, insertKey, value);

        }

        if(status!=OperationStatus.SUCCESS) {

            LOGGER.severe("failed; "+status+ " "+curi);

        }

    }

    

}

BdbWorkQueue:

代表一个链接队列,该队列中所有的链接都具有相同的键值.它实际上是通过调用BdbMultipleWorkQueues的get方法从等处理链接数据库中取得一个链接的.

Code

WorkQueueFrontier:

实现了最核心的三个方法.

Code

BdbFrontier:

继承了WorkQueueFrontier,是Heritrix唯一个具有实际意义的链接工厂.

Code

BdbUriUniqFilter:
实际上是一个过滤器,它用来检查一个要进入等待队列的链接是否已经被抓取过.

Code

深入学习Heritrix---解析Frontier(链接工厂)（转）的更多相关文章

深入学习Python解析并解密PDF文件内容的方法
前面学习了解析PDF文档,并写入文档的知识,那篇文章的名字为深入学习Python解析并读取PDF文件内容的方法. 链接如下:https://www.cnblogs.com/wj-1314/p/9429 ...
CS学习资料百度云链接
CS学习资料百度云链接 [0]Springboot微服务开发天气预报系统视频教程https://pan.baidu.com/s/1joz7flyztCq8oklBlsz8dQ提取密码:cpz7 [1] ...
小菜学习设计模式（三）—工厂方法（Factory Method）模式
前言设计模式目录: 小菜学习设计模式(一)—模板方法(Template)模式小菜学习设计模式(二)—单例(Singleton)模式小菜学习设计模式(三)—工厂方法(Factory Method) ...
Delphi之通过代码示例学习XML解析、StringReplace的用法（异常控制 good）
*Delphi之通过代码示例学习XML解析.StringReplace的用法这个程序可以用于解析任何合法的XML字符串. 首先是看一下程序的运行效果: 以解析这样一个XML的字符串为例: <? ...
jquery源码学习笔记三：jQuery工厂剖析
jquery源码学习笔记二:jQuery工厂 jquery源码学习笔记一:总体结构上两篇说过,query的核心是一个jQuery工厂.其代码如下 function( window, noGlobal ...
分布式深度学习DDL解析
分布式深度学习DDL解析一．概述给一个庞大的GPU集群,在实际的应用中,现有的大数据调度器会导致长队列延迟和低的性能,该文章提出了Tiresias,即一个GPU集群的调度器,专门适应分布式深度学习 ...
深入学习python解析并读取PDF文件内容的方法
这篇文章主要学习了python解析并读取PDF文件内容的方法,包括对学习库的应用,python2.7和python3.6中python解析PDF文件内容库的更新,包括对pdfminer库的详细解释和应 ...
【javaweb学习】解析XML
XML解析方式有两种 dom:Document Object Model文档对象模型,是w3c组织推荐的解析方式 sax:Simple Api XML不是官方标准,但它是XML社区实际上的标准,几乎所 ...
python学习（解析python官网会议安排）
在学习python的过程中,做练习,解析https://www.python.org/events/python-events/ HTML文件,输出Python官网发布的会议时间.名称和地点. 对ht ...

随机推荐

JSP SERVLET 基础知识
jsp(java server page)和servlet是JAVA EE规范的两个基本成员,是JAVA WEB开发的重点也是基础知识.JSP本质上也需要编译成SERVLET运行. JSP比较简单,可 ...
关于JSON字符串
向客户端返回JSON字符串有两种方法: 1.纯手工拼接: result.append("{"); result.append("\"timu\":\& ...
Java 基础总结(二)
本文参见:http://www.cnblogs.com/dolphin0520/category/361055.html 1. 字节流与和字符流 1). 字符流操作时使用了缓冲区,而在关闭字符流时会强 ...
左连接、右连接、内连接和where
首先可以看下w3school写的关于join的介绍: http://www.w3school.com.cn/sql/sql_join.asp on是关联条件,where是筛选条件数据库在通过连接两张 ...
Python面试题之Python对象反射、类反射、模块反射
python面向对象中的反射:通过字符串的形式操作对象相关的属性.python中的一切事物都是对象(都可以使用反射) 一.getattr 对象获取 class Manager: role = &quo ...
SHA和MD5的Salt
常用的对称加密算法有:DES.3DES.RC2.RC4.AES 常用的非对称加密算法有:RSA.DSA.ECC 使用单向散列函数的加密算法(摘要算法):MD5.SHA 那么什么是salt?生成一个随机 ...
通过Apache配置web服务器反向代理
- 第一步: 到安装好的apache文件目录conf文件下,找到httpd.conf文件找到如下配置,去掉#可以启动HTTP反向代理功能 : LoadModule proxy_module modu ...
使用redis做mysql缓存
应用Redis实现数据的读写,同时利用队列处理器定时将数据写入mysql. 同时要注意避免冲突,在redis启动时去mysql读取所有表键值存入redis中,往redis写数据时,对redis主键自增 ...
Could not find com.android.support:appcompat-v7:23.1.1
在刚接触Android Studio的时候,这玩意整起来确实费劲,现在接触多了,感觉还好,毕竟还有一段提升的空间,以后的必然趋势,所以还是潜心下来好好搞搞. 废话少说,切入正题. 如图所示的error ...
UVA 725 UVA 10976 简单枚举
UVA 725 题意:0~9十个数组成两个5位数(或0开头的四位数),要求两数之商等于输入的数据n.abcde/fghij=n. 思路:暴力枚举,枚举fghij的情况算出abcde判断是否符合题目条件 ...

深入学习Heritrix---解析Frontier(链接工厂)（转）

深入学习Heritrix---解析Frontier(链接工厂)（转）的更多相关文章

随机推荐

热门专题