crawler4j源码学习(2)：Ziroom租房网房源信息采集爬虫

crawler4j是用Java实现的开源网络爬虫。提供了简单易用的接口，可以在几分钟内创建一个多线程网络爬虫。下面实例结合jsoup解析网页，javacsv存储采集数据；采集自如ziroom租房网（http://sz.ziroom.com/z/nl/）的出租房信息。

所有的过程仅需两步完成：

第一步：开发Ziroom采集核心部分代码：

/**

 * @date 2016年8月20日 下午6:13:24

 * @version

 * @since JDK 1.8

 */

public class ZiroomCrawler extends WebCrawler {

    /** 爬取匹配原则 */

    private final static Pattern FILTERS = Pattern.compile(".*(\\.(css|js|bmp|gif|jpe?g|ico"

            + "|png|tiff?|mid|mp2|mp3|mp4" + "|wav|avi|mov|mpeg|ram|m4v|pdf" + "|rm|smil|wmv|swf|wma|zip|rar|gz))$");

    /** 爬取数据保存文件路径 */

    private final static String DATA_PATH = "data/crawl/ziroom.csv";

    /** 爬取link文件路径 */

    private final static String LINK_PATH = "data/crawl/link.csv";

    // private static final Logger logger =

    // LoggerFactory.getLogger(ZiroomCrawler.class);

    private final static String URL_PREFIX = "http://sh.ziroom.com/z/nl/";

    private final File fLinks;

    private final File fDatas;

    private CsvWriter csvLinks;

    private CsvWriter csvDatas;

    /**

     * You should implement this function to specify whether the given url

     * should be crawled or not (based on your crawling logic).

     */

    ZiroomCrawlStat myCrawlStat;

    public ZiroomCrawler() throws IOException {

        myCrawlStat = new ZiroomCrawlStat();

        fLinks = new File(DATA_PATH);

        fDatas = new File(LINK_PATH);

        if (fLinks.isFile()) {

            fLinks.delete();

        }

        if (fDatas.isFile()) {

            fDatas.delete();

        }

        csvDatas = new CsvWriter(new FileWriter(fDatas, true), ',');

        csvDatas.write("请求路径");

        csvDatas.endRecord();

        csvDatas.close();

        csvLinks = new CsvWriter(new FileWriter(fLinks, true), ',');

        csvLinks.write("图片");

        csvLinks.write("价格");

        csvLinks.write("地址");

        csvLinks.write("说明");

        csvLinks.endRecord();

        csvLinks.close();

    }

    public void dumpMyData() {

        final int id = getMyId();

        // You can configure the log to output to file

        logger.info("Crawler {} > Processed Pages: {}", id, myCrawlStat.getTotalProcessedPages());

        logger.info("Crawler {} > Total Links Found: {}", id, myCrawlStat.getTotalLinks());

        logger.info("Crawler {} > Total Text Size: {}", id, myCrawlStat.getTotalTextSize());

    }

    @Override

    public Object getMyLocalData() {

        return myCrawlStat;

    }

    @Override

    public void onBeforeExit() {

        dumpMyData();

    }

    /*

     * 这个方法决定了要抓取的URL及其内容，例子中只允许抓取“http://sh.ziroom.com/z/nl/”这个域的页面,

     * 不允许.css、.js和多媒体等文件

     *

     * @see edu.uci.ics.crawler4j.crawler.WebCrawler#shouldVisit(edu.uci.ics.

     * crawler4j.crawler.Page, edu.uci.ics.crawler4j.url.WebURL)

     */

    @Override

    public boolean shouldVisit(Page referringPage, WebURL url) {

        final String href = url.getURL().toLowerCase();

        if (FILTERS.matcher(href).matches() || !href.startsWith(URL_PREFIX)) {

            return false;

        }

        return true;

    }

    /*

     * 当URL下载完成会调用这个方法。你可以轻松获取下载页面的url, 文本, 链接, html,和唯一id等内容。

     *

     * @see

     * edu.uci.ics.crawler4j.crawler.WebCrawler#visit(edu.uci.ics.crawler4j.

     * crawler.Page)

     */

    @Override

    public void visit(Page page) {

        final String url = page.getWebURL().getURL();

        logger.info("爬取路径：" + url);

        myCrawlStat.incProcessedPages();

        if (page.getParseData() instanceof HtmlParseData) {

            final HtmlParseData htmlParseData = (HtmlParseData) page.getParseData();

            final Set<WebURL> links = htmlParseData.getOutgoingUrls();

            try {

                linkToCsv(links);

            } catch (final IOException e2) {

                // TODO Auto-generated catch block

                e2.printStackTrace();

            }

            myCrawlStat.incTotalLinks(links.size());

            try {

                myCrawlStat.incTotalTextSize(htmlParseData.getText().getBytes("UTF-8").length);

            } catch (final UnsupportedEncodingException e1) {

                // TODO Auto-generated catch block

                e1.printStackTrace();

            }

            final String html = htmlParseData.getHtml();

            final Document doc = Jsoup.parse(html);

            final Elements contents = doc.select("li[class=clearfix]");

            for (final Element c : contents) {

                // 图片

                final String img = c.select(".img img").first().attr("src");

                logger.debug("图片：" + img);

                // 地址

                final Element txt = c.select("div[class=txt]").first();

                final String arr1 = txt.select("h3 a").first().text();

                final String arr2 = txt.select("h4 a").first().text();

                final String arr3 = txt.select("div[class=detail]").first().text();

                final String arr = arr1.concat(arr1 + ",").concat(arr2 + ",").concat(arr3);

                logger.debug("地址：" + arr);

                // 说明

                final String rank = txt.select("p").first().text();

                logger.debug("说明：" + rank);

                // 价格

                final String pirce = c.select("p[class=price]").first().text();

                try {

                    csvLinks = new CsvWriter(new FileWriter(fLinks, true), ',');

                    csvLinks.write(img);

                    csvLinks.write(pirce);

                    csvLinks.write(arr);

                    csvLinks.write(rank);

                    csvLinks.endRecord();

                    csvLinks.flush();

                    csvLinks.close();

                } catch (final IOException e) {

                    e.printStackTrace();

                }

            }

        }

    }

    private void linkToCsv(Set<WebURL> links) throws IOException {

        csvDatas = new CsvWriter(new FileWriter(fDatas, true), ',');

        for (final WebURL webURL : links) {

            csvDatas.write(webURL.getURL());

        }

        csvDatas.flush();

        csvDatas.endRecord();

        csvDatas.close();

    }

}

第二步：开发Ziroom采集控制部分代码：

/**

 * @date 2016年8月20日 下午6:15:01

 * @version

 * @since JDK 1.8

 */

public class ZiroomController {

    public static void main(String[] args) {

        final String crawlStorageFolder = "data/crawl/root";

        final int numberOfCrawlers = 3;

        final CrawlConfig config = new CrawlConfig();

        config.setCrawlStorageFolder(crawlStorageFolder);

        config.setPolitenessDelay(1000);

        config.setIncludeBinaryContentInCrawling(false);

        config.setMaxPagesToFetch(50);

        final PageFetcher pageFetcher = new PageFetcher(config);

        final RobotstxtConfig robotstxtConfig = new RobotstxtConfig();

        final RobotstxtServer robotstxtServer = new RobotstxtServer(robotstxtConfig, pageFetcher);

        CrawlController controller;

        try {

            controller = new CrawlController(config, pageFetcher, robotstxtServer);

            controller.addSeed("http://sh.ziroom.com/z/nl/");

            controller.start(ZiroomCrawler.class, numberOfCrawlers);

            final List<Object> crawlersLocalData = controller.getCrawlersLocalData();

            long totalLinks = 0;

            long totalTextSize = 0;

            int totalProcessedPages = 0;

            for (final Object localData : crawlersLocalData) {

                final ZiroomCrawlStat stat = (ZiroomCrawlStat) localData;

                totalLinks += stat.getTotalLinks();

                totalTextSize += stat.getTotalTextSize();

                totalProcessedPages += stat.getTotalProcessedPages();

            }

            System.out.println("Aggregated Statistics:");

            System.out.println("\tProcessed Pages: {}" + totalProcessedPages);

            System.out.println("\tTotal Links found: {}" + totalLinks);

            System.out.println("\tTotal Text Size: {}" + totalTextSize);

        } catch (final Exception e) {

            // TODO Auto-generated catch block

            e.printStackTrace();

        }

    }

}

第三步：开发Ziroom采集状态搜集代码：

/**

 * @date 2016年8月20日 下午6:14:13

 * @version

 * @since JDK 1.8

 */

public class ZiroomCrawlStat {

    private long totalLinks;

    private int totalProcessedPages;

    private long totalTextSize;

    public long getTotalLinks() {

        return totalLinks;

    }

    public int getTotalProcessedPages() {

        return totalProcessedPages;

    }

    public long getTotalTextSize() {

        return totalTextSize;

    }

    public void incProcessedPages() {

        this.totalProcessedPages++;

    }

    public void incTotalLinks(int count) {

        this.totalLinks += count;

    }

    public void incTotalTextSize(int count) {

        this.totalTextSize += count;

    }

    public void setTotalLinks(long totalLinks) {

        this.totalLinks = totalLinks;

    }

    public void setTotalProcessedPages(int totalProcessedPages) {

        this.totalProcessedPages = totalProcessedPages;

    }

    public void setTotalTextSize(long totalTextSize) {

        this.totalTextSize = totalTextSize;

    }

}

Ziroom采集数据展示：

crawler4j源码学习(2)：Ziroom租房网房源信息采集爬虫的更多相关文章

crawler4j源码学习(1)：搜狐新闻网新闻标题采集爬虫
crawler4j是用Java实现的开源网络爬虫.提供了简单易用的接口,可以在几分钟内创建一个多线程网络爬虫.下面实例结合jsoup,采集搜狐新闻网(http://news.sohu.com/)新闻标 ...
NewBluePill源码学习
NewBluePill的源码也看的差不多了,一直说等有时间了再写学习的一些心得,拖来拖去弄到现在了,时间不是等来的,慢慢开始吧. 0x00 初识硬件虚拟化硬件虚拟化对大数人来讲还是比较陌生. ...
框架源码系列十一：事务管理（Spring事务管理的特点、事务概念学习、Spring事务使用学习、Spring事务管理API学习、Spring事务源码学习）
一.Spring事务管理的特点 Spring框架为事务管理提供一套统一的抽象,带来的好处有:1. 跨不同事务API的统一的编程模型,无论你使用的是jdbc.jta.jpa.hibernate.2. 支 ...
Vue源码学习1——Vue构造函数
Vue源码学习1--Vue构造函数这是我第一次正式阅读大型框架源码,刚开始的时候完全不知道该如何入手.Vue源码clone下来之后这么多文件夹,Vue的这么多方法和概念都在哪,完全没有头绪.现在也只 ...
NewBluePill源码学习 <一>
NewBluePill的源码也看的差不多了,一直说等有时间了再写学习的一些心得,拖来拖去弄到现在了,时间不是等来的,慢慢开始吧. 0x00 初识硬件虚拟化硬件虚拟化对大数人来讲还是比较陌生. ...
Vue源码学习二 ———— Vue原型对象包装
Vue原型对象的包装在Vue官网直接通过 script 标签导入的 Vue包是 umd模块的形式.在使用前都通过 new Vue({}).记录一下 Vue构造函数的包装. 在 src/core/in ...
SpringBoot源码学习系列之SpringMVC自动配置
目录 1.ContentNegotiatingViewResolver 2.静态资源 3.自动注册 Converter, GenericConverter, and Formatter beans. ...
SpringBoot源码学习系列之嵌入式Servlet容器
目录 1.博客前言简单介绍 2.定制servlet容器 3.变换servlet容器 4.servlet容器启动原理 SpringBoot源码学习系列之嵌入式Servlet容器启动原理 @ 1.博客前言 ...
vue-elemnt-admin源码学习
vue-elemnt-admin源码学习 vue-element-admin是一个基于vue,element-ui的集成的管理后台.它的安装部分就不说了,按照官网的步骤一步步就可以执行了. https ...

随机推荐

sprin加载顺序
spring加载有个比较有意思的问题,这里片很不错的文章 http://guoliangqi.iteye.com/blog/632697
java类集框架图（google找的，备个份）
让你的网站秒开为IIS启用“内容过期”
让你的网站秒开,为IIS启用“内容过期” 什么是内容过期? 当用户第一次访问你的网站,浏览器从你的网站主机下载内容,如果用户第二次访问你的网站,浏览器从缓存读取内容.你知道浏览器从缓存读取网页有多快吗 ...
python中的Queue
一.先说说Queue(队列对象) Queue是python中的标准库,可以直接import 引用,之前学习的时候有听过著名的“先吃先拉”与“后吃先吐”,其实就是这里说的队列,队列的构造的时候可以定义它 ...
PHP数据运算优先级总结记忆
运算符优先级
集合中list、ArrayList、LinkedList、Vector的区别、Collection接口的共性方法以及数据结构的总结
List (链表|线性表) 特点: 接口,可存放重复元素,元素存取是有序的,允许在指定位置插入元素,并通过索引来访问元素 1.创建一个用指定可视行数初始化的新滚动列表.默认情况下,不允许进行多项选择. ...
vim - Highlight unwanted spaces
http://vim.wikia.com/wiki/VimTip396 precondition: set hlsearch" Show all tabs:/\t" Show tr ...
一个iOS项目中包含多个xcodeproj文件，如何运行其中的一个项目
从GitHub上下载的Masonry的iOS源码,打开发现有多个项目,直接运行,模拟器没反应.由于Masonry是一个多工程的项目,每个项目都依赖Masonry的源码,所以要运行Masonry的Exa ...
XSS (Cross Site Scripting) Prevention Cheat Sheet(XSS防护检查单)
本文是 XSS防御检查单的翻译版本 https://www.owasp.org/index.php/XSS_%28Cross_Site_Scripting%29_Prevention_Cheat_Sh ...
Apache Commons 工具集
一.Commons BeanUtils http://jakarta.apache.org/commons/beanutils/index.html 说明:针对Bean的一个工具集.由于Bean往往是 ...

crawler4j源码学习(2)：Ziroom租房网房源信息采集爬虫

crawler4j源码学习(2)：Ziroom租房网房源信息采集爬虫的更多相关文章

随机推荐

热门专题