Java爬虫框架之WebMagic

一、介绍

WebMagic是一个简单灵活的Java爬虫框架。基于WebMagic，你可以快速开发出一个高效、易维护的爬虫。

二、如何学习

1.查看官网

官网地址为:http://webmagic.io/
官网详细文档:http://webmagic.io/docs/zh/

2.跑通hello world示例(具体可以参考官网，也可以参考博客)

我下面写的单元测试案例，可作为Hello World示例。

注意需要导入Maven依赖:

<dependency>

    <groupId>us.codecraft</groupId>

    <artifactId>webmagic-core</artifactId>

    <version>0.7.3</version>

</dependency>

<dependency>

    <groupId>us.codecraft</groupId>

    <artifactId>webmagic-extension</artifactId>

    <version>0.7.3</version>

</dependency>

3.带着一个目的

说说我的目的，最近我开发的博客系统，其中有个导入第三方博客的插件，这个插件比较简单就是一个搜索框，在对应的搜索框里面填写URL，点击搜索即可导入到自己的博客。

以导入博客园单篇文章为例:

下面是我的源代码(单篇文章导入,我已经将其封装成一个工具类):

import cn.hutool.core.date.DateUtil;

import com.blog.springboot.dto.CnBlogModelDTO;

import com.blog.springboot.entity.Posts;

import com.blog.springboot.service.PostsService;

import org.springframework.beans.factory.annotation.Autowired;

import org.springframework.stereotype.Component;

import us.codecraft.webmagic.Page;

import us.codecraft.webmagic.Site;

import us.codecraft.webmagic.Spider;

import us.codecraft.webmagic.pipeline.ConsolePipeline;

import us.codecraft.webmagic.processor.PageProcessor;

import us.codecraft.webmagic.selector.Selectable;

import javax.annotation.PostConstruct;

/**

 * 导入博客园文章工具类

 */

@Component

public class WebMagicCnBlogUtils implements PageProcessor {

    @Autowired

    private PostsService postService;

    public static WebMagicCnBlogUtils magicCnBlogUtils;

    @PostConstruct

    public void init() {

        magicCnBlogUtils = this;

        magicCnBlogUtils.postService = this.postService;

    }

    private Site site = Site.me()

            .setDomain("https://www.cnblogs.com/")

            .setSleepTime()

            .setUserAgent("Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/67.0.3396.99 Safari/537.36");

    @Override

    public void process(Page page) {

        Selectable obj = page.getHtml().xpath("//div[@class='post']");

        Selectable title = obj.xpath("//h1[@class='postTitle']//a");

        Selectable content = obj.xpath("//div[@class='blogpost-body']");

        System.out.println("title:" + title.replace("<[^>]*>", ""));

        System.out.println("content:" + content);

        CnBlogModelDTO blog = new CnBlogModelDTO();

        blog.setTitle(title.toString());

        blog.setContent(content.toString());

        Posts post = new Posts();

        String date = DateUtil.date().toString();

        post.setPostAuthor(1L);

        post.setPostTitle(title.replace("<[^>]*>", "").toString());

        post.setPostContent(content.toString());

        post.setPostExcerpt(content.replace("<[^>]*>", "").toString());

        post.setPostDate(date);

        post.setPostDate(date);

        post.setPostModified(date);

        boolean importPost = magicCnBlogUtils.postService.insert(post);

        if (importPost) {

            System.out.println("success");

        } else {

            System.out.println("fail");

        }

    }

    @Override

    public Site getSite() {

        return site;

    }

    /**

     * 导入单篇博客园文章数据

     *

     * @param url

     */

    public static void importSinglePost(String url) {

        Spider.create(new WebMagicCnBlogUtils())

                .addUrl(url)

                .addPipeline(new ConsolePipeline())

                .run();

    }

}

单元测试代码:

import com.blog.springboot.dto.CnBlogModelDTO;

import us.codecraft.webmagic.Page;

import us.codecraft.webmagic.Site;

import us.codecraft.webmagic.Spider;

import us.codecraft.webmagic.pipeline.ConsolePipeline;

import us.codecraft.webmagic.processor.PageProcessor;

import us.codecraft.webmagic.selector.Selectable;

public class WebMagicJunitTest implements PageProcessor {

    private Site site = Site.me()

            .setDomain("https://www.cnblogs.com/")

            .setSleepTime()

            .setUserAgent("Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/67.0.3396.99 Safari/537.36");

    @Override

    public void process(Page page) {

        Selectable obj = page.getHtml().xpath("//div[@class='post']");

        Selectable title = obj.xpath("//h1[@class='postTitle']//a");

        Selectable content = obj.xpath("//div[@class='blogpost-body']");

        System.out.println("title:" + title.replace("<[^>]*>", ""));

        System.out.println("content:" + content);

    }

    @Override

    public Site getSite() {

        return site;

    }

    public static void importSinglePost(String url) {

        Spider.create(new WebMagicJunitTest())

                .addUrl(url)

                .addPipeline(new ConsolePipeline())

                .run();

    }

    public static void main(String[] args) {

        WebMagicJunitTest.importSinglePost("https://www.cnblogs.com/youcong/p/9404007.html");

    }

另外我是怎么知道要爬取哪些数据呢?
需求第一，然后通过Chrome或Firefox浏览器检查元素，如图:

Java爬虫框架之WebMagic的更多相关文章

JAVA 爬虫框架webmagic 初步使用Demo
一想到做爬虫大家第一个想到的语言一定是python,毕竟python比方便,而且最近也非常的火爆,但是python有一个全局锁的概念新能有瓶颈,所以用java还是比较牛逼的, webmagic 官网 ...
java爬虫框架jsoup
1.java爬虫框架的api jsoup:https://www.open-open.com/jsoup/
Java爬虫框架WebMagic——入门（爬取列表类网站文章）
初学爬虫,WebMagic作为一个Java开发的爬虫框架很容易上手,下面就通过一个简单的小例子来看一下. WebMagic框架简介 WebMagic框架包含四个组件,PageProcessor.Sch ...
Java爬虫框架WebMagic入门——爬取列表类网站文章
初学爬虫,WebMagic作为一个Java开发的爬虫框架很容易上手,下面就通过一个简单的小例子来看一下. WebMagic框架简介 WebMagic框架包含四个组件,PageProcessor.Sch ...
【java爬虫】利用webmagic框架实战demo
webmagic框架:http://webmagic.io/ WebMagic的结构分为Downloader.PageProcessor.Scheduler.Pipeline四大组件 PageProc ...
Java爬虫框架调研
Python中大的爬虫框架有scrapy(风格类似django),pyspider(国产python爬虫框架). 除了Python,Java中也有许多爬虫框架. nutch apache下的开源爬虫程 ...
Java爬虫框架 | 爬小说
Jsoup,Java爬虫解决方案,中文文档:jsoup 不得不说Java的生态真的好,原来我以为爬虫是只能用Pyhton来写的,结果发现Java的爬虫框架不要太多…… 一分钟你就可以写 ...
java爬虫框架webmagic学习（一）
1. 爬虫的分类:分布式和单机分布式主要就是apache的nutch框架,java实现,依赖hadoop运行,学习难度高,一般只用来做搜索引擎开发. java单机的框架有:webmagic和webc ...
Java爬虫框架Jsoup学习记录
Jsoup的作用当你想获得某网页的内容,可以使用此框架做个爬虫程序,爬某图片网站的图片(先获得图片地址,之后再借助其他工具下载图片)或者是小说网站的小说内容我使用Jsoup写出的一款小说下载器,小 ...

随机推荐

WPF 窗体快捷键(热键)
前言:在WPF项目开发当中,遇到了需要用到快捷键的需求,于是对热键做了一个快速学习,但是这方面的资源很少... 热键大致分为三种场景,下面用QQ的使用场景举例: 全局热键:QQ的Ctrl+Alt+A截 ...
CSP201903-2二十四点
如图所示先处理乘号和除号,再处理加减. #include<bits/stdc++.h> using namespace std; ];int main(){ int n; cin>& ...
VC/c++版本获取现行时间戳精确到毫秒
时间戳是指格林威治时间1970年01月01日00时00分00秒(北京时间1970年01月01日08时00分00秒)起至现在的总秒数.通俗的讲, 时间戳是一份能够表示一份数据在一个特定时间点已经存在的完 ...
Redis远程连接报错解决
今天测试了一下在本机(win10系统)远程连接 centos下的redis,结果报了以下错误: Exception in thread "main" redis.clients.j ...
一文MyBatis-Plus快速入门
目录一.依赖及配置 1.在idea中创建一个SpringBoot项目,在pom.xml中添需要的依赖 2.配置数据库连接 3.在启动类中添加注解 @MapperScan 扫描Mapper接口包 4. ...
HDU4507 吉哥系列故事——恨7不成妻题解数位DP
题目链接:http://acm.hdu.edu.cn/showproblem.php?pid=4507 题目大意: 找到区间 \([L,R]\) 范围内所有满足如下条件的数的平方和 : 不包含'7' ...
Codeforces Round #612 (Div. 2) 前四题题解
这场比赛的出题人挺有意思,全部magic成了青色. 还有题目中的图片特别有趣. 晚上没打,开virtual contest打的,就会前三道,我太菜了. 最后看着题解补了第四道. 比赛传送门 A. An ...
小小知识点（十七）——对数形式功率（dBm）与非对数形式功率(w)之间的换算关系
摘自https://blog.csdn.net/shij19/article/details/52946454 dBm 物理含义是:一个表示功率绝对值的值(也可以认为是以1mW功率为基准的一个比值) ...
RHEL6.6安装Oracle 11g RAC - 基于VMware的实验环境
实验环境准备虚拟机:VMware® Workstation 14 Pro操作系统:Red Hat Enterprise Linux 6.6 x86_64rhel-server-6.6-x86_64-d ...
Hexo 中使用 emoji 和 tasks
替换为 markdown-it 今天在迁移博客项目的时候,发现原来在 hugo 中可以使用的 Emoji 和 tasks 功能都不能正常使用了,查询了一下原因,主要是因为 hexo 默认的解析器是 h ...