Java版网络爬虫基础

　　网络爬虫不仅仅可以爬取网站的网页，图片，甚至可以实现抢票功能，网上抢购，机票查询等。这几天看了点基础，记录下来。

网页的关系可以看做是一张很大的图，图的遍历可以分为深度优先和广度优先。网络爬虫采取的广度优先，概括的说来如下:

2个数组，一个记录已访问的网页(Al)，一个记录未访问的网页(Un)。假设网页A为爬取的起始点，分析A中的所有的超链接B,C,D，将B,C,D加入到Un，分析B中的所有的超链接E,F，将E,F加入到Un末尾，将B从Un除去并加入到AL。依次分析Un中的超链接并加入到Un中就能完成广度优先的遍历。

从上面可以看出，自己写爬虫有几个主要部分，分析网页中的链接，将使用htmlparser来完成，网页的下载功能，将使用httpcliient来完成。

现有的爬虫工具有webharvest等，可以直接使用。Lucene是一个全文检索系统的框架，它只是用来建立索引并搜索的，它不能够实现网络爬虫功能。能够实现网络搜索的系统叫Nutch，它是基于Lucene开发的。

相关中间件的下载地址；

　　HTMLParser : http://downloads.sourceforge.net/project/htmlparser/Integration-Builds/2.0-20060923/HTMLParser-2.0-SNAPSHOT-bin.zip

　　httpcliient : http://hc.apache.org/downloads.cgi

httpclient分为3.x版本和4.x版本，使用3.x版本的在抓取HTTP V1.1时总出现cache设置的问题，使用4.x版本则是正常的。使用了代理时对httpclient和htmlparser都需要做代理设置。

LinkQueue定义已访问队列，待访问队列和爬取得URL的哈希表，包括出队列，入队列，判断队列是否空等操作。

public class LinkQueue {

    // 已访问的 url 集合

    private static Set<String> visitedUrl = new HashSet<String>();

    // 待访问的 url 集合

    private static Queue<String> unVisitedUrl = new PriorityQueue<String>();

    // 获得URL队列

    public static Queue<String> getUnVisitedUrl() {

        return unVisitedUrl;

    }

    // 添加到访问过的URL队列中

    public static void addVisitedUrl(String url) {

        visitedUrl.add(url);

    }

    // 移除访问过的URL

    public static void removeVisitedUrl(String url) {

        visitedUrl.remove(url);

    }

    // 未访问的URL出队列

    public static Object unVisitedUrlDeQueue() {

        return unVisitedUrl.poll();

    }

    // 保证每个 url 只被访问一次

    public static void addUnvisitedUrl(String url) {

        if (url != null && !url.trim().equals("") && !visitedUrl.contains(url) && !unVisitedUrl.contains(url))

            unVisitedUrl.add(url);

    }

    // 获得已经访问的URL数目

    public static int getVisitedUrlNum() {

        return visitedUrl.size();

    }

    // 判断未访问的URL队列中是否为空

    public static boolean unVisitedUrlsEmpty() {

        return unVisitedUrl.isEmpty();

    }

}

实现抓取内容过滤的接口LinkFilter

public interface LinkFilter {

    public boolean accept(String url);

}

DownLoadFile类，根据得到的url，爬取网页内容，下载到本地保存。 F盘下面需要有名为spider的文件夹，存储爬取的网页。

public class DownLoadFileV4 {

    /* 下载 url 指向的网页 */

    public String downloadFile(String url) throws Exception {

        String filePath = null;

        // 初始化，此处构造函数就与3.1中不同

        HttpClient httpclient = new DefaultHttpClient();

        //设置代理和超时，没有使用代理时注掉

        HttpHost proxy = new HttpHost("172.16.91.109", 808);

        httpclient.getParams().setParameter(ConnRoutePNames.DEFAULT_PROXY, proxy);

        httpclient.getParams().setIntParameter(CoreConnectionPNames.CONNECTION_TIMEOUT, 3000);

        HttpHost targetHost = new HttpHost(url.replace("http://", ""));

        HttpGet httpget = new HttpGet("/");

        // 查看默认request头部信息

        System.out.println("Accept-Charset:" + httpget.getFirstHeader("Accept-Charset"));

        // 以下这条如果不加会发现无论你设置Accept-Charset为gbk还是utf-8，他都会默认返回gb2312（本例针对google.cn来说）

        httpget.setHeader("User-Agent", "Mozilla/5.0 (Windows; U; Windows NT 5.1; zh-CN; rv:1.9.1.2)");

        // 用逗号分隔显示可以同时接受多种编码

        httpget.setHeader("Accept-Language", "zh-cn,zh;q=0.5");

        httpget.setHeader("Accept-Charset", "GB2312,utf-8;q=0.7,*;q=0.7");

        // 验证头部信息设置生效

        System.out.println("Accept-Charset:" + httpget.getFirstHeader("Accept-Charset").getValue());

        // Execute HTTP request

        System.out.println("executing request " + httpget.getURI());

        HttpResponse response = null;

        try {

            response = httpclient.execute(targetHost, httpget);

        // HttpResponse response = httpclient.execute(httpget);

        System.out.println("----------------------------------------");

        System.out.println("Location: " + response.getLastHeader("Location"));

        System.out.println(response.getStatusLine().getStatusCode());

        System.out.println(response.getLastHeader("Content-Type"));

        System.out.println(response.getLastHeader("Content-Length"));

        System.out.println("----------------------------------------");

        // 判断页面返回状态判断是否进行转向抓取新链接

        int statusCode = response.getStatusLine().getStatusCode();

        if ((statusCode == HttpStatus.SC_MOVED_PERMANENTLY) || (statusCode == HttpStatus.SC_MOVED_TEMPORARILY) || (statusCode == HttpStatus.SC_SEE_OTHER)

                || (statusCode == HttpStatus.SC_TEMPORARY_REDIRECT)) {

            // 此处重定向处理 此处还未验证

            String newUri = response.getLastHeader("Location").getValue();

            httpclient = new DefaultHttpClient();

            httpget = new HttpGet(newUri);

            response = httpclient.execute(httpget);

        }

        // Get hold of the response entity

        HttpEntity entity = response.getEntity();

        // 查看所有返回头部信息

        Header headers[] = response.getAllHeaders();

        int ii = 0;

        while (ii < headers.length) {

            System.out.println(headers[ii].getName() + ": " + headers[ii].getValue());

            ++ii;

        }

        // If the response does not enclose an entity, there is no need

        // to bother about connection release

        if (entity != null) {

            // 将源码流保存在一个byte数组当中，因为可能需要两次用到该流，

            byte[] bytes = EntityUtils.toByteArray(entity);

            if(response.getLastHeader("Content-Type") != null){

                filePath = "f:\\spider\\" + getFileNameByUrl(url, response.getLastHeader("Content-Type").getValue());

            }else{

                filePath = "f:\\spider\\" + url.substring(url.lastIndexOf("/"), url.length());

            }

            saveToLocal(bytes, filePath);

            String charSet = "";

            // 如果头部Content-Type中包含了编码信息，那么我们可以直接在此处获取

            charSet = EntityUtils.getContentCharSet(entity);

            System.out.println("In header: " + charSet);

            // 如果头部中没有，那么我们需要 查看页面源码，这个方法虽然不能说完全正确，因为有些粗糙的网页编码者没有在页面中写头部编码信息

            if (charSet == "") {

                String regEx = "(?=<meta).*?(?<=charset=[\\'|\\\"]?)([[a-z]|[A-Z]|[0-9]|-]*)";

                Pattern p = Pattern.compile(regEx, Pattern.CASE_INSENSITIVE);

                Matcher m = p.matcher(new String(bytes)); // 默认编码转成字符串，因为我们的匹配中无中文，所以串中可能的乱码对我们没有影响

                boolean result = m.find();

                if (m.groupCount() == 1) {

                    charSet = m.group(1);

                } else {

                    charSet = "";

                }

            }

            System.out.println("Last get: " + charSet);

            // 至此，我们可以将原byte数组按照正常编码专成字符串输出（如果找到了编码的话）

            //System.out.println("Encoding string is: " + new String(bytes, charSet));

        }} catch (Exception e) {

            e.printStackTrace();

        }

        finally {

            httpclient.getConnectionManager().shutdown();

            httpget.abort();

        }

        return filePath;

    }

    /**

     * 根据 url 和网页类型生成需要保存的网页的文件名 去除掉 url 中非文件名字符

     */

    public String getFileNameByUrl(String url, String contentType) {

        // remove http://

        url = url.substring(7);

        // text/html类型

        if (contentType.indexOf("html") != -1&& url.indexOf(".jpg")!=-1&& url.indexOf(".gif")!=-1) {

            url = url.replaceAll("[\\?/:*|<>\"]", "_") + ".html";

            return url;

        }

        else if(url.indexOf(".jpg")!=-1|| url.indexOf(".gif")!=-1){

            url =url;

            return url;

        }// 如application/pdf类型

        else {

            return url.replaceAll("[\\?/:*|<>\"]", "_") + "." + contentType.substring(contentType.lastIndexOf("/") + 1);

        }

    }

    /**

     * 保存网页字节数组到本地文件 filePath 为要保存的文件的相对地址

     */

    private void saveToLocal(byte[] data, String filePath) {

        try {

            DataOutputStream out = new DataOutputStream(new FileOutputStream(new File(filePath)));

            for (int i = 0; i < data.length; i++)

                out.write(data[i]);

            out.flush();

            out.close();

        } catch (IOException e) {

            e.printStackTrace();

        }

    }

}

HtmlParserTool类，用来获得网页中的超链接（包括a标签，frame中的src等等），即为了得到子节点的URL。需要引入htmlparser.jar。

public class HtmlParserTool {

    public static List<String>imageURLS = new ArrayList<String>();

    // 获取一个网站上的链接,filter 用来过滤链接

    public static Set<String> extracLinks(String url, LinkFilter filter) {

        Set<String> links = new HashSet<String>();

        try {

            Parser parser = new Parser();

            // 设置代理，没有代理时注掉

            System.getProperties().put("proxySet", "true");

            System.getProperties().put("proxyHost", "172.16.91.109");

            System.getProperties().put("proxyPort", "808");

            Parser.getConnectionManager().setProxyHost("123");

            parser.setURL(url);

            parser.setEncoding("utf-8");

            // 设置过滤图片

            NodeFilter imgfil = new TagNameFilter("IMG");

            // 过滤 <frame >标签的 filter，用来提取 frame 标签里的 src 属性所表示的链接

            NodeFilter frameFilter = new NodeFilter() {

                private static final long serialVersionUID = -6464506837817768182L;

                public boolean accept(Node node) {

                    if (node.getText().startsWith("frame src=")) {

                        return true;

                    } else {

                        return false;

                    }

                }

            };

            // OrFilter 来设置过滤 <a> 标签，和 <frame> 标签

            OrFilter lf = new OrFilter(new NodeClassFilter(LinkTag.class), frameFilter);

            // 得到所有经过过滤的标签

            //NodeList list = parser.extractAllNodesThatMatch(lf);

            NodeList list = parser.extractAllNodesThatMatch(imgfil);

            for (int i = 0; i < list.size(); i++) {

                Node tag = list.elementAt(i);

                if (tag instanceof LinkTag)// <a> 标签

                {

                    if (tag instanceof ImageTag) {

                        // 加入图片信息

                        ImageTag link = (ImageTag) tag;

                        String imageUrl = link.getImageURL();// url

                        links.add(imageUrl);

                        imageURLS.add(imageUrl);

                        System.out.println(imageUrl);

                    }else{

                        LinkTag link = (LinkTag) tag;

                        String linkUrl = link.getLink();// url

                        if (filter.accept(linkUrl))

                        links.add(linkUrl);

                    }

                } else// <frame> 标签

                {

                    if (tag instanceof ImageTag) {

                        // 加入图片信息

                        ImageTag link = (ImageTag) tag;

                        String imageUrl = link.getImageURL();// url

                        links.add(imageUrl);

                        imageURLS.add(imageUrl);

                        System.out.println(imageUrl);

                    } else {

                        // 提取 frame 里 src 属性的链接如 <frame src="test.html"/>

                        String frame = tag.getText();

                        int start = frame.indexOf("src=");

                        frame = frame.substring(start);

                        int end = frame.indexOf(" ");

                        if (end == -1)

                            end = frame.indexOf(">");

                        String frameUrl = frame.substring(5, end - 1);

                        if (filter.accept(frameUrl))

                            links.add(frameUrl);

                    }

                }

            }

        } catch (ParserException e) {

            e.printStackTrace();

        }

        return links;

    }

}

测试类MyCrawler，用来测试爬取效果

public class MyCrawler {

    /**

     * 使用种子初始化 URL 队列

     *

     * @return

     * @param seeds

     *            种子URL

     */

    private void initCrawlerWithSeeds(String[] seeds) {

        for (int i = 0; i < seeds.length; i++)

            LinkQueue.addUnvisitedUrl(seeds[i]);

    }

    /**

     * 抓取过程

     *

     * @return

     * @param seeds

     * @throws Exception

     */

    public void crawling(String[] seeds) throws Exception {

        LinkFilter filter = new LinkFilter() {

            public boolean accept(String url) {

                if (url.contains("csdn"))

                    return true;

                else

                    return false;

            }

        };

        // 初始化 URL 队列

        initCrawlerWithSeeds(seeds);

        // 循环条件：待抓取的链接不空且抓取的网页不多于1000

        while (!LinkQueue.unVisitedUrlsEmpty() && LinkQueue.getVisitedUrlNum() <= 1000) {

            // 队头URL出队列

            String visitUrl = (String) LinkQueue.unVisitedUrlDeQueue();

            if (visitUrl == null)

                continue;

            DownLoadFileV4 downLoader = new DownLoadFileV4();

            // 下载网页

            try {

                downLoader.downloadFile(visitUrl);

                // 只下载图片，不下载网页

                //if(HtmlParserTool.imageURLS.contains(visitUrl)){

                //    downLoader.downloadFile(visitUrl);

                //}

            } catch (Exception e) {

                // TODO Auto-generated catch block

                e.printStackTrace();

            }

            System.out.println();

            // 该 url 放入到已访问的 URL 中

            LinkQueue.addVisitedUrl(visitUrl);

            // 提取出下载网页中的 URL

            Set<String> links = HtmlParserTool.extracLinks(visitUrl, filter);

            // 新的未访问的 URL 入队

            for (String link : links) {

                LinkQueue.addUnvisitedUrl(link);

            }

        }

    }

    // main 方法入口

    public static void main(String[] args) throws Exception {

        MyCrawler crawler = new MyCrawler();

        crawler.crawling(new String[] {"http://www.csdn.com"});

    }

}

Java版网络爬虫基础的更多相关文章

Java版网络爬虫基础（转）
网络爬虫不仅仅可以爬取网站的网页,图片,甚至可以实现抢票功能,网上抢购,机票查询等.这几天看了点基础,记录下来. 网页的关系可以看做是一张很大的图,图的遍历可以分为深度优先和广度优先.网络爬虫采取的广 ...
java网络爬虫基础学习（三）
尝试直接请求URL获取资源豆瓣电影 https://movie.douban.com/explore#!type=movie&tag=%E7%83%AD%E9%97%A8&sort= ...
java网络爬虫基础学习（一）
刚开始接触java爬虫,在这里是搜索网上做一些理论知识的总结主要参考文章:gitchat 的java 网络爬虫基础入门,好像要付费,也不贵,感觉内容对新手很友好. 一.爬虫介绍网络爬虫是一个自动提 ...
基于java的网络爬虫框架(实现京东数据的爬取，并将插入数据库)
原文地址http://blog.csdn.net/qy20115549/article/details/52203722 本文为原创博客,仅供技术学习使用.未经允许,禁止将其复制下来上传到百度文库等平 ...
Java之网络爬虫WebCollector2.1.2+selenium2.44+phantomjs2.1.1
Java之网络爬虫WebCollector2.1.2+selenium2.44+phantomjs2.1.1 一.简介版本匹配: WebCollector2.12 + selenium2.44.0 ...
swing版网络爬虫-丑牛迷你采集器2.0
swing版网络爬虫-丑牛迷你采集器2.0 http://www.javacoo.com/code/704.jhtml 整合JEECMS http://bbs.jeecms.com/fabu/3186 ...
java之网络爬虫介绍
文章大纲一.网络爬虫基本介绍二.java常见爬虫框架介绍三.WebCollector实战四.项目源码下载五.参考文章一.网络爬虫基本介绍 1. 什么是网络爬虫网络爬虫(又被称为网页蜘蛛, ...
网络爬虫基础知识（Python实现）
浏览器的请求 url=请求协议(http/https)+网站域名+资源路径+参数 http:超文本传输协议(以明文的形式进行传输),传输效率高,但不安全. https:由http+ssl(安全套接子层 ...
使用Java实现网络爬虫
网络爬虫网络爬虫(又被称为网页蜘蛛,网络机器人,在FOAF社区中间,更经常的称为网页追逐者),是一种按照一定的规则,自动地抓取万维网信息的程序或者脚本. 另外一些不常使用的名字还有蚂蚁.自动索引.模 ...

随机推荐

[bzoj1242] Zju1015 Fishing Net弦图判定
弦图判定..MCS算法. 先选一个点,然后每次拿相邻已选点最多的未选点. 选完之后判断一下是否是完美消除序列. #include<cstdio> #include<iostrea ...
hdu3076—概率dp
hdu3076-概率dp 标签 : 概率dp 题目链接题意: 2个人分别有AB的血数,轮流扔骰子,数小的自减一血,平的不变,谁先到减0, 谁输,问A赢的概率. 题解: dp[i][j]表示的是第一个 ...
UEP-confirm和alert弹窗
function stuDel(){ var ds = ajaxgrid.getCheckedRecords(); if(ds.length==0){ $.alert("提示信息" ...
webpack的安装与使用
在安装 Webpack 前,你本地环境必须已安装nodejs. 可以使用npm安装,当然由于 npm 安装速度慢,也可以使用淘宝的镜像及其命令 cnpm,安装使用介绍参照:使用淘宝 NPM 镜像. 使 ...
如何在Chrome下使用Postman进行rest请求测试
在web和移动端开发时,常常会调用服务器端的restful接口进行数据请求,为了调试,一般会先用工具进行测试,通过测试后才开始在开发中使用.这里介绍一下如何在chrome浏览器利用postman应用进 ...
goDaddy SSL证书 Nginx配置全流程（转）
好长时间没动过这玩意了,今天突然用到,忘的一干二净.在此做个笔记吧! 一.购买Godaddy SSL证书 1.打开Godaddy官网 http://www.godaddy.com/: 2.点击网站导航 ...
5分钟学会使用gitlab
第一次接触到gitlab,操作不是很熟练,犯了一堆错,在多次尝试之后,大概了解了流程,这篇文章主要帮助大家快速上手gitlab,如果文章有什么不对的地方,欢迎在评论区留言~ 1.新建项目首先你得有个 ...
[转]另一种遍历Map的方式： Map.Entry 和 Map.entrySet()
转自: http://blog.csdn.net/mageshuai/article/details/3523116 今天看Think in java 的GUI这一章的时候,里面的TextArea这个 ...
LINUX下文件编译
body, table{font-family: 微软雅黑} table{border-collapse: collapse; border: solid gray; border-width: 2p ...
自定义jstl fn函数fns
1.引入函数声明: jsp页面需要引入自定义fns函数声明:<%@ taglib prefix="fns" uri="/WEB-INF/tlds/fns.tld&q ...

Java版网络爬虫基础

Java版网络爬虫基础的更多相关文章

随机推荐

热门专题