python 网络爬虫（二） BFS不断抓URL并放到文件中

上一篇的python 网络爬虫（一）简单demo 还不能叫爬虫，只能说基础吧，因为它没有自动化抓链接的功能。

本篇追加如下功能：

【1】广度优先搜索不断抓URL，直到队列为空

【2】把所有的URL写入文件中

【3】对于不可访问或错误访问的URL，有try except 处理

spider.py

# -*- coding: cp936 -*-

import urllib,Queue,sgmllib,re,os

class URLList(sgmllib.SGMLParser):

    def reset(self):

        sgmllib.SGMLParser.reset(self)

        #maxsize < 1 表示无穷队列

        self.URLqueue = Queue.Queue(maxsize = -1)

    def start_a(self,attrs):

        href = [v for k,v in attrs if k == 'href']

        if href:

            for u in href:

                #判断URL是不是正确的，href都必须有"http://"

                pat = re.compile(r'http://(.+?)')

                #False,0,'',[],{},()都可以视为假，也可以用len()==0判断列表为空

                if len(re.findall(pat,u)) == 0:

                    continue

                self.URLqueue.put(u)

def getURLList(url,parser):

    try:

        URLdata = urllib.urlopen(url)

        parser.feed(URLdata.read())

        URLdata.close()

    except:

        return 

startURL = "http://www.baidu.com"

parser = URLList()

getURLList(startURL,parser)

outfile = startURL[7:len(startURL)]+".txt"

out = open(outfile,'w+')

try:

    #BFS

    while parser.URLqueue.empty() == False:

        url = parser.URLqueue.get()

        print url

        out.writelines(url+'\n')

        getURLList(url,parser)

finally:

    parser.close()

    out.close()

python 网络爬虫（二） BFS不断抓URL并放到文件中的更多相关文章

Python 网络爬虫 009 (编程) 通过正则表达式来获取一个网页中的所有的URL链接，并下载这些URL链接的源代码
通过正则表达式来获取一个网页中的所有的 URL链接,并下载这些 URL链接的源代码使用的系统:Windows 10 64位 Python 语言版本:Python 2.7.10 V 使用的编程 ...
【Python网络爬虫二】使用urllib2抓去网页内容
在Python中通过导入urllib2组件,来完成网页的抓取工作.在python3.x中被改为urllib.request. 爬取具体的过程类似于使用程序模拟IE浏览器的功能,把URL作为HTTP请求 ...
Python网络爬虫(二)
Urllib库之解析链接 Urllib库里有一个parse这个模块,定义了处理URL的标准接口,实现 URL 各部分的抽取,合并以及链接转换.它支持如下协议的 URL 处理:file.ftp.goph ...
[Python]网络爬虫（一）：抓取网页的含义和URL基本构成
一.网络爬虫的定义网络爬虫,即Web Spider,是一个很形象的名字. 把互联网比喻成一个蜘蛛网,那么Spider就是在网上爬来爬去的蜘蛛.网络蜘蛛是通过网页的链接地址来寻找网页的. 从网站某一个 ...
如何利用Python网络爬虫抓取微信朋友圈的动态（上）
今天小编给大家分享一下如何利用Python网络爬虫抓取微信朋友圈的动态信息,实际上如果单独的去爬取朋友圈的话,难度会非常大,因为微信没有提供向网易云音乐这样的API接口,所以很容易找不到门.不过不要慌 ...
利用Python网络爬虫抓取微信好友的所在省位和城市分布及其可视化
前几天给大家分享了如何利用Python网络爬虫抓取微信好友数量以及微信好友的男女比例,感兴趣的小伙伴可以点击链接进行查看.今天小编给大家介绍如何利用Python网络爬虫抓取微信好友的省位和城市,并且将 ...
如何利用Python网络爬虫抓取微信好友数量以及微信好友的男女比例
前几天给大家分享了利用Python网络爬虫抓取微信朋友圈的动态(上)和利用Python网络爬虫爬取微信朋友圈动态——附代码(下),并且对抓取到的数据进行了Python词云和wordart可视化,感兴趣 ...
python网络爬虫之自动化测试工具selenium[二]
目录前言一.获取今日头条的评论信息(request请求获取json) 1.分析数据 2.获取数据二.获取今日头条的评论信息(selenium请求获取) 1.分析数据 2.获取数据房源案例(仅供 ...
python 网络爬虫（二）
一.编写第一个网络爬虫为了抓取网站,我们需要下载含有感兴趣的网页,该过程一般被称为爬取(crawling).爬取一个网站有多种方法,而选择哪种方法更加合适,则取决于目标网站的结构. 首先探讨如何安全 ...

随机推荐

CodeForces 543A - Writing Code DP 完全背包
有n个程序,这n个程序运作产生m行代码,但是每个程序产生的BUG总和不能超过b, 给出每个程序产生的代码,每行会产生ai个BUG,问在总BUG不超过b的情况下, 我们有几种选择方法思路:看懂了题意之后 ...
POJ 3261 可重叠的 k 次最长重复子串【后缀数组】
这也是一道例题给定一个字符串,求至少出现 k 次的最长重复子串,这 k 个子串可以重叠.算法分析:这题的做法和上一题差不多,也是先二分答案,然后将后缀分成若干组.不同的是,这里要判断的是有没有一个组 ...
Android有效解决加载大图片时内存溢出的问题
首先,您需要了解一下,图片占用内存的计算方法,传送门:http://blog.csdn.net/scry5566/article/details/11568751 尽量不要使用setImageBitm ...
设计模式（七）组合模式Composite（结构型）
设计模式(七)组合模式Composite(结构型) 1. 概述在数据结构里面,树结构是很重要,我们可以把树的结构应用到设计模式里面. 例子1:就是多级树形菜单. 例子2:文件和文件夹目录 2.问题 ...
上证A股股指跌破1900
上证A股股指跌破1900 有钱的同学赶紧买哦,机会难得哈哈!
JS多维数组转一维
题目: var array = [1, [2, [3, 4], [5, 6]], 7, 8]; 写一个方法 flatArray(),得到数组 [1, 2, 3, 4, 5, 6, 7, 8] 解答: ...
intent.getAction()
这个是发送端注册上的IntentFilter filter = new IntentFilter( Intent.ACTION_MEDIA_SCANNER_STARTED); filter.addAc ...
如何解决office2007每次打开都要正在配置
前言最近发现我的office2007每次打开的时候都要配置,超级烦人,而且还要等待很久,具体状况如下图: [caption id="attachment_1241" align= ...
jetty插件开发配置
<plugins>  <plugin> <groupId>org.mortbay.jetty</groupId&g ...
关于Linux系统清理/tmp/文件夹的原理
转自:http://www.opsers.org/base/clean-up-on-the-linux-system-tmp-folder-you-may-want-to-know.html 我们知道 ...

python 网络爬虫（二） BFS不断抓URL并放到文件中

python 网络爬虫（二） BFS不断抓URL并放到文件中的更多相关文章

随机推荐

热门专题