Python爬取韩寒所有新浪博客

接上一篇，我们依据第一页的链接爬取了第一页的博客，我们不难发现，每一页的链接就仅仅有一处不同（页码序号），我们仅仅要在上一篇的代码外面加一个循环，这样就能够爬取全部博客分页的博文。也就是全部博文了。

# -*- coding : -utf-8 -*-

import urllib

import time

url = [' ']*350

page = 1

link = 1

while page <=7://眼下共同拥有7页。3

    con = urllib.urlopen('http://blog.sina.com.cn/s/articlelist_1191258123_0_'+str(page)+'.html').read()

    i = 0

    title = con.find(r'<a title=')

    href = con.find(r'href=',title)

    html = con.find(r'.html',href)

    while title != -1 and href != -1 and html != -1 and i<350:

        url[i] = con[href + 6:html + 5]

        content = urllib.urlopen(url[i]).read()

        open(r'allboke/'+url[i][-26:],'w+').write(content)

        print 'link',link,url[i]

        title = con.find(r'<a title=',html)

        href = con.find(r'href=',title)

        html = con.find(r'.html',href)

        i = i + 1

        link = link + 1

    else:

        print 'page',page,'find end!'

    page = page + 1

else:

    print 'all find end'

#i = 0

#while i < 350:

    #content = urllib.urlopen(url[i]).read()

    #open(r'save/'+url[i][-26:],'w+').write(content)

    #print 'downloading',i,url[i]

    #i = i + 1

    #time.sleep(1)

#else:

print 'download artical finished!'

代码最以下部分，保存网页仅仅能保存到50，不知道错在哪里。

所以就将保存网页的代码放在搜索里，找到就保存！

正确执行界面：

执行结果：

Python爬取韩寒所有新浪博客的更多相关文章

Python爬虫爬取一篇韩寒新浪博客
网上看到大神对Python爬虫爬到非常多实用的信息,认为非常厉害.突然对想学Python爬虫,尽管自己没学过Python.但在网上找了一些资料看了一下,看到爬取韩寒新浪博客的视频.共三集,第一节讲爬取 ...
python网络爬虫新浪博客篇
上次写了一个爬世纪佳缘的爬虫之后,今天再接再厉又写了一个新浪博客的爬虫.写完之后,我想了一会儿,要不要在博客园里面写个帖子记录一下,因为我觉得这份代码的含金量确实太低,有点炒冷饭的嫌疑,就是把上次的代 ...
python中multiprocessing.pool函数介绍_正在拉磨_新浪博客
python中multiprocessing.pool函数介绍_正在拉磨_新浪博客 python中multiprocessing.pool函数介绍 (2010-06-10 03:46:5 ...
python datetime模块strptime/strptime format常见格式命令_施罗德_新浪博客
python datetime模块strptime/strptime format常见格式命令_施罗德_新浪博客 python datetime模块strptime/strptime form ...
python中逐行读取文件的最佳方式_Drupal_新浪博客
python中逐行读取文件的最佳方式_Drupal_新浪博客 python中逐行读取文件的最佳方式 (2010-08-18 15:59:28) 转载▼ 标签: python ...
python—webshell_醉清风xf_新浪博客
python—webshell_醉清风xf_新浪博客 python—webshell (2012-05-23 09:55:46) 转载▼
Javascript Jquery 中的数组定义与操作_子木玲_新浪博客
body{ font-family: "Microsoft YaHei UI","Microsoft YaHei",SimSun,"Segoe UI& ...
关于Windows文件读写_暗涌_新浪博客
关于Windows文件读写_暗涌_新浪博客这几天在研究怎么才能加快windows文件读写速度,搜了很多文章,MSDN也看了不少.稍微给大家分享一下. 限制windows文件读写速度的 ...
MWeb 1.3.7 发布！增加发布到 Wordpress 等支持 MetaWeblog API 的服务，如：Wordpress 博客、新浪博客、cnblogs、oschina。
MWeb 1.3.7 版的新功能增加发布到 Wordpress 等支持 Metaweblog API 的服务,目前经测试过的有: Wordpress 博客.新浪博客.cnblogs.oschina. ...

随机推荐

算法学习记录-图——最小生成树之Kruskal算法
之前的Prim算法是基于顶点查找的算法,而Kruskal则是从边入手. 通俗的讲:就是希望通过边的权值大小来寻找最小生成树.(所有的边称为边集合,最小生成树形成的过程中的顶点集合称为W) 选取边集 ...
xfce-OpenVAS
OpenVAS开源风险评估系统部署方案 OpenVAS,即开放式漏洞评估系统,是一个用于评估目标漏洞的杰出框架.功能十分强大,最重要的是,它是“开源”的——就是免费的意思啦- 它与著名的Nessu ...
Appium切换webview时候报chromedriver版本问题
前言用appium切换webview的时候报chrome和chromedriver版本的问题:session not created exception: Chrome version must b ...
vim 第三章插入模式
vim 第三章插入模式在普通模式下可以删除复制及粘贴的命令在插入模式下也存在以中方便快捷的方式能够粘贴寄存器中文本两种方式来插入键盘上不存在的非常用字符替换模式 ...
Centos7 编译安装python3
step1:preparation $ yum install yum-utils make wget gcc $yum-builddep python step2:download $ wget h ...
BZOJ 2337 [HNOI2011]XOR和路径 ——期望DP
首先可以各位分开求和定义$f(i)$表示从i到n的期望值,然后经过一些常识,发现$f(n)=1$的时候的转移,然后直接转移,也可以找到$f(n)=0$的转移. 然后高斯消元31次就可以了. #inc ...
[luoguP2053] [SCOI2007]修车（最小费用最大流）
传送门网络流的建图真的好难! 将一个点拆分成多个点的思想还需要加强. 题解代码和题解中的图略不一样. #include <queue> #include <cstdio> ...
java面试题之什么是ThreadLocal？底层如何实现的？
ThreadLocal是一个解决线程并发问题的一个类,用于创建线程的本地变量,我们知道一个对象的所有线程会共享它的全局变量,所以这些变量不是线程安全的,我们可以使用同步技术.但是当我们不想使用同步的时 ...
cf3D Least Cost Bracket Sequence
This is yet another problem on regular bracket sequences. A bracket sequence is called regular, if b ...
FreeMarker常用语法学习
1.API网址 http://freemarker.sourceforge.net/docs/ 2.一个Table的例子 freemarker 对表格的控制这里将所有需要在一个区域显示到数据全部ad ...

Python爬取韩寒所有新浪博客

Python爬取韩寒所有新浪博客的更多相关文章

随机推荐

热门专题