《scraping with python》

　　记得刚开始学习python时就觉得爬虫特别神奇，特别叼，但是网上的中文资料大都局限于爬取静态的页面，涉及到JavaScript的以及验证码的就很少了，【当时还并不习惯直接找外文资料】就这样止步于设计其相关的爬虫了，前两周图灵社区书籍推荐邮件来了本《python网络数据采集》，英文名《web scraping with python》，觉得有意思就下了本英文版的PDF看完了，发现其不仅讲的很系统而且也完美的解决了当时我存在的问题，而我就在想，如果当时就能够读取到这本书那是不是就很屌呢，是不是就能够少走很多弯路呢？我第一次认为是这样的，还略有点抱怨搜了那么多python爬虫的资料居然没有人推荐这么好的东东，真是不好，而后我又想其实总的来说，这本书的牛逼之处在于把方方面面需要用到的知识都告诉你了，作者用多年的经验举重若轻地全面的透露了所需，所以你就觉得满足了，但是面对新技术的出现，并不能够只依靠别的大神来告诉你方方面所需要的东西，如何能够自己成为那种起头的研究透的人才是最重要的，想到此又怪自己当初为何就没能自己去搞定这些呢，而不应该是埋怨别人没有告诉你？最后昨晚在看一本书时看到的一些东西觉得很有道理：新手往往面对二阶不胜任的情况（second-order incompetence）：不知道自己不知道多少，所以首先需要发挥R&D精神:Rip off and Duplicate 【偷师学艺】，而后需记住，无论是对你自己或对他人，一种规格并非处处适用，正如你从模型中看到的，你的需求取决于你所处的技能水平，随着时间推移，你的个人学习和成长所需要的东西会改变。这么看来也就释然了。

我将《scraping with python》中每一章节最有用的东西的提取了出来并做了一些补充，github地址

各章内容提要：

第一章：最简单的用urllib.request中的urlopen配合BeautifulSoup提取某页面的HTML

第二章：如何用BeautifulSoup定位到想要的内容，如何配合正着表达式使用，如何获取标签中的属性

第三章：实际演示了通过一个页面中的link连续爬取，涉及到了防止爬取重复等问题

第四章：使用网站既有的API来获取数据

第五章：保存数据的问题，保存URL还是下载下来？保存到Mysql，Email等等

第六章：如果不是要爬取HTML而是读取服务器的如TXT，PDF文件应该如何弄

第七章：数据清理（如替换连续空格，替换连续空行，去掉非英文内容），以及第三方工具介绍

第八章：关于自然语言处理中的n-gram ananysis

第九章：提交表单，使用COOKIE，使用SEESION

第十章：使用selenium以及PhantomJS搞定Javascript

第十一章：验证码的识别

第十二章：防止被服务器认定为机器人的措施小结

《scraping with python》的更多相关文章

《Writing Idiomatic Python》前两部分的中文翻译
汇总了一下这本小书前两部分的内容: 翻译<Writing Idiomatic Python>(一):if语句.for循环翻译<Writing Idiomatic Python> ...
翻译《Writing Idiomatic Python》（五）：类、上下文管理器、生成器
原书参考:http://www.jeffknupp.com/blog/2012/10/04/writing-idiomatic-python/ 上一篇:翻译<Writing Idiomatic ...
翻译《Writing Idiomatic Python》（四）：字典、集合、元组
原书参考:http://www.jeffknupp.com/blog/2012/10/04/writing-idiomatic-python/ 上一篇:翻译<Writing Idiomatic ...
翻译《Writing Idiomatic Python》（三）：变量、字符串、列表
原书参考:http://www.jeffknupp.com/blog/2012/10/04/writing-idiomatic-python/ 上一篇:翻译<Writing Idiomatic ...
翻译《Writing Idiomatic Python》（一）：if语句、for循环
开篇废话这是在美国Amazon上评价很不错的一本书,其实严格来说这可能不算书,而是一本小册子.就像书名一样,里面的内容主要是用一些例子讲述地道的Python的代码是怎样写的.书中把很多例子用不良风格 ...
翻译《Writing Idiomatic Python》（二）：函数、异常
原书参考:http://www.jeffknupp.com/blog/2012/10/04/writing-idiomatic-python/ 上一篇:翻译<Writing Idiomatic ...
关于《Head First Python》一书中print_lol()函数的思考
关于<Head First Python>一书中print_lol()函数的思考在<Head First Python>第一章中,讲述到Python处理复杂数据(以电影数据列 ...
为什么《Dive into Python》不值得推荐
2010 年 5 月 5 日更新:我翻译了一篇<<Dive Into Python>非死不可>作为对本文观点的进一步支持和对评论的回复,请见:http://blog.csdn. ...
《流畅的Python》一副扑克牌中的难点
1.现在在看<流畅的Python>这本书,看了三页就发现,这本书果然不是让新手来入门的,一些很常见的知识点能被这个作者玩出花来, 唉,我就在想,下面要分析的这些的代码,就算我费劲巴拉的看懂 ...

随机推荐

CentOS 6.3 配置FTP
一.FTP的安装 .检测是否安装了FTP:[root@localhost ~]# rpm -q vsftpd 如果安装了会显示版本信息: [root@localhost ~]# vsftpd-2.0. ...
The top 100 papers Nature explores the most-cited research of all time.
The top 100 papers Nature explores the most-cited research of all time. The discovery of high-temper ...
ESXI转HYPER-V，问题接二连三啊（VMDK转VHD）
首先说软件: 要不是用SCVMM来转的话,我用得最爽的还是WINIMAGE,自然流畅.其它的都有各种问题. 其次说说配置更改: 如果原ESXI里只有一个硬盘,一切好说,如果里面挂载了两个,甚至三个硬盘 ...
Microsoft Office 2013 激活方法
Microsoft Office 2013 激活方法 Microsoft Office 2013是微软的新一代Office办公软件,全面采用Metro界面,包括Word.PowerPoint.Ex ...
IOI 2009：Mecho
IOI2009 Mecho Time Limit: 10000ms Memory Limit: 262144KB This problem will be judged on SPOJ. Origin ...
【搜索】【并查集】Codeforces 691D Swaps in Permutation
题目链接: http://codeforces.com/problemset/problem/691/D 题目大意: 给一个1到N的排列,M个操作(1<=N,M<=106),每个操作可以交 ...
Delphi NativeXml用法攻略
NativeXml用法攻略 NativeXml可以在官网上下载,下载后将文件夹放在指定地方,打开DELPHI在其环境变量中引用NativeXml路径,然后在程序中引用NativeXml单元,我们就可以 ...
暴力求解——POJ 1321 棋盘问题
Description 在一个给定形状的棋盘(形状可能是不规则的)上面摆放棋子,棋子没有区别.要求摆放时任意的两个棋子不能放在棋盘中的同一行或者同一列,请编程求解对于给定形状和大小的棋盘,摆放k个棋子 ...
[Locked] Inorder Successor in BST
Inorder Successor in BST Given a binary search tree and a node in it, find the in-order successor of ...
《Mathematical Olympiad——组合数学》——染色问题
恢复继续关于<Mathematical Olympiad——组合数学>中问题的分析,这一篇文章将介绍有关染色的问题. 问题一: 将一些石头放入10行14列的矩形方格表内,允许在每个单元 ...

《scraping with python》

《scraping with python》的更多相关文章

随机推荐

热门专题