python爬虫小结1
先看正则化,正则化就是描述命令和字符切分、查找、筛选等功能的方便方式。
http://www.cnblogs.com/fnng/archive/2013/05/20/3089816.html
一个游戏:https://alf.nu/RegexGolf
先谈谈有何用?初步理解:
各种网页、latex等杂乱的文档,如何整理有用的东西呢?比如很乱的一个文档中,定位user_id,然后提取相关的信息。设想没有这个“工具”,我们会写个函数,依次的滑动指针做匹配,也稍微有些烦人啊!更加复杂地,要是匹配一个:数字+任意3字母+某个固定字母+可重复2~4次的小单元字母,怎么做呢?直接用自己写的字符串处理函数,想想就心理发麻,四肢无力。好吧,爬虫就是要做这么枯燥的字符串处理,怎么办呢?挨个挨个保存网页图片?终究不是好办法,以后要是还要做数据集可不得了,想想还是学学爬虫,做一劳永逸的事。
1.简单模式:做匹配
在linux中,也用过*做拷贝的事,蛮方便的,哈哈。好!我们也试试怎么表达上面深蓝色的任务。首先看看这些关键的特殊地字符:
.^$*+?{[]\|()
(1) . 表示任何东西,像linux里面的*
(2) ^ 求“非”该字符串 或者 匹配字符串的开头
(3) $ 匹配字符串的末尾
(4) * 重复0次以上
(5) +重复1次以上
(6) ? 好像是选择
(7) {m,n} 重复m到n次
(8) []某个字符的范围,可列举,也可以指明区间,如[abc],或[a-c]
(9) () 是分组,是希望其他的符号对整块起作用。(ab)*和ab*区别在于abab...,和abbb...
(10) | 是或
(11) \ 转义
(12) \d 任何十进制数,相当于[0-9]
(13) \D 任何非数字字符,相当于[^0-9]
(14) \s 任何空白字符,相当于[\t\n\r\f\v]
(15)\S 任何非空白字符,相当于[^\t\n\r\f\v]
(16)\w 任何字母数字字符,相当于[a-zA-Z0-9_]
(17)\W 反之
(18) \A 匹配句尾句首,无论是不是MULTILINE形式
(19) \Z 匹配句尾
(20) \b 单词边界。 只用以匹配单词的词首和词尾。单词被定义为一个字母数字序列,因此就是用空白符或者非字母数字符来标示。
(21)\B 则相反
2、使用正则表达式
实际中怎么用上面的东西呢?总得有个环境或者链接的“东西”告诉电脑,我表达的正则化的东西,不是一对乱数字啊。那直接写在python里面?str=xxx,还不行啊,只是个字符串,还没搞到正则化的“内核”\工具。好吧,答案是re 模块(包)来指明这一切的一切(小学喜欢写作文这么写,e.g., 他把自己一切的一切献给了祖国)。经过REs编译成为了“RegexObject”对象。对象可以有很多方法手段的哦。举个栗子:
import re
p = re.compile('ab*') #编译
print p #看看是什么鬼
<re.RegexObject instance at 80b4150>
再这里,先打个岔,转义符号的麻烦,我们知道要搞个\section的表达式(latex中最喜欢用\section来搞事情了。那么分析latex文档的小伙伴就要注意了),每当把“命令”当成字符串的时候就要加一个转义。第一次写成\\section作为字符串,以让第二个\保持。那如果把“命令+“\\section”当成字符串的时候,要削减两次,这时应该改成“命令+“\\\\section”,相当让人困惑。怎么办,早就有人注意到这个问题了。这样办:
ok,我们最后看看怎么执行匹配。这里,我们只看看最关键的几个方法:
(1) match()决定是否在字符串刚开始的位置匹配
(2) search()扫描字符串,找到这个RE匹配的位置
(3) findall() 找到RE匹配的所有子串,并把它们作为一个列表返回
(4) finditer() 找到RE匹配的所有子串,并把它们作为一个迭代器返回
match,search返回NONE如果没有匹配的话,反之返回Matchobject实例。查看实例相关,可以用这几个方法:
举个栗子:
栗子2:
栗子3:
栗子4:
有时候,不一定要先产生RegexObject对象,re模块提供顶级函数用match(), search(), sub()等等,可以将两步合成一步。这是RE字符串作为第一个参数,第二个则是相应RegexObject的方法参数相同。返回则要么是None要么就是一个MatchObject的实例。
编译标志:两种形式,一种是缩写,一种是字母
对于4,参考Page 13.
3. 更多模块功能
\b的栗子:
进一步地,看看r起的作用:
括号分组的栗子:
逆向引用没看到:
组:
命令组:?:
无捕捉组:?P<name>
界定符:
前向肯定界定符:(?=)
前向否定界定符:(?!)
4. 修改字符串
这里只是简单谈谈,不展开,因为现在还没用得上。(爬虫只要查找就行了吧?)
5. 常见问题
1)优化表达式
2)match()和search()
3)贪婪vs不贪婪:
python爬虫小结1的更多相关文章
- Python爬虫小结
有些数据是没有专门的数据集的,为了找到神经网络训练的数据,自然而然的想到了用爬虫的方法开始采集数据.一开始采用了网上的一个动态爬虫的代码,发现爬取的图片大多是重复的,有效图片很少. 动态爬虫: fro ...
- 【Python爬虫】爬虫利器 requests 库小结
requests库 Requests 是一个 Python 的 HTTP 客户端库. 支持许多 HTTP 特性,可以非常方便地进行网页请求.网页分析和处理网页资源,拥有许多强大的功能. 本文主要介绍 ...
- Python爬虫 股票数据爬取
前一篇提到了与股票数据相关的可能几种数据情况,本篇接着上篇,介绍一下多个网页的数据爬取.目标抓取平安银行(000001)从1989年~2017年的全部财务数据. 数据源分析 地址分析 http://m ...
- Python字典小结
字典(dict)结构是Python中常用的数据结构,笔者结合自己的实际使用经验,对字典方面的相关知识做个小结,希望能对读者一些启发~ 创建字典 常见的字典创建方法就是先建立一个空字典,然后逐一 ...
- 0.Python 爬虫之Scrapy入门实践指南(Scrapy基础知识)
目录 0.0.Scrapy基础 0.1.Scrapy 框架图 0.2.Scrapy主要包括了以下组件: 0.3.Scrapy简单示例如下: 0.4.Scrapy运行流程如下: 0.5.还有什么? 0. ...
- 路飞学城Python爬虫课第一章笔记
前言 原创文章,转载引用务必注明链接.水平有限,如有疏漏,欢迎指正. 之前看阮一峰的博客文章,介绍到路飞学城爬虫课程限免,看了眼内容还不错,就兴冲冲报了名,99块钱满足以下条件会返还并送书送视频. 缴 ...
- Python爬虫视频教程
├─第1章_[第0周]网络爬虫之前奏 │ ├─第1节_"网络爬虫"课程内容导学 │ │ 第1部分_全课程内容导学.mp4 │ │ 第2部分_全课程内容导学(WS00单元)学习资料. ...
- Python爬虫之小试牛刀——使用Python抓取百度街景图像
之前用.Net做过一些自动化爬虫程序,听大牛们说使用python来写爬虫更便捷,按捺不住抽空试了一把,使用Python抓取百度街景影像. 这两天,武汉迎来了一个德国总理默克尔这位大人物,又刷了一把武汉 ...
- Python 爬虫入门实战
1. 前言 首先自我介绍一下,我是一个做 Java 的开发人员,从今年下半年开始,一直在各大技术博客网站发表自己的一些技术文章,差不多有几个月了,之前在 cnblog 博客园加了网站统计代码,看到每天 ...
随机推荐
- [转]ORACLE分区表的使用和管理
转自:http://love-flying-snow.iteye.com/blog/573303 废话少说,直接讲分区语法. Oracle表分区分为四种:范围分区,散列分区,列表分区和复合分区. 一: ...
- Python [习题] 文件操作:目录间copy 文件
[习题] 指定一个源文件,实现copy到目标目录.例如把/tmp/sample1.txt 拷贝到/tmp/sample2.txt原文件需要有读权限(默认rt权限),目标文件需要给写(w即可)权限. I ...
- P1457 城堡 The Castle
轻度中毒 原题 :The Castle 以下为题解部分:明明辣么简单的一道题,硬是搞了1.5h,WTF?以下列出本题的一些要点. 搜索(DFS)嘛,染色嘛,统计大小嘛,很容易想,也很更易处理. 接下来 ...
- 八、Hadoop学习笔记————调优之Hive调优
表1表2的join和表3表4的join同时运行 此法需要关注是否有数据倾斜(大量数据集中在某一区间段)
- Java项目之员工收录系统
在Java SE中,对IO流与集合的操作在应用中比较重要.接下来,我以一个小型项目的形式,演示IO流.集合等知识点在实践中的运用. 该项目名称为"员工收录系统",在Eclipse的 ...
- spring bean的创建过程
spring的核心容器包括:core.beans.context.express language四个模块.所以对于一个简单的spring工程,最基本的就是依赖以下三个jar包即可: <depe ...
- 用vue2.x注册一个全局的弹窗alert组件
一.在实际的开发当中,弹窗是少不了的,默认系统的弹窗样式太丑,难以满足项目的实际需求,所以需要自己定义弹窗组件,把弹窗组价定义为全局的,这样减少每次使用的时候引入麻烦,节省开发时间.本文将分享如何定义 ...
- 基于 HTML5 Canvas 的 3D 模型列表贴图
少量图片对于我们赋值是没有什么难度,但是如果图片的量大的话,我们肯定希望能很直接地显示在界面上供我们使用,再就是排放的位置等等,这些都需要比较直观的操作,在实际应用中会让我们省很多力以及时间.下面这个 ...
- memcached 缓存数据库应用实践
1.1 数据库对比 缓存: 将数据存储到内存中,只有当磁盘胜任不了的时候,才会启用缓存 缺点:断电数据丢失(双电),用缓存存储数据的目的只是为了应付大并发的业务. 数据库: mysql(关系型数据 ...
- ACM HDU 1559 最大子矩阵
题目链接:http://acm.hdu.edu.cn/showproblem.php?pid=1559 这道题 挺好的,当时想出解法的时候已经比较迟了.还是平时看得少. 把行与列都进行压缩.ans[i ...