Python爬虫例子（笔记，不适合参考，愿意看的可以看看）

话不多说，直接上代码：

 import re

 import csv

 #爬虫的一个小例子，爬的是百度贴吧（网页版）某个帖子的各个楼层的用户名，发言内容和发言时间（使用到了正则表达式） source3.txt是网页源代码

 with open('source3.txt', 'r', encoding='UTF-8') as f:

     source = f.read()

 result_list = []

 every_floor = re.findall('"l_post j_l_post l_post_bright(.*?)<div class="clear"></div>', source, re.S)

 for each in every_floor:

     #每次循环都初始化字典，然后经处理后，将整个有值的字典添加到列表中去

     result = {}

     result['username'] = re.findall('username="(.*?)" class="" src="', each, re.S)

     result['content'] = re.findall('j_d_post_content  clearfix" style="display:;">(.*?)</div><br>', each, re.S)

     result['reply_time'] = re.findall('date&quot;:&quot;(.*?)&quot;,&quot;vote_crypt', each, re.S)

     result_list.append(result)

 with open('hstieba2.csv', 'w', encoding='gbk') as f:

     writer = csv.DictWriter(f, fieldnames=['username', 'content', 'reply_time'])

     writer.writeheader()

     writer.writerows(result_list)

其实就是对普通文本使用正则表达式而已，仅供参考，如有疑问，请在底下留言。

Python爬虫例子（笔记，不适合参考，愿意看的可以看看）的更多相关文章

Python 爬虫个人笔记【目录】
个人笔记,仅供参考目录 Python爬虫笔记(一) Python 爬虫笔记(二) Python 爬虫笔记(三) Scrapy 笔记(一) Scrapy 笔记(二) Scrapy 笔记(三) Pyth ...
python爬虫学习笔记（一）——环境配置（windows系统）
在进行python爬虫学习前,需要进行如下准备工作: python3+pip官方配置 1.Anaconda(推荐,包括python和相关库) [推荐地址:清华镜像] https://mirrors ...
Python爬虫学习笔记(三)
Cookies: 以抓取https://www.yaozh.com/为例 Test1(不使用cookies): 代码: import urllib.request # 1.添加URL url = &q ...
一入爬虫深似海，从此游戏是路人！总结我的python爬虫学习笔记！
前言还记得是大学2年级的时候,偶然之间看到了学长在学习python:我就坐在旁边看他敲着代码,感觉很好奇.感觉很酷,从那之后,我就想和学长一样的厉害,就想让学长教我,请他吃了一周的饭,他答应了.从此 ...
【Python爬虫学习笔记（3）】Beautiful Soup库相关知识点总结
1. Beautiful Soup简介 Beautiful Soup是将数据从HTML和XML文件中解析出来的一个python库,它能够提供一种符合习惯的方法去遍历搜索和修改解析树,这将大大减 ...
【Python爬虫学习笔记（2）】正则表达式（re模块）相关知识点总结
1. 正则表达式正则表达式是可以匹配文本片段的模式. 1.1 通配符正则表达式能够匹配对于一个的字符串,可以使用特殊字符创建这类模式.(图片来自cnblogs) 1.2 特殊字符的转义由于在正则 ...
Python爬虫学习笔记(一)
概念: 使用代码模拟用户,批量发送网络请求,批量获取数据. 分类: 通用爬虫: 通用爬虫是搜索引擎(Baidu.Google.Yahoo等)"抓取系统"的重要组成部分. 主要目的是 ...
Python爬虫学习笔记——防豆瓣反爬虫
开始慢慢测试爬虫以后会发现IP老被封,原因应该就是单位时间里面访问次数过多,虽然最简单的方法就是降低访问频率,但是又不想降低访问频率怎么办呢?查了一下最简单的方法就是使用转轮代理IP,网上找了一些方法 ...
Python爬虫学习笔记——豆瓣登陆(一)
#-*- coding:utf-8 -*- import requests from bs4 import BeautifulSoup import html5lib import re import ...

随机推荐

Ocelot（十二）- 请求聚合
Ocelot允许您指定聚合多个普通ReRoutes的Aggregate ReRoutes(聚合路由),并将其响应映射到一个对象中.一般用于当您有一个客户端向服务器发出多个请求,而这些请求可以合并成一个 ...
libcurl在centos6.4 64位操作系统上不支持https的解决方案
rpm -e –nodeps 软件名例如: 使用yum install nginx 安装了nginx, 这是如果直接使用yum remove nginx 的话,会把依赖的一些包也删掉, 所以要使用r ...
区间DP UVA 10453 Make Palindrome
题目传送门 /* 题意:问最少插入多少个字符使得字符串变成回文串区间DP:dp[i][j]表示[l, r]的字符串要成为回文需要插入几个字符串,那么dp[l][r] = dp[l+1][r-1]; ...
转-AFNetwork 作用和用法详解
来自:http://www.maxiaoguo.com/clothes/269.html AFNetworking是一个轻量级的iOS网络通信类库.它建立在NSURLConnection和NSOper ...
[转]Entity Framework and SQL Azure
本文转自:https://msdn.microsoft.com/zh-cn/library/gg190738 Julie Lerman http://thedatafarm.com April 201 ...
vue学习之遇见的问题
1.本地图片加载不出来错误原因:图片放置位置不对: 解决方法:需要将图片放在static文件夹里
PostgreSQL执行机制的初步学习
作为开源数据库的新手,近日有兴对比了Pg和MySQL的查询计划. 通过Pg源码目录下的src\backend\executor\README文件,加上一些简单调试,就能对Pg的执行机制产生一个初步印象 ...
JavaScript——分页
mysql-scott用户的表的创建
/* 功能:创建 scott 数据库中的 dept 表 */ create table dept( deptno int unsigned auto_increment primary key COM ...
HTML a标签的href 属性 tel 点击可以直接拨打电话 ( 移动端 )
<a href="tel:13828172679">13622178579</a>

Python爬虫例子（笔记，不适合参考，愿意看的可以看看）

Python爬虫例子（笔记，不适合参考，愿意看的可以看看）的更多相关文章

随机推荐

热门专题