requests+xpath+map爬取百度贴吧

 # requests+xpath+map爬取百度贴吧

 # 目标内容:跟帖用户名,跟帖内容,跟帖时间

 # 分解:

 # requests获取网页

 # xpath提取内容

 # map实现多线程爬虫

 import requests

 from requests.exceptions import RequestException

 from lxml import etree

 import json

 from multiprocessing.dummy import Pool as ThreadPool

 def get_html(url):

     try:

         response = requests.get(url)

         if response.status_code == 200:

             return response.text

         else:

             return None

     except RequestException:

         return None

 def parse_html(html):

     selector = etree.HTML(html)

     data = selector.xpath('//div[@class="l_post j_l_post l_post_bright  "]')

     for each in data:

         rs = each.xpath('@data-field')[0]

         rs = json.loads(rs)

         author = rs.get('author').get('user_name')

         author_id = rs.get('content').get('post_id')

         content = each.xpath('div/div/cc/div[@id="post_content_%s"]/text()'% author_id)[0].strip()

         date = rs.get('content').get('date')

         yield {

             'author':author,

             'content':content,

             'date':date

         }

 def save_to_txt(result):

     print('正在存储:',result)

     with open('tieba.txt','a',encoding='utf-8') as f:

         f.write('回帖作者:'+result['author']+'\n')

         f.write('回帖内容:'+result['content']+'\n')

         f.write('回帖时间:'+result['date']+'\n')

         f.write('\n')

 def main(url):

         html = get_html(url)

         if html:

             for result in parse_html(html):

                 save_to_txt(result)

 if __name__=='__main__':

     pool = ThreadPool(4)

     urls=[]

     base_url = 'http://tieba.baidu.com/p/3522395718?pn='

     for page_num in range(1, 21):

         url = base_url + str(page_num)

         urls.append(url)

     pool.map(main,urls)

     pool.close()

     pool.join()

requests+xpath+map爬取百度贴吧的更多相关文章

requests爬取百度音乐
使用requests爬取百度音乐,我想把当前热门歌手的音乐信息爬下来. 首先进行url分析,可以看到: 歌手网页: 薛之谦网页: 可以看到,似乎这些路劲的获取一切都很顺利,然后可以写代码: # -*- ...
写一个python 爬虫爬取百度电影并存入mysql中
目标是利用python爬取百度搜索的电影在类型地区年代各个标签下电影的名字评分和图片连接以及电影连接首先我们先在mysql中建表 create table liubo4( id in ...
【学习笔记】Python 3.6模拟输入并爬取百度前10页密切相关链接
[学习笔记]Python 3.6模拟输入并爬取百度前10页密切相关链接问题描述通过模拟网页,实现百度搜索关键词,然后获得网页中链接的文本,与准备的文本进行比较,如果有相似之处则代表相关链接. me ...
selenium+chrome浏览器驱动-爬取百度图片
百度图片网页中中,当页面滚动到底部,页面会加载新的内容. 我们通过selenium和谷歌浏览器驱动,执行js,是浏览器不断加载页面,通过抓取页面的图片路径来下载图片. from selenium im ...
爬虫系列(六) 用urllib和re爬取百度贴吧
这篇文章我们将使用 urllib 和 re 模块爬取百度贴吧,并使用三种文件格式存储数据,下面先贴上最终的效果图 1.网页分析 (1)准备工作首先我们使用 Chrome 浏览器打开百度贴吧,在输入 ...
利用python的爬虫技术爬取百度贴吧的帖子
在爬取糗事百科的段子后,我又在知乎上找了一个爬取百度贴吧帖子的实例,为了巩固提升已掌握的爬虫知识,于是我打算自己也做一个. 实现目标:1,爬取楼主所发的帖子 2,显示所爬去的楼层以及帖子题目 3,将爬 ...
Python3实现QQ机器人自动爬取百度文库的搜索结果并发送给好友（主要是爬虫）
一.效果如下: 二.运行环境: win10系统:python3:PyCharm 三.QQ机器人用的是qqbot模块用pip安装命令是: pip install qqbot (前提需要有request ...
Python Requests库网络爬取全代码
#爬取京东商品全代码 import requestsurl = "http://item.jd.com/2967929.html"try: r = requests.get(url ...
Python 爬虫实例（1）—— 爬取百度图片
爬取百度图片在Python 2.7上运行 #!/usr/bin/env python # -*- coding: utf-8 -*- # @Author: loveNight import jso ...

随机推荐

TCHAR字符串查找&反向查找字符串
C++支持两种字符串,即常规的ANSI编码("字符串")和Unicode编码(L"字符串"),相应的就有两套字符串处理函数,比如:strlen和wcslen,分 ...
spring Boot+spring Cloud实现微服务详细教程第二篇
上一篇文章已经说明了一下,关于spring boot创建maven项目的简单步骤,相信很多熟悉Maven+Eclipse作为开发常用工具的朋友们都一目了然,这篇文章主要讲解一下,构建spring bo ...
关于css选择器中有小数点的标签获取
需求说明因为项目中章节配置的时候有小数点,1,1.1,1.2,1.11的标题,这个时候每一行标题的id,class设置成标题号是独一无二的标记.但是,直接用js获取是获取不到的,例如$('#3.22 ...
将 Shiro 作为应用的权限基础四：shiro的配置说明
Apache Shiro的配置主要分为四部分: SecurityManager的配置 URL过滤器的配置静态用户配置静态角色配置其中,由于用户.角色一般由后台进行操作的动态数据,比如通过@Req ...
简单谈谈DNS的工作原理及实践
DNS协议简介 dns(Domain Name System)是一个全球化的分布式数据库系统,用于存储域名和互联网IP地址的映射关系.dns协议是计算机协议栈应用层中,应用最广泛的协议之一.用户每一次 ...
转:运行page页面时的事件执行顺序及页面的回发与否深度了解
using System; using System.Data; using System.Configuration; using System.Web; using System.Web.Secu ...
201621123025《Java程序设计》第二周学习总结
1.本周学习总结以几个关键词描述本周的学习内容.并将关键词之间的联系描述或绘制出来. 答:java的两种数据类型:基本数据类型和引用数据类型:==与equals的区别:动态数组. 2.书面作业 1. ...
poj2029 Get Many Persimmon Trees
http://poj.org/problem?id=2029 单点修改矩阵查询二维线段树 #include<cstdio> #include<cstring> #inclu ...
SQL常用语句,随时用随时更新
更多详细说明文档查询 http://www.postgres.cn/docs/9.5/infoschema-columns.html 1.1通过表名查询表的属性 SELECT * FROM sys.s ...
nyoj 移位密码
移位密码时间限制:1000 ms | 内存限制:65535 KB 难度:0 描述移位密码是最简单的一类代替密码,具体算法就是将字母表的字母右移k个位置(k<26),并对字母表长度作模 ...

requests+xpath+map爬取百度贴吧

requests+xpath+map爬取百度贴吧的更多相关文章

随机推荐

热门专题