spider_爬取内涵吧的段子（二级深度爬取）

'''
爬取内涵吧段子所有笑话（带标题，作者）
总结：解码上，使用gbk2312编码的，我们可以采取gbk解码。  不会报错
'''

from fake_useragent import FakeUserAgent
import requests
import chardet
import re
from lxml import etree
import os
import time
# 定义一个url
def neiHan():
    num=1
    base_url = 'https://www.neihanba.com/dz/'
    while True:
        base_headers = {
            'User-Agent':FakeUserAgent().random
        }
        base_bytesHtml = requests.get(url=base_url,headers=base_headers).content
        # print(base_bytesHtml)
        # 判断网页编码格式  返回一个列表
        result = chardet.detect(base_bytesHtml)
        # print(result)
        # 解码  原网站使用的 是gbk2312编码。 我们碰到诸如此类的可以使用，gbk解码。
        # 有兴趣的同学可以自行百度两者的关系
        base_html = base_bytesHtml.decode('gbk')
        # print(base_html)

        # 构造树状图
        base_html=etree.HTML(base_html)
        # 使用xpath提取url列表
        urls = base_html.xpath('/html/body/div[1]/div/div[1]/ul/li[*]/h4/a/@href')
        # print(urls)
        for url in urls:
            # print(url)
            url = 'https://www.neihanba.com'+url
            headers = {
                'User-Agent':FakeUserAgent().random
            }
            # 请求网页
            bytesHtml=requests.get(url,headers=headers).content
            # 解码
            html=bytesHtml.decode('gbk')
            # print(html)
            # 提取内容（标题）  使用正则
            # 定义正则表达式（url）
            title = r'<h1>(.*?)</h1>'
            # 编译
            title = re.compile(title,re.S)
            # 正则提取标题
            title = re.findall(title,html)
            print(title)
            # 定义正则提取内容
            detail = r'<p>(.*?)</p>'
            # 编译
            detail = re.compile(detail,re.S)
            # 进行提取
            detail = re.findall(detail,html)
            # # 处理字符串，去掉多余的空格，替换&rdquo为右引号。使用正则sub方法
            # detail = re.sub('&ldquo','"',detail[0])
            # 处理字符串使用replace方法
            detail_list = []
            detail=detail[0].replace('&ldquo','"').replace('&rdquo','"').strip()
            detail_list.append(detail)
            # print(detail)
            # print(detail_list)

            # 保存成txt文本
            dir = os.makedirs("./neibanba")
            with open(dir+title[0].txt,'w',encoding='utf-8') as f:
                f.write(detail)
            # 设置延时
            time.sleep(1.5)
        # 判断是否有下一页,如果没有循环停止，使用的是尾页判断。
        res=base_html.find('<a href="/dz/list_100.html">尾页</a>')
        # 如果没有
        if res == -1:
            break
        num+=1
        # print(num)
        base_url = 'https://www.neihanba.com/dz/list_{}.html'.format(num)

if __name__ == '__main__':
    neiHan()

spider_爬取内涵吧的段子（二级深度爬取）的更多相关文章

Python爬虫实战三之爬取嗅事百科段子
一.前言俗话说,上班时间是公司的,下班了时间才是自己的.搞点事情,写个爬虫程序,每天定期爬取点段子,看着自己爬的段子,也是一种乐趣. 二.Python爬取嗅事百科段子 1.确定爬取的目标网页首先我 ...
scrapy基于请求传参实现深度爬取
请求传参实现深度爬取请求传参: 实现深度爬取:爬取多个层级对应的页面数据使用场景:爬取的数据没有在同一张页面中在手动请求的时候传递item:yield scrapy.Request(url,ca ...
Python爬虫之利用正则表达式爬取内涵吧
首先,我们来看一下,爬虫前基本的知识点概括一. match()方法: 这个方法会从字符串的开头去匹配(也可以指定开始的位置),如果在开始没有找到,立即返回None,匹配到一个结果,就不再匹配. 我们 ...
Python爬虫-爬取糗事百科段子
闲来无事,学学python爬虫. 在正式学爬虫前,简单学习了下HTML和CSS,了解了网页的基本结构后,更加快速入门. 1.获取糗事百科url http://www.qiushibaike.com/h ...
python学习（十六）写爬虫爬取糗事百科段子
原文链接:爬取糗事百科段子利用前面学到的文件.正则表达式.urllib的知识,综合运用,爬取糗事百科的段子先用urllib库获取糗事百科热帖第一页的数据.并打开文件进行保存,正好可以熟悉一下之前学过 ...
Python爬虫实战一之爬取糗事百科段子
大家好,前面入门已经说了那么多基础知识了,下面我们做几个实战项目来挑战一下吧.那么这次为大家带来,Python爬取糗事百科的小段子的例子. 首先,糗事百科大家都听说过吧?糗友们发的搞笑的段子一抓一大把 ...
转 Python爬虫实战一之爬取糗事百科段子
静觅 » Python爬虫实战一之爬取糗事百科段子首先,糗事百科大家都听说过吧?糗友们发的搞笑的段子一抓一大把,这次我们尝试一下用爬虫把他们抓取下来. 友情提示糗事百科在前一段时间进行了改版,导致 ...
Python爬虫爬取糗事百科段子内容
参照网上的教程再做修改,抓取糗事百科段子(去除图片),详情见下面源码: #coding=utf-8#!/usr/bin/pythonimport urllibimport urllib2import ...
Python爬上不得姐并将段子写入数据库
#Python2.7 可以优化一下前10页每页点赞最多的段子百思不得姐 # -*- coding: utf-8 -*-import MySQLdbimport urllib,urllib2imp ...
深度爬取之rules
深度爬取之rules CrawlSpider使用rules来决定爬虫的爬取规则,并将匹配后的url请求提交给引擎.所以在正常情况下,CrawlSpider不需要单独手动返回请求了. 在rules中包含 ...

随机推荐

requests学习笔记01
一.发送请示 # 导入 Requests 模块 import requests # 获取某个网页 r = requests.get("http://www.baidu.com") ...
zzul1073_Java
import java.util.Scanner;/** * 限制解是正数,且脚数为偶数即可 */public class zzul1073 { public static void main(Str ...
Git Commit Rule
## git commit tagfeat: 新功能fix: 修复问题docs: 修改文档style: 修改代码格式,不影响代码逻辑refactor: 重构代码,理论上不影响现有功能perf: 提升性 ...
mysql5.7 不兼容问题
通过navicat工具导入psc数据库备份文件,报错如下,mysql版本5.7 执行如下语句不通过 DROP TABLE IF EXISTS `guard_user`; CREATE TABLE `g ...
记：后端对字符串进行gzip压缩，前端js进行gzip解压
最近有个需求要求对长字符串进行gzip压缩,然后在js进行解压缩的操作: public static void main(String[] args) { try { String longStrin ...
01_Node的版本管理
Node的版本管理工具常见的node的版本管理工具有两种N.NVM 但是他们有一个致命的问题就是不支持Windwos 但是NVM延申了一个nvm-windows的版本,他就可以很好的支持window ...
22_webpack_优化
Terser是一个JS的解析(Parser).Mangleer(绞肉机).Compresor(压缩机)的工具绞肉机如:一个函数 function functionsWithLongNames(){ ...
5_Java对象
面向对象编程对于描述复杂的事物,为了从宏观上把握,从整体上合理分析,我们需要使用面向对象的思路来分析整个系统.但是,具体到微观操作,仍然需要面向过程的思路去处理. 面向对象编程(Object-Ori ...
[转]c#特性(Attribute)学习总结1
特性是用于在运行时传递程序中各种元素(类.方法.结构.枚举.组件等)的行为信息的声明性标签. 官方的解读不好理解,举个常用的例子,平时会在类的上面加上[Serializable],Serializab ...
设置NTP校时
设置NTP校时-作为客户端 @echo off rem 以管理员身份执行文件 rem 适用于域控PDC主机,对于未加域的计算机可直接使用Internet时间同步 rem 获取管理员权限 %1 msht ...

spider_爬取内涵吧的段子（二级深度爬取）

spider_爬取内涵吧的段子（二级深度爬取）的更多相关文章

随机推荐

热门专题