爬取豆瓣网图书TOP250的信息

爬取豆瓣网图书TOP250的信息，需要爬取的信息包括：书名、书本的链接、作者、出版社和出版时间、书本的价格、评分和评价，并把爬取到的数据存储到本地文件中。

参考网址：https://book.douban.com/top250

注意：使用正则表达式时，不要在Elements选项卡中直接查看源代码，因为那的源码可能经过Javascript渲染而与原始请求不同，而是需要从Network选项卡中查看源码。

import re

import json

import time

import requests

from requests.exceptions import RequestException

def get_one_page(url):

    try:

        headers = {

            'User-Agent': 'Mozilla/5.0 (Macintosh; Intel Mac OS X 10_13_3) '

            + 'AppleWebKit/537.36 (KHTML, like Gecko) Chrome/65.0.3325.162 Safari/537.36'

        }

        response = requests.get(url, headers=headers)

        if response.status_code == 200:

            return response.text

        return None

    except RequestException:

        return None

def parse_one_page(html, start):

    #.*? 非贪婪匹配

    items1 = re.findall('href="(.*?)".*?title="(.*?)".*?', html)

    items2 = re.findall('pl">(.*?\/)?(.*?\/)?(.*?)\/(.*?)\/(.*?)<\/p>', html)#()?有的书没写作者

    items3 = re.findall('nums">(.*?)<\/span>.*?<\/div>(.*?)?<\/td>', html, re.S)#有的书没写书评

    #re.S使.匹配包括换行在内的所有字符

    for i in range(25):

        yield{

            'page': start//25+1,

            'ranking': start+i+1,

            'book': items1[i][1],

            'link': items1[i][0],

            'author': items2[i][0].replace('/', '').strip(),

            'press': items2[i][2].strip(),

            'time': items2[i][3].strip(),

            'price': items2[i][4].strip(),

            'grade': items3[i][0],

            #有书评的则要去除两边的源码

            'evaluation': items3[i][1].strip().replace("</span>\n              </p>", '')\

            .replace('<p class="quote" style="margin: 10px 0; color: #666">\n                  <span class="inq">', '')

        }

def write_to_file(content):

    with open('doubanBookTop250.txt', 'a', encoding='utf-8') as f:

        f.write(json.dumps(content, ensure_ascii=False) + '\n')

def main(start):

    url = 'https://book.douban.com/top250?start=' + str(start)

    html = get_one_page(url)

    for item in parse_one_page(html, start):

        print(item)

        #write_to_file(item)

if __name__ == '__main__':

    for i in range(10):

        main(start=i * 25)

        time.sleep(1)

爬取豆瓣网图书TOP250的信息的更多相关文章

爬取豆瓣电影排行top250
功能描述V1.0: 爬取豆瓣电影排行top250 功能分析: 使用的库 1.time 2.json 3.requests 4.BuautifulSoup 5.RequestException 上机实验 ...
Scrapy爬虫（5）爬取当当网图书畅销榜
本次将会使用Scrapy来爬取当当网的图书畅销榜,其网页截图如下: 我们的爬虫将会把每本书的排名,书名,作者,出版社,价格以及评论数爬取出来,并保存为csv格式的文件.项目的具体创建就不再多讲 ...
Python进阶练习与爬取豆瓣T250的影片相关信息
(一)Python进阶练习正所谓要将知识进行实践,才会真正的掌握于是就练习了几道题:求素数,求奇数,求九九乘法表,字符串练习 import re #求素数 i=1; flag=0 while(i& ...
Python3爬取豆瓣网电影信息
# -*- coding:utf-8 -*- """ 一个简单的Python爬虫, 用于抓取豆瓣电影Top前250的电影的名称 Language: Python3.6 ...
python3爬取豆瓣排名前250电影信息
#!/usr/bin/env python # -*- coding: utf-8 -*- # @File : doubanmovie.py # @Author: Anthony.waa # @Dat ...
简单python爬虫案例(爬取慕课网全部实战课程信息)
技术选型下载器是Requests 解析使用的是正则表达式效果图: 准备好各个包 # -*- coding: utf-8 -*- import requests #第三方下载器 import re ...
正则表达式_爬取豆瓣电影排行Top250
前言: 利用简单的正则表达式,获取响应内容爬取数据. Part1 正则表达式(Regular Expression) 1.1 简介正则表达式,又称规则表达式,它是一种文本模式,就是通过事先定义好的一 ...
实例学习——爬取豆瓣网TOP250数据
开发环境:(Windows)eclipse+pydev 网址:https://book.douban.com/top250?start=0 from lxml import etree #解析提取数据 ...
scrapy 爬取豆瓣互联网图书
安装scrapy conda install scrapy 生成一个scrapy项目 scrapy startproject douban settings文件 # -*- coding: utf-8 ...

随机推荐

Tiny Linux -- tce-load
Tiny Linux which has its own package manager called "tce-load". There's a list of packages ...
用JavaScript完成页面自动操作
在之前的一篇<JavaScript实现按键精灵>中曾记录了几个事件对象,本文将会对它们进行一次实战,要完成的动作包括滚动.点击和翻页. 一.滚动滚动是通过修改容器元素的scrollTop ...
每日一练_PAT_B_PRAC_1004客似云来
题目描述 NowCoder开了一家早餐店,这家店的客人都有个奇怪的癖好:他们只要来这家店吃过一次早餐,就会每天都过来:并且,所有人在这家店吃了两天早餐后,接下来每天都会带一位新朋友一起来品尝.于是,这 ...
如何写出优雅的Python代码？
有时候你会看到很Cool的Python代码,你惊讶于它的简洁,它的优雅,你不由自主地赞叹:竟然还能这样写.其实,这些优雅的代码都要归功于Python的特性,只要你能掌握这些Pythonic的技巧,你一 ...
LintCode 433. 岛屿的个数（Number of Islands）
LintCode 433. 岛屿的个数(Number of Islands) 代码: class Solution: """ @param grid: a boolean ...
RocketMQ重试机制和消息幂等
一.重试机制由于MQ经常处于复杂的分布式系统中,考虑网络波动,服务宕机,程序异常因素,很有可能出现消息发送或者消费失败的问题.因此,消息的重试就是所有MQ中间件必须考虑到的一个关键点.如果没有消息重 ...
Solr搜索解析及查询解析器用法概述
一.简介大多数查询都使用了标准的Solr语法.这种语法是Solr最常见的,由默认查询解析器负责处理.Solr的默认查询解析器是Lucene查询解析器[LuceneQParserPlugin类实现] ...
node -- express框架
express node的一个框架安装express cnpm install express -S 引入 const express = require("express"); ...
Pyinstaller 打包程序为可执行文件exe
Pyiinstaller打包 pyinstaller是python的一个第三方模块,使用它可以将pythnon程序打包为可执行文件,实现打包后的程序在没有python环境的机器上也可以运行.pyins ...
lwip nd没有实现ra，contik有参考
lwip中关于nd的实现,没有路由器的功能,不能发送ra 在contiki中发现有nd发送ra的实现, contiki/core/net/ipv6/uip-ds6.c 在rs的接收处理中,发送soll ...

爬取豆瓣网图书TOP250的信息

爬取豆瓣网图书TOP250的信息的更多相关文章

随机推荐

热门专题