Python 爬取豆瓣电影Top250排行榜，爬虫初试

from bs4 import BeautifulSoup

import openpyxl

import re

import urllib.request

import urllib.error

# 访问url

def ask_url(url):

    # 伪装浏览器

    head = {'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) \

        AppleWebKit/537.36 (KHTML, like Gecko) Chrome/80.0.3987.163 Safari/537.36'}

    req = urllib.request.Request(url, headers=head)  # 包装

    try:

        response = urllib.request.urlopen(req, timeout=3)  # 访问 超时3s结束

        html = response.read().decode('utf-8')  # 解码

        return html  # 返回url网页html源码

    except urllib.request.HTTPError as e:

        if hasattr(e, 'code'):

            print(e.code)

    except urllib.error.URLError as e:

        if hasattr(e, 'reason'):

            print(e.reason)

# 爬取网页

def crawl_web(base_url):

    data_list = []

    # re电影名

    re_movie_name = re.compile(r'<span class="title">(.*?)</span>')

    # re影片详情连接

    re_movie_link = re.compile(r'<a class="" href="(.*?)">')

    # re影片海报图片

    re_movie_img = re.compile(r'<img.*src="(.*?)".*?>', re.S)

    # re电影简介

    re_movie_introduction = re.compile(r'<p class="">(.*?)</p>', re.S)

    # re评分

    re_movie_score = re.compile(

        r'<span class="rating_num" property="v:average">(.*?)</span>')

    # re评分人数

    re_movie_judge = re.compile(r'<span>(.*?)人评价</span>')

    # re一句话评价

    re_moive_inq = re.compile(r'<span class="inq">(.*?)。*</span>')

    for i in range(10):

        url = base_url + str(i * 25)

        html = ask_url(url)  # 获取网页源码

        soup = BeautifulSoup(html, 'html.parser')  # 解析源码

        for item in soup.find_all(class_='item'):

            item = str(item).replace(u'\xa0', ' ')  # 获取的页面中有奇妙代码(●'◡'●)，所以要去掉

            data = []

            # 获取需要的信息

            movie_name = re.findall(re_movie_name, item)

            if len(movie_name) > 1:

                data.append(movie_name[0])

                data.append(movie_name[1].replace('/', ''))

            else:  # 没有外语名也要空出来，方便后续储存

                data.append(movie_name[0])

                data.append('暂无')

            movie_link = re.findall(re_movie_link, item)[0]

            data.append(movie_link)

            movie_img = re.findall(re_movie_img, item)[0]

            data.append(movie_img)

            movie_introduction = re.findall(re_movie_introduction, item)[0]

            movie_introduction = re.sub(

                r'<br(.*)?>', ' ', movie_introduction).strip()  # 存入简介时要去掉含有的html标签

            data.append(movie_introduction)

            movie_score = re.findall(re_movie_score, item)[0]

            data.append(movie_score)

            movie_judge = re.findall(re_movie_judge, item)[0]

            data.append(movie_judge)

            moive_inq = re.findall(re_moive_inq, item)

            if len(moive_inq) == 0:  # 有时候没有一句话短评，同上要空出

                data.append('暂无')

            else:

                data.append(moive_inq[0])

            # 添加到data_list

            data_list.append(data)

    return data_list

def save_data(save_path, data_list):

    wb = openpyxl.Workbook()

    ws = wb.active

    ws.title = '豆瓣TOP250'

    first_row = ("电影名", "其他名", "影片详情连接", "影片海报图片",

                 "电影简介", "评分", "评分人数", "一句话评价")

    temp = 1

    for i in first_row:  # 生成表头

        ws.cell(1, temp, i)

        temp += 1

    row = 1

    for i in data_list:  # 存入数据

        row += 1

        column = 1

        for j in i:

            ws.cell(row, column, j)

            column += 1

    wb.save(save_path+'豆瓣TOP250.xlsx')

    return None

if __name__ == "__main__":

    base_url = 'https://movie.douban.com/top250?start='

    save_path = 'E:\\School\\Study\\Python\\爬虫\\'

    data_list = crawl_web(base_url)

    save_data(save_path, data_list)

    print('Crawl over')

Python 爬取豆瓣电影Top250排行榜，爬虫初试的更多相关文章

零基础爬虫----python爬取豆瓣电影top250的信息（转）
今天利用xpath写了一个小爬虫,比较适合一些爬虫新手来学习.话不多说,开始今天的正题,我会利用一个案例来介绍下xpath如何对网页进行解析的,以及如何对信息进行提取的. python环境:pytho ...
python爬取豆瓣电影Top250（附完整源代码）
初学爬虫,学习一下三方库的使用以及简单静态网页的分析.就跟着视频写了一个爬取豆瓣Top250排行榜的爬虫. 网页分析我个人感觉写爬虫最重要的就是分析网页,找到网页的规律,找到自己需要内容所在的地方, ...
Python爬取豆瓣电影top
Python爬取豆瓣电影top250 下面以四种方法去解析数据,前面三种以插件库来解析,第四种以正则表达式去解析. xpath pyquery beaufifulsoup re 爬取信息:名称评分 ...
Python爬虫入门：爬取豆瓣电影TOP250
一个很简单的爬虫. 从这里学习的,解释的挺好的:https://xlzd.me/2015/12/16/python-crawler-03 分享写这个代码用到了的学习的链接: BeautifulSoup ...
python 爬虫&爬取豆瓣电影top250
爬取豆瓣电影top250from urllib.request import * #导入所有的request,urllib相当于一个文件夹,用到它里面的方法requestfrom lxml impor ...
scrapy爬虫框架教程（二）-- 爬取豆瓣电影TOP250
scrapy爬虫框架教程(二)-- 爬取豆瓣电影TOP250 前言经过上一篇教程我们已经大致了解了Scrapy的基本情况,并写了一个简单的小demo.这次我会以爬取豆瓣电影TOP250为例进一步为大 ...
一起学爬虫——通过爬取豆瓣电影top250学习requests库的使用
学习一门技术最快的方式是做项目,在做项目的过程中对相关的技术查漏补缺. 本文通过爬取豆瓣top250电影学习python requests的使用. 1.准备工作在pycharm中安装request库 ...
Scrapy中用xpath/css爬取豆瓣电影Top250：解决403HTTP status code is not handled or not allowed
好吧,我又开始折腾豆瓣电影top250了,只是想试试各种方法,看看哪一种的方法效率是最好的,一直进行到这一步才知道 scrapy的强大,尤其是和selector结合之后,速度飞起.... 下面我就采用 ...
urllib+BeautifulSoup无登录模式爬取豆瓣电影Top250
对于简单的爬虫任务,尤其对于初学者,urllib+BeautifulSoup足以满足大部分的任务. 1.urllib是Python3自带的库,不需要安装,但是BeautifulSoup却是需要安装的. ...

随机推荐

使用StopWatch类来计时 (perf4j-0.9.16.jar 包里的类)
public class StopWatch { static public int AN_HOUR = 60 * 60 * 1000; static public int A_MINUTE = 60 ...
006-循环结构(下)-C语言笔记
006-循环结构(下)-C语言笔记学习目标 1.[掌握]do-while循环结构 2.[掌握]for循环结构 3.[掌握]嵌套循环一.do-while循环结构 do-while语法: 1 2 ...
给学妹的 Java 学习路线
大家好,这篇文章主要是讲解下如何自学 Java,这个问题有很多粉丝私信问过,今天又有直系学妹问我如何学习 Java? 我就以我的经历,总结下分享给大家,有不当指出或者有更好的方法建议也欢迎留言指出,大 ...
1324E - Sleeping Schedule
题目大意:一天有h个小时,一个人喜欢睡觉,一共睡n次,每次都睡h个小时,开始时间为0,间隔a[i]或a[i]-1个小时开始睡第i次觉,每天都有一个最好时间区间,问这n次觉,最多有多少次是在最好时间内睡 ...
ansible playbook loop 翻译
ansible源文档地址有时候你想多次重复一个任务. 在计算机编程中,这叫做循环. 常见的 Ansible 循环包括使用文件模块更改几个文件和 / 或目录的所有权,使用用户模块创建多个用户,并重复一 ...
Java面试系列第3篇-HashMap相关面试题
HashMap是非线程安全的,如果想要用线程安全的map,可使用同步的HashTable或通过Collections.synchronizeMap(hashMap)让HashMap变的同步,或者使用并 ...
&和&&，|和||的用法
表达式一$a && $b ,表达式二$a & $b 1.相同点:两个表达式都是当$a.$b都为true时,表达式为真.两种运算符对此表达式结果没有影响. 2.不同点:表达式$a ...
discuz 自带的地区四级联动调用方法
首先,DZ提供了专门处理地区信息的函数,在source/function/function_profile.php(第14行)文件中:function profile_setting(){}那么,我们 ...
myod实验（选做）
myod实验实验任务 1 复习c文件处理内容 2 编写myod.c 用myod XXX实现Linux下od -tx -tc XXX的功能 main与其他分开,制作静态库和动态库编写Makefile ...
SVN部署(Centos7,Ubuntu)
SVN 简介 SVN是Subversion的简称,是一个开放源代码的版本控制系统,相较于RCS.CVS,它采用了分支管理系统,它的设计目标就是取代CVS.互联网上很多版本控制服务已从CVS迁移到Sub ...

Python 爬取豆瓣电影Top250排行榜，爬虫初试

Python 爬取豆瓣电影Top250排行榜，爬虫初试的更多相关文章

随机推荐

热门专题