Douban Top 250爬虫

# Ref: https://fishc.com.cn/forum.php?mod=viewthread&tid=101887&extra=page%3D1%26filter%3Dtypeid%26typeid%3D722

import requests

from bs4 import BeautifulSoup

import openpyxl

def open_url(url):

    headers = {'user-agent': 'Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/57.0.2987.98 Safari/537.36'}

    res = requests.get(url, headers=headers)

    res.raise_for_status()

    res.encoding = res.apparent_encoding

    return res.text

def parserHtml(html) -> object:

    try:

        soup = BeautifulSoup(html, 'html.parser')

        titles = []

        hrefs = []

        messages_movie = []

        messages_star = []

        # 名称

        titles_targets = soup.find_all('div', class_='hd')

        for each in titles_targets:

            titles.append(each.a.span.text)

            hrefs.append(each.a['href']) # 链接

        # 信息

        bd_targets = soup.find_all('div', class_='bd')

        for each in bd_targets:

            try:

                messages_movie.append(each.p.text.split('\n')[1].strip() +

                                       each.p.text.split('\n')[2].strip())

            except:

                continue

        # 评分

        star_targets = soup.find_all('span', class_='rating_num')

        for each in star_targets:

            messages_star.append(each.text)

        # result

        result = []

        for i in range(len(messages_star)):

            # result.append(titles[i]  + messages_movie[i] + messages_star[i] + '\n') # save to text

            result.append([titles[i], messages_star[i], messages_movie[i], hrefs[i]])\

        return result

    except:

        print('解析错误')

# def sava_excel(result):

#     try:

#         with open(r'./Python_Excel_小甲鱼/Top_DouBan_250.txt', 'w', encoding='utf-8') as f:

#             for each in result:

#                 f.write(each)

#         f.close()

#     except:

#         print('存储错误')

def save_excel(result):

    try:

        wb = openpyxl.Workbook()

        ws = wb.active

        ws['A1'] = '电影名称'

        ws['B1'] = '评分'

        ws['C1'] = '电影信息'

        ws['D1'] = '电影链接'

        for each in result:

            ws.append(each)

        wb.save('Top_DouBan_250.xlsx')

    except:

        print('保存Excel错误')

# 获取页面

def get_depth(html):

    try:

        soup = BeautifulSoup(html, 'html.parser')

        depth = soup.find('span', class_='next').previous_sibling.previous_sibling.text

        return depth

    except:

        print('获取页数错误')

def main():

    host = r'https://movie.douban.com/top250'

    html = open_url(host)

    depth = get_depth(html)

    result = []

    for i in range(int(depth)):

        url = host + '/?start=' + str(25*i) + '&filter='

        html = open_url(url)

        result.extend(parserHtml(html))

    save_excel(result)

if __name__ == '__main__':

    main()

Douban Top 250爬虫的更多相关文章

IMDB TOP 250爬虫
这个小学期Python大作业搞了个获取IMDB TOP 250电影全部信息的爬虫.第二次写爬虫,比在暑假集训时写的熟练多了.欢迎大家评论. ''' ************************** ...
爬取豆瓣电影TOP 250的电影存储到mongodb中
爬取豆瓣电影TOP 250的电影存储到mongodb中 1.创建项目sp1 PS D:\scrapy> scrapy.exe startproject douban 2.创建一个爬虫 PS D: ...
用python爬取豆瓣电影Top 250
首先,打开豆瓣电影Top 250,然后进行网页分析.找到它的Host和User-agent,并保存下来. 然后,我们通过翻页,查看各页面的url,发现规律: 第一页:https://movie.dou ...
吐血推荐250部必看电影下载 IMDB TOP 250 download
中文名: IMDB Top 250合辑 TLF-MiniSD收藏版英文名: IMDB Top 250 TLF-MiniSD Collection版本: (更新至TOP119)[MiniSD]发行日期: ...
Python开发爬虫之静态网页抓取篇：爬取“豆瓣电影 Top 250”电影数据
所谓静态页面是指纯粹的HTML格式的页面,这样的页面在浏览器中展示的内容都在HTML源码中. 目标:爬取豆瓣电影TOP250的所有电影名称,网址为:https://movie.douban.com/t ...
Python爬虫-豆瓣电影 Top 250
爬取的网页地址为:https://movie.douban.com/top250 打开网页后,可观察到:TOP250的电影被分成了10个页面来展示,每个页面有25个电影. 那么要爬取所有电影的信息,就 ...
豆瓣电影 Top 250
import refrom urllib.request import urlopen def getPage(url): # 获取网页的字符串 response = urlopen(url) ret ...
python3 爬虫---爬取豆瓣电影TOP250
第一次爬取的网站就是豆瓣电影 Top 250,网址是:https://movie.douban.com/top250?start=0&filter= 分析网址'?'符号后的参数,第一个参数's ...
python+SQLAlchemy+爬虫
python+SQLAlchemy+爬虫前面分享了SQLAlchemy的知识,这次我共享一下学习用python开发爬虫再把爬出来的数据放到用SQLAlchemy的数据库上面的知识,当然我这个是带测试 ...

随机推荐

2018.7.31-2018.8.2记：关于maven
maven的使用,用得好,则省力省事,但是用不好则会造成一堆莫名其妙的错误,maven在使用的时候,jar包下载异常终止尤为需要注意,很容易就终止了,并且会出现一些下载出空jar包的情况,即:jar包 ...
mzy对于反射的复习
反射其实就是指在超脱规则的束缚,从强引用到弱相关,在上帝视角做事情,对于写配置文件,和一些框架的源码,得到调用上至关重要,java带有解释器的语法特性,使得泛型一类的语法糖和反射配合之后更如鱼得水! ...
Fllink学习
1.Apache Flink 是一个面向分布式数据流处理和批量数据处理的开源计算平台,它能够基于同一个Flink运行时,提供支持流处理和批处理两种类型应用的功能. 现有的开源计算方案,会把流处理和批处 ...
etcd raft 处理流程图系列3-wal的存储和运行
存储和节点的创建 raftexample中的存储其实有两种,一个是通过raft.NewMemoryStorage()进行创建的raft.raftStorage,关联到单个raft节点,另一个是通过ne ...
redis 《scan命令》
此命令十分奇特建议参考文档:http://redisdoc.com/database/scan.html#scan 222222222222222并非每次迭代都要使用相同的 COUNT 值. ...
实型（浮点型）：float、double
实型(浮点型):float.double 实型变量也可以称为浮点型,浮点型变量是用来存储小数数值的.在C语言中,浮点型分为两种:单精度浮点型(float).双精度浮点型(double),但是doubl ...
JavaScript高级程序设计（读书笔记）之BOM
BOM(Browser Object Model)提供了很多对象用于访问浏览器的功能,这些功能与任何网页内容无关. 8.1 window对象 BOM的核心对象是window,它表示一个浏览器实例.在浏 ...
JDK1.8源码(八)——java.lang.ThreadLocal类
https://www.cnblogs.com/xdd666/p/14734047.html ThreadLocal https://www.cnblogs.com/yanfei1819/p/1473 ...
C# List集合类常用操作 (一)
所有操作基于以下类 class Employees { public int Id { get; set; } public string Name { get; set; } public stri ...
Nginx rewrite跳转 location匹配
目录: 一.常用的Nginx 正则表达式二.location 三.rewrite 一.常用的Nginx 正则表达式 1 ^ :匹配输入字符串的起始位置 2 $ :匹配输入字符串的结束位置 3 * : ...

Douban Top 250爬虫

Douban Top 250爬虫的更多相关文章

随机推荐

热门专题