使用Requests+正则表达式爬取猫眼TOP100电影并保存到文件或MongoDB,并下载图片

需要着重学习的地方:
(1)爬取分页数据时,url链接的构建
(2)保存json格式数据到文件,中文显示问题
(3)线程池的使用
(4)正则表达式的写法
(5)根据图片url链接下载图片并保存
(6)MongoDB的初步使用

#!/usr/bin/env python
# -*- coding: utf-8 -*-

import re

import json

import requests

from requests.exceptions import RequestException

from multiprocessing import Pool

import pymongo

import os

from hashlib import md5

MONGO_URL = 'localhost'

MONGO_DB = 'maoyan'

MONGO_TABLE = 'maoyan'

client = pymongo.MongoClient(MONGO_URL, connect=False)

db = client[MONGO_DB]

# 获取单页数据

def get_one_page(url):

    try:

        response = requests.get(url)

        if response.status_code == 200:

            return response.text

        return None

    except RequestException:

        return None

# 解析单页数据,获取所需的数据

# '.*?board-index.*?>(\d+).*?' 获取顺序号

# '.*?data-src="(.*?)".*?'    获取图片链接

# '.*?name.*?title.*?>(.*?)</a>.*?'  获取电影名称

# '.*?star">(.*?)</p>.*?',re.S 获取演员名单(有换行,需要加上re.S,否则获取不到数据)

# '.*?releasetime">(.*?)</p>.*?' 获取上映时间

# '.*?integer">(.*?)</i>.*?' 获取主分

# '.*?fraction">(.*?)</i>.*?'获取辅分

# 综合下来,加上最外层的dd

def parse_one_page(html):

    pattern = re.compile(

        '<dd>.*?board-index.*?>(\d+).*?data-src="(.*?)".*?name.*?title.*?>(.*?)</a>.*?star">(.*?)</p>.*?releasetime">(.*?)</p>.*?integer">(.*?)</i>.*?fraction">(.*?)</i>.*?</dd>',

        re.S)

    items = re.findall(pattern, html)

    for item in items:

        yield{

            'index':item[0],

            'img':item[1],

            'name':item[2].strip(), # 去除前后空格换行符等

            'star':item[3].strip()[3:], # 去除前后空格换行符等,切片截取指定的范围

            'releasetime':item[4][5:],

            'score':item[5] + item[6] # 评分相加

    }

#  保存至文件

def save_to_file(content):

    # 注意:把json数据保存到文件中显示出中文

    with open('movies.text','a',encoding='utf-8') as f:

        f.write(json.dumps(content,ensure_ascii=False) + '\n')

# 保存到数据库中

def save_to_mongo(result):

    if db[MONGO_TABLE].insert(result):

        print('Successfully Saved to Mongo', result)

        return True

    return False

# 请求图片url,获取图片二进制数据

def download_image(url):

    try:

        response = requests.get(url)

        if response.status_code == 200:

            save_image(response.content) # response.contenter二进制数据 response.text文本数据

        return None

    except RequestException:

        print('请求图片出错')

        return None

def save_image(content):

    file_path = '{0}/{1}.{2}'.format(os.getcwd(), md5(content).hexdigest(), 'jpg')

    if not os.path.exists(file_path):

        with open(file_path,'wb') as f:

            f.write(content)

def main(offset):

    url = 'https://maoyan.com/board/4?offset=' + str(offset) # 针对分页

    html = get_one_page(url)

    for item in parse_one_page(html):

        # print(item)

        # save_to_file(item) # 保存至文件

        # save_to_mongo(item) # 保存到数据库

        download_image(item['img']) # 下载图片保存到当前目录

if __name__ == '__main__':

    # for i in range(0, 100):

    #     main(str(i*10))

    # 开启多线程

    pool = Pool()

    pool.map(main,[i*10 for i in range(10)])

使用Requests+正则表达式爬取猫眼TOP100电影并保存到文件或MongoDB,并下载图片的更多相关文章

PYTHON 爬虫笔记八:利用Requests+正则表达式爬取猫眼电影top100（实战项目一）
利用Requests+正则表达式爬取猫眼电影top100 目标站点分析流程框架爬虫实战使用requests库获取top100首页: import requests def get_one_pag ...
Requests+正则表达式爬取猫眼电影
目标提取出猫眼电影TOP100的电影名称.时间.评分.图片等信息,提取站点的URL为http://maoyan.com/board/4,提取的结果以文本的形式保存下来. 准备工作请安装好reque ...
整理requests和正则表达式爬取猫眼Top100中遇到的问题及解决方案
最近看崔庆才老师的爬虫课程,第一个实战课程是requests和正则表达式爬取猫眼电影Top100榜单.虽然理解崔老师每一步代码的实现过程,但自己敲代码的时候还是遇到了不少问题: 问题1:获取respo ...
Python 爬取猫眼 top100 电影例子
一个Python 爬取猫眼top100的小栗子 import json import requests import re from multiprocessing import Pool #//进程 ...
7.5爬取猫眼Top100电影名单
2018-7-5 20:22:57 还有有一丢丢成就感!以后可以爬取简单网站了!比如妹子图片,只是现在不知道咋下载! 正则还是刚看,要多去用正则!正则很强大的东西! #!/usr/bin/env py ...
Requests+正则表达式爬取猫眼电影(TOP100榜)
猫眼电影网址:www.maoyan.com 前言:网上一些大神已经对猫眼电影进行过爬取,所用的方法也是各有其优,最终目的是把影片排名.图片.名称.主要演员.上映时间与评分提取出来并保存到文件或者数据库 ...
python爬虫知识点总结（九）Requests+正则表达式爬取猫眼电影
一.爬取流程二.代码演示 #-*- coding: UTF-8 -*- #_author:AlexCthon #mail:alexcthon@163.com #date:2018/8/3 impor ...
Python爬虫实战之Requests+正则表达式爬取猫眼电影Top100
import requests from requests.exceptions import RequestException import re import json # from multip ...
python爬虫从入门到放弃（九）之 Requests+正则表达式爬取猫眼电影TOP100
import requests from requests.exceptions import RequestException import re import json from multipro ...

随机推荐

解决Chrome在隐身模式下无法播放Flash视频
在地址栏输入: chrome://flags/#prefer-html-over-flash 打开如下界面,并设置成如下所示: 然后点击左下方重启按钮: 参考: http://www.cnblogs. ...
jQuery Mobile中$.mobile.buttonMarkup方法使用具体解释
近期在群里遇到多数网友提到$.mobile.buttonMarkup()方法的使用. 我这里就列了一下api的使用说明,以后大家看博客就能解决这个问题.如有不对的地方,请留言指出! jQuery Mo ...
hdu1203--D - I NEED A OFFER!（转化01背包）
D - I NEED A OFFER! Time Limit:1000MS Memory Limit:32768KB 64bit IO Format:%I64d & %I64u ...
第一个关于selenium项目
1.创建一个简单的Python工程在主菜单中,选择File | New Project ,并指定Python解释器版本 2.创建python类,快捷键alt+insert 3.编写打开浏览器的代码, ...
maven 镜像使用
maven中的snapshot来源与注意事项 maven中的snapshot来源与注意事项 (2012-04-23 15:37:48) 转载▼ 标签: 杂谈分类: java maven的依赖管理是基 ...
Spring JDBC数据库开发
针对数据库操作,Spring框架提供了JdbcTemplate类. 1.Spring JDBC的配置创建配置文件applicationContext.xml,添加如下代码: <!--配置数据源 ...
Jetty：部署到Jetty
Web应用的框架标准Jetty公布版本号能部署标准servlet Spec Web应用和Jetty内部ContextHandler部署描写叙述符,或者两者的一个混合. Web应用是可部署的动态(se ...
js 获取现在时间一个月（N天）后的日期
欢迎加入前端交流群交流知识&&获取视频资料:749539640 let today = new Date().getTime() let lastDay = getTimeByDay( ...
[Javascript] 轻量级的JavaScript日期处理类库xDate使用指南
XDate是一个请谅解的JavaScript的原生Date对象的封装库,提供增强的功能解析,格式化和日期处理.使用起来就和JavaScript自己的对象和方法一样,非常简单. XDate是一个请谅解的 ...
Android拼图-变形金刚
开篇学了几个月的Android开发,动手做了一个简单的拼图小游戏,没有使用游戏框架,名字也纯属娱乐,比较粗糙请大家一笑别骂. 游戏界面是一张图片切割的6*6的小图片,并将其中一块拿走,玩家通过不同的 ...

使用Requests+正则表达式爬取猫眼TOP100电影并保存到文件或MongoDB,并下载图片

使用Requests+正则表达式爬取猫眼TOP100电影并保存到文件或MongoDB,并下载图片的更多相关文章

随机推荐

热门专题