python 爬虫&爬取豆瓣电影top250

爬取豆瓣电影top250
from urllib.request import *  #导入所有的request，urllib相当于一个文件夹，用到它里面的方法request
from lxml import etree  #调用包
import pickle #
import time
arr = []       #定义一个空数组，用来添加爬出的数据
url = "https://movie.douban.com/top250?start="   #豆瓣top250网址
urls = [ url+str(i) for i in range(0,250,25)] #每次步进值25，总共250个，爬取十次
def aa(link):    #定义一个函数aa
    time.sleep(1)  #间隔一秒
    print("正在爬取:%s"%link)   #提示信息可以实时看到爬取信息
    with urlopen(link) as html:  #在html中打开爬取的数据
        text = html.read().decode("utf-8")# 读取并且解码数据
    doc = etree.HTML(text)       #解析html  etree这是lxml中的方法
    #分别爬取电影名字titles、详细信息news、评分grade、最佳评论comment、网址links
    titles = doc.xpath("//ol[@class='grid_view']/li/div[@class='item']/div[@class='info']/div[@class='hd']/a/span[1]/text()")
    news= doc.xpath("//ol[@class='grid_view']/li/div[@class='item']/div[@class='info']/div[@class='bd']/p/text()")
    grade= doc.xpath("//ol[@class='grid_view']/li/div[@class='item']/div[@class='info']/div[@class='bd']/div[@class='star']/span[@class='rating_num']/text()")
    comment= doc.xpath("//ol[@class='grid_view']/li/div[@class='item']/div[@class='info']/div[@class='bd']/p[@class='quote']/span[@class='inq']/text()")
    links = doc.xpath("//ol[@class='grid_view']/li/div[@class='item']/div[@class='info']/div[@class='hd']/a/@href")
    arr.append(list(zip(titles,news,grade,comment,links))) #用append方法将爬取数据添加到数组arr
for link in urls: #遍历十页urls
    aa(link)   #调用
with open("豆瓣电影.txt",'wb') as f: #打开本地文件“豆瓣电影.txt”以写的方式，二进制
    pickle.dump(arr,f)     #pickle包
with open("豆瓣电影.txt",'rb') as f:
    obj = pickle.load(f)    #加载
for item in obj:
    print(item)
import xlwt#（写入）
wb=xlwt.Workbook()  #创建表格对象
ws=wb.add_sheet("豆瓣电影")
with open("豆瓣电影.txt",'rb') as f:
    arr=pickle.load(f)
index=0
for arr2 in arr:
    for title,news,grade,comment,links in arr2:
        #序号
        ws.write(index,0,index+1)
        # title
        ws.write(index,1,title)
        ws.write(index,2,news)
        ws.write(index,3,grade)
        ws.write(index,4,comment)
        ws.write(index,5,links)
        index+=1

wb.save("豆瓣电影.xls")

python 爬虫&爬取豆瓣电影top250的更多相关文章

Python爬虫-爬取豆瓣电影Top250
#!usr/bin/env python3 # -*- coding:utf-8-*- import requests from bs4 import BeautifulSoup import re ...
python爬虫 Scrapy2-- 爬取豆瓣电影TOP250
sklearn实战-乳腺癌细胞数据挖掘(博主亲自录制视频) https://study.163.com/course/introduction.htm?courseId=1005269003& ...
Python爬虫----抓取豆瓣电影Top250
有了上次利用python爬虫抓取糗事百科的经验,这次自己动手写了个爬虫抓取豆瓣电影Top250的简要信息. 1.观察url 首先观察一下网址的结构 http://movie.douban.com/to ...
Python爬虫爬取豆瓣电影之数据提取值xpath和lxml模块
工具:Python 3.6.5.PyCharm开发工具.Windows 10 操作系统.谷歌浏览器目的:爬取豆瓣电影排行榜中电影的title.链接地址.图片.评价人数.评分等网址:https:// ...
Python爬虫爬取豆瓣电影名称和链接，分别存入txt，excel和数据库
前提条件是python操作excel和数据库的环境配置是完整的,这个需要在python中安装导入相关依赖包: 实现的具体代码如下: #!/usr/bin/python# -*- coding: utf ...
python3 爬虫---爬取豆瓣电影TOP250
第一次爬取的网站就是豆瓣电影 Top 250,网址是:https://movie.douban.com/top250?start=0&filter= 分析网址'?'符号后的参数,第一个参数's ...
Python爬虫-爬取豆瓣图书Top250
豆瓣网站很人性化,对于新手爬虫比较友好,没有如果调低爬取频率,不用担心会被封 IP.但也不要太频繁爬取. 涉及知识点:requests.html.xpath.csv 一.准备工作需要安装reques ...
python爬虫-爬取豆瓣电影数据
#!/usr/bin/python# coding=utf-8# 作者 :Y0010026# 创建时间 :2018/12/16 16:27# 文件 :spider_05.py# IDE :PyChar ...
Python爬虫入门：爬取豆瓣电影TOP250
一个很简单的爬虫. 从这里学习的,解释的挺好的:https://xlzd.me/2015/12/16/python-crawler-03 分享写这个代码用到了的学习的链接: BeautifulSoup ...

随机推荐

Vuex入门（5）—— 为什么要用Action管理异步操作
Action 类似于 mutation,不同在于: 1.Action 提交的是 mutation,而不是直接变更状态. 2.Action 可以包含任意异步操作. 官方给的定义我没什么意见,事实上我通过 ...
Oracle 数据库逻辑结构2.md
Oracle 数据库逻辑结构一.存储关系Oracle 数据库逻辑上是由一个或多个表空间组成的,表空间物理上是由一个或多个数据文件组成的:而在逻辑上表空间又是由一个或多个段组成的.在Oracle 数据库 ...
javaweb(3)之JSP&EL&JSTL
JSP(Java Server Page) 介绍什么是 JSP ? 从用户角度看,JSP 就是一个网页. 从开发者角度看,它其实就是一个继承了 Servlet 的 java 类,所以可以直接说 JS ...
20175211 2018-2019-2 《Java程序设计》第四周学习总结
目录教材学习内容总结第五章子类与继承教材学习中的问题和解决过程代码调试中的问题和解决过程代码托管上周考试错题总结其他(感悟.思考等,可选) 学习进度条参考资料教材学习内容总结第五 ...
高并发架构系列：MQ消息队列的12点核心原理总结
消息队列已经逐渐成为分布式应用场景.内部通信.以及秒杀等高并发业务场景的核心手段,它具有低耦合.可靠投递.广播.流量控制.最终一致性等一系列功能. 无论是 RabbitMQ.RocketMQ.Act ...
C工程交互 ceph 分布式存储系统
网上看到有人问,如何在C项目里调用ceph系统对外提供的API,实现分布式存储. 我在网上搜到了相关信息,但是因为不是会员无法追加答案,故而,贴于此. 赠予有缘人:) ———————————————— ...
Windows下静态库与动态库的创建与使用
Windows下静态库与动态库的创建与使用学习内容:本博客介绍了Windows下使用Visual C++ 6.0制作与使用静态库与动态库的方法. --------CONTENTS-------- 一 ...
[Luogu]A%BProblem——线性筛素数与前缀和
题目描述题目背景题目名称是吸引你点进来的[你怎么知道的] 实际上该题还是很水的[有种不祥的预感..] 题目描述区间质数个数输入输出格式输入格式: 一行两个整数询问次数n,范围m接下来n行, ...
WebForm内置对象：Application和ViewState、Repeater的Command用法
一.内置对象 1.Application 存贮在服务器端,占用服务器内存生命周期:永久所有人访问的都是这一个对象传值:传的是object类型可以传对象. string s =TextBox1.Te ...
eclipse无法断点调试JDK源码的问题
最近换了新版的eclipse,在jdk源码里面,打断点发现无法进入源码调试,程序直接跳过,已查资料发现自己eclipse配置的是jre环境的. 此处要配成jdk目录才有效打开preferences, ...

python 爬虫&爬取豆瓣电影top250

python 爬虫&爬取豆瓣电影top250的更多相关文章

随机推荐

热门专题