python scrapy框架爬取豆瓣

刚刚学了一下，还不是很明白。随手记录。

在piplines.py文件中将爬到的数据放到json中

class DoubanmoviePipelin2json(object):
#打开文件 open_spider 内部自带 不能自己起名

    def open_spidef(self,spider):

        self.json=open("doubantop250.json","w",encoding="utf-8")

        self.jsonfile.write("["+"/n")

        self.first=1
# 对数据进行跌代 放入json文件中

    def process_item(self,item,spider):

        if self ==1:

            movie=json.dumps(dict(item),ensure_ascii=False)

            self.jsonfile.write(movie)

            self.first=0

        else:

             movie=",\n"+json.dumps(dict(item),ensure_ascii=False)

            self.jsonfile.write(movie)

    return item
#关闭文件

    def close_spider(self,spider):

        self.jsonfile.write("\n"+"]")

        self.jsonfile.close()

写入xls中

 class DoubanmoviePipline2xls(object):

     def open_spider(self,spider):

         self.workbook=xlwt.Workbook(encoding="utf-8")

         self.worksheet=self.work.add_sheet("doubantop250")

         hearder=["电影排名","电影名"]

         for colsIndex in range(len(header)):

             worksheet.write(0,colsIndex,header[colsIndex])

         self.rows=1

     def process_item(self,item,spider):

         movie=[item[k] for k in item]

         for colsIndex in range(len(movie)):

 　　　　　　　self.worksheet.write(self.rows,colsIndex,movie[colsIndex])]

 　　　　　　　self.rows+=1

14　　 return item

     def close_spider(self,spider):

         self.rows=0

         self.workbook.save("doubantop250.xls")

python scrapy框架爬取豆瓣的更多相关文章

基于python的scrapy框架爬取豆瓣电影及其可视化
1.Scrapy框架介绍主要介绍,spiders,engine,scheduler,downloader,Item pipeline scrapy常见命令如下: 对应在scrapy文件中有,自己增加 ...
scrapy框架爬取豆瓣读书（1）
1.scrapy框架 Scrapy,Python开发的一个快速.高层次的屏幕抓取和web抓取框架,用于抓取web站点并从页面中提取结构化的数据.Scrapy用途广泛,可以用于数据挖掘.监测和自动化测试 ...
利用python scrapy 框架抓取豆瓣小组数据
因为最近在找房子在豆瓣小组-上海租房上找,发现搜索困难,于是想利用爬虫将数据抓取. 顺便熟悉一下Python. 这边有scrapy 入门教程出处:http://www.cnblogs.com/txw1 ...
Python scrapy框架爬取瓜子二手车信息数据
项目实施依赖: python,scrapy ,fiddler scrapy安装依赖的包: 可以到https://www.lfd.uci.edu/~gohlke/pythonlibs/ 下载 pywi ...
使用scrapy框架爬取自己的博文（2）
之前写了一篇用scrapy框架爬取自己博文的博客,后来发现对于中文的处理一直有问题- - 显示的时候 [u'python\u4e0b\u722c\u67d0\u4e2a\u7f51\u9875\u76 ...
scrapy框架爬取笔趣阁完整版
继续上一篇,这一次的爬取了小说内容 pipelines.py import csv class ScrapytestPipeline(object): # 爬虫文件中提取数据的方法每yield一次it ...
scrapy框架爬取笔趣阁
笔趣阁是很好爬的网站了,这里简单爬取了全部小说链接和每本的全部章节链接,还想爬取章节内容在biquge.py里在加一个爬取循环,在pipelines.py添加保存函数即可 1 创建一个scrapy项目 ...
【python数据挖掘】爬取豆瓣影评数据
概述: 爬取豆瓣影评数据步骤: 1.获取网页请求 2.解析获取的网页 3.提速数据 4.保存文件源代码: # 1.导入需要的库 import urllib.request from bs4 impo ...
Python使用Scrapy框架爬取数据存入CSV文件(Python爬虫实战4)
1. Scrapy框架 Scrapy是python下实现爬虫功能的框架,能够将数据解析.数据处理.数据存储合为一体功能的爬虫框架. 2. Scrapy安装 1. 安装依赖包 yum install g ...

随机推荐

DotNet 资源大全（转）
awesome-dotnet 是由 quozd 发起和维护.内容包括:编译器.压缩.应用框架.应用模板.加密.数据库.反编译.IDE.日志.风格指南等. https://github.com/jo ...
51nod1236 序列求和 V3
这题炒鸡简单,只要第一步想对了后面顺风顺水QWQ(然鹅我没想到) 前置芝士: 斐波那契数列通项公式等比数列求和公式二项式定理这题要求的就是 \(\sum_{i=1}^n Fib(i)^k\) , ...
【easy】530. Minimum Absolute Difference in BST
找BST树中节点之间的最小差值. /** * Definition for a binary tree node. * struct TreeNode { * int val; * TreeNode ...
WPF 10天修炼第十天- WPF数据绑定
WPF数据绑定数据绑定到元素属性是将源对象指定为一个WPF元素,并且源属性是一个依赖属性,依赖属性内置了变更通知.当改变源对象依赖属性值之后,绑定目标可以立即得到更新,开发人员不需要手动编写响应事件 ...
eclipse，代码中有错误，项目或者java类中却不显示红叉
修改eclipse代码提示级别1.单个项目修改项目上右键-->properties-->java compiler-->building-->enable project sp ...
2、jenkins+svn自动发布和回滚
Jenkins配置回滚思路: 目前只能实现使用salt来管控配置文件的管控,配置文件的版本回滚需要后续定制化开发,或者进行格外其他的管理操作.后续实现以下配置可以为每个项目备份构建文件到本地指定路径 ...
两条命令，实现ssh免密登陆
ssh-keygenssh-copy-id -i 目标服务器ip
adb连接夜神模拟器执行命令
1.要进入夜神模拟器的bin目录 2.连接夜神模拟器 3.执行命令 cd %~dp0 nox_adb.exe connect 127.0.0.1>nul set num= :ok set /a ...
Linux-进程描述（1）—进程控制块
进程概念介绍进程是操作系统对运行程序的一种抽象. • 一个正在执行的程序: • 一个正在计算机上执行的程序实例: • 能分配给处理器并由处理器执行的实体: • 一个具有普以下特征的活动单元:一组指令 ...
Nuxt.js国际化vue-i18n的搭配使用
Nuxt.js国际化的前提是,已经使用脚手架工具搭建好了Nuxt.js的开发环境. 我使用的环境是nuxt@2.3 + vuetify@1.4 + vue-i18n@7.3 1. 先安装vue-i18 ...

python scrapy框架爬取豆瓣

python scrapy框架爬取豆瓣的更多相关文章

随机推荐

热门专题