Forward团队-爬虫豆瓣top250项目-模块开发过程

项目托管平台地址:https://github.com/xyhcq/top250

开发模块功能: 爬虫对信息的处理部分

开发时间:5天的下午空余时间（每天大约1小时，边学模块的使用边开发）

实现了：爬虫的基本功能，能够爬取指定网站的信息

实现过程：导入2个python库：requests和BeautifulSoup，利用这些库自带的功能和根据之前成员马壮分析过的网页源码信息可以实现对网页源码内容的分析提取。

def getData(html):

    # 分析代码信息，提取数据

    soup = BeautifulSoup(html, "html.parser")

    # 找到第一个class属性值为grid_view的ol标签

    movieList=soup.find('ol',attrs={'class':'grid_view'})

    # 找到所有的li标签

    for movieLi in movieList.find_all('li'):

        # 找到第一个class属性值为hd的div标签

        movieHd=movieLi.find('div',attrs={'class':'hd'})

        # 找到第一个class属性值为title的span标签

        # 获取电影名字

        movieName=movieHd.find('span',attrs={'class':'title'}).getText()

        print movieName

        # 获取电影链接

        movieUrl=movieHd.find('a class="" href="')

        print movieUrl

        # 获取电影导演/演员

        movieBd = movieLi.find('div', attrs={'class': 'bd'})

        movieSF=movieBd.find('p',attrs={'class':''}).getText()

        print movieSF

        # 获取电影的评分

        movieScore=movieLi.find('span',attrs={'class':'rating_num'}).getText()

        print movieScore

        #获取电影的评论数

        movieEval=movieLi.find('div',attrs={'class':'star'})

        movieEvalNum=re.findall(r'\d+',str(movieEval))[-1]

        print movieEvalNum

        # 获取电影短评

        movieQuote = movieLi.find('span', attrs={'class': 'inq'})

        # 有的电影没有短评，为防止报错，加次

        if(movieQuote):

            print movieQuote.getText()

        else:

            print ('没有短评！')

遇到的问题及问题解决方法:

安装BeautifulSoup和requests库时遇到了严重的问题：系统的python有问题，环境变量异常，不能正常运行模块的安装程序,最终在虚拟机里安装了xp系统和python2.7解决了这个问题

安装BeautifulSoup和requests库时遇到了一般的问题：导入这两个模块后程序报错，不能正常工作,最终经检查发现，安装的模块版本不适用于python2.7，重新找到适配版本安装后问题解决。

Forward团队-爬虫豆瓣top250项目-模块开发过程的更多相关文章

团队-爬虫豆瓣top250项目-模块开发过程
项目托管平台地址:https://github.com/gengwenhao/GetTop250.git 开发模块功能: "get_info()单个页面的爬取"功能,开发时间:15 ...
Forward团队-爬虫豆瓣top250项目-模块测试过程
我所做的模块不需要测试,但在后续其他人编写代码的时候,我需要对网页源码进行进一步的规范,然后指导别人在网页源码中的标签用法.
Forward团队-爬虫豆瓣top250项目-项目总结
托管平台地址:https://github.com/xyhcq/top250 小组名称:Forward团队组长:马壮成员:李志宇.刘子轩.年光宇.邢云淇.张良我们这次团队项目内容是爬取豆瓣电影T ...
Forward团队-爬虫豆瓣top250项目-项目进度
项目地址:https://github.com/xyhcq/top250 我们的项目是爬取豆瓣top250的电影的信息,在做这个项目前,我们都没有经验,完全是从零开始,过程中也遇到了很多困难,不过我们 ...
Forward团队-爬虫豆瓣top250项目-最终程序
托管平台地址:https://github.com/xyhcq/top250 小组名称:Forward团队小组成员合照: 程序运行方法: 在python中打开程序并运行:或者直接执行程序即可运行程 ...
《Forward团队-爬虫豆瓣top250项目-开发文档》
码云地址:https://github.com/xyhcq/top250 模块功能:获取豆瓣top250网页的源代码,并分析. def getHTMLText(url,k): # 获取网页源代码 tr ...
Forward团队-爬虫豆瓣top250项目-开发文档
项目地址:https://github.com/xyhcq/top250 我在本次项目中负责写爬虫中对数据分析的一部分,根据马壮分析过的html,我来进一步写代码获取数据,具体的功能及实现方法我已经写 ...
Forward团队-爬虫豆瓣top250项目-模块测试
项目托管平台地址:https://github.com/xyhcq/top250 模块测试:爬虫对信息的处理部分测试方法: 实际运行一下代码: 可以看见,信息都已经爬取出来了其他补充说明: 原本系 ...
Forward团队-爬虫豆瓣top250项目-需求分析
一. 需求:1.爬取豆瓣电影top250. 2.获取电影名称,排名,分数,简介,导演,演员. 3.将爬取到的数据保存,以便随时查看. 3.可以将获取到的数据展示给用户. 二. 参考: 豆瓣api参考资 ...

随机推荐

python中建模分析零息票收益率曲线--复利和连续复利
收益率曲线(Yield Curve)是显示一组货币和信贷风险均相同,但期限不同的债券或其他金融工具收益率的图表.纵轴代表收益率,横轴则是距离到期的时间.在此用python建模分析零息票收益率曲线,输出 ...
js类的继承，es5和es6的方法
存在的差异:1. 私有数据继承差异 es5:执行父级构造函数并且将this指向子级 es6:在构造函数内部执行super方法,系统会自动执行父级,并将this指向子级2. 共有数据(原型链方法)继承的 ...
spring 生命周期最详解
转载. https://blog.csdn.net/qq_23473123/article/details/76610052 目的在大三开始学习spring时,老师就说spring bean周期非常 ...
ios怎么让状态栏颜色和导航栏背景图片颜色一样
ios7 图片作为导航的背景的话,如果想实现状态栏和导航栏一体化,那么图片高度需要增加22,也就是64,retina是128
lvm管理：扩展lv、删除pv、lv等
从卷组VG里扩展lv.删除pv,并删除物理卷PV 一.扩展LV.缩小LV 1.卸载LV 命令:umount "挂载目录" 2.扩展LV 命令:lvextend -L +500m ...
发送Http
/** * 向指定 URL 发送POST方法的请求 * * @param url * 发送请求的 URL * @param param * 请求参数,请求参数应该是 name1=value1& ...
.net core 微服务之日志落盘设计
原文:.net core 微服务之日志落盘设计目录 1.设计目标 2.日志流程 3.串联请求事务 3.1 请求ID 3.2 处理服务器.服务 3.3 处理接口名 3.4 日志的发生时间 3.5 接口 ...
python中configpraser模块
configparser 模块解析配置文件模块什么是配置文件? 用于编写程序的配置信息的文件什么是配置信息? 为了提高程序的扩展性 #configparser模块的使用 #首先我们需要知道配 ...
SSO 单点登录
一.单系统登录机制 1.http无状态协议 web应用采用browser/server架构,http作为通信协议.http是无状态协议,浏览器的每一次请求,服务器会独立处理,不与之前或之后的请求产生关 ...
springboot整合zookeeper
在springboot中所有的整合都是以bean的形式注入对象,从数据库coon.redis conn.再到整合的zookeeper,依然是依照bean注入连接对象,通过zookeeper api对z ...

Forward团队-爬虫豆瓣top250项目-模块开发过程

Forward团队-爬虫豆瓣top250项目-模块开发过程的更多相关文章

随机推荐

热门专题