Python爬虫实现抓取腾讯视频所有电影【实战必学】
前言
本文的文字及图片来源于网络,仅供学习、交流使用,不具有任何商业用途,版权归原作者所有,如有问题请及时联系我们以作处理。
作者: Python新手学习之家
用python实现的抓取腾讯视频所有电影的爬虫
- # -*- coding: utf-8 -*-
- import re
- import urllib2
- from bs4 import BeautifulSoup
- import string, time
- import pymongo
- NUM = 0 #全局变量,电影数量
- m_type = u'' #全局变量,电影类型
- m_site = u'qq' #全局变量,电影网站
- #根据指定的URL获取网页内容
- def gethtml(url):
- req = urllib2.Request(url)
- response = urllib2.urlopen(req)
- html = response.read()
- return html
- '''
- 在学习过程中有什么不懂得可以加我的python学习交流扣扣qun,934109170,群里有不错的学习教程与开发工具。
- '''
- #从电影分类列表页面获取电影分类
- def gettags(html):
- global m_type
- soup = BeautifulSoup(html) #过滤出分类内容
- #print soup
- #<ul class="clearfix _group" gname="mi_type" gtype="1">
- tags_all = soup.find_all('ul', {'class' : 'clearfix _group' , 'gname' : 'mi_type'})
- #print len(tags_all), tags_all
- #print str(tags_all[1]).replace('\n', '')
- #<a _hot="tag.sub" class="_gtag _hotkey" href="http://v.qq.com/list/1_0_-1_-1_1_0_0_20_0_-1_0.html"title="动作" tvalue="0">动作</a>
- re_tags = r'<a _hot=\"tag\.sub\" class=\"_gtag _hotkey\" href=\"(.+?)\" title=\"(.+?)\" tvalue=\"(.+?)\">.+?</a>'
- p = re.compile(re_tags, re.DOTALL)
- tags = p.findall(str(tags_all[0]))
- if tags:
- tags_url = {}
- #print tags
- for tag in tags:
- tag_url = tag[0].decode('utf-8')
- #print tag_url
- m_type = tag[1].decode('utf-8')
- tags_url[m_type] = tag_url
- else:
- print "Not Find"
- return tags_url
- #获取每个分类的页数
- def get_pages(tag_url):
- tag_html = gethtml(tag_url)
- #div class="paginator
- soup = BeautifulSoup(tag_html) #过滤出标记页面的html
- #print soup
- #<div class="mod_pagenav" id="pager">
- div_page = soup.find_all('div', {'class' : 'mod_pagenav', 'id' : 'pager'})
- #print div_page #len(div_page), div_page[0]
- #<a class="c_txt6" href="http://v.qq.com/list/1_2_-1_-1_1_0_24_20_0_-1_0.html" title="25"><span>25</span></a>
- re_pages = r'<a class=.+?><span>(.+?)</span></a>'
- p = re.compile(re_pages, re.DOTALL)
- pages = p.findall(str(div_page[0]))
- #print pages
- if len(pages) > 1:
- return pages[-2]
- else:
- return 1
- def getmovielist(html):
- soup = BeautifulSoup(html)
- #<ul class="mod_list_pic_130">
- divs = soup.find_all('ul', {'class' : 'mod_list_pic_130'})
- #print divs
- for div_html in divs:
- div_html = str(div_html).replace('\n', '')
- #print div_html
- getmovie(div_html)
- def getmovie(html):
- global NUM
- global m_type
- global m_site
- re_movie = r'<li><a class=\"mod_poster_130\" href=\"(.+?)\" target=\"_blank\" title=\"(.+?)\"><img.+?</li>'
- p = re.compile(re_movie, re.DOTALL)
- movies = p.findall(html)
- if movies:
- conn = pymongo.Connection('localhost', 27017)
- movie_db = conn.dianying
- playlinks = movie_db.playlinks
- #print movies
- for movie in movies:
- #print movie
- NUM += 1
- print "%s : %d" % ("=" * 70, NUM)
- values = dict(
- movie_title = movie[1],
- movie_url = movie[0],
- movie_site = m_site,
- movie_type = m_type
- )
- print values
- playlinks.insert(values)
- print "_" * 70
- NUM += 1
- print "%s : %d" % ("=" * 70, NUM)
- #else:
- # print "Not Find"
- def getmovieinfo(url):
- html = gethtml(url)
- soup = BeautifulSoup(html)
- #pack pack_album album_cover
- divs = soup.find_all('div', {'class' : 'pack pack_album album_cover'})
- #print divs[0]
- #<a href="http://www.tudou.com/albumplay/9NyofXc_lHI/32JqhiKJykI.html" target="new" title="《血滴子》独家纪录片" wl="1"> </a>
- re_info = r'<a href=\"(.+?)\" target=\"new\" title=\"(.+?)\" wl=\".+?\"> </a>'
- p_info = re.compile(re_info, re.DOTALL)
- m_info = p_info.findall(str(divs[0]))
- if m_info:
- return m_info
- else:
- print "Not find movie info"
- return m_info
- def insertdb(movieinfo):
- global conn
- movie_db = conn.dianying_at
- movies = movie_db.movies
- movies.insert(movieinfo)
- if __name__ == "__main__":
- global conn
- tags_url = "http://v.qq.com/list/1_-1_-1_-1_1_0_0_20_0_-1_0.html"
- #print tags_url
- tags_html = gethtml(tags_url)
- #print tags_html
- tag_urls = gettags(tags_html)
- #print tag_urls
- for url in tag_urls.items():
- print str(url[1]).encode('utf-8') #,url[0]
- maxpage = int(get_pages(str(url[1]).encode('utf-8')))
- print maxpage
- for x in range(0, maxpage):
- #http://v.qq.com/list/1_0_-1_-1_1_0_0_20_0_-1_0.html
- m_url = str(url[1]).replace('0_20_0_-1_0.html', '')
- movie_url = "%s%d_20_0_-1_0.html" % (m_url, x)
- print movie_url
- movie_html = gethtml(movie_url.encode('utf-8'))
- #print movie_html
- getmovielist(movie_html)
- time.sleep(0.1)
Python爬虫实现抓取腾讯视频所有电影【实战必学】的更多相关文章
- 用python实现的抓取腾讯视频所有电影的爬虫
1. [代码]用python实现的抓取腾讯视频所有电影的爬虫 # -*- coding: utf-8 -*-# by awakenjoys. my site: www.dianying.atim ...
- 【Python3 爬虫】16_抓取腾讯视频评论内容
上一节我们已经知道如何使用Fiddler进行抓包分析,那么接下来我们开始完成一个简单的小例子 抓取腾讯视频的评论内容 首先我们打开腾讯视频的官网https://v.qq.com/ 我们打开[电视剧]这 ...
- 【转】Python爬虫:抓取新浪新闻数据
案例一 抓取对象: 新浪国内新闻(http://news.sina.com.cn/china/),该列表中的标题名称.时间.链接. 完整代码: from bs4 import BeautifulSou ...
- Python爬虫:抓取新浪新闻数据
案例一 抓取对象: 新浪国内新闻(http://news.sina.com.cn/china/),该列表中的标题名称.时间.链接. 完整代码: from bs4 import BeautifulSou ...
- Python爬虫,抓取淘宝商品评论内容!
作为一个资深吃货,网购各种零食是很频繁的,但是能否在浩瀚的商品库中找到合适的东西,就只能参考评论了!今天给大家分享用python做个抓取淘宝商品评论的小爬虫! 思路 我们就拿"德州扒鸡&qu ...
- python爬虫:抓取下载电影文件,合并ts文件为完整视频
目标网站:https://www.88ys.cc/vod-play-id-58547-src-1-num-1.html 反贪风暴4 对电影进行分析 我们发现,电影是按片段一点点加载出来的,我们分别抓取 ...
- python爬虫数据抓取方法汇总
概要:利用python进行web数据抓取方法和实现. 1.python进行网页数据抓取有两种方式:一种是直接依据url链接来拼接使用get方法得到内容,一种是构建post请求改变对应参数来获得web返 ...
- python爬虫批量抓取ip代理
使用爬虫抓取数据时,经常要用到多个ip代理,防止单个ip访问太过频繁被封禁.ip代理可以从这个网站获取:http://www.xicidaili.com/nn/.因此写一个python程序来获取ip代 ...
- Python爬虫:抓取手机APP的数据
摘要 大多数APP里面返回的是json格式数据,或者一堆加密过的数据 .这里以超级课程表APP为例,抓取超级课程表里用户发的话题. 1.抓取APP数据包 表单: 表单中包括了用户名和密码,当然都是加密 ...
随机推荐
- 《计算机网络 自顶向下方法》 第2章 应用层 Part2
域名.主机名? 从范围上看: 域名的范围比主机名大 一个域名下通常有多个主机名 从组成上看: 主机名 = 服务器名(或计算机名) + 域名 举例说明: baidu.com 是百度的域名 www.b ...
- django_5:表单1——文件上传
上传文件1 class UserForm(forms.Form): name = forms.CharField() headImg = forms.FileField() def regist(re ...
- 万恶之源-python基本数据类型
万恶之源-基本数据类型(dict) 本节主要内容: 字典的简单介绍 字典增删改查和其他操作 3. 字典的嵌套 ⼀一. 字典的简单介绍 字典(dict)是python中唯⼀一的⼀一个映射类型.他是以{ ...
- mysql--时区问题(时间差8个小时?修改Mysql 时区)
发现评论时间比本地时间晚8小时,原因:mysql默认时区选择了CST 解决办法: Ubuntu系统环境下: 1.检查mysql系统时区 进入mysql:mysql -u root -p mysql&g ...
- 2019-10-16:渗透测试,基础学习,burpsuit笔记
maccms10后门分析下载网址,是假官网http://www.maccmsv10.com/download.htmlMaccms10基于php+mysql的maccms,是苹果的内容管理,方便使用, ...
- 【翻译】Orleans 3.0 发布
aaarticlea/jpeg;base64,/9j/4AAQSkZJRgABAQEASABIAAD/2wBDAAYEBQYFBAYGBQYHBwYIChAKCgkJChQODwwQFxQYGBcUF ...
- JAVA中的类不要使用$符的原因解析
下面是在Java中标识符的定义 1.标识符由字母.数字.货币符号(¥.$等).连接符号(_等)组成.(这里的字母为Unicode字符集, 而不再局限于传统的26个英文字母.)2.标识符的首字符可以是字 ...
- 【前端】 在前端利用数学函数知识+box-shadow解波浪图形
序 今天正在刷数学函数相关题目,刷到了下面这篇文章,哇哦-有意思. 利用cos和sin实现复杂的曲线.传送门在下面. CSS 技巧一则 -- 在 CSS 中使用三角函数绘制曲线图形及展示动画 正巧在复 ...
- Linux -- 信号发送实现
信号是Linux系统响应某些条件而产生的一个事件,接收该信号的进程会响应地采取一些行动 signal 定义 在进程控制块 (PCB Process Control Block) 的数据结构中,存在 ...
- SpringMVC 前端传递list到后台
---恢复内容开始--- 1.前端获取传入后台的list 2.ajax写法: $.ajax({ type: 'post', url: url, async:false, dataType:" ...