python爬虫学习(8) —— 关于4399的一个小Demo

堂弟喜欢各种游戏，在没有网络的情况下，上4399显得很无力。

另外，4399广告好多，，而且加载慢。。

怎么办，，写个爬虫吧，，把4399上的“好玩”游戏爬下来。

1. 分析阶段

4399上的游戏，都是 .swf 格式的 flash

想 玩 到一个游戏，我们需要跳转若干的链接：

选择一个游戏 -> 进入到游戏介绍
选择开始游戏 -> 跳转到游戏界面
再仔细在html代码中寻找，最终可能会找到swf源文件所在的地址
有一些地址在html代码的 src 中直接给出，有一些则是给出的相对路径
那么我们抛弃掉一些吧，反正游戏非常多，忽略掉一些也无所谓

2. 动手吧

直接贴出代码，没什么过多的解释，算是一个crawler的小练习。

#coding=utf-8

#爬取4399所有好玩的游戏

import re

import os

import requests

# 基础url

host_url = 'http://www.4399.com'

swfbase_url = 'http://szhong.4399.com/4399swf'

hw_url = 'http://www.4399.com/flash/gamehw.htm'

if not os.path.exists('./swf'):

    os.mkdir(r'./swf')

# 需要的正则表达式

tmp_pat = re.compile(r'<ul class="tm_list">(.*?)</ul>',re.S)

game_pat = re.compile( r'<li><a href="(/flash.*?)"><img alt=.*?src=".*?"><b>(.*?)</b>.*?</li>', re.S )

swf_pat = re.compile(r'_strGamePath="(.*?swf)"',re.S)

game_html = requests.get(hw_url)

game_html.encoding = 'gb2312'

tt = tmp_pat.search(game_html.text,re.S).group(1)

game_list = game_pat.findall(tt)

for l in game_list:

    # print l[0], l[1]

    game_page = requests.get(host_url + l[0]).text

    src_url = swf_pat.search(game_page)

    if src_url == None:

        continue;

    src = requests.get( swfbase_url + src_url.group(1) ).content

    print "正在保存游戏:" , l[1]

    open( "./swf/"+ l[1] + ".swf", "wb" ).write( src )

效果如下：

python爬虫学习(8) —— 关于4399的一个小Demo的更多相关文章

学习react，动手实现一个小demo（仿知乎问答）
学习react也有一周的时间,最近自己做了个仿知乎问答的小demo,项目源码在github上:https://github.com/yang302/reactQa 使用技术:bower+gulp+re ...
python爬虫学习 —— 总目录
开篇作为一个C党,接触python之后学习了爬虫. 和AC算法题的快感类似,从网络上爬取各种数据也很有意思. 准备写一系列文章,整理一下学习历程,也给后来者提供一点便利. 我是目录听说你叫爬虫 - ...
python爬虫学习(1) —— 从urllib说起
0. 前言如果你从来没有接触过爬虫,刚开始的时候可能会有些许吃力因为我不会从头到尾把所有知识点都说一遍,很多文章主要是记录我自己写的一些爬虫所以建议先学习一下cuiqingcai大神的 Pyth ...
Python爬虫学习：四、headers和data的获取
之前在学习爬虫时,偶尔会遇到一些问题是有些网站需要登录后才能爬取内容,有的网站会识别是否是由浏览器发出的请求. 一.headers的获取就以博客园的首页为例:http://www.cnblogs.c ...
python爬虫学习视频资料免费送，用起来非常666
当我们浏览网页的时候,经常会看到像下面这些好看的图片,你是否想把这些图片保存下载下来. 我们最常规的做法就是通过鼠标右键,选择另存为.但有些图片点击鼠标右键的时候并没有另存为选项,或者你可以通过截图工 ...
python爬虫学习笔记（一）——环境配置（windows系统）
在进行python爬虫学习前,需要进行如下准备工作: python3+pip官方配置 1.Anaconda(推荐,包括python和相关库) [推荐地址:清华镜像] https://mirrors ...
python爬虫学习01--电子书爬取
python爬虫学习01--电子书爬取 1.获取网页信息 import requests #导入requests库 ''' 获取网页信息 ''' if __name__ == '__main__': ...
Python爬虫学习02--pyinstaller
Python爬虫学习02--打包exe可执行程序 1.上一次做了一个爬虫爬取电子书的Python程序,然后发现可以通过pyinstaller进行打包成exe可执行程序.发现非常简单好用 2.这是上次写 ...
Python爬虫学习第一记 (翻译小助手)
1 # Python爬虫学习第一记 8.24 (代码有点小,请放大看吧) 2 3 #实现有道翻译,模块一: $fanyi.py 4 5 import urllib.request 6 import u ...

随机推荐

Web中的XHRHttpRequest
1.提出者:Jesse James Garrett 2.IE中,XHR是通过ActiveX对象实现的.涉及浏览器的兼容性写法. 3.使用 <1>open("请求方式&qu ...
如果没有Visual Studio 2015，我们如何创建.NET Core项目？
对于.NET开发人员来说,我们已经习惯了VS这个世界上最强大的IDE,所以对他们来说,项目的创建直接利用安装到VS中相应的项目模板即可.当.NET Core跨出了Windows的围栏,正式拥抱其他平台 ...
PHP的学习--在Atom中使用XDebug（Mac）
之前写过一篇博客<PHP的学习--在sublime中使用XDebug(Ubuntu)>,讲了在Ubuntu系统 sublime 中配置 XDebug,其实配置好之后,我也很少用,原因有两点 ...
ASP.NET Core 中文文档第三章原理（8）日志
原文:Logging 作者:Steve Smith 翻译:刘怡(AlexLEWIS) 校对:何镇汐.许登洋(Seay) ASP.NET Core 内建支持日志,也允许开发人员轻松切换为他们想用的其他日 ...
存在即合理，重复轮子orm java版本
1,业务描述前序? 需求来源于,公司的运营部门.本人所在公司(私营,游戏行业公司),从初创业,我就进入公司,一直致力于服务器核心研发. 公司成立块3年了,前后出产了4款游戏,一直在重复的制造公司游戏对 ...
WCF备忘录一：服务端实例的生命周期
示例代码下载地址:WCFDemo1Day 概述客户端向WCF服务发出请求后,服务端会实例化一个Service对象(实现了契约接口的对象)用来处理请求,实例化Service对象以及维护其生命周期的方式 ...
IdentityServer4 ASP.NET Core的OpenID Connect OAuth 2.0框架学习保护API
IdentityServer4 ASP.NET Core的OpenID Connect OAuth 2.0框架学习之保护API. 使用IdentityServer4 来实现使用客户端凭据保护ASP.N ...
【手记】WebBrowser响应页面中的blank开新窗口及window.close关闭本窗体
注:本文适用.net 2.0+的winform项目目的: 点击页面中的target="_blank"链接时,弹出新窗体页面中有window.close()操作时,关闭窗体上述 ...
Android 的进程和线程
进程和线程如果某个应用程序组件是第一次被启动,且这时应用程序也没有其他组件在运行,则android系统会为应用程序创建一个包含单个线程的linux进程.默认情况下,同一个应用程序的所有组件都运行在同 ...
征途 bzoj 4518
征途(1s 256MB)journey [问题描述] Pine开始了从S地到T地的征途. 从S地到T地的路可以划分成n段,相邻两段路的分界点设有休息站. Pine计划用m天到达T地.除第m天外,每一天 ...

python爬虫学习(8) —— 关于4399的一个小Demo

1. 分析阶段

2. 动手吧

效果如下：

python爬虫学习(8) —— 关于4399的一个小Demo的更多相关文章

随机推荐

热门专题