python google play

#!/usr/env  python

#-*- coding: utf-8  -*-

import urllib

import urllib2

import random

import requests

import os,sys

import MySQLdb

from sgmllib import SGMLParser

from BeautifulSoup import BeautifulSoup

import re

num=0

def main():

	try:

		conn=MySQLdb.connect(host='localhost',user='root',passwd='123456',db='googlemarket',charset="utf8")

		conn.query("set names utf8")

	except Exception,e:

		print e

		sys.exit()

	cursor=conn.cursor()

	category=['PERSONALIZATION','TRANSPORTATION','SPORTS','HEALTH_AND_FITNESS','APP_WALLPAPER','COMICS','MEDICAL','BUSINESS','BOOKS_AND_REFERENCE','WEATHER','ENTERTAINMENT','MEDIA_AND_VIDEO','APP_WIDGETS','TOOLS','PHOTOGRAPHY','PRODUCTIVITY','EDUCATION','NEWS_AND_MAGAZINES','TRAVEL_AND_LOCAL','LIFESTYLE','SOCIAL','FINANCE','SHOPPING','LIBRARIES_AND_DEMO','COMMUNICATION','MUSIC_AND_AUDIO','GAME']

	for k in range(0,27):

		t="https://play.google.com/store/apps/category/"+category[k]

		html=requests.get(t)

		preresult=html.content

		soup=BeautifulSoup(preresult)

		result=soup.prettify("utf-8")

		pattern=re.compile('<a class="title" href="(.+?)" title')

		dataresult=re.findall(pattern,result)

		dataresult=list(set(dataresult))

		for i in dataresult:

			url="https://play.google.com"+i

			print url

			#url="https://play.google.com/store/apps/details?id=com.androidesk&hl=zh_CNhttps%3A%2F%2Fplay.google.com%2Fstore%2Fapps%2Fdetails%3Fid%3Dcom.androidesk"

			html=requests.get(url)

			preresult=html.content

			soup=BeautifulSoup(preresult)

			result=soup.prettify("utf-8")

			#名称

			pattern=re.compile('<div class="document-title" itemprop="name">[\s\S]*?<div>([\s\S]*?)</div>')

			data0=re.findall(pattern,result)

			for items in data0:

				print items

			#制造商

			pattern=re.compile('itemprop="name">([\s\S]*?)</a>')

			data1=re.findall(pattern,result)

			make=data1[0].split("\n")

			print make[8]

			#版本

			pattern=re.compile('itemprop="softwareVersion">([\s\S]*?)</div>')

			data2=re.findall(pattern,result)

			print data2[0]

			#更新时间

			pattern=re.compile('itemprop="datePublished">([\s\S]*?)</div>')

			data3=re.findall(pattern,result)

			print data3[0]

			#文件大小

			pattern=re.compile('itemprop="fileSize">([\s\S]*?)</div>')

			data4=re.findall(pattern,result)

			print data4[0]

			#支持固件

			pattern=re.compile('itemprop="operatingSystems">([\s\S]*?)</div>')

			data5=re.findall(pattern,result)

			print data5[0]

			#说明

			pattern=re.compile('itemprop="description">[\s\S]*?<div>([\s\S]*?)</div>')

			data6=re.findall(pattern,result)

			for items in data6:

				print re.sub('[<br /> <p> </p>]',' ',items)

			sql="insert into address(name,version,developer,pubtime,filesize,support,introduction) values(%s,%s,%s,%s,%s,%s,%s)"

			for items in data6:

				if(data5):

					#values=(data0[0],data1[0],data2[0],data3[0],data4[0],data5[0],re.sub('<br />',' ',items))

				#else:

					#values=(data0[0],data1[0],data2[0],data3[0],data4[0],'NULL',re.sub('<br />',' ',items))

				#print values

				#print sql % values

				#cursor.execute(sql,values)

				#conn.commit()

			pattern=re.compile('<img class="cover-image" src=(.+?) alt="Cover art" itemprop="image" />')

			data=re.findall(pattern,result)

			global num

			for j in data:

				print j

				print type(j)

				headers = {'User-Agent':'Mozilla/5.0 (Windows; U; Windows NT 6.1; rv:2.2) Gecko/20110201'}

				temp=requests.get(j[1:-2], headers=headers)

			f=file("googlemarket/"+str(num),"w+")

			num=num+1

			print num

			f.write(temp.content)

if  __name__=="__main__":

       main()

<type 'str'>
Traceback (most recent call last):
File "crawler0729.py", line 103, in <module>
main()
File "crawler0729.py", line 91, in main
temp=requests.get(j[1:-2], headers=headers)
File "/usr/local/lib/python2.7/dist-packages/requests/api.py", line 55, in get
return request('get', url, **kwargs)
File "/usr/local/lib/python2.7/dist-packages/requests/api.py", line 44, in request
return session.request(method=method, url=url, **kwargs)
File "/usr/local/lib/python2.7/dist-packages/requests/sessions.py", line 335, in request
resp = self.send(prep, **send_kwargs)
File "/usr/local/lib/python2.7/dist-packages/requests/sessions.py", line 438, in send
r = adapter.send(request, **kwargs)
File "/usr/local/lib/python2.7/dist-packages/requests/adapters.py", line 327, in send
raise ConnectionError(e)
requests.exceptions.ConnectionError: HTTPSConnectionPool(host='lh3.ggpht.com', port=443): Max retries exceeded with url: /RBld17rLw4Ik0JtOaKk4bZB2RiGJ2R8H5Q8Rjw3Hh6BAM694fOzzKj1TJFr7R02ZS_40=w30 (Caused by <class 'socket.error'>: [Errno 101] Network is unreachable)

python google play的更多相关文章

Python+Google Geocoding
本文主要介绍使用Python调用Google Geocoding API进行地址到地理坐标的转换. Google Geocoding参考https://developers.google.com/ma ...
吴裕雄--天生自然python Google深度学习框架：Tensorflow实现迁移学习
import glob import os.path import numpy as np import tensorflow as tf from tensorflow.python.platfor ...
详解Python Google Protocol Buffer
为什么要使用PB? PB(Protocol Buffer)是 Google 开发的用于结构化数据交换格式,作为腾讯云日志服务标准写入格式.因此用于写入日志数据前,需要将日志原始数据序列化为 PB 数据 ...
吴裕雄--天生自然python Google深度学习框架：经典卷积神经网络模型
import tensorflow as tf INPUT_NODE = 784 OUTPUT_NODE = 10 IMAGE_SIZE = 28 NUM_CHANNELS = 1 NUM_LABEL ...
吴裕雄--天生自然python Google深度学习框架：图像识别与卷积神经网络
吴裕雄--天生自然python Google深度学习框架：MNIST数字识别问题
import tensorflow as tf from tensorflow.examples.tutorials.mnist import input_data INPUT_NODE = 784 ...
吴裕雄--天生自然python Google深度学习框架：深度学习与深层神经网络
吴裕雄--天生自然python Google深度学习框架：TensorFlow实现神经网络
http://playground.tensorflow.org/
吴裕雄--天生自然python Google深度学习框架：Tensorflow基础应用
import tensorflow as tf a = tf.constant([1.0, 2.0], name="a") b = tf.constant([2.0, 3.0], ...

随机推荐

Windows不能再本地计算机启动Apache
1.显示的错误如下: 2.解决的方法是: 在运行中切换到你的apache的bin目录下,执行httpd.exe,看有什么提示 3.根据错误提示,修改相应的信息,比如我的是ServerRoot must ...
Android Camera拍照压缩
http://www.linuxidc.com/Linux/2014-12/110924.htm package com.klp.demo_025; import java.io.ByteArrayI ...
cx_Oracle使用方法二
下载地址: https://pypi.python.org/pypi/cx_Oracle/5.2.1, 下载的时候注意数据库版本和操作系统环境. 技术手册: http://cx-oracle.read ...
uboot全局变量
一.global_data(include/asm-arm/global_data.h) typedef struct global_data { bd_t *bd; unsigned long fl ...
c语言技巧--长期更新
1. #define LOWER(c) (unsigned char)(c | 0x20) 换成小写 2. gcc -Wall -Werror //告警当成错误来处理 ...
xcode5时代如何设置Architectures和Valid Architectures
目前ios的指令集有以下几种: 1,armv6,支持的机器iPhone,iPhone2,iPhone3G及对应的iTouch 2,armv7,支持的机器iPhone4,iPhone4S 3,armv7 ...
集成activiti-modeler 到自己的业务系统
本文目的: 将activit 5.12.1 的 modeler 流程设计器集成到自己的工程中去解决问题: 1. 复制相关资源文件到自己的工程中 2. 解决modeler的路径访问问题,迁移到非系统 ...
div 背景色设置_DIV背景颜色设置
DIV 背景色设置篇-div背景颜色设置篇一.div标签内直接设置背景颜色 - TOP <div style="background:#000; color:#FFF&quo ...
Guava学习
Guava学习笔记目录 Guava 是一个 Google 的基于java1.6的类库集合的扩展项目,包括 collections, caching, primitives support, concu ...
标量子查询优化（用group by 代替distinct）
标量子查询优化当使用另外一个SELECT 语句来产生结果中的一列的值的时候,这个查询必须只能返回一行一列的值.这种类型的子查询被称为标量子查询在某些情况下可以进行优化以减少标量子查询的重复执行,但 ...

python google play

python google play的更多相关文章

随机推荐

热门专题