python爬虫基础之一（爬淘宝）

没想到python如此强大，

今天看一会视频学会了一段python爬虫

这就是我今天学到的内容爬去淘宝网关于书包的一些信息，包括价格，

#coding=utf-8

import requests#导入requests模块

import re#导入re模块

#提取网页代码通用表达式

def getHTMLText(url):

    try:

        r = requests.get(url,timeout=30)#获取页面的url链接

        r.raise_for_status()

        r.encoding = r.apparent_encoding

        return r.text

    except:

        return ""

#提取Html中的主要信息

def parseHtml(ilt,html):

    try:#下面是正则表达式处理文字信息

        plt = re.findall(r'\"view_price\"\:\"[\d\.]*\"',html)

        flt = re.findall(r'\"raw_title\"\:\".*?\"',html)

        for i in range(len(plt)):

            price =  eval(plt[i].split(":")[1])#eval 可以将前后的”“去掉

            name = eval(flt[i].split(":")[1])#split 可以分割字符串到列表红

            ilt.append([price,name])

    except:

        print("")

#将格式打印出来

def printGoodsPrice(ilt):

    try:#让排版更清晰

        tplt = "{:4}\t{:8}\t{:16}"

        print(tplt.format("序号","价格","商品名称"))

        count = 0;

        for g in ilt:

            count = count+1

            print(tplt.format(count,g[0],g[1]))

    except:

        print("")

def main():

    goods = '书包'#提取的商品

    depth = 2 #提取的深度

    url = 'https://s.taobao.com/search?q='+goods

    ilt = []

    i = 0

    for i in range(depth):

        try:

            irl = url + '&s=' +  str(i*44)#这个地方的改动可以影响提取内容

            html = getHTMLText(irl)

            parseHtml(ilt,html)

        except:

            continue

    printGoodsPrice(ilt)#打印处理

main()

python爬虫基础之一（爬淘宝）的更多相关文章

python爬虫-基础入门-爬取整个网站《3》
python爬虫-基础入门-爬取整个网站<3> 描述: 前两章粗略的讲述了python2.python3爬取整个网站,这章节简单的记录一下python2.python3的区别 python ...
python爬虫-基础入门-爬取整个网站《2》
python爬虫-基础入门-爬取整个网站<2> 描述: 开场白已在<python爬虫-基础入门-爬取整个网站<1>>中描述过了,这里不在描述,只附上 python3 ...
python爬虫-基础入门-爬取整个网站《1》
python爬虫-基础入门-爬取整个网站<1> 描述: 使用环境:python2.7.15 ,开发工具:pycharm,现爬取一个网站页面(http://www.baidu.com)所有数 ...
Python爬虫之定时抢购淘宝商品
Python爬虫之定时抢购淘宝商品 import time from selenium import webdriver import datetime class Spider: def __ini ...
python爬虫基础应用----爬取校花网视频
一.爬虫简单介绍爬虫是什么? 爬虫是首先使用模拟浏览器访问网站获取数据,然后通过解析过滤获得有价值的信息,最后保存到到自己库中的程序. 爬虫程序包括哪些模块? python中的爬虫程序主要包括,re ...
Python爬虫基础--分布式爬取贝壳网房屋信息(Client)
1. client_code01 2. client_code02 3. 这个时候运行多个client就可以分布式进行数据爬取.
Python爬虫基础--分布式爬取贝壳网房屋信息(Server)
1. server_code01 2. server_code02 3. server_code03
【转载】教你分分钟学会用python爬虫框架Scrapy爬取心目中的女神
原文:教你分分钟学会用python爬虫框架Scrapy爬取心目中的女神本博文将带领你从入门到精通爬虫框架Scrapy,最终具备爬取任何网页的数据的能力.本文以校花网为例进行爬取,校花网:http:/ ...
Python爬虫基础
前言 Python非常适合用来开发网页爬虫,理由如下: 1.抓取网页本身的接口相比与其他静态编程语言,如java,c#,c++,python抓取网页文档的接口更简洁:相比其他动态脚本语言,如perl ...
python爬虫-基础入门-python爬虫突破封锁
python爬虫-基础入门-python爬虫突破封锁 >> 相关概念 >> request概念:是从客户端向服务器发出请求,包括用户提交的信息及客户端的一些信息.客户端可通过H ...

随机推荐

【luogu P2195 HXY造公园】题解
题目链接:https://www.luogu.org/problemnew/show/P2195 fir.吐槽题目(省略1w字 sec.考虑对一个森林的维护,每棵树用并查集维护. 操作1:输出当前查询 ...
Jstorm+Spring+mybatis整合
在现有的jstorm框架下,有一个需求:jstorm要对接mysql数据库的实时读取数据, 通过bolt处理,可能要调用service层的框架,最后保存到数据库. 在网上寻找了一下,发现storm集成 ...
sql1999语法
1.交叉连接 cross join 左右两个表进行组合,产生笛卡尔积累. 左边每一行分别于右表每一行数据匹配. 2.using using使用的前提是两个表右关联的字段需要对应,两个表的join查询. ...
Dynamic Ambient Occlusion and Indirect Lighting
This sample was presented on the Nvida witesite, which detail a new idea to calculate the ambient oc ...
iOS11、iPhone X、Xcode9 适配指南
更新iOS11后,发现有些地方需要做适配,整理后按照优先级分为以下三类: 1.单纯升级iOS11后造成的变化: 2.Xcode9 打包后造成的变化: 3.iPhoneX的适配一.单纯升级iOS11后 ...
开发机器上利用vs2013调试远程IIS上的c#程序
当远程IIS上的C#程序出现问题,怎么排错,一般我们通过看日志排查错误的方法,这种方法在程序异常日志都打印出来的情况下是可以解决的,但如果程序日志不详细,或者从日志看不出有用的内容的时候怎么排错? 本 ...
chromium之MessagePump.h
上代码,注释已经写得很详细了. 粗看一下,这是个纯虚类,用于跨平台的通用接口. MessagePump,Pump的意思是泵,,MessagePump也就是消息泵,输送消息 namespace base ...
搭建 Redis 的主从
主从概念⼀个master可以拥有多个slave,⼀个slave⼜可以拥有多个slave,如此下去,形成了强⼤的多级服务器集群架构 master用来写数据,slave用来读数据,经统计:网站的读写比率 ...
linux 安全防护
一.禁止ROOT用户远程登录 linux中root用户是超级管理员,可以针对root用户暴力破解密码,这样很不安全,工作中我们一般禁止root用户直接远程登陆,开设一个或多个普通用户,只允许登陆普通用 ...
Java核心技术36讲----------谈谈final、finally、finalize有什么不同
一.final 1.final修饰方法时,需要注意的点: #final修饰方法时,之前的第二个原因是效率.但是如果方法过于庞大,可能看不到内嵌调用带来的任何性能提升.在最近的Java版本中,不需要使用 ...

python爬虫基础之一（爬淘宝）

python爬虫基础之一（爬淘宝）的更多相关文章

随机推荐

热门专题