Python 爬虫实例（11）—— 爬虫苏宁易购

# coding:utf-8

import json

import redis

import time

import requests

session = requests.session()

import logging.handlers

import pickle

import sys

import re

import datetime

from bs4 import BeautifulSoup

from selenium import webdriver

import os

import sys

reload(sys)

sys.setdefaultencoding('utf8')

r =redis.Redis(host="123.56.74.190",port=6379,password="ZBHRwlb1608")

import platform

sysStr = platform.system()

if sysStr =="Windows":

    LOG_FILE_check = 'C:\\log\\wlb\\crawler\\cic.log'

else:

    LOG_FILE_check = '/log/wlb/crawler/cic.log'

handler = logging.handlers.RotatingFileHandler(LOG_FILE_check, maxBytes=128 * 1024 * 1024,backupCount=10)  # 实例化handler  200M 最多十个文件

fmt = '\n' + '%(asctime)s - %(filename)s:%(lineno)s  - %(message)s'

formatter = logging.Formatter(fmt)  # 实例化formatter

handler.setFormatter(formatter)  # 为handler添加formatter

logger = logging.getLogger('check')  # 获取名为tst的logger

logger.addHandler(handler)  # 为logger添加handler

logger.setLevel(logging.DEBUG)

def spider():

    chromedriver = "C:\Program Files (x86)\Google\Chrome\Application\chromedriver.exe"

    os.environ["webdriver.chrome.driver"] = chromedriver

    browser = webdriver.Chrome(chromedriver)

    # 设置浏览器需要打开的url

    url = "https://www.suning.com/"

    browser.get(url)

    time.sleep(5)

    browser.find_element_by_id("searchKeywords").send_keys(u'手机')

    time.sleep(2)

    for i in range(1,100):

        browser.find_element_by_name("index1_none_search_ss1").click()

        browser.find_element_by_id("nextPage").click()

        result = browser.page_source

        soup = BeautifulSoup(result,'html.parser')

        result_ul = soup.find_all('div',attrs={"id":"filter-results"})[0]

        result_list = result_ul.find_all('div',attrs={"class":"li-bg"})

        print len(result_list)

        print result_list[1]

        # for item in result_list:

        #     print item

        #     print "==" * 30

        #

        # time.sleep(500)

        for item in result_list:

            item = str(item).replace('\n','').replace('\r','').replace('\t','')

            print "==" * 30

            print item

            try:

                sold_price = re.findall('pricefn="priceCenterShow"><i>¥</i>(.*?)<i>.*?</i></span>',item)[0]

            except:

                sold_price = re.findall('<i>¥</i>(.*?)<i>.*?</i></span>',item)[0]

            try:

                item_name = re.findall('<i class=".*?" style=".*?"></i>(.*?)</b></a>',item)[0]

            except:

                item_name = re.findall('target="_blank" title="(.*?)"><i class=',item)[0]

            try:

                item_url = re.findall('class=".*?" href="(.*?)" name',item)[0]

            except:

                item_url = re.findall('<a class=".*?" href="(.*?)" id=', item)[0]

            try:

                item_desc = re.findall('<span><i></i><em>(.*?)</em><b></b></span>',item)[0]

            except:

                item_desc = re.findall('<em>(.*?)</em>', item)[0]

            print item_url

            print item_name

            print sold_price

            print item_desc

    time.sleep(500)

spider()

Python 爬虫实例（11）—— 爬虫苏宁易购的更多相关文章

分布式爬虫系统设计、实现与实战：爬取京东、苏宁易购全网手机商品数据+MySQL、HBase存储
http://blog.51cto.com/xpleaf/2093952 1 概述在不用爬虫框架的情况,经过多方学习,尝试实现了一个分布式爬虫系统,并且可以将数据保存到不同地方,类似MySQL.HB ...
jQuery仿苏宁易购导航
最近看了些网上的各类导航网站源码,自己学习制作了一个仿苏宁易购的导航栏 jQuery部分代码 $(function(){ $(".CategoryTree>ul>li" ...
Axure RP Pro 7.0苏宁易购式标签切换效果教程
转:http://jingyan.baidu.com/article/7082dc1c4f0a11e40a89bdac.html 页面标签切换效果,几乎是所有大网站(尤其是电商类网站)标配的交互方式: ...
华为HiAI 助力苏宁易购，让你尽享完美视觉购物体验！
还在感慨商品照片与实物存在差距,又要退货? 还在抱怨被忽视的图片小细节,影响了生活品质? 想要“买买买”, 又担心海量的商品图片耗光你的流量? 就在近期搭载HiAI能力的苏宁易购新版上线, 让你畅快 ...
苏宁易购Android架构演进史
互联网后端架构 https://mp.weixin.qq.com/s/5lDXjMh6ghQNi4E7qQIEEg 互联网后端架构 10月9日摘要移动青铜时代(2012-2014) 时代特点: 移 ...
苏宁易购微信端全页通过background单图
w单图,绕开了显示的兼容性. http://res.m.suning.com/project/JoinGo/intro.html http://res.m.suning.com/project/Joi ...
苏宁易购微信端 wx ios android other 通过js来控制样式
<!DOCTYPE HTML><html><head><meta charset="UTF-8"><meta name=&qu ...
Python 爬虫实例
下面是我写的一个简单爬虫实例 1.定义函数读取html网页的源代码 2.从源代码通过正则表达式挑选出自己需要获取的内容 3.序列中的htm依次写到d盘 #!/usr/bin/python import ...
python Cmd实例之网络爬虫应用
python Cmd实例之网络爬虫应用标签(空格分隔): python Cmd 爬虫废话少说,直接上代码 # encoding=utf-8 import os import multiproces ...

随机推荐

Shell 字符串分割
入门级别入门级别:类似1,2,3,4,5这样的字符串 #!/bin/bash var="1,2,3,4,5" var=${var//,/ } for i in $var; do ...
jstat 使用日志
如何判断JVM是否存在内存问题呢?如何判断JVM垃圾回收是否正常?一般的top指令基本上满足不了这样的需求,因为它主要监控的是总体的系统资源,很难定位到java应用程序. Jstat是JDK自带的一个 ...
数据库中truncate与delete的区别与联系
昨天被问到truncate与delete的区别,truncate没用过,回去百度了一下,才知道还有这个一种语句. truncate table命令将快速删除数据表中的所有记录(保留数据表结构).这种快 ...
JDK5.0 特性-线程锁Lock
来自:http://www.cnblogs.com/taven/archive/2011/12/17/2291470.html import java.util.concurrent.Executor ...
SpringMVC Controller配置方法有哪几种
第一种 URL对应Bean 如果要使用此类配置方式,需要在XML中做如下样式配置  <bean class="org.s ...
llvm -O 经历过那些pass
https://stackoverflow.com/questions/15548023/clang-optimization-levels
Android Things专题 1.前世今生
文| 谷歌开发人员技术专家, 物联网方向 (IOT GDE) 王玉成(York Wang) 2016 年 12 月,Google 公布了 Developer Preview 版的 Android Th ...
javascript用正則表達式检測username的合法性
在用户登录.用户注冊时经常须要对username如邮箱.手机号进行校验,一般经常使用表达式. 以下整理对邮箱和手机号的表达式校验: function checkUser(){ var userName ...
深入理解JVM(三)——垃圾收集策略具体解释
Java虚拟机的内存模型分为五个部分.各自是:程序计数器.Java虚拟机栈.本地方法栈.堆.方法区. 这五个区域既然是存储空间,那么为了避免Java虚拟机在执行期间内存存满的情况,就必须得有一个垃圾收 ...
触发JVM进行Full GC的情况及应对策略
堆内存划分为 Eden.Survivor 和 Tenured/Old 空间,如下图所示: 从年轻代空间(包括 Eden 和 Survivor 区域)回收内存被称为 Minor GC,对老年代GC称为M ...

Python 爬虫实例（11）—— 爬虫 苏宁易购

Python 爬虫实例（11）—— 爬虫 苏宁易购的更多相关文章

随机推荐

热门专题

Python 爬虫实例（11）—— 爬虫苏宁易购

Python 爬虫实例（11）—— 爬虫苏宁易购的更多相关文章