python使用sessions模拟登录淘宝

之前想爬取一些淘宝的数据，后来发现需要登录，找了很多的资料，有个使用request的sessions加上cookie来登录的，cookie的获取在登录后使用开发者工具可以找到。不过这个登录后获得的网页的代码是静态的，获取动态网页还得另寻他法，一般需要的数据可以在网页的源码中得到，但是你知道的，有些动态加载的就不是那么简单了，而且我发现这样获得的源码中，有些想要获取的数据的格式是经过改动的，比如我要某个商品的具体链接，发现并不能直接使用。总体而言，这是一次失败的尝试，不过倒是了解到使用sessions和cookies可以进到需要登录的网页，也算是一种方式吧。

记录一下失败的一次

import requests

import os

import json

from pyquery import PyQuery as pq

import re

import time

sessions = requests.session()

url = 'https://s.taobao.com/search?q=ipad'

sessions.headers['User-Agent'] = 'Mozilla/5.0 (Macintosh; Intel Mac OS X 10_9_2) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/34.0.1847.131 Safari/537.36'

sessions.headers['cookie']='miid=8428352431475518963; hng=CN***********; cna=IzulExo***************; thw=cn; __guid=15467**********; enc=Ubrfp%2******************************************************; t=5********************1e0; tracknick=%5*********3; lgc=40***3; tg=0; x=e%3D1%26p%3D*%26s%3D0%26c%3D0%26f%3D0%26g%3D0%26t%3D0%26__ll%3D-1%26_ato%3D0; cookie2=393e1f359e39e184059e8c87422bb5ce; v=0; _tb_token_=e7e035bee1ae8; _m_h5_tk=ebb49583b4434c3ff9f4bb277236a5d2_1541089384718; _m_h5_tk_enc=b0dd87431f8ade45b56bccb4982c0bf4; alitrackid=world.taobao.com; swfstore=29789; unb=3159140427; sg=374; _l_g_=Ug%3D%3D; skt=c9446f78d9091af3; cookie1=AHt5ehB%2FBw25k99NwMwTM4z3CWVA2J%2FVUVn4V3D2TMk%3D; csg=7b6476e0; uc3=vt3=F8dByRjNVxN9vRJQjTQ%3D&id2=UNGToApZ%2B2dYHA%3D%3D&nk2=sECE1uX4Wg%3D%3D&lg2=VFC%2FuZ9ayeYq2g%3D%3D; existShop=MTU0MTA4NzI2Ng%3D%3D; _cc_=Vq8l%2BKCLiw%3D%3D; dnk=%5Cu6C38%5Cu65E0%5Cu540D3; _nk_=%5Cu6C38%5Cu65E0%5Cu540D3; cookie17=UNGToApZ%2B2dYHA%'

for i in range(1):

    strs=str(i*44)

    urls=url+'&s='+strs

    html=sessions.get(urls).text

    doc=pq(html)

    doc=str(doc)

    os.chdir(r'G:\PS\PY')

    contentss=[]

    htmls=re.compile(r'p4pTags(.*?)"risk"')

    garbage=re.compile(r'itemlist(.*?)"risk"')

    gb=garbage.findall(doc,re.S|re.M)

    finhtml=htmls.findall(doc,re.S|re.M)

    finhtml=finhtml+gb

    print(len(finhtml))

    #提取信息的正则表达式

    raw_title=r'"raw_title":"(.*?)"'

    view_price= r'"view_price":"(.*?)"' #价格

    view_fee=r'"view_fee":"(.*?)"'      #折扣

    item_loc = r'"item_loc":"(.*?)"' #地区

    view_sales = r'"view_sales":"(.*?)"' #付款人数

    comment_count = r'"comment_count":"(.*?)"' #评论数

    detail_url=r'"detail_url":"(.*?)"'     #url       

    for html in finhtml:

        rtitle=re.findall(raw_title,html)

        price=re.findall(view_price,html)

        fee=re.findall(view_fee,html)

        loc=re.findall(item_loc,html)

        sales= re.findall(view_sales,html)

        comment=re.findall(comment_count,html)

        deurl=re.findall(detail_url,html)

        for rt,p,f,l,s,c,u in zip(rtitle,price,fee,loc,sales,comment,deurl):

            contentss.append({"raw_title":rt,"view_price":p,"view_fee":f,"item_loc":l,"view_sales":s,"comment_count":c,"detail_url":u})

    with open('ipad.json','a',encoding='utf-8') as file:

        file.write(json.dumps(contentss,indent=2,ensure_ascii=False))

    time.sleep(2)#访问间隔

python使用sessions模拟登录淘宝的更多相关文章

Python post请求模拟登录淘宝并爬取商品列表
一.前言大概是一个月前就开始做淘宝的爬虫了,从最开始的用selenium用户配置到selenium模拟登录,再到这次的post请求模拟登录.一共是三篇博客,记录了我爬取淘宝网的经历.期间也有朋友向我 ...
Python爬虫实战五之模拟登录淘宝并获取所有订单
经过多次尝试,模拟登录淘宝终于成功了,实在是不容易,淘宝的登录加密和验证太复杂了,煞费苦心,在此写出来和大家一起分享,希望大家支持. 温馨提示更新时间,2016-02-01,现在淘宝换成了滑块验证了 ...
Python 爬虫实战5 模拟登录淘宝并获取所有订单
经过多次尝试,模拟登录淘宝终于成功了,实在是不容易,淘宝的登录加密和验证太复杂了,煞费苦心,在此写出来和大家一起分享,希望大家支持. 本篇内容 python模拟登录淘宝网页获取登录用户的所有订单详情 ...
Python模拟登录淘宝
最近想爬取淘宝的一些商品,但是发现如果要使用搜索等一些功能时基本都需要登录,所以就想出一篇模拟登录淘宝的文章!看了下网上有很多关于模拟登录淘宝,但是基本都是使用scrapy.pyppeteer.sel ...
selenium跳过webdriver检测并模拟登录淘宝
目录简介编写思路使用教程演示图片源代码 @(文章目录) 简介模拟登录淘宝已经不是一件新鲜的事情了,过去我曾经使用get/post方式进行爬虫,同时也加入IP代理池进行跳过检验,但随着大型网 ...
Python模拟登陆淘宝并统计淘宝消费情况的代码实例分享
Python模拟登陆淘宝并统计淘宝消费情况的代码实例分享支付宝十年账单上的数字有点吓人,但它统计的项目太多,只是想看看到底单纯在淘宝上支出了多少,于是写了段脚本,统计任意时间段淘宝订单的消费情况,看 ...
selenium+python自动化84-chrome手机wap模式（登录淘宝页面）
前言 chrome手机wap模式登录淘宝页面,点击验证码无效问题解决. 切换到wap模式,使用TouchActions模块用tap方法触摸我的环境 chrome 62 chromedriver 2. ...
C# 脚本代码自动登录淘宝获取用户信息
C# 脚本代码自动登录淘宝获取用户信息最近遇到的一个需求是如何让程序自动登录淘宝, 获取用户名称等信息. 其实这个利用SS (SpiderStudio的简称) 实现起来非常简单. 十数行代码就可 ...
Python爬虫之定时抢购淘宝商品
Python爬虫之定时抢购淘宝商品 import time from selenium import webdriver import datetime class Spider: def __ini ...

随机推荐

使用pytorch完成kaggle猫狗图像识别
kaggle是一个为开发商和数据科学家提供举办机器学习竞赛.托管数据库.编写和分享代码的平台,在这上面有非常多的好项目.好资源可供机器学习.深度学习爱好者学习之用.碰巧最近入门了一门非常的深度学习框架 ...
JVM结构及堆的划分
一.JVM结构 1.类加载子系统与方法区类加载子系统负责从文件系统或者网络中加载Class信息,加载的类信息存放于一块称为方法区的内存空间.除了类的信息外,方法区中可能还会存放运行时常量池信息,包括 ...
log4j升级到logback
虽然现在log4j已经基本上不更新很久了,但实际上升级log4j到logback最大的难度并不在于本身的替换,而是现有大量的三方jar依然使用log4j,以至于无法100%的exclude掉,所以很有 ...
vue 起步
vue 官网目前最火的前端框架当属Vue.js了,很多使用过vue的程序员这样评价它,“vue.js兼具angular.js和react.js的优点,并剔除了它们的缺点”.授予了这么高的评价的vue ...
git初学
git在团队合作开发时是很有用的,SVN是集中式的代表,而git是分布式的代表,它分为代码区.暂存区.和本地库.在同一个团队中开发时,在代码存储中心(例如,码云.github)上创建一个库,用于储存和 ...
Python3 tkinter基础 Label justify 多行字符串左对齐
Python : 3.7.0 OS : Ubuntu 18.04.1 LTS IDE : PyCharm 2018.2.4 Conda ...
makefile基本操作
多数内容copy自youtube的一个视频:https://www.youtube.com/watch?v=E1_uuFWibuM 执行环境:原作者是在Linux下做的视频,而我使用的是win10,w ...
kubeadm 生成的token过期后，集群增加节点
通过kubeadm初始化后,都会提供node加入的token: You should now deploy a pod network to the cluster. Run "kubect ...
《OFFER14》14_CuttingRope
// 面试题14:剪绳子 // 题目:给你一根长度为n绳子,请把绳子剪成m段(m.n都是整数,n>1并且m≥1). // 每段的绳子的长度记为k[0].k[1].…….k[m].k[0]*k ...
【做题】BZOJ2534 L-gap字符串——调和级数
题意:给出一个字符串,问其中有多少个子串恰好为\(uvu\)的形式.其中,\(u\)非空,\(v\)的长度恰好为\(l\). \(n \leq 5 \times 10^4\) 我们设两个后缀的起点分别 ...

python使用sessions模拟登录淘宝

python使用sessions模拟登录淘宝的更多相关文章

随机推荐

热门专题