python 使用selenium和requests爬取页面数据

目的：获取某网站某用户下市场大于1000秒的视频信息

1.本想通过接口获得结果，但是使用post发送信息到接口，提示服务端错误。

2.通过requests获取页面结果，使用html解析工具，发现麻烦而且得不到想要的结果

3.直接通过selenium获取控件的属性信息，如图片、视频地址，再对时间进行筛选。将信息保存到以id命名的文件夹下

# -*- coding:utf-8 -*-

from selenium import webdriver

import sys,os,requests,shutil

class GetUserVideo():

    def __init__(self,driver,id):

        self.id = str(id)

        self.driver = driver

        self.base_url = "http://www.xxxxx.com/user/%s?t=2"%(self.id)

    def get_pagecounts(self):

        #获取页面数

        self.driver.get(self.base_url)

        page_counts=int(self.driver.find_elements_by_xpath("//div[@class='page']/a")[-2].text)+1

        return page_counts

    def get_video(self,driver,page,f):

        video_times = driver.find_elements_by_xpath("//i[@class='continue_time']")

        video_urls = driver.find_elements_by_xpath("//div[@class='video']/a[@class='url']")

        video_imgs = driver.find_elements_by_xpath("//a[@class='url']/img")

        length = len(video_times)

        for i in range(length):

            " 当前页面内筛选出时长大于1000秒的，并将图片、时长、地址保存到指定目录"

            time_list = video_times[i].text.split(":")

            time_count = int(time_list[0]) * 3600 + int(time_list[1]) * 60 + int(time_list[2])

            if time_count > 1000:

                video_time = video_times[i].text

                video_url = video_urls[i].get_attribute('href')

                video_img = video_imgs[i].get_attribute("src")

                img_name = str(page) + "_" + str(i)+"_"+os.path.basename(video_img)

                f.write(img_name + "\t")

                f.write(video_time + "\t")

                f.write(video_url + "\n")

                img_url = requests.get(video_img)

                with open(self.id + "/" + img_name, "wb") as b:

                    b.write(img_url.content)

    def test(self):

        "如果存在同名文件夹，就删除"

        if os.path.exists(self.id):

            shutil.rmtree(self.id)

        os.mkdir(self.id)

        driver = self.driver

        page_counts=self.get_pagecounts()

        f=open(self.id+"/video.txt","w")

        for page in range(1,page_counts):

            detail_url = "&page=%s" % page

            driver.get(self.base_url+detail_url)

            self.get_video(driver,page,f)

        f.close()

        driver.quit()

if __name__=="__main__":

    path = sys.path[0].split("/")

    index = path.index("SeleniumOfJenkins") + 1

    ph_driver = "/driver/phantomjs-2.1.1-macosx/bin/phantomjs"

    if index == len(path):

        driver_path = sys.path[0] + ph_driver

    else:

        driver_path = "/".join(path[:index]) + ph_driver

    driver = webdriver.PhantomJS(executable_path=driver_path)

    driver.maximize_window()

    driver.implicitly_wait(10)

    test = GetUserVideo(driver,123456)

    test.test()

python 使用selenium和requests爬取页面数据的更多相关文章

Python爬虫入门——使用requests爬取python岗位招聘数据
爬虫目的使用requests库和BeautifulSoup4库来爬取拉勾网Python相关岗位数据爬虫工具使用Requests库发送http请求,然后用BeautifulSoup库解析HTML文 ...
python 爬虫之requests爬取页面图片的url，并将图片下载到本地
大家好我叫hardy 需求:爬取某个页面,并把该页面的图片下载到本地思考: img标签一个有多少种类型的src值?四种:1.以http开头的网络链接.2.以“//”开头网络地址.3.以“/”开头绝对 ...
python（27）requests 爬取网页乱码，解决方法
最近遇到爬取网页乱码的情况,找了好久找到了种解决的办法: html = requests.get(url,headers = head) html.apparent_encoding html.enc ...
python+requests抓取页面图片
前言: 学完requests库后,想到可以利用python+requests爬取页面图片,想到实战一下.依照现在所学只能爬取图片在html页面的而不能爬取由JavaScript生成的图片,所以我选取饿 ...
[实战演练]python3使用requests模块爬取页面内容
本文摘要: 1.安装pip 2.安装requests模块 3.安装beautifulsoup4 4.requests模块浅析 + 发送请求 + 传递URL参数 + 响应内容 + 获取网页编码 + 获取 ...
scrapy中使用selenium来爬取页面
scrapy中使用selenium来爬取页面 from selenium import webdriver from scrapy.http.response.html import HtmlResp ...
爬虫-----selenium模块自动爬取网页资源
selenium介绍与使用 1 selenium介绍什么是selenium?selenium是Python的一个第三方库,对外提供的接口可以操作浏览器,然后让浏览器完成自动化的操作. sel ...
一个月入门Python爬虫，轻松爬取大规模数据
Python爬虫为什么受欢迎如果你仔细观察,就不难发现,懂爬虫.学习爬虫的人越来越多,一方面,互联网可以获取的数据越来越多,另一方面,像 Python这样的编程语言提供越来越多的优秀工具,让爬虫变得 ...
Python3 Scrapy + Selenium + 阿布云爬取拉钩网学习笔记
1 需求分析想要一个能爬取拉钩网职位详情页的爬虫,来获取详情页内的公司名称.职位名称.薪资待遇.学历要求.岗位需求等信息.该爬虫能够通过配置搜索职位关键字和搜索城市来爬取不同城市的不同职位详情信息, ...

随机推荐

循环队列 c 实现！！！！
上数据结构课的时候老师让写了一个循环队列子系统. 代码如下: #include<stdio.h> #include<malloc.h> #define MAXLEN 100 # ...
jenkins自动化打包部署
请参考: http://m.blog.csdn.net/article/details?id=50518959 1.启动 jenkins.war ,打开首页 192.168.158.129:8080 ...
SharePoint的安装和配置-PowerShell
1. 引入SPModule组件 Import-Module SPModule.misc Import-Module SPModule.setup 需要将执行策略修改为不限制 2. 无人值守安装Shar ...
jquery 中事件
jQuery 事件 - submit() 方法定义和用法当提交表单时,会发生 submit 事件. 该事件只适用于表单元素. submit() 方法触发 submit 事件,或规定当发生 subm ...
Ubuntu:系统启动服务
系统启动服务针对Ubuntu 5级别服务的说明安装sysv-rc-conf sudo apt-get install sysv-rc-conf acpi-support 高级电源管理支持 acpi ...
内网dns劫持
进行内网的dns劫持呢 ---> 我们需要用到ettercap 和ettercap内置的工具dns_spoof 1.我们需要开启ip转发 echo >/proc/sys/net/ipv4/ ...
ztree树形菜单的增加删除修改和换图标
首先需要注意一点,如果有研究过树形菜单,就会发现实现删除和修改功能特别简单,但是增加却有一点复杂.造成这个现象是ztree树形菜单的历史遗留问题.大概是之前的版本没有增加这个功能,后来的版本加上了这个 ...
Ubuntu16.04 和 hadoop2.7.3环境下 hive2.1.1安装部署
参考文献: http://blog.csdn.NET/reesun/article/details/8556078 http://blog.csdn.Net/zhongguozhichuang/art ...
QT 5.4.1 for Android Windows环境搭建
QT 5.4.1 for Android Windows环境搭建 2015-5-13 目录一.参考文章: 二.准备软件: 三.安装准备好的软件: 四.配置Qt 5.4.1 for Android 五 ...
linux学习——sed工具
命令格式: sed [-nefr] [动作] 1.sed可以分析标准输入(STDIN)的数据,然后将数据处理后,再将他输出到标准输出(STDOUT),他有替换.删除.新增.选定特定行等处理功能.sed ...

python 使用selenium和requests爬取页面数据

python 使用selenium和requests爬取页面数据的更多相关文章

随机推荐

热门专题