【爬虫小程序：爬取斗鱼所有房间信息】Xpath

# 本程序亲测有效,用于理解爬虫相关的基础知识，不足之处希望大家批评指正
from selenium import webdriver

import time

class Douyu:

    """爬取斗鱼房间信息"""

    def __init__(self):

        # 爬取目标

        self.url = 'https://www.douyu.com/directory/all'

        # 获取浏览器对象

        self.driver = webdriver.Chrome()

    def get_element_list(self):

        """获取数据"""

        # 定位数据节点

        li_list = self.driver.find_elements_by_xpath('//ul[@id="live-list-contentbox"]/li')

        content_list = list()

        for li in li_list:  # 此时得到的是一条条的elememt，html节点

            # 我们要获取li中的那些数据呢？

            # 房间号：，主播id：,房间名：，粉丝数：，房间链接：等等根据业务需要获取

            # 成对出现的数据，所以选择使用字典保存每个房间的数据信息

            item = dict()

            item["room_id"] = li.find_element_by_xpath('./a').get_attribute('data-rid')

            item["auther"] = li.find_element_by_xpath('.//span[@class="dy-name ellipsis fl"]').text

            item["room_title"] = li.find_element_by_xpath('./a').get_attribute('title')

            item["fans_count"] = li.find_element_by_xpath('.//span[@class="dy-num fr"]').text

            item["room_link"] = li.find_element_by_xpath('./a').get_attribute('href')

            print(item)

            # 此时单个房间的信息已经封装完毕

            # 应该将所有房间的信息封装起来，便于随时取用，由于每个房间信息相当于一个元素，所以我们可以用列表或者元组来保存

            content_list.append(item)  #　此时我们的到的只是一页的数据，如何的到所有数据呢？或者说怎样访问下一页？

            # print(content_list)

        # 获取下一页按钮元素

        next_url = self.driver.find_elements_by_xpath('//a[@class="shark-pager-next"]')[0]

        # 注意：这里为什么用的是elements而不是element，原因是：如果我们获取到最后一页时：这个下一页按钮就不存在了，

        # 用element的话就会报错，用ｅｌｅｍｅｎｔｓ就不会报错

        # 因为ｅｌｅｍｅｎｔｓ获取到的是一个列表，而这个列表就一个元素，所以我们就直接取列表的第0位就可以了

        print(next_url)

        # 将获取到的数据返回

        return content_list,next_url

    def save_contents(self,content_list):

        """保存数据"""

        pass

    def run(self):  # 主函数逻辑

        try:

            # 向目标发起访问

            self.driver.get(self.url)

            # 获取数据

            content_list,next_url = self.get_element_list()  # 接收函数返回的结果

            # 保存数据

            self.save_contents(content_list)

            while next_url is not None:

                # 访问下一页

                next_url.click()  # 点击下一页就相当于向一个新的页面发起请求

                # 跳转到下一页之后，等待页面加载完毕，否则获取不到数据，然后报错

                time.sleep(3)

                # 获取数据

                content_list,next_url = self.get_element_list()  # 接收函数返回的结果

                # 保存数据

            self.save_contents(content_list)

        except Exception as e:

            # 退出浏览器

            self.driver.close()

        else:

            # 退出浏览器

            self.driver.close()

if __name__ == '__main__':

    # 创建对象

    douyu = Douyu()

    # 运行程序

    douyu.run()

【爬虫小程序：爬取斗鱼所有房间信息】Xpath的更多相关文章

【爬虫小程序：爬取斗鱼所有房间信息】Xpath(协程池版)
# 本程序亲测有效,用于理解爬虫相关的基础知识,不足之处希望大家批评指正 from gevent import monkey monkey.patch_all() from gevent.pool i ...
【爬虫小程序：爬取斗鱼所有房间信息】Xpath(线程池版)
# 本程序亲测有效,用于理解爬虫相关的基础知识,不足之处希望大家批评指正 from queue import Queue import requests from lxml import etree ...
【爬虫小程序：爬取斗鱼所有房间信息】Xpath(多线程版)
# 本程序亲测有效,用于理解爬虫相关的基础知识,不足之处希望大家批评指正 from queue import Queue import requests from lxml import etree ...
【爬虫小程序：爬取斗鱼所有房间信息】Xpath(多进程版)
# 本程序亲测有效,用于理解爬虫相关的基础知识,不足之处希望大家批评指正 import requests from lxml import etree from multiprocessing imp ...
基于webmagic的爬虫小应用--爬取知乎用户信息
听到“爬虫”,是不是第一时间想到Python/php ? 多少想玩爬虫的Java学习者就因为语言不通而止步.Java是真的不能做爬虫吗? 当然不是. 只不过python的3行代码能解决的问题,而Jav ...
[python爬虫] Selenium定向爬取PubMed生物医学摘要信息
本文主要是自己的在线代码笔记.在生物医学本体Ontology构建过程中,我使用Selenium定向爬取生物医学PubMed数据库的内容. PubMed是一个免费的搜寻引擎,提供生物医学方 ...
python爬虫实战之爬取智联职位信息和博客文章信息
1.python爬取招聘信息简单爬取智联招聘职位信息 # !/usr/bin/env python # -*-coding:utf-8-*- """ @Author ...
Python爬虫基础--分布式爬取贝壳网房屋信息(Client)
1. client_code01 2. client_code02 3. 这个时候运行多个client就可以分布式进行数据爬取.
selenium,webdriver爬取斗鱼主播信息实操
from selenium import webdriver import time from bs4 import BeautifulSoup class douyuSelenium(): #初始化 ...

随机推荐

div拖拽
分析逻辑关于该过程有一下3个动作 1.点击 2.移动 3.释放鼠标 1.点击时获得点击下去的一点的坐标(盒子的top,left),去除默认事件. 2.移动时不断改变盒子的坐标.(移动的dom目标应该为 ...
问题.beego路由设置及请求参数传递
最近项目组安排将一组Lua实现的web服务端代码重构成Go实现,所以顺便学习了下Lua和Go,这里记录下在尝试重构的过程中遇到的几个问题. 1.beego路由设置路由设置简单说下,主要是调用了pac ...
RestTemplate 1
@Inject private RestTemplate restTemplate; @SuppressWarnings("unchecked") public Use ...
codeforces #583 problem D(搜索好题)
题目大意:在一个已经有障碍的地图上,设置尽可能少的障碍使得(1,1)无法到达(n,m),行进路线位向下或向右. 数据范围:n*m<=1e6 解题思路:答案一定是小于等于2的,因为可以直接阻碍(1 ...
adb logcat命令
1.http://blog.csdn.net/tumuzhuanjia/article/details/39555445 2.http://blog.csdn.net/xyz_lmn/article/ ...
【LeetCode】215-数组中的第K个最大元素
题目描述在未排序的数组中找到第 k 个最大的元素.请注意,你需要找的是数组排序后的第 k 个最大的元素,而不是第 k 个不同的元素. 示例 1: 输入: [3,2,1,5,6,4] 和 k = 2 ...
SpringDataJpa——JpaRepository查询功能（转）
1.JpaRepository支持接口规范方法名查询.意思是如果在接口中定义的查询方法符合它的命名规则,就可以不用写实现,目前支持的关键字如下. Keyword Sample JPQL snippet ...
CLR中你想知道的事
CLR是什么? CLR 公共语言运行时,是一个可由多个语言共同使用的运行环境,核心(内存管理,程序集加载,安全性,异常处理和多线程) Visual Studio是一种编译器,编译器也可称为语法检查器和 ...
〈一〉ElasticSearch的介绍
目录什么是ElasticSearch 核心能力 ES的搜索核心搜索引擎选择搜索的处理补充: 小节总结: 基本学习环境搭建如何操作ElasticSearch 下载.安装和运行(Based Wi ...
DevExpress的TextEdit限制输入内容的格式，比如只能输入数字
场景 Winform控件-DevExpress18下载安装注册以及在VS中使用: https://blog.csdn.net/BADAO_LIUMANG_QIZHI/article/details/1 ...

【爬虫小程序：爬取斗鱼所有房间信息】Xpath

【爬虫小程序：爬取斗鱼所有房间信息】Xpath的更多相关文章

随机推荐

热门专题