使用requests_html抓取数据

from requests_html import HTMLSession

import json

class YejiCollege:

    def __init__(self, url):

        self.url = url

        self.headers = {"User-Agent": ("Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/70.0.3538.67 Safari/537.36")}

    def get_response(self):

        session = HTMLSession()

        return session.get(self.url, headers=self.headers)

    def filter_info(self):

        html_data = self.get_response()

        # 从第三个P标签开始，获取虚假大学数据

        return html_data.html.find('div#data249708 p')[2:]

    @staticmethod

    def get_json(data):

        info = {}

        city = None

        for line in data:

            # 每个城市会显示为 <p><strong>北京：151所</strong></p>

            if 'strong' in line.html:

                # 拆分城市与虚假大学数量

                city, total_college = line.text.split('：')

                # 构造字典

                info[city] = dict(total=total_college, data=[])

                continue

            info[city]['data'].append(line.text)

        with open('colleges.json', 'w+', encoding='utf-8') as f:

            # ensure_ascii默认为True,json.dump后会被转码...

            f.write(json.dumps(info, ensure_ascii=False))

def run():

    url = 'http://www.gaosan.com/gaokao/249708.html'

    main = YejiCollege(url)

    data = main.filter_info()

    main.get_json(data)

if __name__ == '__main__':

    run()

结果：

  ... ... ,

  "陕西": {

    "total": "16所",

    "data": [

      "西安电子信息学院",

      "西安理工学院",

      "西安工商学院",

      "西安科技师范大学",

      "西安信息技术学院",

      "西安工商管理学院",

      "西安工业科技技术学院",

      "西安工业科技学院",

      "陕西国防工业技术学院",

      "陕西瀚林医科学院",

      "西安工业工程学院",

      "陕西工贸职业学院",

      "西安科技职业学院",

      "西安经济技术学院",

      "西安机电工程学院",

      "陕西科技管理学院"

    ]

  },

  "福建": {

    "total": "5所",

    "data": [

      "厦门师范学院",

      "福建海峡经贸技术学院",

      "福建经济贸易大学",

      "福建科技学院",

      "福建省轻工业学院"

    ]

  },

  ... ...

文章参考于微信公众号【清风Python】

使用requests_html抓取数据的更多相关文章

nodejs--实现跨域抓取数据
最近公司安排给我一个任务,抓取页面数据:http://survey.finance.sina.com.cn/static/20205/20131120.html?pid=20205&dpc=1 ...
java抓取网页数据，登录之后抓取数据。
最近做了一个从网络上抓取数据的一个小程序.主要关于信贷方面,收集的一些黑名单网站,从该网站上抓取到自己系统中. 也找了一些资料,觉得没有一个很好的,全面的例子.因此在这里做个笔记提醒自己. 首先需要一 ...
C# WebBrowser控件模拟登录抓取数据
参考博客:C#中的WebBrowser控件的使用参考博客:C#中利用WebBrowser控件,获得HTML源码一.问题点: 1.模拟登录后,如果带有嵌套的iframe嵌套,不好读取iframe内容 ...
PHP的cURL库：抓取网页，POST数据及其他,HTTP认证抓取数据
From : http://developer.51cto.com/art/200904/121739.htm 下面是一个小例程: ﹤?php// 初始化一个 cURL 对象$curl = curl_ ...
php中封装的curl函数(抓取数据)
介绍一个封闭好的函数,封闭了curl函数的常用步骤,方便抓取数据. 代码如下: <?php /** * 封闭好的 curl函数 * 用途:抓取数据 * edit by www.jbxue.com ...
php中CURL技术模拟登陆抓取数据实战，抓取某校教务处学生成绩。
这两天有基友要php中curl抓取教务处成绩的源码,用于微信公众平台的开发.下面笔者只好忍痛割爱了.php中CURL技术模拟登陆抓取数据实战,抓取沈阳工学院教务处学生成绩. 首先,教务处登录需要验证码 ...
【转】蓝牙4.0BLE cc2540 usb-dongle的 SmartRF Packet Sniffer 抓取数据方法--不错
原文网址:http://blog.csdn.net/mzy202/article/details/32408223 蓝牙4.0BLE cc2540 usb-dongle的 SmartRF Packet ...
.net处理页面的抓取数据
//要抓取数据的页面路径 string url = "http://www.scedu.net/banshi/used-car/lower-secondary-education/middl ...
windows环境下nutch2.x 在eclipse中实现抓取数据存进mysql详细步骤
nutch2.x 在eclipse中实现抓取数据存进mysql步骤最近在研究nutch,花了几天时间,也遇到很多问题,最终结果还是成功了,在此记录,并给其他有兴趣的人提供参考,共同进步. 对nutc ...

随机推荐

opencv配置经常遇到的错误
我们在运行一些书上的例子,经常会遇到以下的错误还有什么Assertion Failed错误.这些错误都是我运行浅墨书上的例子或者博客的例子上面的代码的错误,他自己也提了一下,但是说的不是特别的清楚, ...
python基础--内置函数map
num_1=[1,2,10,5,3,7] # num_2=[] # for i in num_1: # num_2.append(i**2) # print(num_2) # def map_test ...
基于Redis做内存管理
1 Redis存储机制: redis存储的数据类型包括,String,Hash,List,Set,Sorted Set,它内部使用一个redisObject对象来表示所有的key和value,这个对象 ...
.h与.cpp
本质上没什么区别. cpp:c plus plus,就表示为c++原文件. .h文件实现的功能是声明.cpp文件中需要使用的变量.函数及宏定义等. .h文件就像是一个接口,具体的实现可以在.cpp中, ...
css：鼠标点击出现有颜色的边框？如何解决
今天遇到上图这样出现有颜色的边框解决办法: css设置属性 outline:none;
LeetCode--054--区螺旋矩阵(java)
给定一个包含 m x n 个元素的矩阵(m 行, n 列),请按照顺时针螺旋顺序,返回矩阵中的所有元素. 示例 1: 输入: [ [ 1, 2, 3 ], [ 4, 5, 6 ], [ 7, 8, 9 ...
正则化的L1范数和L2范数
范数介绍:https://www.zhihu.com/question/20473040?utm_campaign=rss&utm_medium=rss&utm_source=rss& ...
C# 常用的ToString("xxxx")
Convert.ToDecimal("-123").ToString("#,#.##") 结果:-123 Convert.ToDecimal("-12 ...
luogu P1307 数字反转 x
题目描述给定一个整数,请将该数各个位上数字反转得到一个新数.新数也应满足整数的常见形式,即除非给定的原数为零,否则反转后得到的新数的最高位数字不应为零(参见样例2). 输入输出格式输入格式: 输入 ...
Netty学习笔记（一）
学习圣思园Netty笔记,个人理解 2.netty宏观理解-本节内容: 1.阶段性事件驱动,一个请求分为若干阶段处理,每个阶段根据情况合理分配线程去处理,各阶段间通信采用异步事件驱动方式. 2.net ...

使用requests_html抓取数据

使用requests_html抓取数据的更多相关文章

随机推荐

热门专题