requests + bs4 爬取豌豆荚所有应用的信息

1.分析豌豆荚的接口的规律

- 获取所有app的接口url

2.往每一个接口发送请求，获取json数据

解析并提取想要的数据
- app_data:
  - 1.图标
    
    app_img_url
2.名字

app_name

- 3.下载量

app_download_num

- 4.大小

app_size

- 5.简介

app_comment

- 6.详情页url

app_detail

mysql_control.py

import pymysql

class MySQL:

    def __init__(self):

        self.client = pymysql.connect(

            host='127.0.0.1',

            port=3306,

            user='tomjoy',

            password='123456',

            database='wandoujia',

            autocommit=True,

        )

        self.cursor = self.client.cursor(

            pymysql.cursors.DictCursor

        )

    def execute(self, sql, args):

        try:

            self.cursor.execute(sql, args)

        except Exception as e:

            print(e)

    def close(self):

        self.cursor.close()

        self.client.close()

main.py

import requests

import re

from bs4 import BeautifulSoup

from mysql_control import MySQL

# 1.发送请求：

def get_html(url):

    res = requests.get(url)

    return res

# 2.解析数据

def parse_data(data):

    soup = BeautifulSoup(data, 'lxml')

    # 获取所有的li标签，li中包含所有想要的数据

    li_list = soup.find_all(name='li')

    for li in li_list:

        # app详情url

        app_detail = li.find(name='a').attrs.get('href')

        print('详情url:', app_detail)

        # app图标url

        app_img_url = li.find(name='img').attrs.get('data-original')

        print('图标url:', app_img_url)

        # app名称

        app_name = li.find(name='img').attrs.get('alt')

        print('名称:', app_name)

        # 下载人数

        app_download_num = li.find(name='span', attrs={'class': 'install-count'}).text

        print('下载人数:', app_download_num)

        # 大小

        try:

            # 有可能匹配规则是错的或者没有大小，然后获取不到text文本

            app_size = li.find(name='span', attrs={'title': re.compile('MB')}).text

        except Exception as e:

            # 放弃匹配规则不一样的数据，默认为空字符串

            app_size = ''

        print('大小:', app_size)

        # 简介

        app_comment = li.find(name='div', attrs={'class': 'comment'}).text

        print('简介:', app_comment)

        print('*' * 100)

        yield app_name, app_detail, app_img_url, app_download_num, app_size, app_comment

        # app_data = f"""

        #     '名称:', {app_name},

        #     '详情url:', {app_detail},

        #     '图标url:', {app_img_url},

        #     '下载人数:', {app_download_num},

        #     '大小:', {app_size},

        #     '简介:', {app_comment}

        # """

        # save(app_data)

# 3.保存数据到数据库中

def save(generator_data, mysql_obj):

    for data in generator_data:

        print(data)

        sql = 'insert into wandoujia(app_name, app_detail, app_img_url, app_download_num, app_size, app_comment)' \

              ' values(%s, %s, %s, %s, %s, %s) '

        print(sql)

        mysql_obj.execute(sql, data)

if __name__ == '__main__':

    mysql_obj = MySQL()

    # 1.获取所有app的接口url

    for i in range(1,42):

        url = f'https://www.wandoujia.com/wdjweb/api/top/more?resourceType=0&page={i}&ctoken=mrci2hDXHNxavE42fJ85v3JE'

        # 获取响应数据

        res = get_html(url)

        # 将json数据转成字典

        res_dict = res.json()

        # 获取字典中data的值中的content的值

        data = res_dict.get('data').get('content')

        generator_data = parse_data(data)

        # 保存数据到数据库中

        save(generator_data, mysql_obj)

    mysql_obj.close()

requests + bs4 爬取豌豆荚所有应用的信息的更多相关文章

requests+bs4爬取豌豆荚排行榜及下载排行榜app
爬取排行榜应用信息爬取豌豆荚排行榜app信息 - app_detail_url - 应用详情页url - app_image_url - 应用图片url - app_name - 应用名称 - ap ...
python爬取豌豆荚中的详细信息并存储到SQL Server中
买了本书<精通Python网络爬虫>,看完了第6章,我感觉我好像可以干点什么:学的不多,其中的笔记我放到了GitHub上:https://github.com/NSGUF/PythonLe ...
requests bs4 爬取资讯图片
#!/usr/bin/env python # Version = 3.5.2 # __auth__ = '无名小妖' import requests from bs4 import Beautifu ...
[实战演练]python3使用requests模块爬取页面内容
本文摘要: 1.安装pip 2.安装requests模块 3.安装beautifulsoup4 4.requests模块浅析 + 发送请求 + 传递URL参数 + 响应内容 + 获取网页编码 + 获取 ...
python实战项目 — 使用bs4 爬取猫眼电影热榜（存入本地txt、以及存储数据库列表）
案例一: 重点: 1. 使用bs4 爬取 2. 数据写入本地 txt from bs4 import BeautifulSoup import requests url = "http:// ...
使用request+bs4爬取所有股票信息
爬取前戏我们要知道利用selenium是非常无敌的,自我认为什么反爬不反爬都不在话下,但是今天我们为什么要用request+bs4爬取所有股票信息呢?因为他比较原始,因此今天的数据,爬取起来也是比较 ...
requests+正则爬取豆瓣图书
#requests+正则爬取豆瓣图书 import requests import re def get_html(url): headers = {'User-Agent':'Mozilla/5.0 ...
requests+正则表达式爬取ip
#requests+正则表达式爬取ip #findall方法,如果表达式中包含有子组,则会把子组单独返回出来,如果有多个子组,则会组合成元祖 import requests import re def ...
爬虫系列4：Requests+Xpath 爬取动态数据
爬虫系列4:Requests+Xpath 爬取动态数据 [抓取]:参考前文爬虫系列1:https://www.cnblogs.com/yizhiamumu/p/9451093.html [分页]:参 ...

随机推荐

51nod 1686 第K大区间【离散化+二分】
题目链接: http://www.51nod.com/onlineJudge/questionCode.html#!problemId=1686 题意: 定义一个区间的值为其众数出现的次数. 现给出n ...
POLARDB v2.0 技术解读
点击观看“POLARDB 2.0 升级发布会”:https://yq.aliyun.com/live/1136 回顾POLARDB 1.0 POLARDB 1.0 主要的改进包括采用了计算存储分离的架 ...
云上快速搭建Serverless AI实验室
Serverless Kubernetes和ACK虚拟节点都已基于ECI提供GPU容器实例功能,让用户在云上低成本快速搭建serverless AI实验室,用户无需维护服务器和GPU基础运行环境,极大 ...
C# Dapper 基本使用增删改查事务
来源:https://blog.csdn.net/Tomato2313/article/details/78880969 using DapperTest.Models; using System.C ...
【t079】火星上的加法运算
Time Limit: 1 second Memory Limit: 128 MB [问题描述] 最近欢欢看到一本有关火星的书籍,其中她被一个加法运算所困惑,由于她的运算水平有限,想向你求助,作为一名 ...
const（每个对象中的常量）, static const（类的编译时常量）
1 每个对象中的常量 --- const数据成员 const限定,意味着“在该对象生命周期内,它是一个常量”. 关键字const 使被限定的量为常量在该类的每个对象中,编译器都为其const数据成员 ...
Vue自定义指令配置修饰符和传参
一和二,请参考https://www.cnblogs.com/zui-ai-java/p/11109213.html 三.index.html <!DOCTYPE html> <ht ...
win2d 渐变颜色
本文告诉大家如何在 win2d 使用渐变颜色线条渐变在 UWP 的 Win2d 使用渐变颜色需要 CanvasLinearGradientBrush 做颜色,本文告诉大家如何在 win2d 使用 ...
解析PHP跳出循环的方法以及continue、break、exit的区别介绍
本篇文章是对PHP跳出循环的方法以及continue.break.exit的区别进行了详细的分析介绍,需要的朋友参考下 PHP中的循环结构大致有for循环,while循环,do{} while 循 ...
P2P公司是如何进行风险管理的
关于P2P的风控很多人仍然是一知半解,甚至不少长期P2P圈内的资深玩家对此也是“既没吃过猪肉,也没见过猪跑”. 但是不可否认的是,作为一种跳过银行间接贷款融资模式的.一种在借款人和出借人之间直接发 ...

requests + bs4 爬取豌豆荚所有应用的信息

requests + bs4 爬取豌豆荚所有应用的信息的更多相关文章

随机推荐

热门专题