本文仅供学习交流使用,如侵立删!demo下载见文末

车主之家全系车型(包含历史停售车型)配置参数爬虫

先上效果图

环境:

win10 ,Contos7.4

python3.9.4

pycharm2021

retrying=1.3.3

requests=2.22.0

fake_useragent

抓包分析

车主之家安卓APP选择车型后打开配置页面闪退,放弃APP抓包:

踏个坑,车主之家APP车型参数配置页面打开就闪退,刚开始还以为是机型不适配的问题,后来陆续的换了好几台手机都是闪退,那应该就是一个bug。这儿浪费了很长时间!!!

web页面抓包:

web页面也没有明显的数据接口,初步分析数据应该是通过js动态加载(同汽车之家详细可参考:汽车之家车型参数爬虫

果然和汽车之家是一个套路,而且还没有字体加密~~~哈哈哈,那就简单多了

获取所有品牌数据

接口地址:
# 全系品牌信息
https://****.****.com/?&extra=getBrandStyle
# 根据品牌ID 获取所有车型信息
model_url = f'http://****.com/app.php?&type=allStyle&brandId'
    def get_brand(self, brand_url, model_url):
"""
第一步 获取所有的车型id
"""
# 全系品牌信息
brand_res = self._parse_url(url=brand_url)
# 提取所有品牌数据
brandIds = jsonpath(brand_res.json(), '$..list') if jsonpath(brand_res.json(), '$..list') else []
for brandId in brandIds:
for brand in brandId:
print(f'品牌:{brand["title"]} 数据获取中')
alpha = brand['alpha'] # 首字母
title = brand['title'] # 品牌
brand_id = brand['brandId'] # 品牌id
origin = brand['origin'] # 产地
# 根据品牌ID 获取所有车型信息
model_res = self._parse_url(url=model_url)
# 提取所有车型信息
styles = jsonpath(model_res.json(), '$..style')[0] if jsonpath(model_res.json(), '$..style') else []
for style in styles:
model_id = style.get('id') # 车型id
model_name = style.get('name') # 车型名称
img = style.get('img') # 车型图片
yield alpha, title, brand_id, origin, model_name, model_id, img


获取车型参数配置json

接口地址:https://www.****.com/{model_id}/options/
    def parameter_configuration_html(self, model_id, file_name):
"""
第二步:获取车型参数配置网页源码
"""
# 请求车型参数页面
response = self._parse_url(url)
text = str(response.content, encoding="utf-8")
configuration = '车型参数json'
if not os.path.exists(configuration):
os.makedirs(configuration) # 提取出车型的参数数据json保存到文件
json_data = ""
json_config = re.search('var json_config = (.*?)};', text)
if json_config:
# print(config.group(0))
json_data = json_data + json_config.group(0)
json_car = re.search('var json_car = (.*?)}];', text)
if json_car:
# print(option.group(0))
json_data = json_data + json_car.group(0) with open(f'{configuration}/{file_name}', 'w', encoding='utf-8') as f:
f.write(json_data)


数据存储

    def save_xls(self):
"""
第四步 保存数据
"""
# 写入表头 startRow行数 cols列数 co标题
# 计算起止行号
endRowNum = startRow + len(carItem['车型ID']) # 车辆款式记录数
for row in range(startRow, endRowNum):
for col in carItem:
try:
context = str(carItem[col][row - startRow])
colNum = Header[col] # 根据项目名称查询列数
except:
continue
if not context:
context = '-'
# 写入数据 row行 colNum列 context内容
worksheet.write_string(row, colNum, context)
print(f'第:{count}条数据插入成功')
count += 1
else:
startRow = endRowNum
workbook.close()

入口

    @run_time
def run(self):
# 第一步 获取所有的车型id
for alpha, title, brand_id, origin, model_name, model_id, img in self.get_brand():
# 首字母、品牌、品牌id、产地、车型id、车型名称、车型图片
print(alpha, title, brand_id, origin, model_name, model_id, img)
exit()
# 判断是否获取过
if self.keep_records(model_id=model_id, vali=True):
print(f'数据获取过,跳过。')
continue
file_name = f'{alpha}-{title}-{brand_id}-{model_name}-{model_id}'
file_name = file_name.replace('/', ' ')
# 第二步 获取车型参数配置网页源码
self.parameter_configuration_html(model_id=model_id, file_name=file_name)
# 第三步 保存获取记录
self.keep_records(model_id=model_id)
# time.sleep(random.randint(1, 3))

效果


DEMO下载

https://download.csdn.net/download/qq_38154948/85001346


本文仅供学习交流使用,如侵立删!

Python 车主之家全系车型(包含历史停售车型)配置参数爬虫的更多相关文章

  1. Python 汽车之家 全系车型参数(包含历史停售车型) 最全

    本文仅供学习交流使用,如侵立删!联系方式及demo下载见文末 汽车之家2021 全系车型参数(包含历史停售车型) 2021.10.21更新 增加参数:电动扰流板.无框设计车门.隐藏电动门把手.自动驾驶 ...

  2. Python 爬取途虎养车 全系车型 轮胎 保养 数据

    Python 爬取途虎养车 全系车型 轮胎 保养 数据 2021.7.27 更新 增加标题.发布时间参数 demo文末自行下载,需要完整数据私聊我 2021.2.19 更新 增加大保养数据 2020. ...

  3. Python 懂车帝全车系销量排行榜

    本文所有教程及源码.软件仅为技术研究.不涉及计算机信息系统功能的删除.修改.增加.干扰,更不会影响计算机信息系统的正常运行.不得将代码用于非法用途,如侵立删! Python 懂车帝全车系销量排行榜 需 ...

  4. python的库小全

    环境管理 管理 Python 版本和环境的工具 p – 非常简单的交互式 python 版本管理工具. pyenv – 简单的 Python 版本管理工具. Vex – 可以在虚拟环境中执行命令. v ...

  5. python学习笔记比较全

    注:本笔记基于python2.6而编辑,尽量的偏向3.x的语法 Python的特色 1.简单 2.易学 3.免费.开源 4.高层语言: 封装内存管理等 5.可移植性: 程序如果避免使用依赖于系统的特性 ...

  6. iNeuOS云操作系统,.NET Core全系打造

    iNeuOS云操作系统,.NET Core全系打造 目录 一.演示地址... 2 二.技术体系... 2 三.iNeuOS整体介绍... 2 四.iNeuView概述... 3 五.iNeuView操 ...

  7. Python.Django视频教程(全13集)

    Python.Django视频教程(全13集)教程目录: 下载地址:http://www.fu83.cn/thread-205-1-1.html

  8. Python tab 命令补全,以及 vim 补全

    在python 命令行中,使用补全 python 查看 packages 的目录 可用 sys.path 查看. /usr/lib/python2.7/site-packages vim tab.py ...

  9. python中TAB补全

    tab补全的代码文件tab.py #!/usr/bin/env python # python startup file import sys import readline import rlcom ...

随机推荐

  1. 8.0 vue cli自定义页面

    1.新建a.html(public文件夹下)文件,并设定div的id="a" <!DOCTYPE html> <html lang=""> ...

  2. CentOS下sudo的使用和sudoers配置

    一.sudo命令 sudo [参数选项] 命令 参数选项 -l:列出目前用户可执行与无法执行的指令: -v:延长密码有效期限5分钟: -u<用户>:以指定的用户作为新的身份.若不加上此参数 ...

  3. 翻页组件page-flip调用问题

    翻页组件重新调用解决方案 翻页组件:page-flip import { PageFlip } from 'page-flip' pagefile() { //绘制翻页 this.pageFlip = ...

  4. Python汉诺塔求解

    1 def hanoi(n,a,b,c): 2 3 if(n>0): 4 5 hanoi(n-1,a,b,c) 6 7 print("Move disc no:%d from pile ...

  5. 【Unity Shader学习笔记】Unity基础纹理-渐变纹理

    纹理可以用来存储任何表面属性. 可以通过使用渐变纹理来实现插画风格的渲染效果. 这项技术是由Valve公司提出的.Valve使用它来渲染游戏中具有插画风格的角色. 我们使用半兰伯特模型计算漫反射. 因 ...

  6. 差分优化建边(Tax)

    [Luogu P6822PA2012]Tax] (http://www.luogu.com.cn/problem/P6822") All right. Let's go! 题目描述 给出一个 ...

  7. npm run serve修改为npm run dev

    找到package.json文件,打开文件找到  "serve": "vue-cli-service serve"  这一行,把前面的 serve 修改 dev ...

  8. 7. Docker CI、CD

    在上图这个新建的docker-compose.yml文件中把刚才的代码粘贴进去. 可把上述文件保存后,然后到/etc/ssh/sshd_config文件中更改下对应的端口号即可. 然后重新启动sshd ...

  9. c++ 乘法逆元

    主要参考:OI-WIKI 为什么要逆元 当一个题目让你求方案数时常要取余,虽然 \((a+b)\% p=(a\% p+b\% p)\%p\) \((a-b)\% p=(a\% p-b\% p)\%p\ ...

  10. 3D大场景展示功能你了解多少?见详解!

    裸眼3D技术的出现打破了真实与虚拟的界限,人们不仅希望能够体验奇妙的虚拟场景,也希望足不出户在短短几分钟内就能看到遍布各地的场景,希望能实时对接关键数据. 裸眼3D技术的出现打破了真实与虚拟的界限,人 ...