pyppeteer的使用

安装

  • 属于第三方模块进行安装. pip install pyppeteer

  • 在Linux中,如果权限不够则加上. sudo pip install pyppeteer

使用

使用今日头条作为demo

from pyppeteer import launch
import asyncio

async def main(timeout=30):# 设定时间超时, 默认是30秒
   # async 用来申明一个函数是一个异步函数
   browser = await launch(headless=True, args=["--no-sandbox"])
   # 参数说明:
   # headless 参数设为False,变为有头模式
   # Pyppeteer 支持字典和关键字传递参数
   page = await browser.newPage()
   
   # 设置页面大小
   await page.setViewport(viewport={"width":1280, "height":800})
   
   # 是否启用JS, enabled设为False,则无渲染效果
   await page.setJavaScriptEnabled(enabled=True)
   
   # 超时时间设置
   res = await page.goto(url=url, options={"timeout":1000})
   # 响应头
   resp_headers = res.headers
   # 响应状态
   resp_status = res.status
   
   # 等待
   await asynico.sleep(2)
   # 第二种方法
   while not await page.querySelector(".t"):
       pass
   
   # 滚动到页面底部
   await page.evaluate('windows.scrollBy(0,document.body.scrollHeight)')
   
   # 截图报存图片
   await page.screenshot({"path": "toutiao.png"})
   
   # 获取cookie
   print(await page.cookies())  
   
   # 打印页面文本信息
   print(await page.content())
   
   # 在页面上执行js脚本
   dimensions = await page.evaluate(pageFunction='''() => {
          return {
              width: document.documentElement.clientWidth, // 页面宽度
              height: document.documentElement.clientHeight, // 页面高度
              deviceScaleFactor: window.devicePixelRatio, // 像素比 1.0000000149011612
          }
      }''', force_expr=False)  # force_expr=False 执行的是函数
   print(dimensions)
   # 只获取文本 执行 js 脚本 force_expr 为 True 则执行的是表达式
   content = await page.evaluate(pageFunction='document.body.textContent', force_expr=True)
   print(content)

   # 打印当前页标题
   print(await page.title())\
   
   # 抓取其他信息
   """
  1.选择器, Page.querySelector()
  2.选择器, Page.querySelectorAll()
  3.xpath表达式, Page.xpath()
  """
   # 使用querySelector()
   element = await page.querySelector(".feed-infinite-wrapper > ul>li") # 只抓取一个
   print(element)
   
   # 获取所有的文本信息, 执行js代码
   content = await page.querySelectorAll('(element) => element.textContent', element)
   print(content)
   
   # 使用xpath
   # elements = await page.xpath('//div[@class="title-box"]/a')
   # 使用选择器全选
   elements = await page.querySelectorAll(".title-box a")
   for item in elements:
       print(await item.getProperty("textContent"))
       # 获取文本信息
       title = await (await item.getProperty("textContent")).jsonValue()
       # 获取连接
       link = await (await item.getProperty("href")).jsonValue()
       print(title)  
       print(link)
   # 关闭浏览器
   await browser.close()  
  • 如何启动程序

  • 1.创建一个event_loop对象

       loop = asyncio.get_event_loop()
  • 2.启动运行

       loop.run_until_complete(main())

模拟键盘输入

# 模拟输入 账号密码  {'delay': rand_int()} 为输入时间
   await page.type('#TPL_username_1', "sadfasdfasdf")
   await page.type('#TPL_password_1', "123456789", )
   
   await page.waitFor(1000)
   await page.click("#J_SubmitStatic")
使用tkinter获取页面高度宽度
def screen_size():
   """使用tkinter获取屏幕大小"""
   import tkinter
   tk = tkinter.Tk()
   width = tk.winfo_screenwidth()
   height = tk.winfo_screenheight()
   tk.quit()
   return width, height
针对iframe操作
  • page.frames获取所有的iframe列表,需要判断操作的是哪一个iframe跟操作page一样

from pyppeteer import launch
import asyncio

async def main(url):
   w = await launch({"headless":False, "args":["--no-sandbox"]})
   page = await w.newPage()
   await page.setViewport({"width":1366, "height":800})
   await page.goto(url)
   try:
       await asyncio.sleep(1)
       frame = page.frames
       print(frame)
       
       title = await frame[1].title()
       print(title)
       
       await asyncio.sleep(1)
       login = await frame[1].querySelector('#switcher_plogin')
       print(login)
       
       await login.click()
       await asyncio.sleep(5)
   except Exception as e:
       print(e)
   for page in await w.pages():
       await page.close()
   await w.close()

asyncio.get_event_loop().run_until_complete(main("https://i.qq.com/?rd=1"))
# asyncio.get_event_loop().run_until_complete(main("https://www.gushici.com/"))

大部分借鉴与别人,目前觉得模拟器爬虫还是比较慢的,静待大家的创新。

pyppeteer的使用的更多相关文章

  1. pyppeteer(python版puppeteer)基本使用

    一.前言 以前使用selenium的无头浏览器,自从phantomjs2016后慢慢不更新了之后,selenium也开始找下家,这时候谷歌的chrome率先搞出来无头浏览器并开放了各种api,随后fi ...

  2. pyppeteer 报错-无法连接到浏览器

    问题 程序报错: Failed to connect to browser port: http://127.0.0.1:57899/json/version 原因 虽然pyppeteer在首次启动时 ...

  3. pyppeteer爬虫例子

    如果在centos上使用,需要安装下面的依赖 yum install pango.x86_64 libXcomposite.x86_64 libXcursor.x86_64 libXdamage.x8 ...

  4. pyppeteer使用笔记

    pyppeteer -- python版本的puppeteer,一个强大的chronium headless浏览器API 最近搞天猫用了一波儿,记录一下. 先上文档: https://miyakogi ...

  5. pyppeteer初尝滋味

    最近在爬几个电商平台网站用的selenium一登录就会有验证,目前这些网站对selenium检测很严格 因为不少大网站有对selenium的js监测机制.比如navigator.webdriver,n ...

  6. 网络爬虫之使用pyppeteer替代selenium完美绕过webdriver检测

    1引言 曾经使用模拟浏览器操作(selenium + webdriver)来写爬虫,但是稍微有点反爬的网站都会对selenium和webdriver进行识别,网站只需要在前端js添加一下判断脚本,很容 ...

  7. Pyppeteer

    pyppeteer模块的基本使用 引言 Selenium 在被使用的时候有个麻烦事,就是环境的相关配置,得安装好相关浏览器,比如 Chrome.Firefox 等等,然后还要到官方网站去下载对应的驱动 ...

  8. pyppeteer进阶技巧

    记录一下在使用pyppeteer过程中慢慢发现的一些稍微高级一点的用法. 一.拦截器简单用法 拦截器作用于单个Page,即浏览器中的一个标签页.每初始化一个Page都要添加一下拦截器.拦截器实际上是 ...

  9. 爬虫的新模块pyppeteer的使用

    安装 python3 -m pip install pyppeteer 最好是py3.5+ 手动安装 你懂的,天朝网络环境很复杂,如果要用pyppeteer自己绑定的chromium,半天都下载不下来 ...

随机推荐

  1. Spring Cloud 之 Stream.

    一.简介 Spring Cloud Stream 是一个用来为微服务应用构建消息驱动能力的框架. Spring Cloud Stream 为一些供应商的消息中间件产品(目前集成了 RabbitMQ 和 ...

  2. JVM总结(一)

    JVM总结(1) 1.JVM组成: JVM由类加载器子系统.运行时数据区.执行引擎以及本地方法接口组成. 2.JVM运行原理: Java源文件经编译器,编译成字节码程序,通过JVM将每一条指令翻译成不 ...

  3. Springmvc的运行原理 SpringMvc的优点

    SpringMVC框架运行原理 1:客户端发送请求到前端控制器(DispatcherServlet),前端控制器根据请求信息(url),查询一个或多个HandlerMapping, 前端控制器,来决定 ...

  4. 【0805 | Day 8】Python进阶(二)

    列表类型内置方法 一.列表类型内置方法(list) 用途:多个爱好.多个武器.多种化妆品 定义:[ ]内可以有多个任意类型的值,逗号分隔元素 # my_boy_friend = list(['jaso ...

  5. spring架构解析--入门一

    Spring 框架中的核心组件只有三个:Core.Context 和 Beans.它们构建起了整个 Spring 的骨骼架构.简单理解: spring core是工具,context是环境,而bean ...

  6. 「雕爷学编程」Arduino动手做(10)——敲击传感器模块

    37款传感器和模块的提法,在网络上广泛流传,其实Arduino能够兼容的传感器模块肯定是不止37种的.鉴于本人手头积累了一些传感器与模块,依照实践出真知(动手试试)的理念,以学习和交流为目的,这里准备 ...

  7. 从零写一个编译器(十三):代码生成之遍历AST

    项目的完整代码在 C2j-Compiler 前言 在上一篇完成对JVM指令的生成,下面就可以真正进入代码生成部分了.通常现代编译器都是先把生成IR,再经过代码优化等等,最后才编译成目标平台代码.但是时 ...

  8. SpringBoot与Shiro整合权限管理实战

    SpringBoot与Shiro整合权限管理实战 作者 : Stanley 罗昊 [转载请注明出处和署名,谢谢!] *观看本文章需要有一定SpringBoot整合经验* Shiro框架简介 Apach ...

  9. Guava 常用工具类

    引入guava包: <dependency> <groupId>com.google.guava</groupId> <artifactId>guava ...

  10. <lable>标签

    最近用各种框架的时候,发现很多平常自己写代码没注意到的标签和用法,在这里记录一下. 其实是很多细节方面需要注意的写法. <label> 定义:为input元素定义标注 label标签不会向 ...