一、介绍


Splash 跟之前我们介绍的 Selenium ( 参考 Selenium 与自动化测试 —— 《Selenium 2 自动化测试实战》读书笔记) 很类似,都可以理解成一个浏览器,提供网页动态渲染(css、javascript、flash 等)服务,并且都支持 HTTP API 与之交互。

但不同点在于:

  • Splash 更轻量级,但缺点是功能没有Selenium丰富。(所以 Selenium 才称得上是自动化测试框架,Splash更多的算一种网页渲染服务)

  • Splash 的安装、配置、使用更简单

  • Splash 支持异步,能提高爬取效率

文档地址:https://splash.readthedocs.io/en/stable/

二、安装


注意:事先安装好 docker。

docker run -p 8050:8050 scrapinghub/splash

部署在远程服务器记得加 -d 参数,它代表将 Docker 容器以守护态运行,这样在断开远程服务器连接后,不会终止 Splash 服务的运行。

三、使用

安装好后,打开 http://localhost:8050 即可访问,页面如下:

本文安装版本为 v3.4。

可以在此 web 页面来使用,也可以用下面介绍的 API 调用方式,更灵活。

三、Splash API 调用


http://localhost:8050/render.html?url=https://www.baidu.com

http://localhost:8050/render.png?url=https://www.baidu.com

http://localhost:8050/render.jpeg?url=https://www.baidu.com

http://localhost:8050/render.har?url=https://www.baidu.com

http://localhost:8050/render.json?url=https://www.baidu.com

除了上面指定的最简单的url、render类型,还可以通过 Lua 脚本执行更复杂的渲染操作和交互逻辑(即用 execute)。

我们用 python 代码为例:

import requests
from urllib.parse import quote lua = """
function main(splash)
return 'hello'
end
"""
url = 'http://localhost:8050/execute?lua_source=' + quote(lua)
response = requests.get(url)
print(response.text)

下面我们对 Lua 脚本的写法做更多的介绍。

四、Splash 的 Lua 脚本


1、base demo

function main(splash, args)
assert(splash:go(args.url))
assert(splash:wait(0.5)) return {
html = splash:html(),
png = splash:png(),
har = splash:har(),
}
end

接下来针对这个最基本的 demo,来展开介绍。

2、main() 函数

main 函数就是 splash 默认要调用的函数,所以这里保持固定写法就好。

main 的返回值,既可以是字典形式,也可以是字符串形式,最后都会转化为 HTTP Response。

3、splash 对象

splash 类似于 Selenium 中的 WebDriver 对象。

(1)splash 属性

上面提到的 main 函数的第二个参数 args 其实是 splash 对象的其中一个属性,即:

splash.args = args

splash.resource_timeout = 0.1 - 设置超时时间。如果设置为 0 或 nil (类似 Python 中的None),代表不检测超时。

此属性适合在网页加载速度较慢的情况下设置

splash.js_enabled = false - 是否执行 js(默认为 ture)

splash.images_enabled = false 是否加载图片(默认为 ture)

小心 image 不加载导致个别 DOM 渲染出错

splash.plugins_enabled = false - 是否加载浏览器插件,如 Flash 插件 (默认 false)

splash.scroll_position = {x=100, y=200} = 页面上下或左右滚动

(3)splash 方法

go() - 模拟 GET 和 POST 请求

http_get() - 模拟 GET 请求

http_post() - 模拟 POST 请求

function main(splash, args)
-- 错误处理
    local ok, reason = splash:go{"http://httpbin.org/post",                 http_method="POST", body="name=Germey"}     if ok then
        return splash:html()
    end
end

wait() - 等待。类似 python 中的 sleep(多与 go 配合,紧接在 go 后面)

为什么 splash 没有 selenium 的 expected_conditions(预期条件判断)方法,如presence_of_element_located。

call_later() - 类似 JavaScript 的 settimeout

evaljs() - 执行 js 代码

local title = splash:evaljs("document.title")

runjs() 跟 evaljs() 功能类似,只不过语义上更倾向于只调用不关心返回值。

autoload() 跟 evaljs() 功能类似,只不过语义上更倾向于预先加载。

jsfunc() - JavaScript 方法转换为 Lua 脚本

这个好,毕竟我 Lua 语法不熟。

function main(splash, args)
local get_div_count = splash:jsfunc([[
function () {
var body = document.body;
var divs = body.getElementsByTagName('div');
return divs.length;
}
]])
splash:go("https://www.baidu.com")
return("There are %s DIVs"):format(get_div_count())
end

url() - 获取/设置 url

html() / set_content() - 获取/设置 html 内容

splash:set_content ("hello")

png() / jpeg() - 获取页面截图

har() - 获取页面加载过程描述

get_cookies() / add_cookie() / clear_ cookies() - 获取/设置/清除 html 内容

splash:add_cookie({"sessionid", "asdasd", "/", domain="http://example.com" })

set_user_agent() - 设置 user-agent

set_custom_headers() - 设置 header

自定义程度更高,可以设置 user_agent、cookies 等等

splash:set_custom_headers({
    ["User-Agent"] = "Splash",
    ["Site"] = "Splash",
})

get_viewport_size() / set_viewport_size(width, height) - 获取/设置页面大小

set_viewport_full() - 设置全屏

select() - css 选择器 (选择首个)

input = splash:select("#kw”)
-- 点击控件
input:mouse_click()
-- 给控件输入文本
input:send_text('Splash')

selectAll() - css 选择器 (选择全部)

-- 通过 css 选择器选中了节点的正文内容,随后遍历了所有节点,将其中的文本获取下来
local texts = splash:select_all('.quote .text')
local results = {}
for index, text in ipairs(texts) do
results[index] = text.node.innerHTML
end

五、Splash 负载均衡配置


待写。具体可看原书。

六、参考资料


《Python 3网络爬虫开发实战》

Splash 学习笔记的更多相关文章

  1. GRUB学习笔记(转自http://www.cnblogs.com/evilzy/archive/2008/03/30/1130173.html)

    grub学习笔记1 首先要了解的几个概念 1.1 启动管理器 启动管理器是存储在磁盘开始扇区中的一段程序,例如,硬盘的MBR(Master Boot Record),在系统完成启动测试后,如果系统是从 ...

  2. Python学习笔记(六)

    Python学习笔记(六) Ubuntu重置root密码 Ubuntu 16.4 目录结构 Ubuntu 命令讲解 1. Ubuntu重置root密码 启动系统,显示GRUB选择菜单(如果默认系统启动 ...

  3. 学习笔记:CentOS7学习之十八:Linux系统启动原理及故障排除

    目录 学习笔记:CentOS7学习之十八:Linux系统启动原理及故障排除 18.1 centos6系统启动过程及相关配置文件 18.1.1 centos6系统启动过程 18.1.2 centos6启 ...

  4. js学习笔记:webpack基础入门(一)

    之前听说过webpack,今天想正式的接触一下,先跟着webpack的官方用户指南走: 在这里有: 如何安装webpack 如何使用webpack 如何使用loader 如何使用webpack的开发者 ...

  5. PHP-自定义模板-学习笔记

    1.  开始 这几天,看了李炎恢老师的<PHP第二季度视频>中的“章节7:创建TPL自定义模板”,做一个学习笔记,通过绘制架构图.UML类图和思维导图,来对加深理解. 2.  整体架构图 ...

  6. PHP-会员登录与注册例子解析-学习笔记

    1.开始 最近开始学习李炎恢老师的<PHP第二季度视频>中的“章节5:使用OOP注册会员”,做一个学习笔记,通过绘制基本页面流程和UML类图,来对加深理解. 2.基本页面流程 3.通过UM ...

  7. 2014年暑假c#学习笔记目录

    2014年暑假c#学习笔记 一.C#编程基础 1. c#编程基础之枚举 2. c#编程基础之函数可变参数 3. c#编程基础之字符串基础 4. c#编程基础之字符串函数 5.c#编程基础之ref.ou ...

  8. JAVA GUI编程学习笔记目录

    2014年暑假JAVA GUI编程学习笔记目录 1.JAVA之GUI编程概述 2.JAVA之GUI编程布局 3.JAVA之GUI编程Frame窗口 4.JAVA之GUI编程事件监听机制 5.JAVA之 ...

  9. seaJs学习笔记2 – seaJs组建库的使用

    原文地址:seaJs学习笔记2 – seaJs组建库的使用 我觉得学习新东西并不是会使用它就够了的,会使用仅仅代表你看懂了,理解了,二不代表你深入了,彻悟了它的精髓. 所以不断的学习将是源源不断. 最 ...

随机推荐

  1. c 语言I博客作业02

    这个作业属于哪个课程 C语言程序设计1 这个作业要求在哪里 https://edu.cnblogs.com/campus/zswxy/SE2019-2/homework/8687 我在这个课程的目标是 ...

  2. 转:Spring Boot中使用AOP统一处理Web请求日志

    在spring boot中,简单几步,使用spring AOP实现一个拦截器: 1.引入依赖: <dependency> <groupId>org.springframewor ...

  3. java.lang.ClassNotFoundException: com.demo.search.extractAbstract.service.ExtractAbstractServiceHandler

    在利用 Spring 对 thrift 进行集成时,出现错误: avax.servlet.ServletException: Servlet.init() for servlet search-nlp ...

  4. 关于Block内部要不要使用weakSelf的几种情况

    本文转载自http://www.jianshu.com/p/c6ca540861d9 关于Block内部要不要使用weakSelf的几种情况 我们知道当对block使用不当时会造成循环引用导致内存泄露 ...

  5. 调用rest api杀死yarn上的应用

    调用rest api杀死yarn上的应用 调用yarn reat api,通过app name 获取application id public static String getApplication ...

  6. linux终端界面的字颜色设置

    目录 目录 说明 PS1 颜色语法 保存设置 说明 在网上找了好多资料都不是很详细,要不就是语法有错误. 所以弄了好久才整明白了,写下来方便后面的人学习. 本人linux虚拟机版本为CentOs 6. ...

  7. ubuntu下安装gcc

    在ubuntu下安装gcc 第一次写blog,多多包涵! gcc安装步骤 废话不多说,gcc安装步骤如下: 1. sudo apt update 2. sudo apt install build-e ...

  8. Java修炼——手写服务器项目

    项目工程总览: 1.Dispatcher类(一个请求与响应就是一个Dispatcher) package com.bjsxt.server; import java.io.IOException; i ...

  9. Day 04 作业

    目录 作业 简述Python的五大数据类型的作用.定义方式.使用方法: 数字类型 字符串类型 列表 字典 布尔型 一行代码实现下述代码实现的功能: 写出两种交换x.y值的方式: 一行代码取出nick的 ...

  10. Linux搭建Java环境(JDK+Tomcat+MySQL)

    目录 一.项目环境: 二.安装JDK1.8 三.安装Tomcat8.5 四.安装MySQL数据库 五.配置JAVA项目 一.项目环境: 开发环境 生产环境 测试环境 硬件环境: web服务器:cpu: ...