Golang: 并发抓取网页内容

在上一篇中，我们根据命令行的 URL 参数输入，抓取对应的网页内容并保存到本地磁盘，今天来记录一下如何利用并发，来抓取多个站点的网页内容。

首先，我们在上一次代码的基础上稍作改造，使它能够获取多个站点的内容。下面代码中，我们首先定义好三个 URL，然后逐个发送网络请求，获取数据并保存，最后统计消耗的总时间：

// fetch.go

package main

import (

    "os"

    "fmt"

    "time"

    "regexp"

    "net/http"

    "io/ioutil"

)

// 创建正则常量

var RE = regexp.MustCompile("\\w+\\.\\w+$")

func main() {

    urls := []string {

        "http://www.qq.com",

        "http://www.163.com",

        "http://www.sina.com",

    }

    // 开始时间

    start := time.Now()

    for _, url := range urls {

        start := time.Now()

        // 发送网络请求

        res, err := http.Get(url)

        if err != nil {

            fmt.Fprintf(os.Stderr, "fetch: %v\n", err)

            os.Exit(1)

        }

        // 读取资源数据

        body, err := ioutil.ReadAll(res.Body)

        // 关闭资源

        res.Body.Close()

        if err != nil {

            fmt.Fprintf(os.Stderr, "fetch: reading %s: %v\n", url, err)

            os.Exit(1)

        }

        fileName := getFileName(url)

        // 写入文件

        ioutil.WriteFile(fileName, body, 0644)

        // 消耗的时间

        elapsed := time.Since(start).Seconds()

        fmt.Printf("%.2fs %s\n", elapsed, fileName)

    }

    // 消耗的时间

    elapsed := time.Since(start).Seconds()

    fmt.Printf("%.2fs elapsed\n", elapsed)

}

// 获取文件名

func getFileName(url string) string {

    // 从URL中匹配域名后面部分

    return RE.FindString(url) + ".txt"

}

在上面代码中，我们使用正则表达式来从 URL 中匹配域名后面部分，作为最终的文件名。关于正则表达式，后续会做总结。

下面来看看程序运行后的控制台信息：

$ ./fetch

0.12s qq.com.txt

0.20s 163.com.txt

0.27s sina.com.txt

0.59s elapsed

从打印信息中可以看出，最后消耗的总时间等于三次执行的总和。这种方式效率低下，并且不能充分利用计算机资源，下面我们就对程序进行改造，使其能够并发地执行三个抓取操作：

// fetch.go

package main

import (

    "os"

    "fmt"

    "time"

    "regexp"

    "net/http"

    "io/ioutil"

)

// 创建正则

var RE = regexp.MustCompile("\\w+\\.\\w+$")

func main() {

    urls := []string {

        "http://www.qq.com",

        "http://www.163.com",

        "http://www.sina.com",

    }

    // 创建channel

    ch := make(chan string)

    // 开始时间

    start := time.Now()

    for _, url := range urls {

        // 开启一个goroutine

        go fetch(url, ch)

    }

    for range urls {

        // 打印channel中的信息

        fmt.Println(<-ch)

    }

    // 总消耗的时间

    elapsed := time.Since(start).Seconds()

    fmt.Printf("%.2fs elapsed\n", elapsed)

}

// 根据URL获取资源内容

func fetch(url string, ch chan<- string) {

    start := time.Now()

    // 发送网络请求

    res, err := http.Get(url)

    if err != nil {

        // 输出异常信息

        ch <- fmt.Sprint(err)

        os.Exit(1)

    }

    // 读取资源数据

    body, err := ioutil.ReadAll(res.Body)

    // 关闭资源

    res.Body.Close()

    if err != nil {

        // 输出异常信息

        ch <- fmt.Sprintf("while reading %s: %v", url, err)

        os.Exit(1)

    }

    // 写入文件

    ioutil.WriteFile(getFileName(url), body, 0644)

    // 消耗的时间

    elapsed := time.Since(start).Seconds()

    // 输出单个URL消耗的时间

    ch <- fmt.Sprintf("%.2fs %s", elapsed, url)

}

// 获取文件名

func getFileName(url string) string {

    // 从URL中匹配域名部分

    return RE.FindString(url) + ".txt"

}

上面代码中，我们先创建一个 channel，然后对每个抓取操作开启一个 goroutine，待抓取程序完成后，通过 channel 发送消息告知主线程，主线程再做相应的处理操作。关于这部分的原理细节，后续再做总结。

我们运行上面的程序，执行结果如下：

$ ./fetch

0.10s http://www.qq.com

0.19s http://www.163.com

0.29s http://www.sina.com

0.29s elapsed

从结果中可以看出，最后消耗的总时间与耗时最长的那个操作等同，可见并发在性能方面带来的提升是非常可观的。

Golang: 并发抓取网页内容的更多相关文章

Golang高并发抓取HTML图片
Golang高并发抓取HTML图片使用准备 1.安装Golang 2.下载爬虫包 go get -v github.com/hunterhug/marmot/util go get -v githu ...
paip.抓取网页内容--java php python
paip.抓取网页内容--java php python.txt 作者Attilax 艾龙, EMAIL:1466519819@qq.com 来源:attilax的专栏地址:http://blog ...
使用Jsoup函数包抓取网页内容
之前写过一篇用Java抓取网页内容的文章,当时是用url.openStream()函数创建一个流,然后用BufferedReader把这个inputstream读取进来.抓取的结果是一整个字符串.如果 ...
Asp.Net 之抓取网页内容
一.获取网页内容——html ASP.NET 中抓取网页内容是非常方便的,而其中更是解决了 ASP 中困扰我们的编码问题. 需要三个类:WebRequest.WebResponse.StreamRea ...
ASP.NET抓取网页内容的实现方法
这篇文章主要介绍了ASP.NET抓取网页内容的实现方法,涉及使用HttpWebRequest及WebResponse抓取网页内容的技巧,需要的朋友可以参考下一.ASP.NET 使用HttpWebRe ...
ASP.NET抓取网页内容
原文:ASP.NET抓取网页内容一.ASP.NET 使用HttpWebRequest抓取网页内容这种方式抓取某些页面会失败不过,有时候我们会发现,这个程序在抓取某些页面时,是获不到所需的内容的, ...
c#抓取网页内容乱码的解决方案
写过爬虫的同学都知道,这是个很常见的问题了,一般处理思路是: 使用HttpWebRequest发送请求,HttpWebResponse来接收,判断HttpWebResponse中”Content-Ty ...
C# 抓取网页内容的方法
1.抓取一般内容需要三个类:WebRequest.WebResponse.StreamReader 所需命名空间:System.Net.System.IO 核心代码: view plaincopy ...
python 分别用python2和python3伪装浏览器爬取网页内容
python网页抓取功能非常强大,使用urllib或者urllib2可以很轻松的抓取网页内容.但是很多时候我们要注意,可能很多网站都设置了防采集功能,不是那么轻松就能抓取到想要的内容. 今天我来分享下 ...

随机推荐

动态sql和分页
Mybatis动态SQL If.trim.foreach BookMapper /** * 如果形参要在mapper.xml中使用需要加上面注解 * map.name: zs age: 12 * @p ...
请简要描述margin重复问题，及解决方式
两个相邻的盒子垂直方向上的margin会发生重叠,取较大的那个值,而不是相加. 解决: 父级设置padding代替margin 父级设置overflow:hidden 当前元素设置透明的边框使用绝对 ...
元素的alt和title有什么异同？
①alt作为图片的替代文字出现,title作为图片的解释文字出现. ②alt属性应用较少,如img.area.input中,title应用较多,如a.form.input.还有div.p这些块级元素都 ...
java登录图形界面
编写程序,利用JtextField和JpasswordField分别接收用户输入的用户名和密码,并对用户输入的密码进行检验.对于每个用户名有三次密码输入机会. package beizi; impor ...
nexus没有授权导致的错误
错误详情信息: 错误信息: [ERROR] Failed to execute goal on project blog: Could not resolve dependencies for pro ...
vue本地静态图片的路径问题解决方案
不少人在vue的开发中遇到这样一个问题: img的src属性绑定url变量,然而图片加载失败. 大部分的情况中,是开发者使用了错误的写法,例如: <img src="{{ imgUrl ...
关于Echarts柱状图实现的细节
echarts柱状图显示数值[1] echarts2: itemStyle : { normal: {label : {show: true, position: 'top'}}}, echarts ...
Python爬虫爬取BT之家找电影资源
一.写在前面最近看新闻说圣城家园(SCG)倒了,之前BT天堂倒了,暴风影音也不行了,可以说看个电影越来越费力,国内大厂如企鹅和爱奇艺最近也出现一些幺蛾子,虽然目前版权意识虽然越来越强,但是很多资源在 ...
ASP.NET Core如何在ActionFilterAttribute里做依赖注入
在ASP.NET Core里,我们可以使用构造函数注入很方便地对Controller,ViewComponent等部件做依赖注入.但是如何给过滤器ActionFilterAttribute也用上构造函 ...
014 Vue学习笔记2
1.组件化在大型应用开发的时候,页面可以划分成很多部分.往往不同的页面,也会有相同的部分.例如可能会有相同的头部导航.但是如果每个页面都独自开发,这无疑增加了我们开发的成本.所以我们会把页面的不同部 ...

Golang: 并发抓取网页内容

Golang: 并发抓取网页内容的更多相关文章

随机推荐

热门专题