一只简单的网络爬虫(基于linux C/C++)————Url处理以及使用libevent进行DNS解析
Url处理
爬虫里使用了两个数据结构来管理Url
下面的这个数据结构用来维护原始的Url,同时有一个原始Url的队列
//维护url原始字符串
typedef struct Surl {
char *url;
int level;//url抓取深度
int type;//抓取类型
} Surl;
原始的Url队列static queue <Surl *> surl_queue;//这个队列存放解析前的
下面的Url结构体用来维护解析后的url,同样的,配有一个url的队列
//解析后的
typedef struct Url {
char *domain;//域名
char *path;//路径
int port;//端口
char *ip;//IP
int level;//深度
} Url;
解析后的url队列static queue<Url *> ourl_queue;//这个队列存放DNS解析后的
另外,采用一个map容器用来保存域名解析前后的url的主机名称和ip地址
static map<string, string> host_ip_map;//主机,ip的map容器
采用这样的方式的原因是,DNS解析是一个比较浪费时间的过程,解析过的主机名我们将其与ip地址采用map关联起来,因为同一个html页面里可能会有多个url是同一个主机名的,这样一来我们可以直接在map容器中查找该主机名对应的ip,而不必每次都进行DNS解析,这样做可以达到提高效率的效果
两个队列的一些常见的操作(出入队列等)这里就不在弹了
下面看看一个url解析的函数
//解析域名,解析域名后surl队列中surl结构体会转化为url结构体放入url队列
void * urlparser(void *none)
{
Surl *url = NULL;
Url *ourl = NULL;
map<string, string>::const_iterator itr;
//event_base * base = event_base_new();
//evdns_base * dnsbase = evdns_base_new(base, 1);
//event_base_loop(base,EVLOOP_NONBLOCK);
while(1) {
pthread_mutex_lock(&sq_lock);
while (surl_queue.empty()) //surl队列为空则一直等待,直到被唤醒
{
pthread_cond_wait(&sq_cond, &sq_lock);
}
url = surl_queue.front();//取出surl队列中的url
surl_queue.pop();
pthread_mutex_unlock(&sq_lock);
ourl = surl2ourl(url);//原始的结构体转化为ourl
//在回调函数中解析完加进去的
itr = host_ip_map.find(ourl->domain);//在主机IP的map中寻找
if (itr == host_ip_map.end())//找不到的才需要解析,找到说明之前解析过了
{ // not found
//解析DNSdns resolve
event_base * base = event_init();//执行一次libevent库的初始化
evdns_init();//在使用任何解析器函数之前,必须调用evdns_init()函数初始化函数库
evdns_resolve_ipv4(ourl->domain, 0, dns_callback, ourl);//dns_callback回调函数
event_dispatch();
event_base_free(base);
//evdns_base_resolve_ipv4(dnsbase, ourl->domain, 0, dns_callback, ourl);
//event_base_loop(base, EVLOOP_ONCE | EVLOOP_NONBLOCK);
}
else
{
ourl->ip = strdup(itr->second.c_str());//之前解析过,直接拷贝
push_ourlqueue(ourl);//送入队列
}
}
//evdns_base_free(dnsbase, 0);
//event_base_free(base);
return NULL;
}
surl2ourl(Surl * surl)函数如下,主要是将原始的url进行分割,分离出域名和路径,端口等,然后填入解析后的url结构
//原始字符串Surl结构转化为url结构,
static Url * surl2ourl(Surl * surl)
{//calloc在动态分配完内存后,自动初始化该内存空间为零,而malloc不初始化,里边数据是随机的垃圾数据
Url *ourl = (Url *)calloc(1, sizeof(Url));
//strchr函数原型:extern char *strchr(const char *s,char c);查找字符串s中首次出现字符c的位置。
char *p = strchr(surl->url, '/');
if (p == NULL)//原始字符串不存在'/'
{
ourl->domain = surl->url;//直接是域名
ourl->path = surl->url + strlen(surl->url);//路径其实是空的
}
else
{
*p = '\0';//覆盖'/'
ourl->domain = surl->url;//提取域名
ourl->path = p+1;//提取路径
}
// port端口,冒号后面是端口
//查找字符在指定字符串中从正面开始的最后一次出现的位置
p = strrchr(ourl->domain, ':');//找最后一个出现的冒号
if (p != NULL)
{
*p = '\0';
ourl->port = atoi(p+1);
if (ourl->port == 0)
ourl->port = 80;
}
else //Url中若没有端口号,则是默认的80端口
{
ourl->port = 80;
}
// level
ourl->level = surl->level;
return ourl;
}
urlparser函数主要完成了下面的工作,surl转化为url结构,查找map容器,如果是之前未解析的,采用lievent进行域名解析,然后加入map容器,url结构进入ourl队列
lievent的DNS解析
lievent的使用可以参考libevent Documentation
主要是使用了该函数
int evdns_resolve_ipv4 (const char *name,
int flags,
evdns_callback_type callback,
void * ptr
)
参数
name:是想要DNS解析的一个主机名
flags:可以填 0,或者 DNS_QUERY_NO_SEARCH 禁用搜索此查询
callback:是一个回调函数,在解析完成的时候会回调该函数
ptr: 一个传给回调函数的参数
在回调函数中可以得到解析后的ip地址
//DNS解析回调函数
static void dns_callback(int result, char type, int count, int ttl, void *addresses, void *arg)
{
Url * ourl = (Url *)arg;
struct in_addr *addrs = (in_addr *)addresses;
if (result != DNS_ERR_NONE || count == 0)
{
SPIDER_LOG(SPIDER_LEVEL_WARN, "Dns resolve fail: %s", ourl->domain);
}
else
{
char * ip = inet_ntoa(addrs[0]);//网络字节序转化为主机字节序
SPIDER_LOG(SPIDER_LEVEL_DEBUG, "Dns resolve OK: %s -> %s", ourl->domain, ip);
host_ip_map[ourl->domain] = strdup(ip);//ip填入domain对应的ip
ourl->ip = strdup(ip);//ip填入ourl
push_ourlqueue(ourl);//加入队列
}
event_loopexit(NULL); // not safe for multithreads
}
另外,在主函数中,专门开了一个线程用来进行url的DNS解析的
// 启动用于解析DNS的线程
int err = -1;
if ((err = create_thread(urlparser, NULL, NULL, NULL)) < 0)
{//urlparser在url.cpp中
SPIDER_LOG(SPIDER_LEVEL_ERROR, "创建Url解析线程失败: %s", strerror(err));
}
只要原始的url队列不为空,则一直进行DNS的解析,解析后放入另一个队列,若原始url为空(还没有抓取其他的url),则一直在等待,使用的是条件变量
pthread_cond_wait(&sq_cond, &sq_lock);
知道surl队列有url入队,被唤醒继续进行DNS解析的服务
//发送一个信号给另外一个正在处于阻塞等待状态的线程,
//使其脱离阻塞状态,继续执行.如果没有线程处在阻塞等待状态,
//pthread_cond_signal也会成功返回
if (surl_queue.size() == 1)
pthread_cond_signal(&sq_cond);
一只简单的网络爬虫(基于linux C/C++)————Url处理以及使用libevent进行DNS解析的更多相关文章
- 一只简单的网络爬虫(基于linux C/C++)————开篇
最近学习开发linux下的爬虫,主要是参考了该博客及其他一些网上的资料.网络爬虫(又被称为网页蜘蛛,网络机器人,在FOAF社区中间,更经常的称为网页追逐者),是一种按照一定的规则,自动地抓取万维网信息 ...
- 一只简单的网络爬虫(基于linux C/C++)————线程相关
爬虫里面采用了多线程的方式处理多个任务,以便支持并发的处理,把主函数那边算一个线程的话,加上一个DNS解析的线程,以及我们可以设置的max_job_num值,最多使用了1+1+max_job_num个 ...
- 一只简单的网络爬虫(基于linux C/C++)————主事件流程
该爬虫的主事件流程大致如下: 1.获取命令行参数,执行相应操作 2.读取配置文件,解析得到各种设置 3.载入各种模块 4.种子入队,开启DNS解析线程(原始队列不为空时解析) 5.创建epoll,开启 ...
- 一只简单的网络爬虫(基于linux C/C++)————浅谈并发(IO复用)模型
Linux常用的并发模型 Linux 下设计并发网络程序,有典型的 Apache 模型( Process Per Connection ,简称 PPC ), TPC ( Thread Per Conn ...
- 一只简单的网络爬虫(基于linux C/C++)————支持动态模块加载
插件在软件设计中有很大的好处,可以方便地扩展各种功能,使用插件技术能够在分析.设计.开发.项目计划.协作生产和产品扩展等很多方面带来好处: (1)结构清晰.易于理解.由于借鉴了硬件总线的结构,而且各个 ...
- 一只简单的网络爬虫(基于linux C/C++)————socket相关及HTTP
socket相关 建立连接 网络通信中少不了socket,该爬虫没有使用现成的一些库,而是自己封装了socket的相关操作,因为爬虫属于客户端,建立套接字和发起连接都封装在build_connect中 ...
- 一只简单的网络爬虫(基于linux C/C++)————守护进程
守护进程,也就是通常说的Daemon进程,是Linux中的后台服务进程.它是一个生存期较长的进程,通常独立于控制终端并且周期性地执行某种任务或等待处理某些发生的事件.守护进程常常在系统引导装入时启动, ...
- 一只简单的网络爬虫(基于linux C/C++)————读取命令行参数及日志宏设计
linux上面的程序刚开始启动的时候一般会从命令行获取某些参数,比如以守护进程运行啊什么的,典型的例子就是linux下的man,如下图所示 实现该功能可以使用getopt函数实现,该函数在头文件uni ...
- 一只简单的网络爬虫(基于linux C/C++)————利用正则表达式解析页面
我们向一个HTTP的服务器发送HTTP的请求后,服务器会返回可能一个HTML页面(当然也可以是其他的资源),我们可以利用返回的HTML页面,在其中寻找其他的Url,例如我们可以这样在浏览器上查看一下H ...
随机推荐
- NHibernate COUNT(*) 统计问题
NHibernate这个框架用了有一年多了,相对有很大的优势,可以省去很多写Sql的时间. 但是如果你想用它做统计,那么有点抱歉,只能手动写写了.它内置的东西很难符合你的需求. 我遇到的问题是这样的. ...
- BAT脚本编写要点_特殊字符
BAT脚本编写要点(1)_特殊字符 分类: 其他 2011-03-20 00:58 5621人阅读 评论(0) 收藏 举报 脚本cdatecmdtreesystem 1. 点 与echo连用,作用是换 ...
- 【DataBase】 在Windows系统环境 下载和安装 解压版MySQL数据库
MySQL官网解压版下载地址:https://dev.mysql.com/downloads/mysql/ 为什么不推荐使用安装版?无脑下一步,很多配置的东西学习不到了 点选第一个就好了,下面的是调试 ...
- ASE课程总结 by 冯晓云
开始的开始,采访往届ASE班的blog:http://www.cnblogs.com/legs/p/4894362.html 和北航软工M1检查:http://www.cnblogs.com/legs ...
- Product Owner交流记录1
Abstract 最终我们选择了UWP版必应词典功能开发. 项目:“单词挑战”功能 然后我们今天中午我们和Product owner聊了聊. Content Product owner是Travis ...
- Video tagging systems based on DNNs
Need: With the ever-growth large-scale video in the mobile phone, so what will everyone get from the ...
- Robberies 杭电
可怜的POIUYTREWQ最近想买下dota2的商品,但是手头缺钱.他想起了之前看过的一部大片,觉得抢银行也许是个不错的选择.他认为,坏人被抓是因为没有预先规划.于是他在之前的几个月对各大银行进行了一 ...
- OkHttp 优雅封装 HttpUtils 之 气海雪山初探
曾经在代码里放荡不羁,如今在博文中日夜兼行,只为今天与你分享成果.如果觉得本文有用,记得关注我,我将带给你更多. 介绍 HttpUtils 是近期开源的对 OkHttp 轻量封装的框架,它独创的异步预 ...
- 详解 继承(下)—— super关键字 与 多态
接上篇博文--<详解 继承(上)-- 工具的抽象与分层> 废话不多说,进入正题: 本人在上篇"故弄玄虚",用super();解决了问题,这是为什么呢? 答曰:子类中所有 ...
- PHP反序列化漏洞总结
写在前边 做了不少PHP反序列化的题了,是时候把坑给填上了.参考了一些大佬们的博客,自己再做一下总结 1.面向对象 2.PHP序列化和反序列化 3.PHP反序列化漏洞实例 1.面向对象 在了解序列化和 ...