nodejs抓取页面内容，并分析有无某些内容的js文件

nodejs获取网页内容绑定data事件，获取到的数据会分几次相应，如果想全局内容匹配，需要等待请求结束，在end结束事件里把累积起来的全局数据进行操作！

举个例子，比如要在页面中找有没有www.baidu.com，不多说了，直接放代码：

//引入模块

var http = require("http"),

fs = require('fs'),

url = require('url');

//写入文件，把结果写入不同的文件

var writeRes = function(p, r) {

     fs.appendFile(p , r, function(err) {

        if(err)

             console.log(err);

        else

             console.log(r);

    });

},

//发请求，并验证内容，把结果写入文件

postHttp = function(arr, num) {

     console.log('第'+num+"条！")

     var a = arr[num].split(" - ");

     if(!a[0] || !a[1]) {

          return;

     }

     var address = url.parse(a[1]),

     options = {

          host : address.host,

          path: address.path,

          hostname : address.hostname,

          method: 'GET',

          headers: {

            'User-Agent' : 'Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/38.0.2125.122 Safari/537.36'

        }

     }

     var req = http.request(options, function(res) {

          if (res.statusCode == 200) {

               res.setEncoding('UTF-8');

               var data = '';

               res.on('data', function (rd) {

                    data += rd;

               });

               res.on('end', function(q) {

                    if(!~data.indexOf("www.baidu.com")) {

                         return writeRes('./no2.txt', a[0] + '--' + a[1] + '\n');

                    } else {

                         return writeRes('./has2.txt', a[0] + '--' + a[1] + "\n");

                    }

               })

          } else {

               writeRes('./error2.txt', a[0] + '--' + a[1] + '--' + res.statusCode + '\n');

          }

     });

     req.on('error', function(e) {

          writeRes('./error2.txt', a[0] + '--' + a[1] + '--' + e + '\n');

     })

     req.end();

},

//读取文件，获取需要抓取的页面

openFile = function(path, coding) {

     fs.readFile(path, coding, function(err, data) {

          var res = data.split("\n");

          for (var i = 0, rl = res.length; i < rl; i++) {

               if(!res[i])

                    continue;

               postHttp(res, i);

          };

     })

};

openFile('./sites.log', 'utf-8');

上面的代码大家应该都能看的懂！这里只是一个实验性的一些代码，具体的还要大家自己去研究研究！

nodejs抓取页面内容，并分析有无某些内容的js文件的更多相关文章

用PHP抓取页面并分析
在做抓取前,记得把php.ini中的max_execution_time设置的大点,不然会报错的.
【java】抓取页面内容，提取链接（此方法可以http get无需账号密码的请求）
package 网络编程; import java.io.BufferedReader; import java.io.BufferedWriter; import java.io.FileOutpu ...
【新手向】使用nodejs抓取百度贴吧内容
参考教程:https://github.com/alsotang/node-lessons 1~5节 1. 通过superagent抓取页面内容 superagent .get('http://www ...
如何使用angularjs实现抓取页面内容
<html ng-app="myApp"> <head> <title>angularjs-ajax</title> <scr ...
爬虫抓取页面数据原理（php爬虫框架有很多）
爬虫抓取页面数据原理(php爬虫框架有很多 ) 一.总结 1.php爬虫框架有很多,包括很多傻瓜式的软件 2.照以前写过java爬虫的例子来看,真的非常简单,就是一个获取网页数据的类或者方法(这里的话 ...
php抓取页面的几种方法详解
本篇文章是对php抓取页面的几种方法进行了详细的分析介绍,需要的朋友参考下在做一些天气预报或者RSS订阅的程序时,往往需要抓取非本地文件,一般情况下都是利用php模拟浏览器的访问,通过http请求 ...
基于puppeteer模拟登录抓取页面
关于热图在网站分析行业中,网站热图能够很好的反应用户在网站的操作行为,具体分析用户的喜好,对网站进行针对性的优化,一个热图的例子(来源于ptengine) 上图中能很清晰的看到用户关注点在那,我们不 ...
Java爬虫系列二：使用HttpClient抓取页面HTML
爬虫要想爬取需要的信息,首先第一步就要抓取到页面html内容,然后对html进行分析,获取想要的内容.上一篇随笔<Java爬虫系列一:写在开始前>中提到了HttpClient可以抓取页面内 ...
python 爬虫抓取 MOOC 中国课程的讨论区内容
一:selenium 库 selenium 每次模拟浏览器打开页面,xpath 匹配需要抓取的内容.可以,但是特别慢,相当慢.作为一个对技术有追求的爬虫菜鸡,狂补了一些爬虫知识.甚至看了 scrapy ...

随机推荐

PowerShell使用ServicePrincipal登陆Azure
一.打开PowerShell 二.输入下列命令 $pass = ConvertTo-SecureString "<这里换成您的AAD应用密钥>" -AsPlainTex ...
REP开发技巧
这个基本包含了所有的特殊情况 wrap 换行 title显示在每页的固定位置, 第一页需要特殊处理 <DATA> <PDF_TITLE Font="5" Size ...
fork failed because of Out Of Memory
Maybe virtual memory over commit is prevented in your system. If it is prevented, then the virtual m ...
[Aaronyang] 写给自己的WPF4.5 笔记7[三巴掌-ItemsControl数据绑定详解与binding二次处理 3/3]
我要做回自己--Aaronyang的博客(www.ayjs.net) 博客摘要: 全方位的讲解了转换器的使用,单值,多值转换器,条件转换器,StringFormat等方式详细的实践地讲解了Items ...
【Vegas原创】SQL Server 只安装客户端的方法
只安装管理工具
mac mini纯键盘操作连接蓝牙鼠标
许久不开家里的MAC MINI了,今天开来玩玩,结果进个桌面连接鼠标就费了好大的劲现实情况: 1. 没有有线鼠标,只有一个USB键盘,一个微软3600蓝牙鼠标 MAC MINI连接上USB键盘,开机 ...
[svc]数字证书基础知识
数字证书基础原理数字证书采用PKI(Public Key Infrastructure)公开密钥基础架构技术,利用一对互相匹配的密钥进行加密和解密. 每个用户自己设定一把特定的仅为本人所知的私有密钥 ...
LayaBox IDE 安装后执行项目报错解决方案的一些记录
1.打开IDE后出现“路径xxx未指向有效地tsserver安装.将禁用TypeScript语言功能.”提示: 这是由于杀毒软件吧ts对应的js文件作为病毒删除导致的,一般到杀毒软件的历史界面中将ts ...
maven的配置及一些常用命令
一般来说,github上大多的java项目都是使用maven,ant等进行构建的.由于之前没有使用过maven,因此这几天对maven进行了简单的学习.古话说:“温故而知新”,一些命令长时间不使用都会 ...
linux每日命令(27)：chmod命令
chmod命令用于改变linux系统文件或目录的访问权限.用它控制文件或目录的访问权限.该命令有两种用法.一种是包含字母和操作符表达式的文字设定法:另一种是包含数字的数字设定法. Linux系统中的每 ...

nodejs抓取页面内容，并分析有无某些内容的js文件

nodejs抓取页面内容，并分析有无某些内容的js文件的更多相关文章

随机推荐

热门专题