Nutch2.1+mysql+solr3.6.1+中文网站抓取

1、mysql 数据库配置

linux mysql安装步骤省略。

在首先进入/etc/my.cnf （mysql为5.1的话就不用修改my.cnf，会导致mysql不能启动）
在[mysqld]

下添加：

innodb_file_format=barracuda

innodb_file_per_table=true

innodb_large_prefix=true

character-set-server=utf8mb4

collation-server=utf8mb4_unicode_ci

创建表：

CREATE DATABASE nutch5 DEFAULT CHARACTER SET utf8 DEFAULT COLLATE utf8_general_ci;

use nutch5;

CREATE TABLE `webpage` (

        `id` varchar() CHARACTER SET latin1 NOT NULL,

        `headers` blob,

        `text` mediumtext DEFAULT NULL,

        `status` int() DEFAULT NULL,

        `markers` blob,

        `parseStatus` blob,

        `modifiedTime` bigint() DEFAULT NULL,

        `score` float DEFAULT NULL,

        `typ` varchar() CHARACTER SET latin1 DEFAULT NULL,

        `baseUrl` varchar() CHARACTER SET latin1 DEFAULT NULL,

        `content` mediumblob,

        `title` varchar() DEFAULT NULL,

        `reprUrl` varchar() CHARACTER SET latin1 DEFAULT NULL,

        `fetchInterval` int() DEFAULT NULL,

        `prevFetchTime` bigint() DEFAULT NULL,

        `inlinks` mediumblob,

        `prevSignature` blob,

        `outlinks` mediumblob,

        `fetchTime` bigint() DEFAULT NULL,

        `retriesSinceFetch` int() DEFAULT NULL,

        `protocolStatus` blob,

        `signature` blob,

        `metadata` blob,

        PRIMARY KEY (`id`)

    ) ENGINE=InnoDB DEFAULT CHARSET=utf8;

或者用数据库备份sql：

先创建数据库：

CREATE DATABASE nutch2 DEFAULT CHARACTER SET utf8 DEFAULT COLLATE utf8_general_ci;

-- MySQL dump 10.13  Distrib 5.6., for Win64 (x86_64)

--

-- Host: yqxt    Database: nutch

-- ------------------------------------------------------

-- Server version    5.6.

/*!40101 SET @OLD_CHARACTER_SET_CLIENT=@@CHARACTER_SET_CLIENT */;

/*!40101 SET @OLD_CHARACTER_SET_RESULTS=@@CHARACTER_SET_RESULTS */;

/*!40101 SET @OLD_COLLATION_CONNECTION=@@COLLATION_CONNECTION */;

/*!40101 SET NAMES utf8 */;

/*!40103 SET @OLD_TIME_ZONE=@@TIME_ZONE */;

/*!40103 SET TIME_ZONE='+00:00' */;

/*!40014 SET @OLD_UNIQUE_CHECKS=@@UNIQUE_CHECKS, UNIQUE_CHECKS=0 */;

/*!40014 SET @OLD_FOREIGN_KEY_CHECKS=@@FOREIGN_KEY_CHECKS, FOREIGN_KEY_CHECKS=0 */;

/*!40101 SET @OLD_SQL_MODE=@@SQL_MODE, SQL_MODE='NO_AUTO_VALUE_ON_ZERO' */;

/*!40111 SET @OLD_SQL_NOTES=@@SQL_NOTES, SQL_NOTES=0 */;

--

-- Table structure for table `webpage`

--

DROP TABLE IF EXISTS `webpage`;

/*!40101 SET @saved_cs_client     = @@character_set_client */;

/*!40101 SET character_set_client = utf8 */;

CREATE TABLE `webpage` (

  `id` varchar() CHARACTER SET latin1 NOT NULL,

  `headers` blob,

  `text` mediumtext,

  `status` int() DEFAULT NULL,

  `markers` blob,

  `parseStatus` blob,

  `modifiedTime` bigint() DEFAULT NULL,

  `score` float DEFAULT NULL,

  `typ` varchar() CHARACTER SET latin1 DEFAULT NULL,

  `baseUrl` varchar() CHARACTER SET latin1 DEFAULT NULL,

  `content` mediumblob,

  `title` varchar() DEFAULT NULL,

  `reprUrl` varchar() CHARACTER SET latin1 DEFAULT NULL,

  `fetchInterval` int() DEFAULT NULL,

  `prevFetchTime` bigint() DEFAULT NULL,

  `inlinks` mediumblob,

  `prevSignature` blob,

  `outlinks` mediumblob,

  `fetchTime` bigint() DEFAULT NULL,

  `retriesSinceFetch` int() DEFAULT NULL,

  `protocolStatus` blob,

  `signature` blob,

  `metadata` blob,

  PRIMARY KEY (`id`)

) ENGINE=InnoDB DEFAULT CHARSET=utf8;

/*!40101 SET character_set_client = @saved_cs_client */;

/*!40103 SET TIME_ZONE=@OLD_TIME_ZONE */;

/*!40101 SET SQL_MODE=@OLD_SQL_MODE */;

/*!40014 SET FOREIGN_KEY_CHECKS=@OLD_FOREIGN_KEY_CHECKS */;

/*!40014 SET UNIQUE_CHECKS=@OLD_UNIQUE_CHECKS */;

/*!40101 SET CHARACTER_SET_CLIENT=@OLD_CHARACTER_SET_CLIENT */;

/*!40101 SET CHARACTER_SET_RESULTS=@OLD_CHARACTER_SET_RESULTS */;

/*!40101 SET COLLATION_CONNECTION=@OLD_COLLATION_CONNECTION */;

/*!40111 SET SQL_NOTES=@OLD_SQL_NOTES */;

-- Dump completed on --  ::

2、安装nutch2.1
A、 nutch下载地址：http://apache.etoak.com/nutch/2.1/apache-nutch-2.1-src.zip

下载完成后家压缩，

B、以下将nutch的根目录定位${APACHE_NUTCH_HOME}.

C、配置nutch对mysql的支持，修改${APACHE_NUTCH_HOME}/ivy/ivy.xml文件

将这行的注释取消default”/<

修改${APACHE_NUTCH_HOME}/conf/gora.properties文件，

注释默认存储配置

[html]view plain copy print ?

###############################
# Default SqlStore properties #
###############################
#gora.sqlstore.jdbc.driver=org.hsqldb.jdbc.JDBCDriver
#gora.sqlstore.jdbc.url=jdbc:hsqldb:hsql://localhost/nutchtest
#gora.sqlstore.jdbc.user=sa
#gora.sqlstore.jdbc.password=
取消以下代码注释，
###############################
# MySQL properties
################################
gora.sqlstore.jdbc.driver=com.mysql.jdbc.Driver
gora.sqlstore.jdbc.url=jdbc:mysql://localhost:3306/nutch?createDatabaseIfNotExist=true
gora.sqlstore.jdbc.user=xxxxx（mysql用户名）
gora.sqlstore.jdbc.password=xxxxx（mysql密码）

D、修改${APACHE_NUTCH_HOME}/conf/nutch-site.xml 加入如下代码：

[html]view plain copy print ?

property<

name<http.agent.namename<

value<Your Nutch Spidervalue<

property<

property<

name<http.accept.languagename<

value<ja-jp, en-us,en-gb,en;q=0.7,*;q=0.3value<

description<Value of the “Accept-Language” request header field.

This allows selecting non-English language as default one to retrieve.

It is a useful setting for search engines build for certain national group.

description<

property<

property<

name<parser.character.encoding.defaultname<

value<utf-8value<

description<The character encoding to fall back to when no other information

is availabledescription<

property<

property<

name<storage.data.store.classname<

value<org.apache.gora.sql.store.SqlStorevalue<

description<The Gora DataStore class for storing and retrieving data.

Currently the following stores are available: ….

description<

property<

E、使用ant编译 ${APACHE_NUTCH_HOME} 。

F、设置待抓取的网站

cd ${APACHE_NUTCH_HOME}/runtime/local
mkdir -p urls
echo 'http://nutch.apache.org/' < urls/seed.txt

G、执行爬行操作： bin/nutch crawl urls -depth 3 -topN 5

执行完在mysql中即可以查看到爬虫抓取的内容

3、安装solr，对nutch抓取的内容进行索引

（注意：参考资料中推荐使用solr4.0版本，4.0的两个版本我都试了，没有成功，所以替换为3.6.1版本）

solr下载地址：http://www.fayea.com/apache-mirror/lucene/solr/3.6.1/apache-solr-3.6.1.zip

A、解压缩下载包，

B、下载 http://nlp.solutions.asia/wp-content/uploads/2012/08/schema.xml替换${APACHE_SOLR_HOME}/example/solr/conf/schema.xml.

C、启动solr

cd ${APACHE_SOLR_HOME}/example

java -jar start.jar

D、在浏览器输入地址http://localhost:8983/solr 测试是否启动成功。

E、另起linux终端，输入如下命令，使solr对nutch抓取内容进行索引。

cd ${APACHE_NUTCH_HOME}/runtime/local/

bin/nutch solrindex http://127.0.0.1:8983/solr/ -reindex

4、测试

在浏览器输入 http://localhost:8983/solr ，看到如下界面：

在文本框中输入 content:nutch 点击查询，便可查处内容中包含nutch关键字的网页

Nutch2.1+mysql+solr3.6.1+中文网站抓取的更多相关文章

[转]使用Scrapy建立一个网站抓取器
英文原文:Build a Website Crawler based upon Scrapy 标签: Scrapy Python 209人收藏此文章, 我要收藏renwofei423 推荐于 11个月 ...
PHP登入网站抓取并且抓取数据
有时候需要登入网站,然后去抓取一些有用的信息,人工做的话,太累了.有的人可以很快的做到登入,但是需要在登入后再去访问其他页面始终都访问不了,因为他们没有带Cookie进去而被当做是两次会话.下面看看代 ...
sciencedirect 网站抓取过程
开发环境 C#+SQLite 软件使用教程: 设置页面 1. 首先录入需要查询的关键词,如果需要根据年去查询,可以勾选对应的年,支持多个年份查询.点击[设置关键字]按钮,把待查询关键 ...
c#使用WebClient登录网站抓取登录后的网页
C#登录网站实际上就是模拟浏览器提交表单,然后记录浏览器响应返回的会话Cookie值,再次发送请求时带着这个会话cookie值去请求就可以实现模拟登录的效果了. 如下类CookieAwareWebCl ...
wget整站抓取、网站抓取功能；下载整个网站；下载网站到本地
wget -r -p -np -k -E http://www.xxx.com 抓取整站 wget -l 1 -p -np -k http://www.xxx.com 抓取第一级 - ...
Nutch 2.2+MySQL+Solr4.2实现网站内容的抓取和索引
原文地址: http://blog.sina.com.cn/s/blog_3c9872d00101p4f0.html Nutch 2.2.1发布快两月了,该版本与Nutch之前版本相比,有较大变化,特 ...
【转】详解抓取网站，模拟登陆，抓取动态网页的原理和实现（Python，C#等）
转自:http://www.crifan.com/files/doc/docbook/web_scrape_emulate_login/release/html/web_scrape_emulate_ ...
windows环境下nutch2.x 在eclipse中实现抓取数据存进mysql详细步骤
nutch2.x 在eclipse中实现抓取数据存进mysql步骤最近在研究nutch,花了几天时间,也遇到很多问题,最终结果还是成功了,在此记录,并给其他有兴趣的人提供参考,共同进步. 对nutc ...
nutch2.1+mysql+elasticsearch整合linux单机部署
这次主要介绍下nutch2.1和mysql和elasticsearch的整合,是在单机上运行,并不是分布式部署.1.下载nutch2.1 nutch下载地址:http://labs.mop.com/a ...

随机推荐

ajax后台跳转无效的原因
Ajax只是利用脚本访问对应url获取数据而已,不能做除了获取返回数据以外的其它动作了.所以浏览器端是不会发起重定向的. 1)正常的http url请求,只有浏览器和服务器两个参与者.浏览器端发起一个 ...
STL源码剖析——空间配置器Allocator#1 构造与析构
以STL的运用角度而言,空间配置器是最不需要介绍的东西,因为它扮演的是幕后的角色,隐藏在一切容器的背后默默工作.但以STL的实现角度而言,最应该首先介绍的就是空间配置器,因为这是这是容器展开一切运作的 ...
python — 线程
目录 1.线程基础知识 2 Thread 类 3 锁 4 队列 1.线程基础知识 1.1 进程与线程的区别进程: 创建进程时间开销大销毁进程时间开销大进程之间切换时间开销大线程: 线程是 ...
PAT(B) 1084 外观数列（Java）
题目链接:1084 外观数列 (20 point(s)) 题目描述外观数列是指具有以下特点的整数序列: d, d1, d111, d113, d11231, d112213111, - 它从不等于 ...
【HC89S003F4开发板】 6crc校验
HC89S003F4开发板crc校验前言第一次用有带crc的mcu 使用资料自带的demo @实现效果通过PC向MCU发送5个8位数据,MCU返回CRC校验值 void main() { /** ...
mongodb 启动及创建用户
1. 守护进程启动,参考: https://blog.csdn.net/jj546630576/article/details/81117765 2. 用户管理参考: https://www.cnbl ...
vsCode 代码不高亮显示的问题——安装Vetur插件
vsCode 代码不高亮显示: 解决办法:安装Vetur插件点击左侧菜单的扩展-->搜索Vetur-->点击安装-->安装完成重启vsCode
【SQL Server高可用性】数据库复制：SQL Server 2008R2中通过数据库复制，把A表的数据复制到B表
原文:[SQL Server高可用性]数据库复制:SQL Server 2008R2中通过数据库复制,把A表的数据复制到B表经常在论坛中看到有人问数据同步的技术,如果只是同步少量的表,那么可以考虑使 ...
关于 false sharing
问题来源在多线程操作中,每个线程对操作对象都会有单独的缓存,最后将缓存同步到内存上,不加锁的话会导致数据缺乏同步出现错误,如果只是简单地加锁,性能就会飞速下降解法 spacing &&am ...
ABP 基于DDD的.NET开发框架学习（二）创建实体
1.创建模型类打开.Core项目,新建新建一个项目文件夹(Demo);为了演示表关联及外键的使用,创建两个类:创建类ClothesCategoty.csusing Abp.Domain.Entitie ...

Nutch2.1+mysql+solr3.6.1+中文网站抓取

Nutch2.1+mysql+solr3.6.1+中文网站抓取的更多相关文章

随机推荐

热门专题