Joe Armstrong的访谈中有一段关于"打开黑盒子"的阐述,给我留下很深的印象:Joe Armstrong在做XWindows开发时没有使用对应的类库,而是在了解XWindows底层实现后选择了直接和套接字通信,"把这20条消息映射到Erlang术语上,变个小魔术，然后可以向窗口直接发送消息，它们就开始执行动作了". [访谈全文] 回到今天的任务:Erlang使用Solr服务?当问题落实到数据通信协议的时候,就豁然开朗了,转换为我们熟悉的技术方案组合.先看下Solr的简介:

Solr

Solr (pronounced "solar") is an open source enterprise search platform from the Apache Lucene project. Its major features include full-text search, hit highlighting, faceted search, dynamic clustering, database integration, and rich document (e.g., Word, PDF) handling. Providing distributed search and index replication, Solr is highly scalable. Solr is the most popular enterprise search engine. Solr 4 adds NoSQL features. Solr is written in Java and runs as a standalone full-text search server within a servlet container such as Apache Tomcat or Jetty. Solr uses the Lucene Java search library at its core for full-text indexing and search, and has REST-like HTTP/XML and JSON APIs that make it usable from most popular programming languages. Solr's powerful external configuration allows it to be tailored to many types of application without Java coding, and it has a plugin architecture to support more advanced customization.

2014-2-17 15:03:21 补充一点Solr的东西:

Solr 可以做到 NEAR-Real-time Search , 这个应该归功于softcommit
Solr 4 之前的版本只有提交到Lucene索引才能检索到,现在可以做到Real Time Get;换句话话说一个刚刚提交的数据,还没有Commit,现在是可以做修改的;能够做到这点是因为Transcation log,数据提交到Solr会写入transaction log.这个设计解耦了update durability和update visibility
目前Solr 4.x还是需要以文档为单位进行数据更新,重新做索引;换句话说新增字段的时候每条数据都要重新处理,重新做索引
Solr在任意时刻只有一个Active Searcher,Active Searcher有一份只读的Lucene索引快照.换句话说,当有新内容提交到Solr之后,这条数据对当前的Searcher是不可见的;新条目从不可见到可见:关闭当前的Searcher然后打开一个新的Searcher,新的Searcher会加载最新的索引的快照;这就是我们Commit数据到Solr的本质,关闭Old Searcher的时候会等把当前in-progress请求全部处理完;Old Searcher中缓存的数据也会被清理掉,这样是有道理的,有的数据可能已经删除了,可能有新数据了;New Searcher需要做一些预计算,所以Solr会有一个Warming Searcher的设计:等待New Searcher预热完毕再关闭之前的Searcher,这样搜索性能不会有明显的下降,对于Solr重新启动的情况,要看useColdSearcher是否开启,如果是false那就要阻塞到Searcher完成预热;Warming Searcher有两种方式:1.从old cache复制 2.执行cache warming queries,这个语句是开发者根据自己的业务定制的,不能用默认的;因为开启之后会有性能损失,默认是注释掉的,由开发者根据实际情况执行定制;一旦达到maxWarmingSearchers的数量上限,Commit就会失败,预热太多个Searcher会消耗CPU和Memeory;
filtercache相当于缓存了若干数据分组结果,但是如果数据分组数量有限,命中率太低,那效果可以想象非常差;这个策略如果使用不当,就会浪费内存,比如:过滤条件过于复杂极小概率命中;solrconfig.xml中有对应的配置节,可以配置autowarmcount,自动预热是从old searcher中提取一些语句在new searcher中执行;autowarm会影响new searcher的启动速度,如果commit比较快,要求不停的创建新的searcher,就悲剧了;所以autowarmcount设置的值一般比较小;
queryResultWindowsSize 可以预取分页数据.queryResultMaxDocsCached 每条检索语句最多返回多少条文档;enableLazyFieldLoading可以优化取文档部分字段的情况,延迟加载的字段在用到的时候再请求;
segement merging是怎么回事?一份Luncene索引由若干个Segement构成,每一个查询都要在所有的Segement里面拿结果,Segment太多会影响性能;所以需要用合并机制

搭建全文搜索服务Solr的确是一个不错的选择,分分钟就可以搭建起来Solr的环境,配置好IK什么的,那Erlang应用如何使用Solr服务呢?从上面维基百科的介绍中,我们可以捕捉到一些信息:REST-full API,XML,JSON,HTTP.看到这里已经全是我们熟悉的技术方案了,我们深入进去看下:

esolr

2008年ppolv (Pablo Polvorin)在trapexit.org提交了一个Solr的功能模块,[地址: http://forum.trapexit.org/viewtopic.php?t=13059 ],完成了操作Solr的基本功能:

|> Add/Update documents esolr:add/2
|> Delete documents esolr:delete/2
|> Search esolr:search/3

先看看怎么使用这些上面的接口:

%% 测试代码

-module(t).

-compile(export_all).

start()->

   SearchUrl="http://192.168.0.160:8080/solr/hear_me/select",

   UpdateUrl="http://192.168.0.160:8080/solr/hear_me/update",

   MltUrl="http://192.168.0.160:8080/solr/hear_me/mlt",

   {ok,Pid}=esolr:start([{select_url, SearchUrl}, {update_url, UpdateUrl}, {morelikethis_url, MltUrl}]),

   Pid.

search(SolrPid)->

  esolr:search("",[{fields,"*,*"}],SolrPid).

add(SolrPid) ->

   esolr:add([{doc,[{id,"ai234"}, {text,<<"Look me mom!, I'm searching now">>}]}],SolrPid),

   esolr:add([{doc,[{id,"a3456"}, {text,<<"Look me mom!, I'm searching now">>}]}],SolrPid),

   esolr:commit(SolrPid).

测试结果如下:

Eshell V5.  (abort with ^G)

> P=t:start().

<..>

> t:add(P).

ok

> esolr:search("searching",[{fields,"*,*"}],P).

{ok,[{"numFound",},{"start",}],

    [{doc,[{"id",<<"ai234">>},

           {"_version_",}]},

     {doc,[{"id",<<"a3456">>},

           {"_version_",}]}],

    []}

> t:search(P).

{ok,[{"numFound",},{"start",}],

    [{doc,[{"c_type",},

           {"c_tags",

            [<<"å¥³äºº">>,

             <<,,,,,>>,

             <<"å®¶åº">>,

             <<,,,,,>>,

             <<,,,,,,,,>>,

             <<,,,,,,,,>>,

             <<,,,,,>>,

             <<,,,,,>>,

             <<,,,,,>>]},

           {"c_pub_date",<<"2013-07-12T16:29:11.593Z">>},

           {"id",<<"">>},

           {"_version_",}]},

     {doc,[{"c_type",},

           {"c_tags",

            [<<,,,,,>>,

             <<,,,,,>>,

             <<,,,,,>>,

             <<,,,,,>>,

             <<,,,,,>>,

             <<,,,,,>>,

             <<,,,,,>>,

 ..... ...

代码实现　

翻开代码,下面这个方法包含了大部分技术要点:

make_post_request(Request,PendingInfo,

State=#esolr{update_url=URL,pending=P,auto_commit=AC,dirty=Dirty},

Timeout) ->

     {ok,RequestId} = httpc:request(post,{URL,[{"connection", "close"}],"text/xml",Request},[{timeout,Timeout}],[{sync,false}]),

     Pendings = gb_trees:insert(RequestId,PendingInfo,P),

     if

          (AC == always) and Dirty ->

                      CommitRequest = encode_commit(),

                      {ok,C_RequestId} = httpc:request(post,{URL,[{"connection", "close"}],"text/xml",CommitRequest},

                                                    [{timeout,State#esolr.commit_timeout}],[{sync,false}]),

                      Pendings2 = gb_trees:insert(C_RequestId,{auto,auto_commit},Pendings),

                      error_logger:info_report([{auto_commit,send}]),

                        {noreply,State#esolr{pending=Pendings2,dirty=false}};

          true -> {noreply,State#esolr{pending=Pendings}}

     end.

首先在init阶段开启了inets:start(),make_post_request发起HTTP请求靠的是httpc,每一次请求之后都会把RequestId和请求发起者({From,_}里面的From)对应关系存储到gb_tree.在后面的handle_info代码段,可以看到对HTTPResponse的消息的接收.

% @hidden

handle_info({http,{RequestId,HttpResponse}},State = #esolr{pending=P}) ->

     case gb_trees:lookup(RequestId,P) of

          {value,{Client,RequestOp}} -> handle_http_response(HttpResponse,RequestOp,Client),

                              {noreply,State#esolr{pending=gb_trees:delete(RequestId,P)}};

          none -> {noreply,State}

                    %% the requestid isn't here, probably the request was deleted after a timeout

     end;

parse_search_response(Response,Client) ->

     {value,{"response",{obj,SearchRespFields}},RestResponse} = lists:keytake("response",1, Response),

     {value,{"docs",Docs},RespFields} =  lists:keytake("docs",1,SearchRespFields),

     gen_server:reply(Client,{ok,RespFields,[{doc,DocFields} || {obj,DocFields}<-Docs],RestResponse}).

在parse_search_response方法里面gen_server:reply调用最终完成了对请求的应答.

XML & Json

既然要处理XML,当然要用到xmerl模块了,encode_*系列模块基本上都是用它完成数据的encode,比如:

Eshell V5..  (abort with ^G)

> xmerl:export_simple([{commit,[]}],xmerl_xml).

["<?xml version=\".\"?>",[["<","commit","/>"]]]

>

HTTPResponse解析还会用到xmerl_scan,xmerl_xpath

handle_http_response({{_HttpV,,_Reason},_Headers,Data},Op,Client) ->

     {Response,[]} = xmerl_scan:string(binary_to_list(Data)),

     [Header] = xmerl_xpath:string("/response/lst[@name='responseHeader']",Response),

     case parse_xml_response_header(Header) of

          {ok,QTime} ->  parse_xml_response(Op,Response,QTime,Client);

          {error,Error} ->  response_error(Op,Client,Error)

     end;

除了XML之外,还要解析JSON,这里使用的是RFC4627.

扩展

这个简单的功能模块,呃,是不是太简陋了?而且你会发现代码太老了?这段代码后续被修改应用在了Zotontic项目实现搜索功能,之前盘点Erlang Web Server和Web Framework的时候提到过这个CMS系统 [地址:https://github.com/arjan/mod_search_solr] 这个项目里面把原有代码做了重构,并增加了很多实用的接口比如翻页 "MoreLikeThis"功能封装.可以在Github上获取代码试一下,Zotontic的代码略显庞大,只取必需的模块编译即可;

ok,今天就到这里.

最后小图一张 Miss Nine

[Erlang 0104] 当Erlang遇到Solr的更多相关文章

Erlang基础 -- 介绍 -- Erlang特点
前言 Erlang是具有多重范型的编程语言,具有很多特点,主要的特点有以下几个: 函数式并发性分布式健壮性软实时热更新递增式代码加载动态类型解释型函数式 Erlang是函数式编程语言 ...
Archive for the ‘Erlang’ Category 《Erlang编程指南》读后感
http://timyang.net/category/erlang/ 在云时代,我们需要有更好的能利用多核功能及分布式能力的编程语言,Erlang在这方面具有天生的优势,因此我们始终对它保持强烈关注 ...
[Erlang 0057] Erlang 排错利器: Erlang Crash Dump Viewer
http://www.cnblogs.com/me-sa/archive/2012/04/28/2475556.html Erlang Crash Dump Viewer真的是排错的天兵神器,还记得我 ...
[Erlang 0124] Erlang Unicode 两三事 - 补遗
最近看了Erlang User Conference 2013上patrik分享的BRING UNICODE TO ERLANG!视频,这个分享很好的梳理了Erlang Unicode相关的问题,基本 ...
erlang 在线生成crashdump
一般说来抓dump 4种方式: 1. erlang:halt(“abort”). 2. 在erlang shell下输入CTRL C + “大写的A” 3.等着进程崩溃 ...
erlang 故障排查工具
系统级别perf top, dstat -tam, vtune 都能很好分析beam 瓶颈,本文主要erlang 级别排查: 1. 反编译确认线上运行代码是否正确,reltools没掌握好,升级偶尔 ...
erlang 虚机crash
现网服务,每次更新一个服务时,另外一个集群所有node 都跟着同时重启一遍,这么调皮,这是闹哪样啊.. 看系统日志:/var/log/messages Oct 30 15:19:41 localhos ...
[Erlang 0105] Erlang Resources 小站 2013年1月~6月资讯合集
很多事情要做,一件一件来; Erlang Resources 小站 2013年1月~6月资讯合集,方便检索. 小站地址: http://site.douban.com/204209/ ...
[Erlang 0107] Erlang实现文本截断
抽时间处理一下之前积压的一些笔记.前段时间有网友 @稻草人问字符串截断的问题"各位大侠 erlang截取字符串一般用哪个函数啊",有人支招用string:substr/3, ...

随机推荐

MySQL常见错误
1. TokuFT file system space is really low and access is restricted 解决方法:修改tokudb_fs_reserve_percent参 ...
精彩 .NET 2015
英文原文:Understanding .NET 2015 Understanding 翻译为了解或理解,对于 .NET 来说,2015 年注定会更加精彩,所以标题就用了"精彩"这个 ...
三行代码接入，社交软件打字时底下弹出的表情布局,自定义ViewPager+页面点标+各种功能的android小框架。
(转载请声明出处:http://www.cnblogs.com/linguanh/) 前言: 接上次分享的 ListView 动态加载类,入口:http://www.cnblogs.com/lingu ...
[无聊的事-连载之连开100个VS] 折腾你的骚机吧，骚年们！！！
[无聊的事-连载之连开100个VS] 折腾你的骚机吧,骚年们!!! 只有8G内存的,用这个:打开你的CMD命令提示符如果只装了Visual Studio 2010,用这条命令,打开50个VSfor / ...
解决asp.net mvc的跨域请求问题
web.config中配置如下内容: <system.webServer> <httpProtocol> <customHeaders> <add name= ...
.NET正则表达式基础入门（一）
字符组正则表达式的字符组十分简单,就是列出你所想要匹配的字符.阅读本章前,建议先下载我于CSDN上传的示例代码,下载无需分数,下载链接. 1.普通字符组普通字符组,列出所有你需要匹配的字符. 例如 ...
【原创】SQL常用函数
--值类型转换 ) --时间差 ,GETDATE()),GETDATE()) --加减指定时间 ,GETDATE()) --获取系统日期 select GETDATE() --生成不重复Id sele ...
【Java每日一题】20161219
package Dec2016; import java.util.Arrays; public class Ques1219 { public static void main(String[] a ...
PHP intval()
定义和用法获取变量的整数值,允许以使用特定的进制返回.默认10进制注:如果参数为整数,则不做任何处理. 语法 intval (var, base) 参数描述 var 必须.可以是任何标量类型. ...
rabbitmq trace 日志的使用以及其疑惑之处
RabbitMQ 默认日志里只有类似客户端"accpet/close"等信息,对于有异常或者跟踪消息内部结构就比较麻烦了. 不过MQ有个rabbitmq_tracing插件,安装该 ...

[Erlang 0104] 当Erlang遇到Solr

Solr

esolr

扩展

[Erlang 0104] 当Erlang遇到Solr的更多相关文章

随机推荐

热门专题