oracle全文检索
全文检索
oracle对使用几十万以上的数据进行like模糊查询速度极差,包括 like 'AAA%' ,like '%AAA',like '%AAA%',like '%A%A%'的那些模糊查询。网上有很多文章讲到如何提高like查询,提到 like 'AAA%'能够使用到索引,而like '%AAA' ,使用创建反向函数的索引来提高查询效率。
为了解决大数据情况下的模糊查询速度慢的问题,oracle创建了全文检索技术.
即通过Oracle专利的词法分析器(lexer),将文章中所有的表意单元(Oracle称为term)找出来,记录在一组以dr$开头的表中,同时记下该term出现的位置、次数、hash值等信息。检索时,Oracle从这组表中查找相应的term,并计算其出现频率,根据某个算法来计算每个文档的得分(score),即所谓的‘匹配率’。而lexer则是该机制的核心,它决定了全文检索的效率。
oracle有三个基本的分词器
-- basic_lexer 针对英文,因为英文都用空格和标点分词,纯英文时建议用它
-- chinese_vgram_lexer 针对中文,支持所有汉字字符集,以字词为单元,分词较机械
-- chinese_lexer 针对中文,只支持utf8字符集,只认高频常用字词,效率更高,中文时建议用它.
数数据量达到百万级别以上时,在单列上建立的全文索引相比普通索引的查询速度那将是天差地别的.
准备工作
在使用前如果以下语句不能正常执行,那定是DBA没有给该User赋权限.
1检查和设置数据库角色
首先检查数据库中是否有CTXSYS用户和CTXAPP脚色。如果没有这个用户和角色,意味着你的数据库创建时未安装intermedia功能。你必须修改数据库以安装这项功能。默认安装情况下,ctxsys用户是被锁定的,因此要先启用ctxsys的用户。
ctxsys用户默认是被锁定的且密码即时失效,所以我们以sys用户进入em,然后修改ctxsys用户的状态和密码。
2赋权
以abc用户下的tbl_my_lex表为例.
先以sys用户DBA身份登录,对abc赋resource,connect权限:
GRANT resource, connect to abc;
再以ctxsys用户登录并对abc用户赋权
GRANT ctxapp to abc; GRANT execute ON ctxsys. ctx_cls TO abc; GRANT execute ON ctxsys. ctx_ddl TO abc; GRANT execute ON ctxsys. ctx_doc TO abc; GRANT execute ON ctxsys. ctx_output TO abc; GRANT execute ON ctxsys. ctx_query TO abc; GRANT execute ON ctxsys. ctx_report TO abc; GRANT execute ON ctxsys. ctx_thes TO abc; GRANT execute ON ctxsys. ctx_ulexer TO abc;
基本语法
然后以abc用户登录 :
conn abc/abc;
--------------------------------------------------------------------------------------
-- 建表 Create table tbl_my_lex (id number primary key, info varchar2(1000)); Insert into tbl_my_lex values (1, 'this is a example for the basic_lexer'); Insert into tbl_my_lex values (2, 'he following example sets Printjoin characters '); Insert into tbl_my_lex values (3, 'To create the INDEX with no_theme indexing '); Insert into tbl_my_lex values (4, '中华人民共和国'); Insert into tbl_my_lex values (5, '中国淘宝软件'); Insert into tbl_my_lex values (6, '测试basic_lexer 是否支持中文'); Commit;
--------------------------------------------------------------------------------------
-- 创建一个名为my_chinese_lexer的chinese_lexer格式的分词器 Begin ctx_ddl.create_preference('my_chinese_lexer', 'chinese_lexer'); End; /
--------------------------------------------------------------------------------------
-- 对tbl_my_lex这张表的info列的信息建立一个名为IDX_TBL_COL的索引 Create index IDX_TBL_COL on tbl_my_lex (info) indextype is ctxsys.context parameters ('lexer my_chinese_lexer');
--------------------------------------------------------------------------------------
-- 以刚才建立的全文索引方式进行查询 Select * from tbl_my_lex where contains(info, '中国') > 0;
--------------------------------------------------------------------------------------
↑↑↑↑↑↑↑↑↑↑↑↑↑↑↑如果表是死的不会增删,那么到此为止就够了↑↑↑↑↑↑↑↑↑↑↑↑↑↑↑↑↑↑↑↑↑↑↑
↓↓↓↓↓↓↓↓↓↓↓↓↓↓↓如果表是活的,会动态增加,那么继续往下看↓↓↓↓↓↓↓↓↓↓↓↓↓↓↓↓↓↓↓↓↓↓↓↓↓
-- 存过1,同步索引,即把新增的记录,添加到索引的检索范围 begin ctx_ddl.sync_index('IDX_TBL_COL'); end; / -- 意为如果新增一行记录,不用ctx_ddl .sync_index, -- 直接 Select * from tbl_my_lex where contains(info, '中国') > 0;查到的结果是不会改变的
--------------------------------------------------------------------------------------
-- 存过2,同步索引,即把删除的记录,踢出索引的检索范围 begin ctx_ddl.optimize_index('INX_CUSTOMINFO_ADDR_DOCS', 'FAST'); end; / -- 意为如果删除一行记录,不用ctx_ddl .sync_index, -- 直接 Select * from tbl_my_lex where contains(info, '中国') > 0;查到的结果是不会改变的
--------------------------------------------------------------------------------------
-- 网上文章说: 65万记录的一个表建立索引只需要20分钟,同步一次约1分钟 -- 所以对存过1和存过2作job定时是很有必要的.
-- 其它语句
--------------------------------------------------------------------------------------
-- 删除一个名为my_chinese_lexer的chinese_lexer格式的分词器 Begin ctx_ddl.drop_preference('my_chinese_lexer'); End; /
--------------------------------------------------------------------------------------
DROP INDEX IDX_TBL_COL FORCE; -- 强行删除索引
--------------------------------------------------------------------------------------
参考
http://chaoji-liangbin.blog.163.com/blog/static/252392122010915101351354/
http://blog.chinaunix.net/uid-14107-id-2844042.html
http://blog.itpub.net/15962/viewspace-1005675/
oracle全文检索的更多相关文章
- oracle 全文检索
一.使用 sys 用户登录oracle (1)运行—cmd—sqlplus — sys/密码 @连接字符 as sysdba 二.授权 1.grant ctxapp to 全文检索使用用户: 2.gr ...
- 找到一篇关于 Oracle 全文检索实践 的文章
http://www.iteye.com/topic/1118055 有详细的例子记录了Oracle 全文检索的使用.
- oracle 全文检索创建脚本示例
--创建全文索引 grant execute on ctx_ddl to username;--使用其他帐号对username授权exec ctx_ddl.create_preference('my_ ...
- oracle全文检索【转】【补】
全文检索 oracle对使用几十万以上的数据进行like模糊查询速度极差,包括 like 'AAA%' ,like '%AAA',like '%AAA%',like '%A%A%'的那些模糊查询.网上 ...
- oracle 全文检索技术
1.查看用户: select * from dba_users WHERE username='CTXSYS';select * from dba_users WHERE username='CTXS ...
- 转 Oracle全文检索http://docs.oracle.com/cd/E11882_01/text.112/e24436/toc.htm
SQL > exec ctx_ddl.create_preference ('my_test_lexer','chinese_lexer') : PL/SQL 过程成功完成 SQL > E ...
- oracle全文检索笔记
1.删除词法解析器 exec ctx_ddl.drop_preference('my_lexer'); 2.创建中文词法解析器 exec ctx_ddl.create_preference ('my_ ...
- 写给大忙人的Elasticsearch架构与概念(未完待续)
最新版本官方文档https://www.elastic.co/guide/en/elasticsearch/reference/current/index.html文档增删改参考https://www ...
- 全文检索- Oracle/MySql/达梦
简单使用语法: MySql: ALTER TABLE dataset_ods ENGINE = MyISAM; //5.6后的InnoDB支持全文索引 ALTER TABLE dataset_ods ...
随机推荐
- 【转载】ANSYS有限元分析中的单位问题
原文地址:http://www.cnblogs.com/ylhome/archive/2009/02/26/1398756.html ansys中没有单位的概念,只要统一就行了.所以,很多人在使用时, ...
- C#中动态读写App.config配置文件
转自:http://blog.csdn.net/taoyinzhou/article/details/1906996 app.config 修改后,如果使用cofnigurationManager立即 ...
- CVE-2014-6271 Bash漏洞利用工具
CVE-2014-6271 Bash漏洞利用工具 Exploit 1 (CVE-2014-6271) env x='() { :;}; echo vulnerable' bash -c "e ...
- ubuntu12.04+kafka2.9.2+zookeeper3.4.5的伪分布式集群安装和demo(java api)测试
博文作者:迦壹 博客地址:http://idoall.org/home.php?mod=space&uid=1&do=blog&id=547 转载声明:可以转载, 但必须以超链 ...
- LVS-DR工作原理图文详解
为了阐述方便,我根据官方原理图另外制作了一幅图,如下图所示:VS/DR的体系结构: 我将结合这幅原理图及具体的实例来讲解一下LVS-DR的原理,包括数据包.数据帧的走向和转换过程. 官方的原理说明:D ...
- python模块介绍- SocketServer 网络服务框架
来源:https://my.oschina.net/u/1433482/blog/190612 摘要: SocketServer简化了网络服务器的编写.它有4个类:TCPServer,UDPServe ...
- NBU AIX ORACLE10G RAC恢复到AIX单实例(表空间恢复)
ln -s /usr/openv/netbackup/bin/libobk.a64 /oraclev3/product/10.2.0/lib/libobk.a不建软连接会报如下错误: using ta ...
- 玩转单元测试之WireMock -- Web服务模拟器
玩转单元测试之WireMock -- Web服务模拟器 WireMock 是一个灵活的库用于 Web 服务测试,和其他测试工具不同的是,WireMock 创建一个实际的 HTTP服务器来运行你的 We ...
- ubuntu下基于sqlite3后台的php环境的搭建
最近准备把公司的服务器换成linux 数据库sqlite3 搭建过程记录如下: 1 sqlite3安装.. apt-get install sqlite 2.PHP服务器搭建. apt-get ins ...
- loadrunner 功能详解(一) - Run-time Settings
1.General / Run Logic Number of Iterations:说明的是反复循环的次数. 常境的时间中,如果时间设为5分钟,而实际上程序的运行只需要1分钟,而在这项中,选择的是 ...