SQL-一道特殊的字符串分解题目
本题不是一道直接的字符串拆解,
应用场景如下,表中有一个字段,是表示事件受影响的国家集合,使用逗号进行分隔,不幸的是,居然发现有些国家本身就带有逗号,这样在规范化的时候,如何准确地找到这些国家呢?
以下的代码是有一定限制的。但基本上够用。
下面的代码使用到了分析函数lag和lead还有cte,sqlserver2012及其以后的版本都支持,oracle好像10g以上就支持了。
主要思路:
字符串的分解,可以使用数字辅助表,然后cross join刷副本,然后根本分隔符出现的位置然后切豁字符串拆解到我们需要的东东。(解决方案中我使用的递归CTE来处理找到对应的位置)
现在还需要多加一步,就是对拆解的部分进行验证和去重不符合要求的那一部。
使用LAG和LEAD的好处,就是不需要再用自连接去找到对应的下一条数据了。
本题的解题原则是如何长项能连接到正确的国家,则取长项的,否则取短项的。
代码如下:
--准备示例表与数据 drop table my_countries; drop table valid_country; create table my_countries(rid int,country_name_cc varchar(200)); insert into my_countries(rid,country_name_cc) values(1,'china,test, public of'); insert into my_countries(rid,country_name_cc) values(2,'us, public of,china,Evan, public of'); create table valid_country(cid int, country_name varchar(30)); insert into valid_country(cid,country_name) values(1,'china'); insert into valid_country(cid,country_name) values(2,'test, public of'); insert into valid_country(cid,country_name) values(3,'Evan, public of'); insert into valid_country(cid,country_name) values(4,'us, public of'); insert into valid_country(cid,country_name) values(5,'Evan'); --select * from my_countries; --select * from valid_country;
正确的结果是:
WITH SPLIT_COUNTRY AS ( SELECT RID, 1 AS LVL, 1 AS STARTPOS, CHARINDEX(',',COUNTRY_NAME_CC+',')-1 AS ENDPOS FROM MY_COUNTRIES UNION ALL SELECT SC.RID, LVL+1 AS LVL, ENDPOS+2, CHARINDEX(',',COUNTRY_NAME_CC+',',ENDPOS+2)-1 FROM MY_COUNTRIES CC JOIN SPLIT_COUNTRY SC ON CC.RID=SC.RID WHERE CHARINDEX(',',CC.COUNTRY_NAME_CC+',',ENDPOS+2)>0 ) ,CTE_COUNTRY AS ( SELECT RID,LVL,STARTPOS,ENDPOS,LEAD(ENDPOS,1) OVER(PARTITION BY RID ORDER BY LVL) AS NEXTENDPOS FROM SPLIT_COUNTRY ) ,CTE AS ( SELECT MC.RID,SC.LVL, CASE WHEN NEXTENDPOS IS NOT NULL AND EXISTS (SELECT * FROM VALID_COUNTRY VC WHERE VC.COUNTRY_NAME = SUBSTRING(COUNTRY_NAME_CC,STARTPOS,NEXTENDPOS-STARTPOS+1)) THEN SUBSTRING(COUNTRY_NAME_CC,STARTPOS,NEXTENDPOS-STARTPOS+1) ELSE SUBSTRING(MC.COUNTRY_NAME_CC,STARTPOS,ENDPOS-STARTPOS+1) END AS COUNTRY FROM MY_COUNTRIES MC JOIN CTE_COUNTRY SC ON MC.RID=SC.RID ) ,CHECK_VALID AS ( SELECT CASE WHEN CHARINDEX(',',LAG(COUNTRY,1) OVER(PARTITION BY RID ORDER BY LVL))>0 THEN 0 ELSE 1 END AS ISVALID, * FROM CTE ) SELECT CV.RID,CV.COUNTRY,VC.CID FROM CHECK_VALID CV JOIN VALID_COUNTRY VC ON CV.COUNTRY = VC.COUNTRY_NAME AND ISVALID=1 ORDER BY RID;
另一种方案,在第一种的基础上稍加修改:
WITH SPLIT_COUNTRY AS ( SELECT RID, 1 AS LVL, 1 AS STARTPOS, CHARINDEX(',',COUNTRY_NAME_CC+',')-1 AS ENDPOS FROM MY_COUNTRIES UNION ALL SELECT SC.RID, LVL+1 AS LVL, ENDPOS+2, CHARINDEX(',',COUNTRY_NAME_CC+',',ENDPOS+2)-1 FROM MY_COUNTRIES CC JOIN SPLIT_COUNTRY SC ON CC.RID=SC.RID WHERE CHARINDEX(',',CC.COUNTRY_NAME_CC+',',ENDPOS+2)>0 ) ,CTE_COUNTRY AS ( SELECT RID,LVL,STARTPOS,ENDPOS,LEAD(ENDPOS,1) OVER(PARTITION BY RID ORDER BY LVL) AS NEXTENDPOS FROM SPLIT_COUNTRY ) ,CTE AS ( SELECT MC.RID,SC.LVL, SUBSTRING(MC.COUNTRY_NAME_CC,STARTPOS,ENDPOS-STARTPOS+1) AS COUNTRY, SUBSTRING(COUNTRY_NAME_CC,STARTPOS,NEXTENDPOS-STARTPOS+1) AS COUNTRY2 FROM MY_COUNTRIES MC JOIN CTE_COUNTRY SC ON MC.RID=SC.RID ) SELECT CTE.RID,VC.COUNTRY_NAME,VC.CID FROM CTE JOIN VALID_COUNTRY VC ON (CASE WHEN EXISTS(SELECT * FROM VALID_COUNTRY X WHERE X.COUNTRY_NAME=CTE.COUNTRY2) THEN CTE.COUNTRY2 ELSE CTE.COUNTRY END) = VC.COUNTRY_NAME ;
SQL-一道特殊的字符串分解题目的更多相关文章
- SQL Server中截取字符串常用函数
SQL Server 中截取字符串常用的函数: .LEFT ( character_expression , integer_expression ) 函数说明:LEFT ( '源字符串' , '要截 ...
- 使用List把一个长字符串分解成若干个短字符串
把一个长字符串分解成若干个固定长度的短字符串,由于事先不知道长字符串的长度,以及短字符串的数量,只能使用List. public static void get_list_sbody(String s ...
- sql server 查找包含字符串的对象
sql server 查找包含字符串的对象 SELECT sm.object_id, OBJECT_NAME(sm.object_id) AS object_name, o.type, o.type_ ...
- java字符串分解 StringTokenizer用法(比split()方法效率高)
Java中substring方法可以分解字符串,返回的是原字符串的一个子字符串.如果要讲一个字符串分解为一个一个的单词或者标记,StringTokenizer可以帮你. int countTokens ...
- SQL Server 中截取字符串常用的函数
SQL Server 中截取字符串常用的函数: 1.LEFT ( character_expression , integer_expression ) 函数说明:LEFT ( '源字符串' , '要 ...
- sql server中截取字符串的常用函数
我们如果要在sql server中,使用截取字符串的方法要怎样使用呢? sql server提供了3个常用截取字符串方法,LEFT().RIGHT().SUBSTRING() /****** Sql ...
- Sql动态查询拼接字符串的优化
Sql动态查询拼接字符串的优化 最原始的 直接写:string sql="select * from TestTables where 1=1";... 这样的代码效率很低的,这样 ...
- java字符串分解 StringTokenizer用法
Java中substring方法可以分解字符串,返回的是原字符串的一个子字符串.如果要讲一个字符串分解为一个一个的单词或者标记,StringTokenizer可以帮你. 先看个例子: 1 public ...
- XE4 TStringDynArray 比 c6 的TStringList 好用 字符串 分解 分割 转换 TByteDynArray
TStringDynArray 动态数组 字符串 分解 分割 System::DynamicArray<System::UnicodeString> TByteDynArray, ...
随机推荐
- 从零开始学习Linux(cp 命令)
功能: 复制文件或目录说明: cp指令用于复制文件或目录,如同时指定两个以上的文件或目录,且最后的目的地是一个已经存在的目录,则它会把前面指定的所有文件或目录复制到此目录中.若同时指定多个文件或目录, ...
- [javaSE] 练习队列线程和对象序列化
主要练习了队列数据结构,对象序列化和反序列化,多线程操作 import java.io.BufferedReader; import java.io.File; import java.io.File ...
- [python学习笔记]Day2
摘要: 对象 对于python来说,一切事物都是对象,对象基于类创建: 注:查看对象相关成员 var,type,dir 基本数据类型和序列 int内部功能 class int(object): def ...
- 关联规则-R语言实现
关联规则code{white-space: pre;} pre:not([class]) { background-color: white; }if (window.hljs && ...
- Java中的Set集合接口实现插入对象不重复的原理
在java的集合中,判断两个对象是否相等的规则是: 1).判断两个对象的hashCode是否相等 . 如果不相等,认为两个对象也不相等,完毕 如果相等,转入2)(这一点只是为了提 ...
- ArrayList,Hashtable,List<T>,Dictionary<K,V>
1.ArrayList ArrayList list = new ArrayList(); //for遍历 ; i < list.Count; i++) { SE se=(SE)list[i]; ...
- ahjesus Unity3D界面快捷键
F Frame selection Tab Shift focus between first column and second column (Two columns) Ctrl/Cmd + F ...
- IE浏览器中ajax使用缓存数据的问题
今天做了一个小功能:点击鼠标实时更新系统时间,采用ajax,过程很顺利,没遇到啥差错,谷歌,火狐,欧鹏一律通过,怀着忐忑的心情点开了IE8,果然,IE要对得起前端杀手的称号:更新不了时间. 查了一下这 ...
- 约瑟夫问题(c++实现)
描述:约瑟夫问题:有n只猴子,按顺时针方向围成一圈选大王(编号从1到n),从第1号开始报数,一直数到m,数到m的猴子退出圈外,剩下的猴子再接着从1 开始报数.就这样,直到圈内只剩下一只猴子时,这个猴子 ...
- 浅析LruCache原理
Android用LruCache来取代原来强引用和软引用实现内存缓存,因为据说自2.3以后Android将更频繁的调用GC,导致软引用缓存的数据极易被释放. LruCache使用一个LinkedHas ...