今天想学字符串hash是怎么弄的。就看到了这题模板题

http://acm.hdu.edu.cn/showproblem.php?pid=4622

刚开始当然不懂啦,然后就上网搜解法。很多都是什么后缀自动机那些。作为小白的我当然不懂啦,更重要的是我想学的是字符串hash这种解法呢?然而有这种解法,但是却都是只有代码,看起来很辛苦。所以这里我把我的理解写上来,当然有错误的话,请各路高手指出来,我也好好学习下~~

首先介绍一个字符串Hash的优秀映射函数:BKDRHash,这里hash一开始是等于0的

for(i=1 to lenstr)  hash = seed * hash + str[i]; 这是求解hash值的公式。绝大多数情况下能唯一确定字符串。seed是一个参数,一般取 31 、131、 1313、 13131、 131313、 etc..冲突比较小

经典题目:HDU 4622 Reincarnation

题意:给定一个长为2000个字符串,给出Q(Q<=10000)个询问。每个询问包含[L,R],要求算出这个区间内不同的子串的个数。

思路:暴力枚举区间长度L,从1开始枚举到lenstr,再枚举起点i即可。能在O(n2)的时间枚举完。但仅仅是枚举完,但这里并没有去重,这部分时间,我们用hash来完成,复杂度压到O(1)。什么叫去重呢?例如baba,当我们枚举第二个ba的时候,就要告诉我们”ba”在[1,4]中重复出现了一次,所以ans[1][4]--; //ans[L][R]就是表示区间内不同子串的个数了。

要枚举那么多子串,我们希望,对于任意给定的区间[L,R],都能快速地算出它的hash值是多少。例如求[3,4]的hash值,明显有 ans = seed * str[3] + str[4];(这是根据公式得到的。

那么我们先预处理一个前缀hash总和,记为sumHash[i]表示1~i的hash值。则有

sumHash[1] = str[1];                                            sunHash[2] = seed * str[1] + str[2];

sunHash[3] = seed * sumHash[2] + str[3];     sumHash[4] = seed * sumHash[3] + str[4];

把他们拆出来,即可得到[3,4]    ans = sumHash[4]  –  seed(R-L+1)  *  sumHash[2];

所以预处理两个数组,powseed[i]表示seed的i次方, sumHash[i]定义如上

然后就是怎么判断重复出现的问题了。我们知道那个hash值是唯一的,我们只能靠这个来判断是否重复出现,但是这个hash值很大,用map<ULL,int>来模拟是可以得,但是很慢。怎么办呢?我们可以用图,先把hash值%MOD压缩下,把他们加入到一幅图中,再开一个数组保存边的权值,用边的权值来和hash值判断相不相同,即可确定是否重复出现。

那个图没什么了不起的,就是为了返回出现的位置,不要被那个图吓到了。

下面代码可以300+ms

#include <cstdio>
#include <cstdlib>
#include <cstring>
typedef unsigned long long int ULL;
//BKDRHash,最优的字符串hash算法。hash一开始是等于0的
//for(i=1 to lenstr) hash = seed * hash + str[i]; 这是求解hash值的公式
//我们希望,对于任意给定的区间[L,R],都能快速地算出它的hash值是多少
//明显我们要算的是:例如[3,4] ans = seed * str[3] + str[4]
//那么我们先预处理一个前缀hash总和,记为sumHash[i]表示1~i的hash值
//sumHash[1] = str[1]; sunHash[2] = seed * str[1] + str[2];
//sunHash[3] = seed * sumHash[2] + str[3]; sumHash[4] = seed * sumHash[3] + str[4];
//拆出来,得到若要求[3,4] 既可以 ans = sumHash[4] - seed^(R-L+1) * sumHash[2]
//所以预处理两个数组,powseed[i]表示seed的i次方, sumHash[i]定义如上
const int seed = ; // 31 131 1313 13131 131313 etc..
const int maxn = +;
char str[maxn];
ULL powseed[maxn]; // seed的i次方 爆了也没所谓,sumHash的也爆。用了ULL,爆了也没所谓,也能唯一确定它,无符号
ULL sumHash[maxn]; //前缀hash值
int ans[maxn][maxn]; //ans[L][R]就代表ans,就是区间[L,R]内不同子串的个数
const int MOD = ;
struct StringHash
{
int first[MOD+],num; // 这里因为是%MOD ,所以数组大小注意,不是maxn
ULL EdgeNum[maxn]; // 表明第i条边放的数字(就是sumHash那个数字)
int next[maxn],close[maxn]; //close[i]表示与第i条边所放权值相同的开始的最大位置
//就比如baba,现在枚举长度是2,开始的时候ba,close[1] = 1;表明"ba"开始最大位置是从1开始
//然后枚举到下一个ba的时候,close[1]就要变成3了,开始位置从3开始了
void init ()
{
num = ; memset (first,,sizeof first);
return ;
}
int insert (ULL val,int id) //id是用来改变close[]的
{
int u = val % MOD; //这里压缩了下标,val是一个很大的数字,这里就有一个问题了,val是唯一的,因为它是从sumHash得到的
//那个hash算法很优秀,基本上val是唯一的了。现在我们想知道和val值相同的地方是哪里。又是上面那个例子了。baba。当我们
//枚举第二个ba的时候,我想知道它有没出现过,如果有,请放回它出现的位置。这里其实完全可以用map<ULL,int>book这样做,
//如果book[val] != 0,就代表出现过了,更新,返回就可以。但是非常慢,2800+ms,第二次提交还TLE
//所以我们逼不得已用图了,再加上其他辅助的数组.EdgeNum[]就是用来判断和val相不相同的。这样时间才降下来
for (int i = first[u]; i ; i = next[i]) //存在边不代表出现过,出现过要用val判断,val才是唯一的,边还是压缩后(%MOD)的呢
{
if (val == EdgeNum[i]) //出现过了
{
int t = close[i]; close[i] = id;//更新最大位置
return t;
}
}
++num; //没出现过的话,就加入图吧
EdgeNum[num] = val; // 这个才是精确的
close[num] = id;
next[num] = first[u];
first[u] = num;
return ;//没出现过
}
}H;
void work ()
{
scanf ("%s",str+);
int lenstr = strlen(str+);
for (int i=;i<=lenstr;++i)
sumHash[i] = sumHash[i-]*seed + str[i];
memset(ans,,sizeof(ans));
for (int L=;L<=lenstr;++L) //暴力枚举子串长度
{
H.init();
for (int i=;i+L-<=lenstr;++i)
{
int pos = H.insert(sumHash[i+L-]-powseed[L]*sumHash[i-],i);
ans[i][i+L-] ++;//ans[L][R]++,自己是一个
ans[pos][i+L-]--;//pos放回0是没用的
//就像bababa,第二个ba的时候,会ans[1][4]--;表明[1,4]重复了一个
//然后第三个ba的时候,ans[2][6]--,同理,表明[2,6]也是重复了
//那么ans[1][6]重复了两个怎么算?就是在递推的时候,将ans[2][6]的值覆盖上来的
//ans[1][6] += ans[2][6] + ans[1][5] - ans[2][5];
}
}
for (int i = lenstr; i>=; i--)
{
for (int j=i;j<=lenstr;j++)
{
ans[i][j] += ans[i+][j]+ans[i][j-]-ans[i+][j-];
}
}
int m;
scanf ("%d",&m);
while (m--)
{
int L,R;
scanf ("%d%d",&L,&R);
printf ("%d\n",ans[L][R]);
}
return ;
} int main ()
{
powseed[] = ;
for (int i = ; i <= maxn-; ++i) powseed[i] = powseed[i-] * seed;
int t;
scanf ("%d",&t);
while (t--) work();
return ;
}

下面再附上一个用map模拟的代码。2800+ms,可能会超时哦。

#include <cstdio>
#include <cstdlib>
#include <cstring>
#include <cmath>
#include <algorithm>
using namespace std;
#define inf (0x3f3f3f3f)
typedef long long int LL;
typedef unsigned long long int ULL;
#include <iostream>
#include <sstream>
#include <vector>
#include <set>
#include <map>
#include <queue>
#include <string>
//BKDRHash,最优的字符串hash算法。hash一开始是等于0的
//for(i=1 to lenstr) hash = seed * hash + str[i]; 这是求解hash值的公式
//我们希望,对于任意给定的区间[L,R],都能快速地算出它的hash值是多少
//明显我们要算的是:例如[3,4] ans = seed * str[3] + str[4]
//那么我们先预处理一个前缀hash总和,记为sumHash[i]表示1~i的hash值
//sumHash[1] = str[1]; sunHash[2] = seed * str[1] + str[2];
//sunHash[3] = seed * sumHash[2] + str[3]; sumHash[4] = seed * sumHash[3] + str[4];
//拆出来,得到若要求[3,4] 既可以 ans = sumHash[4] - seed^(R-L+1) * sumHash[2]
//所以预处理两个数组,powseed[i]表示seed的i次方, sumHash[i]定义如上
const int seed = ; // 31 131 1313 13131 131313 etc..
const int maxn = +;
char str[maxn];
ULL powseed[maxn]; // seed的i次方 爆了也没所谓,sumHash的也爆。用了ULL,爆了也没所谓,也能唯一确定它
ULL sumHash[maxn]; //前缀hash值
int ans[maxn][maxn]; //ans[L][R]就代表ans,就是区间[L,R]内不同子串的个数
const int MOD = ;
struct StringHash
{
//int book[MOD+20];
map<ULL,int>book;
void init ()
{
book.clear(); return ;
}
int insert (ULL val,int id)
{
if (book[val])
{
int t = book[val];
book[val] = id;
return t;
}
book[val] = id;
return ;
}
}H;
void work ()
{
scanf ("%s",str+);
int lenstr = strlen(str+);
for (int i=;i<=lenstr;++i)
sumHash[i] = sumHash[i-]*seed + str[i];
memset(ans,,sizeof(ans));
for (int L=;L<=lenstr;++L) //暴力枚举子串长度
{
H.init();
for (int i=;i+L-<=lenstr;++i)
{
int pos = H.insert(sumHash[i+L-]-powseed[L]*sumHash[i-],i);
ans[i][i+L-] ++;//ans[L][R]++,自己是一个
ans[pos][i+L-]--;//pos放回0是没用的
//就像bababa,第二个ba的时候,会ans[1][4]--;表明[1,4]重复了一个
//然后第三个ba的时候,ans[2][6]--,同理,表明[2,6]也是重复了
//那么ans[1][6]重复了两个怎么算?就是在递推的时候,将ans[2][6]的值覆盖上来的
//ans[1][6] += ans[2][6] + ans[1][5] - ans[2][5];
}
}
for (int i = lenstr; i>=; i--)
{
for (int j=i;j<=lenstr;j++)
{
ans[i][j] += ans[i+][j]+ans[i][j-]-ans[i+][j-];
}
}
int m;
scanf ("%d",&m);
while (m--)
{
int L,R;
scanf ("%d%d",&L,&R);
printf ("%d\n",ans[L][R]);
}
return ;
} int main ()
{
#ifdef local
freopen("data.txt","r",stdin);
#endif
powseed[] = ;
for (int i = ; i <= maxn-; ++i) powseed[i] = powseed[i-] * seed;
int t;
scanf ("%d",&t);
while (t--) work();
return ;
}

HDU 4622 Reincarnation Hash解法详解的更多相关文章

  1. hdu 4622 Reincarnation(后缀数组)

    hdu 4622 Reincarnation 题意:还是比较容易理解,给出一个字符串,最长2000,q个询问,每次询问[l,r]区间内有多少个不同的字串. (为了与论文解释统一,这里解题思路里sa数组 ...

  2. Python操作redis系列以 哈希(Hash)命令详解(四)

    # -*- coding: utf-8 -*- import redis #这个redis不能用,请根据自己的需要修改 r =redis.Redis(host=") 1. Hset 命令用于 ...

  3. LeetCode(42.接雨水)多解法详解

    接雨水解法详解: 题目: 基本思路:从图上可以看出要想接住雨水,必须是凹字形的,也就是当前位置的左右两边必须存在高度大于它的地方,所以我们要想知道当前位置最多能存储多少水,只需找到左边最高处max_l ...

  4. hdu 4622 Reincarnation 字符串hash 模板题

    题目链接:http://acm.hdu.edu.cn/showproblem.php?pid=4622 题意:给定一个长度不超过2000的字符串,之后有不超过1e5次的区间查询,输出每次查询区间中不同 ...

  5. HDU 4622 Reincarnation 后缀自动机 // BKDRHash(最优hash)

    Reincarnation Time Limit: 6000/3000 MS (Java/Others)    Memory Limit: 131072/65536 K (Java/Others) P ...

  6. HDU 4622 Reincarnation (查询一段字符串的不同子串个数,后缀自动机)

    Reincarnation Time Limit: 6000/3000 MS (Java/Others)    Memory Limit: 131072/65536 K (Java/Others)To ...

  7. hdu 4622 Reincarnation

    http://acm.hdu.edu.cn/showproblem.php?pid=4622 用字典树把每一个字符串对应成一个整数 相同的字符串对应到相同的整数上 把所用的串对应的整数放在一个数组里 ...

  8. hdu 4622 Reincarnation trie树+树状数组/dp

    题意:给你一个字符串和m个询问,问你l,r这个区间内出现过多少字串. 连接:http://acm.hdu.edu.cn/showproblem.php?pid=4622 网上也有用后缀数组搞得. 思路 ...

  9. hdu 4622 Reincarnation SAM模板题

    题目链接:http://acm.hdu.edu.cn/showproblem.php?pid=4622 题意:给定一个长度不超过2000的字符串,之后有Q次区间查询(Q <= 10000),问区 ...

随机推荐

  1. POJ 1046 Color Me Less(浅水)

    一.Description A color reduction is a mapping from a set of discrete colors to a smaller one. The sol ...

  2. mount error(12): Cannot allocate memory解决办法

    http://hi.baidu.com/zhangbin101004/item/e459f4d1f818dfbd33db903b 今天囧了啊,在ubuntu挂载的文件夹里面解压数据库,结果linux嫌 ...

  3. 查看,上传crushmap命令

    标签(空格分隔): ceph,ceph运维,crushmap 查看crushmap命令 从mon节点获取crushmap: # ceph osd getcrushmap -o crush.map 反编 ...

  4. C# 播放音乐

    用 .NET 自带的类库 System.Media 下面的 SoundPlayer 来播放音乐的方式,此种方式使用托管代码,应该是更为可取的方式吧 使用起来非常简单,下面稍作说明: . 支持同步.异步 ...

  5. 问题:C# params类型参数;结果:C#的参数类型:params、out和ref

    C#的参数类型:params.out和ref PS:由于水平有限,难免会有错误和遗漏,欢迎各位看官批评和指正,谢谢~ 首先回顾一下C#声明一个方法的语法和各项元素,[]代表可选 [访问修饰符] 返回值 ...

  6. 多对多 hibernate映射

    数据库: create table EMPLOYEE ( EMPID NUMBER(6) not null, EMPNAME VARCHAR2(32) ) alter table EMPLOYEE a ...

  7. 安装 ambaria

    hadoop安装 wget http://public-repo-1.hortonworks.com/ambari/centos6/1.x/updates/1.2.4.9/ambari.repo cp ...

  8. [51nod1384]全排列

    法一:next_permutation函数,两个参数分别为起始指针和末尾指针. #include<bits/stdc++.h> using namespace std; typedef l ...

  9. ubuntu下root用户默认密码及修改方法

    [ubuntu下root用户默认密码及修改方法] 很多朋友用ubuntu,一般都是装完ubuntu系统,马上就修改root密码了,那么root用户的默认密码是多少,当忘记root用户密码时如何找回呢, ...

  10. 很随意的让你了解 - 最小生成树之Prim算法

    首先分成两个容器. 第一个容器就是装有生成树里面的顶点,第二个容器就是装有没有放入这个第一个容器中的顶点. 首先默认往第一个容器里面装一个顶点.然后..计算出第二个容器里所有顶点和这个顶点的距离.没有 ...