知识点 - 字典树
解决问题类型:
最大限度地减少无谓的字符串比较,查询效率比哈希表高。
Trie的核心思想是空间换时间。利用字符串的公共前缀来降低查询时间的开销以达到提高效率的目的。
3个基本性质
1.根节点不包含字符,每条边代表一个字符。
2.从根节点到某一节点,路径上经过的字符连接起来,为该节点对应的字符串。
3.每个节点的所有子节点包含的字符都不相同。
复杂度:
建树
O
(
N
∗
l
e
n
)
O(N*len)
O(N∗len)
查找结点
O
(
l
e
n
)
O(len)
O(len)
例题
题目1:给你100000个长度不超过10的单词。对于每一个单词,我们要判断他出没出现过,如果出现了,求第一次出现在第几个位置。
题目2:已知n个由小写字母构成的平均长度为10的单词,判断其中是否存在某个串为另一个串的前缀子串。
面对比3种方法:
-
即从字符串集中从头往后搜,看每个字符串是否为字符串集中某个字符串的前缀,复杂度为 O ( n 2 ) O(n^2) O(n2)。
-
使用hash:我们用hash存下所有字符串的所有前缀子串,建立存有子串hash的复杂度为 O ( n ∗ l e n ) O(n*len) O(n∗len),而查询的复杂度为 O ( n ) ∗ O ( 1 ) = O ( n ) O(n)* O(1)= O(n) O(n)∗O(1)=O(n)。
-
使用trie:因为当查询如字符串abc是否为某个字符串的前缀时,显然以b,c,d…等不是以a开头的字符串就不用查找了。所以建立trie的复杂度为O(n*len),而建立+查询在trie中是可以同时执行的,建立的过程也就可以称为查询的过程,hash就不能实现这个功能。所以总的复杂度为 O ( n l e n ) O(nlen) O(nlen),实际查询的复杂度也只是 O ( l e n ) O(len) O(len)。(说白了,就是Trie树的平均高度h为len,所以Trie树的查询复杂度为 O ( h ) = O ( l e n ) O(h)=O(len) O(h)=O(len)。好比一棵二叉平衡树的高度为logN,则其查询,插入的平均时间复杂度亦为 O ( l o g N ) ) O(logN)) O(logN))。
代码
const int MAXN = (int)1e6+7;
const int MaxTot = 5e6+7; //注意大小为 N*len
const int INF = (int)0x3f3f3f3f;
struct Aho {
struct state{
int next[2];
int cnt,vis;
}tree[MaxTot];
int tot;
int newpoint(int lun) {
++tot;
memset(tree[tot].next,0,sizeof(tree[tot].next));
tree[tot].vis = lun;
tree[tot].cnt = 1;
return tot;
}
inline void init(int lun) {
memset(tree[0].next,0,sizeof(tree[0].next));
tot = 0;
newpoint(lun);
}
inline void insert(char *S,int lun) { //构造字典树,插入S这个串
int n = strlen(S);
int now = 1;
tree[now].cnt ++;
rep(i,0,n-1) { //提取出每个字符
char c = S[i]-'0';
if (tree[tree[now].next[c]].vis != lun) {
tree[now].next[c] = newpoint(lun);
}else {
tree[tree[now].next[c]].cnt ++;
}
now = tree[now].next[c];
}
//tree[now].cnt++; //走到了结束位置,最后++
}
inline void del(char *S) { //构造字典树,插入S这个串
int n = strlen(S);
int now = 1;
tree[now].cnt --;
rep(i,0,n-1) { //提取出每个字符
char c = S[i]-'0';
tree[tree[now].next[c]].cnt --;
now = tree[now].next[c];
}
}
}a,b;