杭电ACM1277——全文检索~~AC自动机算法

题目的意思:给你一篇文章,再给你T个字符串,判断这T个字符串有哪些在文章中出现过。

由于文章很大,普通的方法必定超时,所以需要用 AC自动机算法。

AC自动机算法是多模匹配算法之一,主要是用于在一篇文章中,找出给定的N个单词在这篇文章中出现的个数。

AC自动机算法,我也是刚刚学习,主要是在建立字典树的基础上,增加了失败指针,提高了匹配的效率。而且最难的是失败指针的建立。

它的优点是:最大限度地减少无谓的字符串比较,查询效率比哈希表高。

对于AC自动机算法,可以参考大神的博客:点击打开链接 里面有详细的说明,我也是从中学习的。


AC自动机算法,基本上就是那样子的,所以,写的代码,可以成为模版来用。

我一开始用的不是队列来做的,也就是参考上面博客的大神写的,但是,内存超了,所以,改用了队列来做,才过的,而且用的内存也仅仅只是比规定的少了100多K。

下面的是AC的代码:

#include <iostream>
#include <cstdio>
#include <cstring>
#include <vector>
#include <queue>
using namespace std;

char str[60010];
class data
{
public:
	int key;         //判断是否是叶子结点
	data *fail;      //失败指针
	data *num[10];   //子结点
	data()           //构造函数
	{
		key = 0;
		fail = NULL;
		memset(num, NULL, sizeof(num));
	}
};
int head, tail;
vector <int> ans;
bool flag;

void buildTree(data *root, int x, char *p)    //建立字典树函数,root提前new了一个
{
	int j;
	int length = strlen(p);	
	data *temp = root;
	for(j = 0; j < length; j++)
	{
		int k = p[j] - '0';
		if(temp->num[k] == NULL)
		{
			temp->num[k] = new data();
		}
		temp = temp->num[k];
	}
	temp->key = x;
}

void get_fail(data *head)                //获取fail指针
{
	data *now, *p;  
    queue<data*> q;  
    head->fail = NULL;  
    q.push(head);                   //根节点入队
    for(; !q.empty(); )  
    {  
        now = q.front();  
        q.pop();  
        for(int i = 0; i < 10; ++i)  //所有不为NULL的入队
            if(now->num[i])  
            {  
                p = now->fail;  
                for(; p && !p->num[i]; p = p->fail);  
                now->num[i]->fail = p ? p->num[i] : head;  
                q.push(now->num[i]); 
            }  
    }  
}
void finds(data *root, char *s)     //匹配函数
{
	int leng = strlen(s);
	data *p = root;
	for(int i = 0; i < leng; i++)
	{
		int k = s[i] - '0';
		while(!p->num[k] && p != root)
			p = p->fail;
		p = p->num[k] == NULL ? root : p->num[k];
		data *temp = p;
		for( ; temp != root; temp = temp->fail)
		{
			if(temp->key)
			{
				ans.push_back(temp->key);
				flag = true;
			}
		}
	}
}

int main()
{
//  freopen("data.txt", "r", stdin);
    int n, t, i, j, k;
    char s[120];
    while(cin >> n >> t)
	{
		getchar();
		flag = false;
		head = tail = 0;
		data *root = new data();
		memset(str, '\0', sizeof(str));
		for(i = 0; i < n; i++)            //输入数据
		{
			gets(s);
			strcat(str, s);
		}
		getchar();
		for(i = 0; i < t; i++)          //输入数据
		{
			gets(s);
			int length = strlen(s);
			k = j = 0;
			while(s[k++] != ']');   //去掉前面没用的
		
			k += 1;
			while(k < length)
			{
				s[j++] = s[k++];
			}
			s[j] = '\0';
			buildTree(root, i + 1, s);  //建树
		}
		get_fail(root);           //获取fail指针
		finds(root, str);        //匹配
		if(flag)
		{
			cout << "Found key: ";
			for(i = 0; i < ans.size(); i++)
				i != ans.size() - 1 ? cout << "[Key No. " << ans[i] << "] " : cout << "[Key No. " << ans[i] << "]" << endl;;
		}
		else
			cout << "No key can be found !" << endl;
	}
    return 0;
}


  • 1
    点赞
  • 0
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
数据来源:中经数据库 主要指标110多个(全部都是纯粹的 市辖区 指标),大致是: GDP GDP增速 第一产业增加值占GDP比重 第二产业增加值占GDP比重 第三产业增加值占GDP比重 人均GDP 社会消费品零售总额 固定资产投资(不含农户) 新设外商投资企业数_外商直接投资 实际利用外资金额(美元) 一般公共预算收入 一般公共预算支出 一般公共预算支出_教育 一般公共预算支出_科学技术 金融机构人民币各项存款余额_个人储蓄存款 金融机构人民币各项存款余额 金融机构人民币各项贷款余额 规模以上工业企业单位数 规模以上工业企业单位数_内资企业 规模以上工业企业单位数_港澳台商投资企业 规模以上工业企业单位数_外商投资企业 规模以上工业总产值 规模以上工业总产值_内资企业 规模以上工业总产值_港澳台商投资企业 规模以上工业总产值_外商投资企业 规模以上工业企业流动资产合计 规模以上工业企业固定资产合计 规模以上工业企业利润总额 规模以上工业企业应交增值税 规模以上工业企业主营业务税金及附加 户籍人口数 年均户籍人口数 户籍人口自然增长率 第一产业就业人员占全部城镇单位就业人员比重 第二产业就业人员占全部城镇单位就业人员比重 第三产业就业人员占全部城镇单位就业人员比重 城镇非私营单位就业人员数 城镇非私营单位就业人员数_第一产业 城镇非私营单位就业人员数_第二产业 城镇非私营单位就业人员数_第三产业 城镇非私营单位就业人员数_农、林、牧、渔业 城镇非私营单位就业人员数_采矿业 城镇非私营单位就业人员数_制造业 城镇非私营单位就业人员数_电力、热力、燃气及水生产和供应业 城镇非私营单位就业人员数_建筑业 城镇非私营单位就业人员数_批发和零售业 城镇非私营单位就业人员数_交通运输、仓储和邮政业 城镇非私营单位就业人员数_住宿和餐饮业 城镇非私营单位就业人员数_信息传输、软件和信息技术服务业 城镇非私营单位就业人员数_金融业 城镇非私营单位就业人员数_房地产业 城镇非私营单位就业人员数_租赁和商务服务业 城镇非私营单位就业人员数_科学研究和技术服务业 城镇非私营单位就业人员数_水利、环境和公共设施管理业 城镇非私营单位就业人员数_居民服务、修理和其他服务业 城镇非私营单位就业人员数_教育 城镇非私营单位就业人员数_卫生和社会工作 城镇非私营单位就业人员数_文化、体育和娱乐业 城镇非私营单位就业人员数_公共管理、社会保障和社会组织 城镇非私营单位在岗职工平均人数 城镇就业人员数_私营企业和个体 城镇非私营单位在岗职工工资总额 城镇非私营单位在岗职工平均工资 城镇登记失业人员数 建成区面积 建设用地面积 建设用地面积_居住用地 液化石油气供气总量 液化石油气供气总量_居民家庭 人工煤气、天然气供气总量 人工煤气、天然气供气总量_居民家庭 液化石油气用气人口 人工煤气、天然气用气人口 城市公共汽电车运营车辆数 城市出租汽车运营车辆数 城市公共汽电车客运总量 道路面积 排水管道长度 建成区绿化覆盖面积 建成区绿化覆盖率 绿地面积 公园绿地面积 维护建设资金支出 土地面积 生活用水供水量 供水总量 全社会用电量 城乡居民生活用电量 工业生产用电量 房地产开发投资 房地产开发投资_住宅 限额以上批发和零售业法人单位数 限额以上批发和零售业商品销售总额 普通中学学校数 中等职业教育学校数 普通小学学校数 普通高等学校专任教师数 普通中学专任教师数 中等职业教育专任教师数 普通小学专任教师数 普通高等学校在校生数 普通中学在校生数 中等职业教育在校生数 普通小学在校生数 电视节目综合人口覆盖率 公共图书馆总藏量_图书 医疗卫生机构数_医院和卫生院 卫生人员数_执业(助理)医师 医疗卫生机构床位数_医院和卫生院 城镇职工基本养老保险参保人数 职工基本医疗保险参保人数 失业保险参保人数

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值