敏感词过滤算法DFA

最新推荐文章于 2024-04-25 17:59:48 发布

m0_52000057

最新推荐文章于 2024-04-25 17:59:48 发布

阅读量827

点赞数 1

分类专栏： java 文章标签： java

本文链接：https://blog.csdn.net/m0_52000057/article/details/112849810

版权

DFA

敏感词过滤方案

1 使用数据库模糊查询，效率太低

2 使用String.indexOf("")查找，数据库量大的话也是比较慢

3 把敏感词和内容使用全文检索（solr,ElasticSearche）技术进行分词再匹配，也是可以的，但是这种方案比较麻烦。

4 DFA算法，确定有穷自动机。本项目采用这种方案

DFA全称为：Deterministic Finite Automaton,即确定有穷自动机。其特征为：有一个有限状态集合和一些从一个状态通向另一个状态的边，每条边上标记有一个符号，其中一个状态是初态，某些状态是终态。但不同于不确定的有限自动机，DFA中不会有从同一状态出发的两条边标志有相同的符号。

一次性的把所有的敏感词存储到了多个map中，就是下图表示这种结构

敏感词：冰毒、大麻、大坏蛋

在这里插入图片描述

检索的过程，就是hashMap的get实现

1、第一个字“冰”，我们在hashMap中可以找到。得到一个新的map = hashMap.get("")。

2、如果map == null，则不是敏感词。否则跳至3

3、获取map中的isEnd，通过isEnd是否等于1来判断该词是否为最后一个。如果isEnd == 1表示该词为敏感词，否则跳至1。

通过这个步骤我们可以判断“冰毒”为敏感词，但是如果我们输入“冰箱”则不是敏感词了。

工具类：


import java.util.*;

public class SensitiveWordUtil {
   

    public static Map<String, Object> dictionaryMap = new HashMap<>();


    /**
     * 生成关键词字典库
     * @param words
     * @return
     */
    public static void initMap(Collection<String> words) {
   
        if (words == null) {
   
            System.out.println("敏感词列表不能为空");
            return ;
        }

        // map初始长度words.size()，整个字典库的入口字数(小于words.size()，因为不同的词可能会有相同的首字)
        Map<String, Object> map = new HashMap<>(words.size());
        // 遍历过程中当前层次的数据
        Map<String, Object> curMap = null

最低0.47元/天解锁文章

m0_52000057

关注

1
点赞
踩
4

收藏

觉得还不错? 一键收藏
0
评论
敏感词过滤算法DFA

DFA敏感词过滤方案1 使用数据库模糊查询，效率太低2 使用String.indexOf("")查找，数据库量大的话也是比较慢3 把敏感词和内容使用全文检索（solr,ElasticSearche）技术进行分词再匹配，也是可以的，但是这种方案比较麻烦。4 DFA算法，确定有穷自动机。本项目采用这种方案DFA全称为：Deterministic Finite Automaton,即确定有穷自动机。其特征为：有一个有限状态集合和一些从一个状态通向另一个状态的边，每条边上标记有一个符号，其中一个状态
复制链接

扫一扫