SpringBoot集成自然语言处理hanlp工具包

最新推荐文章于 2024-10-23 15:38:05 发布

A尘埃

最新推荐文章于 2024-10-23 15:38:05 发布

阅读量1.8k

点赞数 5

文章标签： spring boot 自然语言处理后端 hanlp

本文链接：https://blog.csdn.net/usa_washington/article/details/136519931

版权

HanLP是用于普及自然语言处理在生产环境应用的工具包。博客介绍了其下载与配置方法，包括零配置使用基本功能，通过hanlp.properties自定义配置，还说明了下载jar、data、hanlp.properties的步骤，以及依赖集成、配置文件和启动类设置、测试等内容。

摘要生成于 C知道，由 DeepSeek-R1 满血版支持，前往体验 >

HanLP是一系列模型与算法组成的NLP工具包，目标是普及自然语言处理在生产环境中的应用。

下载与配置

<dependency>
    <groupId>com.hankcs</groupId>
    <artifactId>hanlp</artifactId>
    <version>portable-1.8.4</version>
</dependency>

零配置，即可使用基本功能（除由字构词、依存句法分析外的全部功能）

如果用户有自定义的需求，使用hanlp.properties进行配置（Portable版同样支持hanlp.properties）
下载jar、data、hanlp.properties

①、下载：data.zip
下载后解压到任意目录，接下来通过配置文件告诉HanLP数据包的位置。
HanLP中的数据分为词典和模型，其中词典是词法分析必需的，模型是句法分析必需的

data
│
├─dictionary
└─model

用户可以自行增删替换，如果不需要句法分析等功能的话，随时可以删除model文件夹。

模型跟词典没有绝对的区别，隐马模型被做成人人都可以编辑的词典形式，不代表它不是模型。
GitHub代码库中已经包含了data.zip中的词典，直接编译运行自动缓存即可；模型则需要额外下载

②、下载jar和配置文件：hanlp-release.zip
配置文件的作用是告诉HanLP数据包的位置，只需修改第一行
root=D:/JavaProjects/HanLP/
为data的父目录即可，比如data目录是/Users/hankcs/Documents/data，那么root=/Users/hankcs/Documents/ 。

最后将hanlp.properties放入classpath即可，对于多数项目，都可以放到src或resources目录下，编译时IDE会自动将其复制到classpath中。除了配置文件外，还可以使用环境变量HANLP_ROOT来设置root。安卓项目请参考demo。

如果放置不当，HanLP会提示当前环境下的合适路径，并且尝试从项目根目录读取数据集。

一、依赖（这里采用方式一的集成）


<?xml version="1.0" encoding="UTF-8"?>
<project xmlns="http://maven.apache.org/POM/4.0.0"
         xmlns:xsi="http://www.w3.org/2001/XMLSchema-instance"
         xsi:schemaLocation="http://maven.apache.org/POM/4.0.0 http://maven.apache.org/xsd/maven-4.0.0.xsd">
    <parent>