拓展阅读

分词系列专题

关键词系列专题

NLP segment-01-聊一聊分词

NLP segment-02-聊一聊关键词提取 keyword

NLP segment-03-基于 TF-IDF 实现关键词提取 java 开源实现

NLP segment-04-自动摘要 auto-summary java 开源实现

NLP segment-05-文本相似度计算 similarity java 开源实现

NLP segment-20-分词开源项目介绍 HanLP 未来十年的自然语言处理

NLP segment-21-分词开源项目介绍 ansj_seg

倒排索引原理与实现 reverse-index

NLP segment-21-分词开源项目介绍 ansj_seg

开源项目

为了便于大家学习，项目开源地址如下，欢迎 fork+star 鼓励一下老马~

nlp-hanzi-similar 汉字相似度

word-checker 拼写检测

sensitive-word 敏感词

前言

前面一些内容，我们介绍了分词。以及 TF-IDF 的实现原理。

基于分词实现 auto-summary 自动摘要。

这一节我们来一起看一下文本相似度的计算。

nlp-keyword

nlp-keyword 高性能的 java 分词关键词提取实现，基于分词 segment。

愿景：成为 java 最好用的关键词工具。

特性

基于 TF-IDF 算法的关键字算法
灵活的条件指定

变更日志

文本相似度

maven 引入

<dependency>
    <groupId>com.github.houbb</groupId>
    <artifactId>nlp-keyword-similarity</artifactId>
    <version>1.2.0</version>
</dependency>

入门例子

final String source = "我喜欢看电影，读书和旅游。";
final String target = "我不喜欢看电影。我爱唱跳、RAP、Music~";

double rank = SimilarityHelper.similarity(source, target);

结果：

0.677537337470188

拓展阅读
前言
nlp-keyword
- 特性
文本相似度
- maven 引入
- 入门例子

拓展阅读

分词系列专题

关键词系列专题

开源项目

前言

nlp-keyword

特性

文本相似度

maven 引入

入门例子

更多学习