java 如何计算两个汉字的相似度？如何获得一个汉字的相似汉字？

老马啸西风

2023-04-12 上海

阅读 1 分钟

0

计算汉字相似度

情景

有时候我们希望计算两个汉字的相似度，比如文本的 OCR 等场景。用于识别纠正。

实现

引入 maven

<dependency>
    <groupId>com.github.houbb</groupId>
    <artifactId>nlp-hanzi-similar</artifactId>
    <version>1.3.0</version>
</dependency>

java 实现

double rate1 = HanziSimilarHelper.similar('末', '未');

返回对应的相似度：

0.9629629629629629

返回一个汉字的相似列表

情景

找到相似的汉字，有很多有趣的场景。

实现

List<String> list = HanziSimilarHelper.similarList('爱');
Assert.assertEquals("[爰, 爯, 受, 爭, 妥, 憂, 李, 爳, 叐, 雙]", list.toString());

开源地址

为了便于大家学习，上述代码已开源

https://github.com/houbb/nlp-hanzi-similar

在线体验

在线体验

拓展阅读

NLP 中文形近字相似度计算思路

中文形近字相似度算法实现，为汉字 NLP 尽一点绵薄之力

当代中国最贵的汉字是什么？

NLP 开源形近字算法补完计划（完结篇）

NLP 开源形近字算法之形近字列表（番外篇）

开源项目在线化中文繁简体转换/敏感词/拼音/分词/汉字相似度/markdown 目录

自然语言处理人工智能 chatgpt

阅读 1.1k发布于 2023-04-12

老马啸西风

191 声望34 粉丝

« 上一篇

和 chatgpt 聊了一会儿分布式锁 redis/zookeeper distributed lock

下一篇 »

金融用户敏感数据如何优雅地实现脱敏？

引用和评论

推荐阅读

【老马】加密机加解密系列汇总篇(共计13篇)

老马啸西风阅读 299

Open WebUI：开源AI交互平台的全面解析

DBLens赞 5阅读 2k

大模型中的Token究竟是什么？从原理到作用深度解析

DBLens赞 5阅读 4.1k

一文掌握 MCP 上下文协议：从理论到实践

陈明勇赞 5阅读 1.8k

MySQL × 向量数据库：大模型时代的黄金组合实战指南

DBLens赞 5阅读 1.9k

Vue3-ChatGPT：基于vite4.x+vue3+pinia2模仿chatgpt聊天AI实例

xiaoyan2017赞 2阅读 10.8k评论 4

分享自制小工具：AutomateGPT – 在 ChatGPT 里批量执行任务

Meathill赞 3阅读 742评论 1

0 条评论

评论支持部分 Markdown 语法：**粗体** _斜体_ [链接](http://example.com) `代码` - 列表 > 引用。你还可以使用 @ 来通知其他用户。