个人简介

Echo Blog


江湖无名 安心练剑
  • 如何解决分词的繁简体问题?
    分词的繁简体问题 分词是基本所有 nlp 的基础,那么分词中的繁简体如何解决? 方案1-HMM预测 不依赖字典,直接根据繁题的字频预测。 优点:降低内存消耗 缺点:不知道 jieba 有没有对应的繁体字频统计。 而且我想在 HMM 服务降级的时候依然可以支持。 方案2-繁体字典预处理 基于 jieba-fenci + opencc4j 首先做一次预处理。 将所有的繁体词组处...
    2020-01-09 02:09:32 | Search
  • 如何为 java 设计一款高性能的拼音转换工具 pinyin4j
    拼音转换工具 拼音转换工具的思路不难: (1)词语分词 (2)基于词库进行拼音的映射 (3)拼接最后的结果 可以认为主要下面的部分值得留意 准确性 作为拼音转换算法,准确性优先级应该是在性能之前的。 如果我们能保证高准确性,应该尽可能的去提高准确性。 词库来源 这里的词库,不包括分词的词库,仅仅指拼音的词库。 指拼音的词库,收集可以在各种优秀词库的基础上,不应该在收集上...
    2020-01-09 02:09:32 | Search
  • 拼音转汉字实现方式
    基于HMM的拼音转汉字 这里的拼音一般不带声调。 将汉字作为隐藏状态,拼音作为观测值,使用viterbi算法可以将多个拼音转换成合理的汉字。 例如给出ti,chu,le,jie,jue,fang,an,viterbi算法会认为提出了解决方案是最合理的状态序列。 HMM 需要三个分布,分别是: 初始时各个状态的概率分布 各个状态互相转换的概率分布 ...
    2020-01-09 02:09:32 | Search
  • pinyin4j 声母与韵母的基础知识
    汉语拼音是拼写汉民族标准语的拼音方案。 汉语拼音是以北京语音系统作为语音标准的。 北京音也是中国地域最辽阔、人口最多的北方方言的典型代表。 解释汉语拼音用法和标准的《汉语拼音方案》是中国拼音文字方案的国家标准,也是联合国规定用来拼写中国人名地名和专用词语的国际标准。 它是中华人民共和国法定的拼音方案,是世界文献工作中拼写有关中国的专用名词和词语的国际标准。 1958年2月11日,第...
    2020-01-09 02:09:32 | Search
  • pinyin4j 之中文拼音的基础知识
    拼音声调 声调 拼音声调是指普通话中的声调,通常叫四声,即阴平(第一声),用“ˉ”表示,如lā;阳平第二声,用“ˊ”表示,如lá;上声(第三声),用“ˇ”表示,如lǎ;去声(第四声),用“ˋ”表示,如;là。 汉语中还存在着一种特殊声调,叫做轻声,有时也叫第五声,在汉语拼音中不标调。有些学者认为“第五声”的说法并不确切。轻声虽然能够起分辨语义的作用,但是通常不列入汉语“四声”之一,因为...
    2020-01-09 02:09:32 | Search
  • 开源中文的繁简体转换 opencc4j-05-日文转换支持
    Opencc4j Opencc4j 支持中文繁简体转换,考虑到词组级别。 开源中文的繁简体转换 opencc4j-01-使用入门概览 开源中文的繁简体转换 opencc4j-02-一个汉字竟然对应两个 char? 开源中文的繁简体转换 opencc4j-03-简体还是繁体,你说了算! 开源中文的繁简体转换 opencc4j-04-香港地区转换支持 开源中文的繁简体转换 openc...
    2020-01-09 02:09:32 | Search
  • 开源中文的繁简体转换 opencc4j-04-香港地区转换支持
    Opencc4j Opencc4j 支持中文繁简体转换,考虑到词组级别。 开源中文的繁简体转换 opencc4j-01-使用入门概览 开源中文的繁简体转换 opencc4j-02-一个汉字竟然对应两个 char? 开源中文的繁简体转换 opencc4j-03-简体还是繁体,你说了算! 开源中文的繁简体转换 opencc4j-04-香港地区转换支持 开源中文的繁简体转换 openc...
    2020-01-09 02:09:32 | Search
  • 开源中文的繁简体转换 opencc4j-03-简体还是繁体,你说了算!
    Opencc4j Opencc4j 支持中文繁简体转换,考虑到词组级别。 开源中文的繁简体转换 opencc4j-01-使用入门概览 开源中文的繁简体转换 opencc4j-02-一个汉字竟然对应两个 char? 开源中文的繁简体转换 opencc4j-03-简体还是繁体,你说了算! 开源中文的繁简体转换 opencc4j-04-香港繁简体的支持 开源中文的繁简体转换 openc...
    2020-01-09 02:09:32 | Search