几款开源的中文分词系统

更新时间：2012年11月13日 17:47:18 投稿：mdxy-dxy

中文分词是做好中文内容检索、文本分析的基础，主要应用于搜索引擎与数据挖掘领域。中文是以词为基本语素单位，而词与词之间并不像英语一样有空格来分隔，因而中文分词的难点在于如何准确而又快速地进行分词

以下介绍4款开源中文分词系统。

ICTCLAS – 全球最受欢迎的汉语分词系统

中文词法分析是中文信息处理的基础与关键。中国科学院计算技术研究所在多年研究工作积累的基础上，研制出了汉语词法分析系统ICTCLAS(Institute of Computing Technology, Chinese Lexical Analysis System)，主要功能包括中文分词；词性标注；命名实体识别；新词识别；同时支持用户词典；支持繁体中文；支持GBK、UTF-8、UTF-7、UNICODE等多种编码格式。我们先后精心打造五年，内核升级6次，目前已经升级到了ICTCLAS3.0。ICTCLAS3.0分词速度单机996KB/s，分词精度98.45%，API不超过200KB，各种词典数据压缩后不到3M，是当前世界上最好的汉语词法分析器。

HTTPCWS – 基于HTTP协议的开源中文分词系统

HTTPCWS 是一款基于HTTP协议的开源中文分词系统，目前仅支持Linux系统。HTTPCWS 使用“ICTCLAS 3.0 2009共享版中文分词算法”的API进行分词处理，得出分词结果。

ICTCLAS是中国科学院计算技术研究所在多年研究工作积累的基础上，基于多层隐马模型研制出的汉语词法分析系统，主要功能包括中文分词；词性标注；命名实体识别；新词识别；同时支持用户词典。ICTCLAS经过五年精心打造，内核升级6次，目前已经升级到了ICTCLAS3.0，分词精度98.45%，各种词典数据压缩后不到3M。ICTCLAS在国内973专家组组织的评测中活动获得了第一名，在第一届国际中文处理研究机构SigHan组织的评测中都获得了多项第一名，是当前世界上最好的汉语词法分析器。

SCWS – 简易中文分词系统

SCWS 在概念上并无创新成分，采用的是自行采集的词频词典，并辅以一定程度上的专有名称、人名、地名、数字年代等规则集，经小范围测试大概准确率在 90% ~ 95% 之间，已能基本满足一些中小型搜索引擎、关键字提取等场合运用。 SCWS 采用纯 C 代码开发，以 Unix-Like OS 为主要平台环境，提供共享函数库，方便植入各种现有软件系统。此外它支持 GBK，UTF-8，BIG5 等汉字编码，切词效率高。

PhpanAlysis - PHP无组件分词系统

PhpanAlysis分词系统是基于字符串匹配的分词方法，这种方法又叫做机械分词方法，它是按照一定的策略将待分析的汉字串与一个“充分大的”机器词典中的词条进行配，若在词典中找到某个字符串，则匹配成功（识别出一个词）。按照扫描方向的不同，串匹配分词方法可以分为正向匹配和逆向匹配；按照不同长度优先匹配的情况，可以分为最大（最长）匹配和最小（最短）匹配；按照是否与词性标注过程相结合，又可以分为单纯分词方法和分词与标注相结合的一体化方法。

MMSEG4J　　

MMSEG4J基于Java的开源中文分词组件，提供lucene和solr 接口

　　1）、mmseg4j 用 Chih-Hao Tsai 的 MMSeg 算法实现的中文分词器，并实现 lucene 的 analyzer 和 solr 的TokenizerFactory 以方便在Lucene和Solr中使用。

　　2）、MMSeg 算法有两种分词方法：Simple和Complex，都是基于正向最大匹配。Complex 加了四个规则过虑。官方说：词语的正确识别率达到了 98.41%。mmseg4j 已经实现了这两种分词算法。

IKAnalyzer 开源的轻量级中文分词工具包

IKAnalyzer 是一个开源的，基于java语言开发的轻量级的中文分词工具包。从2006年12月推出1.0版开始，IKAnalyzer已经推出了3个大版本。最初，它是以开源项目Luence为应用主体的，结合词典分词和文法分析算法的中文分词组件。新版本的IKAnalyzer3.0则发展为面向Java的公用分词组件。

IKAnalyzer3.0特性:

采用了特有的“正向迭代最细粒度切分算法“，具有60万字/秒的高速处理能力。

采用了多子处理器分析模式，支持：英文字母（IP地址、Email、URL）、数字（日期，常用中文数量词，罗马数字，科学计数法），中文词汇（姓名、地名处理）等分词处理。优化的词典存储，更小的内存占用。

中文分词

VSCode程序猿彩虹屁插件rainbow fart体验篇
这篇文章主要介绍了VSCode程序猿彩虹屁插件rainbow fart体验,本文通过图文并茂的形式给大家介绍的非常详细，对大家的学习或工作具有一定的参考借鉴价值，需要的朋友可以参考下
2020-06-06
VSCODE内使用Jupyter模式运行backtrader不展示图片、图片尺寸无法自定义的解决方案
VSCODE中使用Jupyter模式运行backtrader时,图片无法展示或调整尺寸,通过修改matplotlib的全局设置,并将配置文件传递给cerebro.plot,可以解决图片展示和尺寸调整的问题,感兴趣的朋友一起看看吧
2025-02-02
git修改已commit的注释信息实现
这篇文章主要介绍了git修改已commit的注释信息实现，文中通过示例代码介绍的非常详细，对大家的学习或者工作具有一定的参考学习价值，需要的朋友们下面随着小编来一起学习学习吧
2020-07-07
git通过内网代理访问外网的相关配置方法
这篇文章主要介绍了git通过内网代理，访问外网的相关配置,配置git代理以http代理为例，给大家详细讲解，需要的朋友可以参考下
2023-05-05
postman测试接口各种类型传值的实现
本文主要介绍了postman测试接口各种类型传值的实现，文中通过示例代码介绍的非常详细，具有一定的参考价值，感兴趣的小伙伴们可以参考一下
2022-02-02
Gitlab新建用户无法收到邮件的问题解决办法
在配置GitLab邮件服务时,可能因为环境或版本差异遇到问题,本文就来介绍一下Gitlab新建用户无法收到邮件的问题解决办法,感兴趣的可以了解一下
2024-11-11
Git配置别名简化操作命令方式详解
这篇文章主要为大家介绍了Git配置别名简化操作命令方式详解，有需要的朋友可以借鉴参考下，希望能够有所帮助，祝大家多多进步，早日升职加薪
2022-06-06
gitee命令行上传项目的步骤详解
这篇文章主要介绍了gitee命令行上传项目的步骤详解,本文通过图文并茂的形式给大家介绍的非常详细，对大家的学习或工作具有一定的参考借鉴价值，需要的朋友可以参考下
2020-09-09
Spark GraphX 分布式图处理框架图算法详解
这篇文章主要为大家介绍了Spark GraphX 分布式图处理框架图算法详解，有需要的朋友可以借鉴参考下，希望能够有所帮助，祝大家多多进步，早日升职加薪
2022-10-10
通过自定义字段重新排序 WordPress 文章方法
在本文中，我将向您展示如何通过自定义字段更改文章的顺序。WordPress 中文章的默认顺序基于发布日期，并按时间倒序显示。这意味着它将在顶部显示最新的文章。
2021-09-09

几款开源的中文分词系统

相关文章

最新评论

大家感兴趣的内容

最近更新的内容

常用在线小工具