Python自然语言处理停用词过滤实例详解

更新时间：2024年01月17日 10:28:10 作者：李元静

这篇文章主要为大家介绍了Python自然语言处理停用词过滤实例详解,有需要的朋友可以借鉴参考下,希望能够有所帮助,祝大家多多进步,早日升职加薪

什么是停用词

在汉语中，有一类没有多少意义的词语，比如组词“的”，连词“以及”、副词“甚至”，语气词“吧”，被称为停用词。一个句子去掉这些停用词，并不影响理解。所以，进行自然语言处理时，我们一般将停用词过滤掉。

而HanLP库提供了一个小巧的停用词字典，它位于Lib\site-packages\pyhanlp\static\data\dictionary目录中，名字为：stopwords.txt。该文本收录了常见的中英文无意义的词汇，每行一个词语。示例如下：

我们在进行自然语言处理时，可以用BinTrie、DoubleArrayTrie和AhoCorasickDoubleArrayTrie中的任意一个来存储词典。考虑到该词典中都是短语且比较多，用双数组字典树更划算，处理时间更快。

加载停用词字典

通过前文的介绍，我们知道了使用双数组字典树加载停用词字典更划算。下面，我们来加载其停用词，并返回键值对结构。代码如下：

def load_dictionary(path): map=JClass('java.util.TreeMap')() with open(path,encoding='utf-8') as src: for word in src: word=word.strip() map[word]=word return JClass('com.hankcs.hanlp.collection.trie.DoubleArrayTrie')(map)

删除停用词

通过上面的停用词加载，我们获取了DoubleArrayTrie树结构的词汇。如果要删除停用词，可以直接使用分词后的结果剔除停用词即可。剔除的方法如下：

def remove_stopwords(termlist,trie): return [term.word for term in termlist if not trie.containsKey(term.word)]

分词以及删除停用词

在前面的博文中，我们已经学会了如何分词，现在我们又学会了如何剔除停用词。这里，我们将两者结合起来，实现分词效果。代码如下：

if __name__ == "__main__": HanLP.Config.ShowTermNature=False trie=load_dictionary(HanLP.Config.CoreStopWordDictionaryPath) text="今天就这样吧！明天我们在说可以吗？" segment=DoubleArrayTrieSegment() termlist=segment.seg(text) print("分词结果",termlist) print("去掉停用词",remove_stopwords(termlist,trie))

运行之后，得到如下结果：

直接删除停用词（不分词）

对应上面的结果，我们先分词在删除停用词。但是，有时候我们也喜欢先删除停用词在进行分词。下面，我们来实现直接删除停用词。

代码如下：

#直接过滤方法
def direct_remove_stopwords(text,replacement,trie): JString=JClass('java.lang.String') searcher=trie.getLongestSearcher(JString(text),0) offset=0 result='' while searcher.next(): begin=searcher.begin end=begin+searcher.length if begin>offset: result+=text[offset:begin] result+=replacement offset=end if offset<len(text): result+=text[offset:] return result
if __name__ == "__main__": HanLP.Config.ShowTermNature = False trie = load_dictionary(HanLP.Config.CoreStopWordDictionaryPath) text = "今天就这样吧！明天我们在说可以吗？" segment = DoubleArrayTrieSegment() termlist = segment.seg(text) print("分词结果", termlist) print("去掉停用词", remove_stopwords(termlist, trie)) print("不分词去掉停用词", direct_remove_stopwords(text, "**", trie))

运行之后，效果如下：

以上就是Python自然语言处理停用词过滤实例详解的详细内容，更多关于Python自然语言处理停用词过滤的资料请关注脚本之家其它相关文章！

您可能感兴趣的文章:

Python Fire创建简单的命令行接口
Python Fire是一个开源库,它能够自动生成命令行接口,让Python程序变得更加友好和易用,本文主要为大家介绍了Python Fire如何根据Python函数自动生成命令行接口,感兴趣的可以了解下
2023-11-11
python计算程序开始到程序结束的运行时间和程序运行的CPU时间
这篇文章主要介绍了python计算程序开始到程序结束的运行时间和程序运行的CPU时间的三个方法，大家参考使用
2013-11-11
python+opencv轮廓检测代码解析
这篇文章主要介绍了python+opencv轮廓检测代码解析，本文实例实现对图片的简单处理，比如图片的读取，灰度显示等相关内容，具有一定借鉴价值,需要的朋友可以参考下
2018-01-01
Python实现Excel批量处理+邮件自动发送的全流程
在日常办公中,重复的 Excel 数据整理、报表生成与邮件分发工作占据大量时间,本文将手把手教你用 Python 实现 Excel 数据批量处理 + 自动化邮件发送全流程,需要的朋友可以参考下
2025-12-12
python神经网络TensorFlow简介常用基本操作教程
这篇文章主要介绍了python神经网络入门TensorFlow简介常用基本操作教程，有需要的朋友可以借鉴参考下，希望能够有所帮助，祝大家多多进步
2021-11-11
OpenCV Python实现拼图小游戏
这篇文章主要为大家详细介绍了OpenCV Python实现拼图版小游戏，文中示例代码介绍的非常详细，具有一定的参考价值，感兴趣的小伙伴们可以参考一下
2020-03-03
python使用tcp实现局域网内文件传输
这篇文章主要介绍了python使用tcp实现局域网内文件传输，文件包括文本,图片,视频等，文中示例代码介绍的非常详细，具有一定的参考价值，感兴趣的小伙伴们可以参考一下
2018-07-07
Python中return函数返回值实例用法
在本篇文章里小编给大家整理的是一篇关于Python中return函数返回值实例用法，有兴趣的朋友们可以学习下。
2020-11-11
Python 虚拟环境迁移到其他电脑的实现
本文主要介绍了Python 虚拟环境迁移到其他电脑的实现，文中通过示例代码介绍的非常详细，对大家的学习或者工作具有一定的参考学习价值，需要的朋友们下面随着小编来一起学习学习吧
2023-04-04
套娃式文件夹如何通过Python批量处理
这篇文章主要介绍了套娃式文件夹如何通过Python批量处理，文中通过示例代码介绍的非常详细，对大家的学习或者工作具有一定的参考学习价值，需要的朋友们下面随着小编来一起学习学习吧
2020-08-08