在python下实现word2vec词向量训练与加载实例

更新时间：2020年06月09日 11:13:08 作者：csg_mozl123

这篇文章主要介绍了在python下实现word2vec词向量训练与加载实例，具有很好的参考价值，希望对大家有所帮助。一起跟随小编过来看看吧

项目中要对短文本进行相似度估计，word2vec是一个很火的工具。本文就word2vec的训练以及加载进行了总结。

word2vec的原理就不描述了，word2vec词向量工具是由google开发的，输入为文本文档，输出为基于这个文本文档的语料库训练得到的词向量模型。

通过该模型可以对单词的相似度进行量化分析。

word2vec的训练方法有2种，一种是通过word2vec的官方手段，在linux环境下编译并执行。

在github上下载word2vec的安装包，然后make编译。查看demo-word.sh脚本，得到word2vec的执行命令：

./word2vec -train text8 -output vectors.bin -cbow 1 -size 200 -window 8 -negative 25 -hs 0 -sample 1e-4 -threads 20 -binary 1 -iter 15

参数解释：

1）-train：需要训练的语料库，text8为语料库文件名

2）-output：输出的词向量文件，vectors.bin为输出词向量文件名，.bin后缀为二进制文件。若要以文档的形式查看词向量文件，需要将-binary参数的值由1改为0

3）-cbow：是否使用cbow模型进行训练。参数为1表示使用cbow，为0表示不使用cbow

4）-size：词向量的维数，默认为200维。

5）-window：训练过程中截取上下文的窗口大小，默认为8，即考虑一个词前8个和后8个词

6）-negative：若参数非0，表明采样随机负采样的方法，负样本子集的规模默认为25。若参数值为0,表示不使用随机负采样模型。使用随机负采样比Hierarchical Softmax模型效率更高。

7）-hs：是否采用基于Hierarchical Softmax的模型。参数为1表示使用，0表示不使用

8）-sample：语料库中的词频阈值参数，词频大于该阈值的词，越容易被采样。默认为e^-4.

9）-threads：开启的线程数目，默认为20.

10）-binary：词向量文件的输出形式。1表示输出二进制文件，0表示输出文本文件

11）-iter：训练的迭代次数。一定范围内，次数越高，训练得到的参数会更准确。默认值为15次.

./word2vec -train mytext.txt -output vectors.txt -cbow 1 -size 200 -window 5 -negative 25 -hs 0 -sample 1e-4 -threads 20 -binary 0 -iter 30

示例为训练一个名mytext.txt的文档。设置输出词向量的格式为.txt文本文档，所以还需要将-binary参数设置为0.

训练模型采用基于随机负采样的cbow模型。由于短文本字数极为有限，所以-window参数设置为5，设置词向量的维数

为200，为了使得到的参数更准确，将迭代次数增加至30.其他参数使用默认值。

训练以后得到一个txt文本，该文本的内容为：每行一个单词，单词后面是对应的词向量。

gensim加载词向量：

保存词向量模型到pkl中（注意：这里是对词向量模型进行构建）

from gensim.models import KeyedVectors
if not os.path.exists(pkl_path): # 如果pickle模型不存在，则构建一个

    print '词向量模型不存在，开始构建词向量模型...'
    Word2Vec = KeyedVectors.load_word2vec_format(vecs_path, binary=False) # 加载词向量模型
    f = file(pkl_path, 'wb')
    pickle.dump(Word2Vec, f, True)
    f.close()
    print '词向量模型构建完毕...'

f= file(pkl_path, 'rb')# 打开pkl文件
word2vec=pickle.load(f)# 载入pkl

第二种方法是使用gensim模块训练词向量：

from gensim.models import Word2Vec
from gensim.models.word2vec import LineSentence

try:
  import cPickle as pickle
except ImportError:
  import pickle

sentences = LineSentence(path)# path为要训练的txt的路径
# 对sentences表示的语料库进行训练，训练200维的词向量，窗口大小设置为5，最小词频设置为5
model = Word2Vec(sentences, size=200, window=5, min_count=5)
model.save(model_path)#model_path为模型路径。保存模型，通常采用pkl形式保存，以便下次直接加载即可

# 加载模型
model = Word2Vec.load(model_path)

完整的训练，加载通常采用如下方式：

if not os.path.exists(model_path):
    sentences = LineSentence(path)
    model = Word2Vec(sentences, size=200, window=5, min_count=5)
    model.save(model_path)
model = Word2Vec.load(model_path)

这样一来，就可以通过pkl化的词向量模型进行读取了。pkl的目的是为了保存程序中变量的状态，以便下次直接访问，

不必重新训练模型。

详细内容间gensim官方库

https://radimrehurek.com/gensim/models/word2vec.html

以上这篇在python下实现word2vec词向量训练与加载实例就是小编分享给大家的全部内容了，希望能给大家一个参考，也希望大家多多支持脚本之家。

您可能感兴趣的文章:

Python利用scikit-learn实现近邻算法分类的示例详解
scikit-learn已经封装好很多数据挖掘的算法，这篇文章就来用scikit-learn实现近邻算法分类，文中的示例代码讲解详细，感兴趣的小伙伴可以了解一下
2023-02-02
python 读取txt,json和hdf5文件的实例
今天小编就为大家分享一篇python 读取txt,json和hdf5文件的实例，具有很好的参考价值，希望对大家有所帮助。一起跟随小编过来看看吧
2018-06-06
Django 数据库同步操作技巧详解
这篇文章主要介绍了Django 数据库同步操作技巧详解,文中通过示例代码介绍的非常详细，对大家的学习或者工作具有一定的参考学习价值,需要的朋友可以参考下
2019-07-07
LangChain简化ChatGPT工程复杂度使用详解
这篇文章主要为大家介绍了LangChain简化ChatGPT工程复杂度使用详解，有需要的朋友可以借鉴参考下，希望能够有所帮助，祝大家多多进步，早日升职加薪
2023-03-03
在Python下进行UDP网络编程的教程
这篇文章主要介绍了在Python下进行UDP网络编程的教程,UDP编程是Python网络编程部分的基础知识,示例代码基于Python2.x版本,需要的朋友可以参考下
2015-04-04
Python读取GSMap数据的问题
这篇文章主要介绍了Python读取GSMap数据的问题,本文给大家介绍的非常详细，对大家的学习或工作具有一定的参考借鉴价值，需要的朋友可以参考下
2021-03-03
使用Pandas进行Excel数据处理的操作和技巧
在数据处理和分析的过程中,Excel是一个非常常见的工具,然而,当数据量变大,操作复杂度增加时,Excel的效率和功能可能无法满足需求,Pandas是一个强大的Python数据处理库,本文将介绍如何使用Pandas进行Excel数据处理,并展示一些常见的操作和技巧
2023-11-11
Python利用matplotlib绘制约数个数统计图示例
这篇文章主要介绍了Python利用matplotlib绘制约数个数统计图,结合实例形式详细分析了Python使用matplotlib进行统计图绘制的相关操作技巧,需要的朋友可以参考下
2019-11-11
python如何建立全零数组
在本篇内容里小编给大家分享了关于python建立全零数组的方法，需要的朋友们跟着学习下吧。
2020-07-07
python 归并排序的实现
归并排序是一种分治算法,它将数组分成两半,分别对这两半进行排序,然后将排序后的两半合并在一起,本文就来介绍一下python 归并排序的实现,具有一定的参考价值,感兴趣的可以了解一下
2024-06-06

在python下实现word2vec词向量训练与加载实例

相关文章

最新评论

大家感兴趣的内容

最近更新的内容

常用在线小工具